模型驗證 · 原創研究

十二個入場過濾器,零生還者。那些虧損單,本來就是看不見的。

一場48小時的戰役:試圖教會兩套實盤策略跳過自己的壞單——以及那張解釋了"為什麼每一次嘗試都虧錢"的效應量表。

首頁 / 研究洞察 / 入場過濾器,零生還者EN · 简体 · 繁體
模型驗證 · 原創研究  ·  2026年8月  ·  全文8分鐘 · 摘要30秒
TL;DR — 30秒速覽
  • 實盤連虧兩天之後,我們回測了十二種"跳過壞單"的設計:趨勢斜率閘、tick佔比閘、市況切換、事件後加深入場、時鐘禁令,以及一個樸素貝葉斯分類器。每一種都降低了利潤——在最好的那個月裡從−3%到−96%——而且沒有一種救回了那個引發它們的壞日子。
  • 原因可以測量,不是玄學。在入場那一刻,將來會贏的單和將來會輸的單在我們能算出的每一個特徵上都統計相同:效應量0.00–0.15σ。貝葉斯似然比≈1,沒有任何東西可以更新。
  • 關於一筆交易的資訊只出現在兩個地方:開倉之後(出場規則)和季節尺度(資金配置)。按它來自的225個資產的篩選池誠實縮水之後,這套策略本身是真貨的機率為54–89%——而只有未經挑選的實盤月份能把這個數抬上去。
12 / 0
測試的入場過濾器 / 增加了利潤的過濾器
≤ 0.15σ
七個特徵中,入場時贏家與輸家的最大分離度
54–89%
緊縮夏普比率給出的"策略為真"置信度,取決於誠實的試驗次數

兩套自動化賬本度過了糟糕的48小時。一支穩定幣做市艦隊在錨定價格遷移時交了一筆"搬家稅";一套在三個山寨幣上執行的薄盤均值迴歸策略,在某個代幣解鎖引發的拋售裡連吃三根滿額止損。兩筆虧損都不大,都在設計上限之內。但它們都引出了每個策略主人遲早會問的那個問題:這些單我們難道不能提前看見、然後跳過去嗎?我們花了48小時、大約二十次回測去找答案。答案是"不能"——而這個"不能"的形狀,才是有用的部分。

為什麼這很重要:入場過濾器是策略主人和評審者最常為實盤策略提出的"改進"。它也最容易過擬合,因為它瞄準的壞單在事後看得一清二楚。下面是一種可復現的方法,可以在寫下任何一行過濾器程式碼之前,先判斷它需要的資訊到底存不存在。

1把考場佈置得讓過濾器有機會贏

三年tick資料、模擬器裡帶上全部真實結構規則、每個過濾器考兩道題。

展開推導

過濾器通常只在那個引發它的日子上測試——它們就是這麼透過的。我們把每一個都放到三段時間上考:引發它的事件日、整段歷史裡最賺錢的那個月(任何過濾器最可能破壞的時期)、以及一個平靜的對照月。模擬器帶著完整的實盤結構——保守的成交規則、單倉互斥、利息、熔斷器、穩定幣艦隊的波動市況切換——因為本站此前的一次評審已經展示過,缺了一條結構規則的回測可以把一個利潤中心算成虧損

兩道考題,按順序答:這個過濾器在最好的那個月裡花了多少錢?以及它在壞日子裡省了多少?第一題不及格的過濾器,沒有資格去答第二題。

2墓園

十二種設計、六個家族、一個模式:每個過濾器都在好月份裡付了錢,在壞日子裡一分沒收回。

展開推導
過濾器家族它假設了什麼最佳月的代價壞日子的挽救
趨勢斜率閘(4個變體)錨在移動時暫停−7% 至 −83%0
tick佔比閘價格持續壓在錨的一側時暫停−83%0
事件後加深入場(1–4小時)衝擊之後要求更大折扣−26% 至 −29%為負
事件後禁止開倉(4–12小時)等塵埃落定−88%為負
衝擊後單向禁令只禁止與復甦方向相反的那一側−28%為負
市況依賴觸發器(48小時/7天回看)在拋售中更嚴格−17% 至 −25%0 — 探測器來得太遲
樸素貝葉斯 P(贏) ≥ 0.70…0.85讓分類器來挑−9% 至 −97%無 — 勝率紋絲不動,仍為77–79%

整張表反覆出現兩個發現。第一,真正造成傷害的單子,是在任何探測器能看見事件之前就開出來的:一張在舊價格水平上站著的倉位,恰逢這個水平搬家;或者一根在拋售開始第一分鐘就觸發的止損。所以每一個"衝擊之後"的過濾器都是在稅交完之後才到場;它們實際攔下的,是那些正忙著把稅賺回來的康復單。第二,最好的那個月裡最賺錢的那些時段——均值迴歸賬本賺到全年大部分利潤的那些緩慢、安靜的臺階——與那些緩慢、安靜的失血段,擁有同一副表面特徵。能攔住其中一個的閘門,也一定攔住另一個。

值得記住的不對稱

探測器遲到,對防禦是致命的(傷害在事件出生那一刻就造成了),對復工卻是無害的(你只是漏掉幾筆單)。這支艦隊裡唯一透過評審的閘門,建立在這句話的後半段上:一個哨兵,按已實現的虧損暫停,等一個影子賬本證明市場重新付錢時復工。它在事後審判一群交易,從不在事前審判單筆交易。

3直接測量資訊本身

寫過濾器之前先算效應量。這裡是0.00–0.15σ——噪音。

展開推導

任何入場過濾器都是在打一個賭:入場那一刻可觀測的某樣東西,在將來會贏的單和將來會輸的單之間有所不同。這個賭可以在不造出過濾器的情況下被測量:取歷史上每一筆交易,記錄它入場時的候選特徵,按結果分組,計算均值的標準化差異(Cohen's d)。對那套山寨幣策略——3,346筆交易、77%勝率——結果如下:

入場時的特徵未來贏家均值未來輸家均值分離度 (d)
最近60秒跌速149 bp137 bp0.15
最近5分鐘跌速256 bp255 bp0.01
1小時回報−189 bp−214 bp0.05
24小時回報+251 bp+120 bp0.09
30分鐘振幅538 bp547 bp0.02
一天中的小時12.012.00.00

0.3σ的分離度通常是"這裡有點東西"的門檻;一個真正有選擇力的過濾器需要的是0.8σ。表裡沒有一項夠到0.15。贏家和輸家是同一個群體,在同一時刻拍下的同一張照片。一個在這些特徵上訓練的走向前樸素貝葉斯分類器,用更昂貴的方式確認了這一點:在每一個機率閾值上,它都只刪掉了交易,沒有動過勝率。

穩定幣艦隊講了一個更微妙的故事。在那裡,有一個特徵——近期波動率——以0.4–0.8σ分開了贏家和輸家。但把平靜季的交易按這個特徵分桶後,148筆裡有144筆坐在同一個桶裡:這個分離存在於季節之間,而不是同一季節內的交易之間。而這條資訊早已在用——用在艦隊的市況切換上,用在分給每個季節的資金上。回到單筆交易的尺度,訊號再一次消失。

4按貝葉斯的方式讀它

似然比等於一,先驗就留在原地。過濾器能做的只有從一條正期望的交易流裡刪單。

展開推導
P(贏 | 特徵) ∝ P(特徵 | 贏) × P(贏)

一個過濾器只有在特徵能改變賠率時才配存在:即P(特徵 | 贏)與P(特徵 | 輸)不同。效應量接近零意味著這兩個分佈幾乎完全重疊,似然比≈1,後驗等於先驗——也就是策略的基礎勝率。此時過濾器無論做什麼,都是在從一條正期望的交易流裡隨機刪單;而從正期望流裡隨機刪單,在構造上就是負期望的。上面十二個結果不是十二個糟糕的設計,是同一條定理被觀察了十二次。

那麼資訊到底在哪?在賬本早已在用的那兩個地方。開倉之後:一次錯位會不會回吐,只有在倉位開啟之後才揭曉,這就是為什麼所有透過評審的規則都是出場規則——跟蹤止盈、硬止損、時間保險絲、連虧熔斷。季節尺度:波動市況確實能預測結果,但那是按月做的資金配置決定,不是逐筆做的入場決定。

5現在給策略本身縮水

Bonferroni校正輕鬆透過;緊縮夏普比率說54–89%,取決於一個誠實引數。

展開推導

如果入場過濾器無法改進策略,下一個誠實的問題就是:策略自己的回測有多少是真的。它是從225個資產的篩選中找到的,tick級測試了大約30個,留下三個。每筆交易的夏普比率為0.099,共2,472筆(t = 4.9),偏度−1.78,峰度5.1——許多小贏、幾次滿額止損的肥尾簽名。Bonferroni校正後的顯著性檢驗在假設5,000次試驗時也能透過;那是大樣本的人為產物,不是證據。緊縮夏普比率才是對的工具,而它的判決隨著你承認的試驗次數而移動:

承認的試驗次數 (N)N代表什麼夏普比率為真的機率
6最終設計上的引數變體99%
30在盈虧上做過tick級測試的資產89%
225一級篩選中的資產54%
1,000這個團隊曾經嘗試過的一切27%

關於算術的兩點說明。負偏度是真實的懲罰,不是技術細節:它放大了夏普比率的標準誤,這正是這套策略歷史上那十三個月回撤在統計學裡的化身。另一條獨立路徑——給一個經過篩選的零售策略設0.20的顯式貝葉斯先驗,再按證據鏈更新——落在0.53的後驗上。兩種方法、兩套假設、一個答案:一枚介於六四開和九一開之間的硬幣。

那十二個入場過濾器也屬於這本賬。假如其中一個"透過"了,它就是同一份資料上十二次嘗試裡的最好者,它自己的緊縮夏普比率要從N = 12起算。過濾器也是試驗。

6數字往上走的唯一途徑

經過挑選的證據要打折;未經挑選的實盤月份全額計入。資金等的就是它們。

展開推導

54%之所以低,是因為這份回測是在許多候選裡事後挑出來的。而一個實盤月份沒法事後挑。每一個都是N = 1的試驗,全額計入,而這套策略的第一個實盤半月在勝率(67%對67%)和每筆經濟賬上與模型分毫不差地對齊。保持這種對齊,算術會在大約三個實盤月之後越過95%線——與本月早些時候應用在艦隊自身業績上的"畢業日期"邏輯相同。由此落下的操作規則:在縮水後的數字越過95%之前只用試點資金;不憑回測本身放大規模;由一次排定日程的重新評級來決定時機,而不是由感覺。

生產環境裡改了什麼:什麼都沒加。十二個過濾器被附上數字後否決。一個已有的暫停機制在它自己的實測成本(330天−5個單位)與兩次誤報被權衡之後,降級為提醒。這次評審的產出是一張效應量表、一條縮水後的置信區間、和一個日期。

可複用的檢查清單

在構建任何入場過濾器之前——無論是你自己的還是供應商的:

  • 先算效應量。把歷史交易按結果分組,測量每個候選特徵在入場時的值,報告Cohen's d。低於0.3σ就停下;過濾器沒有東西可讀。
  • 先在最好的月份上測,再看壞日子。在豐收期裡養不活自己的過濾器,沒有資格去防守。
  • 把探測器的延遲對照那筆造成傷害的單子。如果虧損在訊號能觸發之前就已開倉,這個過濾器保護的是一具屍體。
  • 問清資訊是交易級的還是季節級的。季節級資訊屬於資金配置,不屬於入場規則。
  • 數清你試過多少個過濾器。每一個都是一次試驗;生還者的顯著性必須按那個N縮水。
  • 按策略自身篩選池的誠實N給它縮水——然後讓未經挑選的實盤月份、而不是更多的回測,去抬高這個數字。

這篇文章的位置

這與MOA在獨立驗證與確認(IV&V)服務中對企業供應商主張所採用的紀律完全相同——延伸到量化策略以及為它們提出的各種改進。我們評審方法論與證據;我們不銷售也不管理被評審的策略,本文內容亦不構成任何個性化的財務建議。對答案沒有立場,也沒有寬鬆打分的動機。

有一套策略、一個過濾器、或一份業績主張需要獨立評級?

在投入資金或客戶資金之前,先做方法論優先的評審——無利益衝突。

開始一次保密對話