- 對一份實盤交易賬本做Bootstrap自助重抽樣(bootstrap resampling),拼出一萬個模擬年份,沒有一個虧損——這種確定性應當引起懷疑,而不是信心。
- 這份業績的年化夏普比率5.1能透過樸素的顯著性檢驗;但把定型前試過的五個策略變體計入懲罰後,置信度跌到79%。
- 三件工具在同一個位置失明:樣本里沒有危機。誠實的產出是一個日曆日期——這份業績真正獲得正式顯著性的那一天。
一個實盤自動化交易賬戶跑了大約兩個月。所有賬務層面的核查都指向同一個結論:盈利、平穩、乏味。接下來的問題順理成章,也是每一位資金配置方、每一個投資委員會、每一張交易臺遲早都會對一份年輕業績提出的問題:這是實力,還是走運的兩個月?這個問題背後有一整套真正的統計機器——而機器給出的答案,比一句“是”或“否”有意思得多。
為什麼這件事重要:擺在投資者面前的實盤業績大多很短,大多經過篩選(你看到的是跑出來的那個策略,悄悄退役的那些你看不到),而給它們打分的工具卻大多預設這兩件事都不存在。下面這些統計方法,存在的意義恰恰就是給這兩個事實定價。
1誠實地構建日度序列——無聊的日子也要算
五十六個日度收益,包括每一個什麼都沒發生的日子。
展開推演過程
原材料毫不起眼:實盤賬本上每一筆完成的往返交易,扣除實際資金成本後,按日曆日彙總為已投入資金的日度收益。有一條誘人的捷徑——也是供應商材料裡的常見做法——只統計有交易的日子。這會悄悄刪掉策略空倉無風險的時段,抬高建立在其上的每一個比率。這裡使用的序列包含全部五十六天,零交易日按零計入。
2樸素的結論:亮眼,但顯著性勉強及格
年化夏普比率5.08——t統計量1.99,以毫釐之差跨過95%置信線。
展開推演過程
年化收益約15%、波動率3%,算出的夏普比率(Sharpe ratio)超過5——放在任何一份路演材料裡都能當頭條。但夏普比率是估計值,估計值自帶誤差棒,誤差棒的寬度由業績長度決定。56個日度收益給出的t統計量(t-statistic)是1.99:單側p值約0.026。統計上顯著嗎?是——但只是勉強及格,而且是在還沒人問出下面兩個更難的問題之前。同樣的夏普比率放在兩年裡是壓倒性的證據;放在兩個月裡,只是一聲有希望的低語。
3Bootstrap:一萬個平行年份
重抽樣只能重新組合你餵給它的歷史——它發明不出你還沒遇到的那個壞日子。
展開推演過程
Bootstrap自助重抽樣從觀測序列中有放回地隨機抽取交易日,拼裝出合成年份——這裡做了一萬個。輸出的分佈:年化收益中位數約15%,90%置信區間(confidence interval)約+10%到+20%,最差的模擬回撤(drawdown)約2%,以及一萬個年份裡沒有一個虧損。
“一萬年零虧損”並不是策略不會虧的證據。它只證明這56個觀測日裡,沒有哪一天糟糕到無論怎麼重排都能拖垮一整年。Bootstrap忠實地回答的是“我的歷史重新組合起來長什麼樣”——它在結構上就無法回答“我還沒見過的那一天長什麼樣”。任何風平浪靜的樣本,Bootstrap出來都是金剛不壞之身。
誠實的使用還要附上兩條附加說明:逐日重抽樣假設各交易日相互獨立(真實策略的好壞時段會成群出現——塊狀Bootstrap變體正是為此而生);而且這裡的輸入區間沒有包含任何一次市場失序。
4給它緊縮:為“逛過的每家店”付賬
把定型前試過的五個變體計入代價,“統計顯著”就變成了79.5%的機率。
展開推演過程
大多數公開展示的實盤業績背後有一個安靜的事實:擺給你看的策略是倖存者。這張交易臺在敲定當前配置之前,老老實實試過大約五個引數變體。從五個裡挑出最好的一個,再當作從頭到尾只試過它來做檢驗,會誇大證據強度——五個純隨機策略裡最好的那個,看起來同樣漂亮。
緊縮夏普比率(Deflated Sharpe Ratio, DSR;Bailey & López de Prado)把這項修正形式化:它把顯著性門檻抬高到“N次嘗試中的最優者”僅憑運氣就能達到的夏普水平,並順帶修正收益分佈的偏度與肥尾。
| 嘗試過的變體數(N) | 運氣門檻(夏普) | 優勢為真的機率 |
|---|---|---|
| 1 — 假裝從未篩選 | 0.0 | 98.2% |
| 5 — 誠實的數字 | 3.07 | 79.5% |
| 10 | 4.06 | 66.2% |
| 20 | 4.90 | 52.9% — 等於拋硬幣 |
把第一行和第二行對照著讀:“98%已證實”與“79%大機率”之間的差距,與策略本身毫無關係——純粹取決於分析者肯不肯承認自己試過多少個版本。這一個誠實引數對結論的撬動,比資料本身還大。夏普比率5、兩個月、五選一:一份前景不錯、但還沒資格用“顯著”二字的業績。
5注意三件工具在哪一點上口徑一致
三件工具,同一個盲區:樣本里沒有危機。
展開推演過程
Bootstrap說“不會虧”。樸素t檢驗說“顯著”。緊縮夏普比率說“79.5%”。看起來是三個結論;其實是對同一個窟窿、從三個角度給出的同一個結論。這些數字裡的每一分確定性,都繼承自一個沒有發生過任何劇烈行情的56天視窗——正是同一個結構性盲區,讓凱利公式對同一個賬戶開出3,000倍槓桿的處方。統計機器不會創造關於尾部的資訊;它只會讓“資訊缺失”這件事更容易被忽視——或者,用得對的話,更容易被看見。
6把統計結論換算成日曆
統計意義上的耐心是有日期的——資金決策可以照著這個日期排。
展開推演過程
緊縮夏普比率隨業績長度的平方根增長。假設業績維持當前水平,按誠實的N=5懲罰計算,這份記錄會在大約110天實盤時跨過95%門檻:還差約兩個月。這就把一句含糊的“再看看資料”變成了一條帶日期的操作規則:業績畢業之前不放大資金;畢業當天安排一次重新評分。這套統計最有用的產出根本不是一個分數——而是一份日曆。
哪些事沒有發生:沒有人因為“不會虧”的Bootstrap結果追加資金,也沒有人在引用夏普比率時不附上業績長度。這次審查的產出是一份帶日期的重評時間表,外加一個寫進文件的誠實引數——絕大多數業績展示裡被悄悄省略的那個N。
可複用的檢查清單
在接受任何一份實盤業績之前——無論是你自己的還是供應商的:
- 日度收益序列包含空倉日,還是隻算有交易的日子?
- 夏普比率是否與業績長度一併給出——它的t統計量真的跨過顯著性門檻了嗎?
- 對這份業績做Bootstrap會得到什麼——有沒有人承認它只能重組已觀測的歷史、永遠無法延伸歷史?
- 在拿出來展示的這一個之前,一共試過多少個變體、基金或配置?按這個誠實的N,緊縮夏普比率給出什麼結論?
- 樣本區間是否包含真正威脅該策略的市場環境?如果沒有,每一個比率都只是“好天氣比率”。
- 有沒有一個寫明的日曆日期,標記這份業績正式獲得顯著性——資金決策真的在等這個日期嗎?
這套方法的定位
這套紀律,與MOA在獨立驗證與確認(IV&V)中審查企業級供應商宣告所用的完全相同——這裡延伸到量化實盤業績與業績宣告。我們審查的是方法論與證據;我們不銷售、不管理被審查的策略,本文內容也不構成個人化的投資建議。答案與我們沒有利害關係,我們也沒有任何打高分的動機。