统计方法 · 实盘业绩

一万个模拟年份,零亏损。这份确定性恰恰是漏洞。

用机构真正在用的统计工具给一份实盘业绩(track record)打分——并弄清一个“稳赚不赔”的结果到底意味着什么。

首页 / 研究洞察 / Bootstrap与紧缩夏普比率EN · 简体 · 繁體
统计方法 · 实盘业绩  ·  2026年8月  ·  全文6分钟 · 摘要30秒
TL;DR — 30秒速览
  • 对一份实盘交易账本做Bootstrap自助重抽样(bootstrap resampling),拼出一万个模拟年份,没有一个亏损——这种确定性应当引起怀疑,而不是信心。
  • 这份业绩的年化夏普比率5.1能通过朴素的显著性检验;但把定型前试过的五个策略变体计入惩罚后,置信度跌到79%。
  • 三件工具在同一个位置失明:样本里没有危机。诚实的产出是一个日历日期——这份业绩真正获得正式显著性的那一天。
5.1
56个实盘交易日的年化夏普比率
79.5%
计入选择偏差惩罚后,优势为真的概率
~110天
业绩正式“毕业”所需的实盘长度

一个实盘自动化交易账户跑了大约两个月。所有账务层面的核查都指向同一个结论:盈利、平稳、乏味。接下来的问题顺理成章,也是每一位资金配置方、每一个投资委员会、每一张交易台迟早都会对一份年轻业绩提出的问题:这是实力,还是走运的两个月?这个问题背后有一整套真正的统计机器——而机器给出的答案,比一句“是”或“否”有意思得多。

为什么这件事重要:摆在投资者面前的实盘业绩大多很短,大多经过筛选(你看到的是跑出来的那个策略,悄悄退役的那些你看不到),而给它们打分的工具却大多默认这两件事都不存在。下面这些统计方法,存在的意义恰恰就是给这两个事实定价。

1诚实地构建日度序列——无聊的日子也要算

五十六个日度收益,包括每一个什么都没发生的日子。

展开推演过程

原材料毫不起眼:实盘账本上每一笔完成的往返交易,扣除实际资金成本后,按日历日汇总为已投入资金的日度收益。有一条诱人的捷径——也是供应商材料里的常见做法——只统计有交易的日子。这会悄悄删掉策略空仓无风险的时段,抬高建立在其上的每一个比率。这里使用的序列包含全部五十六天,零交易日按零计入。

2朴素的结论:亮眼,但显著性勉强及格

年化夏普比率5.08——t统计量1.99,以毫厘之差跨过95%置信线。

展开推演过程

年化收益约15%、波动率3%,算出的夏普比率(Sharpe ratio)超过5——放在任何一份路演材料里都能当头条。但夏普比率是估计值,估计值自带误差棒,误差棒的宽度由业绩长度决定。56个日度收益给出的t统计量(t-statistic)是1.99:单侧p值约0.026。统计上显著吗?是——但只是勉强及格,而且是在还没人问出下面两个更难的问题之前。同样的夏普比率放在两里是压倒性的证据;放在两个月里,只是一声有希望的低语。

3Bootstrap:一万个平行年份

重抽样只能重新组合你喂给它的历史——它发明不出你还没遇到的那个坏日子。

展开推演过程

Bootstrap自助重抽样从观测序列中有放回地随机抽取交易日,拼装出合成年份——这里做了一万个。输出的分布:年化收益中位数约15%,90%置信区间(confidence interval)约+10%到+20%,最差的模拟回撤(drawdown)约2%,以及一万个年份里没有一个亏损

正确解读

“一万年零亏损”并不是策略不会亏的证据。它只证明这56个观测日里,没有哪一天糟糕到无论怎么重排都能拖垮一整年。Bootstrap忠实地回答的是“我的历史重新组合起来长什么样”——它在结构上就无法回答“我还没见过的那一天长什么样”。任何风平浪静的样本,Bootstrap出来都是金刚不坏之身。

诚实的使用还要附上两条附加说明:逐日重抽样假设各交易日相互独立(真实策略的好坏时段会成群出现——块状Bootstrap变体正是为此而生);而且这里的输入区间没有包含任何一次市场失序。

4给它紧缩:为“逛过的每家店”付账

把定型前试过的五个变体计入代价,“统计显著”就变成了79.5%的概率。

展开推演过程

大多数公开展示的实盘业绩背后有一个安静的事实:摆给你看的策略是幸存者。这张交易台在敲定当前配置之前,老老实实试过大约五个参数变体。从五个里挑出最好的一个,再当作从头到尾只试过它来做检验,会夸大证据强度——五个纯随机策略里最好的那个,看起来同样漂亮。

紧缩夏普比率(Deflated Sharpe Ratio, DSR;Bailey & López de Prado)把这项修正形式化:它把显著性门槛抬高到“N次尝试中的最优者”仅凭运气就能达到的夏普水平,并顺带修正收益分布的偏度与肥尾。

尝试过的变体数(N)运气门槛(夏普)优势为真的概率
1 — 假装从未筛选0.098.2%
5 — 诚实的数字3.0779.5%
104.0666.2%
204.9052.9% — 等于抛硬币

把第一行和第二行对照着读:“98%已证实”与“79%大概率”之间的差距,与策略本身毫无关系——纯粹取决于分析者肯不肯承认自己试过多少个版本。这一个诚实参数对结论的撬动,比数据本身还大。夏普比率5、两个月、五选一:一份前景不错、但还没资格用“显著”二字的业绩。

5注意三件工具在哪一点上口径一致

三件工具,同一个盲区:样本里没有危机。

展开推演过程

Bootstrap说“不会亏”。朴素t检验说“显著”。紧缩夏普比率说“79.5%”。看起来是三个结论;其实是对同一个窟窿、从三个角度给出的同一个结论。这些数字里的每一分确定性,都继承自一个没有发生过任何剧烈行情的56天窗口——正是同一个结构性盲区,让凯利公式对同一个账户开出3,000倍杠杆的处方。统计机器不会创造关于尾部的信息;它只会让“信息缺失”这件事更容易被忽视——或者,用得对的话,更容易被看见。

6把统计结论换算成日历

统计意义上的耐心是有日期的——资金决策可以照着这个日期排。

展开推演过程

紧缩夏普比率随业绩长度的平方根增长。假设业绩维持当前水平,按诚实的N=5惩罚计算,这份记录会在大约110天实盘时跨过95%门槛:还差约两个月。这就把一句含糊的“再看看数据”变成了一条带日期的操作规则:业绩毕业之前不放大资金;毕业当天安排一次重新评分。这套统计最有用的产出根本不是一个分数——而是一份日历。

哪些事没有发生:没有人因为“不会亏”的Bootstrap结果追加资金,也没有人在引用夏普比率时不附上业绩长度。这次审查的产出是一份带日期的重评时间表,外加一个写进文档的诚实参数——绝大多数业绩展示里被悄悄省略的那个N。

可复用的检查清单

在接受任何一份实盘业绩之前——无论是你自己的还是供应商的:

  • 日度收益序列包含空仓日,还是只算有交易的日子?
  • 夏普比率是否与业绩长度一并给出——它的t统计量真的跨过显著性门槛了吗?
  • 对这份业绩做Bootstrap会得到什么——有没有人承认它只能重组已观测的历史、永远无法延伸历史?
  • 在拿出来展示的这一个之前,一共试过多少个变体、基金或配置?按这个诚实的N,紧缩夏普比率给出什么结论?
  • 样本区间是否包含真正威胁该策略的市场环境?如果没有,每一个比率都只是“好天气比率”。
  • 有没有一个写明的日历日期,标记这份业绩正式获得显著性——资金决策真的在等这个日期吗?

这套方法的定位

这套纪律,与MOA在独立验证与确认(IV&V)中审查企业级供应商声明所用的完全相同——这里延伸到量化实盘业绩与业绩声明。我们审查的是方法论与证据;我们不销售、不管理被审查的策略,本文内容也不构成个人化的投资建议。答案与我们没有利害关系,我们也没有任何打高分的动机。

有一份需要独立评分的实盘业绩、回测或业绩声明?

在投入资本或客户资金之前,先做一次方法论优先的审查——无利益冲突。

开始一次保密对话