跳到正文
法布财经头条·· 3 小时前AI 评分67

回测收益漂亮就能实盘?多重试验如何制造“最佳策略”

AI 导读

回测中反复尝试策略并只展示收益最高的一组,可能使偶然结果看起来像有效规律,因此评估实盘价值不能只看收益率或夏普比率。文中以独立检验误报率为5%的简化模型说明,试验100次时至少出现一次误报的概率为99.41%,并强调这不是赢家无效的后验概率。文章还介绍了披露完整搜索记录、预先冻结评估规则、保留最终未参与决策的数据,以及核算交易成本等核验方法。

正文

一条平滑向上的回测曲线,可能来自有效规律,也可能只是反复试验后的幸存者。如果研究者换过几十组均线、试过不同市场和过滤条件,最后只展示收益最高的一组,读者看到的就不是“一套策略接受了一次检验”,而是“一段历史接受了很多次挑选”。

判断回测能否支持实盘,先审查选出策略的过程,再看赢家的收益率。至少要说清:试过哪些方案,决策是在看结果之前还是之后做的,成交时能否获得信号所需信息,以及扣除真实成本后还剩多少优势。夏普比率再高,也不能替代这些问题。

回测收益漂亮就能实盘?多重试验如何制造“最佳策略”_1

为什么试100次,不能还按试1次理解?

先看一个刻意简化的模型:所有候选策略实际上都没有优势;每次统计检验在无优势时误报的概率为5%;各次检验相互独立。连续m次都不误报的概率是0.95的m次方,因此:

至少误报一次的概率=1-(1-0.05)m

独立检验次数至少出现一次误报
15.00%
1040.13%
2064.15%
5092.31%
10099.41%

在上述假设下,试100次,几乎必然能找到至少一个“显著”的结果。但这不代表选中策略有99.41%的概率无效,也不代表99.41%的策略会亏钱。这里算的是“所有策略都无优势时,一整组试验至少出现一次误报”的概率,不是某个赢家的后验概率,更不是学术研究中专门定义的回测过拟合概率指标。

现实中的均线参数和交易信号往往高度相关,不能把所有组合数量直接代入独立模型,再宣称得到了精确风险。这个例子说明搜索范围为什么重要,并没有替研究者估计“等效独立试验次数”。

需要披露的,不只是最后留下的参数

在五个市场各试十组窗口,最后只报告一个市场的一组参数,已经隐藏了大量选择。换起始日期、删除一次危机、反转信号方向、增加波动率过滤器,甚至改用表现最好看的评价指标,都可能继续消耗同一份历史的信息。

研究日志应保留失败方案、数据版本、参数、成本设定、评估区间和结果,并标明决策先后顺序。解释策略为何可能有效的经济机制很重要,但看过收益后补写的故事,不能算一份独立证据。

对于事先固定、完整披露且单项检验有效的一组m次检验,可以用较保守的邦费罗尼方法:把每次显著性门槛设为α/m。20次检验若希望整组错误概率不超过5%,单次门槛就是0.0025,未经调整的p值0.01不能过关。这一控制不要求检验相互独立,却要求每项检验本身有效、试验范围没有被隐瞒。它无法修复未来数据泄漏、遗漏试验或不恰当的收益分布假设。

看完测试结果再改规则,样本外就变成了样本内

必须分清三个用途:拟合参数、挑选方案、评价最终冻结的研究流程。验证集用于选择方案,最后保留的一段未知数据用于验收。若看完保留样本后觉得回撤太大,便增加过滤器或更换市场,这段数据已经参与开发。继续叫它“样本外”,并不能恢复独立性。

例如,先用第1—500个观测拟合,在501—600检验;再用101—600拟合,在601—700检验;随后用201—700拟合,在701—800检验。最后801—1000仍保持封存,留作最终评价。窗口安排和选择规则必须提前确定。随着时间前进,早期测试数据进入后续训练可以符合真实部署过程,但不能在看完全部测试区间后重新挑选最有利的流程。

把不重叠测试区间的收益按时间连接起来,同时计入区间交界处的持仓处理和交易成本。如果标签使用未来收益,或持仓跨越边界,应排除信息延伸到评估区间的训练样本。隔离长度应由实际信息跨度决定,不是随手加一个固定天数。随机打乱时间序列,反而可能把“明天”泄漏给“昨天”。

数据口径还要单独过关。期货研究应先核对连续合约复权方式与真实换月损益,否则收益曲线可能在策略筛选之前就已经失真。

回测剩下的一点优势,可能被成本误差吃掉

假设200笔已完成交易的名义金额相同,每笔完整往返的平均毛收益为8个基点。若往返成本是6个基点,平均净收益只剩2个基点;成本升至10个基点,净收益就变成负2个基点。这里是逐笔算术平均,并非年化或复利组合收益,重叠持仓和资金占用还要另建账户账本。

成本应包括双边买卖价差、佣金、滑点及适用的融资或借券费用,不能用单边成本扣一整笔往返收益。尤其要检查换手率最高、流动性最差的时段,而不是把平静交易日的点差套到全部历史。统计上显著的毛收益,不等于经济上可执行的净优势。

再看参数小幅变化是否就让结果坍塌、利润是否集中于某一段行情,以及大量相关交易是否虚增了样本量。邻近参数稳定只能增强证据,不能替代未见过的数据。脱离收益依赖性、尾部风险和筛选过程,规定统一“至少多少笔”或“夏普超过多少”都不够严谨。

把曲线还原成一套能够推翻结论的核验流程

  1. 复现数据:确认信息在当时已经可得,价格能够成交,公司行动或合约换月处理正确,并固定数据版本。
  2. 还原搜索:找回失败试验和人为排除条件。搜索历史缺失时,不能声称已评估挑选赢家带来的偏差。
  3. 冻结方案:提前写明拟合窗口、选型规则、持仓处理和成本模型,留下真正未参与决策的数据。
  4. 复算净结果:逐笔交易与账户收益对账,压力测试执行成本,检查收益集中度和样本依赖性。
  5. 规定失效条件:消除泄漏、计入合理成本或使用封存样本后优势消失,就不能说原结论通过了检验;证据不确定时,应保留为研究候选。

有价值的回测,不是把结果修饰到最漂亮,而是把数据、试验历史和评估规则展示得足够清楚,让别人能够重复研究,也能够证明你的结论不成立。

来源:法布财经头条 · fastbull.com