多少笔交易才能让回测可信?
作者 chwoo · 加密货币交易7年。最近4个月运行自动交易机器人。 ·
做个让人不安的实验:把一枚公平的硬币抛十次。得到七次正面并不罕见,也就是70%。没有人会因此断定这枚硬币有魔力。然而交易者 常常看到一个策略在回测的10笔交易里赢了7笔,就断定自己找到了胜率70%的系统。样本量是回测中最不起眼的概念,却在悄悄让你 检验过的大多数东西失效。
小样本为何产生惊艳成绩
交易越少,运气越是压过实力。交易数越少,纯粹偶然能造出的结果范围就越宽,而且因为你只会注意那些碰巧表现好的设置, 小样本加上大量尝试,几乎保证你会“发现”某个纯属噪音的惊人结果。大多数好得过分的回测背后就是这台发动机:不是算错了, 而是交易少、尝试多。
对胜率估计误差的粗略直觉:误差随交易数的平方根缩小。10笔交易会在你测得的胜率周围罩上约±15个百分点的迷雾;100笔仍剩 约±5个点;要到几百笔,图像才算比较清晰。确切数字取决于真实胜率,但规则的形状才是重点:想把噪音减半,交易数 要翻四倍。
实践标准
- 少于约30笔: 轶事。有意思,但作为任何方向的证据都毫无价值。
- 约30–100笔: 线索。值得打磨后再测,但还不值得投钱。
- 几百笔,横跨多年和多种行情: 估计值开始值得信任,前提是策略没有针对这些数据调过参。
这就是为什么用七年数据检验比用最近六个月重要,也是为什么低周期不自动等于更差:1小时策略能在周线策略交易20笔的时间里 产生一千笔。周线策略并非不可检验,但诚实要求你承认它的误差棒有多宽。
样本量与其他一切相互作用
如果你尝试了几百种参数组合,大样本也救不了你。每一次尝试都等于再给偶然发一张彩票。而集中在同一轮牛市里的大样本, 实际上是一笔漫长的相关性押注,而非几百笔独立押注。本站的周期表正是为此而存在:把成绩拆进7年/3年/1年窗口,能看出不同 时代的交易是否彼此印证。
在相信任何回测之前,无论是你的还是别人的,先问两个问题:多少笔交易?横跨多少种不同的行情?如果答案是“四十笔,全部 来自2024年”,那你看到的是故事,不是统计。把你的想法放到完整历史上去跑,让交易数告诉你该信几分。
参考资料
- Sample size determination — How wide an estimate stays when the sample is small.
- Overfitting