样本量与统计显著性
一句话速览
一个真实胜率 50% 的系统,做二十笔交易,观测到 65% 甚至 35% 都很正常。所以二十笔算出的胜率几乎没有信息量,而多数人正是拿它下结论的。
这节课要你带走的
直观看到样本量不足时观测值能飘多远,
以及知道要多少笔交易才够下结论。
上一节 教了怎么算期望值。这一节回答一个更基础的问题:你算出来的那个数,可信吗。
同一个系统,跑一千遍
下面的模拟做的是:假设你的系统真实胜率就是设定的那个值,让它做 N 笔交易,重复一千次,看每次观测到的胜率会落在哪里。
把笔数设成 20 试试:一个真实胜率 50% 的系统,观测胜率在 30% 到 70% 之间都属于正常波动。
然后把笔数调到 200,你会看到分布明显收窄。样本量就是这样起作用的:它不改变真相,只是让你离真相更近。
二十笔交易算出来的胜率,说明的主要是运气。
要多少笔才够
取决于你想分辨多大的差别。差别越小,需要的样本越多:
| 你想确认的 | 大致需要的交易笔数 |
|---|---|
| 系统是不是明显有效(胜率 50% vs 70%) | 数十笔 |
| 系统是不是略有优势(胜率 50% vs 60%) | 一百多笔 |
| 系统是不是有微弱优势(胜率 50% vs 55%) | 数百笔 |
| 两套相似的方法哪个更好 | 上千笔 |
这是量级参考,不是精确的统计功效计算。但它足以说明一件事:你日常纠结的那些细微差别,靠你的交易记录是分辨不出来的。
比如「这个指标参数用 5 还是 10 更好」,要在实盘上分辨出来需要上千笔。而多数人做了三十笔就换参数了,那三十笔的结果几乎完全是噪音。
这解释了几个常见现象
- 「这个方法最近很准」。最近十次的表现,样本量远远不够。热手谬误 讲的就是这个。
- 频繁换方法。做几笔不顺就换,换完又不顺再换。每次都在用噪音做决策,而每次切换本身还有成本。
- 新手运。刚入市赚了几笔就以为有天赋。达克曲线 那一节讲过这个阶段,样本量视角下它就是抽样波动。
- 把凯利公式直接套用。单笔风险那一节 说过凯利要打折使用,根本原因就在这里:它的输入参数是估计值,而估计值来自不足的样本。
样本量之外,还有三个陷阱
- 样本要来自不同市场环境。一百笔全部发生在牛市里,那验证的是牛市里的表现。至少要跨越一次明显的环境切换。
- 不能中途改规则。做到第三十笔觉得不行就调参数,那前三十笔和后七十笔不是同一个系统,样本不能合并。
- 不能只统计执行了的。那些「本来想做但没做」的机会,如果你只记赚钱的那些,统计就被污染了。
第二条最常见,也最难避免。解决办法是把参数固定下来,写在 交易计划 里,做满预定笔数再评估。中途难受也不改。
一个现实的折中
要求上千笔才评估,对多数人不现实。所以给一个可操作的版本:
- 先做满 30 笔。这个阶段不评估收益,只检查执行:规则有没有被遵守、日志有没有记全。
- 做满 100 笔再算期望值。这时候的数字仍然有很大误差,但至少能看出方向性的问题(比如平均亏损远大于平均盈利)。
- 用回测补充样本。历史数据能提供更多样本,但有它自己的坑,见 过拟合 和 幸存者偏差。
做
今天就做这一件事
把上面的模拟器真实胜率设成 50%、笔数设成 20,看一眼 5 分位和 95 分位。
然后想一想:你上次换掉某个方法的时候,做了多少笔?
如果少于 30 笔,那个决定的依据基本是噪音。
带走这一条:真实胜率 50% 的系统做二十笔,观测到 30% 到 70% 都正常。
想分辨细微差别需要上千笔,而你日常纠结的那些参数差异根本分辨不出来。
现实做法:30 笔只查执行,100 笔再算期望值,中途绝不改规则。