交易系统 · 第 7 节

样本量与统计显著性

建立你自己的交易系统 · 第 7 页。上一节算出的期望值,先过这一关。

一句话速览 一个真实胜率 50% 的系统,做二十笔交易,观测到 65% 甚至 35% 都很正常。所以二十笔算出的胜率几乎没有信息量,而多数人正是拿它下结论的。
这节课要你带走的 直观看到样本量不足时观测值能飘多远, 以及知道要多少笔交易才够下结论。

上一节 教了怎么算期望值。这一节回答一个更基础的问题:你算出来的那个数,可信吗。

同一个系统,跑一千遍

下面的模拟做的是:假设你的系统真实胜率就是设定的那个值,让它做 N 笔交易,重复一千次,看每次观测到的胜率会落在哪里。

交互 · 观测胜率的分布

0%观测胜率100%
观测胜率
5 分位
观测胜率
中位数
观测胜率
95 分位

固定种子的伪随机模拟,同样输入结果一致。 这里只模拟胜率的抽样波动,真实交易还有盈亏幅度的波动,实际不确定性更大。

把笔数设成 20 试试:一个真实胜率 50% 的系统,观测胜率在 30% 到 70% 之间都属于正常波动。

然后把笔数调到 200,你会看到分布明显收窄。样本量就是这样起作用的:它不改变真相,只是让你离真相更近。

二十笔交易算出来的胜率,说明的主要是运气。

要多少笔才够

取决于你想分辨多大的差别。差别越小,需要的样本越多:

你想确认的大致需要的交易笔数
系统是不是明显有效(胜率 50% vs 70%)数十笔
系统是不是略有优势(胜率 50% vs 60%)一百多笔
系统是不是有微弱优势(胜率 50% vs 55%)数百笔
两套相似的方法哪个更好上千笔

这是量级参考,不是精确的统计功效计算。但它足以说明一件事:你日常纠结的那些细微差别,靠你的交易记录是分辨不出来的。

比如「这个指标参数用 5 还是 10 更好」,要在实盘上分辨出来需要上千笔。而多数人做了三十笔就换参数了,那三十笔的结果几乎完全是噪音。

这解释了几个常见现象

  1. 「这个方法最近很准」。最近十次的表现,样本量远远不够。热手谬误 讲的就是这个。
  2. 频繁换方法。做几笔不顺就换,换完又不顺再换。每次都在用噪音做决策,而每次切换本身还有成本。
  3. 新手运。刚入市赚了几笔就以为有天赋。达克曲线 那一节讲过这个阶段,样本量视角下它就是抽样波动。
  4. 把凯利公式直接套用。单笔风险那一节 说过凯利要打折使用,根本原因就在这里:它的输入参数是估计值,而估计值来自不足的样本。

样本量之外,还有三个陷阱

  1. 样本要来自不同市场环境。一百笔全部发生在牛市里,那验证的是牛市里的表现。至少要跨越一次明显的环境切换。
  2. 不能中途改规则。做到第三十笔觉得不行就调参数,那前三十笔和后七十笔不是同一个系统,样本不能合并。
  3. 不能只统计执行了的。那些「本来想做但没做」的机会,如果你只记赚钱的那些,统计就被污染了。

第二条最常见,也最难避免。解决办法是把参数固定下来,写在 交易计划 里,做满预定笔数再评估。中途难受也不改。

一个现实的折中

要求上千笔才评估,对多数人不现实。所以给一个可操作的版本:

  1. 先做满 30 笔。这个阶段不评估收益,只检查执行:规则有没有被遵守、日志有没有记全。
  2. 做满 100 笔再算期望值。这时候的数字仍然有很大误差,但至少能看出方向性的问题(比如平均亏损远大于平均盈利)。
  3. 用回测补充样本。历史数据能提供更多样本,但有它自己的坑,见 过拟合幸存者偏差

今天就做这一件事

把上面的模拟器真实胜率设成 50%、笔数设成 20,看一眼 5 分位和 95 分位。

然后想一想:你上次换掉某个方法的时候,做了多少笔?

如果少于 30 笔,那个决定的依据基本是噪音。

带走这一条:真实胜率 50% 的系统做二十笔,观测到 30% 到 70% 都正常。 想分辨细微差别需要上千笔,而你日常纠结的那些参数差异根本分辨不出来。 现实做法:30 笔只查执行,100 笔再算期望值,中途绝不改规则。