量化交易 XtradingTime

一个交易系统需要回测多少笔才算有效:公式 n ≥ (1.96σ/E)²,附四档期望值对照表

一个交易系统需要回测多少笔才算有效:公式 n ≥ (1.96σ/E)²,附四档期望值对照表
本文目录(9 节)

「我回测了一百笔,胜率 55%,这套系统能用。」这句话里唯一确定的信息是笔数,而一百笔在交易这种噪声水平下,几乎什么都证明不了。所需样本量不是拍出来的经验值,它有一个可以直接算的公式,只依赖两个数:单笔期望值和单笔收益的标准差。这篇把公式、算法和四档期望值下的对照表全部给出来。

先给结论,方便直接抄走:一套胜率 40%、赢 2R 输 1R 的系统(期望值 0.2R),需要大约 208 笔才能在 95% 置信水平上确认它的期望值真的大于零。 如果你一年做 100 笔,这意味着两年。

一、公式和它的来源

所需样本量的公式是:

n ≥ (1.96 × σ / E)²

n = 所需交易笔数
σ = 单笔收益的标准差(以 R 为单位)
E = 单笔期望值(以 R 为单位)
1.96 = 95% 置信水平对应的 z 值

它的来源是均值的置信区间。n 笔交易的平均收益,其标准误是 σ/√n。要让「平均收益大于零」这个结论在 95% 置信水平上成立,需要满足:

E > 1.96 × σ / √n

两边移项并平方,就得到上面那个式子。整个推导只用了一个假设:单笔收益之间相互独立。 这个假设在交易里不完全成立(连续加仓、同向持仓会引入相关性),所以实际所需笔数只会比公式算出来的更多,不会更少。

R 是这里的关键单位。一笔交易赚了多少 R,等于它的盈亏除以这一笔的初始风险金额。 止损 100 点、最后赚了 200 点,就是 +2R。用 R 而不是用金额,是为了让不同仓位大小的交易可以放在同一个分布里统计。仓位怎么算见一笔交易该用多少仓位。

二、标准差怎么算

多数人卡在这一步,因为 σ 不是直接给出的数字,要从胜率和盈亏比推。

对一个「赢就赚 W 个 R,输就亏 L 个 R」的简化模型,胜率为 p 时:

E   = p × W − (1 − p) × L
E²ₓ = p × W² + (1 − p) × L²
σ   = √(E²ₓ − E²)

代入胜率 40%、赢 2R、输 1R:

E   = 0.40 × 2 − 0.60 × 1 = 0.20 R
E²ₓ = 0.40 × 4 + 0.60 × 1 = 2.20
σ   = √(2.20 − 0.04) = √2.16 = 1.4697 R

这个 1.47 就是交易的噪声水平。 它比期望值 0.20 大了七倍多。一套优秀系统的信号强度只有噪声的七分之一,这是所有样本量问题的根源。

如果你已经有实盘记录,不需要用这个模型,直接对每笔的 R 值求标准差即可,Excel 里用 STDEV.S 一步算完,表格公式见Excel交易统计公式。用真实分布算出来的 σ 通常比模型算出来的更大,因为真实交易里有滑点、有部分止盈、有超出止损的跳空。

三、四档期望值对照表

下面这张表是核心。假定赢 2R 输 1R 的盈亏结构,反推每档期望值对应的胜率,再算所需笔数。

单笔期望值 E对应胜率(赢2R输1R)单笔标准差 σ所需笔数 n每年100笔需要
0.10 R36.67%1.446 R803 笔8.0 年
0.20 R40.00%1.470 R208 笔2.1 年
0.30 R43.33%1.487 R95 笔1.0 年
0.50 R50.00%1.500 R35 笔0.4 年

读这张表的正确方式不是「找到自己那一行」,而是看四行之间的落差:期望值从 0.3R 掉到 0.1R,只差 0.2R,所需样本量却从 95 笔涨到 803 笔,差了八倍多。

四档期望值与所需样本量的关系图,横轴为单笔期望值0.05R到0.5R,纵轴为所需笔数(对数刻度),画一条急剧下降的曲线并在0.1R、0.2R、0.3R、0.5R四点标出803、208、95、35四个数值,曲线左侧区域用底色标注「弱信号区:验证成本以年为单位」,右侧标注「强信号区:一年内可验证」

四、核心洞察:这是一个平方关系

公式里 E 在分母上,而且整体被平方。这意味着:

期望值降一半,所需样本量变成四倍。

固定 σ = 1.47R,只改变 E:

单笔期望值 E所需笔数 n相对上一行
0.40 R52 笔基准
0.20 R208 笔×4
0.10 R830 笔×4
0.05 R3320 笔×4

这个平方关系有三条很实际的推论。

推论一:微弱优势在实践中不可验证。 期望值 0.05R 的系统理论上是赚钱的,但你需要 3320 笔才能确认它不是随机的。一年 100 笔的话是 33 年,而市场结构在 33 年里早就变了。在人的一生尺度上,太弱的优势等于没有优势。

推论二:提高期望值比增加样本便宜得多。 想让验证周期缩短一半,你有两个选择:交易频率翻倍(成本翻倍、精力翻倍、质量下降),或者把期望值提高 41%(1.41² ≈ 2)。后者通常更容易,因为期望值的改进空间往往在出场和仓位上,不在入场信号上。改哪里更有效的分析见为什么胜率高还是亏钱。

推论三:连亏一段完全不能说明问题。 期望值 0.2R 的系统,跑到 50 笔时的 t 值只有 0.96,远达不到显著。50 笔的结果是正是负,基本上是掷硬币。 用 50 笔的结果去改规则,改的是噪声。要不要因为连亏换系统,判据见连亏之后要不要换系统。

五、换一个置信水平,数字会变多少

1.96 对应双侧 95%,这是学术界的默认值,对交易者未必是最合适的。

置信口径z 值E=0.1RE=0.2RE=0.3RE=0.5R
单侧 95%1.645585 笔147 笔65 笔24 笔
双侧 95%1.960830 笔208 笔93 笔34 笔
双侧 99%2.5761434 笔359 笔160 笔58 笔

交易者用单侧 95% 是有道理的,因为你关心的问题是单向的:「期望值是不是大于零」,而不是「期望值是不是不等于零」。用单侧口径,E=0.2R 的系统 147 笔就够,比双侧少了近三成。

但不要为了让数字好看而一路放宽口径。放宽到 80% 置信,意味着每五套通过检验的系统里有一套其实是无效的,而你会把真金白银押上去。

六、样本量够了,还有四个条件

笔数达标只是必要条件,下面四条同时满足,回测结论才成立。

条件一:样本必须覆盖至少两种市场环境。 208 笔全部来自同一段单边行情,等于只测了一种情况。一个粗略的检验方法是把样本按时间切成三段,看三段的期望值符号是否一致。分环境表现的检验方法在交易系统是不是真的有效里有更细的做法。

条件二:参数不能是在同一批数据上调出来的。 用同一批数据调参数再用它验证,是在用答案检验答案。正确做法是留出最后 30% 的数据完全不看,参数定死之后再在这段上跑一遍。参数敏感度怎么测见怎么评估一套策略。

条件三:每笔的风险必须大致相等。 R 这个单位成立的前提是每笔的初始风险一致。如果你有些笔重仓有些笔轻仓,那么这批样本的分布是混合的,标准差会被严重低估,算出来的样本量偏小。

条件四:回测里的成本必须按实际填。 手续费、点差、滑点全部计入。这三样合起来经常吃掉 0.05R 到 0.1R,正好是一套弱系统的全部期望值。

样本量之外四个条件的检验流程图,画成四道串联的闸门:环境覆盖(样本按时间三等分检查期望值符号一致性)、样本外验证(数据末尾30%留白不参与调参)、风险一致性(每笔R值的初始风险金额分布是否集中)、成本计入(手续费点差滑点三项合计占期望值的比例),任一道闸门不通过则整批回测结论作废

七、样本不够的时候该怎么办

现实是多数人手上只有几十笔。这时候有三条可行的路,都不包括「先上仓位试试」。

第一条:先看执行率,不看盈亏。 50 笔判断不了系统好坏,但足以判断你的执行情况。执行率低于 90% 的话,盈亏数据本身就不是这套系统的表现,是你和系统的混合表现,谈有效性没有意义。

第二条:降低单笔风险,把笔数跑出来。 用四分之一的仓位跑到 200 笔,代价是这段时间的收益很小,收获是一个可以下结论的样本。这比用满仓跑 50 笔然后猜要划算得多。什么时候可以把资金加回来,门槛见什么条件下可以加大交易资金。

第三条:换更细粒度的指标。 期望值收敛得很慢,但有些中间量收敛得快很多。比如「入场后 5 根 K 线内的平均浮盈」这类指标,方差比最终盈亏小,几十笔就能看出趋势。它不能替代期望值检验,但可以早期给出方向性的提示。

八、三个常见误区

误区一:用回测的总收益率下结论。 总收益率把笔数、仓位、复利三件事混在一起,不同笔数之间无法比较。一切结论都要落到单笔 R 的分布上。

误区二:把优化次数当成免费的。 在同一批数据上试了 50 组参数,选出最好的那组,这组的表现天然被高估。粗略修正方法是把置信要求提高:试了 k 组参数,就把 z 值按 k 组独立检验来收紧,试 20 组的话 z 从 1.96 升到约 3.0,所需样本量会翻倍还多。

误区三:觉得日内高频可以绕过样本量问题。 高频确实能快速积累笔数,但高频的单笔期望值通常也小得多(扣掉成本后经常在 0.05R 量级),而所需样本量按平方放大,两边基本抵消。没有免费的样本。

写在最后

这个公式最有价值的地方不是让你算出 208 这个数字,是让你接受一件事:交易信号的强度只有噪声的七分之一,所以任何短期结果都不携带信息。

理解了这一点,很多困扰会自动消失。连亏五笔要不要改规则,不用纠结,样本量不够,不改。这个月赚了 30% 说明系统很好吗,不说明,样本量不够。

系统评估的完整指标清单见怎么评估一套策略,这些指标各自的及格线在夏普比率多少算好里。而所有这些指标的前提,都是先有足够的样本。

3秒免费测一下你的”管不住手指数”:journal.xtradingtime.com(记住 3316,就能找到我们)


本文内容仅供教育和参考用途,不构成任何投资建议。文中的统计方法基于单笔收益独立同分布的简化假设,实际交易中相关性会使所需样本量进一步增大。交易有风险,入市须谨慎。

微信搜一搜 Tom讲交易

在微信里搜「Tom讲交易」即可关注,每周更新交易教学

推荐课程

合约陪跑实战训练营

不只教方法,更带你实盘执行。从仓位管理到止损止盈,手把手纠正你的交易习惯,建立可复制的盈利系统。

→

相关文章

量化交易

回测胜率多少才算及格:孤立的胜率没有及格线,及格的是期望值 0.2R 加样本 208 笔

回测跑出 55% 胜率就当系统能用,是这批参数里最贵的误判。胜率的及格线完全由盈亏比决定:盈亏比 1:1 时及格线是 60%,1:3 时只要 30%。更要命的是第二个条件,及格线越低的系统越难被证明,盈亏比 1:3 需要 323 笔样本而 1:2 只要 208 笔。这篇给出按盈亏比查的及格胜率表、对应的样本量表,以及回测及格之外必须同时满足的三条。

交易系统

同一个信号的历史胜率为什么不能直接用:每桶 20 笔只够发现 35.8 个百分点的差距

把一个信号按市场环境分桶统计胜率,是用好交易记录的正确方向,但切完之后每桶只剩几十笔,这几十笔算出来的胜率精度差到几乎不能用。文章用二项分布的置信区间和双样本比例检验给出三张对照表,并证伪一条流传很广的门槛:每桶 20 笔根本不够,它只够发现胜率掉到 14% 以下的桶,而那种桶不用统计也知道它差。真正的结论是样本量决定了你只能回答什么问题,所以分桶统计的正确用法是做否决而不是做选择,文末给出四条可以直接在自己记录上执行的判据。

量化交易

回测要用多长时间的数据:先算笔数不算年数,日线策略一年只有 25 笔

「回测一年还是五年」这个问题问错了对象。真正决定回测有没有说服力的是两个数:样本笔数和覆盖的市场状态数。日线策略一年约 250 根 K 线,若平均每 10 根出一个信号,一年只有 25 笔,离 208 笔的显著性门槛差 8.3 年。这篇给出信号密度与所需年数的换算表、五档周期的年信号数对照、市场状态覆盖的三条硬要求,以及数据不够时的三条替代路径。

交易系统

交易系统压力测试怎么做:六个场景各代一次,两个场景叠加就把 0.2R 打成负数

压力测试不是把回测再跑一遍,是把六个具体的坏条件分别代进去看期望值剩多少。基准系统胜率 40%、盈亏比 1:2、每笔期望 0.2R,胜率下调 5 个百分点后只剩 0.05R,盈亏比掉 25% 就归零,滑点每笔多吃 0.1R 只剩 0.1R,而胜率下调加滑点两个场景同时发生就变成 −0.05R。这篇给六个场景的代入算法、及格线和不通过时的改法。

交易系统

三年换了五套方法:先算样本账,每换一次就把 208 笔清零重来

三年还在换指标换方法,问题通常不在方法上,在于没有任何一套方法跑够过样本。换系统真正的代价不是学习时间,是统计样本归零:期望值 0.2R 的系统需要约 208 笔才能确认有效,三年里换五次方法,平均每套只跑 40 笔左右,t 值不到 0.9,五套系统全部处于「无法判断」的状态。这篇给出样本成本核算表和四条判据,区分问题出在方法还是出在诊断能力。

交易系统

稳定盈利的标准是什么:不是连续几个月赚钱,是 208 笔加 t 值过 1.96

用「连续几个月盈利」当稳定盈利的判据,会把绝大多数真正有效的系统判死。一套每笔期望 0.2R、每月做 21 笔的系统,单月亏损概率是 26.3%,连续六个月都盈利的概率只有 16.0%。真正的判据是样本量加期望值显著性:约 208 笔、t 值过 1.96。这篇给出月度盈亏的完整概率表、两类判据的误判率对照,以及按不同交易频率达到 208 笔分别要多久。

觉得有用?关注公众号

扫码或在微信里搜「Tom讲交易」,每周更新交易教学文章

扫码关注 Tom讲交易,或微信搜一搜 Tom讲交易

配套免费工具

随机漫步模拟

打开