【维克】p值的正确理解:为什么“统计显著“不等于“实际有用“?
2026/7/27 16:03:54 网站建设 项目流程

年化20%量化笔记 · 第31篇

WHY 为什么p值是量化交易者最容易误读的指标

一个价值10万的"显著"发现

去年有个做量化的朋友老周,兴冲冲打电话给我:"维克,我找到了一个超神的信号!RSI低于20的时候买入,回测5年数据,p值只有0.008,统计极其显著!"

我问他:"平均持仓周期多长?"

"3天。"

"5年大概多少笔交易?"

"大概260笔。"

"平均单笔收益率多少?"

他沉默了一下:"扣掉手续费和滑点,大概0.15%。"

我说:"老周,你的p值确实很显著,但你5年260笔交易,每笔赚0.15%,扣完成本年化收益不到2%。你花了3个月研究这个信号,时薪算下来可能不如去跑滴滴。"

他愣住了。

这就是p值最大的陷阱:它告诉你"这个信号不是噪声",但它从不告诉你"这个信号值不值得用"。

p值到底是什么——用最直白的话解释

p值的定义其实很简单:

假设策略信号完全无效(零假设成立),你观察到当前结果(或更极端结果)的概率。

翻译成人话就是:如果这个信号是垃圾,你"碰巧"测出这样结果的概率有多大。

p值=0.05 → 信号是垃圾的话,有5%的概率出现这种结果

p值=0.001 → 信号是垃圾的话,只有0.1%的概率出现这种结果

p值=0.5 → 信号是垃圾的话,有50%的概率出现这种结果——跟抛硬币差不多

p值越小,说明"这个信号是垃圾"这个假设越不可信,我们就有理由认为信号可能是有效的。

但注意,p值从来不说:这个信号有多好、能赚多少钱、值不值得投入。

统计显著 vs 经济显著——一道被忽视的分水岭

这是量化交易中最重要的概念区分之一,但90%的新手不知道:

维度

统计显著性

经济显著性

回答的问题

"这个效应存在吗?"

"这个效应够大吗?"

衡量工具

p值、t值、置信区间

收益率、夏普比、年化回报

受什么影响

样本量(数据越多越容易显著)

效应大小(信号的实际强度)

实际意义

判断信号vs噪声

判断值不值得交易

一个p值=0.0001的策略,可能年化收益只有0.5%——统计极其显著,经济上毫无意义。

一个p值=0.08的策略(未达到0.05显著水平),可能年化收益25%——统计上不够"显著",但经济上极其有价值。

p值只负责"验明正身",不負責"评估身价"。

HOW 如何正确解读p值并避免被误导

误区一:p<0.05就是好策略

这是我见过最多的错误认知。

p<0.05只意味着:在5%的显著性水平下,我们有足够的证据拒绝"策略无效"这个假设。它不等于:

❌ 策略一定赚钱

❌ 策略收益足够大

❌ 策略在实盘中也会有效

❌ 策略没有过拟合

p值是一把"过滤筛",不是一枚"奖章"。

它帮你过滤掉那些纯噪声的信号,但通过筛选的信号,还需要进一步评估收益大小、稳定性、交易成本等实际指标。

误区二:p值越大,策略越差

也不对。

p值受样本量影响极大。同样是"每次RSI超卖买入"这个策略:

测试100笔交易,p值可能是0.15(不显著)

测试1000笔交易,p值可能变成0.003(极显著)

策略本身没变,只是数据量变了。

反过来也成立:一个本来有效的强信号,如果你只用30笔交易测试,p值可能高达0.3——不是策略不好,是数据太少,统计检验的"分辨率"不够。

所以p值大不一定代表策略差,也可能是样本量不足。判断策略质量,永远要结合效应大小(收益率、夏普比)一起看。

误区三:p=0.049和p=0.051有本质区别

0.049显著,0.051不显著——所以0.049的策略好、0.051的策略差?

荒谬。

0.05这个阈值是人类约定的一个数字,不是自然界的物理常数。p=0.049和p=0.051之间的差异,在统计上几乎没有任何意义。

正确做法:把p值当作一个连续指标来理解,而不是一个"是/否"的开关。

p值范围

合理解读

p < 0.001

极强证据表明信号非噪声,值得深入研究

0.001 ≤ p < 0.01

强证据,信号很可能有效

0.01 ≤ p < 0.05

中等证据,信号可能有效,需要更多数据确认

0.05 ≤ p < 0.10

弱证据,不能排除信号有效,但需要谨慎

p ≥ 0.10

证据不足,暂时认为信号可能是噪声

正确姿势:p值+效应大小+样本量的三角验证

每次评估一个策略信号,我强迫自己看三个数字:

第一:p值——信号是真是假?

p<0.05 → 有理由相信信号不是噪声

p>0.05 → 证据不足,暂不采纳

第二:效应大小——信号值多少钱?

平均收益率、年化回报、夏普比

扣除交易成本后还剩多少

这个数字是否值得我投入真金白银

第三:样本量——结论可靠吗?

样本太少(<50笔交易),p值不可信

样本够大(>200笔),p值的参考价值更高

还要看数据是否覆盖了不同的市场环境

三个数字放一起看,才能做出正确判断:

p值

效应大小

样本量

结论

0.003

年化25%

350笔

✅ 强信号,认真考虑实盘

0.003

年化1.5%

350笔

⚠️ 信号是真的,但太弱了,扣完成本可能不值得

0.04

年化18%

40笔

⚠️ 效应不错但样本太少,需要更多数据验证

0.04

年化1.2%

40笔

❌ 样本少+效应弱,大概率不值得

0.15

年化30%

200笔

⚠️ 效应强但p值偏高,可能是市场环境特殊导致,继续观察

实操模板:我的策略评估检查表

每个新信号上线前,我会填这个表:

策略名称:_______________
信号描述:_______________
统计指标:
- 交易笔数:___笔
- 胜率:___%
- p值:___
- 置信区间(收益率):[___%, ___%]
经济指标:
- 平均单笔收益:___%
- 年化收益(扣成本前):___%
- 年化收益(扣成本后):___%
- 最大回撤:___%
- 夏普比:___
判断:
□ p<0.05 且年化收益(扣成本)>5% → 进入模拟盘测试
□ p<0.05 但年化收益(扣成本)<2% → 放弃,效应太小
□ p>0.05 但效应量大 → 扩大样本量后重新测试
□ p>0.05 且效应量小 → 放弃,大概率是噪声

这个表逼着我同时看统计显著性和经济显著性,避免被一个漂亮的p值冲昏头。

WHAT 你带走的三个核心认知和一份实操清单

核心

1. p值是必要条件,不是充分条件

一个策略想让你赚钱,首先得通过p值检验(证明信号不是噪声),但通过p值检验不代表它就能赚钱。p值是门槛,不是终点线。

2. 统计显著 ≠ 经济显著

p=0.001不代表策略好,p=0.08也不代表策略差。永远要同时看效应大小——年化收益、夏普比、扣成本后的净利润。一个统计极其显著但年化只有1%的信号,对你的账户毫无意义。

3. p值是可操纵的

数据挖得越深、参数调得越多、测试的时间窗口选得越"巧",p值越容易变好看。这就是为什么量化交易中必须做样本外测试、交叉验证——不然是自欺欺人。

  • 立即:检查你当前跟踪的所有策略信号,每个都标注p值和年化收益(扣成本后)
  • 本周:用上面的三角验证法重新评估,标记出"统计显著但经济不显著"的信号——这些是你在浪费时间的证据
  • 持续:每次测试新信号,必须填写策略评估检查表,不允许只看p值就做决策
  • 习惯:跟团队或合作伙伴讨论策略时,先问"效应大小多少",再问"p值多少"——养成经济显著性优先的思维习惯

总结

p值告诉你"这个信号是不是真的",但赚不赚钱取决于"这个信号有多大"。别被一个漂亮的p值蒙住眼睛,忘了看银行账户。

年化20%量化笔记 · 第31篇 · 维克

下一篇:多重检验陷阱:为什么你找到的"规律"可能是假的?

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询