LEARN · ZH · easyquanttrading.com
为什么 100 条策略通常只是 3 个想法
任何有效的搜索都会收敛——收敛本来就是它的含义。后果让人不舒服,而且几乎没人披露:一个看起来很有广度的策略货架,通常只是少数几个想法穿着不同的参数。这一页讲清相关性去重怎么把这件事暴露出来、为什么冗余是搜索的性质而不是某个引擎的缺陷,以及我们把这套方法用在自己货架上(而不是别人货架上)时得到的数字。
- 搜索收敛意味着同一个结构性想法被反复重新发现
- 一百条相关策略,既不是一百次检验,也不是一百笔下注
- 相关性聚类按行为分组,不按参数值分组
- 冗余会虚增表观广度,同时压低真实的分散化程度
- 我们公开自己的冗余数字,是为了让它可以被校准,而不是把它藏起来
- 实务做法:在计数、构建组合、修正检验次数之前,先去重
FAQ
- 相关性阈值多少算冗余?
- 没有普适正确的阈值,任何单一数字都是简化。高阈值(比如 0.95)只能抓到几乎完全同质的行为;低一些(0.7)会把交易者可能视为不同的策略也合并进来。无论用哪个都必须公开,因为最终计数完全取决于它。
- 冗余和过拟合是一回事吗?
- 不是,它们是两种会互相作用的失效模式。冗余说的是候选之间有多像;过拟合说的是对噪声的拟合。高冗余会让过拟合更严重,因为它让一次很大的搜索看起来像一次很小、证据很足的搜索。
- 去重会让我丢掉策略吗?
- 你丢掉的是广度的幻觉。没有任何东西被删除:每条候选都还在,冗余的那些是被标注而不是被移除。改变的是你相信自己拥有多少笔独立下注。
- 为什么不直接在生成时就去掉重复?
- 因为冗余率本身就是信息。在生成阶段压制近似重复,会让货架看起来比搜索实际更分散,也会破坏用于过拟合修正的检验次数估计。
- 冗余率高说明平台不行吗?
- 它说明搜索收敛了,而收敛正是搜索该做的事。关键问题不是冗余存不存在,而是平台披不披露它。一个不披露的高冗余率,比一个披露了的高冗余率问题大得多。
- 我自己能做这件事吗?
- 能,而且你大概应该做。取每条候选在同一份数据上的收益或信号序列,算两两相关矩阵,在你选定并写明的阈值上聚类。几行代码的事,而它会改变你之后读到的每一份策略清单的意味。
← 返回量化学习不承诺收益,只承诺可检验。