LEARN · ZH · easyquanttrading.com

为什么 100 条策略通常只是 3 个想法

任何有效的搜索都会收敛——收敛本来就是它的含义。后果让人不舒服,而且几乎没人披露:一个看起来很有广度的策略货架,通常只是少数几个想法穿着不同的参数。这一页讲清相关性去重怎么把这件事暴露出来、为什么冗余是搜索的性质而不是某个引擎的缺陷,以及我们把这套方法用在自己货架上(而不是别人货架上)时得到的数字。

FAQ

相关性阈值多少算冗余?
没有普适正确的阈值,任何单一数字都是简化。高阈值(比如 0.95)只能抓到几乎完全同质的行为;低一些(0.7)会把交易者可能视为不同的策略也合并进来。无论用哪个都必须公开,因为最终计数完全取决于它。
冗余和过拟合是一回事吗?
不是,它们是两种会互相作用的失效模式。冗余说的是候选之间有多像;过拟合说的是对噪声的拟合。高冗余会让过拟合更严重,因为它让一次很大的搜索看起来像一次很小、证据很足的搜索。
去重会让我丢掉策略吗?
你丢掉的是广度的幻觉。没有任何东西被删除:每条候选都还在,冗余的那些是被标注而不是被移除。改变的是你相信自己拥有多少笔独立下注。
为什么不直接在生成时就去掉重复?
因为冗余率本身就是信息。在生成阶段压制近似重复,会让货架看起来比搜索实际更分散,也会破坏用于过拟合修正的检验次数估计。
冗余率高说明平台不行吗?
它说明搜索收敛了,而收敛正是搜索该做的事。关键问题不是冗余存不存在,而是平台披不披露它。一个不披露的高冗余率,比一个披露了的高冗余率问题大得多。
我自己能做这件事吗?
能,而且你大概应该做。取每条候选在同一份数据上的收益或信号序列,算两两相关矩阵,在你选定并写明的阈值上聚类。几行代码的事,而它会改变你之后读到的每一份策略清单的意味。
← 返回量化学习不承诺收益,只承诺可检验。