ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

量化概念 14:过拟合与样本外(回测越漂亮,越要警惕)

2026/8/30 15:34:59 拓冰建站 浏览量
量化概念 14:过拟合与样本外(回测越漂亮,越要警惕) 回测年化 40%实盘一年后只剩 5%——这种情况在量化里太常见了。问题往往不是策略不好而是回测本身骗了你策略在历史数据上过拟合了。什么是过拟合过拟合overfitting是模型把历史数据里的噪声当成了规律背下来。历史数据里除了真实的规律还有大量偶然——某只股票恰好连涨、某个时段恰好风格占优。参数越多、尝试越多模型就越能把每个偶然都解释得严丝合缝代价是失去对未来数据的泛化能力。类比学生考试背答案的学生题目一模一样时满分换道题就垮学方法的学生单次可能不是最高分但换什么题都能做。回测过拟合就是背答案。回测为什么容易过拟合参数搜索。在历史数据上试几千组参数挑表现最好的那组。几千次尝试里总会有几组碰巧很漂亮——那不是规律是运气。试的次数越多找到的最优参数越像噪声。因子挖掘。批量测试几百个因子总有几个在历史上有不错的 IC。这里面大部分是多重比较带来的假发现——数据里总有东西看起来有效。样本太少。规律需要足够样本才能显现。数据点少、参数多时任何复杂模型都能把历史拟合得完美但拟合的是噪声。样本外真正的检验防过拟合的核心工具是样本外验证out-of-sample把数据按时间切开前一段样本内约 70%用来开发策略、调参数后一段样本外约 30%留着开发过程中完全不看最后才跑一次。样本外的意义在于它没有被你的开发过程污染。样本内做得多漂亮都可以是背答案样本外才是换道题的考试。关键在于一次。样本外跑完发现不好回头调参数再跑——第二次跑的时候样本外已经变成样本内了你看到的又是背过的答案。怎么防过拟合样本外验证开发时不碰最后一次性验证参数要少参数越少能背的东西越少过拟合空间越小可解释说得清为什么有效——有故事支撑的因子比纯搜索出来的可信看稳健性最优参数附近是平原参数微调结果基本不变还是尖峰只有那一个点好——尖峰几乎一定是过拟合警惕漂亮曲线样本内年化 40% 配样本外 5%落差本身就是过拟合的信号常见误区反复用样本外调参看过一次的样本外就不再是样本外等于没验证参数越多越好复杂度和样本量必须匹配A 股的历史样本撑不起太多参数只看样本内样本内人人漂亮分水岭在样本外样本外差一点就再调调连续多次试探之后任何结论都不可信了小结过拟合是把历史噪声当规律背下来参数搜索和因子挖掘是它的两个主要温床。防它的核心是样本外验证开发时不碰、最后一次性跑。样本内年化和样本外落差太大先怀疑策略过拟合别急着给参数找借口——回测越漂亮越要警惕。