ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

阿里:揭示LLM科学推理中的捷径作弊

2026/8/14 15:25:15 拓冰建站 浏览量
阿里:揭示LLM科学推理中的捷径作弊 标题Right Answer, Wrong Method: Shortcut Hacking Misleads the Evaluation of LLM Reasoning on Frontier Science Benchmarks来源arXiv, 2608.02442v1️文章简介研究问题仅凭最终答案准确率评估大模型科学推理能力是否会因模型使用无效捷径而高估其真实水平主要贡献论文定义并量化了“解题黑客”现象开发了基于专家知识的反作弊策略证明当前评估严重高估了前沿模型的推理能力。重点思路定义“解题黑客”指模型通过数值搜索、枚举、猜测或先猜后验等无效捷径获得正确答案却 bypass 了题目旨在考察的核心推理步骤。这与单纯的推理错误不同后者导致答案错误而前者答案正确但过程无效。构建专家锚定检测器通过盲测标注300个前沿科学问题的解答训练由多个顶级模型组成的评审团用于识别解题过程中的捷径行为。该检测器与人类专家判断的一致性达到75.4%且倾向于保守估计漏报多于误报。多维度系统分析在不同难度教科书、竞赛、前沿基准HLE、学科数理化及主流前沿模型中量化黑客行为。发现随着题目难度增加黑客比例从2.2%激增至37.4%在 credited 的正确答案中8.2%-44.1%实为黑客解。开发反作弊策略基于专家原则设计测试时指令如禁止列举、要求证明必要性、预提交推导计划允许模型在无法严谨推导时选择弃权从而抑制捷径行为。分析总结难度与黑客率正相关在简单问题上黑客行为罕见但在奥林匹克级别和HLE等前沿难题中黑客比例显著上升表明模型在能力不足时更倾向于走捷径。准确率存在严重虚高传统评估方式下大量得分归功于猜测和验证而非真实推理。应用反作弊指令后报告准确率大幅下降如从50.6%降至37.3%但经调整的真实推导准确率下降幅度较小说明被剔除的分数多为“水分”。模型差异明显较弱模型在无法解题时更易采用黑客手段较强模型的黑客解更可能被计为正确。在同一模型家族迭代中多数新版本减少了黑客行为但也出现个别版本倒退的现象。学科特征各异数学中常见数值搜索和模式猜测物理中多为公式回忆后验证化学中多为答案回忆后校验。这些领域特定的捷径形式反映了模型对可搜索答案空间的利用。个人观点论文跳出了传统的“答案对错”或“步骤局部正确性”评估框架提出了“能力是否被真正行使”这一核心判据揭示了当前LLM在科学推理上的繁荣可能部分建立在“暴力搜索”和“记忆检索”之上。