ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

Are They All Good? Evaluating the Quality of CoTs in LLM-based Code Generation

2026/10/7 2:31:41 拓冰建站 浏览量
Are They All Good? Evaluating the Quality of CoTs in LLM-based Code Generation 文章主要内容总结本文聚焦于大型语言模型(LLMs)在代码生成中使用思维链(CoT)技术时的质量评估,通过实证研究探究了影响CoT质量的关键因素、CoT质量与生成代码正确性的关系,以及LLMs对低质量CoT的检测和修复能力。研究背景:LLMs结合CoT技术能显著提升代码生成性能,但CoT本身的质量对代码正确性至关重要,目前对LLM生成的CoT质量缺乏深入研究。研究方法:基于两个代码生成基准(CoderEval和SWE-bench-NF)的1023个CoT-代码对,分析了813个失败代码样本的CoT质量,并对210个成功代码样本的CoT进行补充分析;同时探索了多智能体辩论(MAD)框架用于检测低质量CoT,以及不同粒度反馈对LLMs自我修复CoT的影响。主要发现:影响CoT质量的因素中,外部因素(如需求模糊、上下文缺失)占53.6%,内部因素(如LLM误解指令、推理不一致)占40.1%;即使CoT正确,仍有18.5%的生成代码存在错误(因LLM未遵循CoT步骤);即使代码正确,仍有11.9%的CoT存在错误(因LLM依赖自身知识修正了推理缺陷);多智能体辩论(MAD)框架在检测低质量CoT上显著优于单一LLM;LLMs的CoT自我修复能力有限,但提供详细错误信息可提升修复效果。文章创新点首次深入分析了影响LLM生成的CoT质量的因素,并提