
标题FinanceHarness: Autonomous Financial Deep Research Framework来源arXiv, 2607.27853v1️文章简介研究问题通用深度研究系统缺乏金融领域所需的专业知识、历史模式分析及未来事件预测能力且现有基准存在未来信息泄露风险如何构建防泄露的自动化金融深度研究框架主要贡献论文提出了FinanceHarness专家引导的智能体框架及FinanceGym时间点基准实现了端到端自动化金融研究并提供了可验证的评估标准。重点思路构建时间点搜索沙盒基于包含真实发布日期的海量网络语料库建立密集检索系统严格执行截止时间访问控制确保代理仅能获取截止日前信息防止未来数据泄露。开发FinanceGym基准从语料库构建金融实体图挖掘情境生成以投资论点为导向的研究问题。设计双层评分标准分离截止前的证据检索与截止后的结果预测经专家验证确保高质量。设计FinanceHarness框架采用分层服务架构集成面向LLM的工具、API及执行工作流。通过专家知识引导代理运行环境、数据构建及奖励建模使评估与优化共享同一合约。实施严格评估协议使用LLM法官根据预定义标准对报告进行打分区分前置证据与后置推理。对比微调模型、基础模型加搜索工具及工程化智能体系统等多种基线。分析总结基准极具挑战性即使是领先的LLM和智能体在FinanceGym上的得分均低于40%表明当前系统在结合历史证据与前瞻性判断方面仍有巨大提升空间。框架显著提升性能在相同开源骨干模型下FinanceHarness将整体评分从25.3%提升至32.4%优于多数开源微调模型及部分工程化搜索系统接近专有模型水平。前后置表现差异大所有系统在截止前证据检索上的得分远高于截止后推理证明金融深度研究的难点在于基于历史信息进行合理的未来预测而非单纯的信息检索。训练带来边际增益通过组相对策略优化进行环境内训练后性能仅微幅提升0.4个百分点说明精心设计的工具与工作流比单纯的后训练更能有效提升复杂任务表现。个人观点论文解决了金融研究中时间敏感性与前瞻性推理的矛盾通过引入严格的时间点沙盒和分离式评分标准实现了对金融智能体“预测能力”的客观量化而非仅评估其信息整合能力。