
1. 项目概述当搜索智能体学会“闭嘴”在大型语言模型驱动的搜索智能体领域我们正面临一个日益尖锐的挑战幻觉。想象一下你让一个智能助手帮你查找“2025年某款尚未发布手机的详细参数”一个尽职但可能“过度自信”的智能体很可能会基于其训练数据中的模式编造出一套看似合理、实则完全虚构的规格表。这种“一本正经地胡说八道”的现象就是幻觉。它不仅损害用户体验更在医疗、法律、金融等严肃场景中潜藏巨大风险。传统的解决方案比如后处理过滤、增加检索证据的置信度阈值或者简单地用“我不知道”来回应所有不确定查询都像是给一个滔滔不绝的演讲者套上笼头——要么限制过大要么过于笨拙。我们真正需要的是让智能体自身具备一种高级的“自知之明”能够精准判断何时自己掌握的信息足够可靠可以作答何时应该主动“弃权”并请求更多信息或明确告知能力边界。这正是“To Answer or to Abstain”这个项目要解决的核心问题。它不再将“回答”与“不回答”视为非此即彼的静态规则而是通过一种名为“弃权感知的强化学习”的动态决策框架教会搜索智能体在每一次与用户的交互中智能地做出“答”或“不答”的抉择。其目标不是消灭不确定性而是管理不确定性在提供高价值信息的同时将幻觉风险控制在最低水平。2. 核心思路与架构设计从二元决策到策略优化这个项目的设计哲学源于一个深刻的观察一个完美的搜索智能体其价值不仅体现在它“答对了多少”更体现在它“在不确定时少答错了多少”。因此我们需要将“弃权”从一个被动的、惩罚性的选项提升为一个主动的、可学习的策略。2.1 问题建模扩展的动作空间在标准的基于LLM的搜索-生成流程中智能体的动作通常是“生成一个答案”。在本框架中我们将其动作空间扩展为{生成答案 主动弃权}。这看似简单实则带来了建模上的根本变化生成答案智能体基于检索到的文档片段综合生成一个自然语言回复。主动弃权智能体输出一个特定的信号如[ABSTAIN]并可以附带简短的元信息例如“检索到的资料相互矛盾”或“该问题超出当前知识范围”。关键在于选择“弃权”本身需要智能体对当前查询的答案可靠性有一个内在的估计。这个估计不能仅仅基于生成答案的置信度LLM的softmax概率因为LLM对自己生成的内容往往过度自信。我们需要更丰富的、基于检索-生成一致性的信号。2.2 核心信号构建可靠性评估器要让智能体学会弃权我们必须为它提供判断依据。我们设计了多粒度的可靠性评估信号作为强化学习中的状态表征的一部分检索相关性分数检索系统返回的文档与查询的匹配度如BM25、向量相似度。低相关性可能意味着知识库中缺乏可靠信息。证据支持度生成的答案中的关键事实或主张能否在检索到的文档中找到直接或间接的支撑。这可以通过NLI模型或简单的文本蕴含匹配来计算。内部一致性当采用思维链或多次采样时不同推理路径或生成结果之间的一致性程度。高度不一致常暗示着问题的不确定性。答案特异性与模糊性生成的答案是否包含大量“可能”、“也许”、“某些情况下”等模糊词汇或者是否在回避问题的核心。这些信号被组合成一个可靠性标量分数。这个分数并不直接决定弃权而是作为智能体策略网络的输入让它在学习中自行探索“在何种可靠性阈值下弃权是长期收益更高的选择”。2.3 强化学习框架精心设计的奖励函数项目的灵魂在于其强化学习设置特别是奖励函数的设计。我们采用Actor-Critic架构智能体是Actor其目标是最大化从环境中获得的累积奖励。奖励函数必须精心平衡多个目标回答正确的奖励如果智能体选择“回答”且答案正确给予正向奖励。回答错误的惩罚如果智能体选择“回答”但答案错误产生幻觉给予较大的负向奖励。这是抑制幻觉的核心。合理弃权的奖励如果智能体在问题不确定时选择“弃权”给予一个适度的正向奖励。这一点至关重要它赋予了“诚实”以价值。奖励值需小于正确回答的奖励以避免智能体变得过度保守。不当弃权的惩罚如果智能体在问题简单、信息明确时选择“弃权”懒惰或逃避给予轻微的负向奖励。信息增益奖励如果弃权时能附带简要的元信息如“A和B来源矛盾”可额外给予小额奖励鼓励提供有用反馈。设计心得奖励函数的数值设定是调参的关键。初期我们犯过一个错误将正确回答的奖励设得过高导致智能体几乎从不弃权宁愿“赌一把”后来又将合理弃权的奖励设得与正确回答相近导致智能体变成“点头先生”对任何稍有难度的问题都弃权。最终我们采用了一个动态基线让正确回答的奖励是合理弃权的2-3倍错误回答的惩罚是正确回答奖励的-5到-10倍这个比例在实践中取得了较好的平衡。3. 训练流程与关键技术实现整个训练流程是一个闭环的系统模拟了智能体与用户或模拟环境的持续交互。3.1 环境与模拟用户构建由于无法在真实用户流量上直接进行在线强化学习我们需要构建一个高质量的模拟训练环境。知识库准备一个涵盖多领域如维基百科片段、专业论文摘要、新闻存档的文档集合。查询-答案对生成可回答查询从文档中直接抽取事实构造问题。确保答案明确存在于检索结果中。不可回答/模糊查询这是训练的关键。我们通过多种方式构造信息缺失型针对知识库中不存在的事件或细节提问如“未来产品参数”。信息矛盾型从不同文档中抽取相互矛盾的事实构造一个查询使得检索结果包含冲突信息。信息模糊型问题本身存在歧义或所需答案超出模型的知识截止日期。检索器集成一个高效的检索模块如基于稠密向量的DPR或ColBERT用于为每个查询召回Top-K个相关文档片段。3.2 智能体策略网络架构智能体以检索到的文档和查询为输入其策略网络通常基于一个预训练的LLM进行微调。网络有两个输出头动作头一个二分类器输出选择“回答”或“弃权”的概率。这个头的输入除了LLM的上下文表示外还拼接了前面计算的可靠性特征向量。答案生成头当动作头选择“回答”时此头负责自回归地生成答案文本。当选择“弃权”时此头可以生成一个固定的弃权令牌或简短的说明。我们采用了Actor-Attention-Critic的变体思路。这里的“Attention”并非指Transformer中的注意力而是强调Critic网络需要“关注”那些用于评估可靠性的关键信号。Critic网络价值网络的任务是评估当前状态查询检索结果可靠性特征的长期价值它帮助Actor网络更好地理解不同决策的远期后果。3.3 训练循环与策略优化训练在模拟环境中以episode的形式进行采样从环境中采样一个查询可能是可回答的也可能是不可回答的。检索与表征检索相关文档计算可靠性特征形成当前状态。动作选择策略网络根据状态输出动作概率依概率采样决定“答”或“弃”。执行与评估若“回答”则生成答案由环境中的答案验证器判断对错对于可回答查询对比标准答案对于不可回答查询答案通常被判为错。若“弃权”则直接进入奖励计算环节。奖励计算根据前述奖励函数规则计算本次动作的即时奖励。策略更新使用PPO等策略梯度算法结合Critic网络提供的优势估计更新Actor策略网络的参数。Critic网络也通过最小化价值估计的误差来更新。实操要点训练初期策略网络非常随机。我们采用课程学习先使用大量“可回答查询”让智能体学会基本的信息综合与生成能力并建立“正确回答有高回报”的认知。随后逐步混入更高比例的“不可回答查询”引导它在新场景下探索“弃权”动作的价值。这个过程需要监控两个关键指标回答准确率和合理弃权率。4. 效果评估与核心挑战如何衡量一个“学会弃权”的智能体是否优秀我们不再只看QA准确率。4.1 多维评估指标我们建立了一个综合评估体系指标定义期望目标幻觉率(错误回答数) / (所有选择回答的查询数)显著降低核心目标弃权率(弃权查询数) / (总查询数)在可接受范围内提升反映智能体保守程度可回答查询的准确率(正确回答数) / (所有可回答查询数)保持高位不能因学弃权而下降弃权质量(在不可回答查询上的弃权数) / (所有不可回答查询数)越高越好衡量“该弃则弃”的能力不当弃权率(在可回答查询上的弃权数) / (所有可回答查询数)越低越好衡量“该答则答”的能力综合得分如准确率 - λ * 幻觉率 μ * 弃权质量平衡各项能力的整体指标4.2 实现中的核心挑战与解决方案模拟环境的真实性模拟的不可回答查询可能与真实用户查询分布不符。解决方案采用对抗生成的方式用一个小的判别器网络来区分模拟查询和真实历史查询并以此调整查询生成器使模拟环境分布逼近真实分布。奖励函数的稀疏性与延迟判断一个答案是否正确本身可能需要调用另一个LLM或复杂逻辑且只在回合结束时发生。解决方案使用内在好奇心模块或基于可靠性特征的预测奖励模型为智能体提供更密集的中间奖励信号加速学习。“弃权”动作的滥用智能体可能发现“弃权”总能获得稳定的小额正奖励从而逃避回答任何问题。解决方案引入基线调整和机会成本惩罚。例如对于一个简单问题如果智能体弃权其奖励不仅包括弃权奖励还要减去一个“本可轻松获得的正向回答奖励”的估计值使其净奖励可能为负。与现有系统集成训练好的策略网络如何无缝接入现有的搜索-问答流水线解决方案将策略网络部署为一个轻量级的“决策门控”模块。在检索后、生成前该模块快速评估可靠性并做出决策。如果决定生成则调用原生成模型如果决定弃权则直接返回预设模板极大节省了计算资源。5. 高级话题面向异构LLM的多智能体协同服务项目标题和热词中提到了“多智能体”和“异构LLM”这指向了一个更前沿的应用场景Chimera或类似的面向延迟与性能感知的异构LLM多智能体服务框架。我们的弃权感知智能体可以完美融入此类架构。在这种架构下一个查询可能被路由到多个不同能力、不同大小的LLM智能体异构。例如一个快速但能力较小的模型如小型BERT类模型可能先做粗筛和可靠性初判如果它信心不足或主动弃权查询会被路由到更强大但更慢的模型如大型GPT类模型。我们的强化学习框架可以扩展分层弃权决策每个智能体都有自己的“答/弃”策略。小模型在早期过滤掉大量不确定或超出其能力的问题将其“弃权”并传递给大模型从而在系统层面优化吞吐量和成本。协同奖励设计系统级的奖励函数。例如如果小模型正确弃权了一个难题并由大模型正确解答那么小模型也能分享部分奖励鼓励其做好“守门员”角色。负载与延迟感知将系统当前负载、大模型的排队延迟等信息作为状态的一部分输入给前端智能体的策略网络。这样智能体在决策时不仅考虑问题可靠性还考虑系统资源在负载高时可能更倾向于弃权将问题留给异步处理或直接返回“请稍后再试”。未来扩展思考当前的框架主要关注“事实性”幻觉。但幻觉还包括“逻辑幻觉”、“指令跟随幻觉”等。未来的工作可以将可靠性评估信号扩展到逻辑一致性检查、指令分解验证等领域。此外让用户参与到循环中例如在智能体弃权时允许用户提供澄清或反馈并将此反馈作为新的状态输入可以实现持续的在线学习和个性化适配。让AI学会说“我不知道”或许是迈向真正可靠、可信人机协同的关键一步。这不仅仅是技术优化更是一种设计理念的转变从追求全能全知到追求在能力边界内的精准与诚实。通过弃权感知的强化学习我们正在为搜索智能体注入这份宝贵的“自知之明”。