ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

一个RAG突破方案,清华DocTrace爆发

2026/8/10 23:32:00 拓冰建站 浏览量
一个RAG突破方案,清华DocTrace爆发

今天分享的文章是百度联合清华提出DocTrace,把长文档视觉问答转为显式证据图推理–模型先构建证据图再基于图生成答案,让每步推理可溯源。三基准较Qwen3-VL-8B-Instruct提升14.4/11.3/11.7点超GPT-4.1。

思路起源

LongDocVQA要求多模态大语言模型在跨多页异构元素中定位整合推理证据。金融审计/医疗分析等高风险场景仅有准确预测不够,用户必须能审查每个结论如何从证据推导,显式证据组合与答案准确性同等重要。现有三类方法各有短板:

  • 端到端MLLM:在隐含表示中隐式聚合证据,难审查
  • RAG:把检索证据当无序上下文,未显式建模证据组合
  • 文档智能体:迭代工具使用暴露中间动作,但推理仍是轨迹导向,未显式表示证据间依赖

共同短板:都不显式建模grounded证据如何逐步组合成最终答案,证据组合保持隐式,难验证难监督难改进。

方案细节

DocTrace受人类专家启发(渐进缩小搜索空间+组织证据成显式推理结构),把LongDocVQA转为显式证据图推理问题而非隐式答案预测。层次化由粗到细三阶段:证据定位 -> 结构化文档解析 -> 证据图推理,同时缩减推理空间并提供节点级证据溯源。

证据定位

全分辨率处理所有页计算不可行且常超上下文容量。DocTrace先在均匀下采样页上做粗粒度定位:

Pevid = fθloc(Dlow, Q)

给定低分辨率文档图像和问题Q,预测证据页索引集Pevid。仅这些页进入后续阶段,大幅缩减搜索空间。

结构化文档解析

定位的证据页用PaddleOCR-VL-1.5以原生分辨率处理,提取细粒度布局元素。每个元素:

bi = (ti, xi, ci)

  • ti:语义类型(文本/表格/图/图表)
  • xi:边界框
  • ci:抽取内容

解析元素形成证据池 **B = {b1, …, bM}**,作后续图推理的原子证据单元。

证据图推理

给定结构化证据池,显式构建证据图:

G = (V, E)

  • 每个节点:B中grounded证据块 或 中间推理结果
  • 每条有向边:推理依赖

推理过程形式化:P(A, G | B, Q) = P(G | B, Q) · P(A | G, Q)

模型先构建证据图,再基于图生成最终答案。因每步推理显式grounded于文档证据,图天然提供节点级证据溯源。

训练数据构造

现有基准仅提供问答对,无法监督证据定位或图推理。DocTrace自动构造结构化监督,分4类训练场景:单页可答/多页可答/无关不可答/缺细节不可答,覆盖证据组合和校准拒绝。

  • Gemini 3.1 Pro生成grounded证据页+证据图
  • GPT-5.5独立验证证据充分性和逻辑一致性
  • 仅验证通过样本保留

任务特定GRPO对齐

Stage1优化证据页定位,Stage3联合优化证据图生成和答案预测,配三类专用奖励:

定位奖励(距离感知软Fβ):页定位是序数而非二值,接近ground-truth的预测应得更高奖励。精确匹配贡献h = |P̂ ∩ G|,未匹配gold页贪婪分配最近预测得距离相关软信用d(k),k为页索引距离。

Rstage1 = (1+β²)·Prec·Rec / (β²·Prec + Rec)

图忠实度奖励:从四维度评估证据图Rgraph = wh·Rhit + wc·Rcomp + ws·Rstruct + wt·Rtopo

  • Rhit:准确证据grounding(节点重叠最大化)
  • Rcomp:完整且紧凑(抑制缺失步骤和冗余节点)
  • Rstruct:结构有效性(可执行DAG约束+有效证据引用)
  • Rtopo:与参考图拓扑一致的推理依赖

答案正确性奖励Ranswer = α·Rexact + (1-α)·Rllm

  • Rexact:确定性答案精确匹配
  • Rllm:LLM验证器评估语义等价
  • 不可答问题:证据不足时鼓励弃答,惩罚幻觉答案

Stage3奖励:Rstage3 = λ·Rgraph + (1-λ)·Ranswer

实验结果

三基准全优:MMLongBench-Doc 52.9(+14.4)超GPT-4.1(45.6) +7.3,LongDocURL 56.4(+11.3),SlideVQA 85.1(+11.7)。

证据图可信:证据grounding 99.5%,图完整性99.6%;反事实评估mask被引证据翻转82.8%,未被引仅9.6%。

图推理对长度鲁棒:检索覆盖率从70.6降到50.2但条件accuracy基本不变;消融显示图推理主要贡献跨页多跳(去图推理单页47.1 vs 44.6)。

学AI大模型的正确顺序,千万不要搞错了

🤔2026年AI风口已来!各行各业的AI渗透肉眼可见,超多公司要么转型做AI相关产品,要么高薪挖AI技术人才,机遇直接摆在眼前!

有往AI方向发展,或者本身有后端编程基础的朋友,直接冲AI大模型应用开发转岗超合适!

就算暂时不打算转岗,了解大模型、RAG、Prompt、Agent这些热门概念,能上手做简单项目,也绝对是求职加分王🔋

📝给大家整理了超全最新的AI大模型应用开发学习清单和资料,手把手帮你快速入门!👇👇

学习路线:

✅大模型基础认知—大模型核心原理、发展历程、主流模型(GPT、文心一言等)特点解析
✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑
✅开发基础能力—Python进阶、API接口调用、大模型开发框架(LangChain等)实操
✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用
✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代
✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经

以上6大模块,看似清晰好上手,实则每个部分都有扎实的核心内容需要吃透!

我把大模型的学习全流程已经整理📚好了!抓住AI时代风口,轻松解锁职业新可能,希望大家都能把握机遇,实现薪资/职业跃迁~

这份完整版的大模型 AI 学习资料已经上传CSDN,朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费