MMGraphRAG输了,ACM 2026北航DualG-MRAG新作牛了
今天分享北航出品的ACM MM 2026论文–DualG-MRAG,它把多模态RAG的"细粒度视觉vs检索噪声"困境解了。
用Macro Graph做全局拓扑路由+Micro Graph做局部视觉验证,配query-driven GNN和动态规划路径解码。结果在MMQA上EM绝对提升7%,query延迟~0.44s比MMGraphRAG快100倍。
优化重点
现有MM-RAG两大流派各有短板:
- 向量匹配范式(VisRAG/VLM2Vec/CoRe-MMRAG/ViDoRAG):把多模态证据压成静态embedding,难捕捉跨模态依赖
- 图增强范式(HM-RAG/MMGraphRAG/RAG-Anything):细粒度视觉塞统一图导致图爆炸+噪声,粗粒度实体丢失局部证据,拓扑静态query无关
三大核心挑战:
- C1:细粒度表示vs检索噪声两难
- C2:静态图结构vs动态query不匹配
- C3:异构证据缺乏显式结构融合
DualG-MRAG三层架构应对三大挑战:Dual-Tier Graph(解C1)+ Query-Driven GNN(解C2)+ Explicit Path Injection(解C3)。
方案细节
Macro+Micro双层图
Macro Reasoning Graph (T_M)- 全局结构骨架
- 全局实体E_M + 关系R_M
- 视觉信息:frozen VLM生成简洁caption融入文本
- OpenIE提取基础三元组T_M_raw = (e_head, r, e_tail)
- 等价边T_eq:实体embedding余弦相似度超阈值τ则连边
- T_M = T_M_raw ∪ T_eq
Micro Matching Graph (T_m)- 文档内细粒度验证
- micro-fact是4元组:f = (u, r, v, d)
- u/v:头尾节点(文本锚点)
- r:关系(显式编码空间关系/物体属性/局部交互等视觉细节)
- d:源文档指针(链回原图)
- 关键设计:视觉细节放关系r里不放节点,原图用指针d链回,这样细粒度不污染全局结构
Cross-Tier Alignment:映射函数C(·): E_m -> E_M,两阶段链接(精确字符串匹配+ColBERT语义软链接),把局部多模态概念锚定到全局拓扑。
双分支证据激活
Graph-Level Structural Matching(图级)
- 约束LLM parser生成P(q) = (T_cond, T_target, k_v)
- T_cond:带通配符的关系三元组约束
- T_target:目标实体/属性
- k_v:动态视觉预算,限制喂MLLM最大图片数防视觉过载
- 在Micro Graph上subgraph matching,匹配代价dist(π) = Σ(d_n + d_r + d_n)
- 子图同构NP-hard,用近似启发式:Top-K dense vector候选 + Branch-and-Bound搜索
- 命中T_cond的micro-facts通过C投影到Macro Graph形成激活集S_ext(q)
- 与NER合并产生query mask m_q(GNN检索器初始化输入)
- 产出图级文档分数s_graph(d)
Node-Level Document Boosting(节点级辅助)
- 防parser失败/图提取不完整的辅助分支
- 用query显式实体在micro-node空间最近邻搜索
- 严格边界:匹配节点不扩展m_q,只贡献节点级分数s_node(d)
Hybrid Fusion:s_micro(d) = max(s_graph(d), s_node(d))
Query-driven GNN检索器
基于NBFNet架构,把检索形式化为query驱动的消息传递。
Dynamic State Initialization(动态状态初始化)
- h_v^(0) = Enc(q) if v∈m_q else 0
- Enc(·)是all-mpnet-v2编码器
- 反共识:信息流只从query相关锚点出发,初始化阶段就剪枝MMKG噪声搜索空间(vs传统GNN用固定结构节点embedding,query无关)
Relational Message Passing(关系消息传递)
- L层传播:m_uv^(l+1) = Msg(h_u^(l), g^(l+1)(h_r), h_v^(l))
- Msg(·)用非参数DistMult
- g^(l+1)(·)层特定关系变换,让不同推理深度学不同遍历逻辑
- 节点更新:sum pooling + 线性变换
Relevance Scoring and Document Fusion(打分与融合)
- P_q(v) = MLP(h_v^(L))
- 稀疏矩阵乘法投影到文档空间,得文本分t_d和视觉分i_d
- 各自Min-Max归一化
- 视觉分被s_micro(d)调制:
- 命中micro约束:î*_d = α·î_d + β·s_micro(d)
- 未命中:视觉分乘衰减系数
- 最终排序:s_final(d) = max(t̂_d, î*_d)
- 文本推理强 OR 视觉证据结构验证通过,则排名高
显式路径解码
不依赖外部启发式搜索(如PathRAG),直接从GNN前向传递轨迹恢复推理路径。
Local Flow Decomposition(局部流分解)
- τ
- τ是温度超参,低τ集中少数主导推理路径
Efficient Path Decoding via DP(动态规划路径解码)
- 原始KG有环,但L层消息传递天然建模为L-hop计算DAG
- 递推:
- 跟踪最优前驱Ψ^(l)(v) = arg max,从最高分目标节点回溯到初始query实体
- 解码只在受限L-hop计算子图上,开销可控
Topological Evidence Serialization(拓扑证据序列化)
- 输出推理路径:P = {(e_0, r_1, e_1, …, e_L)}
- 用C(·)反向映射macro实体回原始多模态源
- 跨文本/图像/表格多源片段序列化为生成prompt中step-by-step推理路径
- 替代传统孤立文档chunk输入
实验结果
MMQA EM绝对提升7%:DualG-MRAG EM 44.20%(4B),比最强baseline ViDoRAG(37.20%)绝对提升7%,超图增强竞品MMGraphRAG(35.50%)。
延迟比MMGraphRAG快100倍:DualG-MRAG ~0.44s vs MMGraphRAG ~40.5s,内部延迟Micro-Matching 59.95%/Macro-Reasoning 39.40%,亚秒级响应实现深度推理。
Macro和Micro缺一不可:w/o Macro MMQA R@5从61.9%暴跌到21.8%(全局拓扑连通性对跨模态多跳路由至关重要);w/o Micro WebQA R@5降18.2%(局部视觉噪声过滤关键)。
学AI大模型的正确顺序,千万不要搞错了
🤔2026年AI风口已来!各行各业的AI渗透肉眼可见,超多公司要么转型做AI相关产品,要么高薪挖AI技术人才,机遇直接摆在眼前!
有往AI方向发展,或者本身有后端编程基础的朋友,直接冲AI大模型应用开发转岗超合适!
就算暂时不打算转岗,了解大模型、RAG、Prompt、Agent这些热门概念,能上手做简单项目,也绝对是求职加分王🔋
📝给大家整理了超全最新的AI大模型应用开发学习清单和资料,手把手帮你快速入门!👇👇
学习路线:
✅大模型基础认知—大模型核心原理、发展历程、主流模型(GPT、文心一言等)特点解析
✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑
✅开发基础能力—Python进阶、API接口调用、大模型开发框架(LangChain等)实操
✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用
✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代
✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经
以上6大模块,看似清晰好上手,实则每个部分都有扎实的核心内容需要吃透!
我把大模型的学习全流程已经整理📚好了!抓住AI时代风口,轻松解锁职业新可能,希望大家都能把握机遇,实现薪资/职业跃迁~