
Video-DeepResearch面向下一代视频多模态深度研究智能体论文arXiv编号2608.03979v1https://github.com/Osilly/Vision-DeepResearch摘要现有多模态深度研究智能体仅支持静态图片检索无法处理连续视频时序时空推理任务。本文通过初步实证实验发现当前模型存在两大核心缺陷模态偏好偏差智能体刻意规避视觉检索工具优先使用纯文本搜索放弃视频画面时序细粒度证据参数知识泄露模型依赖预训练内置参数记忆直接作答不调用任何外部工具完成推理评测结果失真。本文提出Video-DeepResearchVideo-DR统一框架采用感知-探索解耦分阶段工具解锁流水线强制模型先完成跨帧视觉细粒度检索再执行网页文本检索配套两阶段训练方案监督微调SFT分组相对策略优化GRPO突破模仿学习性能天花板。同时本文构建VideoDR-Bench人机协同多跳视频问答基准包含200道必须结合视觉检索外网知识推理的复杂样本。实验结果Video-DeepResearch-35B-A3B 平均准确率64.0%超越闭源模型Claude-4.5-Sonnet59.0%5个百分点大幅领先GPT-552.5%、Gemini 2.5 Pro57.5%30B轻量化版本达到59.3%与Claude持平证明训练范式在小参数量模型上同样有效。1 引言随着大模型智能体技术发展文本、图片深度研究DeepResearch系统已成熟但连续视频时序深度推理仍是空白领域。视频任务需要跨帧时空细粒度定位、实体追踪再结合全网外部知识多跳推理复杂度远高于单张静态图像。现有研究演进脉络纯文本智能体WebGPT、AutoGPT仅文本搜索无视觉感知图像深度研究WebWatcher、Vision-DeepResearch支持图片裁剪、反向图搜但无法处理时序视频视频理解模型仅单轮静态帧编码缺少交互式工具检索闭环无法联动外网信息。当前两大核心痛点评测失真现有视频基准无法约束模型调用视觉工具模型靠内置参数记忆答题评测分数不代表真实检索推理能力模型行为缺陷存在视觉工具规避倾向无视视频画面实体证据直接用泛化文本搜索丢失时序上下文信息。本文核心五大贡献提出Video-DeepResearch完整视频深度研究框架设计感知-探索解耦流水线强制先视觉检索再文本搜索解决模态偏好偏差搭建可扩展视频问答数据生成管线产出3万条视频问答对、7千条高质量完整智能体推理轨迹设计SFTGRPO两阶段训练方案小参数量模型超越顶级闭源大模型构建VideoDR-Bench人机协同评测基准全部样本必须同时使用视觉文本工具杜绝参数知识泄露完整消融实验验证各模块增益分析工具调用行为变化证明框架可从根本改变模型推理策略。2 基础方案尝试与实证分析2.1 任务形式化定义给定连续视频序列V{v1,v2...vT}V\{v_1,v_2...v_T\}V{v1,v2...vT}与复杂查询Q智能体执行序列决策生成完整答案R。动作空间A{Select_Keyframe,Crop_Search,Text_Search,Visit}\mathcal{A}\{\text{Select\_Keyframe},\text{Crop\_Search},\text{Text\_Search},\text{Visit}\}A{Select_Keyframe,Crop_Search,Text_Search,Visit}Select_Keyframe从时序中筛选关键帧Crop_Search框选帧内实体裁剪并执行反向图像检索Text_Search文本全网检索Visit访问网页读取详细内容。推理轨迹Hi[Q,V,a1,o1...ai−1,oi−1]\mathcal{H}_i [Q,V,a_1,o_1...a_{i-1},o_{i-1}]Hi[Q,V,a1,o1...ai−1,oi−1]策略分布ai∼πθ(a∣Hi)a_i \sim \pi_\theta(a|\mathcal{H}_i)ai∼πθ(a∣Hi)。2.2 现有模型实证实验选用Qwen3.5-35B、Qwen3.5-397B、GPT-5三款主流模型在传统视频基准评测统计平均工具调用次数模型准确率单任务视觉工具调用均值单任务文本工具调用均值Qwen3.5-35B41%0.040.58Qwen3.5-397B58%0.101.27GPT-557%0.000.12两大关键结论模态规避偏差即使最强开源397B模型平均每任务仅调用0.1次视觉工具极度依赖文本搜索完全放弃视频时序视觉证据参数知识泄露GPT-5全程几乎不调用任何工具仅凭预训练记忆达到57%高分现有基准无法区分“检索推理”和“内部记忆背诵”评测无实际参考价值。3 Video-DeepResearch 完整框架整体流水线分为三大阶段视频多级过滤、VQA问答生成、推理轨迹构造训练采用SFT监督微调GRPO强化学习双阶段方案。3.1 VQA 视频问答数据生成步骤1多源视频两级过滤数据源公开视频数据集YouTube真实流媒体视频规则粗过滤剔除过短、纯色无内容视频智能体精细过滤Qwen3.5-35B评估内容信息量剔除无研究价值素材过滤后数据划分为训练集构造推理轨迹、测试集构建VideoDR-Bench。步骤2关键帧选取实体视觉检索CLIP帧相似度打分筛选候选关键帧大模型标注实体边界框裁剪目标实体反向图搜验证实体匹配度生成结构化元组关键帧、边界框、实体名称、检索摘要。步骤3 问答生成与防泄露过滤两种提问范式单实体问答基于单一实体事实提问多实体多跳问答跨实体关联复杂推理。防泄露过滤规则无工具辅助下模型答对的样本全部丢弃保证题目必须调用外部检索最终产出3万条高质量VQA样本。3.2 推理轨迹生成核心解耦流水线针对模型规避视觉工具问题设计分阶段工具解锁策略第一阶段感知阶段仅开放Select_Keyframe、Crop_Search视觉工具强制跨帧多次实体检索不允许文本搜索视觉信息充足后解锁Text_Search、Visit文本工具再完成答案推导拒绝采样仅保留推理正确轨迹用于训练最终产出7千条完整高质量智能体执行轨迹。3.3 两阶段训练方案基础底座Video-DeepResearch-30B-A3BQwen3-VL-30B-InstructVideo-DeepResearch-35B-A3BQwen3.5-35B-A3B硬件集群4台NVIDIA H80 80GB节点完整超参见附录B。阶段一监督微调 SFT训练混合数据集7千条视频感知推理轨迹 7千条纯文本深度研究样本均衡视觉/文本工具使用行为。损失函数标准自回归负对数似然LSFT−E(x,y)∼D[∑i1∣y∣logπθ(yi∣x,yi)]\mathcal{L}_{\text{SFT}}-\mathbb{E}_{(x,y)\sim\mathcal{D}}\left[\sum_{i1}^{|y|}\log\pi_{\theta}(y_{i}\mid x,y_{i})\right]LSFT−E(x,y)∼Di1∑∣y∣logπθ(yi∣x,yi)阶段二GRPO 分组相对策略优化采用DeepSeek-Math提出的GRPO算法无需独立价值网络节省显存开销。训练集2千道中等难度视频样本每条生成4条推理轨迹稀疏二元奖励答案正确r1错误r0负梯度仅20%概率生效抑制格式错误、循环重复对训练的干扰完整损失包含策略裁剪项KL正则项LGRPO1G∑i1G[min(πθ(oi)πold(oi)A^i,clip(πθ(oi)πold(oi),1−ϵ,1ϵ)A^i)]−βDKL\begin{split}\mathcal{L}_{\text{GRPO}}\frac{1}{G}\sum_{i1}^{G}\Big[\min\Big(\frac{\pi_{\theta}(o_{i})}{\pi_{\text{old}}(o_{i})}\hat{A}_{i},\text{clip}\Big(\frac{\pi_{\theta}(o_{i})}{\pi_{\text{old}}(o_{i})},1-\epsilon,1\epsilon\Big)\hat{A}_{i}\Big)\Big]-\beta\mathbb{D}_{\text{KL}}\end{split}LGRPOG1i1∑G[min(πold(oi)πθ(oi)A^i,clip(πold(oi)πθ(oi),1−ϵ,1ϵ)A^i)]−βDKL3.4 VideoDR-Bench 评测基准人机协同标注流水线最终200道多跳视频推理样本视频时长分布视频类型时长数量占比短视频≤2分钟9246.0%中视频2~10分钟6834.0%长视频≥10分钟4020.0%六大视频领域分布知识类29.5%、娱乐22.0%、日常生活18.5%、游戏体育14.5%、新闻12.0%、其他3.5%。标注流程人工标注员裁剪实体检索生成种子问题多智能体迭代扩展多跳复杂问题自动过滤无工具可解样本人工复核全部题目。4 完整实验4.1 实验配置对比基线Gemini 2.5 Pro、GPT-5、Claude-4.5-Sonnet、Qwen全系开源模型、Kimi K2.5评测两套数据集传统VideoDR、本文VideoDR-Bench评测规则统一工具调用权限使用Qwen3-VL-30B作为裁判模型打分。4.2 主实验全局准确率结果模型VideoDR总精度VideoDR-Bench平均精度Gemini 2.5 Pro62.057.5GPT-557.052.5Claude-4.5-Sonnet63.059.0Qwen3.5-397B超大开源基线58.052.8Video-DeepResearch-30B-A3B62.059.3Qwen3.5-35B 原始底座42.042.8Video-DeepResearch-35B-A3B68.064.0核心结论35B版本SOTA64.0%领先Claude 5个百分点30B轻量化版本59.3%持平顶级闭源Claude对比原生底座35B版本提升21.2%30B提升18.8%训练范式增益巨大细分领域优势知识、娱乐、日常视频提升最显著新闻动态场景仍存在优化空间。4.3 工具调用行为分析统计各模型平均视觉/文本工具调用次数模型VideoDR视觉/文本VideoDR-Bench视觉/文本Claude-4.51.83 / 3.382.25 / 3.24GPT-50.00 / 0.120.31 / 1.43Qwen3.5-397B0.10 / 1.270.04 / 2.77Video-DeepResearch-30B2.33 / 4.242.98 / 3.81结论本文框架彻底解决模态规避问题模型主动大量执行跨帧实体视觉检索不再依赖纯文本搜索推理流程贴合视频时序信息。4.4 消融实验30B模型训练配置VideoDR精度VideoDR-Bench全局均值原生底座38.043.040.5仅4K视频SFT44.048.046.07K视频轨迹SFT55.051.053.07K视频7K文本混合SFT59.054.556.8SFT2K GRPO完整框架62.056.559.3消融结论视频轨迹SFT是基础增益带来12.5%提升混合文本样本缓解文本检索能力短板额外3.8%GRPO强化学习突破模仿学习上限最终再提升2.5%缺一不可三模块协同才能达到最优性能。4.5 深层讨论模型规模不等于视频检索能力397B超大基线性能弱于30B优化版证明专用训练范式比参数量更关键工具调用行为是真实理解指标GPT5高分仅靠记忆无视觉检索不具备视频真实理解模态偏差是数据分布缺陷非模型架构固有问题通过分阶段解锁训练可完全修正。5 相关工作5.1 视频理解大模型传统Video-LLM仅均匀采样单帧做静态问答缺少交互式检索闭环近期视频智能体仅支持封闭场景内置工具无法联动全网开放信息。本文首次打通视频时序感知全网多跳深度研究完整链路。5.2 多模态深度研究系统文本智能体WebGPT、WebSailor、图像智能体Vision-DeepResearch已成熟但均无法处理连续时序视频现有视频评测集缺少“必须视觉检索”约束存在知识泄露漏洞本文VideoDR-Bench填补该空白。6 结论本文提出Video-DeepResearch首个完整视频深度研究智能体框架针对模态规避、参数知识泄露两大行业痛点设计感知-探索解耦、分阶段工具解锁的数据生成流水线配套SFTGRPO两阶段训练方案同时构建200道人机协同多跳评测基准VideoDR-Bench。实验证明35B版本达到SOTA超越全部闭源模型30B轻量化版本可媲美Claude-4.5。研究证明专用训练范式能让中小参数量模型获得远超超大基础模型的视频时序检索推理能力为下一代视频多模态智能体提供完整基线与训练方案。局限性训练与数据合成需要海量H80 GPU算力计算开销高基准依赖人工复核标注大规模自动扩充存在难度未来方向轻量化推理架构、全自动评测标注、长时序超长视频深度研究拓展。附录完整资源实验脚本/超参/提示词附录B 训练超参完整脚本并行方案TP4、CP2、EP8序列并行开启上下文最大长度80k tokens训练轮次3 epoch全局batch64学习率峰值1e-5线性预热5%步数后衰减至5e-7MoE负载均衡损失系数1e-6专家容量系数2.0显存优化FlashAttention、全层激活检查点、可扩展分段内存保存策略每500步存储Safetensors格式权重不保存优化器状态。附录C 关键帧提取预处理代码规则使用CLIP-ViT-L/14336px计算帧相似度相似度0.8丢弃冗余帧单视频最多保留20帧纯色无画面视频直接过滤整套预处理脚本开源在项目仓库。附录D 全套提示词脚本4类核心Prompt视频任务适用性判定Prompt过滤无需检索的简单视频多帧实体提取Prompt输出标准化实体边界框JSON多跳问答生成Prompt禁止泄露实体名称强制多模态联合推理智能体工具调用Prompt强制先执行select_crop_search视觉检索再调用文本搜索工具定义完整JSON规范见论文附录表6。可用工具完整定义select_crop_search指定帧边界框裁剪反向图搜实体search批量文本全网检索visit读取网页详情抽取目标证据。论文全部资源下载链接论文HTML原文https://arxiv.org/html/2608.03979v1论文PDFhttps://arxiv.org/pdf/2608.03979v1完整代码仓库https://github.com/Osilly/Vision-DeepResearchVideoDR-Bench数据集https://github.com/QuantaAlpha/VideoDR-Bench全套训练SFT/GRPO脚本、提示词模板仓库train/eval目录实验仿真评测工具VLMEvalKit视频定制分支原始视频数据源MLVU、Video-MME、公开YouTube数据集