ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

InternVideo三阶段训练流程揭秘:从自监督预训练到8B视频对话模型

2026/10/4 10:53:58 拓冰建站 浏览量
InternVideo三阶段训练流程揭秘:从自监督预训练到8B视频对话模型 InternVideo三阶段训练流程揭秘从自监督预训练到8B视频对话模型【免费下载链接】InternVideo[ECCV2024] Video Foundation Models Data for Multimodal Understanding项目地址: https://gitcode.com/OpenGVLab/InternVideoInternVideo 是上海AI实验室开源的视频基础模型系列它的核心是一套三阶段训练流程先用无需人工标注的自监督预训练看懂视频再通过图文多模态对齐学会图文匹配最后与 7B 语言模型拼成InternVideo2-8B 视频对话模型。本文带你完整拆解这条从数据到模型的成长路径新手也能轻松看懂每一步在做什么。整体思路为什么要分三个阶段视频理解是比图像理解更难的任务视频既有时序动态又要和文本、音频对齐。InternVideo 的解法是把能力分层学习阶段目标输入数据监督信号阶段一视觉自监督预训练纯视频无标签掩码重建 教师蒸馏阶段二视频-文本多模态对齐图文/视频文本对对比学习 蒸馏 交叉对齐阶段三视频对话视频 文本指令对话数据微调三个阶段分别对应仓库里的三个模块阶段一代码InternVideo2/single_modality/run_pretraining.py阶段二代码InternVideo2/multi_modality/阶段三InternVideo3InternVideo3/阶段一自监督预训练让模型看懂视频 阶段一的核心思想是不需要任何人工标注让视频编码器从海量视频中自学视觉表征主要依赖两种学习信号生成式学习掩码重建随机遮盖视频中的大量时空 tokenmask_typetube管状掩码、mask_ratio0.75让模型根据可见部分还原被遮盖的内容。相关参数定义见 run_pretraining.py。判别式学习教师蒸馏用两个强大的教师模型带学生——视觉教师InternVL图像-视频 CLIP 模型和多模态教师VideoMAEv2让 1B 参数的学生模型对齐教师的特征。注册逻辑见 run_pretraining.py。训练脚本非常直观运行一条命令即可启动 1B 模型预训练bash ./scripts/pretraining/1B_pt.sh对应文件位于 InternVideo2/single_modality/scripts/pretraining/。预训练完成后你会得到一个与文本无关的通用视频编码器InternVideo2-Stage1-1B/6B它能提取出高质量的纯视觉特征是后续一切能力的地基。阶段二视频-文本对齐从看懂到对得准 阶段二把纯视觉编码器升级为多模态模型在视觉编码器上接一个文本编码器BERT 或 LLM并引入一组互补的损失函数让视频特征和文本特征在同一个空间里对得准。核心损失配置见 scripts/pretraining/stage2/1B/config.py损失项作用VTC视频-文本对比学习拉近匹配对、推远不匹配对MLM掩码语言建模增强文本编码能力VTM视频-文本匹配含难负样本挖掘用于检索场景阶段一预训练的视觉编码器直接作为初始化pretrained1B_stage1.pth同时保留 CLIP 教师蒸馏clip_teacher相关参数见 config.py。训练命令同样是单行启动bash scripts/pretraining/stage2/1B/run.sh该阶段还衍生出一个CLIP 后预训练分支scripts/pretraining/clip/用 LLM 做文本编码器支持中英文检索。阶段二的产出是InternVideo2-Stage2模型在 60 多个视频/音频任务动作识别、时间定位、图文检索等上达到当时 SOTA其中 Kinetics-400 动作识别准确率达92.1%。阶段三8B视频对话模型会看视频还会聊天 阶段三把前两阶段的成果合体将阶段二训练好的1B 视觉编码器与一个7B 语言模型如 InternLM 系列通过适配器拼接得到InternVideo2-Stage3-8B视频对话模型。8B即 1B 视觉 7B 语言它能直接接收视频帧和文字指令进行视频问答、详细描述与推理。最新的InternVideo3-8B-Instruct沿用了同样的视觉编码器 LLM范式并在此基础上强化了长视频与智能体式推理能力其整体架构如下InternVideo3 的训练配方同样遵循分阶段思想继续预训练CPT→ 短到长监督微调SFT→ 基于规则强化学习 → 在线蒸馏详见 InternVideo3/README.md 中的 Training Recipe 章节。在公开权重的模型中它在 Video-MME、MLVU、EgoSchema 等长视频基准上取得了领先成绩小结三阶段流程一张图看懂 阶段模型规模关键能力入口代码① 自监督预训练1B / 6B通用视频视觉表征single_modality② 多模态对齐1B / 6B视频-文本检索与理解multi_modality③ 视频对话8B视频问答与推理InternVideo3这套自监督 → 多模态对齐 → 对话微调的三阶段训练流程是 InternVideo 系列能同时拿下识别、检索、定位、对话等几十项任务的关键。如果你想复现或魔改可以从 InternVideo2/single_modality/MODEL_ZOO.md 的模型列表入手逐阶段跑通整条流水线。【免费下载链接】InternVideo[ECCV2024] Video Foundation Models Data for Multimodal Understanding项目地址: https://gitcode.com/OpenGVLab/InternVideo创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考