Mage-ViT技术解密:微软如何从零训练出 codec-native 视觉编码器?

Mage-ViT技术解密:微软如何从零训练出 codec-native 视觉编码器?

【免费下载链接】Mage-VL项目地址: https://ai.gitcode.com/hf_mirrors/microsoft/Mage-VL

Mage-VL是微软推出的一款高效的 codec-native 流式多模态基础模型,专为图像和视频理解而设计。其视觉编码器 Mage-ViT 完全从零开始训练,规模紧凑至 4B。它旨在解决现代 VLM 的“莫拉维克悖论”——在复杂的离线推理任务上表现出色,但在简单的实时流感知任务上却速度缓慢且计算量大。

什么是 codec-native 视觉编码器?

传统的视频理解模型通常将视频解码为均匀采样的帧,然后通过冻结的网络预训练 ViT 推送密集的补丁标记网格。而 Mage-VL 则遵循现代视频编解码器的结构:将流分离为锚定(I)帧预测(P)帧,保留每个锚定补丁,并仅保留编解码器花费比特的预测帧补丁——即携带真实运动和新细节的区域。这种与编解码器对齐的稀疏性使得 Mage-VL 在保持高视觉质量的同时,能够显著降低计算成本和延迟。

Mage-ViT 的训练方法

Mage-ViT 是从两阶段从零开始的 ViT 预训练中提取的独立视觉编码器。这是仅 ViT 预训练的检查点:它没有经过与语言模型的联合 VLM 训练。微软通过以下关键步骤从零训练出 Mage-ViT:

  1. 数据准备:收集了大量的图像和视频数据,包括各种场景、物体和动作。这些数据经过预处理,以适应编解码器原生的输入格式。

  2. 架构设计:设计了一种与编解码器对齐的视觉编码器架构。该架构能够有效地处理锚定帧和预测帧,并提取其中的关键信息。

  3. 预训练:使用大规模的图像和视频数据对 Mage-ViT 进行预训练。预训练过程中,模型学习如何从编解码器原生的输入中提取视觉特征。

  4. 微调:在预训练的基础上,对 Mage-ViT 进行微调,以适应特定的下游任务,如图像理解、视频理解和实时流感知等。

Mage-VL 的整体架构

Mage-VL 是一个统一的模型,其中投影的视觉标记和文本标记共享一个因果 Qwen3 解码器。静态图像成为单个空间块;视频成为时间有序的编解码器窗口。在模式下,轻量级认知门预测每个滚动窗口的p_speak = g(h_t)(通过事件保留特征提取器保持的循环流内存),并在p_speak ≥ τ时触发生成;响应由冻结的基础模型从最近编解码器段的本地滑动窗口解码,文本查询可以随时注入。

Mage-VL 的整体架构包括以下几个关键组件:

  • Mage-ViT 视觉编码器:负责从图像和视频中提取视觉特征。
  • Qwen3 语言解码器:负责处理文本输入和生成文本输出。
  • 认知门:负责控制实时流感知任务中的生成时机。
  • 事件保留特征提取器:负责保持循环流内存,以便认知门能够准确预测生成时机。

Mage-VL 的性能表现

Mage-VL 在多个视频和时间接地基准测试中表现出色。在保持 4B Qwen3 骨干网络固定且仅交换 ViT 的情况下,Mage-VL 在所有报告的视频和时间接地基准测试中均优于 Qwen3-VL-4B——在本地化繁重的任务上优势最大(+22.5 QVHighlight,+17.1 ActivityNet,+11.0 VSI-Bench,+24.5 VideoEval-Pro)。

在 SoccerNet 基准测试中,Mage-VL-4B 在响应时间方面表现出色,具有较高的 TriggerAcc、Precision、Recall、F1 和 Latency 指标。在 OVO-Bench 基准测试中,Mage-VL 在流式架构中设置了新的最先进总体得分。

如何使用 Mage-VL?

Mage-VL 提供了一个单一的检查点microsoft/Mage-VL,它同时提供图像和视频理解以及主动流门——相同的权重可以回答离线图像/视频问题并驱动事件门控评论。它涵盖了所有 Mage-VL 功能:图像理解、帧采样视频、传统 H.264/HEVC 编解码器视频、神经 DCVC-RT 编解码器视频和事件门控流。该存储库捆绑了编解码器处理器、神经编解码器包和主动门权重——不需要单独的理解、NVC 或流检查点。

要使用 Mage-VL 进行图像和帧采样视频推理,只需安装transformers库,然后使用以下代码:

model_id = "microsoft/Mage-VL" model = AutoModelForCausalLM.from_pretrained(model_id, trust_remote_code=True) processor = AutoProcessor.from_pretrained(model_id, trust_remote_code=True)

对于在线模式,可以与 OpenAI 兼容的 SGLang 服务器通信。首先使用 Mage-VL SGLang 分支构建并启动服务器(构建需要protobuf-compiler和 Rust 工具链):

git clone https://gitcode.com/hf_mirrors/microsoft/Mage-VL cd Mage-VL git checkout sglang cargo build --release ./target/release/sglang-server --model-path microsoft/Mage-VL

总结

Mage-ViT 是微软从零训练的 codec-native 视觉编码器,它通过与编解码器对齐的稀疏性,在保持高视觉质量的同时,显著降低了计算成本和延迟。Mage-VL 作为一个统一的模型,涵盖了图像理解、视频理解和实时流感知等多种功能,在多个基准测试中表现出色。如果你正在寻找一种高效的多模态基础模型,Mage-VL 绝对值得一试。

Mage-VL 采用 Apache-2.0 许可证发布,你可以在遵守许可证条款的前提下自由使用和修改它。

【免费下载链接】Mage-VL项目地址: https://ai.gitcode.com/hf_mirrors/microsoft/Mage-VL

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考