
InternVL3.5-14B 基准测试全解读28 项评测与 16% 推理提升背后的完整真相【免费下载链接】InternVL3_5-14B项目地址: https://ai.gitcode.com/hf_mirrors/OpenGVLab/InternVL3_5-14BInternVL3.5-14B 是开源多模态大模型MLLM家族中的中坚成员0.3B 视觉编码器 Qwen3-14B 语言骨干总参数 15.1B。官方用MMMU、MathVista 等 28 项基准测试评估全家族模型并报告了16.0% 综合推理性能提升与4.05 倍推理加速。本文带你读懂这些数字从何而来、14B 型号处于什么位置、以及如何部署起来。一、先认识 14B核心规格一张表14B 版本是视觉小、语言大的典型组合视觉参数仅 0.3B14.8B 参数集中在语言部分因此通用视觉理解靠轻量 ViT 完成深度推理主要靠语言模型支撑。关键项14B 规格出处视觉编码器InternViT-300M0.3B模型总览表语言模型Qwen3-14B14.8Bconfig.json总参数15.1B模型总览表上下文窗口40,960 tokensconfig.json图像输入448×448 动态分辨率1~12 个图像块config.json权重文件7 个分片如 model-00001-of-00007.safetensors本地文件许可协议Apache-2.0README.md为什么动态分辨率重要448×448 是单块图像的基础尺寸max_dynamic_patch: 12意味着复杂图片最多切成 12 块送进视觉编码器——图表、文档这类细节多的输入能保留更多像素信息这正是 MMMU、AI2D 等基准上拿分的硬件基础。二、28 项基准测试是什么四大家族拆解官方在 README.md 中完整列出了评测清单MMBench v1.1 (en)、MMStar、BLINK、HallusionBench、AI2D、OCRBench、MMVet、MME-RealWorld (en)、MVBench、VideoMME、MMMU、MathVista、MathVision、MathVerse、DynaMath、WeMath、LogicVista、MATH500、AIME24、AIME25、GPQA、MMLU-Pro、GAOKAO、IFEval、SGP-Bench、VSI-Bench、ERQA、SpaCE-10、OmniSpatial。数一数正好28 项可归为四大家族1️⃣ 多模态通用理解10 项基准考什么MMBench v1.1 (en)综合多模态理解总览MMStar、BLINK细粒度感知、人类直觉级视觉挑战HallusionBench多模态幻觉检测AI2D、OCRBench图表/示意图理解、文字识别MMVet、MME-RealWorld (en)综合评分、真实世界场景MVBench、VideoMME视频动态理解2️⃣ 推理与数学9 项——本次提升的主战场基准考什么MMMU大学级多模态学科综合问答MathVista、MathVision、MathVerse、DynaMath、WeMath数学视觉题、多步推理MATH500、AIME24、AIME25竞赛级数学AIME 为美赛真题官方明确点名MMMU 与 MathVista 正是级联强化学习Cascade RL带来substantial improvements的两项代表——这也是标题里真相的核心提升不是均匀撒网而是集中砸在推理上。3️⃣ 纯文本与逻辑4 项GPQA研究生级科学问答、MMLU-Pro大规模知识、GAOKAO高考题、IFEval指令遵循——验证视觉模型没有偏科掉语言基本盘。4️⃣ 智能体任务5 项SGP-Bench、VSI-Bench、ERQA、SpaCE-10、OmniSpatial对应 InternVL3.5 新增的GUI 交互与具身智能embodied agency能力。 评测方法官方使用 VLMEvalKit 完成全部评测且默认报告的是未开启测试时扩展TTS的裸分——也就是说开思考模式后的实际推理分数只会更高。三、16.0% 推理提升与 4.05× 加速两个数字的来龙去脉1. 16.0% 来自先离线、后在线的级联强化学习训练管线共四个阶段见 README.mdCPT多模态持续预训练文本图像混合语料打底SFT监督微调32K 上下文混入 DeepSeek-R1 式思考链数据CascadeRL 之 MPO离线 RL混合偏好优化保证稳定收敛相当于高效热身CascadeRL 之 GSPO在线 RL基于模型自己生成的样本继续精调输出分布。官方结论级联 RL 相比单独的离线或在线 RL用一小部分 GPU 成本拿到了显著的性能提升。2. 4.05× 加速来自 ViR DvD 的部署架构ViR视觉分辨率路由器按图像块语义丰富度动态调整视觉 token 压缩率DvD视觉-语言解耦部署ViT/MLP 放视觉服务器LLM 放语言服务器单向传 BF16 特征、三段异步流水线。⚠️ 注意这两个效率组件主要针对InternVL3.5-Flash 高效系列14B 标准版主要受益的是模型本体更高效的 token 表示。3. 测试时扩展TTS还没算在内官方同时实现了深度思考思考模式分步推理与并行思考Best-of-N 配合 VisualPRM 评审挑选最优答案。但论文报告的实验结果均未使用 TTS——感知类基准上模型本就够强扩展收益集中在推理类。这是读分表时最重要的隐藏注脚。四、14B 的成绩单如何定位三个客观事实28 项分数官方以图表形式呈现于整个 InternVL3.5 家族最大型号 241B-A28B 达到开源 MLLM 的 SOTA并缩小与 GPT-5 等闭源模型的差距14B 是其中的单卡可跑中坚14B 的权重完成了完整四阶段训练管线无后缀版本即最终版而带 -Pretrained / -Instruct / -MPO 后缀的中间权重也一并开源方便复现研究该模型基于 Qwen3 初始化、保留 InternVL1.5 的动态高分辨率策略架构遵循 ViT–MLP–LLM 范式。五、快速上手部署与使用 14B 的 3 个关键步骤硬件门槛官方说明 30B 及以下的模型可在单张 A100上部署14B 单卡完全够用8-bit 量化可进一步降低显存占用。步骤 1获取权重git clone https://gitcode.com/hf_mirrors/OpenGVLab/InternVL3_5-14B或直接从模型库拉取OpenGVLab/InternVL3_5-14B约 30GB7 个 safetensors 分片。步骤 2加载模型bf16 全精度from transformers import AutoModel, AutoTokenizer import torch model AutoModel.from_pretrained( OpenGVLab/InternVL3_5-14B, torch_dtypetorch.bfloat16, low_cpu_mem_usageTrue, use_flash_attnTrue, trust_remote_codeTrue, device_mapauto).eval() tokenizer AutoTokenizer.from_pretrained(OpenGVLab/InternVL3_5-14B, trust_remote_codeTrue, use_fastFalse)⚠️ 需要 transformers ≥ 4.52.1见 generation_config.json 中的版本要求。步骤 3想要更强推理开启思考模式评测分数是裸分开启 Thinking 模式可让 MMMU、MathVista 类题目再上一个台阶将 system prompt 设为官方 R1 思维提示词并建议do_sampleTrue、temperature0.6避免无谓重复提示词全文见 README.md。部署服务可任选LMDeploy或vLLM其中 LMDeploy 的api_server一条命令即可提供兼容 OpenAI 接口的 API。六、新手速查清单选型与调参建议显存只有一张 A100 80G14B 是家族里能力/成本甜点2B~8B 是更省的选择数学与学科题开思考模式 temperature0.6收益最大️文档/图表理解动态分辨率自动生效无需手工调参1~12 块自适应视频任务抽帧后按Frame1: image格式拼接提问多轮对话用history参数维持上下文单图多图均支持对比研究下载带 -MPO / -Instruct 后缀的中间权重可自行复现级联 RL 各阶段增益。七、核心文件速览文件说明README.md完整文档28 项基准、训练管线、部署示例config.json架构配置Qwen3-14B InternViT-300Mgeneration_config.json生成配置与 transformers 版本要求preprocessor_config.json图像预处理448 基准尺寸、1~12 动态块modeling_internvl_chat.py模型主体实现model-00001-of-00007.safetensors权重分片 1/7一句话总结14B 的分数不是营销数字——28 项评测覆盖感知—推理—文本—智能体四个维度16% 的推理提升来自 MPO→GSPO 两段式强化学习4.05× 加速来自 ViRDvD 部署架构而官方报告的是未开思考模式的保底成绩实际推理表现还有上探空间。单卡 A100 就能把这套开源多模态中坚跑起来值得动手试一试。【免费下载链接】InternVL3_5-14B项目地址: https://ai.gitcode.com/hf_mirrors/OpenGVLab/InternVL3_5-14B创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考