商汤SenseNova-Vision:一个模型统一所有视觉任务,全面超越,代码已开源 基本信息论文标题Vision as Unified Multimodal Generation / 视觉即统一多模态生成作者团队商汤科技研究院 南洋理工大学 香港中文大学 北京大学 上海交通大学 浙江大学发表信息arXiv:2607.06560, 2026年7月代码链接https://github.com/OpenSenseNova/SenseNova-Vision研究背景你有没有想过一个问题为什么目标检测需要一个模型分割需要另一个深度估计还得换第三个计算机视觉领域长期处于一任务一模型的碎片化局面——DETR做检测SAM做分割MoGe做深度每个模型架构不同、数据格式不同、互不兼容。这不仅是研究者的烦恼更是产业落地的瓶颈。自动驾驶需要同时跑检测、深度估计和场景理解三四个模型机器人抓取需要检测分割深度联合推理。如果能把所有视觉任务放进一个模型像ChatGPT统一NLP那样会怎样商汤科技联合六所高校的最新工作SenseNova-Vision正是朝这个方向迈出的关键一步。创新点SenseNova-Vision的核心思路极其直接把所有视觉任务都转化为看图说话和看图生成。无论是输出文字坐标红酒杯在[100,200,300,400]还是生成一张深度图甚至是图文混合的指代分割结果都落在同一个多模态生成框架内。这相当于把ChatGPT文本进→文本出的思路搬到了视觉领域输入图像和自然语言指令输出可以是文字、图像或两者混合不需要任何任务专用的预测头。核心方法技术实现分两步每一步都很务实。第一步重新定义数据。研究团队构建了 SenseNova-Vision Corpus核心操作是把所有异构的CV标注统一转写成指令-回答对。COCO的检测框变成图中的猫在哪→猫在[坐标]“深度图的像素矩阵变成估计深度→输出深度图”分割掩码变成把红酒杯分出来→掩码图标签。第二步在统一语料上训练。从一个现成的预训练多模态模型出发不做任何架构改动不添加任何任务专用模块仅在这个翻译后的语料库上训练。模型自然学会了将不同视觉任务理解为不同的问答模式——文字问答、图像生成、图文混合三种模式共用一套参数。这个设计的巧妙之处在于架构零改动。统一不是靠魔改网络结构实现的而是靠重新定义输入输出空间。实验结果SenseNova-Vision在四大类视觉任务上对飙各领域最强专用模型任务类别具体指标本文结果最佳专用模型结构化感知检测 F1mIoU56.6Rex-Omni 52.9稠密几何深度 δ193.2MoGe-2 92.6分割GCG分割 mIoU69.2LISA 61.9多视图3D重建 F187.9VGGT 84.3一个没有任务专用头的统一模型在多个指标上反而超越了各领域最强的专用模型。深度估计的 δ1 达到93.2%意味着93.2%的像素深度误差在25%以内已接近实用精度。多视图3D重建的87.9 F1也大幅领先此前的SOTA。应用场景自动驾驶当前方案需要多个独立模型做检测、深度估计和场景理解。SenseNova-Vision一个模型覆盖全部感知需求显著降低系统复杂度和推理延迟。机器人操作机械臂抓取物体需要同时做检测、深度感知和分割。统一模型让感知链路从多模型串行变成单模型并行。AR/VR从单张图片重建3D结构、估计相机姿态、分割物体——这些是AR眼镜的核心能力SenseNova-Vision的多视图几何能力恰好对齐这个方向。局限与展望推理速度方面作为大模型目前还达不到轻量级专用模型的实时性但这是工程优化问题而非原理瓶颈。极端场景下的鲁棒性——强光照、严重遮挡等条件下——仍需进一步验证。此外当前模型仅处理静态图像尚未扩展到视频时序理解。但方向已经非常清晰。One Model for All Vision正在从口号变成工程现实统一多模态生成可能是视觉基础模型的最终形态。总结一句话SenseNova-Vision证明了一个统一多模态生成模型能同时胜任七大视觉任务且超越专用模型。覆盖检测、OCR、分割、深度、法线、3D重建、相机姿态架构零改动。模型和代码已全面开源。以上就是SenseNova-Vision论文的核心解读。如果觉得有帮助欢迎点赞、在看、转发三连支持你觉得一模型通吃所有视觉任务离产业落地还有多远欢迎在评论区聊聊。