ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

西湖大学与南洋理工团队提出Code World Model:代码决定世界运行,视频模型呈现外观!

2026/9/8 19:19:20 拓冰建站 浏览量
西湖大学与南洋理工团队提出Code World Model:代码决定世界运行,视频模型呈现外观! Code World Model以语言模型为“大脑”让代码决定世界运行视频模型呈现外观近年来视频生成模型在清晰度、时序一致性和可控性上快速进步能合成连贯后续画面使「可交互视频世界」从概念走向原型。但延续画面不等于运行世界复杂环境中的高层语义难以仅凭局部像素预测来维护。复杂世界需“理解为什么”复杂世界需要「理解为什么」语言模型具备的能力适合处理这类高复杂度决策。而且游戏视频是程序执行结果的像素投影现阶段若让视频模型直接学习动作与像素的映射学习路径低效且会造成耦合。Code World Model的提出基于此西湖大学AGI Lab与南洋理工大学的研究团队提出了Code World Model一种以语言模型为「大脑」的新型世界模型范式。其核心思路是让coding agent通过编写、调用和修改code维护并更新可执行的world state相关状态转换为proxy指导video model生成视觉画面。职责重新划分这里的语言模型并不取代视频模型Code World Model重新划分了两者的职责coding agent和code负责知识、目标、规则与长期因果video model负责外观、运动细节、光照与纹理。世界运行过程拆分围绕上述分工Code World Model将世界的运行过程拆成三个部分coding agent理解玩家意图与新事件调用世界知识推理潜在后果决定执行、组合或修改的机制code以更高频率执行确定性更新将高层决策变成可检查、可复用、可持续运行的规则video model读取演化后的状态条件利用视觉先验生成视觉观察。分工对应不同计算频率这种分工对应不同计算频率coding agent进行稀疏决策code执行密集状态更新且coding agent能改变世界运行方式。引入proxy解决接口问题完成职责拆分后存在接口问题为此引入了proxy。它从world state中提取信息组织成粗粒度视觉表示与结构化文本一同送入video model。proxy可表达多种信息设计原则是在控制能力与状态编码成本间取得平衡当前实现中的proxy像素量约为目标的1/16。训练样本需严格对齐要让video model学会理解proxy训练样本需严格对齐。研究团队从游戏运行时记录中同步记录相关数据离线编译proxy。论文使用的gameplay数据包含157段录制约5.6小时源视频采样得到9,420个5秒训练片段。同一份运行时记录可重新编译成不同的proxy论文还展示了真实视频proxy - observation pair的离线构造流程。原型系统运行方式当前原型采用MiniMax - H3的Ref2VA backbone作为video model训练使用8张NVIDIA H800 GPU。推理阶段由GPT - 5.6 Sol担任coding agent系统提供相关模板和primitive它可构造可执行的世界。对于每个5秒片段GPT Image 2生成appearance anchorMiniMax - H3生成RGB视频较长视频通过滑动窗口生成。实验定性结果实验定性结果显示模型能遵循proxy指定的内容补充丰富的纹理等。项目主页给出了与其他video world model的视频对比关注控制粒度与视觉结果。网友评论与结语网友评论虚幻引擎6是否是最后一个用传统3D方法创造游戏的引擎虚幻引擎CEO Tim表示不知道。结语指出过去的video world model主要学习「观察如何继续」Code World Model则进一步维护世界状态和规则。一个开放的生成世界需要视频模型的视觉想象力和执行机制其核心是让code决定世界中发生什么让video model决定这一切看起来如何。