ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

从李飞飞访谈看AI学习新范式:世界模型与合成数据如何突破现实数据瓶颈

2026/8/27 21:17:59 拓冰建站 浏览量
从李飞飞访谈看AI学习新范式:世界模型与合成数据如何突破现实数据瓶颈 1. 从访谈引出的一个反常识观点最近李飞飞的一期访谈在技术圈里刷了屏。大家印象里的李飞飞往往和“大数据”绑定得很深——早期推动 ImageNet靠海量人工标注的真实图片把深度学习的浪潮托了起来。正因为这样当她在访谈里说出类似“人也不全靠现实数据学习”的观点时很多人的第一反应是这岂不是在否定自己过去主导的大数据路线其实不是否定而是对“数据”这个概念的重新理解。李飞飞长期关注的方向已经从静态视觉转向空间智能、具身智能也就是让 AI 不只停留在“识别一张图”而是能理解三维空间、动作和因果关系能在物理世界里做出合理反应。要做到这一点只靠给模型灌更多真实世界记录是不够的因为真实世界的数据覆盖有限、成本高、还可能包含大量噪声。人类的成长过程也不是把所有现实场景都经历一遍才学会行动而是能在很有限的真实经验之上通过想象、推理、语言和抽象去泛化新情况。对普通 AI 工程师来说这句话背后藏着一条非常重要的学习方向如果模型能在真实数据之外自己生成有效经验学习效率会有巨大提升。这正好引出了近几年工业界和学术界都在关注的合成数据、世界模型、模拟器、自我博弈等技术。本文不会去逐字分析访谈原话而是把“人也不全靠现实数据学习”当做一个技术命题从学习机理、当前 AI 训练范式、空间智能、工程落地等角度做一个系统拆解。无论你是做 CV、NLP还是做强化学习这篇文章都能给你一个更完整的视角。2. 人脑学习和当前 AI 学习到底差在哪2.1 当前主流 AI仍然高度依赖真实数据过去十年深度学习最成功的路径本质上是一条“真实数据驱动”的路径。以 ImageNet 为例模型需要先在千万张人工标注的真实图片上做监督学习才能学会识别物体。后来引入自监督学习比如 CLIP、MAE模型虽然不需要人工逐张标注了但预训练语料仍然是从互联网上收集的真实图片、真实文本。再后面的大语言模型也主要是在真实网页、书籍、论文等文本上做下一个词预测。这条路线带来了非常震撼的能力数据量足够大模型会涌现出令人意外的理解和生成能力。它也带来了一个隐藏的瓶颈模型学到的知识本质上是对训练数据分布的拟合。当测试场景和训练分布差异很大时模型容易表现得“一本正经地胡说八道”或者泛化能力不足。所以当前 AI 的学习有一个明显特征真实数据决定能力上限。数据覆盖不到的角落就是模型能力崩塌的地方。2.2 人类学习真实经验只是起点再看人类。婴儿和幼儿当然需要真实世界的视觉、触摸、运动等感官输入但这种输入和深度学习模型使用的“数据”很不一样。真实世界对人是稀疏、模糊甚至矛盾的。一个孩子看到一只狗可能只看了几眼伸手摸了一次被狗叫吓了一次之后就能在没见过的新品种上识别出“这是狗”。这里面至少做了几件事从有限观察中抽取了结构性的特征比如四条腿、毛茸茸、会动借助语言和成人的指示获得了抽象类别在想象中推演“如果我伸手去摸会发生什么”通过反事实推理排除干扰比如“虽然也会叫但猫不是狗”。李飞飞在访谈里点出的关键点正是这一点人类学习不是把所有现实数据都存下来再统计归纳而是依赖一套强大的先验结构包括空间感知、运动意图、因果推理和想象能力。真实数据负责提供“种子”大脑在此基础上做大量离线的“脑内模拟”。2.3 为什么“现实数据不够”这个问题越来越尖锐如果模型只做图片分类真实数据堆得多一点好像也够用。但一旦进入具身智能、机器人控制、自动导航、手术辅助这些场景问题就暴露了。真实世界中一个机器人要抓取水杯需要理解水杯的材质、重心、把手方位、抓取力度、周围障碍物以及动作失败后如何修正。这些经验很难通过“多拍照片”获得必须通过大量试错。而物理试错成本极高机器人碰几次就坏了总不能让它每条路径都撞一遍。这时候就要让人工智能学会“想象”。这也正符合李飞飞这些年提出的空间智能研究方向让 AI 能够理解三维空间中的几何关系、运动关系和因果变化看着一张图就能推算出背后可能发生的动作后果。一旦模型具备这种能力它就能在虚拟空间里预习真实世界减少对真实世界数据密度的依赖。3. 不完全依赖真实数据学术界和工业界在怎么做3.1 世界模型让模型学会“脑内推演”世界模型是最近几年特别热的技术概念。它本质上是用一个模型去学习环境的动态规律也就是给定当前状态和一个动作能预测出下一个状态。人能够想象自己移动杯子后杯子会到哪里靠的就是脑内有一个足够好的世界模型。世界模型的价值在于学会之后可以不依赖真实环境采样直接在模型内部生成大量“虚拟经历”。比如之前 Sora 等视频生成模型虽然被讨论最多的是多媒体生成但它的深层意义在于模型要用视频数据理解世界的物理动态知道物体下落、碰撞、光影变化的大致规律。当这种规律被编码进网络参数模型就拥有了一种可泛化的“想象能力”。对 AI 训练来说世界模型的产出可以当作额外训练数据补足真实数据覆盖不到的长尾场景。3.2 模拟器和合成数据低成本制造“经验”工业界最成熟的手段是模拟器。自动驾驶公司普遍用仿真的方式生成大量虚拟城市路况让车辆模型先跑上万小时再拿着仿真结果迁移到真实环境。游戏引擎在机器人领域承担了类似作用比如把机械臂放在物理仿真环境里反复尝试抓取收集成功和失败的数据。合成数据也早已不是新鲜事。在视觉领域可以用渲染引擎生成带精准标注的图片在文本领域可以让大模型生成平衡场景的训练样本。这背后的核心思路和人类学习很像先把真实世界规律抽象成可重新组合的单元再通过生成的方式创造没有实际经历过的新场景。不过合成数据不是完全替代真实数据而是把真实数据中隐含的结构放大。如果真实数据是“种子”合成数据就是“温室”让模型在一个受控环境里快速长经验。3.3 自我博弈与强化学习凭空创造对抗经验另一个经典案例是 AlphaGo 和 AlphaZero。它没有从人类棋谱里学习“全部棋局”也没有办法获得亿万个真实棋盘作为标注数据。它靠的是自我博弈让模型和自己下棋不断产生新的对局数据再从自我对抗中学习策略。这种学习方式可以看作“想象学习”的一种极端形式现实世界只提供了规则围棋的合法走法剩下的经验全部由模型内部推演产生。访谈里说人不完全靠现实数据学习其实也对应这种“脑内回放”和“推演训练”。人类会在头脑里模拟一场对话、一个动作可能带来的后果这个过程不需要外界真实反馈却极大增强了学习效率。3.4 具身智能与空间智能用三维动作理解世界李飞飞把空间智能和具身智能放到重要位置道理也在这里。人类学习并不是把环境当作一堆二维图片而是把环境当作一个可以交互的三维空间。我们行走时会判断台阶高度抓握时会根据距离调整手形这些能力都来自空间感知和运动反馈的共同作用。如果 AI 能从视觉输入中恢复出三维几何结构、物体位置关系和可能的动作约束那么它面对一个新场景时就可以在“想象空间”里先做一遍推理物体能不能抓、抓哪里、移动后会不会碰撞。这样即使没有真实世界的大量试错数据AI 也能借助几何和物理先验做出合理推测。这实际上是把数据驱动和结构化推理结合走的路线更接近人类感知。它不是简单地说“不需要现实数据”而是说“现实数据不再是被动吞入的内容而是一种主动感知与交互的原料”。4. 用一个小实验理解“真实数据不够”与“想象补足”理论说多了容易飘我们直接用一个简单的分类任务来体会。假设我们要训练一个分类器区分三角形和圆形。真实数据很少的时候模型学不好这时候如果加入“想象”——也就是对已有数据做合理的变换或生成——分类器往往能明显变好。下面用 Python 代码演示这个思路。这不是一个严格意义上的论文复现只是为了让你理解数据增强和模拟生成为什么有用。4.1 准备少量真实数据我们先用最简单的二维点集来模拟两个类别。这里通过关键点坐标区分图形而不是像素渲染降低理解成本。import numpy as np import matplotlib.pyplot as plt from sklearn.model_selection import train_test_split from sklearn.linear_model import LogisticRegression from sklearn.metrics import accuracy_score np.random.seed(42) # 生成三角形样本三个顶点在(0,0)、(2,0)、(1,2)附近抖动 def make_triangle(n): points [] for _ in range(n): x [0, 2, 1] np.random.normal(0, 0.15, 3) y [0, 0, 2] np.random.normal(0, 0.15, 3) points.append(np.concatenate([x, y])) return np.array(points) # 生成圆形样本用8个采样点描述圆的形状 def make_circle(n): points [] angles np.linspace(0, 2 * np.pi, 8, endpointFalse) for _ in range(n): base_x np.cos(angles) np.random.normal(0, 0.15, 8) base_y np.sin(angles) np.random.normal(0, 0.15, 8) points.append(np.concatenate([base_x, base_y])) return np.array(points) X np.concatenate([make_triangle(20), make_circle(20)], axis0) y np.array([0] * 20 [1] * 20) # 只取很少的真实数据 X_train, X_test, y_train, y_test train_test_split( X, y, test_size0.5, random_state0, stratifyy ) print(f训练样本数{len(X_train)}测试样本数{len(X_test)})这里每类只有 10 个训练样本属于典型的“小数据”场景。每个样本用 16 个数值表示坐标位置虽然简单但已经足够看出数据量对分类器的影响。4.2 只用真实数据训练我们用简单的逻辑回归来训练分类器并观察测试准确率。model LogisticRegression(max_iter1000) model.fit(X_train, y_train) pred model.predict(X_test) acc accuracy_score(y_test, pred) print(f不使用任何想象准确率{acc:.3f})因为样本非常少而且噪声明显准确率通常不会很高而且每次随机种子不同结果会有波动。这反映了真实项目里的常见困境标注成本高、场景样本有限、训练初期模型效果不稳定。4.3 加入“想象”对已有样本做轻微扰动现在模拟人类的想象能力。我们并不去采集新的真实数据而是在已有样本的合理范围内做轻微随机扰动生成一批“虚拟经验”。这本质上是数据增强。def imagine(points, n_extra200): generated [] for p in points: for _ in range(n_extra): noise np.random.normal(0, 0.08, sizep.shape) generated.append(p noise) return np.array(generated) # 基于训练数据生成虚拟样本 X_aug imagine(X_train, n_extra30) y_aug np.repeat(y_train, 30, axis0) X_combined np.concatenate([X_train, X_aug], axis0) y_combined np.concatenate([y_train, y_aug], axis0) model_aug LogisticRegression(max_iter1000) model_aug.fit(X_combined, y_combined) pred_aug model_aug.predict(X_test) acc_aug accuracy_score(y_test, pred_aug) print(f通过想象扩充数据后准确率{acc_aug:.3f})在这个小实验里加入扰动后的训练数据让分类器对轻微形变更鲁棒测试准确率通常会明显提升。注意我们并不是增加了“真实观测”而是让模型在已有分布附近做了合理的虚拟推演。这就是“不依赖更多现实数据”的落地形态之一。4.4 这个小实验说明了什么真实项目里小样本分类、罕见场景检测、机器人抓取策略训练都会面临同样的数据稀缺问题。数据增强、生成式数据、仿真环境的作用不是代替真实世界反馈而是让模型先利用已有知识做合理外推把可能遇到的边界情况先在“想象空间”里过一遍。李飞飞在访谈里提到的点放到工程视角看本质上就是提醒我们把学习算法设计得更具主动性和结构性它才能更高效地利用有限真实数据。5. 对普通开发者的启示别再盲目迷信“数据多就赢”李飞飞访谈的讨论在我们实际做 AI 工程时至少可以带来四个层面的启发。5.1 数据数量不是唯一杠杆过去做模型遇到效果不好第一反应是加数据。加真实数据成本高、周期长、隐私风险大加网络爬取数据又容易引入噪声和偏见。如果能像人类一样在模型内部产生有效经验那么小数据集也有机会训练出高泛化模型。具体到项目里可以先盘点现有数据中有多少高质量样本有多少边界案例。优先做精细清洗和结构化标注再考虑用增强、生成或仿真手段把样本空间撑大。一味追求数据总量的增长边际收益会越来越低。5.2 结构化先验能极大地减少数据依赖人类之所以不用看几万个三角形才知道三角形有“三条边、三个顶点”是因为大脑中已经存在几何和空间关系的基本概念。AI 模型同样可以借助这种先验。比如目标检测模型里锚框、NMS 非极大值抑制、Transformer 对位置编码的建模都相当于把空间结构先验注入模型。在三维视觉里相机内参、深度估计、点云配准本质上也是用几何关系约束网络输出。当模型有了这些约束它就不再需要对每一种可能场景都重新学习数据需求自然下降。5.3 用模拟环境低成本生成经验如果你正在做机器人、自动驾驶、物理仿真相关的项目强烈建议评估模拟器是否可用。工作流一般是先在真实场景录制少量数据建立仿真场景用强化学习或自监督学习在仿真环境里大量试错然后再迁移回真实环境。这样做的好处是仿真环境可以看到现实中极少发生的危险场景比如车辆失控、机械臂碰撞、极端天气。如果项目没有现成的物理仿真器也可以用 3D 渲染生成图像数据、用大模型生成文本变体这些都能在一定程度上补足真实数据覆盖不足的问题。5.4 评估模型时关注“分布外泛化”传统评估方式是在测试集上算准确率但测试集往往和训练集来自同一分布。当一个模型只能记住训练数据分布它的“高准确率”在真实场景里很容易垮掉。我们要学着在训练时把部分数据和真实环境差异明显的场景加入评估观察模型在没有见过类似数据时的表现。这更接近人类学习中被测试“灵活运用”的状态。6. 关于“人类不靠现实数据学习”的几个常见误解访谈观点传播开后评论区经常出现一些极端化的解读。这里用表格梳理几个常见误解和相对客观的理解。误解相对客观的理解“李飞飞说数据无用”她强调的是人类不完全依赖被动接受的现实数据但真实经验仍然是学习起点AI 也一样真实数据很重要但不能只靠堆数据。“以后不用采集真实数据了”真实数据依然是验证和校准的基准合成数据和想象能力只是提高效率无法完全替代真实世界反馈。“大模型不需要预训练数据了”当前所有世界模型、强化学习方法仍然需要一定规模的初始数据和环境规则只是后续可以自我推演。“空间智能只和机器人相关”空间智能也影响视频理解、AR/VR、自动驾驶、医疗影像等多领域本质是让 AI 从平面理解走向三维交互理解。“人脑没有先验全靠学习”人类学习依赖长期演化形成的结构先验AI 也可以借鉴这种思路把物理规律、几何约束内置到模型中。这些误解的根源是把“不完全依赖”听成了“完全不需要”。真实的科研和工程里现实数据仍然是稀缺且高价值的原料只不过我们需要配套一个更聪明、更主动的学习引擎。7. 给 AI 工程师的落地建议7.1 从项目维度可以按以下步骤优化第一步梳理当前模型最大的泛化瓶颈是“数据量不足”还是“标注噪声高”。如果是质量差优先清洗和重标注如果是覆盖不足再考虑扩充或生成。第二步评估可用的仿真资源。游戏引擎、物理引擎、合成渲染器、大模型生成接口都可以作为经验生成器。第三步把数据增强和生成纳入训练流程。在文本任务中可以用回译、同义词替换、模板改写在视觉任务中可以用随机裁剪、颜色抖动、Mixup、Cutout 等在强化学习任务中可以直接对状态空间加扰动。第四步引入小规模世界模型。先把当前环境的状态转移规律学出来再用模型做规划相当于给模型装了一个“预习模块”。第五步在日常实验中加入分布外测试集持续观察模型泛化能力的变化。7.2 从思维维度调整团队认知团队里很容易形成“数据多就是好”“模型大就是强”的惯性。李飞飞这次访谈带来的真正价值是提醒我们重新思考学习系统的设计现实数据只是面粉面粉能做出什么还要看是否有水、酵母和揉面工艺。如果把团队精力全部放在收集更多面粉上却忽略对学习机制的打磨长期来看会越来越被动。反过来一个带有空间推理、因果建模和想象能力的学习系统即使只有少量真实数据也能高效适应新环境。7.3 从学习路线维度往哪个方向深挖如果你对这个话题感兴趣以下几个方向非常值得投入世界模型比如学习环境动态、预测下一帧、做隐空间规划具身智能比如让模型通过相机输入预测动作、训练机器人抓取仿真到真实的迁移比如 domain randomization、domain adaptation自我博弈和课程学习让模型在虚拟环境里由易到难地生成经验空间智能比如单目深度估计、三维重建、动态场景理解。这些方向目前都还在快速演进没有哪一个是“最终的正确答案”。但对工程师来说只要能从中提炼出更高效的数据利用方式就能在实际业务中产生明显的价值。8. 一句值得记下来的话李飞飞访谈让我最触动的一点不是“现实数据不好”而是“人类大脑很擅长在现实经验之上建立巨大的想象空间”。AI 下一步的发展大概率也会沿着这条路走不只是拥有更大的数据集更关键的是拥有更强的先验、生成和推理能力在数据的缝隙中自己长出规律。如果你正在为小数据场景发愁不妨先停下来想一想你能不能让模型在没有真实样本的地方依靠已有的规则和结构先推演一遍如果能做到这一点那么你的模型离“像人一样学习”就不再遥远。希望这篇技术解读能给你带来一些不一样的思考。如果对世界模型、空间智能或具身智能的落地实现感兴趣也可以继续关注这个方向的新进展自己动手做几次模拟实验远胜过只看结论。