ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

美国播客邀前沿AI研究者探讨:递归自我改进技术瓶颈与前景几何?

2026/9/14 22:04:42 拓冰建站 浏览量
美国播客邀前沿AI研究者探讨:递归自我改进技术瓶颈与前景几何? 关于RSI的分歧与共识美国知名播客主持人德瓦杰什·帕特尔邀请三位前沿AI公司研究者围绕AI递归自我改进RSI的技术瓶颈与前景展开讨论。三位嘉宾分别是开源AI公司Zyphra首席技术官贝伦·米利奇、Thinking Machines首席科学家约翰·舒尔曼、模型训练平台Baseten模型训练负责人查理·奥尼尔。关于RSI是否会到来他们存在分歧但有基本共识当前技术路径有多个未解决瓶颈RSI不会迅速发生。米利奇认为阻碍可能来自监管舒尔曼指出模型“品味”和长期判断能力弱于人类奥尼尔认为关键在于AI能否自主设定研究目标。中国实验室追赶因素分析关于中国实验室的追赶讨论指向几个结构性因素蒸馏只需少量轨迹就能复制能力是对抗中心化的主要力量前沿实验室从大型数据公司购买数据中国公司也能买到同样的数据真实世界的用户分布比RL环境本身更重要前沿实验室在RL环境上的优势可能没那么大。强化学习有效性探讨关于强化学习RL的有效性米利奇指出大量被归因于RL的成功实际来自中间训练RL本身只是策略微调但其信噪比远高于监督微调SFT。奥尼尔则发现RL带来的主要泛化是时间跨度上的模型学会了在更长的任务上持续工作。时间线判断差异关于时间线嘉宾们判断差异显著AI成为全面远程工作者需一到三年对AI研究者的10倍生产力提升需两年左右AI在所有领域超越顶级人类专家需三到十年。访谈实录内容以下是访谈实录经编辑整理内容。2036年若无超级智能最可能卡在哪帕特尔询问若2036年无数十亿个超级智能最可能的技术原因。米利奇提出类“莫拉维克悖论”可能性认为更可能的阻碍来自监管舒尔曼指出新模型使用一段时间后会暴露弱点奥尼尔认为当前Transformer RL方案离全局最优解的距离是关键突破可能难以发现。帕特尔提出反面观点瑞安·格林布拉特认为AI若能模拟提升研发能力可能很快跨过人类研究水平。米利奇同意认为AI未跨过去可能是能力瓶颈或监管原因。奥尼尔指出科研分两类提出全新问题和范式的研究是AI难突破的地方。帕特尔询问人类在AI研发中最后被自动化的环节米利奇认为是迭代问对问题奥尼尔强调选对方向的重要性舒尔曼表示定义目标短期内不会被自动化。中国实验室为什么追得这么快帕特尔询问模型提供商未大幅整合的原因。舒尔曼认为蒸馏是对抗集中化的主要力量还提到中国公司可能使用代理服务收集和出售数据。米利奇指出中国公司能买到与前沿实验室相同的数据跟进较容易。奥尼尔通过模型对比说明真实世界用户分布比RL环境更重要。帕特尔询问真实世界部署是否更重要舒尔曼提出环境有难度和真实性两个维度蒸馏在不同分布上进行效果不同。训练AI研究员到底在训练什么帕特尔询问第一个能自动化AI研发的模型的训练方式。舒尔曼认为是从人类反馈中学习品味和创建练习环境的组合。奥尼尔介绍目前实际操作是将公司训练栈的bug变成环境本质是蒸馏。米利奇指出环境可超越人类能力是超越人类AI研究的路径。舒尔曼说明很多研究是先在不真实场景找方法再回到真实性。长时程RL会引出AGI吗帕特尔询问实验室扩展RL训练能否让AI成为“远程员工”及模拟环境学习是否足够。奥尼尔认为难以判断是为了RSI还是打造通用模型。帕特尔询问模型擅长上下文学习为何还需领域训练舒尔曼表示领域训练可提高效率米利奇认为两者可同时进行。帕特尔指出任务时间跨度长难模拟奥尼尔将任务分为累积型和非平稳型说明RSI和真实世界工作的不同。帕特尔感慨RSI比律师助理容易舒尔曼分析模型弱点来源。帕特尔询问给模型万亿token上下文窗口能否解决品味问题米利奇理论上认为可行奥尼尔指出持续学习的技术困境米利奇认为需从头训练新模型。帕特尔询问AI能自动化实验执行但需人决定实验是否算RSI米利奇认为这是关键问题奥尼尔区分两类研究舒尔曼分享OpenAI早期对目标函数的认知。数据vs架构进步的驱动力到底是什么帕特尔介绍实验结果数据解释约12倍计算效率提升架构改进解释约3.7倍。奥尼尔认为低垂果实已摘完Epoch估计的改进有缺口可看出后训练的贡献。米利奇认为大规模训练中数据更重要架构是一次性突破。帕特尔询问2030年前沿模型活跃参数奥尼尔认为未来几年不会大幅增长舒尔曼预计模型会继续变大数据效率将更重要。RL为什么比想象中更有效帕特尔询问一年前认为RL无法扩展现在模型却有变化的原因。米利奇指出RL成功的因素包括中间训练的贡献、高信噪比和对函数空间的影响。奥尼尔说明RL未实现横向泛化但有时间跨度上的泛化和相变现象。Move 37与单文化隐忧帕特尔询问RL在LLM上能否产生类似AlphaGo第37手的突破。米利奇认为RL不一定降低创造力熵坍缩可能是环境和验证器问题。舒尔曼指出创造力分解决高难度搜索问题和输出多样性担心蒸馏带来“单一文化”。时间线预测帕特尔询问AI成为远程工作者、让研究者实现10倍生产力提升、在所有可电脑完成工作中超过顶级人类专家的时间。奥尼尔、米利奇、舒尔曼分别给出不同预测。