
一场时长八十分钟的拳击式辩论, 联合发明人亲自登场为自身作品辩解, 对面三位挑战者直接指出五大关键问题。这是人工智能架构在过去十年间最为激烈的一次正面碰撞。统治人工智能黄金十年的架构, 其基础是否已然松动了呢?凭什么统治AI这么久长上下文、记忆、推理这些短板新架构真能突破吗称作「后」的这个, 究竟是那种更强的记忆机制, 还是更高效的序列建模, 又或者说从训练直至系统都要更换一套。5月5日旧金山搞了场拳击擂台式的辩论赛。这不是比喻是真擂台。一边是身为共同发明人叫做Łukasz的, 另一边是倡导主张「后时代」的新架构派系的。留意一个细微之处: 身为注意力机制的两位共同发明者, 属于“八子”当中的一员, 坐到了对立的那一面。话题就一个下一代AI架构到底长什么样。现场坐满了研究者, 以及创业者, 还有投资人。输赢并非依靠投票, 而是靠一种东西, 那就是称作拍手计分器的玩意儿, 谁的掌声响亮谁就能赢。这是一场刀刀见红、指名道姓的硬碰硬。裁判宣布比赛开始之时, 统治全球AI架构将近十年的那个神话, 首次被其缔造者亲自拽上被告席, 去进行自卫性质的辩护。这场思想界的重量级对决从的五大死穴开始。苦久矣五大死穴Łukasz 的身份让这场辩论的分量直接拉满。他是的联合发明人。作为2017年那篇对整个AI格局产生改变作用的论文「Is All You Need」的作者之一, 之后他投身于GPT系列以及o1的实际工程开发工作之中。他是当事人。他今天坐在这里是为自己的作品做辩护。对面的三位挑战者来头同样不小。, Llion Jones, 存在着的, 另一位身为联合发明人的个体, 是AI联合创始人之一。首席科学官BDH架构的发明人。 AI首席技术官MIT液态神经网络的共同发明人。这本身就是, 在技术史上, 极其罕见的画面。创造同一个东西的人, 对于它的未来, 产生了根本性分歧。开场用了一个类比。他说的注意力机制就像图书管理员的卡片索引系统。你步入图书馆里面, 讲出你寻觅的内容, 管理员翻阅卡片目录, 寻得对应的书架位置, 将书拿出来递给你。简洁。高效。全局检索。可是挑战者们会进行询问的, 那便是: 假定这个图书馆存有一亿册书籍, 那情况会怎样呢? 每次开展查询的时候, 都需要将全部卡片逐一翻阅查看, 在这种状况下, 这个系统还能够承受得住吗?这就是O(n²)悬在头上的达摩克利斯之剑。三位挑战者, 并未一概而论地讲「不行了」, 他们剖析出了五个具体的, 当下架构于设计层面难以解决的开放难题。每一个都直指要害。那些挑战者们所拥有的最为尖锐的隐喻, 其直接指向的是记忆方面以及持续学习存在的缺陷, 名为「土拨鼠之日」。于电影《土拨鼠之日》里, 主角每日醒来, 世界开展重置, 昨天的记忆全然消失不见。目前也是如此。每一次推理 Pass它的权重都是完全冻结的。纵然你就在今天给它聊扯了长达十个小时之久, 它获取到了堪称绝妙无比的全新知识, 然而待下一回会话开始启动之际, 它依旧还是一个已然失忆的白痴呐。此时此刻, 在工业领域其中, 为了将这个问题予以应对解决, 人们不顾一切地使劲往里面塞RAG, 也就是检索增强生成, 还塞进长上下文, 即是KV Cache。然而, 这压根就不是针对架构层面的解决办法, 反而是借助价格高昂的算力, 往伤口处去粘贴创可贴。五大死穴, 其中任意一个单独抽取出来, 都绝非是一件微小轻而易举之事的, 汇集汇总成为全部放在一起, 从而塑造构成了一张完整毫无缺漏的起诉书的。但起诉书不等于判决书。的底牌你行你上拿曲线说话面对五大攻击没有一一辩驳。他没有表明O(n²)并非是个问题, 没有提及灾难性遗忘并不存在, 也没有表示完美无缺。他抛出了一句话成了整场辩论的核心除非Post-证明更好的曲线否则仍然是主流。这句话的杀伤力在于它把举证责任推回了挑战者。什么是曲线简单说就是「投入更多算力和数据AI能力提升多少」。其统治时长将近十年 的 最关键原因 并非因为它不存在缺陷 而是它那种曲线一直到现时当前都从未被任何一种架构超越过。这是敢砸几十亿美元训练GPT、持续扩大规模的底气。的逻辑极其清晰你说有五个问题我同意。却存在状况的事物与理应被更替的事物之间, 有着一道间距。跨越该间距, 你所需要的并非五篇论文, 而是一条更优的曲线。然后他展开了更具体的辩护而且带着工程现场的铁锈味。并行性是硬道理。于上周, 在新近的硬件之上, 再度实现了若干老式RNN, 且实施了对比。非常小的GRU比一个大得多的还要慢50倍。循环神经网络确实有着一种优美之感, 但它那顺序执行的特性, 于当下的硬件而言, 简直就是一场可谓是毁灭性的灾难呀。要是真的有某一种更为优良的架构存在, 你得花费五十倍的时长去证实它, 然而大多数的实验室是不会有这个耐烦心的。十年的工程积累。GPU优化并非唯一重点, 编译器、训练框架、以 及如 JAX 这般的特定框架、推理引擎、像 vllm、 -LLM 这样的不同引擎、又或量化工具等, 整个 AI 工程 栈都围绕着精心搭建而展开。换架构意味着这一切都要重来。隐式的「持续学习」早已发生。强调, 于大规模预训练完毕之后, 在前向传播过程里所展现出来的上下文学习, 也就是所谓的In - , 在数学层面实际上是极为完美地模拟了反向传播之中的梯度下降。换句话说你们说它不会学它其实在以另一种方式偷偷地学。不是他的辩护呈现为「永远是最优解」这样的状况, 而是呈现出「现在是最优解, 除非你能够证明并非如此」这般的情形。然后他甩出一句让对面哑口无言的话也许找到下一个架构的恰恰会是本身——而不是你们。全场笑声。但大家都听出来了这是认真的。AI无人可挡的光明未来那场结束陈词, 并未提及所谓的「永远是最优解」, 他所表达的是, 「当下的状况, 依旧处于获胜态势。」。「目前」这个词是他留给挑战者的唯一缝隙。更微妙的是他亲手交出了一件本属于自己阵营的武器。后阵营先前最为突出的不足, 乃是「欠缺具备强大算力的工程以及硬件验证」——全新的架构运行速度迟缓之人并没有乐意去为之改建芯片, 不过却自我认可道, 此番障碍正处于被破除的状态:当下, AI Agent已然掌握了撰写具备极高难度的CUDA的能力, 同时也学会了编写核函数。哪怕一个全新的架构, 一开始运行的时候比正常速度慢五十倍, 但是你只需把代码交给Agent, 它就能够在短的时间之内, 帮你做出优化, 得到那种几乎可以将GPU算力充分利用的专用内核。硬件彩票的壁垒正在被智能体开发生态自己砸碎。这有着重大意味, 一旦存在这样情况, 即某人于百万Token、千万Token的那种极长上下文任务之中, 运用Post - 架构去跑出一条更加漂亮的困惑度曲线, 哪怕仅仅只有那么一点点优势, 会在放大镜的观察情境之下, 形成朝着旧日帝国予以致命打击的这么一种结果。甚至主动提出建议, 这个建议是, 应当构建一个统一的测试标准, 该标准是以困惑度来衡量所有架构在相同条件之下的学习能力。我们理应于这件事情之上达成一致的看法, 而后各自去证实自身的架构更为优良。这句话的潜台词是挑战赛正式开始。而Jones的最后一句话更直接于今日而言, 我并未获取到任何这般的缘由, 使之能够促使我去质疑自身所秉持的那种信念, 即为有更加优良的事物存在着。当那突破性的情形降临之际, 我们所有的人都会迈入到那个后续的时代当中, Łukasz同样也不会是例外的状况——这是由于在那个时候他根本就没有别的选择余地了。这场名为“拳击赛”的较量, 表面上看似带有戏谑意味, 然而, 它的最终胜负状况, 却直接对硅谷双雄的底层根基有着决定作用, 即是否需要将其全部推倒并重新建造, 是这样的情况。要是处于后续阶段Post-的阵营居然有着更为优等的Law缩放定律曲线的话, 那么整个关于人类进而通向AGI的物理路线图的情况, 就都会被改写了。参考资料