Google被曝正在研发一颗新的服务器AI芯片,把Gemini固化到硬件里 刚刚The Information报道Google正在搞一颗代号「Frozen v2」的服务器芯片打算把Gemini的部分架构直接固化进硬件里。据知情人士的说法这颗芯片每瓦功耗能输出的Token数可能达到Google现有自研AI芯片的6到10倍最快将于2028年部署。模型要被做成芯片了。等等模型是软件啊软件怎么能「焊」进芯片赌赢了Gemini的推理成本倒是是真有可能降一个数量级但要赌输了模型一换骨架这芯片就变成技术包袱了。而且Gemini 3.5都还在难产现在就敢把架构焊起来下一代模型长得不一样怎么办。。今天咱们就把这事从头到尾捋清楚。◈一、「焊进芯片」焊的到底是什么先解决第一个问题:软件怎么变成硬件?一个大模型拆开有两样核心的东西——「权重」:几千亿个参数决定模型知道什么「架构」:多少层、每层什么算子、数据按什么顺序流过哪些计算单元决定模型怎么算。按照目前披露的方案Frozen v2想固化的是Gemini中相对稳定、反复执行的计算路径。权重依然可以更新模型也能继续训练但「怎么算」这条主干会被更深地写进电路。通用芯片必须服务不同模型和任务因此要保留足够的灵活性。每次运行时编译器和芯片都要处理调度、数据搬运、缓存分配等一系列问题。Frozen v2则更专业化。Gemini怎么算、怎么搬出厂前就定死在电路里了。具体主要省在这三个地方少调度。专用芯片把固定流程直接做成电路省掉大量指令解析和调度开销。少搬运。计算路径固定后缓存、带宽和数据流都能围着Gemini重新设计让数据尽量少绕路。敢压精度。通用芯片得给各种模型留余地专用芯片可以针对Gemini常用的算子和数值格式做激进优化用更低精度换更高吞吐。这套思路其实是Google的祖传手艺。2015年初代TPU干的就是这事——把CPU、GPU里AI用不上的通用功能全删了芯片面积全让给矩阵运算由此换来了几十倍的能效提升。十年过去Google准备把专用化再往前推一步GPU保留较强的通用性能够运行各种并行计算任务TPU把重点收窄到AI常用的矩阵运算Frozen v2准备删掉「兼容各种模型架构」这个包袱。每收窄一层芯片都会少做一些无用功代价则是少兼容一些变化。效率越高回头的余地越小。方向已经很清楚了打造一颗专门伺候Gemini的芯片。◈二、尴尬的是Gemini自己还在难产把一个模型的骨架焊进硅片潜台词是我对这个模型有绝对的信心。但就在这颗芯片曝光的几天前Gemini 3.5 Pro才刚刚延期。这个新模型在Google内部有个代号叫「Cappuccino」。5月的I/O大会上Google说6月上线。6月过去了没上线。前几天圈子里一度传它会在7月17日发布结果等来的是——延期数月。原因是编码能力没达到内部标准。Google虽然紧急更新了一波训练数据想抢救模型但结果用彭博社的转述说——「令人失望」。消息一出Alphabet股价当天就跌超4%。有前员工形容Google的跨部门协调「就像试图煮沸整个大海」。更扎心的是——因为GPU容量不够Google自己的工程师经常用不上自家的AI编码工具。这个手握自研TPU、今年资本开支奔着1900亿美元去的Google自己人也被算力卡脖子。缺便宜的算力缺到这个份上你就明白它为什么盯上了「焊芯片」这条最极端的省电路线。但省电归省电矛盾还是那个矛盾:芯片最早2028年部署。如果那之前Gemini只是换权重、扩规模它仍然能继续跑但如果底层计算方式变了今天换来的高能效明天就可能变成死胡同。说来也巧这对矛盾Google自己用代号写得明明白白Cappuccino还在萃取Frozen准备冷冻。起名的人可能比谁都懂Google现在的处境。◈三、Google在赌大模型的架构正在收敛。一杯咖啡还没萃出来怎么就敢冷冻因为在Google眼里赔率已经变了。最近几轮旗舰模型的更新其实都没有早期那种肉眼可见的能力飞跃了——沃顿商学院的教授管这叫「下一代巨模型失望陷阱」堆数据堆算力换能力跃升的老路收益肉眼可见地递减发布会越开越像挤牙膏。对模型公司这是坏消息。但对芯片设计师这是好事儿。正因为架构不再月月大改「把骨架焊死」才第一次从疯狂变成可行。几年前把“模型骨架五年不变”写进芯片几乎等于押注技术停止进化。今天这仍是一场豪赌只是Google判断赔率已经变了模型能力会继续迭代但底层计算形态未必还会频繁翻修。而3.5的难产恰恰给这个判断做了注脚。连Google自己都很难再让模型发生「长相级」的变化了。当然赌就是赌。万一范式转移真来了——全新的注意力结构、新的记忆机制、甚至非Transformer的形态——Frozen v2的高效率一夜之间就会变成技术包袱。Google等于把2028年之后的筹码现在就押上了桌。◈四、硬件彩票这次反过来抽了最后把镜头拉远。这事的影响不止Google一家。2020年Sara Hooker写过一篇论文:《The Hardware Lottery》硬件彩票。她的观点是AI历史上胜出的研究方向往往不是因为思想最好而是因为恰好适配了当时的硬件。深度学习本身就是最大的中奖者——神经网络的思想在上世纪就有了苦等几十年直到撞上GPU这张彩票才翻了身。过去是硬件在开奖模型来抽签。现在这台彩票机被反过来了:芯片开始只认某一个模型的骨架。而且不止Google在干——创业公司Etched把Transformer的运算模式固化进芯片其他架构一概不跑更极端的Taalas连模型权重都直接做进硅片一颗芯片就是一个模型官网口号干脆叫The Model is the Computer。微软Maia、亚马逊Trainium、Meta的MTIA他们虽然没走这么极端但方向也都一致芯片要为自家负载定制越来越不通用。币圈已经把这条路走过一遍。比特币挖矿从CPU走向GPU再走向ASIC矿机。专用化每前进一步效率都会大幅上升但单颗芯片能做的事情也越来越少。如果AI芯片也走上这条单行道真正的问题就来了——五年后当全世界的数据中心里插满了只认Transformer、甚至只认Gemini骨架的芯片。但前沿研究和新架构仍然需要灵活的硬件。但当更多资金、电力和先进产能被分配给已经验证过的模型路线新想法拿到第一批算力的成本会越来越高。五年后如果全世界的数据中心里插满了优先服务Transformer甚至只为特定模型优化的芯片。那个可能颠覆Transformer的新架构要先跑在什么机器上它的「GPU时刻」又由谁提供