
上个月我在整理一次行业分享的PPT时突然意识到一个很有意思的信号OpenAI 和 Anthropic 对外发布的内容重心正悄悄从模型评测和榜单转向算力基础设施与芯片合作的消息。过去一年还在“GPT 还是 Claude 谁更强”的口水仗里打转的两家公司不约而同地把手伸向了 AI 硬件——准确说是在争夺 AI 硬件的“定义权”。这个定义权不是谁家芯片跑分高那么简单。它关系到下一代模型能长多大、推理成本能降到多低、终端设备上能不能跑得动本地 AI、甚至开发者每个月要为大模型 API 付多少钱。作为一个每天要调 API、关注模型选型的从业者我觉得这场硬件战争比模型参数竞赛更值得关注因为它会实实在在改变你我的技术选型和成本结构。这篇文章会把两家公司的硬件布局、背后逻辑以及对开发者和企业的影响拆开讲清楚。1. 从模型竞赛到硬件竞赛换轨的真实原因1.1 模型能力的“卷”正在撞上边际效益递减过去两年多OpenAI 和 Anthropic 的竞争主战场一直在模型层。GPT-4 的多模态能力、Claude 3 的超长上下文、o1 的推理范式、Claude 4 的智能体能力……每隔几个月就有一轮“最强模型”头衔的交替。但从 2025 年上半年开始一个明显的信号出现了模型竞赛的边际效益在递减。不是说模型不再进步而是说在都达到“顶尖水平”的前提下用户和企业的选择标准变了。我接触过不少技术负责人选型时的核心问题已经从“谁能写诗写得好”变成“谁能把成本降下来”“谁的 API 更稳定”“谁的延迟更低”。这些问题的答案很大程度上取决于后端硬件而不是模型参数。换句话说大家默认模型能力已经够用接下来的差距在成本和效率上。这个转变对 AI 公司的战略影响是巨大的。过去你只要砸钱堆参数、堆数据就能在评测榜单上拿第一现在你必须在物理世界里把每一瓦电、每一块芯片的效率压榨到极致。这已经不是纯软件问题而是从芯片设计到数据中心运营的全栈问题。1.2 推理算力需求暴涨硬件成为真正的瓶颈从技术路线看推理模型是这轮硬件竞赛的直接催化剂。OpenAI 的 o 系列推理模型和 Anthropic 的 Claude 3.7 系列都引入了“思考时间”的概念——模型在给出最终答案之前会先生成数千甚至数万个内部推理 Token 来“想清楚”再回答。这个机制对推理算力的消耗是传统模型一次性输出的几十倍。我用一个具体的数字来说明一次包含 2 万内部思考 Token 的 o1 推理请求实际消耗的算力大约相当于传统 GPT-4o 请求的 15 到 30 倍。如果把这个比例放大到全球企业每天的 API 调用量推理算力的需求可以说是指数级增长。这就带来一个很直白的数学问题同样一次 API 调用算力消耗变成原来的 20 倍API 定价要么大涨要么倒逼硬件效率提升 20 倍。市场显然选择了后者——各家都在拼命优化推理硬件。这也是 OpenAI 和 Anthropic 不约而同开始定制芯片的根本原因。他们比的不是谁家 GPU 多而是谁能用最低的硬件成本跑出最高质量回答。1.3 英伟达的“一家独大”让所有 AI 公司不安换轨的另一个推手是供应链风险。过去两年 H100、A100 一片难求让所有依赖英伟达的 AI 公司都感受到了命运被捏在别人手里的滋味。英伟达数据中心业务的毛利率长期保持在 70% 以上这意味着 AI 公司每赚 1 美元就有相当比例变成英伟达的利润。对 OpenAI 和 Anthropic 这种头部公司来说这绝对不能接受。它们的应对策略很清晰要么推高融资规模去抢购 GPU要么自己动手重新定义硬件。于是我们看到一个趋势——越有实力的 AI 公司越不甘心只做英伟达的“下游组装厂”。自研或定制芯片本质上是在夺回对自身成本结构和产品形态的控制权。2. OpenAI 的硬件棋局定制芯片、星际之门与人才争夺2.1 与 Broadcom 合作目标明确对标 TPU 模式OpenAI 的硬件布局虽然官方披露不多但从 2024 年底开始与博通合作开发定制推理芯片的信息已经比较扎实。这款芯片据传将采用台积电先进制程专注于推理而非训练预计未来一两年内量产。为什么选博通这个细节很关键。博通不是 AI 芯片领域的新玩家Google 的 TPU 从第一代开始就是与博通深度合作的产物。博通扮演的角色更像“定制芯片架构设计服务商”不直接卖通用 GPU而是帮客户把特定工作负载的逻辑固化到芯片里。OpenAI 选择这条路说明它需要一个比通用 GPU 更高效、更贴合自己模型结构的推理加速方案。通用 GPU 要考虑所有模型的通用性很多算力被花在了与具体模型无关的灵活性上。而定制 ASIC 可以为 Transformer 架构做硬件级优化——比如把注意力机制中的矩阵运算固化到特定电路模块把 KV Cache 的内存管理做成专用逻辑。这些优化看似细微叠在一起就是数量级的推理效率提升。2.2 Stargate 项目从单点芯片到千亿美元基础设施芯片只是 OpenAI 硬件版图的一块拼图真正的重头戏是 Stargate星际之门项目。这是 OpenAI 联合软银、甲骨文等合作伙伴推进的大规模数据中心建设计划预计总投资规模达到数千亿美元规划了多个专用于大模型训练和推理的超大规模数据中心。要注意Stargate 不是简单“多买几万张 GPU”而是一个覆盖电力供应、数据中心设计、芯片部署、液冷散热、网络互联的完整基础设施计划。我之前参观过一些传统数据中心它们的架构是为云计算设计的网络拓扑、供电密度、散热能力都不适配大规模 GPU 集群。Stargate 这类项目相当于从零开始为 AI 计算重新设计一整座“算力工厂”。为什么说这也是硬件定义权因为模型的能力上限不仅取决于芯片本身还取决于芯片之间的互联带宽、内存层次、数据吞吐能力。OpenAI 通过 Stargate 掌控的是算力从物理世界到模型能力的全部转化链路。这种深度不是短期能追赶的。2.3 从 Google 和各大芯片厂挖人自研不再是传闻另一个值得关注的动向是人才。OpenAI 在 2024 到 2025 年引进了多位具备芯片设计背景的资深工程人员包括从 Google TPU 团队、苹果芯片团队和多家半导体公司挖来的核心角色。这些人的履历背后是一场围绕“硬件人才”的争夺战。我在招人时有一个体会芯片设计人才和纯软件算法工程师是两种完全不同的物种。算法工程师可以靠一个周末的重写快速迭代但芯片设计要提前 2 到 3 年做架构决策落地周期极长容错率极低。OpenAI 能在自研芯片上快速推进很大程度上依赖这些资深芯片人的经验而不是单纯靠“砸钱买卡”。Stack Overflow 上有开发者问过一个问题OpenAI 为什么要同时做模型和芯片答案其实很简单——模型迭代和芯片设计周期之间存在巨大的时间差。今天设计的芯片要等到模型已经迭代了三四代之后才能真正部署。要让芯片始终贴合最新模型架构就必须让芯片设计团队和模型算法团队在同一个组织内深度协同而不是依赖外部供应商寄过来的通用方案。3. Anthropic 的算力棋盘TPU 绑定、AWS 自研芯片与第三选择3.1 押注 Google TPU不买卡也能训练出顶级模型Anthropic 的硬件路线与 OpenAI 有所区别它的一个重要筹码是与 Google 的深度绑定。Claude 系列模型从训练到推理都大规模使用 Google 的 TPU 集群Google 在硬件和云资源上的倾斜是 Anthropic 能够以相对可控成本训练顶级模型的关键。选择 TPU 并不是一个“妥协”的决定反而有非常强的工程逻辑。TPU 的架构从一开始就是为大规模矩阵运算设计的在训练 Transformer 模型时效率极高。TPU v4 和 v5p 的集群互联技术在大规模并行训练上的表现甚至在某些场景下优于英伟达的 InfiniBand 方案。Anthropic 的做法某种程度上是在“英伟达体系”之外开出了一条真正可用的替代路线。这也让我想到一个行业现象很多创业公司在选择训练算力时默认只考虑英伟达但真正的头部实验室早就开始走多硬件路线。Anthropic 验证了“不买一张 H100 也能训练出世界顶级模型”这个命题这本身就有巨大的行业示范效应。3.2 AWS 投资与 Trainium/Inferentia 芯片的布局除了 GoogleAnthropic 还接受了亚马逊的大规模投资并承诺使用 AWS 的自研芯片——Trainium 用于训练Inferentia 用于推理。亚马逊投资 Anthropic本质上也是一场硬件生态的争夺AWS 需要一家明星模型公司来验证自己的自研芯片Anthropic 则获得了摆脱单一大客户依赖的选择空间。这意味着 Anthropic 实际上在同时使用两套非英伟达硬件体系Google 的 TPU 和 AWS 的 Trainium/Inferentia。这种“双重押注”在商业上是非常聪明的策略。它让 Anthropic 在硬件谈判中拥有巨大的议价空间——任何一家云厂商都知道如果自己提供的算力价格或性能没有竞争力Anthropic 可以把负载转移到另一家平台。我经常在技术社区里看到开发者抱怨 AWS Trainium 的生态还不够成熟SDK 和调试工具与 CUDA 相比差了一截。但作为“被生态绑定的开发者”我们可能低估了头部模型公司愿意投入多少工程资源来补齐这些短板。当一家公司每年要在云上消耗数十亿美元算力时它有极强的动力去帮芯片厂商打磨生态而这恰恰是整个行业降低对单一家族芯片依赖的关键。3.3 自研芯片的想象空间Anthropic 不想被任何协议绑死TPU 和 Trainium 之外关于 Anthropic 自研芯片的传闻一直没有断过。从招聘信息到专利申请都能看到它在硬件领域的布局迹象。对于一个志在成为下一代基础模型公司的企业来说长期把核心算力完全寄托在投资方身上显然不是最稳妥的选择。我判断 Anthropic 的自研策略会非常谨慎短期内不会有 OpenAI 与博通合作那种激进动作。更合理的路径是先在 TPU 和 Trainium 上积累硬件协同设计的经验完成下一代模型的算法与硬件适配预研等到模型架构相对稳定、研发投入有足够利润支撑之后再考虑真正的自研流片。但不管自研的节奏是快是慢Anthropic 的真实意图已经很清晰在英伟达体系之外为自己保留一条“随时可以自立门户”的硬件通道。定义权不一定是“我的芯片完全自主”也可以是“谁都不能占我的主导权”。4. 硬件定义权为什么这么重要三层逻辑拆解4.1 第一层算力成本结构决定商业生死最直接的一层是成本。AI 公司本质上是在“卖算力”——模型参数量、推理深度、上下文长度每一项背后都是实打实的硬件开销。如果两家公司的 API 定价相同而你的单次推理成本是对方的两倍那利润空间就被彻底吃掉了。我给大家算一笔大概的账假设一个标准中长文本请求在英伟达 H100 集群上的推理成本约为 0.002 美元如果换成深度定制后专门为这类请求优化的 ASIC 芯片同样的请求成本可能降到 0.0004 美元也就是五分之一。在 API 价格战打得火热的当下这种成本优势就是降价的底气。这也解释了为什么 OpenAI 在 API 价格上能够频繁调整而一些依赖租用算力的中小模型公司毫无还手之力。硬件定义权实质上是对 AI 服务报价能力的定义权。4.2 第二层模型架构的自由度来自硬件自主第二层很多人容易忽略硬件决定模型架构的可选空间。芯片的内存容量和带宽决定了模型的上下文窗口能做到多大算力单元的设计决定了模型能不能高效使用稀疏注意力、条件计算等新架构。举例来说如果你想开发一个拥有 500 万 Token 上下文窗口的模型你需要的不是更大的存储而是巨大的 KV Cache 相关内存带宽。通用 GPU 在设计时不会为这种极端场景做专门优化但定制硬件就可以。这不仅意味着能力上限不同更意味着“哪些研究方向值得投入”的战略自由度不同。在自有硬件平台上的团队可以大胆尝试革命性架构依赖外部硬件的团队只能被动适配通用平台的“舒适区”这在一两年的竞争里也许看不出来但在三到五年的维度上是决定性的。4.3 第三层端侧 AI 的入口之争第三层是关于终端的。AI 硬件不只是数据中心里的芯片还包括手机、PC、汽车、智能家居等端侧设备。OpenAI 一直想推自己的端侧 AI 设备同时和苹果等厂商谈判深度集成Anthropic 也在探索大模型在端侧的部署方案。端侧硬件的真正瓶颈不是算力够不够而是如何在极低功耗、极小体积下跑出可用的大模型。谁能定义端侧 AI 芯片的规格谁就能在“本地优先的智能体验”时代占据主动权。从这个角度看硬件定义权之争是对未来 AI 入口的提前占领。这场战争的结果会直接决定我们在五年后是用语音助手、智能眼镜还是某种现在还想象不到的硬件形态与 AI 交互。5. 对开发者与企业用户的实际影响我的几点判断5.1 API 定价的下行空间比想象中更大如果你像我一样每天都在调大模型 API这两个公司的硬件争夺战对你最直接的影响是价格。过去一年无论是 OpenAI 还是 AnthropicAPI 价格都在经历一轮又一轮的下调。这里既有市场竞争的因素但更核心的推动力是硬件效率的提升。我的建议是企业在做预算和产品规划时不要仅仅基于当前 API 价格做成本模型一定要考虑到未来 18 到 24 个月的降价趋势。现在定了三年的价格模型两年后可能预算表上的支出会砍半。这是一种“规划冗余”对商业决策很重要。5.2 端侧 AI 部署会迎来真正的机会对做端侧 AI 方案的团队来说这场硬件争夺战是重大利好。随着头部模型公司对特定量级的端侧推理硬件进行定制优化算力门槛会大幅下降。早期我做端侧部署时在手机芯片上跑一个像样的 70 亿参数模型基本要经过各种量化、剪枝、蒸馏最后效果还差强人意。但如果头部模型的推理引擎能被针对主流端侧芯片做底层适配端侧 AI 的体验将有质的飞跃。对于重视隐私、需要离线能力、关注单次调用成本的业务场景我建议大家密切关注端侧模型的推理能力和成本平衡。未来两年可能会迎来端侧 AI 真正落地的窗口期。5.3 选型时的三个观察指标最后给开发者和技术决策者一些实操建议。既然 OpenAI 和 Anthropic 都在争夺硬件定义权那我们在做技术选型和供应商评估时应该重点观察什么我把自己的考察维度和优先级整理成了一张表观察指标关注点为什么重要算力自研程度供应商是否有自研/定制芯片并大规模部署决定未来成本下降空间多硬件冗余能力是否依赖单一 GPU 供应商决定供应链抗风险能力生态兼容性API 是否方便切换是否有闭源锁定风险决定你的迁移成本和谈判空间这三个指标背后是一个核心判断不要只看“谁家模型跑分高”更要看“谁家的成本结构能在未来持续支撑低价高质量的服务”。一家拥有可持续成本优势的 AI 公司才能成为你业务的长久伙伴。5.4 基础设施稳定性正在从“已知风险”变成“被优化对象”另外很多开发者在实际工作中遇到过的连接问题、响应延迟波动也值得重新审视。我自己就曾遇到过类似的情况排查到最后发现是模型服务商在算力调度高峰期出现的暂时性拥堵。这类问题的背后往往与 AI 公司的基础设施规模、算力调度策略和硬件冗余度直接相关。虽然在博文里不便展开具体报错细节但我想提醒大家当一家公司在硬件基础设施上投入越大、算力储备越充足这类稳定性问题的发生频率和恢复速度往往会更有保障。因此“基础设施的稳健度”也应纳入供应商综合评估而不只是在 geming 文档里查看 SLA 数字。6. 写在最后的个人体会这几年我最大的感受是AI 行业的竞争正在从“写代码的人”之间的竞争变成“造芯片的人”和“建数据中心的人”之间的竞争。OpenAI 和 Anthropic 在争夺的不只是模型排行榜的第一名而是定义 AI 硬件规格、成本和产品边界的能力。这个过程对从业者提出了一些新的要求。过去我们只需要关注模型能力现在还要去理解芯片架构、算力调度和数据中心设计这些“看着很远”的东西。但反过来这也意味着 AI 工程师的职业边界在变宽懂硬件、懂推理部署、懂算力成本的复合型人才在未来几年会越来越值钱。关于这场定义权争夺我的判断是短期内英伟达仍然会占据主导位置因为无论是定制芯片还是云厂商自研方案都还需要时间验证和迭代。但长期来看一家 AI 公司的护城河将越来越多地取决于它对硬件的控制能力。作为技术人我们最好的应对方式是保持对新架构、新硬件、新部署方式的敏感度——因为下一次技术浪潮可能就藏在“谁在定义硬件”的这个答案里。