ARTICLE DETAIL

建站实战干货

来自一线的建站与推广经验沉淀,每一条都经过真实交付验证。

从3nm制程到推理专用芯片,OpenAI自研ASIC如何影响AI算力格局

2026/8/29 4:37:56 拓冰建站 浏览量
从3nm制程到推理专用芯片,OpenAI自研ASIC如何影响AI算力格局 今年以来AI Infra 领域最受关注的新闻之一就是 OpenAI 被曝在 9 个月左右时间里完成了一颗 3nm 自研推理芯片的设计代号 Jalapeño。根据公开报道这颗芯片在推理场景的表现被认为接近甚至优于英伟达 Blackwell消息一出立刻在 AI 工程师和基础设施团队中引发讨论。这不是一篇“跑分报告”也不打算对未公开的产品细节做无根据的猜测。本文会从 AI 芯片的底层概念出发把制程工艺、训练与推理芯片的差异、代工关系、对比维度、对开发者的实际影响讲清楚。对于做大模型应用、Agent 系统、RAG 服务、模型部署的开发者来说理解这类芯片的出现有助于判断未来一段时间的推理成本走向也能帮你重新审视自己的算力层选型和成本优化策略。1. 背景为什么大模型厂商开始自研芯片1.1 从“买卡”到“造芯”的转变在过去两年里训练和运行大模型的主要算力来源是英伟达的数据中心 GPU。无论是 GPT 系列、Llama 系列还是各类开源模型训练阶段几乎都依赖 CUDA 生态下的 GPU 集群。但这里有一个很现实的问题算力成本太高。大模型公司每年在算力上的投入是惊人的。当模型规模进入千亿甚至万亿参数级别训练一次的成本可以达到数百万美元级别。这还只是训练真正持续烧钱的是推理——也就是你每次调用 API、每次和聊天机器人对话时后端执行的实时计算。推理是持续发生的只要服务在线推理开销就无法停止。业务规模越大推理成本越不可控。对于 OpenAI 这类以 API 服务为核心收入的公司来说推理成本直接决定毛利率所以它必须找到更经济的计算方案。自研芯片不是新鲜事。谷歌早在 2015 年前后就开始做 TPU亚马逊有 InferentiaMeta 也在推进自研推理芯片。OpenAI 走到这一步只是时间问题。1.2 OpenAI Jalapeño 是什么根据目前公开的报道Jalapeño 是 OpenAI 与博通合作开发的一颗推理专用芯片采用台积电 3nm 制程定位是数据中心的推理加速任务。几个关键信息点值得注意研发周期约 9 个月。对于一颗芯片来说这个速度非常快。传统 ASIC 芯片从设计到流片通常需要 18 到 36 个月9 个月意味着团队规模、工程管理、IP 复用和流程配合都达到了相当高的水平。采用 3nm 制程。这是目前最先进的量产制程之一相比英伟达 Blackwell 所使用的 4nm 级别制程在晶体管密度、能效比上有物理层面的优势。面向推理场景。这颗芯片不是用来训练基础大模型的而是专注于推理计算尤其是 Transformer 架构中的矩阵乘法和注意力计算。合作方包括博通和台积电。博通负责协助芯片设计与高速互联 IP台积电负责代工制造。这些信息大多来自媒体公开报道OpenAI 官方并没有完全公布芯片的架构细节。所以在阅读下文时凡是涉及具体性能指标的内容都要把它理解为基于公开信息的分析而不是官方规格。1.3 英伟达 Blackwell 是什么Blackwell 是英伟达在 2024 年发布的数据中心 GPU 架构对应产品包括 B200、GB200 等。它面向的是大规模 AI 训练和推理任务在设计上追求通用性和极致算力。Blackwell 的定位是“全能的 AI 计算平台”既能训练大模型也能做推理加速。英伟达通过 CUDA、TensorRT、NCCL 等软件生态把训练、推理、分布式通信全链路整合在一起形成了很难替代的软件护城河。英伟达 GPU 的优势在于通用性。一套集群可以同时应付训练、微调、推理、视频解码等多种任务。这种灵活性在工程上非常宝贵它能让你不用为每一种负载单独购买专用硬件。但通用性的代价就是在某些特定负载上它不一定是最优解。比如当你只需要做推理时GPU 里很多为训练设计的计算单元可能处于“闲置”状态而推理真正吃紧的是内存带宽和低精度计算效率。2. 核心概念看懂 AI 芯片的关键指标要理解“Jalapeño 优于 Blackwell”这个说法不能只看名字必须先理解几个硬件层面的核心概念。2.1 制程工艺3nm 意味着什么芯片的制程工艺通常用纳米nm表示指的是晶体管特征尺寸的一个大致标尺。数值越小晶体管做得越密单位面积可以放更多的晶体管同时每个晶体管的功耗也越低。Jalapeño 使用台积电 3nm 制程Blackwell 则对应台积电 4nm 级别制程。从物理层面看3nm 在晶体管密度和能效比上有天然优势。同样的计算任务如果算法和架构相近3nm 芯片的功耗通常更低相同功耗下的吞吐量更高。不过要注意制程只是芯片性能的一部分。架构设计和软件生态往往更重要。一个 4nm 的优秀设计完全可能在实际任务中胜过 3nm 的普通设计。所以“3nm 优于 4nm”只是一个粗略的起点不能直接等同于产品更优秀。2.2 训练芯片与推理芯片的区别大模型的工作负载可以分为训练和推理两个阶段它们对芯片的要求完全不同。训练阶段追求的是大规模并行计算能力。训练过程需要频繁在不同 GPU 之间同步梯度所以芯片对高精度浮点运算FP8、BF16、FP32和高速互联NVLink、InfiniBand有极高要求。训练芯片需要具备高吞吐、高互联带宽、强大的通用计算能力。推理阶段则是另一个逻辑。推理时模型参数已经固定核心任务是把输入数据通过模型一层层算过去。这里的主要瓶颈往往不是峰值算力而是内存带宽。在自回归生成模型里每个 token 的生成都要重新读取完整的模型权重这导致内存访问成为瓶颈。芯片的计算阵列在大部分时间可能并没有满载而是在等数据从显存中送过来。所以推理芯片最重要的是大容量、高带宽的内存接口对低精度计算的优化FP8、INT4更高效的注意力算子较低的端到端延迟训练芯片和推理芯片是“搭档”关系不是替代关系。OpenAI 做推理芯片并不代表它放弃英伟达 GPU而是把最适合跑训练的设备留给训练把重复且海量的推理负载放到成本更低的专用芯片上。2.3 内存带宽与互联技术推理芯片性能的关键瓶颈之一就是内存带宽。内存带宽决定了芯片从 HBM高带宽内存中读取参数的速度。芯片内部的计算单元即使再快如果数据读取跟不上也会“空转”。所以推理专用芯片通常会堆叠大量 HBM 存储器并设计较宽的内存接口。此外多芯片之间的互联也很重要。大模型通常超过单颗芯片的显存容量需要把模型切分到多颗芯片上。芯片之间的互联带宽就决定了通信开销。英伟达有 NVLink 和 NVSwitch谷歌有 TPU 互联博通也在高速互联 IP 上有深厚积累。OpenAI 选择博通合作很大程度上就是看中了它的互联和通信设计能力。2.4 能效比与总拥有成本芯片优劣的终极评价标准不是跑分而是总拥有成本TCO。总拥有成本包含芯片采购成本、服务器与机柜成本、数据中心电力成本、冷却成本、维护成本和软件适配成本。一颗芯片即便性能不差如果功耗过高、散热要求苛刻、适配成本巨大在真实数据中心里也很难发挥优势。推理场景的芯片通常以“每瓦性能”和“每美元性能”为评价指标。比如处理相同数量的请求芯片 A 如果比芯片 B 功耗低 30%那么一年节省的电费可能非常可观。Jalapeño 的 3nm 制程在能效比上天然占优这也是它被看好能在推理场景胜出的原因。3. OpenAI Jalapeño 技术方案解读3.1 9 个月研发周期背后的工程能力芯片设计在传统认知中是“重资产、慢周期”的工作。一颗先进工艺芯片通常需要经历架构定义、RTL 设计、功能验证、物理设计、流片、封装测试等多个阶段整体周期经常以两年为单位计算。Jalapeño 用 9 个月完成这里面有几层原因值得关注第一这是一颗推理芯片不是通用加速器。推理芯片的功能边界更清晰可以精简很多通用计算单元验证工作量也更小。相比一枚需要兼容大量框架和算子的训练芯片推理芯片的设计复杂度要低不少。第二博通提供了成熟的设计平台和高速互联 IP。OpenAI 不需要从零开始做 PCIe 控制器、片上网络、SerDes 等基础模块而是可以在博通的 IP 库上做上层定制这大大压缩了设计时间。第三台积电 3nm 制程已经经历了多代芯片的量产验证工艺成熟度高设计套件、规则文件、IP 可用性都已经完善。成熟的工艺平台降低了流片失败风险。9 个月不是偶然它反映的是“定制化芯片 成熟工艺 专业设计伙伴”这个模式的可行性。如果这个模式被验证成功未来会有更多大模型公司跟进做自己的推理芯片。3.2 推理优先的设计思路目前公开信息显示Jalapeño 的设计目标非常聚焦就是处理 OpenAI 内部的推理负载尤其面向 Transformer 架构。推理优先体现在几个方面面向低精度计算。推理场景可以用 INT8、FP8 甚至 INT4 实现无损或接近无损的量化推理芯片可以针对这些低精度数据类型做专门优化显著提升单位面积的计算吞吐。优化注意力机制。Transformer 的注意力计算涉及大量矩阵乘法和 softmax 操作芯片可以设计专用的注意力计算单元或者集成更高效的内存访问模式来降低 KV Cache 的读写开销。减少对外部宿主 CPU 的依赖。推理芯片通常要处理调度、动态 shape、批处理等任务如果芯片本身集成了更强的控制和调度逻辑就能降低整机配置成本。更具体地说OpenAI 有大量模型服务类型从 GPT-4 到 o1、o3 以及各类开源模型微调实例。一个只服务特定模型家族的推理芯片可以把芯片上的内存大小、带宽、计算精度的配比做到非常贴合模型特点。这种“软件定义硬件”的思路是通用 GPU 很难做到的。3.3 与 Broadcom、台积电的合作模式OpenAI 自研芯片并不是“单打独斗”而是采用了垂直分工模式。博通在芯片领域有两个明显优势一是通信和互联 IP包括 PCIe、SerDes、以太网控制器二是超大规模数据中心芯片的设计经验谷歌的 TPU 也有博通参与。OpenAI 负责架构定义和软件栈博通负责把算法构造成可流片的 RTL 设计台积电负责制造这个分工本身就是一个经过验证的成熟链路。这种模式也降低了 OpenAI 的跳空风险。OpenAI 不需要自建晶圆厂也不需要自己养一支庞大的物理设计团队而是可以借用外部成熟团队快速推进把核心精力放在“这颗芯片上要跑什么模型、怎么让模型跑得更快”这类算法与硬件协同设计上。3.4 与 Blackwell 的对比真的“优于”吗“优于 Blackwell”这个说法需要放在具体范围内理解。Blackwell 是一系列产品的总称包含训练、推理、云游戏、超大规模数据中心等多种场景。在训练大模型方面GPU 的软件生态和通用性依然是压倒性的优势。Jalapeño 作为一颗推理专用芯片在纯训练基准测试中大概率不可能超过 Blackwell。但在推理场景情况可能完全不同。一颗专为 Transformer 推理优化的 3nm 芯片在服务固定模型时可以在吞吐量和能效比上做到接近甚至超过 Blackwell 的效果。这个对比更类似于一个定制化工具在特定工序上的效率可能高于一台多功能机床。可以这样理解两者的分工对比维度OpenAI Jalapeño英伟达 Blackwell制程工艺3nm台积电4nm 级别台积电主要定位推理加速训练 推理通用计算目标客户OpenAI 内部服务全球数据中心、云厂商、自建集群软件生态围绕 OpenAI 模型栈定制CUDA、TensorRT 等通用生态灵活性固定负载优化支持多种模型和任务成本模式专用部署降低单次推理成本通用采购摊薄开发成本所以“优于”这个词容易产生误导。更准确的说法是Jalapeño 在 OpenAI 自己的推理负载上可能在每美元性能和每瓦性能方面优于英伟达 Blackwell。它是一个垂直优化方案不是全面替代方案。4. 对 AI 开发者的实际影响4.1 你会直接用到 Jalapeño 吗对绝大多数 AI 应用开发者来说你不会直接操作 Jalapeño甚至不会感知到它的存在。OpenAI 对外提供的是 API 服务而不是芯片访问接口。无论后端跑在英伟达 GPU 上还是跑在自研芯片上对外暴露的都是chat.completions这样的 HTTP 接口。但这不意味着和开发者无关。芯片替换的收益最终会通过 API 价格、延迟、并发上限等形式体现出来。如果自研芯片明显降低了推理成本OpenAI 就会有更大的调价空间。可能的结果是更低的 API 单价或者更宽的免费额度或者在不涨价的情况下支持更大的上下文窗口。对开发者来说你感受到的是“服务更便宜、更快、更稳”但背后是算力架构的巨大变化。4.2 OpenAI API 推理调用示例为了让你能够直观感受推理服务的逻辑下面给出一个标准的 OpenAI API 调用示例。这部分代码不依赖具体芯片无论后端是 GPU 还是自研 ASIC接口形式都是一样的。from openai import OpenAI client OpenAI( api_keyyour-api-key ) result client.chat.completions.create( modelgpt-4o-mini, messages[ { role: system, content: 你是技术文档助手回答要简洁、准确。 }, { role: user, content: 用三句话解释什么是 ASIC 芯片。 } ], max_tokens200, temperature0.3 ) print(result.choices[0].message.content)这个示例展示了最小可用的推理请求。开发者通过 SDK 屏蔽了底层算力差异。如果未来 OpenAI 把推理服务迁到自研芯片上这份代码不需要做任何修改。但有一点值得关注不同的推理后端对 prompt 长度、批量大小、并行请求的表现可能不同。如果未来 OpenAl 在特定芯片上提供不同规格的服务实例开发者可能会在 API 文档中看到新增的模型 ID 或者服务等级选项。4.3 开发者需要关注什么作为 AI 应用开发者面对自研芯片这个趋势有一个重要的工程原则保持对底层算力环境的透明性。具体来说建议关注以下几点关注 API 定价变化。如果推理成本下降模型 API 价格调整是大概率事件。你可以通过官方价格页面看到变动并重新评估自己的应用成本模型。关注模型文档中的性能提示。某些模型可能针对特定芯片做优化在响应速度、并发限制、超时参数上会有变化。不要为单个模型私有化部署投入过多精力。如果 OpenAI 的推理芯片只服务自家的托管 API那模型的封闭推理路径会越来越有价值自建 GPU 集群做微调推理的意义相对下降。保持代码层面的供应商无关性。用 OpenAI SDK、Anthropic SDK 或者统一的第三方封装库可以让你在不同服务商之间平滑迁移。5. 常见问题与认识误区5.1 Jalapeño 会取代英伟达吗短期内不会而且没必要。OpenAI 的训练负载依然依赖英伟达 GPU。即使在推理阶段英伟达 GPU 也依然在维持现有 API 服务。自研芯片的定位是新增算力供给而不是把所有负载从 GPU 上搬走。自研芯片的最大意义在于供给弹性。当 OpenAI 有了自己的推理芯片它对英伟达的依赖度会降低谈判筹码也会增加。这会间接影响整个 AI 芯片市场的定价格局。5.2 “优于 Blackwell”是全面碾压吗不是。Blackwell 是一个通用 AI 计算平台Jalapeño 是一个针对推理负载优化的专用加速器。说“优于”的前提是限定在推理场景、OpenAI 内部模型、特定部署条件下。如果跳出这个范围英伟达依然有完整优势。CUDA 生态经过多年沉淀几乎所有的深度学习框架都支持 NVIDIA GPU。这种生态成本是任何新芯片都难以在短期内逾越的。5.3 普通开发者用得上吗如果你是通过 API 使用大模型服务的开发者那你会间接享受到更低成本带来的好处。如果你是想自己搭建推理服务的开发者短期内很难直接买到或者租赁基于 OpenAI 自研芯片的云实例。芯片在最早阶段应该是 OpenAI 内部使用不会对其他企业开放。5.4 9 个月造出芯片是否意味着团队技术实力很强芯片设计能力和软件工程能力并不完全等号。9 个月的周期里OpenAI 借助了博通的 IP 库和设计流程也依赖了台积电成熟的工艺库。用“团队技术实力很强”来概括并不准确更准确的说法是OpenAI 具备很强的资源整合能力和精准的产品定义能力能快速调动外部资源把自己对推理负载的理解转化为硬件需求。6. 最佳实践与工程建议6.1 把推理成本作为核心指标来跟踪不管芯片格局怎么变推理成本始终是应用上线前必须评估的指标。建议在项目初始阶段就建立成本模型把每千 token 的成本、每日请求量、高峰并发都纳入监控。下面是一个简单的推理成本估算脚本可以作为团队内部评估工具的基础def estimate_cost_per_1k_tokens( input_tokens: int, output_tokens: int, price_per_1m_input: float, price_per_1m_output: float ) - float: input_cost input_tokens / 1_000_000 * price_per_1m_input output_cost output_tokens / 1_000_000 * price_per_1m_output return input_cost output_cost input_tokens 2000 output_tokens 500 price_per_1m_input 0.15 price_per_1m_output 0.60 total_cost estimate_cost_per_1k_tokens( input_tokensinput_tokens, output_tokensoutput_tokens, price_per_1m_inputprice_per_1m_input, price_per_1m_outputprice_per_1m_output ) print(f单次请求推理成本: ${total_cost:.6f}) # 如果每天有 100 万次请求 daily_requests 1_000_000 print(f每日推理成本估算: ${total_cost * daily_requests:,.2f})在芯片更替后单价可能下调这个脚本可以帮助你快速重新估算判断是否要调整模型的调度策略比如把更多低频任务切到更便宜的模型实例上。6.2 保持模型调用层与模型实现解耦在应用架构里建议不要直接把某个模型硬编码到业务逻辑深处。尽量通过统一的模型网关或抽象层来调用模型。这样做的价值在于当 OpenAI 发布新的推理芯片之后很可能会推出价格更低的新模型规格或服务套餐你需要能快速切换。统一的模型调用层可以让你只需要修改配置就能把流量从旧模型切到新模型而不用改动业务代码。同时在项目里用环境变量管理模型名称和 API Key会方便线上环境做策略调整export OPENAI_API_KEYyour-api-key export DEFAULT_CHAT_MODELgpt-4o-mini在代码中读取模型名称时优先使用环境变量而不是硬编码这样后续切换模型时不需要重新编译或重新发布。6.3 关注推理延迟的波动信号如果你是一个对服务质量敏感的开发者建议在调用 OpenAI API 时记录延迟数据。芯片切换过程中上游服务可能出现短暂的性能波动。可以用一个简单的脚本做持续性探测把端到端延迟记录下来curl -s -w \nDNS解析: %{time_namelookup}s\n连接建立: %{time_connect}s\n首字节: %{time_starttransfer}s\n总耗时: %{time_total}s\n \ -X POST https://api.openai.com/v1/chat/completions \ -H Content-Type: application/json \ -H Authorization: Bearer $OPENAI_API_KEY \ -d { model: gpt-4o-mini, messages: [{role: user, content: ping}], max_tokens: 10 }如果发现某些时段延迟明显上升可以结合 OpenAI 状态页和自己的监控数据做交叉验证。在接入自研芯片的过程中服务端可能需要进行更频繁的模型版本切换和容量调整应用侧最好设置合理的超时和重试机制。6.4 为大模型基础设施做“异构”准备自研芯片不会只影响 OpenAI 一家。随着推理芯片生态成熟云厂商也会推出更多类型的推理加速实例。如果你的团队已经有自建推理集群的计划建议在设计阶段就考虑异构算力训练集群用英伟达 GPU保证框架兼容性。推理集群可以评估专用加速实例如 AWS Inferentia、Google TPU 虚机、未来的其他 ASIC 实例。在模型导出时考虑 ONNX、OpenVINO 等中间格式降低未来迁移成本。对模型做量化评估选择适合专用芯片的精度格式。硬件层面的异构能力本质上就是软件层面的抽象能力。模型加载、推理调度、批处理逻辑尽量与具体硬件驱动解耦你才有全局调度的空间。6.5 关注开源生态和模型许可证风险OpenAI 的自研芯片与开源模型生态的关系也值得关注。如果未来 OpenAI 把 Codex、Whisper 或其他模型开源出来并且这些模型针对自家芯片做了优化那开源模型的运行时可能也会带上特定的硬件优化路径。这对开发者的影响是你在本地或自建集群上部署开源模型时性能和云端专用芯片差异会变大。建议团队在模型选型时不只看模型本身的指标还要看它的官方部署生态。如果一个模型对特定硬件做了深度适配而你没有使用该硬件实际效果可能有较大折扣。7. 总结OpenAI Jalapeño这颗自研芯片本质是“大模型公司为推理成本构建专属算力解决方案”的一个标志性事件。9 个月的研发周期、3nm 制程、面向推理优化、与博通和台积电的深度合作让它既值得被当作芯片行业案例来分析也值得被当作 AI 基础设施发展趋势来理解。对开发者来说最重要的事情不是去研究这颗芯片的寄存器配置而是关注它带来的下游变化API 定价可能有调整推理延迟可能更稳定模型服务形态可能更丰富。把应用层的模型调用做成松耦合把成本监控做成常态化把推理延迟纳入可观测体系这些基本功在任何芯片架构下都适用。芯片战争还会继续但有一点已经很清楚AI 计算正在从“通用计算统吃一切”走向“训练与推理分层、专用芯片与通用 GPU 共存”的异构时代。提前理解这个趋势你的技术决策会更从容。