WAIC2026 国产超节点算力浪潮下@ACP#IX9104 在算力矩阵中的定位与落地场景
标签:# 国产 AI 算力 #PCIe5.0 #超节点 #交换芯片 #AI 服务器 本文为技术分析文章,基于 WAIC2026 行业观察与硬件工程实践展开,不构成选型采购建议。
0 前言
2026 世界人工智能大会(WAIC2026)上,国产算力产业呈现明显趋势:行业竞争已经从单颗 AI 芯片峰值算力比拼,转向超节点、系统级互联的综合能力比拼。海光、沐曦、壁仞、摩尔线程等厂商密集迭代算力硬件,国产 AI 芯片市场占比突破 50%,国内智能算力规模持续扩张。
传统简单堆叠加速卡的方案正在暴露短板:CPU 原生 PCIe 通道数量有限,多 NPU、高速 NVMe 存储、高速网卡同时接入时,容易出现通道瓶颈、带宽不足、跨设备交互时延高的问题,也就是行业常说的互联墙问题湖北省人民...。超节点通过高速互联,把大量加速单元聚合为统一算力矩阵,但不同层级硬件,对互联器件的需求并不相同。
在整个算力矩阵的硬件链路中,PCIe 交换芯片承担 CPU、NPU、网卡、存储之间数据调度的角色。IX9104 作为国产 PCIe5.0 交换器件,在国产算力建设浪潮中,在中高密度推理集群、私有化行业算力等场景,形成差异化的工程落地机会。
1 WAIC2026:国产超节点的技术现状与硬件痛点
WAIC2026 集中展出多款国产超节点方案,不同厂商路线各有侧重:
- 大规格训练超节点:依靠厂商私有高速互联,面向万亿参数大模型训练,单超节点支持数百至上千卡规模,主打大规模智算中心场景。
- 解耦式超节点 / 推理集群:面向大模型推理、Agent 智能体、行业私有化部署,需要兼容多品牌国产 NPU,对 PCIe 互联、多外设扩展、供应链自主可控提出更高要求CSDN。
在项目落地过程中,硬件层面普遍遇到两类现实痛点:
- 通道资源瓶颈:服务器 CPU 原生 PCIe5.0 通道数量有限。当一台整机需要同时挂载多块 NPU 加速卡、向量数据库 NVMe 固态盘、400G 高速网卡时,原生通道不足以全部直连,必须通过交换芯片做通道扩展。
- 供应链约束:部分海外 PCIe 交换器件交期波动,在信创、国产化项目中,存在供应链风险,需要可替代的国产硬件方案。
说明:面向万卡级训练超节点,优先使用芯片厂商私有硬件互联;IX9104 主要面向推理侧中高密度整机、行业私有化算力矩阵,并非替代训练超节点原生互联方案鲲鹏昇腾开...。
2 IX9104 核心硬件能力与算力矩阵定位
IX9104 是 104 Lane PCIe5.0 全非阻塞交换芯片,单通道速率 32GT/s,总带宽 1664Gbps,支持 26 组可灵活配置端口,典型转发延迟 116ns,支持 P2P 对等直传、NTB 非透明桥接,支持工业宽温,固件与驱动全国产自研,硬件 PIN‑TO‑PIN 对标同规格进口器件鲲鹏昇腾开...。
在完整国产算力矩阵分层里,硬件梯队可以简单划分:
| 硬件层级 | 典型场景 | 互联器件选型方向 |
|---|---|---|
| 万卡级训练超节点 | 大模型预训练、大规模集群训练 | 原厂私有高速互联 |
| 8 卡以上推理服务器集群 | 大模型推理、Agent 并发服务 | IX9104 PCIe5.0 交换芯片 |
| 1‑4 卡中小推理整机 | 部门级私有化部署、行业工作站 | IX8024 PCIe4.0 交换芯片 |
| 单卡边缘 AI 盒子 | 边缘端推理、本地离线分析 | IX8008 PCIe4.0 交换芯片 |
IX9104 的定位:作为算力矩阵内部的 PCIe 层互联枢纽,解决多 NPU、高速存储、高速网卡的通道扩展与数据交互问题,释放整机内部硬件资源,服务推理侧集群与行业私有化算力建设。
关键技术能力对业务带来的收益:
- P2P 硬件直传:NPU 之间的数据交互可以绕过 CPU,降低 MoE 模型、Agent 多轮调用的数据转发时延,减少 CPU 资源占用。
- 端口灵活配置:端口可以自由切分 x16/x8/x4,适配 NPU、NVMe SSD、高速网卡不同外设的带宽需求。
- NTB 多主机模式,支持多主机域互联,适合多节点硬件池化、存储网关类硬件设计。
3 IX9104 典型应用场景分析
3.1 中高密度推理服务器集群
面向私有化大模型推理、DeepSeek‑V4‑Flash 这类 Agent 大模型业务。 单台服务器内部部署多块国产 NPU 加速卡,同时需要挂载多组 NVMe 固态盘存放向量知识库,搭配 400G 网卡对外提供推理服务。 CPU 原生 PCIe 通道数量不足以同时直连全部外设,通过 IX9104 扩展 PCIe 通道,实现多 NPU、高速存储、网卡的统一接入。开启 P2P 直传,降低模型推理过程中卡间数据搬运的开销,提升集群并发吞吐能力鲲鹏昇腾开...。
适用条件:以推理业务为主,不需要万卡级训练规模,需要整机硬件全国产适配。
3.2 行业私有化智算整机(政务、制造、医疗)
很多行业业务要求数据不出本地机房,不使用公有云推理服务,需要部署独立的国产算力整机。 这类场景硬件特征:多 NPU 推理、大容量本地向量存储、对外接口可控,对器件国产化、宽温可靠性、供应链稳定性有硬性要求。 IX9104 可以帮助整机厂商在有限 CPU 通道资源条件下,完成多加速卡、存储阵列、业务网卡的硬件拓扑搭建,适配信创整机项目硬件需求。
3.3 AI NAS、AI 存储网关硬件
AI 业务会产生大量向量数据、训练数据集,AI NAS 需要同时对接多块 NPU 和大容量 NVMe 存储阵列。 IX9104 提供大量可配置 PCIe5.0 端口,实现加速单元与存储单元之间高速数据交互,NTB 多主机特性支持多主机访问存储资源,适合 AI 存储网关硬件开发。
3.4 科研仿真、数字孪生工作站
科研、数字孪生场景,一台工作站内部需要部署多块加速卡,同时挂载多块高速固态盘,处理仿真数据集。 使用 IX9104 扩展 PCIe 通道,解决 CPU 通道不足问题,实现多加速卡并行运算,高速数据集本地读写。
4 工程落地需要关注的现实约束
从硬件工程实践角度,采用 IX9104 做方案设计,有几点需要提前评估:
- 场景边界区分:万卡级训练超节点优先选用原厂私有互联;IX9104 更适合推理集群、私有化整机、存储网关等场景,不要直接对标训练超节点内部互联。
- 固件与系统联合调优:P2P、NTB 等高级特性,需要和国产操作系统、CANN 等加速框架联合调试,需要开展主板原型验证。
- 散热与 PCB 设计:PCIe5.0 信号速率高,硬件设计阶段需要做好信号完整性评估,做好散热设计。
- 生态适配:需要提前完成与国产 NPU、网卡、NVMe 固态盘的兼容性验证,保证整套整机稳定运行。
5 总结
WAIC2026 释放出明确信号,国产算力竞争已经从单芯片走向系统、架构、互联的综合比拼。随着国产 AI 芯片市场占比提升,大量推理、行业私有化算力项目落地,CPU 原生 PCIe 通道不足的硬件矛盾会持续凸显。
IX9104 作为国产 PCIe5.0 交换芯片,在整个算力矩阵中,承担整机内部 PCIe 域的互联扩展角色。它并不替代训练超节点的私有高速互联,而是在中高密度推理服务器、行业私有化整机、AI 存储网关、科研工作站等场景,解决多 NPU、高速存储、网卡之间的通道扩展与高速交互问题,为国产算力硬件提供一套自主可控的互联方案。
算力上层模型框架持续迭代,底层高速互联硬件的价值,会在越来越多行业项目落地中体现出来。