公司动态
从灵骏真武 M890 超节点看@ACP#PCIe5.0 交换芯片 IX9104 在国产算力体系下的落地机遇
摘要阿里云灵骏真武 M890 超节点实例正式在乌兰察布商用上线可承载 2 万亿以上参数大模型Qwen3.8‑Max、Kimi K3 已完成适配对外服务。超节点架构把算力竞争从单芯片性能延伸到整机互联体系。本文从工程实践角度分析国产 PCIe5.0 交换芯片 IX9104 在超节点生态下的业务痛点、市场机会与典型落地场景。一、国产超节点时代到来互联成为算力效率关键变量WAIC2026 之后国产 AI 芯片、超节点方案密集亮相行业共识逐步形成万亿参数大模型、大规模 Agent 推理业务不只依靠 AI 加速芯片本身整机内部的高速互连能力直接决定集群实际算力利用率。阿里云灵骏真武 M890 超节点实例作为已经商用落地的国产超节点代表以 64 卡紧密耦合单元对外输出算力单实例可支撑 2 万亿参数级别 MoE 大模型运行Qwen3.8‑Max、Kimi K3 等大模型完成适配面向公有云训推、私有化超节点、行业大模型推理提供算力底座。超节点内部自研 ICN Switch 负责 AI 加速芯片之间的卡间高速互联而服务器域内 CPU‑NPU、NPU‑高速 SSD、NPU‑智能网卡之间大量数据流依然高度依赖 PCIe 总线完成调度。在 MoE 模型、Agent 多智能体业务下KV‑Cache 缓存、向量知识库、工具调用带来大量突发 IO 访问原生 CPU PCIe 通道数量、带宽往往成为整机的性能瓶颈高速 PCIe 交换芯片的价值进一步放大鲲鹏昇腾开...。公有云超大超节点更多使用自研专用互联但大量政企私有化超节点、部门级中型推理集群、超节点附属存储扩展单元、异构混合算力机柜依然需要标准化、全国产、高可靠的 PCIe5.0 交换方案这也是国产 PCIe 交换芯片的核心切入窗口。二、IX9104 产品定位匹配超节点衍生业务的核心诉求IX9104 是国产 104 Lane PCIe5.0 非阻塞交换芯片单通道速率 32GT/s提供 26 组可灵活配置端口支持 P2P 对等传输、NTB 非透明桥接、SR‑IOV 虚拟化、多主机级联工业宽温‑40℃~105℃固件与驱动全国产PIN‑TO‑PIN 对标海外同规格高端交换器件面向高密度 AI 服务器、国产化算力节点设计。面对灵骏 M890 代表的超节点生态整机硬件层面主要面临几类工程痛点单 CPU 原生 PCIe 通道有限多 NPU、多块 NVMe 向量 SSD、多张高速网卡同时部署时通道资源紧张出现带宽收敛MoE 大模型推理过程NPU 与本地知识库盘之间频繁搬运 KV 缓存希望绕过 CPU 做 P2P 直传降低转发时延私有化信创场景要求关键互连器件实现全国产替代不能依赖海外交换芯片中型集群需要芯片级联扩展搭建算力池兼容多主机异构接入适配混合算力机柜。IX9104 的能力恰好针对上述痛点作为算力系统的中间枢纽完成 PCIe 通道扩展、数据流调度、多设备直连补齐国产超节点衍生整机的 IO 短板。注意IX9104 并不替代 M890 超节点内部 ICN 专用互联芯片而是作用在服务器 PCIe 域解决 CPU、NPU、高速存储、网卡之间的互连扩展问题二者属于架构上的互补关系。三、IX9104 在 M890 超节点生态下的典型应用场景场景 1私有化中型超节点推理服务器8‑16 卡国产 NPU 整机公有云 M890 是 64 卡大规模超节点而大量政企、金融、能源行业客户并不会直接采购 64 卡完整超节点更多落地 8‑16 卡规模私有化推理集群运行 Qwen、Kimi 等 MoE 大模型、Agent 业务。这类整机中使用 IX9104 做 PCIe5.0 通道扩展单颗芯片扩展多路下行端口同时挂载多块国产 NPU、多路 NVMe SSD 向量知识库、高速网卡开启 P2P 直传NPU 和 SSD 之间数据搬运绕过 CPU降低 MoE 推理时延提升大模型并发吞吐量。 业务适配行业私有化大模型、企业本地 Agent 平台、知识库检索推理服务。场景 2超节点配套本地高速存储扩展柜M890 超节点主要负责 AI 计算大模型权重、海量业务向量库、日志数据集需要配套高密度本地存储单元。传统方案 CPU 直连硬盘数量有限引入 IX9104 作为存储域交换枢纽扩展大量 PCIe5.0 NVMe 设备构建超节点外部附属存储池。优势不需要改动超节点核心计算部分通过标准化 PCIe 链路对接实现算力与存储解耦扩容满足万亿参数模型权重缓存、向量数据库高吞吐读写需求。场景 3异构混合算力机柜超节点 通用服务器混合部署很多智算中心会采用 “大型超节点 通用推理服务器” 混合机柜部署一部分机器跑大规模 MoE 训练推理一部分跑轻量化 Agent、API 网关、向量检索业务。 IX9104 支持 NTB 非透明桥、多主机模式可以实现多台主机算力资源池化调度不同主机下的 NPU、存储资源可以互相访问提升机柜整体资源利用率适配智算中心异构混合部署模式。场景 4信创智算集群全国产化算力节点建设随着国产 AI 芯片占比持续提升很多政企智算项目要求从加速卡、CPU 到底层互连器件全部国产化。过去高端 PCIe5.0 交换长期被海外厂商垄断是国产化卡脖子环节。 IX9104 作为全国产 PCIe5.0 交换芯片可用于信创智算项目中高密度推理服务器完整适配国产 CPU 国产 NPU 体系满足政策对供应链自主可控的硬性要求。四、落地过程中的工程约束与选型提示IX9104 面向 PCIe5.0 域 IO 扩展不能替代超节点内部专用卡间互联芯片架构设计上需要区分专用高速互联与 PCIe 交换的分工PCIe5.0 信号速率高PCB 设计、信号仿真、散热设计是整机成败关键点需要严格按照芯片参考设计完成硬件开发Agent、MoE 业务大量使用 P2P 功能需要整机 BIOS、内核驱动、大模型推理框架协同适配充分验证 P2P 稳定性更小规模 4 卡及以下边缘推理整机优先选择 PCIe4.0 系列交换芯片平衡成本与性能IX9104 更适合 8 卡以上中高密度算力节点。五、结语灵骏真武 M890 商用落地标志国产超节点从展会样机走向实际业务交付。超节点竞争不只是 AI 加速芯片的比拼CPU‑加速卡‑存储‑网卡之间的互连系统成为影响整机实际输出能力的重要环节。IX9104 作为国产高端 PCIe5.0 交换芯片不参与超节点内部卡间专用互联而是聚焦服务器 PCIe 域的通道扩展、多设备调度在私有化中型推理整机、配套存储扩展柜、异构算力机柜、信创智算集群这些细分场景打开替代空间是国产算力基础设施链条中不可忽视的中间枢纽器件。