跳到正文
原文
mingchikuo· @mingchikuo · X·· 2026-08-31AI 评分66

郭明錤:Nvidia 恢复 Rubin CPX 项目,预计 1Q27 量产

AI 导读

郭明錤表示,行业调研显示 Nvidia 已恢复此前被认为被砍掉的 Rubin CPX 项目,预计 1Q27 量产,且 prefill 性能较旧设计更强。

正文 · AI 翻译

就在市场认为 Rubin CPX 已被从英伟达产品路线图中砍掉之际,我最新的产业调查显示,英伟达已重启该项目,预计将于 2027 年第一季度开始量产。与之前的设计相比,重启后的 Rubin CPX 提供更强的 prefill 性能,其 GPU 规格和机架架构均有重大变化,凸显了英伟达对 prefill 解决方案的高度重视。

关键变化:

1. Rubin CPX GPU 规格

CPX 提供接近 Rubin 的计算性能,功耗也与 Rubin 的最高额定功率持平,均为每 GPU 2,300 W。CPX 采用 168 GB HBM4,而 Rubin 为 288 GB,上一代 CPX 设计则采用 128 GB GDDR7。

2. 机架设计

新款 CPX 采用独立的 MGX ETL 机架,不再像之前的设计那样与 Rubin 共享机架。客户可根据需求选择 64、128、192 或 256 个 CPX GPU。在一个 CPX 机架内,每 64 个 CPX GPU 构成一个机架模块,包含八个计算托盘(每个托盘 8 个 CPX GPU)和一个交换机托盘。

3. 扩展(scale-up)与横向扩展(scale-out)

NVLink 仅用于每个托盘内 8 个 CPX GPU 之间的 scale-up,每个 CPX 的 NVLink 带宽为 1–1.5 TB/s(Rubin 为每 GPU 3.6 TB/s)。每个机架模块内托盘之间的 scale-out 通过 Spectrum-6 以太网运行,采用全铜 L1 链路。机架模块之间的 scale-out 则由每个模块的 Spectrum-6 交换机通过 OSFP 光链路处理。

4. 工作原理

CPX 必须与 Vera Rubin NVL72 搭配使用,英伟达建议 CPX 与 Rubin GPU 的比例为 1:1。CPX 负责 prefill 并构建 KV cache,随后通过以太网 RDMA 将其传输给 Rubin 进行 decode。

5. 产品定位:长上下文 prefill 的最佳性价比

如今超过 50% 的 AI 推理工作负载来自处理输入上下文并构建相应的 KV cache。因此,CPX 提供了一种更灵活、成本更低的 prefill 处理方式。每个含 8 个 CPX 的托盘约配备 1.34 TB HBM4,足以满足大多数长上下文 prefill 工作负载及相关 KV cache 需求。

来源:mingchikuo · x.com