郭明錤:Nvidia 恢复 Rubin CPX 项目,预计 1Q27 量产
郭明錤表示,行业调研显示 Nvidia 已恢复此前被认为被砍掉的 Rubin CPX 项目,预计 1Q27 量产,且 prefill 性能较旧设计更强。
就在市场认为 Rubin CPX 已被从英伟达产品路线图中砍掉之际,我最新的产业调查显示,英伟达已重启该项目,预计将于 2027 年第一季度开始量产。与之前的设计相比,重启后的 Rubin CPX 提供更强的 prefill 性能,其 GPU 规格和机架架构均有重大变化,凸显了英伟达对 prefill 解决方案的高度重视。
关键变化:
1. Rubin CPX GPU 规格
CPX 提供接近 Rubin 的计算性能,功耗也与 Rubin 的最高额定功率持平,均为每 GPU 2,300 W。CPX 采用 168 GB HBM4,而 Rubin 为 288 GB,上一代 CPX 设计则采用 128 GB GDDR7。
2. 机架设计
新款 CPX 采用独立的 MGX ETL 机架,不再像之前的设计那样与 Rubin 共享机架。客户可根据需求选择 64、128、192 或 256 个 CPX GPU。在一个 CPX 机架内,每 64 个 CPX GPU 构成一个机架模块,包含八个计算托盘(每个托盘 8 个 CPX GPU)和一个交换机托盘。
3. 扩展(scale-up)与横向扩展(scale-out)
NVLink 仅用于每个托盘内 8 个 CPX GPU 之间的 scale-up,每个 CPX 的 NVLink 带宽为 1–1.5 TB/s(Rubin 为每 GPU 3.6 TB/s)。每个机架模块内托盘之间的 scale-out 通过 Spectrum-6 以太网运行,采用全铜 L1 链路。机架模块之间的 scale-out 则由每个模块的 Spectrum-6 交换机通过 OSFP 光链路处理。
4. 工作原理
CPX 必须与 Vera Rubin NVL72 搭配使用,英伟达建议 CPX 与 Rubin GPU 的比例为 1:1。CPX 负责 prefill 并构建 KV cache,随后通过以太网 RDMA 将其传输给 Rubin 进行 decode。
5. 产品定位:长上下文 prefill 的最佳性价比
如今超过 50% 的 AI 推理工作负载来自处理输入上下文并构建相应的 KV cache。因此,CPX 提供了一种更灵活、成本更低的 prefill 处理方式。每个含 8 个 CPX 的托盘约配备 1.34 TB HBM4,足以满足大多数长上下文 prefill 工作负载及相关 KV cache 需求。
来源:mingchikuo · x.com