跳到正文
原文
sgl_project· @sgl_project · X·· 2 天前AI 评分55

SGLang 适配 NVIDIA Vera Rubin 并加速 Kimi K3 推理

AI 导读

SGLang 官方宣布已将 SGLang 带到 NVIDIA Vera Rubin 早期访问硬件上,与 NVIDIA 合作优化 attention、MoE 和投机验证内核以加速 Kimi K3 推理。

正文 · AI 翻译

我们将 SGLang 带到了 NVIDIA Vera Rubin 上,并加速了 Kimi K3 的推理。

我们与 @NVIDIA 密切合作,在早期访问版 Rubin 硬件上优化了注意力、MoE 和投机验证内核。

亮点:

• 在 batch 1 / 128K 上下文下,FP8 MLA 最高提速 20%

• KDA 验证提速 20%,且输出逐位一致

• 通过 MoE 尾部融合实现端到端推理提速 5.9%,每个解码步骤减少 276 次内核启动

SGLang 还为 Miles 在 Rubin 上的端到端 RL 训练提供 rollout 支持,包括在 Vera CPU 上使用 64 个并发沙箱的 agentic RL。

完整结果与工程细节 👉 lmsys.org/blog/2026-10-09-ve…

来源:sgl_project · x.com