sgl_project· @sgl_project · X·· 2 天前AI 评分
SGLang 适配 NVIDIA Vera Rubin 并加速 Kimi K3 推理
SGLang 官方宣布已将 SGLang 带到 NVIDIA Vera Rubin 早期访问硬件上,与 NVIDIA 合作优化 attention、MoE 和投机验证内核以加速 Kimi K3 推理。
我们将 SGLang 带到了 NVIDIA Vera Rubin 上,并加速了 Kimi K3 的推理。
我们与 @NVIDIA 密切合作,在早期访问版 Rubin 硬件上优化了注意力、MoE 和投机验证内核。
亮点:
• 在 batch 1 / 128K 上下文下,FP8 MLA 最高提速 20%
• KDA 验证提速 20%,且输出逐位一致
• 通过 MoE 尾部融合实现端到端推理提速 5.9%,每个解码步骤减少 276 次内核启动
SGLang 还为 Miles 在 Rubin 上的端到端 RL 训练提供 rollout 支持,包括在 Vera CPU 上使用 64 个并发沙箱的 agentic RL。
完整结果与工程细节 👉 lmsys.org/blog/2026-10-09-ve…
来源:sgl_project · x.com