0xBakeer· @0xBakeer · X·· 10 天前AI 评分
单台DGX Spark多模型推理速度实测
这周大家都在晒 3、4 台 Spark 集群。这是一台 DGX Spark 为单个用户跑出的成绩,全部在我的机器上实测: 开启 OpenBMB 的 drafter MiniCPM5-2B:100.8 tok/s Qwen3.6-35B-A3B:89.7 Ling-3.0-flash:69.5 Qwen3.8-Flash-Next:55.5 DeepSeek-V4-Flash:47.9(EXL3) Gemma-4-E2B:39.2 Qwen3.8-27B:33.4(EXL3 + DFlash2) Tinfield-1 2-bit:30.7 一次跑一个模型,256 tokens 输入,256 输出
这周大家都在晒 3 节点、4 节点的 Spark 集群。下面是一台 DGX Spark 为单个用户跑出的成绩,全部在我自己的机器上实测:
MiniCPM5-2B,开启 OpenBMB 的 drafter:100.8 tok/s
Qwen3.6-35B-A3B:89.7
Ling-3.0-flash:69.5
Qwen3.8-Flash-Next:55.5
DeepSeek-V4-Flash:47.9(EXL3)
Gemma-4-E2B:39.2
Qwen3.8-27B:33.4(EXL3 + DFlash2)
Tinfield-1 2-bit 量化:30.7
每次只跑一个模型,输入 256 tokens,输出 256 tokens
来源:0xBakeer · x.com