跳到正文
原文
SemiAnalysis_· @SemiAnalysis_ · X·· 2 天前AI 评分37

SemiAnalysis 测试 Vultr GPU 集群暴露多项问题

AI 导读

SemiAnalysis 在 Vultr GPU 集群上测试时发现多项问题:镜像含 CUDA、Docker、runc 等多个存在 CVE 的库,登录 pod 缺少 `/shared` 挂载和 Pyxis 配置,K8s 默认 `vultr-block-storage` StorageClass 与裸金属集群不兼容导致 pod 卡在 `ContainerCreating`。

正文 · AI 翻译

Vultr 为我们测试构建的镜像中,许多库都存在适用的 CVE,包括 CUDA、DCGM、Docker、runc 和 ConnectX 固件。我们的 Slinky 登录 pod 没有挂载 `/shared`,也缺少 Pyxis plugstack 配置,因此在 Vultr 支持团队于活动期间重新配置登录 pod 修复这两个问题之前,我们不得不从 worker pod 进行编排操作。从 K8s 层看到的存储还有另一个基本问题:默认存储配置与我们的裸金属集群不兼容。默认 StorageClass `vultr-block-storage` 能正常配置和绑定,但 pod 却永远卡在 `ContainerCreating` 状态。不过,随 worker 节点附带的 Lustre 层表现优异,在 32 个客户端上实现了 91.7 GB/s 的聚合读取速度。Grafana 已完成配置,但仅部分正确,由于 `DCGM_FI_PROF_NVLINK_*` 字段未配置,NVLink 读取值显示为 0。(2/3)

来源:SemiAnalysis_ · x.com