跳到正文
原文
Hugging Face Blog·· 2026-07-06AI 评分22

PRX Part 4:Hugging Face 的数据策略

AI 导读

Hugging Face 在 PRX 系列第四篇中披露其数据策略:预训练数据由公开与内部数据集混合组成,用 VLM 重新生成图像长描述,再转为可流式训练的语料。团队将文本编码器从 T5Gemma 换成 Qwen3-VL 并改为训练时实时计算文本 latent,实测吞吐损失约 3–4%(30 天训练约多 1 天)。图像统一以 JPEG quality 92 编码,实测首次重编码几乎不可察觉。

当前提供 AI 导读,完整正文请阅读原文。

来源:Hugging Face Blog · huggingface.co