Hugging Face Blog·· 2026-04-29精选AI 评分
Granite 4.1 LLM 是如何训练的:IBM 公开数据工程、预训练与强化学习全流程
IBM Granite 团队发布技术文章,详解 Granite 4.1 系列稠密 LLM(3B、8B、30B)的训练流程:约 15T tokens 五阶段预训练,上下文窗口经长上下文扩展至 512K tokens,随后用约 4.1M 条高质量样本做 SFT,并采用 on-policy GRPO 配合 DAPO loss 的多阶段强化学习。
Granite 4.1 团队公开了从数据配比到多阶段 RL 的完整训练细节,可对照其 8B 稠密模型追平 32B MoE 的结论。
当前提供 AI 导读,完整正文请阅读原文。
来源:Hugging Face Blog · huggingface.co