跳到正文
原文
X:Microsoft Research (@MSFTResearch)· @kim__minseon·· 26 天前精选AI 评分67

FrogNano 发布:Qwen3.5-4B 纯 RL 后训练,SWE-bench Verified 达 61.5%

RT by @MSFTResearch: 4B parameters. ZERO distillation. 61.5% on SWE-bench Verified 🤯 Meet FrogNano 🐸: Qwen3.5-4B post-trained purely with RL on synthetic tasks from TaskPilot. Just 5 iterations × 300 tasks. Who said coding agents have to be huge? 🐸

AI 导读

FrogNano 发布,基于 Qwen3.5-4B 后训练,在 SWE-bench Verified 上取得 61.5%,参数量为 4B。该模型不使用知识蒸馏,仅用 TaskPilot 生成的合成任务做纯 RL 训练,共 5 轮迭代、每轮 300 个任务。

推荐理由

4B 模型仅用 RL 在合成任务上后训练即达到 61.5% SWE-bench Verified,为小模型做编码智能体提供了可参考的训练路径。

来源:X:Microsoft Research (@MSFTResearch) · x.lingyaoai.com