FrogNano 发布:Qwen3.5-4B 纯 RL 后训练,SWE-bench Verified 达 61.5%
FrogNano 发布,基于 Qwen3.5-4B 后训练,在 SWE-bench Verified 上取得 61.5%,参数量为 4B。该模型不使用知识蒸馏,仅用 TaskPilot 生成的合成任务做纯 RL 训练,共 5 轮迭代、每轮 300 个任务。
推荐理由:4B 模型仅用 RL 在合成任务上后训练即达到 61.5% SWE-bench Verified,为小模型做编码智能体提供了可参考的训练路径。