跳到正文

#产品更新

今日 0 条
10月10日周六
10月9日周五
  1. Weyaxi59

    Weyaxi 团队发布 TermGrade,这是一套面向终端智能体的高质量 RL 环境,完全开源,同时公开构建与评分的完整过程以及所用的 RL 训练配方。该数据集包含 1k 个可执行环境,每个都经执行验证并对照 6 个模型评分,附带支撑评分的全部 36k 条轨迹(含失败样本)。作者称用这些任务训练 gemma-4-31B-it,在其原本能解出一半的任务上使 Terminal-Bench 2.1 提升 +3.1。

  2. testingcatalog58

    Odyssey 将世界模型中的物理预测与语言模型中的编码相类比,认为能准确预测物体下落、倾倒和碰撞的模型体现了机器人和智能体所需的世界理解。文中提到机器人手臂从数十小时演示中学习任务,使用冻结的 Odyssey-3 骨干在 20 小时驾驶数据上训练的驾驶策略,以及 Flexion 的人形策略在让 VLA 基线失效的光照变化下仍能工作。

10月8日周四
10月7日周三
  1. Hugging Face Blog75

    Nemotron 微调后在 IOI 2026 与 IMO 2026 双双达到金牌水平

    NVIDIA 官方博客称,基于 Nemotron 3 用 SFT、RL 与反馈式推理特化的系统在 IOI 2026 与 IMO 2026 均达金牌水平:Nemotron-3-Ultra-CC 得 535.4/600,超过 361.12 的金牌线与人类最高分 498.27;IMO 系统得 30/42,超过官方金牌线 29。

    推荐理由:原文给出从基座到数据再到推理循环的四步特化配方,读者可据此评估复现金牌级系统的成本与路径。

10月3日周六