Arena 研究:前沿图像模型后训练需复合奖励,FLUX.2-dev 提升 69 Elo
Arena 研究提出前沿图像模型后训练的复合奖励方案,认为人类偏好奖励必要但不充分,偏好模型仍可能奖励细节缺失、引入未请求内容等 reward-hacking 行为。
Arena 研究提出前沿图像模型后训练的复合奖励方案,认为人类偏好奖励必要但不充分,偏好模型仍可能奖励细节缺失、引入未请求内容等 reward-hacking 行为。
Repovive 联合 IOI、IMO、ICPC 决赛选手评测 AI 判卷能力,从数学竞赛中选出 534 份可疑或边缘提交,建立统一评分标准与专家参考判断。模型整体偏严,更常拒绝有效提交;清晰指令让 GPT 模型平均提升约 2 个百分点,加入评分示例后 Claude 平均提升约 10 个百分点、GPT 约 5 个百分点。Grok 几乎拒绝一切,仅接受 1–5% 提交,而金标准接受 64.4%。
Geoffrey Hinton 转发并推荐了一篇论文,讨论 AI 研发自动化是否会触发智能爆炸。文中提到,递归自我改进导致智能爆炸的想法已存在很久,但直到最近才显得可能很快发生,如今许多顶尖研究者认为它可能不久后出现。论文指出,与一年前相比,AI 系统现在已编写了构建它们的公司内部的大部分代码,链接为 casp.ac/reports/intelligence。
Meta 研究博客发布《Solving Open Research Problems Together》,介绍数学家与 Muse Spark 合作完成六篇研究论文。该内容为 AI at Meta 转推并附上研究博客链接。
Meta 团队借助 Muse Spark 在非结合代数中找到了一个反例,推翻了受生物学启发提出的数学结构规则。他们进一步给出替代刻画,并由研究人员核验与完善。相关论文已发布在 Meta 研究页面。
Meta 分享六篇论文,来自数学家与 Muse Spark 1.1、Muse Spark 1.2 在 Thinking Mode 下通过常规 meta.ai 聊天界面协作求解开放数学问题,未使用定制研究框架。合作遵循数学家主导研究、第二组数学家评审、论文标注人机撰写段落并致谢所依据的先前研究等原则,对同一问题其他团队的独立解法也予以承认。
论文 Adaptive Reward Routing 提出通过前向过程 RL 为音视频联合扩散模型做动态多奖励优化,取代单一评分方案。该方法面向生成式媒体,论文已在 HuggingFace 上线(2609.37200)。
研究提出 EgoTools,聚焦真实第一视角视频中的工具中心推理,解决多数智能体演示忽略的"手中持有什么工具、如何使用"问题。该工作关注跨镜头切换时的工具身份保持,作者称首次尝试在镜头移开的瞬间就丢失了螺丝刀。论文已发布在 HuggingFace,编号 2609.39378。
Google Research 发布多智能体证明发现论文,其系统 Cogentic 基于 Gemini,从问题陈述出发、无需专家提示,在理论计算机科学的五个开放问题上取得新结果,涉及在线学习、拍卖理论和机制设计,每个结果均由领域专家核验。
Gacha Decoding 通过给 LM 配备 RNG 工具并让其"掷骰规划",把多样性来源从 token 熵转向指令遵循,样本效率比此前方法提升逾 11 倍。
NVIDIA 发布关于长时程智能体的论文,提出 Long-Transduction 测试方法,要求模型在数千次输出中持续读取、更新并输出依赖状态的结果,并分别改变三个因素。
Google 宣布推出基于可信执行环境(TEE)的新一代联邦学习系统,为数据匿名化提供可远程验证和审计的保证,Gboard 已采用该系统上线英语和日语下一词预测模型。
推荐理由:Google 公布基于 TEE 的新一代联邦学习系统设计,并给出 Gboard 已上线的落地情况,可了解隐私可验证训练的一种工程路径。
CAMEL-AI 的 SETA(Scaling Environments for Terminal Agents)被 NeurIPS 2026 Evaluations & Datasets Track 接收,并开源了 SETA-Env 数据集,包含 4500+ 可验证终端 RL 环境及配套的可扩展合成与质量控制流水线。
SETA(Scaling Environments for Terminal Agents)被 NeurIPS 2026 Evaluations & Datasets Track 接收,并发布 SETA-Env 数据集,包含 4500+ 个开源可验证终端 RL 环境及完整的合成与训练管线。
Mercor 的一项研究让 12 名平均有 5.5 年经验的持证 CPA 完成 APEX Accounting Benchmark 中的简化任务,结果显示 AI 模型在结构化记账任务上比会计师更快、更准确且成本更低。
ServiceNow CoreAI 构建了 AutoSynthData,利用目标模型的失败与更强教师的成功来定位能力缺口,并生成、验证新的可执行训练任务,课程随模型进步向仍难的任务迁移。该方法以 EnterpriseOps Gym 数据集演示,任务由系统规范、用户提示词和验证器三部分组成,需满足可行性、真实性与难度要求。
AREX-2 是一个 27B 智能体,通过长时程反思任务实现自我改进,在可验证的 ML 与算法任务上训练,测试时轮次越多解越好。它在 MLE-bench Lite 上取得 81.8,在 Frontier-CS 上取得 70.7,并可迁移到深度研究任务。
ARC Prize 公布了 Qwen3.8-27B 在 ARC-AGI 上的完整测试结果,并同步给出排行榜、公开结果复现方式与测试政策。相关结果可在 ARC Prize 排行榜查看,复现脚本托管于 arcprize/arc-agi-benchmarking 仓库。
PostTrainBench v1.2 发布,新增云 GPU 支持,可通过 Harbor adapter 在 Harbor + Modal 上以相同设置运行基准测试。
卡内基梅隆、MIT、纽约大学和斯坦福的研究团队开发的 AI 系统 Ataraxos 以 15 胜 1 负 4 平击败被认为是史上最强的 Stratego 选手 Pim Niemeijer,训练仅用 16 块 GPU、花费几千美元。
LongLive-Plug 提出一种面向视频生成的一次性(one-step)通用蒸馏方法,可让长时长视频生成更易部署,并为需要快速出片的创作者节省算力与时间。该方法无需多次迭代即可完成蒸馏。
Omni-IO Skills 是一篇关于让 AI 智能体实现 Omni-Native 能力的论文,已在 Hugging Face 上线(论文编号 2609.31847)。该工作聚焦于为智能体赋予全模态输入输出技能,具体方法与结果细节尚未在公开信息中展开。
LEGO-Anything 提出用编码智能体(Coding Agents)完成 3D 场景重建,论文已发布在 Hugging Face Papers(编号 2609.36380)。该工作将 3D 场景重建任务交给编码智能体处理,并附有演示视频。
新发布的 Incident Arena 是一个把编程智能体放到"on call"位置的基准测试,用来检验 AI 能否处理应用代码出故障后的运维响应,而不只是写代码。该基准同时放出了论文与完整数据集。
OpenAI 的 Noam Brown 与 @ssokota 在 Nature 论文中推出首个超人级 Stratego AI,采用他们为不完美信息下的强化学习与测试时计算开发的通用技术。两人五年前在会议海报环节结识,Brown 当时是唯一到访其海报的人,随后邀请他实习并持续合作至今。
Google DeepMind 在 Nature 发表论文,提出 SynthID Bio 蛋白质水印方法,可在保持功能的前提下为 AI 生成的蛋白质序列和结构加水印,用于溯源检测。
微软研究团队开发出一套机器学习系统,可在极端空间天气风暴抵达前 30-60 分钟预测地球哪些区域可能受损。该系统针对的是会破坏地面电力系统、降低 GPS 精度并干扰卫星运行的极端空间天气事件。
微软研究院实习生开发了一套端到端机器学习流水线,为美国本土 66,935 座变电站生成空间天气风险预测,可提前 30 至 60 分钟预警。系统结合 AE 与 Dst 指数预测、地质电导率和电网数据,在 2020-2026 评估期内检测到近 80% 的重大空间天气事件,其中 Dst 预测在 62.2% 的高活跃时段优于 Burton 方程。
Google DeepMind 团队发表论文,提出基于 SynthID 的蛋白质水印方案 SynthIDBio,可在不损害蛋白质功能的前提下,在 ProteinMPNN 设计的蛋白质序列中嵌入可检测的水印,用于生物安全筛查。
腾讯混元联合复旦大学、清华大学发布 ExplorationBench,用于衡量 AI 系统的探索能力,并构建可验证的 Alien Worlds 环境。其中 AlienCode 含 31 项隐藏规则改动、70 个任务,AlienLogic 含 24 条修改的推理规则、70 个定理,答案由解释器或证明检查器评分,不使用 LLM 评判。
Nathan Lambert 引用 Rulin Shao 的研究介绍 Context Language Models(CLMs),主张让语言模型不受限制地直接编辑自身上下文,而非依赖现有 harness 的固定上下文管理方式。该研究称这种方式可带来更好的长程记忆与 FLOP 高效的适配,并把上下文当作文件、将策略学习进 CLM 权重中,无需 harness。
面壁智能 OpenBMB 发布 Diffusion Reward Models(DRM),不再把人类偏好压缩成单一分数,而是学习完整奖励分布,保留分歧、不确定性与多种可能判断。
Anthropic 发布研究文章评估智谱 GLM-5.3,称其能自主构建端到端网络攻击链,且发布时未设置实质性滥用防护。测试显示 GLM-5.3 在 Chrome V8 漏洞利用任务中的成功率接近 Claude Mythos Preview。
SpatialClaw 是一篇被 NeurIPS 2026 接收的论文,主张用动作接口而非更大的世界模型来提升智能体的空间推理能力。
Hugging Face 发布 Open TTS Leaderboard,用客观指标评测开源多语言 TTS 与声音克隆模型,单模型评测耗时从数周投票缩短到数小时。
Google Research 提出 Diffusion Controller 框架,把扩散模型的去噪过程重构为连续控制问题,用一个轻量"转向阻尼"网络在冻结基座模型的前提下动态调整生成轨迹。
typesafe 在 Hugging Face 上线 WorkflowEvals 评测集,同时公开 GitHub 复现仓库和一份名为 evalsafe-onet 的附加数据集。配套博客以 anti-benchmaxxing 为主题,讨论基准刷分问题。
微软研究院正在推进早期研究项目 Quine,目标是构建一个生物学的多模态世界模型。它通过连接不同生物尺度与模态的洞见,帮助科学家以计算方式搜索远超直觉所能覆盖的空间,并在实验前对假设进行优先级排序。实验结果会作为反馈,帮助研究人员校准后续研究方向。
一项研究显示,仅用 5,664 条单词级教师答案做后训练,学生模型在从未见过代码的情况下于 HumanEval+ 上提升 5.34pp。该结果说明后训练会在与训练任务无关的决策上留下行为影子。
Tufa Labs 在 ARC Prize 2026 的 ARC-AGI-3 上将高分从 27.29% 提升至 45.33%,重新夺回第一。这一成绩使其明显领先第二名。