UniEvo-VL:单模型自进化框架,无需外部监督提升图像生成
UniEvo-VL 是一个自进化框架,让单个多模态模型同时充当教师和学生,从自身建设性反馈中学习,在无外部监督下提升图像生成能力。该框架由 AK 在 X 上分享,发布于 10 月 1 日。
UniEvo-VL 是一个自进化框架,让单个多模态模型同时充当教师和学生,从自身建设性反馈中学习,在无外部监督下提升图像生成能力。该框架由 AK 在 X 上分享,发布于 10 月 1 日。
一种新的在线策略蒸馏方法通过外推 RL 引发的表征残差,让学生在四组模型对上匹配甚至超越教师模型。该方法将教师视为方向而非终点,代码和 checkpoint 计划发布。
ARC Prize 公布 2026 年 ARC-AGI-3 Milestone #2 三位获奖者,均开源了各自得分最高的解法:Daniel Franzen 以 27.9% 获 2.5 万美元,Lord Han Solo 以 23.8% 获 7500 美元,Lohit Siriki 以 22.5% 获 5000 美元。
ARC Prize 2026 公布 ARC-AGI-3 里程碑 #2 的三位获奖者,均开源了各自得分最高的解法:Daniel Franzen 以 27.9% 获 $25K,Lord Han Solo 以 23.8% 获 $7.5K,Lohit Siriki 以 22.5% 获 $5K。
ScienceBuddy 将用户在对话中的纠正转化为带评分的测试任务,交替改写智能体的提示词与技能、重训模型,把科学智能体准确率从 42.2% 提升到 73.3%。
伯克利论文《When Context Changes: Understanding Update Failures in LLMs》发现,当偏好或截止时间等发生变化时,旧版本仍留在上下文中,模型虽掌握新值,注意力却持续漂回旧提及。
NVIDIA 新论文测试 7 个开源模型在加数字、排序列表等简单重复任务上的表现,128K token 任务的平均准确率比 4K token 任务低 62.8%,最好的模型在最长的任务中也只有 17.1% 全部答对。
腾讯论文提出 SkillAdam,让 AI 自动改进智能体技能指令时记录已修复的问题,并在效果不稳定时只做小幅修改。在长程购物与旅行规划任务上,它平均准确率达 28.3%,高于此前最佳方法 SkillOpt 的 21.7%,token 用量约为后者的三分之一。该方法针对自动改写指令常陷入反复、新改动推翻已有修复的问题。
论文 AgentBug-Smith 提出自动复现智能体系统中真实 harness bug 的方法,指出这类 bug 具有独特特征,当前最先进的软件智能体仍难以修复。现有 benchmark 也进一步阻碍了该方向的进展。
美中多家实验室的论文提出 AgentBug-Smith,把 GitHub 上智能体框架的真实 bug 报告自动转成可运行测试,形成一套 200 个 bug 且持续增长的基准。
Graphite 研究发现 Claude Opus 5.5 的写作痕迹是“dependable”一词出现频率比人类样本高 23 倍,“this matters”高 116 倍;OpenAI Astra 则偏爱“another dimension”和“not simply X”式纠正性框架,后者出现频率超人类 100 倍。
Arena 发布文生图模型后训练研究,认为人类偏好奖励必要但不充分,偏好模型仍会奖励细节缺失、加入未要求内容等 reward-hacking 输出。
Arena 研究提出前沿图像模型后训练的复合奖励方案,认为人类偏好奖励必要但不充分,偏好模型仍可能奖励细节缺失、引入未请求内容等 reward-hacking 行为。
Repovive 联合 IOI、IMO、ICPC 决赛选手评测 AI 判卷能力,从数学竞赛中选出 534 份可疑或边缘提交,建立统一评分标准与专家参考判断。模型整体偏严,更常拒绝有效提交;清晰指令让 GPT 模型平均提升约 2 个百分点,加入评分示例后 Claude 平均提升约 10 个百分点、GPT 约 5 个百分点。Grok 几乎拒绝一切,仅接受 1–5% 提交,而金标准接受 64.4%。
Geoffrey Hinton 转发并推荐了一篇论文,讨论 AI 研发自动化是否会触发智能爆炸。文中提到,递归自我改进导致智能爆炸的想法已存在很久,但直到最近才显得可能很快发生,如今许多顶尖研究者认为它可能不久后出现。论文指出,与一年前相比,AI 系统现在已编写了构建它们的公司内部的大部分代码,链接为 casp.ac/reports/intelligence。
Meta 研究博客发布《Solving Open Research Problems Together》,介绍数学家与 Muse Spark 合作完成六篇研究论文。该内容为 AI at Meta 转推并附上研究博客链接。
Meta 团队借助 Muse Spark 在非结合代数中找到了一个反例,推翻了受生物学启发提出的数学结构规则。他们进一步给出替代刻画,并由研究人员核验与完善。相关论文已发布在 Meta 研究页面。
Meta 分享六篇论文,来自数学家与 Muse Spark 1.1、Muse Spark 1.2 在 Thinking Mode 下通过常规 meta.ai 聊天界面协作求解开放数学问题,未使用定制研究框架。合作遵循数学家主导研究、第二组数学家评审、论文标注人机撰写段落并致谢所依据的先前研究等原则,对同一问题其他团队的独立解法也予以承认。
论文 Adaptive Reward Routing 提出通过前向过程 RL 为音视频联合扩散模型做动态多奖励优化,取代单一评分方案。该方法面向生成式媒体,论文已在 HuggingFace 上线(2609.37200)。
研究提出 EgoTools,聚焦真实第一视角视频中的工具中心推理,解决多数智能体演示忽略的"手中持有什么工具、如何使用"问题。该工作关注跨镜头切换时的工具身份保持,作者称首次尝试在镜头移开的瞬间就丢失了螺丝刀。论文已发布在 HuggingFace,编号 2609.39378。
Google Research 发布多智能体证明发现论文,其系统 Cogentic 基于 Gemini,从问题陈述出发、无需专家提示,在在线学习、拍卖理论和机制设计五个开放问题上取得新结果,每个结果均由领域专家核查。
Gacha Decoding 通过给 LM 配备 RNG 工具并让其"掷骰规划",把多样性来源从 token 熵转向指令遵循,样本效率比此前方法提升逾 11 倍。
NVIDIA 发布关于长时程智能体的论文,提出 Long-Transduction 测试方法,要求模型在数千次输出中持续读取、更新并输出依赖状态的结果,并分别改变三个因素。
Google 宣布推出基于可信执行环境(TEE)的新一代联邦学习系统,为数据匿名化提供可远程验证和审计的保证,Gboard 已采用该系统上线英语和日语下一词预测模型。
推荐理由:Google 公布基于 TEE 的新一代联邦学习系统设计,并给出 Gboard 已上线的落地情况,可了解隐私可验证训练的一种工程路径。
SETA(Scaling Environments for Terminal Agents)被 NeurIPS 2026 Evaluations & Datasets Track 接收,并发布 SETA-Env 数据集,包含 4500+ 个开源可验证终端 RL 环境及完整的合成与训练管线。
Mercor 的一项研究让 12 名平均有 5.5 年经验的持证 CPA 完成 APEX Accounting Benchmark 中的简化任务,结果显示 AI 模型在结构化记账任务上比会计师更快、更准确且成本更低。
ServiceNow CoreAI 构建了 AutoSynthData,利用目标模型的失败与更强教师的成功来定位能力缺口,并生成、验证新的可执行训练任务,课程随模型进步向仍难的任务迁移。该方法以 EnterpriseOps Gym 数据集演示,任务由系统规范、用户提示词和验证器三部分组成,需满足可行性、真实性与难度要求。
AREX-2 是一个 27B 智能体,通过长时程反思任务实现自我改进,在可验证的 ML 与算法任务上训练,测试时轮次越多解越好。它在 MLE-bench Lite 上取得 81.8,在 Frontier-CS 上取得 70.7,并可迁移到深度研究任务。
ARC Prize 公布了 Qwen3.8-27B 在 ARC-AGI 上的完整测试结果,并同步给出排行榜、公开结果复现方式与测试政策。相关结果可在 ARC Prize 排行榜查看,复现脚本托管于 arcprize/arc-agi-benchmarking 仓库。
PostTrainBench v1.2 发布,新增云 GPU 支持,可通过 Harbor adapter 在 Harbor + Modal 上以相同设置运行基准测试。
卡内基梅隆、MIT、纽约大学和斯坦福的研究团队开发的 AI 系统 Ataraxos 以 15 胜 1 负 4 平击败被认为是史上最强的 Stratego 选手 Pim Niemeijer,训练仅用 16 块 GPU、花费几千美元。
LongLive-Plug 提出一种面向视频生成的一次性(one-step)通用蒸馏方法,可让长时长视频生成更易部署,并为需要快速出片的创作者节省算力与时间。该方法无需多次迭代即可完成蒸馏。
Omni-IO Skills 是一篇关于让 AI 智能体实现 Omni-Native 能力的论文,已在 Hugging Face 上线(论文编号 2609.31847)。该工作聚焦于为智能体赋予全模态输入输出技能,具体方法与结果细节尚未在公开信息中展开。
LEGO-Anything 提出用编码智能体(Coding Agents)完成 3D 场景重建,论文已发布在 Hugging Face Papers(编号 2609.36380)。该工作将 3D 场景重建任务交给编码智能体处理,并附有演示视频。
微软研究院实习生开发了一套端到端机器学习流水线,为美国本土 66,935 座变电站生成空间天气风险预测,可提前 30 至 60 分钟预警。系统结合 AE 与 Dst 指数预测、地质电导率和电网数据,在 2020-2026 评估期内检测到近 80% 的重大空间天气事件,其中 Dst 预测在 62.2% 的高活跃时段优于 Burton 方程。
Google DeepMind 团队发表论文,提出基于 SynthID 的蛋白质水印方案 SynthIDBio,可在不损害蛋白质功能的前提下,在 ProteinMPNN 设计的蛋白质序列中嵌入可检测的水印,用于生物安全筛查。
面壁智能 OpenBMB 发布 Diffusion Reward Models(DRM),不再把人类偏好压缩成单一分数,而是学习完整奖励分布,保留分歧、不确定性与多种可能判断。
SpatialClaw 是一篇被 NeurIPS 2026 接收的论文,主张用动作接口而非更大的世界模型来提升智能体的空间推理能力。
Hugging Face 发布 Open TTS Leaderboard,用客观指标评测开源多语言 TTS 与声音克隆模型,单模型评测耗时从数周投票缩短到数小时。
Google Research 提出 Diffusion Controller 框架,把扩散模型的去噪过程重构为连续控制问题,用一个轻量"转向阻尼"网络在冻结基座模型的前提下动态调整生成轨迹。