UniEvo-VL:单模型自进化框架,无需外部监督提升图像生成
UniEvo-VL 是一个自进化框架,让单个多模态模型同时充当教师和学生,从自身建设性反馈中学习,在无外部监督下提升图像生成能力。该框架由 AK 在 X 上分享,发布于 10 月 1 日。
UniEvo-VL 是一个自进化框架,让单个多模态模型同时充当教师和学生,从自身建设性反馈中学习,在无外部监督下提升图像生成能力。该框架由 AK 在 X 上分享,发布于 10 月 1 日。
一种新的在线策略蒸馏方法通过外推 RL 引发的表征残差,让学生在四组模型对上匹配甚至超越教师模型。该方法将教师视为方向而非终点,代码和 checkpoint 计划发布。
ScienceBuddy 将用户在对话中的纠正转化为带评分的测试任务,交替改写智能体的提示词与技能、重训模型,把科学智能体准确率从 42.2% 提升到 73.3%。
一项针对中等长度、定义明确的会计任务的研究发现,前沿 AI 模型比初级会计师更快更准确,甚至优于研究中表现最好的会计师。Claude Opus 5 在 20 道题中取得 20 题全对、正确率 100%,每题几分钟内完成;12 名持证注册会计师的正确率从 0% 到约 90% 不等,其中数人用完了 3 小时时限。研究还提到,18 个月前这些模型在同类任务上的得分远低于人类会计师。
伯克利论文《When Context Changes: Understanding Update Failures in LLMs》发现,当偏好或截止时间等发生变化时,旧版本仍留在上下文中,模型虽掌握新值,注意力却持续漂回旧提及。
NVIDIA 新论文测试 7 个开源模型在加数字、排序列表等简单重复任务上的表现,128K token 任务的平均准确率比 4K token 任务低 62.8%,最好的模型在最长的任务中也只有 17.1% 全部答对。
腾讯论文提出 SkillAdam,让 AI 自动改进智能体技能指令时记录已修复的问题,并在效果不稳定时只做小幅修改。在长程购物与旅行规划任务上,它平均准确率达 28.3%,高于此前最佳方法 SkillOpt 的 21.7%,token 用量约为后者的三分之一。该方法针对自动改写指令常陷入反复、新改动推翻已有修复的问题。
论文 AgentBug-Smith 提出自动复现智能体系统中真实 harness bug 的方法,指出这类 bug 具有独特特征,当前最先进的软件智能体仍难以修复。现有 benchmark 也进一步阻碍了该方向的进展。
美中多家实验室的论文提出 AgentBug-Smith,把 GitHub 上智能体框架的真实 bug 报告自动转成可运行测试,形成一套 200 个 bug 且持续增长的基准。
国际清算银行(BIS)发布关于 AI 公司循环融资的报告,2021 至 2025 年间同行贡献了 AI 公司投资额的 55.2%,AI 投资者自身交易额的 28.7% 流向 AI 标的。
国际清算银行(BIS)发布关于 AI 公司循环融资的报告,2021 至 2025 年间 AI 企业获得的投资中 55.2% 来自其他 AI 公司,而 AI 投资方投出的资金中只有 28.7% 流向 AI 企业。
Graphite 研究发现 Claude Opus 5.5 的写作痕迹是“dependable”一词出现频率比人类样本高 23 倍,“this matters”高 116 倍;OpenAI Astra 则偏爱“another dimension”和“not simply X”式纠正性框架,后者出现频率超人类 100 倍。
Arena 发布文生图模型后训练研究,认为人类偏好奖励必要但不充分,偏好模型仍会奖励细节缺失、加入未要求内容等 reward-hacking 输出。
Arena 研究提出前沿图像模型后训练的复合奖励方案,认为人类偏好奖励必要但不充分,偏好模型仍可能奖励细节缺失、引入未请求内容等 reward-hacking 行为。
Geoffrey Hinton 转发并推荐了一篇论文,讨论 AI 研发自动化是否会触发智能爆炸。文中提到,递归自我改进导致智能爆炸的想法已存在很久,但直到最近才显得可能很快发生,如今许多顶尖研究者认为它可能不久后出现。论文指出,与一年前相比,AI 系统现在已编写了构建它们的公司内部的大部分代码,链接为 casp.ac/reports/intelligence。
国际清算银行(BIS)发布报告,分析 AI 公司之间的循环融资。2021 至 2025 年间,同行贡献了 AI 公司投资金额的 55.2%,AI 投资方 28.7% 的交易金额流向 AI 标的。
Meta 研究博客发布《Solving Open Research Problems Together》,介绍数学家与 Muse Spark 合作完成六篇研究论文。该内容为 AI at Meta 转推并附上研究博客链接。
Meta 团队借助 Muse Spark 在非结合代数中找到了一个反例,推翻了受生物学启发提出的数学结构规则。他们进一步给出替代刻画,并由研究人员核验与完善。相关论文已发布在 Meta 研究页面。
Meta 分享六篇论文,来自数学家与 Muse Spark 1.1、Muse Spark 1.2 在 Thinking Mode 下通过常规 meta.ai 聊天界面协作求解开放数学问题,未使用定制研究框架。合作遵循数学家主导研究、第二组数学家评审、论文标注人机撰写段落并致谢所依据的先前研究等原则,对同一问题其他团队的独立解法也予以承认。
论文 Adaptive Reward Routing 提出通过前向过程 RL 为音视频联合扩散模型做动态多奖励优化,取代单一评分方案。该方法面向生成式媒体,论文已在 HuggingFace 上线(2609.37200)。
研究提出 EgoTools,聚焦真实第一视角视频中的工具中心推理,解决多数智能体演示忽略的"手中持有什么工具、如何使用"问题。该工作关注跨镜头切换时的工具身份保持,作者称首次尝试在镜头移开的瞬间就丢失了螺丝刀。论文已发布在 HuggingFace,编号 2609.39378。
Google Research 发布多智能体证明发现论文,其系统 Cogentic 基于 Gemini,从问题陈述出发、无需专家提示,在在线学习、拍卖理论和机制设计五个开放问题上取得新结果,每个结果均由领域专家核查。
Gacha Decoding 通过给 LM 配备 RNG 工具并让其"掷骰规划",把多样性来源从 token 熵转向指令遵循,样本效率比此前方法提升逾 11 倍。
NVIDIA 发布关于长时程智能体的论文,提出 Long-Transduction 测试方法,要求模型在数千次输出中持续读取、更新并输出依赖状态的结果,并分别改变三个因素。
Google 宣布推出基于可信执行环境(TEE)的新一代联邦学习系统,为数据匿名化提供可远程验证和审计的保证,Gboard 已采用该系统上线英语和日语下一词预测模型。
推荐理由:Google 公布基于 TEE 的新一代联邦学习系统设计,并给出 Gboard 已上线的落地情况,可了解隐私可验证训练的一种工程路径。
SETA(Scaling Environments for Terminal Agents)被 NeurIPS 2026 Evaluations & Datasets Track 接收,并发布 SETA-Env 数据集,包含 4500+ 个开源可验证终端 RL 环境及完整的合成与训练管线。
Mercor 的一项研究让 12 名平均有 5.5 年经验的持证 CPA 完成 APEX Accounting Benchmark 中的简化任务,结果显示 AI 模型在结构化记账任务上比会计师更快、更准确且成本更低。
ServiceNow CoreAI 构建了 AutoSynthData,利用目标模型的失败与更强教师的成功来定位能力缺口,并生成、验证新的可执行训练任务,课程随模型进步向仍难的任务迁移。该方法以 EnterpriseOps Gym 数据集演示,任务由系统规范、用户提示词和验证器三部分组成,需满足可行性、真实性与难度要求。
AREX-2 是一个 27B 智能体,通过长时程反思任务实现自我改进,在可验证的 ML 与算法任务上训练,测试时轮次越多解越好。它在 MLE-bench Lite 上取得 81.8,在 Frontier-CS 上取得 70.7,并可迁移到深度研究任务。
卡内基梅隆、MIT、纽约大学和斯坦福的研究团队开发的 AI 系统 Ataraxos 以 15 胜 1 负 4 平击败被认为是史上最强的 Stratego 选手 Pim Niemeijer,训练仅用 16 块 GPU、花费几千美元。
LongLive-Plug 提出一种面向视频生成的一次性(one-step)通用蒸馏方法,可让长时长视频生成更易部署,并为需要快速出片的创作者节省算力与时间。该方法无需多次迭代即可完成蒸馏。
Omni-IO Skills 是一篇关于让 AI 智能体实现 Omni-Native 能力的论文,已在 Hugging Face 上线(论文编号 2609.31847)。该工作聚焦于为智能体赋予全模态输入输出技能,具体方法与结果细节尚未在公开信息中展开。
LEGO-Anything 提出用编码智能体(Coding Agents)完成 3D 场景重建,论文已发布在 Hugging Face Papers(编号 2609.36380)。该工作将 3D 场景重建任务交给编码智能体处理,并附有演示视频。
微软研究院实习生开发了一套端到端机器学习流水线,为美国本土 66,935 座变电站生成空间天气风险预测,可提前 30 至 60 分钟预警。系统结合 AE 与 Dst 指数预测、地质电导率和电网数据,在 2020-2026 评估期内检测到近 80% 的重大空间天气事件,其中 Dst 预测在 62.2% 的高活跃时段优于 Burton 方程。
Google DeepMind 团队发表论文,提出基于 SynthID 的蛋白质水印方案 SynthIDBio,可在不损害蛋白质功能的前提下,在 ProteinMPNN 设计的蛋白质序列中嵌入可检测的水印,用于生物安全筛查。
面壁智能 OpenBMB 发布 Diffusion Reward Models(DRM),不再把人类偏好压缩成单一分数,而是学习完整奖励分布,保留分歧、不确定性与多种可能判断。
SpatialClaw 是一篇被 NeurIPS 2026 接收的论文,主张用动作接口而非更大的世界模型来提升智能体的空间推理能力。
Anthropic Frontier Red Team 在内部 Binary Exploitation 基准的 100 项任务中随机抽取评测,发现 GLM-5.3 在 4% 的试验中实现完整控制流劫持,Claude Mythos Preview 为 6%。报告指出,此前模型如 Claude Opus 4.6 和 GLM-5.2 在这些任务中均未成功,说明一个有意义的能力门槛已被跨过。
Google Research 提出 Diffusion Controller 框架,把扩散模型的去噪过程重构为连续控制问题,用一个轻量"转向阻尼"网络在冻结基座模型的前提下动态调整生成轨迹。
一项研究显示,仅用 5,664 条单词级教师答案做后训练,学生模型在从未见过代码的情况下于 HumanEval+ 上提升 5.34pp。该结果说明后训练会在与训练任务无关的决策上留下行为影子。