UniEvo-VL 一个自进化框架,单个多模态模型同时充当教师和学生,从自身的建设性反馈中学习,在无外部监督的情况下提升图像生成能力。
#论文/研究
#论文/研究
HuggingPapers@HuggingPapersAI 评分 HuggingPapers@HuggingPapersAI 评分 X:Rohan Paul (@rohanpaul_ai)AI 评分 ScienceBuddy 如何让科学智能体从 42.2% 提升到 73.3% 准确率
ScienceBuddy 将用户在对话中的纠正转化为带评分的测试任务,交替改写智能体的提示词与技能、重训模型,把科学智能体准确率从 42.2% 提升到 73.3%。
X:Rohan Paul (@rohanpaul_ai)精选AI 评分 研究显示 Claude Opus 5 在会计任务上 20 题全对,12 名注册会计师正确率 0% 至约 90%
一项针对中等长度、定义明确的会计任务的研究发现,前沿 AI 模型比初级会计师更快更准确,甚至优于研究中表现最好的会计师。Claude Opus 5 在 20 道题中取得 20 题全对、正确率 100%,每题几分钟内完成;12 名持证注册会计师的正确率从 0% 到约 90% 不等,其中数人用完了 3 小时时限。研究还提到,18 个月前这些模型在同类任务上的得分远低于人类会计师。
X:Rohan Paul (@rohanpaul_ai)AI 评分 伯克利论文:LLM 常沿用旧偏好,智能体需在提示词中写明当前状态
伯克利论文《When Context Changes: Understanding Update Failures in LLMs》发现,当偏好或截止时间等发生变化时,旧版本仍留在上下文中,模型虽掌握新值,注意力却持续漂回旧提及。
X:Rohan Paul (@rohanpaul_ai)AI 评分 NVIDIA 论文:长任务中模型准确率下降,建议给条目编号并分批处理
NVIDIA 新论文测试 7 个开源模型在加数字、排序列表等简单重复任务上的表现,128K token 任务的平均准确率比 4K token 任务低 62.8%,最好的模型在最长的任务中也只有 17.1% 全部答对。
X:Rohan Paul (@rohanpaul_ai)AI 评分 腾讯 SkillAdam:让 AI 自动改进智能体技能指令,准确率 28.3% 且 token 消耗降至约三分之一
腾讯论文提出 SkillAdam,让 AI 自动改进智能体技能指令时记录已修复的问题,并在效果不稳定时只做小幅修改。在长程购物与旅行规划任务上,它平均准确率达 28.3%,高于此前最佳方法 SkillOpt 的 21.7%,token 用量约为后者的三分之一。该方法针对自动改写指令常陷入反复、新改动推翻已有修复的问题。
X:Rohan Paul (@rohanpaul_ai)AI 评分 AgentBug-Smith:自动复现智能体系统中的真实 harness bug
论文 AgentBug-Smith 提出自动复现智能体系统中真实 harness bug 的方法,指出这类 bug 具有独特特征,当前最先进的软件智能体仍难以修复。现有 benchmark 也进一步阻碍了该方向的进展。
X:Rohan Paul (@rohanpaul_ai)AI 评分 研究:编程智能体仅修复 9% 的 Agent 框架 bug,AgentBug-Smith 基准发布
来自中美顶尖实验室的论文提出 AgentBug-Smith,可将真实 GitHub bug 报告自动转化为可运行测试,构建出持续增长的 200 个 bug 基准。3 个编程智能体中表现最好的仅修复 9% 的 Agent 框架 bug,而普通软件 bug 的修复率约为 40%。一份过往修复经验简编让某智能体在 79 个未见 bug 上的正确修复数从 1 提升到 6。
X:Rohan Paul (@rohanpaul_ai)AI 评分 BIS 报告:2021 至 2025 年 AI 公司超半数投资来自同行
国际清算银行(BIS)发布关于 AI 公司循环融资的报告,2021 至 2025 年间同行贡献了 AI 公司投资额的 55.2%,AI 投资者自身交易额的 28.7% 流向 AI 标的。
X:Rohan Paul (@rohanpaul_ai)AI 评分 BIS 报告:AI 企业 55.2% 融资来自其他 AI 公司
国际清算银行(BIS)发布关于 AI 公司循环融资的报告,2021 至 2025 年间 AI 企业获得的投资中 55.2% 来自其他 AI 公司,而 AI 投资方投出的资金中只有 28.7% 流向 AI 企业。
TechCrunch · AIAI 评分Graphite 研究:Claude Opus 5.5 最爱说“this matters”,各模型写作痕迹各不相同
Graphite 研究发现 Claude Opus 5.5 的写作痕迹是“dependable”一词出现频率比人类样本高 23 倍,“this matters”高 116 倍;OpenAI Astra 则偏爱“another dimension”和“not simply X”式纠正性框架,后者出现频率超人类 100 倍。
cohere@cohereAI 评分 传统 nDCG 只认可基准答案库中已有的结果。RCP-nDCG@10 会根据每条结果的实际相关性进行评分,其结果由人工评审和 MTEB 提供支持。
arena@arenaAI 评分 X:Rohan Paul (@rohanpaul_ai)AI 评分 BIS 报告:2021 至 2025 年 AI 公司超半数投资来自同行
国际清算银行(BIS)发布报告,分析 AI 公司之间的循环融资。2021 至 2025 年间,同行贡献了 AI 公司投资金额的 55.2%,AI 投资方 28.7% 的交易金额流向 AI 标的。
AIatMeta@AIatMetaAI 评分 _akhaliq@_akhaliqAI 评分 自适应奖励路由 通过前向过程 RL 实现联合音视频扩散的动态多奖励优化 论文:huggingface.co/papers/2609.3…
_akhaliq@_akhaliqAI 评分 X:Elvis Saravia (@omarsar0, DAIR.AI)AI 评分 Google Research 发布多智能体证明发现论文,Cogentic 在五个开放问题上取得新结果
Google Research 发布多智能体证明发现论文,其系统 Cogentic 基于 Gemini,从问题陈述出发、无需专家提示,在理论计算机科学的五个开放问题上取得新结果,涉及在线学习、拍卖理论和机制设计,每个结果均由领域专家核验。
scottgeng00@scottgeng00AI 评分 dair_ai@dair_aiAI 评分 DAIR.AI 介绍 NVIDIA 关于长程智能体的论文:模型即使接受 128K tokens 上下文,任务执行越久越容易出错。
Google Research精选AI 评分Google 发布基于 TEE 的新一代联邦学习系统,Gboard 已采用
Google 宣布推出基于可信执行环境(TEE)的新一代联邦学习系统,为数据匿名化提供可远程验证和审计的保证,Gboard 已采用该系统上线英语和日语下一词预测模型。
推荐理由:Google 公布基于 TEE 的新一代联邦学习系统设计,并给出 Gboard 已上线的落地情况,可了解隐私可验证训练的一种工程路径。
guohao_li@guohao_liAI 评分
The DecoderAI 评分Mercor 研究:AI 在记账任务上速度与准确率超过持证会计师,但仍无法独立完成结账
Mercor 的一项研究让 12 名平均有 5.5 年经验的持证 CPA 完成 APEX Accounting Benchmark 中的简化任务,结果显示 AI 模型在结构化记账任务上比会计师更快、更准确且成本更低。
Hugging Face BlogAI 评分
ServiceNow CoreAI 的 AutoSynthData 如何为企业智能体生成训练数据
ServiceNow CoreAI 构建了 AutoSynthData,利用目标模型的失败与更强教师的成功来定位能力缺口,并生成、验证新的可执行训练任务,课程随模型进步向仍难的任务迁移。该方法以 EnterpriseOps Gym 数据集演示,任务由系统规范、用户提示词和验证器三部分组成,需满足可行性、真实性与难度要求。
HuggingPapers@HuggingPapersAI 评分
Ars Technica · AIAI 评分CMU 等团队用 16 块 GPU 训练的 Ataraxos 以 15 比 1 击败最强 Stratego 人类选手
卡内基梅隆、MIT、纽约大学和斯坦福的研究团队开发的 AI 系统 Ataraxos 以 15 胜 1 负 4 平击败被认为是史上最强的 Stratego 选手 Pim Niemeijer,训练仅用 16 块 GPU、花费几千美元。
_akhaliq@_akhaliqAI 评分 LongLive-Plug Once-for-All Distillation for Video Generation paper: huggingface.co/papers/2609.3…
_akhaliq@_akhaliqAI 评分 Omni-IO Skills Harnessing Your Agent Omni-Native paper: huggingface.co/papers/2609.3…
_akhaliq@_akhaliqAI 评分 LEGO-Anything 用于3D场景重建的编码智能体 论文:huggingface.co/papers/2609.3…
andrezfu@andrezfuAI 评分 智能体写应用代码,但出问题时你凌晨 2 点还是得被叫醒。 我们想知道 AI 能否也处理这部分工作。 推出 Incident Arena:一个让编码智能体值班的基准! 查看下方论文与完整数据集发布!
Microsoft ResearchAI 评分 微软研究院用机器学习预测电网空间天气风险
微软研究院实习生开发了一套端到端机器学习流水线,为美国本土 66,935 座变电站生成空间天气风险预测,可提前 30 至 60 分钟预警。系统结合 AE 与 Dst 指数预测、地质电导率和电网数据,在 2020-2026 评估期内检测到近 80% 的重大空间天气事件,其中 Dst 预测在 62.2% 的高活跃时段优于 Burton 方程。
Ars Technica · AIAI 评分Google DeepMind 用 SynthIDBio 为 AI 设计的蛋白质加水印
Google DeepMind 团队发表论文,提出基于 SynthID 的蛋白质水印方案 SynthIDBio,可在不损害蛋白质功能的前提下,在 ProteinMPNN 设计的蛋白质序列中嵌入可检测的水印,用于生物安全筛查。
TencentHunyuan@TencentHunyuanAI 评分 natolambert@natolambertAI 评分 当前的框架在LLM管理自身上下文方面设置非常僵化。我们证明可以让LLM直接编辑上下文——从而实现更好的长期记忆、FLOP高效的适应等。 不要再害怕上下文压缩了!
OpenBMB@OpenBMBAI 评分 面壁智能 OpenBMB 等团队提出 Diffusion Reward Models(DRM),不再把人类偏好压缩成单一分数,而是学习完整奖励分布,保留分歧、不确定性与多种合理判断。
frxiaobei@frxiaobeiAI 评分 Anthropic 发布文章评估智谱 GLM-5.3 的网络攻击能力,按其测试 GLM-5.3 在 Chrome V8 漏洞利用任务中的成功率接近 Claude Mythos Preview。
_akhaliq@_akhaliqAI 评分 Simon WillisonAI 评分 Anthropic 红队:GLM-5.3 在 100 项漏洞利用任务中 4% 实现完整控制流劫持
Anthropic Frontier Red Team 在内部 Binary Exploitation 基准的 100 项任务中随机抽取评测,发现 GLM-5.3 在 4% 的试验中实现完整控制流劫持,Claude Mythos Preview 为 6%。报告指出,此前模型如 Claude Opus 4.6 和 GLM-5.2 在这些任务中均未成功,说明一个有意义的能力门槛已被跨过。
X:Ethan Mollick (@emollick)AI 评分 Anthropic 研究:GLM-5.3 可自主构建端到端网络攻击利用且缺乏滥用防护
Anthropic 发布研究,指出 GLM-5.3 能够自主构建端到端的网络攻击利用,与其他前沿模型不同,它在发布时没有设置有效限制滥用的防护措施。研究主题为 GLM-5.3 与高级网络攻击能力的扩散,原文链接为 anthropic.com。