跳到正文

#论文/研究

今日 22 条
今天10月3日周六
  1. X:Rohan Paul (@rohanpaul_ai)78

    研究显示 Claude Opus 5 在会计任务上 20 题全对,12 名注册会计师正确率 0% 至约 90%

    一项针对中等长度、定义明确的会计任务的研究发现,前沿 AI 模型比初级会计师更快更准确,甚至优于研究中表现最好的会计师。Claude Opus 5 在 20 道题中取得 20 题全对、正确率 100%,每题几分钟内完成;12 名持证注册会计师的正确率从 0% 到约 90% 不等,其中数人用完了 3 小时时限。研究还提到,18 个月前这些模型在同类任务上的得分远低于人类会计师。

  2. X:Rohan Paul (@rohanpaul_ai)36

    腾讯 SkillAdam:让 AI 自动改进智能体技能指令,准确率 28.3% 且 token 消耗降至约三分之一

    腾讯论文提出 SkillAdam,让 AI 自动改进智能体技能指令时记录已修复的问题,并在效果不稳定时只做小幅修改。在长程购物与旅行规划任务上,它平均准确率达 28.3%,高于此前最佳方法 SkillOpt 的 21.7%,token 用量约为后者的三分之一。该方法针对自动改写指令常陷入反复、新改动推翻已有修复的问题。

  3. X:马东锡 NLP (@dongxi_nlp)62

    Hinton 等发布论文探讨 AI 研发自动化是否会引发智能爆炸

    Geoffrey Hinton 转发并推荐了一篇论文,讨论 AI 研发自动化是否会触发智能爆炸。文中提到,递归自我改进导致智能爆炸的想法已存在很久,但直到最近才显得可能很快发生,如今许多顶尖研究者认为它可能不久后出现。论文指出,与一年前相比,AI 系统现在已编写了构建它们的公司内部的大部分代码,链接为 casp.ac/reports/intelligence。

  4. X:AI at Meta (@AIatMeta)62

    Meta 发布数学家与 Muse Spark 协作完成的六篇论文

    Meta 分享六篇论文,来自数学家与 Muse Spark 1.1、Muse Spark 1.2 在 Thinking Mode 下通过常规 meta.ai 聊天界面协作求解开放数学问题,未使用定制研究框架。合作遵循数学家主导研究、第二组数学家评审、论文标注人机撰写段落并致谢所依据的先前研究等原则,对同一问题其他团队的独立解法也予以承认。

10月2日周五
  1. Google Research62

    Google 发布基于 TEE 的新一代联邦学习系统,Gboard 已采用

    Google 宣布推出基于可信执行环境(TEE)的新一代联邦学习系统,为数据匿名化提供可远程验证和审计的保证,Gboard 已采用该系统上线英语和日语下一词预测模型。

    推荐理由:Google 公布基于 TEE 的新一代联邦学习系统设计,并给出 Gboard 已上线的落地情况,可了解隐私可验证训练的一种工程路径。

  2. Hugging Face Blog38

    ServiceNow CoreAI 的 AutoSynthData 如何为企业智能体生成训练数据

    ServiceNow CoreAI 构建了 AutoSynthData,利用目标模型的失败与更强教师的成功来定位能力缺口,并生成、验证新的可执行训练任务,课程随模型进步向仍难的任务迁移。该方法以 EnterpriseOps Gym 数据集演示,任务由系统规范、用户提示词和验证器三部分组成,需满足可行性、真实性与难度要求。

10月1日周四
  1. Microsoft Research34

    微软研究院用机器学习预测电网空间天气风险

    微软研究院实习生开发了一套端到端机器学习流水线,为美国本土 66,935 座变电站生成空间天气风险预测,可提前 30 至 60 分钟预警。系统结合 AE 与 Dst 指数预测、地质电导率和电网数据,在 2020-2026 评估期内检测到近 80% 的重大空间天气事件,其中 Dst 预测在 62.2% 的高活跃时段优于 Burton 方程。

9月30日周三
  1. Simon Willison62

    Anthropic 红队:GLM-5.3 在 100 项漏洞利用任务中 4% 实现完整控制流劫持

    Anthropic Frontier Red Team 在内部 Binary Exploitation 基准的 100 项任务中随机抽取评测,发现 GLM-5.3 在 4% 的试验中实现完整控制流劫持,Claude Mythos Preview 为 6%。报告指出,此前模型如 Claude Opus 4.6 和 GLM-5.2 在这些任务中均未成功,说明一个有意义的能力门槛已被跨过。