跳到正文

全部动态

今日 21 条
今天10月3日周六
  1. X:Rohan Paul (@rohanpaul_ai)36

    腾讯 SkillAdam:让 AI 自动改进智能体技能指令,准确率 28.3% 且 token 消耗降至约三分之一

    腾讯论文提出 SkillAdam,让 AI 自动改进智能体技能指令时记录已修复的问题,并在效果不稳定时只做小幅修改。在长程购物与旅行规划任务上,它平均准确率达 28.3%,高于此前最佳方法 SkillOpt 的 21.7%,token 用量约为后者的三分之一。该方法针对自动改写指令常陷入反复、新改动推翻已有修复的问题。

  2. X:Karina Nguyen(@karinanguyen)41

    Repovive 数学竞赛 AI 判卷评测:GPT 与 Claude 模型评判数学证明的能力对比

    Repovive 联合 IOI、IMO、ICPC 决赛选手评测 AI 判卷能力,从数学竞赛中选出 534 份可疑或边缘提交,建立统一评分标准与专家参考判断。模型整体偏严,更常拒绝有效提交;清晰指令让 GPT 模型平均提升约 2 个百分点,加入评分示例后 Claude 平均提升约 10 个百分点、GPT 约 5 个百分点。Grok 几乎拒绝一切,仅接受 1–5% 提交,而金标准接受 64.4%。

  3. X:马东锡 NLP (@dongxi_nlp)62

    Hinton 等发布论文探讨 AI 研发自动化是否会引发智能爆炸

    Geoffrey Hinton 转发并推荐了一篇论文,讨论 AI 研发自动化是否会触发智能爆炸。文中提到,递归自我改进导致智能爆炸的想法已存在很久,但直到最近才显得可能很快发生,如今许多顶尖研究者认为它可能不久后出现。论文指出,与一年前相比,AI 系统现在已编写了构建它们的公司内部的大部分代码,链接为 casp.ac/reports/intelligence。

  4. X:AI at Meta (@AIatMeta)62

    Meta 发布数学家与 Muse Spark 协作完成的六篇论文

    Meta 分享六篇论文,来自数学家与 Muse Spark 1.1、Muse Spark 1.2 在 Thinking Mode 下通过常规 meta.ai 聊天界面协作求解开放数学问题,未使用定制研究框架。合作遵循数学家主导研究、第二组数学家评审、论文标注人机撰写段落并致谢所依据的先前研究等原则,对同一问题其他团队的独立解法也予以承认。

10月2日周五
  1. Google Research62

    Google 发布基于 TEE 的新一代联邦学习系统,Gboard 已采用

    Google 宣布推出基于可信执行环境(TEE)的新一代联邦学习系统,为数据匿名化提供可远程验证和审计的保证,Gboard 已采用该系统上线英语和日语下一词预测模型。

    推荐理由:Google 公布基于 TEE 的新一代联邦学习系统设计,并给出 Gboard 已上线的落地情况,可了解隐私可验证训练的一种工程路径。

  2. Hugging Face Blog38

    ServiceNow CoreAI 的 AutoSynthData 如何为企业智能体生成训练数据

    ServiceNow CoreAI 构建了 AutoSynthData,利用目标模型的失败与更强教师的成功来定位能力缺口,并生成、验证新的可执行训练任务,课程随模型进步向仍难的任务迁移。该方法以 EnterpriseOps Gym 数据集演示,任务由系统规范、用户提示词和验证器三部分组成,需满足可行性、真实性与难度要求。

10月1日周四
  1. Microsoft Research34

    微软研究院用机器学习预测电网空间天气风险

    微软研究院实习生开发了一套端到端机器学习流水线,为美国本土 66,935 座变电站生成空间天气风险预测,可提前 30 至 60 分钟预警。系统结合 AE 与 Dst 指数预测、地质电导率和电网数据,在 2020-2026 评估期内检测到近 80% 的重大空间天气事件,其中 Dst 预测在 62.2% 的高活跃时段优于 Burton 方程。

9月30日周三