跳到正文

#论文/研究

今日 0 条
10月10日周六
10月9日周五
10月5日周一
  1. Import AI57

    Import AI 475:智能体群体扩展、SynthID Bio 生物水印与 AI 科学经济

    Jack Clark 在本期 Import AI 中讨论了 Toby Ord 关于智能体群体(swarm)扩展的分析:群体作为新的推理扩展形式,4 个智能体的群体用约两倍总 token 达到同等性能,但因并行只需一半时间;群体规模扩大 10x 只带来 3x 到 5x 的性能提升,存在类似经济学中踩脚效应的收益递减,但仍可能提高 RSI 驱动智能爆炸的概率。

10月4日周日
10月3日周六
  1. X:Ethan Mollick (@emollick)62

    研究称前沿 AI 模型在会计任务上已快于并准于初级会计师

    一项研究指出,在中等长度、定义明确的会计任务上,前沿 AI 模型现在比初级会计师更快、更准确,甚至优于研究中表现最好的那位会计师。作者提到,18 个月前这些模型的得分还远低于人类会计师。相关讨论见 Mercor 博客文章《Human Baselines for Benchmarks: AI Now Outperforms Junior Accountants》。

  2. X:Rohan Paul (@rohanpaul_ai)78

    研究显示 Claude Opus 5 在会计任务上 20 题全对,12 名注册会计师正确率 0% 至约 90%

    一项针对中等长度、定义明确的会计任务的研究发现,前沿 AI 模型比初级会计师更快更准确,甚至优于研究中表现最好的会计师。Claude Opus 5 在 20 道题中取得 20 题全对、正确率 100%,每题几分钟内完成;12 名持证注册会计师的正确率从 0% 到约 90% 不等,其中数人用完了 3 小时时限。研究还提到,18 个月前这些模型在同类任务上的得分远低于人类会计师。

9月30日周三
9月28日周一
9月23日周三
8月10日周一
  1. Import AI32

    Import AI 468:23 条 RSI 政策建议、PostTrainBench+,以及信任与透明度如何影响 AI 竞赛

    Import AI 第 468 期汇总了智库 IFP 提出的 23 条"低后悔"政策建议,分属 7 个类别,用于应对 AI 研发自动化带来的风险。MIT 与 Columbia 的论文《Racing to Ruin》分析称,竞争对手间实现协调减速取决于技术开发的透明度与对彼此可信度的判断:低信任下所有均衡都奔向灾难,高信任下两家理性企业永远竞赛的概率随理性先验比值平方衰减。

7月6日周一
6月30日周二
6月8日周一
5月11日周一
  1. Import AI22

    Import AI 456:RSI 与经济增长、AI 监管的"激进可选性"、以及神经计算机

    Institute for Law & AI 提出"激进可选性"监管思路,主张政府短期避免过度监管,同时建设信息收集、举报人保护、评估与人才等能力,为 AI 剧变保留政策工具。Meta 与 KAIST 的论文提出 Neural Computer,尝试用神经网络在学习到的运行时状态中统一计算、内存与 I/O。