ARC Prize 2026:ARC-AGI-3 Milestone #2 三位获奖者开源方案
ARC Prize 公布 2026 年 ARC-AGI-3 Milestone #2 三位获奖者,均开源了各自得分最高的解法:Daniel Franzen 以 27.9% 获 2.5 万美元,Lord Han Solo 以 23.8% 获 7500 美元,Lohit Siriki 以 22.5% 获 5000 美元。
ARC Prize 公布 2026 年 ARC-AGI-3 Milestone #2 三位获奖者,均开源了各自得分最高的解法:Daniel Franzen 以 27.9% 获 2.5 万美元,Lord Han Solo 以 23.8% 获 7500 美元,Lohit Siriki 以 22.5% 获 5000 美元。
ARC Prize 2026 公布 ARC-AGI-3 里程碑 #2 的三位获奖者,均开源了各自得分最高的解法:Daniel Franzen 以 27.9% 获 $25K,Lord Han Solo 以 23.8% 获 $7.5K,Lohit Siriki 以 22.5% 获 $5K。
伯克利论文《When Context Changes: Understanding Update Failures in LLMs》发现,当偏好或截止时间等发生变化时,旧版本仍留在上下文中,模型虽掌握新值,注意力却持续漂回旧提及。
Volantis 完成 8800 万美元 A 轮融资,由 Lachy Groom 和 Abstract 联合领投,John Doerr、Susa Ventures、VXI Capital 和 Triatomic Capital 参投。
Liquid AI 的 D1 模型已在 OpenRouter 上线,这是一个决策模型,输入应用状态和是/否、选择或评分问题,返回带每个选项概率的类型化答案。该模型零数据留存,定价为 $0.04/M 输入、$0 输出,上下文窗口 65K。
SemiAnalysis Weekly 新一期由 Jordan Nanos 主持,Cam Quilici、Bryan Shan 和 Alec Ibarra 参与,InferenceX 团队解析了 Engram 内存卸载、AgentX 利润计算器、TPU v7、Vera Rubin 与 Blackwell 的对比,以及更快的 token 是否值得溢价。
Repovive 联合 IOI、IMO、ICPC 决赛选手评测 AI 判卷能力,从数学竞赛中选出 534 份可疑或边缘提交,建立统一评分标准与专家参考判断。模型整体偏严,更常拒绝有效提交;清晰指令让 GPT 模型平均提升约 2 个百分点,加入评分示例后 Claude 平均提升约 10 个百分点、GPT 约 5 个百分点。Grok 几乎拒绝一切,仅接受 1–5% 提交,而金标准接受 64.4%。
Meta 分享六篇论文,来自数学家与 Muse Spark 1.1、Muse Spark 1.2 在 Thinking Mode 下通过常规 meta.ai 聊天界面协作求解开放数学问题,未使用定制研究框架。合作遵循数学家主导研究、第二组数学家评审、论文标注人机撰写段落并致谢所依据的先前研究等原则,对同一问题其他团队的独立解法也予以承认。
Google Research 发布多智能体证明发现论文,其系统 Cogentic 基于 Gemini,从问题陈述出发、无需专家提示,在在线学习、拍卖理论和机制设计五个开放问题上取得新结果,每个结果均由领域专家核查。
OpenAI 发布 GPT-6 系列模型指南,面向初创公司讲解如何选择 GPT-6 模型、调节推理强度、优化提示词与技能、协调工具调用,并为生产环境准备工作流。
Gacha Decoding 通过给 LM 配备 RNG 工具并让其"掷骰规划",把多样性来源从 token 熵转向指令遵循,样本效率比此前方法提升逾 11 倍。
NVIDIA 发布关于长时程智能体的论文,提出 Long-Transduction 测试方法,要求模型在数千次输出中持续读取、更新并输出依赖状态的结果,并分别改变三个因素。
前 Google DeepMind 研究员指出,LLM 靠逐个预测 token 生成答案,其思维链仍由同一套下一 token 预测产生,并非 AlphaGo 那种独立搜索机制,因此不构成真正的推理。他列举三大缺陷:模型没有显式可检查的认知状态、知识与推理在权重中纠缠不清、思维链常是事后编造。为此他离开 Google DeepMind,主张借鉴 AlphaGo 架构,让系统维护可更新的认知状态。
MIT 的 Alex Zhang 在 Latent Space 播客中介绍了其递归语言模型(RLM)研究,基于 RLM 的 harness 是首个接近解决 ARC-AGI-3 的方案,早于 OpenAI 的 Astra。
OpenAI 的 GPT-6 Astra Ultrafast 已在 NVIDIA Blackwell GPU 上运行,并面向 OpenAI API 以及符合条件的 ChatGPT Work 和 Codex 用户开放。
推荐理由:OpenAI 在 NVIDIA Blackwell 上推出 Astra Ultrafast 模式,读者可了解其相对标准模式的提速幅度与开放入口。
AREX-2 是一个 27B 智能体,通过长时程反思任务实现自我改进,在可验证的 ML 与算法任务上训练,测试时轮次越多解越好。它在 MLE-bench Lite 上取得 81.8,在 Frontier-CS 上取得 70.7,并可迁移到深度研究任务。
ARC Prize 表示 Qwen3.8-27B 的榜单成本是按阿里云公开 token 价格乘以记录的 token 用量估算,而非其专用推理收费。该模型经 Baseten 测试,使用自带 chat template:low 要求思考简短聚焦,xhigh 要求仔细思考并检查假设,medium 两者都不加。ARC-AGI-3 结果将在测试完成后公布。
ARC Prize 公布 Qwen3.8-27B 在 ARC-AGI(Verified)上的测试结果:ARC-AGI v2 得分 42.4%、每任务 0.45 美元,ARC-AGI v1 得分 87.5%、每任务 0.22 美元。
卡内基梅隆、MIT、纽约大学和斯坦福的研究团队开发的 AI 系统 Ataraxos 以 15 胜 1 负 4 平击败被认为是史上最强的 Stratego 选手 Pim Niemeijer,训练仅用 16 块 GPU、花费几千美元。
NVIDIA 提出 AI 工厂的投资回报取决于产出能力、使用寿命与需求三项,其平台通过全栈协同设计同时做到高产出、耐用与通用。SemiAnalysis AgentX 数据显示,Vera Rubin NVL72 每兆瓦吞吐量比 GB300 NVL72 高 30 倍以上,在 DeepSeek V4 Pro 上每百万 token 成本最多低 45 倍。
Google DeepMind 推出 Gemini 4 Argon,面向编码、企业知识工作与网络防御,首批开放给 Fairwind 计划的政府用户与可信网络安全人员,后续再向开发者、企业和消费者开放。
推荐理由:汇总了 Gemini 4 Argon 的基准、定价与可用范围,并列出同期多家模型与工具的动态,便于横向比较。
ARC Prize 公布 OpenAI 的 GPT-6.1 Sol 在 ARC-AGI 上的验证成绩:ARC-AGI-3 在标准 harness 下为 52.7%。
推荐理由:ARC Prize 给出 GPT-6.1 Sol 在三代 ARC-AGI 上的成绩与单任务成本,可对比其与 GPT-6 Astra 的性价比差异。
ARC Prize 称 GPT-6.1 Sol 在 ARC-AGI-3 上提高推理档位后决策更优,完成关卡所需动作更少,从而降低了总推理成本。在 sk48 上,使用 provider adapter(保留跨轮不透明推理状态并支持自动压缩)时,max reasoning 的 GPT-6.1 Sol 以 463 个动作完成游戏,而 low reasoning 用了 1,078 个。
Google DeepMind 介绍 Argon,其输出上限为 1M token,并加入更深层的推理能力,用于一次性处理长链条、多步骤问题。官方表示将参考早期测试者的反馈完善系统,之后再面向开发者、企业和消费者更广泛地推出。更多信息见 goo.gle/4rZBiSd。
Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御者开放,随后将逐步面向开发者、企业和消费者推出,起步价为每百万输入 token 2 美元、每百万输出 token 10 美元。
推荐理由:Gemini 4 Argon 的 1M 输出 token 与多项基准成绩,展示了长程复杂任务上的能力边界变化。
Astra 在 ARC-AGI-3 上得分 99.9%,ARC Prize 为此构建了一个交互式页面,让用户亲自试玩模型受测的游戏,并阅读 Astra 自己运行过程留下的笔记。有评论质疑该成绩并未体现理解能力,认为关键在于弄清这些游戏的机制,而 Astra 的笔记中看不到它如何预判新关卡会发生什么。
ARC Prize 公布数据称,达到 ARC-AGI-1 75% 分数的成本在 19 个月内下降 99.95%,从 o3-preview 的 $26/task 降至 DeepSeek V4 Flash 的 $0.01/task。
ARC Prize 公布智谱 GLM 5.3 Flash 在 ARC-AGI 上的 Verified 结果:ARC-AGI-2 得分 65.8%,每任务成本 0.09 美元;ARC-AGI-1 得分 91.0%,每任务成本 0.04 美元。ARC Prize 称该模型在两个基准上表现强劲,且每任务成本均低于 0.10 美元,并提供了排行榜、复现仓库、测试政策与完整结果链接。
ARC Prize 公布智谱 GLM 5.3 Flash 在 ARC-AGI 上的验证成绩:ARC-AGI-2 为 65.8%,每任务 $0.09;ARC-AGI-1 为 91.0%,每任务 $0.04。该模型在两个基准上的单任务成本均低于 $0.10。
ARC Prize 对 GLM 5.3 Flash 在 ARC-AGI-1 与 ARC-AGI-2 公开任务上做了测试。该模型曾以 Ox Alpha 之名在 OpenRouter 上隐身提供,后经 Baseten 测试官方版 GLM 5.3 Flash,两项基准分数平均上升 15 个百分点。
Tufa Labs 在 ARC Prize 2026 的 ARC-AGI-3 上将高分从 27.29% 提升至 45.33%,重新夺回第一。这一成绩使其明显领先第二名。
ARC Prize 公布 OpenAI GPT-6 Sol 在 ARC-AGI 系列基准上的成绩:ARC-AGI-3 为 4.6%($5.6K,标准 harness)和 23.0%($8.7K,provider adapter harness),ARC-AGI-2 为 89.6%($0.44/task),ARC-AGI-1 为 95.5%($0.14/task)。
ARC Prize 公布测试结果,在 ARC-AGI-1 的 xhigh 推理档位下,GPT-6 Sol 得分 92.7%,GPT-5.6 Sol 为 97.5%。在匹配的推理档位上,GPT-6 Sol 每个任务的成本比 GPT-5.6 Sol 低 73%。完整结果见 arcprize.org/results/openai-gpt-6-sol。
ARC Prize 公布 OpenAI 的 GPT-6 Sol 在 ARC-AGI 系列基准上的成绩:ARC-AGI-3 在标准 harness 下为 4.6%。
Liquid AI 为视觉语言模型 LFM2.5-VL-3B 发布实验性 DSpark 草稿模型,解码速度在设备端最高提升 3.13x、H100 上最高 2.66x,端到端最高提升 2.62x 和 2.27x。该草稿模型约 280M 参数,仅增加 8.9% 参数量,首日支持 llama.cpp、MLX-VLM 和 SGLang,输出质量不变。
面壁智能 OpenBMB 分享 SGLang Omni 中关于批大小的讨论,聚焦性能验证与调度权衡。此前在《Revisiting CPU Resources as a First-Class Citizen in Speech Model Serving》一文中已指出,同一 commit 的吞吐量会因宿主机资源争用而出现显著变化。
Nunchux AI 及合作者推出 VC-Attention,为 MiniMax-H3 带来免训练低比特注意力加速,在 B200 上较 FlashAttention-4 提速 1.6 倍、B300 上提速 1.5 倍,保真度优于 SageAttention2。
商汤发布 SenseNova U1.5 技术报告,推出开源 8B-MoT 原生统一模型,通过共享注意力连接理解与生成。模型采用 Pixel Shuffle 加 3×3 空间卷积实现原生 4K 生成,并用多专家在线策略蒸馏整合美学、OCR、信息图与编辑能力。
推荐理由:技术报告与训练配方同步开源,读者可据此了解统一多模态模型如何打通理解与生成。
Google Research 提出 Retrieve-for-Train 框架,通过离线强化学习发现奖励对齐的查询扇出并编译为监督信号,再蒸馏进一个 53.9M 参数的扩散检索器,实现推理时单次非自回归的查询扇出。
World Labs 的新 Atlas 模型经过大幅推理优化后实现实时运行,生成和漫游世界在交互状态下更具临场感。其推理在 B200 和 MI355X 上运行,两者性能相近。