ARC Prize 公布 ARC-AGI-3 高分榜新成绩:Yi-Chia Chen 取得 59.17%,超过 @tufalabs 取得领先。
#评测/基准
#评测/基准
arcprize@arcprizeAI 评分 arcprize@arcprizeAI 评分 ARC Prize 2026 的 ARC-AGI-2 最高分由 @tufalabs 达到 88.06%。$150K 奖金将在保证奖金之外,分给所有得分超过 85% 的队伍。
arena@arenaAI 评分 Arena 本周榜单显示,Nano Banana 2.1 在 Image Arena 三个模式均进前 6:Multi-Image Edit 第 4(1431 分)。
TechCrunch@TechCrunchAI 评分 LMArena 排行榜背后的公司获得由 Lightspeed 和 Khosla 领投的 2 亿美元融资,并开始在对齐问题上评测 AI 模型,例如模型是否会说谎。
ArtificialAnlys@ArtificialAnlysAI 评分
TechCrunch · AIAI 评分AI 榜单 Arena 完成 2 亿美元 B 轮融资,估值 10 个月内接近翻倍至 31 亿美元
AI 模型众包榜单 Arena 宣布完成 2 亿美元 B 轮融资,估值达 31 亿美元,由 Lightspeed Venture Partners 和 Khosla Ventures 领投,Salesforce Ventures、a16z 等参投。
ml_angelopoulos@ml_angelopoulos精选AI 评分 推荐理由:原文把融资与真实用户交互中的对齐问题观察结合,读者可了解评测平台如何从偏好榜单转向对齐评估。
istoica05@istoica05AI 评分 infwinston@infwinstonAI 评分
arcprize@arcprizeAI 评分
FlemingCentre@FlemingCentreAI 评分
Latent SpaceAI 评分AINews:GPT-6.1 Sol 与 Sonnet 5.5 重塑性价比前沿
OpenAI 发布 GPT-6.1 Sol,定价 $2/$10 per million input/output tokens,比 GPT-6 Sol 便宜 39% 且 Agent Arena 得分高 1.52 分,比 Astra 便宜 81%。
arcprize@arcprizeAI 评分 Lord Han Solo kaggle.com/lordhansolo Notebook: kaggle.com/code/lordhansolo/…
Latent SpaceAI 评分Latent Space 宣布 AINews v3 与 Discord 合并等改版计划
Latent Space 公布未来一周的改版计划:AINews 将升级至 v3,并与 Latent Space Discord 合并,以解决 Discord 垃圾推广信息增多的问题。团队还计划迁移至 Beehiiv 并启用新主页,同时重新开放赞助与 PR 合作,并已新设 Business/Ops Manager 和 Head of Editorial。
Hugging Face BlogAI 评分
英国 AISI 如何用 EvalEval 基础设施让评测结果可复现
英国 AI Security Institute(AISI)正通过 EvalEval 的 Evaluation Cards 公开分享评测方法与结果,覆盖 HealthBench。
Google DeepMindAI 评分Google DeepMind 首次试点双重盲测 AI 评估,用密码学环境防止基准污染
Google DeepMind 推出全球首个针对专有前沿 AI 模型的双重盲测评估,将外部评测限制在密码学"黑箱"中,防止模型提前接触测试题造成基准污染。该试点与新加坡 AI Safety Institute、OpenMined、AVERI 和 MLCommons 合作,在隐私保护环境中用保密基准测试 Gemini Flash Lite 模型。
Import AIAI 评分Import AI 461:Sequent 称"对齐尚未走上正轨"、FrontierCode 与合成研究实习生
英国 AI Security Institute 对齐团队与 Timaeus 联合成立非营利研究机构 Sequent,认为"对齐尚未走上正轨",计划两年内扩至 40-80 名全职员工,初期募资 1 亿至 1.5 亿美元,研究方向涵盖可扩展监督、学习理论、启发式论证、博弈论与 personas。
OpenAI NewsAI 评分 太平洋西北国家实验室与 OpenAI 合作加速联邦许可审批
OpenAI 与太平洋西北国家实验室联合推出 DraftNEPABench,用于评估 AI 编程智能体加速联邦许可审批的能力,显示有望将 NEPA 起草时间最多缩短 15%。该基准旨在推动基础设施审查流程的现代化。