ARC Prize 公布 ARC-AGI-3 新的高分纪录为 45.33%,此前纪录为 27.29%,由 @tufalabs 创造并重新夺回第一名。
#推理
#推理
arcprize@arcprizeAI 评分 OpenBMB@OpenBMBAI 评分 Thom_Wolf@Thom_WolfAI 评分 dongxi_nlp@dongxi_nlpAI 评分 arcprize@arcprizeAI 评分 arcprize@arcprizeAI 评分 ClaudeDevs@ClaudeDevsAI 评分
dongxi_nlp@dongxi_nlpAI 评分 我觉得 Opus 5.5 不抽大麻,做不出这种东西。 看完你就懂 PPO, GRPO, DPO! Better than expected.
haoailab@haoailabAI 评分 MiniMax_AI@MiniMax_AIAI 评分
latentspacepod@latentspacepodAI 评分 trq212@trq212AI 评分 effort 到底是什么?什么时候该改它,为什么不干脆所有都用 max effort? 我深入研究了这个问题,查看了 evals 并做了自己的测试,结果让我相当惊讶。
AnthropicAI@AnthropicAI精选AI 评分 推荐理由:原文给出了具体挑战、计算成本与独立验证,读者可据此评估 AI 在理论物理研究中的实际可用性。
Latent SpaceAI 评分Runway 的 WorldPrompt 与实时世界模型工程
Runway 本月早些时候推出 GWM Worlds 2 研究预览,把高保真视频与音频生成变成实时交互式模拟,并新增 WorldPrompt 输入格式,可固定环境部分要素(含首帧)并生成带时间戳的事件。
Hugging Face BlogAI 评分
Liquid AI 发布 LFM2.5-VL-DSpark 草稿模型,加速视觉语言模型推理
Liquid AI 为视觉语言模型 LFM2.5-VL-3B 发布实验性 DSpark 草稿模型,解码速度在设备端最高提升 3.13x、H100 上最高 2.66x,端到端最高提升 2.62x 和 2.27x。该草稿模型约 280M 参数,仅增加 8.9% 参数量,首日支持 llama.cpp、MLX-VLM 和 SGLang,输出质量不变。
TencentHunyuan@TencentHunyuanAI 评分
Latent SpaceAI 评分Radical Numerics CEO Eric Nguyen 谈生物安全:一场 AI 军备竞赛
Radical Numerics 联合创始人兼 CEO Eric Nguyen 在访谈中提出,能提升生物能力的基因组语言模型(GLM)同样可用于防御,并称当前防御方在这场军备竞赛中处于落后。
Simon Willison精选AI 评分 Claude Opus 5.5、GPT-6 Sol 与 GPT-6 Luna 发布,新一轮价格战开启
Anthropic 发布 Claude Opus 5.5,约一小时后 OpenAI 发布 GPT-6 Sol 和 GPT-6 Luna,作者认为这开启了新一轮价格战。
推荐理由:作者用自测和价格表对比了同日发布的多款新模型,可据此了解当前模型定价与推理档位的实际表现。
bcherny@bchernyAI 评分 bcherny 用 Opus 5.5 借助 Lean 对 Claude Agent SDK 做形式化验证,几条简短提示词换来 16 个修复各类 bug 和竞态条件的 PR。
OpenAI NewsAI 评分 OpenAI 为 GPT-6 改进提示词缓存
OpenAI 为 GPT-6 改进提示词缓存,带来更高的缓存命中率、新的诊断能力、显式断点以及可降低延迟和成本的控制项。原文未给出具体命中率数字或价格变化。
TencentHunyuan@TencentHunyuanAI 评分 Simon WillisonAI 评分 TypeSafe AI 发布 Jev:只输出浮点决策的 System One 模型
TypeSafe AI 发布 Jev,这是其称为 System One 的新类别模型,输入文本后不输出文本,而是返回类别、是/否判断、评分及对应置信度的浮点数。
Latent SpaceAI 评分TypeSafe CEO Diogo Almeida 谈 Jev:为生产环境打造 System One 模型
TypeSafe AI CEO Diogo Almeida 在 Latent Space 播客中介绍新模型 Jev,称其为面向代码消费的 System One 大模型,按每美元智能优化,发布视频播放量约 4000 万次。
SpaceXAI@SpaceXAIAI 评分
GenAI_is_real@GenAI_is_realAI 评分
xiangyuli@xiangyuliAI 评分 AnthropicAI@AnthropicAIAI 评分
X:商汤 SenseTime (@SenseTime_AI)精选AI 评分 商汤发布 SenseNova U1.5 技术报告:开源 8B-MoT 原生统一模型
商汤发布 SenseNova U1.5 技术报告,推出开源 8B-MoT 原生统一模型,通过共享注意力连接理解与生成。模型采用 Pixel Shuffle 加 3×3 空间卷积实现原生 4K 生成,并用多专家在线策略蒸馏整合美学、OCR、信息图与编辑能力。
推荐理由:技术报告与训练配方同步开源,读者可据此了解统一多模态模型如何打通理解与生成。
ancadianadragan@ancadianadraganAI 评分
NVIDIA Blog精选AI 评分
NVIDIA Vera Rubin NVL72 首次亮相 MLPerf Inference v6.1,吞吐最高达 GB300 NVL72 的 3.7 倍
NVIDIA 在 MLPerf Inference v6.1 中首次提交 Vera Rubin NVL72 预览结果,在 Qwen3-VL 上吞吐最高达 GB300 NVL72 的 3.7 倍,在 DeepSeek-R1 上最高达 2.5 倍。
推荐理由:MLPerf Inference v6.1 首次提交数据给出了 Vera Rubin NVL72 相对 GB300 NVL72 的吞吐提升与 99% 扩展效率,可作为推理基础设施选型的参考。
Google ResearchAI 评分Google Research 提出 Retrieve-for-Train:用 RL 编译扩散模型绕过推理瓶颈,加速复杂 AI 搜索
Google Research 提出 Retrieve-for-Train 框架,通过离线强化学习发现奖励对齐的查询扇出并编译为监督信号,再蒸馏进一个 53.9M 参数的扩散检索器,实现推理时单次非自回归的查询扇出。
GoogleDeepMind@GoogleDeepMindAI 评分
OpenAI News精选AI 评分 OpenAI 发布 GPT-6 Astra,面向企业场景的最强模型
OpenAI 发布 GPT-6 Astra,称其为面向企业场景能力最强的模型,具备高级推理、computer use 以及更强的写作与设计判断力。
推荐理由:官方给出 GPT-6 Astra 的定位与三项能力方向,可据此了解 OpenAI 面向企业场景的模型迭代重点。
jcjohnss@jcjohnssAI 评分 我们的新 Atlas 模型经过一番高强度的推理优化后,现在可以实时运行了!当世界生成与导航是交互式的,体验要生动得多。 推理在 B200 和 MI355X 上运行,性能相近。两款设备都是出色的主力!
polynoamial@polynoamialAI 评分 转推 @deanwball:“为解决 Navier-Stokes 问题,我们使用了一个内部模型,其能力显著强于 GPT-6 Astra。” https:/…
wjmzbmr1@wjmzbmr1AI 评分 MostafaRohani@MostafaRohaniAI 评分 weijie444@weijie444AI 评分 去年7月,当大语言模型在IMO上夺得金牌时,我觉得AI或许有一天能解决数学中最难的一些问题。现在,一个OpenAI内部模型(仍在改进!)已经解决了一个千禧年难题。这一天来得如此之快,感觉很不真实!
OpenAI@OpenAIAI 评分