自适应奖励路由 通过前向过程 RL 实现联合音视频扩散的动态多奖励优化 论文:huggingface.co/papers/2609.3…
#推理
#推理
_akhaliq@_akhaliqAI 评分 SpaceXAI@SpaceXAIAI 评分 X:Elvis Saravia (@omarsar0, DAIR.AI)AI 评分 Google Research 发布多智能体证明发现论文,Cogentic 在五个开放问题上取得新结果
Google Research 发布多智能体证明发现论文,其系统 Cogentic 基于 Gemini,从问题陈述出发、无需专家提示,在理论计算机科学的五个开放问题上取得新结果,涉及在线学习、拍卖理论和机制设计,每个结果均由领域专家核验。
OpenAI NewsAI 评分 GPT-6 系列模型选型指南
OpenAI 发布 GPT-6 系列模型指南,面向初创公司讲解如何选择 GPT-6 模型、调节推理强度、优化提示词与技能、协调工具调用,并为生产环境准备工作流。
scottgeng00@scottgeng00AI 评分 dair_ai@dair_aiAI 评分 DAIR.AI 介绍 NVIDIA 关于长程智能体的论文:模型即使接受 128K tokens 上下文,任务执行越久越容易出错。
novita_labs@novita_labsAI 评分 MIT Technology Review · AIAI 评分
别被迷惑——LLM 并不会推理
前 Google DeepMind 研究员指出,LLM 靠逐个预测 token 生成答案,其思维链仍由同一套下一 token 预测产生,并非 AlphaGo 那种独立搜索机制,因此不构成真正的推理。他列举三大缺陷:模型没有显式可检查的认知状态、知识与推理在权重中纠缠不清、思维链常是事后编造。为此他离开 Google DeepMind,主张借鉴 AlphaGo 架构,让系统维护可更新的认知状态。
Latent SpaceAI 评分MIT 的 Alex Zhang 谈 RLM、GPU Kernel 与智能体集群研究
MIT 的 Alex Zhang 在 Latent Space 播客中介绍了其递归语言模型(RLM)研究,基于 RLM 的 harness 是首个接近解决 ARC-AGI-3 的方案,早于 OpenAI 的 Astra。
NVIDIA Blog精选AI 评分
NVIDIA GPU 加速 OpenAI GPT-6 Astra Ultrafast 上线
OpenAI 的 GPT-6 Astra Ultrafast 已在 NVIDIA Blackwell GPU 上运行,并面向 OpenAI API 以及符合条件的 ChatGPT Work 和 Codex 用户开放。
推荐理由:OpenAI 在 NVIDIA Blackwell 上推出 Astra Ultrafast 模式,读者可了解其相对标准模式的提速幅度与开放入口。
arcprize@arcprizeAI 评分 arcprize@arcprizeAI 评分 AnthropicAI@AnthropicAIAI 评分
Ars Technica · AIAI 评分CMU 等团队用 16 块 GPU 训练的 Ataraxos 以 15 比 1 击败最强 Stratego 人类选手
卡内基梅隆、MIT、纽约大学和斯坦福的研究团队开发的 AI 系统 Ataraxos 以 15 胜 1 负 4 平击败被认为是史上最强的 Stratego 选手 Pim Niemeijer,训练仅用 16 块 GPU、花费几千美元。
Latent Space精选AI 评分Google DeepMind 发布 Gemini 4 Argon,支持 1M token 输出
Google DeepMind 推出 Gemini 4 Argon,面向编码、企业知识工作与网络防御,首批开放给 Fairwind 计划的政府用户与可信网络安全人员,后续再向开发者、企业和消费者开放。
推荐理由:汇总了 Gemini 4 Argon 的基准、定价与可用范围,并列出同期多家模型与工具的动态,便于横向比较。
latentspacepod@latentspacepodAI 评分 latent.space 撰文介绍 OpenAI 的新智能体技术栈:@AriX 和 @nikunjhanda 讲解 Computer Use 在真实任务上已快于人类。
ornith_@ornith_AI 评分 thoughtfullab@thoughtfullabAI 评分 ArtificialAnlys@ArtificialAnlys精选AI 评分 推荐理由:原文给出智能指数、成本和幻觉率的横向对比,读者可据此判断新模型相对竞品的性价比位置。
arcprize@arcprizeAI 评分 arcprize@arcprizeAI 评分 ARC Prize 指出 GPT-6.1 Sol 与 GPT-6 Astra 类似,在 ARC-AGI-3 上推理等级越高决策越好,完成关卡所需动作越少,从而降低总推理成本。
GoogleAI@GoogleAI精选AI 评分 推荐理由:原文说明了该模型面向的三类复杂工作流场景和输出上限,读者可据此判断它对长任务工作流的适配程度。
GoogleDeepMind@GoogleDeepMindAI 评分 sundarpichai@sundarpichaiAI 评分
Google DeepMind精选AI 评分Google DeepMind 发布 Gemini 4 Argon 前沿模型
Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御者开放,随后将逐步面向开发者、企业和消费者推出,起步价为每百万输入 token 2 美元、每百万输出 token 10 美元。
推荐理由:Gemini 4 Argon 的 1M 输出 token 与多项基准成绩,展示了长程复杂任务上的能力边界变化。
Davidstout@DavidstoutAI 评分 MTSlive@MTSliveAI 评分 AntLingAGI@AntLingAGI精选AI 评分 推荐理由:原文给出了参数规模、上下文长度和三项评测分数,读者可据此判断其定位与开源计划。
TencentHunyuan@TencentHunyuanAI 评分 natolambert@natolambertAI 评分 当前的框架在LLM管理自身上下文方面设置非常僵化。我们证明可以让LLM直接编辑上下文——从而实现更好的长期记忆、FLOP高效的适应等。 不要再害怕上下文压缩了!
OpenBMB@OpenBMBAI 评分 面壁智能 OpenBMB 等团队提出 Diffusion Reward Models(DRM),不再把人类偏好压缩成单一分数,而是学习完整奖励分布,保留分歧、不确定性与多种合理判断。
Replit@ReplitAI 评分 SemiAnalysis_@SemiAnalysis_AI 评分 gen_obligation@gen_obligationAI 评分 在 max 模式下结果更令人印象深刻!6.1 sol 的表现超过了 Opus 5.5,同时使用的 token 少了 4 倍。
arcprize@arcprizeAI 评分 sherwinwu@sherwinwuAI 评分 arcprize@arcprizeAI 评分 arcprize@arcprizeAI 评分 arcprize@arcprizeAI 评分 HuggingPapers@HuggingPapersAI 评分 后训练会在无关决策上留下行为痕迹 仅用 5,664 个单词的教师答案,学生模型在 HumanEval+ 上提升 +5.34pp——却从未见过代码。