#推理
#推理
maithra_raghu@maithra_raghuAI 评分 dair_ai@dair_aiAI 评分 omarsar0@omarsar0AI 评分 作者引述一篇论文指出,在整仓库迁移任务中,同一 GPT-5.6 Sol 模型与相同 effort 设置下,把 Codex 换成 HERMES harness 后成功率从 6.5% 升至 31.0%。
dongxi_nlp@dongxi_nlpAI 评分 推荐阅读! ExploreNet: Learning Where to Explore in Diffusion GRPO
rohanpaul_ai@rohanpaul_aiAI 评分 rohanpaul_ai@rohanpaul_aiAI 评分 0xdoug@0xdougAI 评分 dongxi_nlp@dongxi_nlpAI 评分 dongxi_nlp@dongxi_nlpAI 评分
rohanpaul_ai@rohanpaul_aiAI 评分 rohanpaul_ai@rohanpaul_aiAI 评分 – arxiv.org/abs/2609.36054 Title: "What if automating AI R&D triggers an intelligence explosion?"
_akhaliq@_akhaliqAI 评分 ALoDLM Adaptively Looped Diffusion Language Models paper: huggingface.co/papers/2610.0…
dair_ai@dair_aiAI 评分 dair_ai@dair_aiAI 评分 DAIR.AI 介绍一篇提出 PAIR 的论文,该方法从同一状态重放智能体、分别在有无压缩下对比,以定位上下文压缩对长程智能体的损害。
rohanpaul_ai@rohanpaul_aiAI 评分 rohanpaul_ai@rohanpaul_aiAI 评分 dongxi_nlp@dongxi_nlpAI 评分 dair_ai@dair_aiAI 评分
HuggingPapers@HuggingPapersAI 评分 omarsar0@omarsar0AI 评分 _akhaliq@_akhaliqAI 评分 dair_ai@dair_aiAI 评分 omarsar0@omarsar0AI 评分 dair_ai@dair_aiAI 评分 NVIDIA 一篇关于终端智能体测试时算力的论文提出 Mid-Harness 方法:采样多条候选 shell 命令并先验证再执行,把更多算力花在验证器而非增加采样上。
dair_ai@dair_aiAI 评分
omarsar0@omarsar0AI 评分 dair_ai@dair_aiAI 评分
mayalen_etc@mayalen_etcAI 评分 1/9 NCA 中的局部通信可以产生视觉"思维链"。 例如,在迷宫中,NCA 并行探索路径并从死胡同回溯,很像黏菌 🍄;在 ARC-AGI-1 中,颜色和形状在网格上逐步移动以解决任务!
X:Elvis Saravia (@omarsar0, DAIR.AI)AI 评分 Meta Superintelligence Labs 论文:用专用控制器调度长程智能体任务,GPT-5.5 在 ProgramBench 从 63.7% 提升至 71.5%
Meta Superintelligence Labs 提出用专用控制器调度长程智能体任务,在相同 worker 和相同预算下,GPT-5.5 在 ProgramBench 上从 63.7% 提升至 71.5%,Codex 得分为 58.0%。
X:Elvis Saravia (@omarsar0, DAIR.AI)AI 评分 ProVer:用 LLM 裁判定位关键步骤,改进智能体 RL 的信用分配
ProVer 提出一种智能体强化学习信用分配方法:由 LLM 裁判对比成功与失败的 rollout,指出造成差异的关键片段,再通过该片段前后采样续写、以成功率变化作为该片段的优势值。在 ALFWorld、WebShop 和 SearchQA 上,相对 GRPO 分别带来 Qwen3.5-2B 9.91%、Qwen3.5-4B 7.12% 的相对提升,裁判换成更小模型时仍有效。
HuggingPapers@HuggingPapersAI 评分 X:Rohan Paul (@rohanpaul_ai)AI 评分 伯克利论文:LLM 常沿用旧偏好,智能体需在提示词中写明当前状态
伯克利论文《When Context Changes: Understanding Update Failures in LLMs》发现,当偏好或截止时间等发生变化时,旧版本仍留在上下文中,模型虽掌握新值,注意力却持续漂回旧提及。
AIatMeta@AIatMetaAI 评分 _akhaliq@_akhaliqAI 评分 自适应奖励路由 通过前向过程 RL 实现联合音视频扩散的动态多奖励优化 论文:huggingface.co/papers/2609.3…
X:Elvis Saravia (@omarsar0, DAIR.AI)AI 评分 Google Research 发布多智能体证明发现论文,Cogentic 在五个开放问题上取得新结果
Google Research 发布多智能体证明发现论文,其系统 Cogentic 基于 Gemini,从问题陈述出发、无需专家提示,在理论计算机科学的五个开放问题上取得新结果,涉及在线学习、拍卖理论和机制设计,每个结果均由领域专家核验。
scottgeng00@scottgeng00AI 评分 dair_ai@dair_aiAI 评分 DAIR.AI 介绍 NVIDIA 关于长程智能体的论文:模型即使接受 128K tokens 上下文,任务执行越久越容易出错。
Ars Technica · AIAI 评分CMU 等团队用 16 块 GPU 训练的 Ataraxos 以 15 比 1 击败最强 Stratego 人类选手
卡内基梅隆、MIT、纽约大学和斯坦福的研究团队开发的 AI 系统 Ataraxos 以 15 胜 1 负 4 平击败被认为是史上最强的 Stratego 选手 Pim Niemeijer,训练仅用 16 块 GPU、花费几千美元。
TencentHunyuan@TencentHunyuanAI 评分 natolambert@natolambertAI 评分 当前的框架在LLM管理自身上下文方面设置非常僵化。我们证明可以让LLM直接编辑上下文——从而实现更好的长期记忆、FLOP高效的适应等。 不要再害怕上下文压缩了!