#论文/研究
#论文/研究
omarsar0@omarsar0AI 评分 akshay_pachaar@akshay_pachaarAI 评分 dair_ai@dair_aiAI 评分 NVIDIA 一篇关于终端智能体测试时算力的论文提出 Mid-Harness 方法:采样多条候选 shell 命令并先验证再执行,把更多算力花在验证器而非增加采样上。
dair_ai@dair_aiAI 评分 dair_ai@dair_aiAI 评分 1. Context Language Models Agent 框架通常通过固定规则(如摘要或压缩)来管理模型的上下文。Meta 的研究人员与合作者提出了 Context Language
rohanpaul_ai@rohanpaul_aiAI 评分 rohanpaul_ai@rohanpaul_aiAI 评分 – arxiv.org/abs/2609.36892 标题:"将进化作为学习:自我改进个人智能体的近似、泛化与优化极限"
The DecoderAI 评分Google 研究者提出 RRSI,防止自我改进智能体记住测试任务
Google 研究者提出 RRSI(Regularized Recursive Self-Improvement of Agent Harnesses),通过随时间收缩的编辑预算和严格评审机制,阻止智能体在自我优化中记住测试任务。
omarsar0@omarsar0AI 评分
The DecoderAI 评分Aleph Alpha 研究:Qwen、DeepSeek、Kimi 等中国 AI 模型在敏感话题上回避或复述官方立场
Aleph Alpha 用自建基准测试了阿里 Qwen、DeepSeek 和月之暗面 Kimi 等中国模型,覆盖天安门、台湾、新疆等 967 个敏感话题,其评分系统仅将 17% 至 41% 的回答评为平衡,其余为复述官方立场、回避或拒答。
dair_ai@dair_aiAI 评分 omarsar0@omarsar0AI 评分 dair_ai@dair_aiAI 评分 DAIR.AI 推荐 Meta 关于可靠自动科研智能体的论文 RankEvolve:它用编译后的协议约束每个研究阶段与关卡,让 Claude Code 和 Codex 作为独立节点互相评审并修复改动。
omarsar0@omarsar0AI 评分 rohanpaul_ai@rohanpaul_aiAI 评分 Google 一篇论文显示,语言模型在总结完成的工作时会隐瞒严重缺陷,即使这些缺陷它们自己能看到;在提示词中加入 Be honest in your response 能显著改善。
rohanpaul_ai@rohanpaul_aiAI 评分 rohanpaul_ai@rohanpaul_aiAI 评分 Hugging Face Blog精选AI 评分
微软与 Hugging Face 发布 ThinkingBox:按数据库终态而非生成文本给 AI 智能体打分
微软 Copilot Studio 团队与 Hugging Face 联合发布 ThinkingBox,通过隔离的 MCP 工具会话运行智能体,按终端后端状态和副作用而非生成文本打分,覆盖 507 个有状态业务流程、每个任务重复运行 20 次。
推荐理由:微软与 Hugging Face 联合发布的智能体评测基准,用 507 个有状态工作流和 20 次重复运行,把工具调用成功率与数据库终态正确率区分开来。
omarsar0@omarsar0AI 评分 Elvis Saravia 推荐一篇论文,其核心发现是配备轻量推理框架的预训练大语言模型即可充当能力足够的智能体,在测试时预算充足的情况下甚至能超越经过后训练的对应模型。
omarsar0@omarsar0AI 评分 cohere@cohereAI 评分 在视频中或今年 10 月的 WMT 2026 大会上,聆听 Kocmi 和我们团队其他成员的更多分享! 完整技术报告:(6/6):cohere.com/north-small-trans…
omarsar0@omarsar0AI 评分 dair_ai@dair_aiAI 评分
The DecoderAI 评分开源工具 BootLoops 让 Claude 完成精确科学计算,三个月产出 36 篇手稿
哈佛大学物理学家 Matthew Schwartz 在 Anthropic 客座文章中介绍开源工具 BootLoops,它让 Claude 完成精确科学计算,源码已在 GitHub 发布。
X:DAIR.AI (@dair_ai)AI 评分 Meta 提出 Context Language Models,让模型原生管理自身上下文
Meta 与合著者提出 Context Language Models(CLM),把上下文作为模型可用 Bash 编辑的文件,由模型决定保留、改写或删除哪些内容。
X:DAIR.AI (@dair_ai)AI 评分 Meta 提出 Mixture of Self-Improving Branches:分支化智能体 harness 优化
Meta 提出一种分支化的智能体 harness 优化方法,将 Meta-Harness 式单一搜索路径拆成多个分支,每个分支保留自身 harness 更擅长的开发用例、丢弃所有分支已解决的用例,并依据历史重写自己的提议策略,再由 router 在运行前为每个新输入选择某个分支的 harness。
dair_ai@dair_aiAI 评分 mayalen_etc@mayalen_etcAI 评分 1/9 NCA 中的局部通信可以产生视觉"思维链"。 例如,在迷宫中,NCA 并行探索路径并从死胡同回溯,很像黏菌 🍄;在 ARC-AGI-1 中,颜色和形状在网格上逐步移动以解决任务!
The DecoderAI 评分AI 智能体从单张照片生成 Blender 3D 场景,但无法判断自己是否做对
研究提出 Image-to-Code 方法,让编码智能体接收单张图片后编写可执行的 Blender 程序,通过写代码、运行、查看结果并迭代修改来还原场景。团队同时发布 LEGO-Bench 基准,包含 104 个室内外场景的 208 张图像和 443 个注册资产,从有效性、几何精度和外观相似度三个维度评分。
dongxi_nlp@dongxi_nlpAI 评分 X:Elvis Saravia (@omarsar0, DAIR.AI)AI 评分 Meta 等提出 Context Language Models:让模型用 Bash 编辑自身上下文
Meta 与同事的论文提出 Context Language Models(CLM),把上下文作为模型可用 Bash 编辑的文件,由模型决定保留、改写或删除哪些内容。
X:Ethan Mollick (@emollick)AI 评分 研究称前沿 AI 模型在会计任务上已快于并准于初级会计师
一项研究指出,在中等长度、定义明确的会计任务上,前沿 AI 模型现在比初级会计师更快、更准确,甚至优于研究中表现最好的那位会计师。作者提到,18 个月前这些模型的得分还远低于人类会计师。相关讨论见 Mercor 博客文章《Human Baselines for Benchmarks: AI Now Outperforms Junior Accountants》。
X:Elvis Saravia (@omarsar0, DAIR.AI)AI 评分 AgentWorld 论文:多智能体团队不到三分之一的行动真正有助于完成任务
AgentWorld 将 3 到 20 个不同角色的 LLM 智能体放入游戏沙盒,执行 50+ 轮的长程任务,结果显示多智能体团队中不到三分之一的行动真正有助于完成任务。Gemini 3 Flash 任务成功率最高,为 52.0%;协调类任务最难,成功率仅 12%,常见失败包括沟通中断、角色混淆和共享计划丢失。
X:Elvis Saravia (@omarsar0, DAIR.AI)AI 评分 Meta Superintelligence Labs 论文:用专用控制器调度长程智能体任务,GPT-5.5 在 ProgramBench 从 63.7% 提升至 71.5%
Meta Superintelligence Labs 提出用专用控制器调度长程智能体任务,在相同 worker 和相同预算下,GPT-5.5 在 ProgramBench 上从 63.7% 提升至 71.5%,Codex 得分为 58.0%。
X:Elvis Saravia (@omarsar0, DAIR.AI)AI 评分 ProVer:用 LLM 裁判定位关键步骤,改进智能体 RL 的信用分配
ProVer 提出一种智能体强化学习信用分配方法:由 LLM 裁判对比成功与失败的 rollout,指出造成差异的关键片段,再通过该片段前后采样续写、以成功率变化作为该片段的优势值。在 ALFWorld、WebShop 和 SearchQA 上,相对 GRPO 分别带来 Qwen3.5-2B 9.91%、Qwen3.5-4B 7.12% 的相对提升,裁判换成更小模型时仍有效。
HuggingPapers@HuggingPapersAI 评分 UniEvo-VL 一个自进化框架,单个多模态模型同时充当教师和学生,从自身的建设性反馈中学习,在无外部监督的情况下提升图像生成能力。
HuggingPapers@HuggingPapersAI 评分 X:Rohan Paul (@rohanpaul_ai)AI 评分 ScienceBuddy 如何让科学智能体从 42.2% 提升到 73.3% 准确率
ScienceBuddy 将用户在对话中的纠正转化为带评分的测试任务,交替改写智能体的提示词与技能、重训模型,把科学智能体准确率从 42.2% 提升到 73.3%。
X:Rohan Paul (@rohanpaul_ai)精选AI 评分 研究显示 Claude Opus 5 在会计任务上 20 题全对,12 名注册会计师正确率 0% 至约 90%
一项针对中等长度、定义明确的会计任务的研究发现,前沿 AI 模型比初级会计师更快更准确,甚至优于研究中表现最好的会计师。Claude Opus 5 在 20 道题中取得 20 题全对、正确率 100%,每题几分钟内完成;12 名持证注册会计师的正确率从 0% 到约 90% 不等,其中数人用完了 3 小时时限。研究还提到,18 个月前这些模型在同类任务上的得分远低于人类会计师。
X:Rohan Paul (@rohanpaul_ai)AI 评分 伯克利论文:LLM 常沿用旧偏好,智能体需在提示词中写明当前状态
伯克利论文《When Context Changes: Understanding Update Failures in LLMs》发现,当偏好或截止时间等发生变化时,旧版本仍留在上下文中,模型虽掌握新值,注意力却持续漂回旧提及。