#数据/训练
#数据/训练
omarsar0@omarsar0AI 评分 rohanpaul_ai@rohanpaul_aiAI 评分 rohanpaul_ai@rohanpaul_aiAI 评分
omarsar0@omarsar0AI 评分 rohanpaul_ai@rohanpaul_aiAI 评分 rohanpaul_ai@rohanpaul_aiAI 评分 dair_ai@dair_aiAI 评分 Meta Superintelligence Labs 发表论文,提出在 Agent RL 训练中用专门的用户模拟器替代过于配合的 LLM 扮演用户。
rohanpaul_ai@rohanpaul_aiAI 评分 maithra_raghu@maithra_raghuAI 评分 rohanpaul_ai@rohanpaul_aiAI 评分 dair_ai@dair_aiAI 评分
1a1a11a@1a1a11aAI 评分
Google Research精选AI 评分Google Research 三个月专利撰写实验:AI 辅助提升产出但未必加速初级律师成长
Google Research 与 NBER 合作发表的三个月田野实验显示,在 133 名律师、11 家知识产权律所中随机开放 Google Labs AI 专利撰写工具(现属 Gemini Notebook)后,10 天和 90 天的起草评分分别提升 0.34 和 0.38 个标准差。
推荐理由:研究用三个月随机对照实验区分了AI辅助产出与无辅助判断,可帮助读者理解AI对不同资历从业者技能积累的差异影响。
The DecoderAI 评分JEPA-Anything 把 LeCun 的 JEPA 扩展为跨领域通用世界模型
研究团队(由 PhAI Labs 牵头,与 Stanford、Oxford、Princeton 合作)提出 JEPA-Anything,把 JEPA 的预测状态拆成四个正交因子、各由独立预测模块处理后再重组,以避免简单模式淹没困难模式。
rohanpaul_ai@rohanpaul_aiAI 评分 上海AI实验室新论文提出 SkillGym,把每个技能文件转成带代码检查器的沙箱任务,只用通过校验的运行数据微调模型,使模型在不加载技能文件的情况下也变得更强。
HuggingPapers@HuggingPapersAI 评分 akshay_pachaar@akshay_pachaarAI 评分
The DecoderAI 评分Google 研究者提出 RRSI,防止自我改进智能体记住测试任务
Google 研究者提出 RRSI(Regularized Recursive Self-Improvement of Agent Harnesses),通过随时间收缩的编辑预算和严格评审机制,阻止智能体在自我优化中记住测试任务。
dair_ai@dair_aiAI 评分 DAIR.AI 推荐 Meta 关于可靠自动科研智能体的论文 RankEvolve:它用编译后的协议约束每个研究阶段与关卡,让 Claude Code 和 Codex 作为独立节点互相评审并修复改动。
omarsar0@omarsar0AI 评分 dair_ai@dair_aiAI 评分
The DecoderAI 评分开源工具 BootLoops 让 Claude 完成精确科学计算,三个月产出 36 篇手稿
哈佛大学物理学家 Matthew Schwartz 在 Anthropic 客座文章中介绍开源工具 BootLoops,它让 Claude 完成精确科学计算,源码已在 GitHub 发布。
X:DAIR.AI (@dair_ai)AI 评分 Meta 提出 Context Language Models,让模型原生管理自身上下文
Meta 与合著者提出 Context Language Models(CLM),把上下文作为模型可用 Bash 编辑的文件,由模型决定保留、改写或删除哪些内容。
X:Elvis Saravia (@omarsar0, DAIR.AI)AI 评分 Meta 等提出 Context Language Models:让模型用 Bash 编辑自身上下文
Meta 与同事的论文提出 Context Language Models(CLM),把上下文作为模型可用 Bash 编辑的文件,由模型决定保留、改写或删除哪些内容。
X:Elvis Saravia (@omarsar0, DAIR.AI)AI 评分 ProVer:用 LLM 裁判定位关键步骤,改进智能体 RL 的信用分配
ProVer 提出一种智能体强化学习信用分配方法:由 LLM 裁判对比成功与失败的 rollout,指出造成差异的关键片段,再通过该片段前后采样续写、以成功率变化作为该片段的优势值。在 ALFWorld、WebShop 和 SearchQA 上,相对 GRPO 分别带来 Qwen3.5-2B 9.91%、Qwen3.5-4B 7.12% 的相对提升,裁判换成更小模型时仍有效。
HuggingPapers@HuggingPapersAI 评分 X:Rohan Paul (@rohanpaul_ai)AI 评分 ScienceBuddy 如何让科学智能体从 42.2% 提升到 73.3% 准确率
ScienceBuddy 将用户在对话中的纠正转化为带评分的测试任务,交替改写智能体的提示词与技能、重训模型,把科学智能体准确率从 42.2% 提升到 73.3%。
X:Rohan Paul (@rohanpaul_ai)AI 评分 NVIDIA 论文:长任务中模型准确率下降,建议给条目编号并分批处理
NVIDIA 新论文测试 7 个开源模型在加数字、排序列表等简单重复任务上的表现,128K token 任务的平均准确率比 4K token 任务低 62.8%,最好的模型在最长的任务中也只有 17.1% 全部答对。
X:Rohan Paul (@rohanpaul_ai)AI 评分 腾讯 SkillAdam:让 AI 自动改进智能体技能指令,准确率 28.3% 且 token 消耗降至约三分之一
腾讯论文提出 SkillAdam,让 AI 自动改进智能体技能指令时记录已修复的问题,并在效果不稳定时只做小幅修改。在长程购物与旅行规划任务上,它平均准确率达 28.3%,高于此前最佳方法 SkillOpt 的 21.7%,token 用量约为后者的三分之一。该方法针对自动改写指令常陷入反复、新改动推翻已有修复的问题。
Google Research精选AI 评分Google 发布基于 TEE 的新一代联邦学习系统,Gboard 已采用
Google 宣布推出基于可信执行环境(TEE)的新一代联邦学习系统,为数据匿名化提供可远程验证和审计的保证,Gboard 已采用该系统上线英语和日语下一词预测模型。
推荐理由:Google 公布基于 TEE 的新一代联邦学习系统设计,并给出 Gboard 已上线的落地情况,可了解隐私可验证训练的一种工程路径。
Hugging Face BlogAI 评分
ServiceNow CoreAI 的 AutoSynthData 如何为企业智能体生成训练数据
ServiceNow CoreAI 构建了 AutoSynthData,利用目标模型的失败与更强教师的成功来定位能力缺口,并生成、验证新的可执行训练任务,课程随模型进步向仍难的任务迁移。该方法以 EnterpriseOps Gym 数据集演示,任务由系统规范、用户提示词和验证器三部分组成,需满足可行性、真实性与难度要求。
Microsoft ResearchAI 评分 微软研究院用机器学习预测电网空间天气风险
微软研究院实习生开发了一套端到端机器学习流水线,为美国本土 66,935 座变电站生成空间天气风险预测,可提前 30 至 60 分钟预警。系统结合 AE 与 Dst 指数预测、地质电导率和电网数据,在 2020-2026 评估期内检测到近 80% 的重大空间天气事件,其中 Dst 预测在 62.2% 的高活跃时段优于 Burton 方程。
Microsoft Research精选AI 评分 微软研究院推出 Quine:面向生物学复杂性的 AI 研究系统
微软研究院推出 Quine,一个面向生物学复杂性的 AI 研究系统,由生物学世界模型和连接模型、科学工具、文献与研究者的交互式 harness 两部分组成。该系统与 Broad Institute 合作用于胰腺导管腺癌(PDAC)研究,从数千个化合物中筛选并优先排序可驱动肿瘤细胞状态转变的候选物,最高排名的化合物在湿实验中产生了最大的预期状态转变,整个流程仅用一个周末完成。
推荐理由:微软研究院公开 Quine 的生物学世界模型与实验编排框架,并给出胰腺癌化合物筛选的湿实验验证结果。
OpenBMB@OpenBMBAI 评分 X:DAIR.AI (@dair_ai)AI 评分 Amazon AGI 提出 AutoGym:从领域种子生成可验证的智能体 RL 环境
Amazon AGI 提出 AutoGym,可从少量领域种子或过往模型轨迹出发,同时生成任务、可执行环境与验证器,用于为智能体构建强化学习环境。该工作将"创建 RL 环境"视为一项重要的 AI 工程新技能,作者认为这一方向正出现明显转变。论文已发布在 arXiv(2609.22592)。
X:DAIR.AI (@dair_ai)AI 评分 Salesforce AI Research 提出 Critical-State RL:多轮工具调用只训练关键回合
Salesforce AI Research 提出 Critical-State RL,用于多轮工具调用的强化学习:当奖励依赖后续回合时,只训练真正改变结果的那一次调用,而非把奖励摊到整条轨迹上。
TencentHunyuan@TencentHunyuanAI 评分
Microsoft ResearchAI 评分 微软开源逆合成模型 RetroChimera,成果登上 Nature
微软研究院在 Nature 发表逆合成模型 RetroChimera,并开源其实现与权重。该模型用学习式重排序整合 Transformer 模型 R-SMILES 2 与 GNN 模型 NeuralLoc,在盲测中化学家更偏好其单步反应预测;十个挑战性目标的多步路线中 RetroChimera 成功九个,优于 de novo 模型的五个、编辑模型的四个和 NeuralSym 的两个。