#数据/训练
#数据/训练
rohanpaul_ai@rohanpaul_aiAI 评分 fchollet@fcholletAI 评分 natolambert@natolambertAI 评分 percyliang@percyliangAI 评分 omarsar0@omarsar0AI 评分 omarsar0@omarsar0AI 评分 DAIR.AI 的 Elvis Saravia 推荐一篇关于小语言模型 Agent 的 harness-aware distillation 论文(arxiv.org/abs/2610.02858)。
Google Research精选AI 评分Google Earth AI 开放地球人口动力学基础模型用于全球公共卫生研究
Google Research 介绍以 Earth AI 的 Population Dynamics Foundation Model(PDFM)作为公共卫生领域的行星地理基础模型概念验证,将隐私保护的搜索趋势、人类流动、建成环境密度与环境因素压缩为月度刷新的位置嵌入,无需任务特定微调即可直接接入流行病学现有工作流。
推荐理由:原文用五个独立合作评估展示了同一组位置嵌入在不同疾病与资源环境下的可迁移性,读者可据此判断地理基础模型在公共卫生工作流中的实际适用边界。
The DecoderAI 评分JEPA-Anything 把 LeCun 的 JEPA 扩展为跨领域通用世界模型
研究团队(由 PhAI Labs 牵头,与 Stanford、Oxford、Princeton 合作)提出 JEPA-Anything,把 JEPA 的预测状态拆成四个正交因子、各由独立预测模块处理后再重组,以避免简单模式淹没困难模式。
rohanpaul_ai@rohanpaul_aiAI 评分 上海AI实验室新论文提出 SkillGym,把每个技能文件转成带代码检查器的沙箱任务,只用通过校验的运行数据微调模型,使模型在不加载技能文件的情况下也变得更强。
ben_burtenshaw@ben_burtenshawAI 评分 HuggingPapers@HuggingPapersAI 评分 ClementDelangue@ClementDelangueAI 评分 rohanpaul_ai@rohanpaul_aiAI 评分 rohanpaul_ai@rohanpaul_aiAI 评分 akshay_pachaar@akshay_pachaarAI 评分 socialcapital@socialcapitalAI 评分 rohanpaul_ai@rohanpaul_aiAI 评分 rohanpaul_ai@rohanpaul_ai精选AI 评分 推荐理由:编辑精选:对个人智能体设计有直接参考价值,区分适合用记忆表达的偏好与应由代码维护的状态,并给出记忆长度的实验对比。结论限于文中测试条件。
The DecoderAI 评分Google 研究者提出 RRSI,防止自我改进智能体记住测试任务
Google 研究者提出 RRSI(Regularized Recursive Self-Improvement of Agent Harnesses),通过随时间收缩的编辑预算和严格评审机制,阻止智能体在自我优化中记住测试任务。
The DecoderAI 评分NASA 与 IBM 发布开源月球基础模型,基于 17 年轨道器数据
NASA 与 IBM Research 联合多家学术机构发布 NASA-IBM Lunar Foundation Model,称其为最早的开源月球科学基础模型之一。
dair_ai@dair_aiAI 评分 DAIR.AI 推荐 Meta 关于可靠自动科研智能体的论文 RankEvolve:它用编译后的协议约束每个研究阶段与关卡,让 Claude Code 和 Codex 作为独立节点互相评审并修复改动。
omarsar0@omarsar0AI 评分 emollick@emollickAI 评分 🎵 蒸馏浪潮 🎵 美国实验室称中国实验室蒸馏他们的模型。而欧洲新的"主权模型"是在由……GLM 和 Qwen 生成的数据上微调的。
TechCrunch · AIAI 评分AWS CEO 回应数据中心抵制:Amazon 称已不再使用 NDA
AWS CEO Matt Garman 在博客中表示,Amazon 在与政府机构就数据中心项目合作时已不再使用保密协议(NDA)。他同时反驳数据中心耗水过多、推高电价、污染严重、无益社区四大说法,称数据中心直接用水仅占美国工业用水 0.5%,发电机 99.9% 时间闲置,并称过去三年 Amazon 已向有数据中心布局的美国社区投入超 10 亿美元。
The Verge · AIAI 评分Capcom 计划打造“与 AI 共同创作游戏”的未来
Capcom 在 Capcom Open Conference RE: 2026 上表示,计划将 RE Engine 逐步改造成“AI 生成游戏引擎”,迈向“与 AI 共同创作游戏”的未来。程序员 Satoshi Ishida 称,将把 AI 技术整合进开发流程以提升效率;Capcom 此前表示不会在游戏中使用 AI 生成素材。
dair_ai@dair_aiAI 评分
huggingface@huggingfaceAI 评分 Hugging Face 团队发布多 harness 强化学习完整指南,指出同一模型同一权重在不同 agent harness 下得分可差至 62% 与 33%。
X:Rohan Paul (@rohanpaul_ai)AI 评分 Yann LeCun 在 ETH Zürich 演讲称 Scaling LLM 无法实现 AGI
Yann LeCun 在 ETH Zürich 的最新演讲中表示,靠扩大 LLM 规模实现 AGI 是“不可能的”。他指出,大语言模型训练约 30 万亿 token,约合 10^14 字节文本,一个人读完需要约 40 万年;而一个 4 岁儿童仅通过视觉在约 1 年 10 个月内就接收到同等量级的数据。
adithya_s_k@adithya_s_kAI 评分 X:Elon Musk (@elonmusk, xAI)AI 评分 Elon Musk:Terafab 目标年产 1 TW 算力,约为当前全球 AI 算力产出的 50 倍
Elon Musk 称 Terafab 目标是每年生产 1 TW 算力,约为当前全球 AI 算力产出的 50 倍,并称台积电对 Terafab 的贡献基本只是补充。他表示 Terafab 本身规模将极其庞大,是按半导体行业现有任何已知规模都无法运作的量级建造的,并非又一座普通晶圆厂。
The DecoderAI 评分开源工具 BootLoops 让 Claude 完成精确科学计算,三个月产出 36 篇手稿
哈佛大学物理学家 Matthew Schwartz 在 Anthropic 客座文章中介绍开源工具 BootLoops,它让 Claude 完成精确科学计算,源码已在 GitHub 发布。
X:DAIR.AI (@dair_ai)AI 评分 Meta 提出 Context Language Models,让模型原生管理自身上下文
Meta 与合著者提出 Context Language Models(CLM),把上下文作为模型可用 Bash 编辑的文件,由模型决定保留、改写或删除哪些内容。
X:SemiAnalysis (@SemiAnalysis_)AI 评分 SemiAnalysis:定制 HBM 可将 Nvidia Rubin 计算芯片的 HBM4 控制器与 PHY 占用面积减少约 60%
SemiAnalysis 估算 HBM4 控制器和 PHY 约占 Nvidia Rubin 计算芯片 16% 面积。定制 HBM 用紧凑 D2D 链路替代标准 PHY,Samsung 数据显示其标准 HBM4 PHY 占 8mm x 4mm,定制 D2D 接口仅需 8.5mm x 1.5mm,面积减少约 60%,同时内存控制器从计算芯片移至 HBM base die。
X:SemiAnalysis (@SemiAnalysis_)AI 评分 SemiAnalysis:定制 HBM 可将 HBM4 控制器与 PHY 占用面积减少约 60%
SemiAnalysis 估算 HBM4 控制器和 PHY 约占 Nvidia Rubin 计算芯片 16% 面积,定制 HBM 可将这部分空间还给计算或缓存。
X:SemiAnalysis (@SemiAnalysis_)AI 评分 SemiAnalysis:HBM4 控制器与 PHY 约占 Nvidia Rubin 计算die 16%
SemiAnalysis 估算,HBM4 控制器和 PHY 约占 Nvidia Rubin 计算 die 的 16%,大量先进制程面积被用于与内存通信而非计算。
X:SemiAnalysis (@SemiAnalysis_)AI 评分 Johnson Matthey 预测 2026 年钌需求 119.3 万盎司,超过 97.7 万盎司的一次供应
Johnson Matthey 预计 2026 年钌需求达 119.3 万盎司,而一次供应仅 97.7 万盎司,需求已超过供应。化学品需求预计下降 16%,主因中国尼龙产能过剩,这也解释了价格为何未进一步上涨。电子需求从 2023 年的 30 万盎司增至 2025 年的 41.3 万盎司,2026 年预计达 43.5 万盎司,数据中心扩张将推动硬盘用钌需求创五年新高。
X:Elvis Saravia (@omarsar0, DAIR.AI)AI 评分 Meta 等提出 Context Language Models:让模型用 Bash 编辑自身上下文
Meta 与同事的论文提出 Context Language Models(CLM),把上下文作为模型可用 Bash 编辑的文件,由模型决定保留、改写或删除哪些内容。
X:Elvis Saravia (@omarsar0, DAIR.AI)AI 评分 Volantis 用光学技术破解 AI 内存瓶颈,目标单用户 10000 tokens/秒推理速度
Volantis 完成 8800 万美元 A 轮融资,通过光学技术为每颗芯片提供更大容量和更高带宽的内存,目标在超过 10T 参数的模型上实现每用户最高 10000 tokens/秒的推理速度。该方案旨在解决 AI 内存瓶颈,初期可让原本耗时数小时的编程智能体在几分钟甚至几秒内完成。团队曾参与首款 CoWoS 产品、早期 HBM 及首款硅光 CPO 系统等半导体技术研发,下一代产品已完成流片。
X:Elvis Saravia (@omarsar0, DAIR.AI)AI 评分 ProVer:用 LLM 裁判定位关键步骤,改进智能体 RL 的信用分配
ProVer 提出一种智能体强化学习信用分配方法:由 LLM 裁判对比成功与失败的 rollout,指出造成差异的关键片段,再通过该片段前后采样续写、以成功率变化作为该片段的优势值。在 ALFWorld、WebShop 和 SearchQA 上,相对 GRPO 分别带来 Qwen3.5-2B 9.91%、Qwen3.5-4B 7.12% 的相对提升,裁判换成更小模型时仍有效。
X:Elvis Saravia (@omarsar0, DAIR.AI)AI 评分 Kled V3 发布:72 小时内向 50 万+ 贡献者网络派发数据采集任务
Kled V3 允许实验室指定所需数据,并在 72 小时内将采集任务部署到其 50 万+ 自愿贡献者网络,覆盖图像、视频、音频、文本和标注的 108 个可配置模板。贡献者用手机按说明和合格示例完成采集,形成"定位模型失败点—转为采集任务—获取真实世界新样本—再训练评估"的更紧反馈闭环。