OpenAI 公布内部前沿模型在数学开放问题上的新结果
OpenAI 发布其内部前沿模型在数学开放问题上的新结果,并在 GitHub 上共享 Lean 证明形式化文件与研究细节。
OpenAI 发布其内部前沿模型在数学开放问题上的新结果,并在 GitHub 上共享 Lean 证明形式化文件与研究细节。
目标是让研究人员和公共卫生官员补充现有健康信息,弥合报告缺口,并主动应对健康挑战。 了解更多我们的最新研究 ↓ goo.gle/3TLTX73
ALoDLM Adaptively Looped Diffusion Language Models paper: huggingface.co/papers/2610.0…
ID-Forcing:让长视频生成保持在分布内 自回归视频模型会漂移到训练时长之外。ID-Forcing 将 KV caching 和条件对齐到训练状态,无需微调即可生成分钟级视频。
DAIR.AI 的 Elvis Saravia 推荐一篇关于小语言模型 Agent 的 harness-aware distillation 论文(arxiv.org/abs/2610.02858)。
Google Research 介绍以 Earth AI 的 Population Dynamics Foundation Model(PDFM)作为公共卫生领域的行星地理基础模型概念验证,将隐私保护的搜索趋势、人类流动、建成环境密度与环境因素压缩为月度刷新的位置嵌入,无需任务特定微调即可直接接入流行病学现有工作流。
推荐理由:原文用五个独立合作评估展示了同一组位置嵌入在不同疾病与资源环境下的可迁移性,读者可据此判断地理基础模型在公共卫生工作流中的实际适用边界。
研究团队(由 PhAI Labs 牵头,与 Stanford、Oxford、Princeton 合作)提出 JEPA-Anything,把 JEPA 的预测状态拆成四个正交因子、各由独立预测模块处理后再重组,以避免简单模式淹没困难模式。
– arxiv.org/abs/2609.38445 Title: "AIM: Agentic Idea Management for Automated Research"
DAIR.AI 介绍一篇提出 PAIR 的论文,该方法从同一状态重放智能体、分别在有无压缩下对比,以定位上下文压缩对长程智能体的损害。
– arxiv.org/abs/2609.36365 标题:"Engineering Simplicity: Simple Mechanism Interfaces Steer LLM Agents"
– arxiv.org/abs/2609.35738 Title: "Harness Learning Enables Generalizable Test-Time Adaptation"
Johns Hopkins 与 Carnegie Mellon University 的新论文显示,一个 4B 小模型通过学习失败报告来改写 agent 的 harness 代码,可迁移到新任务。
上海AI实验室新论文提出 SkillGym,把每个技能文件转成带代码检查器的沙箱任务,只用通过校验的运行数据微调模型,使模型在不加载技能文件的情况下也变得更强。
Google Research 发布新工作报告《Open and Emergent Problems in Agentic Privacy and Security。
微软发表关于智能体 harness 自动优化的新论文,提出 ActiveSaddler 方法,通过追踪失败模式、优先处理最值得修复的失败或尝试未见过的任务来选择训练任务,而非使用固定任务列表。
Jack Clark 在本期 Import AI 中讨论了 Toby Ord 关于智能体群体(swarm)扩展的分析:群体作为新的推理扩展形式,4 个智能体的群体用约两倍总 token 达到同等性能,但因并行只需一半时间;群体规模扩大 10x 只带来 3x 到 5x 的性能提升,存在类似经济学中踩脚效应的收益递减,但仍可能提高 RSI 驱动智能爆炸的概率。
MIT一份于6月2026日发布的报告指出,AI正削弱大学体验的核心部分:答疑时间出席减少、在线讨论参与下降、宿舍与图书馆学习小组变少,师生间信任也在流失。
EditHero 一个面向长时程部件级3D编辑与Vibe建模的基准 论文:huggingface.co/papers/2610.0…