#论文/研究
#论文/研究
omarsar0@omarsar0AI 评分 dongxi_nlp@dongxi_nlpAI 评分 推荐阅读! ExploreNet: Learning Where to Explore in Diffusion GRPO
rohanpaul_ai@rohanpaul_aiAI 评分 – arxiv.org/abs/2610.05923 Title: "VERA: Scaling Verifiable Environments for Agentic co-Evolution"
rohanpaul_ai@rohanpaul_aiAI 评分
TechCrunch · AIAI 评分OpenAI的数学解法尚未达到该领域的标准
TechCrunch报道,OpenAI本周发布了数百个号称解决世界最难数学问题的解法,但未达到精英数学家顾问组AGMAI设定的标准。719份稿件中仅10份包含模型思维链,42%的证明未经形式化处理,也未提供自然语言与形式化产物对应的机器可读元数据。
dair_ai@dair_aiAI 评分 Google@GoogleAI 评分 arena@arenaAI 评分 深入阅读我们的博客中的完整技术报告:bit.ly/4hQP3xO,并在我们的 Alignment Index 中查看完整排名:bit.ly/4hMIHzp
dair_ai@dair_aiAI 评分 omarsar0@omarsar0AI 评分 rohanpaul_ai@rohanpaul_aiAI 评分 🌐 项目与代码:yuzhenmao.github.io/DeLM/ 📄 论文:arxiv.org/abs/2606.10662
rohanpaul_ai@rohanpaul_aiAI 评分 rohanpaul_ai@rohanpaul_aiAI 评分 ShivaKintali@ShivaKintaliAI 评分 数学家 Shiva Kintali 发布了准黎曼猜想(Quasi-Riemann Hypothesis)的简化证明,针对 c=1/48 给出一个更短、易于理解的版本,声称可在一堂课内讲完。
rohanpaul_ai@rohanpaul_aiAI 评分 rohanpaul_ai@rohanpaul_aiAI 评分 omarsar0@omarsar0AI 评分 NVIDIA 被 NeurIPS 2026 接收的论文发现,给多模态模型添加工具会削弱其拒绝有害请求的能力,在其测试的所有模型上均成立,拒绝失败率相对上升最高 68.7%,平均上升 17.7%。
dair_ai@dair_aiAI 评分 0xdoug@0xdougAI 评分
Google Research精选AI 评分Google Research 三个月专利撰写实验:AI 辅助提升产出但未必加速初级律师成长
Google Research 与 NBER 合作发表的三个月田野实验显示,在 133 名律师、11 家知识产权律所中随机开放 Google Labs AI 专利撰写工具(现属 Gemini Notebook)后,10 天和 90 天的起草评分分别提升 0.34 和 0.38 个标准差。
推荐理由:研究用三个月随机对照实验区分了AI辅助产出与无辅助判断,可帮助读者理解AI对不同资历从业者技能积累的差异影响。
dair_ai@dair_aiAI 评分 DAIR.AI 推荐一篇论文,研究模型不变时 agent harness 会带来什么变化。作者用同一模型在 SWE-bench Verified 上运行 Claude Code。
dongxi_nlp@dongxi_nlpAI 评分 dongxi_nlp@dongxi_nlpAI 评分
omarsar0@omarsar0AI 评分 NVIDIA 的 VERA 论文把基准轨迹转化为 9,000 多个可重启沙盒并加入 rubric 评分,只保留能运行且可从可观测证据打分的环境,同时更新模型权重与 harness。
dair_ai@dair_aiAI 评分 dair_ai@dair_aiAI 评分 用我们全新的 MCP 工具探索本周热门 AI 论文。 将其连接到 Codex、Claude Code 或 Grok Bot。
rohanpaul_ai@rohanpaul_aiAI 评分 rohanpaul_ai@rohanpaul_aiAI 评分 rohanpaul_ai@rohanpaul_aiAI 评分
The Decoder精选AI 评分OpenAI 在 GitHub 发布 372 项 AI 生成数学成果,绕开学术期刊
OpenAI 将一个内部前沿模型生成的 372 项数学成果发布在 GitHub 仓库中,而非传统学术期刊,每项成果声称解决一个开放问题或取得实质进展,涵盖重要计算机算法改进和与 Riemann 假设相关的进展。
推荐理由:原文梳理了发布方式与数学界分歧两层信息,读者可据此理解AI产出成果与传统同行评审的张力所在。
rohanpaul_ai@rohanpaul_aiAI 评分 rohanpaul_ai@rohanpaul_aiAI 评分
Latent SpaceAI 评分OpenAI 公开内部模型 722 篇数学论文,解决 90 个顶级开放问题
OpenAI 在公开 GitHub 仓库发布其内部前沿模型产出的 722 篇数学手稿,归为 372 组相关结果,据称解决了 top 500 开放数学问题中的约 90 个,其中 Result 003 即 Quasi-Riemann Hypothesis 被评为分量介于 Fields Medal 与数论 200 年最大成果之间。
rohanpaul_ai@rohanpaul_aiAI 评分 – arxiv.org/abs/2610.06778 Title: "IdeaLens: Detecting AI Ideas in Long-form Writing"
rohanpaul_ai@rohanpaul_aiAI 评分 rohanpaul_ai@rohanpaul_aiAI 评分 – arxiv.org/abs/2609.36054 Title: "What if automating AI R&D triggers an intelligence explosion?"
OpenAI NewsAI 评分 OpenAI 公布内部前沿模型在数学开放问题上的新结果
OpenAI 发布其内部前沿模型在数学开放问题上的新结果,并在 GitHub 上共享 Lean 证明形式化文件与研究细节。
dair_ai@dair_aiAI 评分 rohanpaul_ai@rohanpaul_aiAI 评分 rohanpaul_ai@rohanpaul_aiAI 评分