#推理
#推理
ArtificialAnlys@ArtificialAnlysAI 评分 emollick@emollickAI 评分 有意思的是,鉴于 OpenAI 发布一系列证明所引发的争议,以及这对数学学科意味着什么,至少部分 OpenAI 的证明似乎已经引发了广泛协作社区极其快速的迭代式进展。
rohanpaul_ai@rohanpaul_aiAI 评分 rohanpaul_ai@rohanpaul_aiAI 评分 数学将从这里开始以惊人的速度发展。 研究人员在几小时内就能发现新方法/新证明。 这是一种相乘超长数字的新方法,比之前最好的理论允许的少浪费一点精力。
emollick@emollickAI 评分
elonmusk@elonmuskAI 评分 dongxi_nlp@dongxi_nlpAI 评分 LLMs 有很多可以 scale 的维度。 但 OpenAI 最近的拉垮告诉我们,verifier scaling 目前看来是最无聊,最慢,用户体验感最差的一种 scale 方式。
rohanpaul_ai@rohanpaul_aiAI 评分 Simon WillisonAI 评分 Simon Willison 引述 Jake Boggan:Barnette 猜想被证明,我花了 24 年研究它
Jake Boggan 在 Hacker News 上评论称,他研究了 24 年的 Barnette 猜想据称已被证明(problem 180),令他心情复杂。他曾在布达佩斯学习图论,为该问题投入数千小时,去年夏天一度以为自己解开了它。
Yuchenj_UW@Yuchenj_UWAI 评分 两年前的2024年,我们还在嘲笑GPT-4o把“Is 9.9 > 9.11?”答得离谱地错。 现在感觉所有最难的数学题都将被AI解决。 我们正生活在多么疯狂的时代。
rohanpaul_ai@rohanpaul_aiAI 评分 一篇由包括Geoffrey Hinton和Yoshua Bengio在内的20多位专家撰写的政策论文,呼吁各国政府开始追踪AI研究中已有多少由AI自主完成。
fchollet@fcholletAI 评分 重新表述:G 是从数学 + 代码 RLVR 中"涌现"的吗?还是你只获得了更高的数学 + 代码技能,而没有其他任何东西? 也许 G 是一种技能,它与数学 + 代码问题求解同构?
fchollet@fcholletAI 评分 dongxi_nlp@dongxi_nlpAI 评分 rohanpaul_ai@rohanpaul_aiAI 评分 Microsoft ResearchAI 评分 Microsoft Research 播客访谈:AI 评测中的意外失败与应对之道
Microsoft Research 播客中,主持人 Chad Atalla 与 Microsoft 合作研究经理、Purdue 教授 Jennifer Neville 对谈,讨论评测如何推动当今 AI 系统性能边界,以及模型在传统基准之外测试时出现的意外失败。
rohanpaul_ai@rohanpaul_aiAI 评分 rohanpaul_ai@rohanpaul_aiAI 评分 omarsar0@omarsar0AI 评分 SemiAnalysis_@SemiAnalysis_AI 评分
The Verge · AIAI 评分The Verge:AI 收购数学领域的争议全景
The Verge 发文梳理过去一年 OpenAI、Anthropic 等实验室在长期未解数学问题上宣布的突破,包括解决一个著名的 Millennium Prize 问题,以及这些结果在学界引发的反弹。
omarsar0@omarsar0AI 评分 rohanpaul_ai@rohanpaul_aiAI 评分
emollick@emollickAI 评分 rohanpaul_ai@rohanpaul_aiAI 评分
elsleightholm@elsleightholmAI 评分 omarsar0@omarsar0AI 评分 Elvis Saravia 推荐一篇论文,其核心发现是配备轻量推理框架的预训练大语言模型即可充当能力足够的智能体,在测试时预算充足的情况下甚至能超越经过后训练的对应模型。
X:Rohan Paul (@rohanpaul_ai)AI 评分 Yann LeCun 讲解 LLM 之后:大语言模型足以实现人类级智能吗
NYU 教授 Yann LeCun 在视频中讲解 LLM 之后的技术路线,并讨论大语言模型是否足以实现人类级智能。该内容为 Rohan Paul 转推中附带的完整视频链接。
X:Rohan Paul (@rohanpaul_ai)AI 评分 Cerebras CEO 解释晶圆级架构为何在 LLM 推理中比 GPU 快 2500 倍
Cerebras 联合创始人兼 CEO Andrew Feldman 解释,其晶圆级架构在 LLM 推理的 decode 阶段比 GPU 快约 2500 倍。
Thom_Wolf@Thom_WolfAI 评分 latentspacepod@latentspacepodAI 评分 fchollet@fcholletAI 评分 SemiAnalysis_@SemiAnalysis_AI 评分 ShayanCJahan@ShayanCJahanAI 评分 dongxi_nlp@dongxi_nlpAI 评分
MIT Technology Review · AIAI 评分
别被迷惑——LLM 并不会推理
前 Google DeepMind 研究员指出,LLM 靠逐个预测 token 生成答案,其思维链仍由同一套下一 token 预测产生,并非 AlphaGo 那种独立搜索机制,因此不构成真正的推理。他列举三大缺陷:模型没有显式可检查的认知状态、知识与推理在权重中纠缠不清、思维链常是事后编造。为此他离开 Google DeepMind,主张借鉴 AlphaGo 架构,让系统维护可更新的认知状态。
Latent SpaceAI 评分MIT 的 Alex Zhang 谈 RLM、GPU Kernel 与智能体集群研究
MIT 的 Alex Zhang 在 Latent Space 播客中介绍了其递归语言模型(RLM)研究,基于 RLM 的 harness 是首个接近解决 ARC-AGI-3 的方案,早于 OpenAI 的 Astra。
AnthropicAI@AnthropicAIAI 评分
Replit@ReplitAI 评分 arcprize@arcprizeAI 评分