OpenAI 公布内部前沿模型在数学开放问题上的新结果
OpenAI 发布其内部前沿模型在数学开放问题上的新结果,并在 GitHub 上共享 Lean 证明形式化文件与研究细节。
OpenAI 发布其内部前沿模型在数学开放问题上的新结果,并在 GitHub 上共享 Lean 证明形式化文件与研究细节。
Mistral 发布 Mistral Large 4 预览版,这是一个 1 万亿参数、490 亿激活参数的模型,在自家 3,800 块 NVIDIA Grace Blackwell GPU 集群上训练,通过其 API 提供,开放权重版本承诺本月底发布。
ALoDLM Adaptively Looped Diffusion Language Models paper: huggingface.co/papers/2610.0…
Microsoft Research 播客中,主持人 Chad Atalla 与 Microsoft 合作研究经理、Purdue 教授 Jennifer Neville 对谈,讨论评测如何推动当今 AI 系统性能边界,以及模型在传统基准之外测试时出现的意外失败。
TechCrunch Disrupt 2026 于 10 月 13-15 日在旧金山 Moscone West 举行,公布完整分论坛议程,每场 50 分钟、含观众 Q&A,先到先得。
AI 公司 Reflection 发布首个免费开放模型 Beam,采用 501B 总参数、每 token 激活 23B 的 MoE 架构,主打编码、逻辑推理和智能体任务,以更低算力对标 DeepSeek 和 Qwen 等中国开源模型。
DAIR.AI 介绍一篇提出 PAIR 的论文,该方法从同一状态重放智能体、分别在有无压缩下对比,以定位上下文压缩对长程智能体的损害。
我们从机器人自身的日志中进化提示词,使用 SOTA LLM 智能体和人工监督。无需训练。对抗满技能的脚本对手,v1 每局皆输;不到两小时后的 v9,每局皆赢。
The Verge 发文梳理过去一年 OpenAI、Anthropic 等实验室在长期未解数学问题上宣布的突破,包括解决一个著名的 Millennium Prize 问题,以及这些结果在学界引发的反弹。
Reflection AI 发布首个前沿开源权重模型 Beam,称其在高级推理基准上比肩 Z.ai 的 GLM-5.2 等中国领先开源模型,且推理算力消耗低 3-4 倍。
达到 50 TPS 而非 30 TPS,同时拥有目前最优化的 tokenizer。而且这些模型在完成任务所需的 token 数量方面相当高效!
Simon Willison 在本地 DGX Spark 上用 Qwen3.8-27B-Q4_K_M.gguf 复现了 Colin Frasier 两年前用 GPT-4o 做的加法实验,让模型把正整数相加并仅用英文单词给出精确结果。