#推理
#推理
elonmusk@elonmuskAI 评分 OpenAIDevs@OpenAIDevsAI 评分
MiaAI_lab@MiaAI_labAI 评分 MiaAI_lab 展示 GLM 5.3 Flash 在 DGX Sparks 上以 227 tok/s 运行的实测结果,作者称这一速度看起来不太真实,但确实跑出来了。该测试为 4 路并发混合流场景。
AravSrinivas@AravSrinivasAI 评分 OpenRouter@OpenRouterAI 评分 MiniMax_AI@MiniMax_AIAI 评分 perplexitydevs@perplexitydevsAI 评分 rohanpaul_ai@rohanpaul_aiAI 评分 OpenRouter@OpenRouterAI 评分
Hugging Face Blog精选AI 评分
Nemotron 微调后在 IOI 2026 与 IMO 2026 双双达到金牌水平
NVIDIA 官方博客称,基于 Nemotron 3 用 SFT、RL 与反馈式推理特化的系统在 IOI 2026 与 IMO 2026 均达金牌水平:Nemotron-3-Ultra-CC 得 535.4/600,超过 361.12 的金牌线与人类最高分 498.27;IMO 系统得 30/42,超过官方金牌线 29。
推荐理由:原文给出从基座到数据再到推理循环的四步特化配方,读者可据此评估复现金牌级系统的成本与路径。
Latent SpaceAI 评分OpenAI 公开内部模型 722 篇数学论文,解决 90 个顶级开放问题
OpenAI 在公开 GitHub 仓库发布其内部前沿模型产出的 722 篇数学手稿,归为 372 组相关结果,据称解决了 top 500 开放数学问题中的约 90 个,其中 Result 003 即 Quasi-Riemann Hypothesis 被评为分量介于 Fields Medal 与数论 200 年最大成果之间。
rohanpaul_ai@rohanpaul_aiAI 评分
The Verge · AIAI 评分OpenAI 发布 722 篇数学手稿,含未发布模型解决的数百个开放问题
OpenAI 发布一批共 722 篇手稿、覆盖 372 个结果族,称其中包含其未发布的前沿模型解决的数百个长期开放数学问题。据 AGMAI 说明,这批结果包含模型推理摘要、算力估算与尝试问题统计,OpenAI 称平均结果约相当于 ChatGPT Pro 三小时思考算力。
rohanpaul_ai@rohanpaul_aiAI 评分 OpenAI NewsAI 评分 OpenAI 公布内部前沿模型在数学开放问题上的新结果
OpenAI 发布其内部前沿模型在数学开放问题上的新结果,并在 GitHub 上共享 Lean 证明形式化文件与研究细节。
testingcatalog@testingcatalogAI 评分 OpenAI@OpenAIAI 评分 Simon WillisonAI 评分 Mistral 发布 Mistral Large 4 预览版:1 万亿参数、490 亿激活
Mistral 发布 Mistral Large 4 预览版,这是一个 1 万亿参数、490 亿激活参数的模型,在自家 3,800 块 NVIDIA Grace Blackwell GPU 集群上训练,通过其 API 提供,开放权重版本承诺本月底发布。
arcprize@arcprizeAI 评分 arcprize@arcprizeAI 评分 arcprize@arcprizeAI 评分 arcprize@arcprizeAI 评分
arthurmensch@arthurmenschAI 评分
The DecoderAI 评分Reflection 发布开源模型 Beam,主打低算力下的编码与智能体能力
AI 公司 Reflection 发布首个免费开放模型 Beam,采用 501B 总参数、每 token 激活 23B 的 MoE 架构,主打编码、逻辑推理和智能体任务,以更低算力对标 DeepSeek 和 Qwen 等中国开源模型。
ArtificialAnlys@ArtificialAnlysAI 评分 dongxi_nlp@dongxi_nlpAI 评分 rohanpaul_ai@rohanpaul_aiAI 评分
TechCrunch · AIAI 评分Reflection 发布开源权重模型 Beam,称以更低成本对标中国模型
Reflection AI 发布首个前沿开源权重模型 Beam,称其在高级推理基准上比肩 Z.ai 的 GLM-5.2 等中国领先开源模型,且推理算力消耗低 3-4 倍。
thsottiaux@thsottiauxAI 评分 达到 50 TPS 而非 30 TPS,同时拥有目前最优化的 tokenizer。而且这些模型在完成任务所需的 token 数量方面相当高效!
Simon WillisonAI 评分 Qwen3.8 27B 本地模型英文单词加法评测:关闭推理准确率 23.57%,开启后 169 次答对 167 次
Simon Willison 在本地 DGX Spark 上用 Qwen3.8-27B-Q4_K_M.gguf 复现了 Colin Frasier 两年前用 GPT-4o 做的加法实验,让模型把正整数相加并仅用英文单词给出精确结果。
testingcatalog@testingcatalogAI 评分 Aleph Alpha 发布开源权重模型 Kolibri,采用 MoE 架构,78B 总参数、3.46B 激活参数,支持 1M 上下文窗口,以 Apache 2.0 许可证分发。
perplexitydevs@perplexitydevsAI 评分 X:Elvis Saravia (@omarsar0, DAIR.AI)AI 评分 webAI 发布 3.6B 参数 TwIL-LM3-Pro,本地运行并开源
webAI 发布开源小模型 TwIL-LM3-Pro,仅 3.6B 参数,提供量化版本可在日常电脑本地运行,无需云端。其 BIG-Bench Hard 逻辑子集得分 95.4%,对比 VibeThinker-3B 的 61.1%;SVAMP 95%、MuSR 64.1%。
arena@arenaAI 评分 AIatMeta@AIatMetaAI 评分
novita_labs@novita_labsAI 评分 arcprize@arcprizeAI 评分
Latent Space精选AI 评分Google DeepMind 发布 Gemini 4 Argon,支持 1M token 输出
Google DeepMind 推出 Gemini 4 Argon,面向编码、企业知识工作与网络防御,首批开放给 Fairwind 计划的政府用户与可信网络安全人员,后续再向开发者、企业和消费者开放。
推荐理由:汇总了 Gemini 4 Argon 的基准、定价与可用范围,并列出同期多家模型与工具的动态,便于横向比较。
thoughtfullab@thoughtfullabAI 评分 ArtificialAnlys@ArtificialAnlys精选AI 评分 推荐理由:原文给出智能指数、成本和幻觉率的横向对比,读者可据此判断新模型相对竞品的性价比位置。