Qwen3.8 27B 本地模型英文单词加法评测:关闭推理准确率 23.57%,开启后 169 次答对 167 次
Simon Willison 在本地 DGX Spark 上用 Qwen3.8-27B-Q4_K_M.gguf 复现了 Colin Frasier 两年前用 GPT-4o 做的加法实验,让模型把正整数相加并仅用英文单词给出精确结果。
Simon Willison 在本地 DGX Spark 上用 Qwen3.8-27B-Q4_K_M.gguf 复现了 Colin Frasier 两年前用 GPT-4o 做的加法实验,让模型把正整数相加并仅用英文单词给出精确结果。
NVIDIA 一篇关于终端智能体测试时算力的论文提出 Mid-Harness 方法:采样多条候选 shell 命令并先验证再执行,把更多算力花在验证器而非增加采样上。
Cerebras 联合创始人兼 CEO Andrew Feldman 指出影响 AI 加速器行业的三大供应链瓶颈:HBM 内存、CoWoS 封装产能以及获取台积电 3nm 制程。
Aleph Alpha 发布开源权重模型 Kolibri,采用 MoE 架构,78B 总参数、3.46B 激活参数,支持 1M 上下文窗口,以 Apache 2.0 许可证分发。
Elvis Saravia 推荐一篇论文,其核心发现是配备轻量推理框架的预训练大语言模型即可充当能力足够的智能体,在测试时预算充足的情况下甚至能超越经过后训练的对应模型。
NYU 教授 Yann LeCun 在视频中讲解 LLM 之后的技术路线,并讨论大语言模型是否足以实现人类级智能。该内容为 Rohan Paul 转推中附带的完整视频链接。
Cerebras 联合创始人兼 CEO Andrew Feldman 解释,其晶圆级架构在 LLM 推理的 decode 阶段比 GPU 快约 2500 倍。
1/9 NCA 中的局部通信可以产生视觉"思维链"。 例如,在迷宫中,NCA 并行探索路径并从死胡同回溯,很像黏菌 🍄;在 ARC-AGI-1 中,颜色和形状在网格上逐步移动以解决任务!
webAI 发布开源小模型 TwIL-LM3-Pro,仅 3.6B 参数,提供量化版本可在日常电脑本地运行,无需云端。其 BIG-Bench Hard 逻辑子集得分 95.4%,对比 VibeThinker-3B 的 61.1%;SVAMP 95%、MuSR 64.1%。
Meta Superintelligence Labs 提出用专用控制器调度长程智能体任务,在相同 worker 和相同预算下,GPT-5.5 在 ProgramBench 上从 63.7% 提升至 71.5%,Codex 得分为 58.0%。
ProVer 提出一种智能体强化学习信用分配方法:由 LLM 裁判对比成功与失败的 rollout,指出造成差异的关键片段,再通过该片段前后采样续写、以成功率变化作为该片段的优势值。在 ALFWorld、WebShop 和 SearchQA 上,相对 GRPO 分别带来 Qwen3.5-2B 9.91%、Qwen3.5-4B 7.12% 的相对提升,裁判换成更小模型时仍有效。
伯克利论文《When Context Changes: Understanding Update Failures in LLMs》发现,当偏好或截止时间等发生变化时,旧版本仍留在上下文中,模型虽掌握新值,注意力却持续漂回旧提及。
Volantis 完成 8800 万美元 A 轮融资,由 Lachy Groom 和 Abstract 联合领投,John Doerr、Susa Ventures、VXI Capital 和 Triatomic Capital 参投。
SemiAnalysis 指出,在 Rubin 上 HBM 控制器和 PHY 约占 GPU 芯片面积的 16%,而在采用 NVHBM 的 Feynman 上估计降至约 4%。
关于我们与 Cerebras 的合作有一些猜测。 Cerebras 是我们的紧密合作伙伴,我们深度合作,共同推动速度的前沿。