新在线策略蒸馏方法:教师是方向而非终点,学生可匹配或超越教师
一种新的在线策略蒸馏方法通过外推 RL 引发的表征残差,让学生在四组模型对上匹配甚至超越教师模型。该方法将教师视为方向而非终点,代码和 checkpoint 计划发布。
一种新的在线策略蒸馏方法通过外推 RL 引发的表征残差,让学生在四组模型对上匹配甚至超越教师模型。该方法将教师视为方向而非终点,代码和 checkpoint 计划发布。
ARC Prize 公布 2026 年 ARC-AGI-3 Milestone #2 三位获奖者,均开源了各自得分最高的解法:Daniel Franzen 以 27.9% 获 2.5 万美元,Lord Han Solo 以 23.8% 获 7500 美元,Lohit Siriki 以 22.5% 获 5000 美元。
ARC Prize 2026 公布 ARC-AGI-3 里程碑 #2 的三位获奖者,均开源了各自得分最高的解法:Daniel Franzen 以 27.9% 获 $25K,Lord Han Solo 以 23.8% 获 $7.5K,Lohit Siriki 以 22.5% 获 $5K。
AWS 发布开源决策模型 Strands Decider 2B,基于 Qwen3.5-2B 构建,可在本地运行,用于在预设选项中快速做出选择并给出置信度评分。该模型由 AWS 杰出工程师 Marc Brooker 受 TypeSafe 的 Jev 启发开发,曾在同尺寸模型的 Jevbench 排名中登顶。
Muse 推出开源项目 Muse Gadgets,包含 ESP32 固件和 Linux SDK,开发者可从 gadgets.muse.ai 获取 API token,并用编码智能体基于 GitHub 仓库为 Muse 构建外设。
Keras 社区会议公布可插拔后端计划,MLX 和 PaddlePaddle 后端即将推出,新后端将以附加库形式安装。Keras 将减少新后端所需的算子数量,为所有次要算子添加后端无关实现,并统一新算子的单元测试工具,单个测试框架即可验证类型转换一致性等功能。KerasHub 新增大量模型,并将从 tf-text 预处理迁移至 PyGrain。
Ai2 开源 AstaBrief 8B,一个把研究问题和检索到的文献片段转成带引用报告的模型,基于 Qwen3-8B 经 SFT 和 DPO 训练,权重与训练数据一并开放。
ARC Prize 公布了 Qwen3.8-27B 在 ARC-AGI 上的完整测试结果,并同步给出排行榜、公开结果复现方式与测试政策。相关结果可在 ARC Prize 排行榜查看,复现脚本托管于 arcprize/arc-agi-benchmarking 仓库。
面壁智能 OpenBMB 发布 Diffusion Reward Models(DRM),不再把人类偏好压缩成单一分数,而是学习完整奖励分布,保留分歧、不确定性与多种可能判断。
Blendi 开源了 Dioramas,一个用于电影感交互式 3D 网站的框架,完全免费、无需注册,附带 20 个完整示例站点,每个围绕一个可触摸的交互(如提灯探索博物馆、启动机甲、敲开晶洞)。
typesafe 在 Hugging Face 上线 WorkflowEvals 评测集,同时公开 GitHub 复现仓库和一份名为 evalsafe-onet 的附加数据集。配套博客以 anti-benchmaxxing 为主题,讨论基准刷分问题。
清华NLP(OpenBMB 成员)联合中科院大学、东北大学、UIUC 和约翰霍普金斯大学提出 One-Shot OPD,把 on-policy distillation 的训练集压缩到一条 query。
Unsloth 发布 Qwen-Image-2.1 的 GGUF 量化版本,可在 12GB 显存下本地运行,7B 模型表现与 Nano Banana 2.0 相当。
推荐理由:Unsloth 给出 Qwen-Image-2.1 的本地量化运行方案与显存门槛,可据此判断本地部署成本。
微软研究院在 Nature 发表逆合成模型 RetroChimera,并开源其实现与权重。该模型用学习式重排序整合 Transformer 模型 R-SMILES 2 与 GNN 模型 NeuralLoc,在盲测中化学家更偏好其单步反应预测;十个挑战性目标的多步路线中 RetroChimera 成功九个,优于 de novo 模型的五个、编辑模型的四个和 NeuralSym 的两个。
MiniMax 将 MiniMax Code CLI v0.4.12 面向全球开发者开放,并以 MIT 协议开源。官方称该工具在 FrontierHarness Eval 上取得了 state-of-the-art 的通过率。
推荐理由:MiniMax 把 Code CLI 以 MIT 协议开源并给出 FrontierHarness Eval 成绩,读者可据此判断其编码工具链的开放程度。
开发者 Isaac Mason 用 three.js + spark + crashcat + navcat,在 World Labs Marble 生成的世界里做了一个高斯泼溅浏览器游戏 demo,并发布在 World Labs 的 YouTube 频道。
SparkJS 2.2.0 发布,splat 排序速度提升 20%,部分系统 FPS 提升 14%,打包体积缩小 50%,并包含大量 bug 修复与改进。该版本还支持直接从仓库安装预构建 bundle,无需在本地配置 Rust 工具链。完整变更日志已在 GitHub 发布。
商汤发布开源智能体办公技能套件 SenseNova Skills,将 Deep Research、数据分析、PPT 生成和信息图生成整合在一起,可直接把原始数据处理成可编辑的 .pptx 文件。
Unsloth 宣布 GLM-5.3-Flash 本地 GGUF 推理提速 3.3 倍,整体区间为 1.6–3.4 倍,来自优化解码并额外支持多 token 预测。
微软研究院推出 GigaPath-Flash 和 GigaTIME-Flash,以蒸馏自十亿参数 GigaPath 编码器的 22M 参数 ViT-S 骨干大幅降低病理基础模型算力需求,并以 Apache 2.0 许可开放。
Unsloth 发布 GLM-5.3 的 2-bit 量化版本,体积从 1.51TB 压缩到 239GB,减少约 83%,精度保留约 81%,可在 256GB Mac 或相应 RAM/VRAM 配置上运行。
推荐理由:原文给出量化后的体积与精度保留比例,读者可据此判断本地部署 GLM-5.3 所需的硬件门槛。
Unsloth 发布 GLM-5.3-Flash 的 GGUF 量化版本,可在 128GB 内存上以 3-bit 精度本地运行,并提供了部署指南与 Hugging Face 仓库地址。
推荐理由:Unsloth 放出 GLM-5.3-Flash 的 GGUF 量化版本,并给出 128GB 内存跑 3-bit 的本地部署路径。
METR 分析发现 AI 对科研的加速并不均衡:2026 年网络安全漏洞报告速度较 2025 年大幅加快,数学领域贡献有限,AI 研究本身的算法进展则未见可测加速。多校团队提出 SPADE 框架,让 LLM 交替生成可执行训练环境并求解,在 Qwen3-30B-A3B 上使游戏环境套件均分达 58.3,较基线提升 8.1。