ALoDLM Adaptively Looped Diffusion Language Models paper: huggingface.co/papers/2610.0…
#开源/仓库
#开源/仓库
_akhaliq@_akhaliqAI 评分 HuggingPapers@HuggingPapersAI 评分 ID-Forcing:让长视频生成保持在分布内 自回归视频模型会漂移到训练时长之外。ID-Forcing 将 KV caching 和条件对齐到训练状态,无需微调即可生成分钟级视频。
Microsoft ResearchAI 评分 微软开源逆合成模型 RetroChimera,成果登上 Nature
微软研究院在 Nature 发表逆合成模型 RetroChimera,并开源其实现与权重。该模型用学习式重排序整合 Transformer 模型 R-SMILES 2 与 GNN 模型 NeuralLoc,在盲测中化学家更偏好其单步反应预测;十个挑战性目标的多步路线中 RetroChimera 成功九个,优于 de novo 模型的五个、编辑模型的四个和 NeuralSym 的两个。
Hugging Face Blog精选AI 评分
IBM 研究提出一致性指南,将 ReAct 智能体的 Pass^5 一致性差距从 24.4 点缩小到 12.0 点
IBM 研究团队在 ALTK-Evolve 中新增一致性指南(consistency guidelines),基于 Consistency Analyzer 诊断智能体轨迹中易翻转的决策点。
推荐理由:原文用 Pass^k 与 Mean@k 的差距量化智能体不确定性,并给出可复用的诊断与改进流程。
Import AIAI 评分Import AI 470:机器不应享有权利;SPADE 自动生成训练环境;Hawkeye 优化 GPU kernel
METR 分析发现 AI 对科研的加速并不均衡:2026 年网络安全漏洞报告速度较 2025 年大幅加快,数学领域贡献有限,AI 研究本身的算法进展则未见可测加速。多校团队提出 SPADE 框架,让 LLM 交替生成可执行训练环境并求解,在 Qwen3-30B-A3B 上使游戏环境套件均分达 58.3,较基线提升 8.1。
Hugging Face BlogAI 评分
Hugging Face 论文:用离线 Top-K Logits 与融合分块 KL 损失降低 LLM 知识蒸馏成本
Hugging Face 最新论文提出两项系统改动,让 LLM 知识蒸馏成本大幅下降:先离线缓存教师模型的 top-100 logits,使教师模型无需与学生模型同时驻留显存;再用融合分块 KL 损失,避免生成完整的词表×序列长度矩阵。
Hugging Face BlogAI 评分
ScarfBench:面向企业级 Java 框架迁移的 AI 智能体基准测试
Hugging Face 发布开源基准 ScarfBench,用于评估 AI 智能体在企业级 Java 框架迁移中的表现,覆盖 Spring、Jakarta EE、Quarkus 三大生态,含 34 个应用、102 个框架实现、204 个迁移任务和 1331 个专家测试。
Import AIAI 评分Import AI 457:AI 版 Stuxnet、Muon 优化器缺陷与正向对齐
Import AI 457 关注三件事:SentinelOne 拆解出约 20 年前的病毒 fast16.sys,它通过篡改 LS-DYNA 970、PKPM、MOHID 等高精度计算软件的内存结果来破坏工程与物理仿真。
Google ResearchAI 评分Google Research 用 AI 合成神经元加速脑图谱绘制,重建误差降低 4.4%
Google Research 提出 MoGen(Neuronal Morphology Generation),基于 PointInfinity 点云流匹配模型生成合成神经元形状,为 PATHFINDER 重建模型补充训练数据,使小鼠轴突重建误差降低 4.4%,主要来自 merge error 的减少。
Hugging Face BlogAI 评分
IBM 与 UC Berkeley 用 ITBench 和 MAST 诊断企业级智能体为何失败
IBM Research 与 UC Berkeley 用 MAST 失败分类法分析 ITBench 中 310 条 SRE 执行轨迹,覆盖 Gemini-3-Flash、Kimi-K2 和 GPT-OSS-120B 三类模型。
Google ResearchAI 评分Google 开源 DialogLab:编写、模拟与测试动态人-AI 群组对话
Google Research 在 ACM UIST 2025 发布开源原型框架 DialogLab,用于编写、模拟和测试动态的人-AI 群组对话,将对话的社交设定与时间推进解耦,支持拖拽式场景搭建、实时预览与验证仪表盘。14 名游戏设计、教育和社会科学领域参与者的评测显示,human control 模式在参与度、有效性和真实感上显著优于 autonomous 与 reactive 模式。
Hugging Face BlogAI 评分
Intel 发布 DeepMath:基于 smolagents 的轻量级数学推理 Agent
Intel AI Software Group 推出 DeepMath,一个基于 Qwen3-4B Thinking 并用 GRPO 微调的数学推理 Agent,通过 smolagents 实现,让模型生成 Python 片段在沙箱中执行并回填结果。
Hugging Face Blog精选AI 评分
ServiceNow 发布 Apriel-H1:将 15B 推理模型蒸馏为 Mamba 混合架构,吞吐提升 2.1 倍
ServiceNow 的 SLAM Lab 发布 Apriel-H1,把 15B 推理模型改造成 Mamba 混合架构,旗舰版 Apriel-H1-15b-Thinker-SFT 实现 2.1 倍吞吐且质量损失很小,MATH500 从 0.90 升到 0.92、MTBench 从 8.30 升到 8.58,GSM8k、GPQA、AIME24 略有下降。
推荐理由:ServiceNow 公开了把 15B 推理模型蒸馏成 Mamba 混合架构的完整流程与七个 checkpoint,可看到效率与质量的取舍曲线。
Hugging Face BlogAI 评分
Hugging Face 开源多面手 Transformer 智能体 JAT,单网络玩转 157 项任务
Hugging Face 发布 JAT(Jack of All Trades),一个基于 GPT-Neo 架构的多模态 Transformer 智能体,用单一网络在 157 项训练任务上达到专家平均性能的 65.8%。
Hugging Face BlogAI 评分
Hugging Face 发布 WebSight 数据集,用截图生成 HTML 代码
Hugging Face 推出 WebSight 数据集,用于训练 AI 将网页截图转换为 HTML 代码。该数据集从 v0.1 的 82.3 万对 HTML 与截图样本扩展至 v0.2 的 200 万例,改用真实图像截图并切换至 Tailwind CSS。基于该数据集微调的视觉语言模型 Sightseer 可将网页截图转为可用的 HTML 代码,并能在生成结果中嵌入与原截图相近的图像。
OpenAI NewsAI 评分 OpenAI 发布 Neural MMO:大规模多智能体游戏环境
OpenAI 发布 Neural MMO,一个面向强化学习智能体的大规模多智能体游戏环境。该平台支持在持久、开放式的任务中容纳数量可变的大量智能体,多智能体与多物种的引入带来更好的探索、差异化的生态位形成以及整体能力的提升。
OpenAI NewsAI 评分 OpenAI 发布 CoinRun:量化强化学习泛化能力
OpenAI 发布训练环境 CoinRun,用于衡量智能体将经验迁移到新情境的泛化能力,并已帮助厘清强化学习领域一个长期存在的难题。CoinRun 在复杂度上取得平衡:比《刺猬索尼克》等传统平台游戏更简单,但对当前最先进算法仍构成值得挑战的泛化测试。
OpenAI NewsAI 评分 OpenAI 发布八个模拟机器人环境与 HER Baselines 实现
OpenAI 发布八个模拟机器人环境,以及 Hindsight Experience Replay 的 Baselines 实现,均出自其过去一年的研究。这些环境已用于训练可迁移到实体机器人的模型,OpenAI 同时发布了一组机器人研究议题。