跳到正文

全部动态

今日 2 条
9月4日周五
  1. Google Research36

    Google Research 跨人群基因组预测的迁移学习研究

    Google Research 用 UK Biobank 欧洲人群数据向 Biobank Japan 近 20 万日本人样本做多基因风险评分迁移学习,覆盖 BMI、血压、血脂、血糖等 8 项临床性状。结果显示目标人群样本达 15k 以上时,本地训练模型反超混合欧洲数据训练;HDL、LDL 和血糖等人群特异性强的性状从欧洲数据获益更少。

  2. Google Research66

    Google Research 与 HHMI Janelia 发布雄性果蝇完整脑图谱

    Google Research 与 HHMI Janelia 等机构在 Cell 发表雄性果蝇完整中枢神经系统连接组,包含超过 166,000 个神经元和 1.25 亿个突触连接,是迄今神经元数量最多的脑图谱。

    推荐理由:读者可了解AI驱动的连接组学如何完成迄今神经元数量最多的脑图谱,以及它向脊椎动物扩展的路径。

9月3日周四
9月2日周三
8月28日周五
  1. Hugging Face Blog36

    Hugging Face Open ASR Leaderboard 新增首个全球南方语言:印地语与印度英语评测集 Monsoon

    Hugging Face 与 Voice Arena 合作,在 Open ASR Leaderboard 上新增 Monsoon en-IN 和 Monsoon hi-IN 两个评测集,印地语成为该多语言榜单上首个 Indic 语言。四个公开/私有 split 共覆盖 4,888 名说话人,每人记录 12 项属性,且说话人不重叠;印地语集采用 lattice 标注以容纳多种可接受的拼写变体。

  2. Google Research62

    Google Earth AI 推出行星预测引擎 PPE,自动完成地理空间建模全流程

    Google Earth AI 推出实验性研究能力行星预测引擎(PPE),可依据自然语言查询自主完成地理空间数据发现、特征工程、模型训练与评估,把原本需要数周人工数据工程的建模流程缩短到几分钟。

    推荐理由:原文给出PPE在公共卫生、粮食安全与疫情预测上的基准对比,可了解地理空间建模自动化的能力边界。

8月27日周四
  1. Google Research34

    Google Research 推出 GlucoFM:面向连续血糖监测的双流基础模型

    Google Research 发布 GlucoFM,一个自监督双流基础模型,将血糖的慢变基线趋势与短期波动分离,并保留时间与缺失信息。模型在 109,066 小时无标注 CGM 数据上预训练,覆盖 4 个队列、7 项临床任务共 14 组评估,平均 PR-AUC 比同语料预训练的最佳 GluFormer 变体高 5.8 个百分点。

8月26日周三
  1. Google Research28

    Google AgentHands:为 XR 空间智能体对话生成同步手势

    Google 在 CHI 2026 发布研究原型 AgentHands,让 XR 中的 AI 智能体在说话时同步做出与语音对齐的手势,把抽象指令变成空间中的实体演示。系统通过眼动与场景重建注册物体 3D 包围盒,由后端 LLM 在回复中内嵌 GestureEvent,再在头显端用词级时间戳让手势与 TTS 精确同步。12 人被试内研究对比纯语音基线,结果显示空间指代效果显著提升。

8月25日周二
  1. Hugging Face Blog62

    Multiverse Computing 提出 Quantization-Aware Healing,4-bit 压缩模型在 7/9 基准上超过其 bfloat16 版本

    Multiverse Computing 发布论文《Quantization-Aware Healing: A Practical Recipe for Recovering Compressed, 4-Bit LLMs》,提出 QAH 方法:在结构压缩并量化后,直接从压缩前的原始模型蒸馏,而非从恢复出的 bfloat16 检查点蒸馏。

    推荐理由:论文给出压缩加量化后从原始模型蒸馏的恢复配方,并附9项基准对比与QAT稳定性差异。

8月24日周一
  1. Import AI22

    Import AI 470:机器不应享有权利;SPADE 自动生成训练环境;Hawkeye 优化 GPU kernel

    METR 分析发现 AI 对科研的加速并不均衡:2026 年网络安全漏洞报告速度较 2025 年大幅加快,数学领域贡献有限,AI 研究本身的算法进展则未见可测加速。多校团队提出 SPADE 框架,让 LLM 交替生成可执行训练环境并求解,在 Qwen3-30B-A3B 上使游戏环境套件均分达 58.3,较基线提升 8.1。

8月22日周六
8月21日周五
  1. Hugging Face Blog62

    Hugging Face 研究:语音识别模型存在基准优化问题

    Hugging Face 发布研究,用共识分歧、掩蔽实体检索和拼写切换三项探针量化语音识别中的基准优化现象,评测 11 个开源 ASR 模型。结果显示,部分高分模型会在音频与参考文本矛盾时复现基准的错误转写,VoxPopuli 分析样本中约 40% 的片段被标记出参考错误,涉及约 3% 的参考词,这类模型复现错误参考的比例为 18–30%。

    推荐理由:通过三项探针量化语音模型对基准的过拟合,并给出可复用的检测脚本与榜单入口。

  2. Microsoft Research34

    微软 Skala 1.1 发布:训练数据增 2.5 倍,已接入 CP2K 并推进 Psi4、FHI-aims、ORCA、VASP 集成

    微软研究院发布深度学习交换关联泛函 Skala 1.1,训练数据量为此前首个公开版本的 2.5 倍,在 GMTKN55 的 55 个类别中 32 项排名第一,加权平均误差 2.8 kcal/mol。Skala 现已在 CP2K 中可用,并正被集成进 Psi4、FHI-aims、ORCA 和 VASP,同时微软研究院推出持续追踪各版本计算性能的 living benchmark。

8月19日周三
  1. Hugging Face Blog62

    ALTK-Evolve 研究:智能体到底需要多少记忆

    IBM Research 在 Hugging Face 博客发布 ALTK-Evolve 研究,用 AppWorld 的 585 个多步任务评测八款模型,发现智能体记忆不是开关而是需要按模型校准的剂量。

    推荐理由:八模型对比给出了智能体记忆的三种剂量模式与 token 开销数据,可据此判断自家模型该用全量还是检索式注入。

8月17日周一
8月13日周四
  1. Hugging Face Blog68

    Hugging Face 用智能体复现 2226 篇 ICML 论文

    Hugging Face 在 7 月 15 日至 8 月 2 日举办 ICML 2026 开放复现挑战,1221 名社区成员用 Claude Code、Codex、Cursor 等编码智能体逐条复现论文,共发布 6816 份 Trackio logbook,覆盖 2226 篇论文,占全部录用论文的 34%。

    推荐理由:Hugging Face 公开了 2200 余篇 ICML 论文的复现结果与判定数据,可据此了解智能体参与科研复现的可行边界。

  2. Microsoft Research41

    MindTopo 揭示多模态大模型的空间推理能力短板

    微软研究院推出 MindTopo 基准,用于评测多模态大模型在连通性、封闭、顺序、分离与打结五类拓扑关系上的推理与规划能力。测试显示,模型在静态图像识别上表现明显优于交互式规划任务,且两者均远低于人类水平;失败多发生在规划阶段而非感知阶段,模型在场景变化中会丢失结构关系或提出违反物理约束的动作。图像与视频生成仅在单帧关系可见时偶有帮助,序列任务中仍不可靠。

8月12日周三
  1. Google Research67

    Google Research 发布 AMIE(Video):基于 Gemini 与 Project Astra 的实时视频问诊系统

    Google Research 发布 AMIE(Video),一个基于 Gemini 和 Project Astra 的实时视频问诊配置,可感知非语言临床线索、引导患者演员完成虚拟体格检查并实时进行诊断推理。

    推荐理由:原文给出AMIE(Video)的三智能体异步架构与随机对照评测结果,可了解实时视频问诊中视听感知与推理的分工方式。

8月11日周二
8月10日周一
8月3日周一
  1. Import AI66

    多伦多大学等机构构建可自我复制的AI蠕虫原型

    多伦多大学、Vector Institute、剑桥大学与ServiceNow的研究者构建了一个AI蠕虫原型,利用被攻陷机器的GPU运行开源权重LLM进行推理,自主发现漏洞并发起攻击。该原型在漏洞检测上成功率约80%,利用漏洞约53%,自我复制约88%,完整攻击链整体成功率约37%。研究者称这证明自我维持的AI驱动网络威胁已不再是理论,并指出该蠕虫以去中心化群体方式运行,没有单点可被切断。

8月1日周六
7月31日周五
7月29日周三
7月27日周一
7月26日周日
  1. Berkeley AI Research35

    Berkeley AI Research 提出 ABBEL:用信念状态监督让 LLM 高效长程交互

    Berkeley AI Research 提出 ABBEL 框架,将 LLM 的交互摘要隔离为自然语言"信念状态"并加以监督评分,替代完整交互历史作为智能体的工作上下文。在协作编程基准 CollabBench 上,采用重建式信念评分的 ABBEL-rec-BG 将自摘要模型与全上下文模型的性能差距缩小约 50%,训练步数从 100 步降至 50 步,峰值上下文 token 数也低于全上下文设置。

7月23日周四
7月16日周四
  1. Hugging Face Blog22

    新模型来了,优势依旧:DharmaOCR 在巴西葡萄牙语 OCR 上仍领先 Mistral OCR4 与 Unlimited-OCR

    DharmaOCR 在葡萄牙语专项基准上以 0.925 分领先 Mistral OCR4 的 0.798 和 Unlimited-OCR 的 0.7587,后两者分别落后约 13 分和 16 分以上。该模型经葡萄牙语监督微调加 DPO 两阶段训练,把全部参数集中于巴西葡萄牙语,在复杂文档提取质量和生成稳定性上形成结构性优势。文章认为,新架构并未改变这一领域专精带来的差距。