#开源生态
#开源生态
dair_ai@dair_aiAI 评分
Hugging Face BlogAI 评分
Hugging Face 推出 Open TTS Leaderboard:面向多语言 TTS 与声音克隆的可扩展评测
Hugging Face 发布 Open TTS Leaderboard,用客观指标评测开源多语言 TTS 与声音克隆模型,单模型评测耗时从数周投票缩短到数小时。
Microsoft Research精选AI 评分 微软研究:将物理AI推理卸载到边缘或云端可提升机器人性能与续航
微软研究院对移动机器人操作负载做系统性测量,发现把物理AI推理从机器人端侧GPU卸载到边缘或云端GPU,可提升任务成功率、支持更大模型并延长续航。
推荐理由:微软对移动操作机器人推理负载的系统性测量,给出端侧、边缘与云端算力取舍的量化依据。
Google DeepMind精选AI 评分Google DeepMind 发布 AlphaGenome Atlas,覆盖人类基因组 90 亿个单核苷酸变异预测
Google DeepMind 发布 AlphaGenome Atlas,一个包含人类基因组 90 亿个单核苷酸变异效应预测的平台,规模达 1PB,超过 AlphaFold Database 的 30 倍。
推荐理由:读者可了解 AlphaGenome Atlas 如何把 90 亿个单核苷酸变异的预测结果做成可检索资源,以及 AVI 评分在编码与非编码区的用途。
Google Research精选AI 评分Google Research 与 HHMI Janelia 发布雄性果蝇完整脑图谱
Google Research 与 HHMI Janelia 等机构在 Cell 发表雄性果蝇完整中枢神经系统连接组,包含超过 166,000 个神经元和 1.25 亿个突触连接,是迄今神经元数量最多的脑图谱。
推荐理由:读者可了解AI驱动的连接组学如何完成迄今神经元数量最多的脑图谱,以及它向脊椎动物扩展的路径。
Hugging Face Blog精选AI 评分
Hugging Face 研究:语音识别模型存在基准优化问题
Hugging Face 发布研究,用共识分歧、掩蔽实体检索和拼写切换三项探针量化语音识别中的基准优化现象,评测 11 个开源 ASR 模型。结果显示,部分高分模型会在音频与参考文本矛盾时复现基准的错误转写,VoxPopuli 分析样本中约 40% 的片段被标记出参考错误,涉及约 3% 的参考词,这类模型复现错误参考的比例为 18–30%。
推荐理由:通过三项探针量化语音模型对基准的过拟合,并给出可复用的检测脚本与榜单入口。
Hugging Face Blog精选AI 评分
Hugging Face 用智能体复现 2226 篇 ICML 论文
Hugging Face 在 7 月 15 日至 8 月 2 日举办 ICML 2026 开放复现挑战,1221 名社区成员用 Claude Code、Codex、Cursor 等编码智能体逐条复现论文,共发布 6816 份 Trackio logbook,覆盖 2226 篇论文,占全部录用论文的 34%。
推荐理由:Hugging Face 公开了 2200 余篇 ICML 论文的复现结果与判定数据,可据此了解智能体参与科研复现的可行边界。
Berkeley AI ResearchAI 评分
从 CUDA 到 MLX:K-Search 如何把数十年 kernel 经验带到 Apple Silicon
Berkeley Sky Lab 与 IBM Research 将演化式 kernel 搜索框架 K-Search 扩展到 MLX 后端,通过结构化 CUDA-to-MLX 翻译层把已有 CUDA kernel 知识迁移到 Apple Silicon。
Hugging Face BlogAI 评分
DiScoFormer:一个 Transformer 同时估计密度与 score,跨分布通用
Hugging Face 博客介绍 DiScoFormer(Density and Score Transformer),一个模型在单次前向传播中即可从一组数据点估计分布的密度与 score,无需针对新分布重新训练。
Hugging Face BlogAI 评分
Hugging Face 与 Treble Technologies 推出 FFASR 远场 ASR 基准榜单
Hugging Face 与 Treble Technologies 上线首个开放、社区驱动的远场 ASR 基准 FFASR Leaderboard,覆盖 14 个模拟房间,并设 Lab Measured 与 Lab Simulated 两列做仿真到实测验证。
Hugging Face BlogAI 评分
Hugging Face 为 Open ASR Leaderboard 引入私有数据集以抵御 benchmaxxing
Hugging Face 与 Appen Inc.、DataoceanAI 合作,为 Open ASR Leaderboard 引入覆盖多口音、朗读与对话语音的高质量英文 ASR 私有数据集,以防 benchmaxxing 和测试集污染。
Hugging Face Blog精选AI 评分
Granite 4.1 LLM 是如何训练的:IBM 公开数据工程、预训练与强化学习全流程
IBM Granite 团队发布技术文章,详解 Granite 4.1 系列稠密 LLM(3B、8B、30B)的训练流程:约 15T tokens 五阶段预训练,上下文窗口经长上下文扩展至 512K tokens,随后用约 4.1M 条高质量样本做 SFT,并采用 on-policy GRPO 配合 DAPO loss 的多阶段强化学习。
推荐理由:Granite 4.1 团队公开了从数据配比到多阶段 RL 的完整训练细节,可对照其 8B 稠密模型追平 32B MoE 的结论。
Hugging Face BlogAI 评分
QIMMA:Hugging Face 推出质量优先的阿拉伯语 LLM 排行榜
Hugging Face 发布 QIMMA(阿拉伯语"顶峰")阿拉伯语 LLM 排行榜,在评测模型前先对基准做质量验证,整合 14 个来源基准的 109 个子集、超 52,000 条样本,覆盖 7 个领域,其中 99% 为原生阿拉伯语内容,也是首个含代码评测的阿拉伯语排行榜。验证发现 ArabicMMLU 丢弃率 3.1%、MizanQA 2.3%,问题涵盖答案错误、文本损坏与文化偏见。
Google ResearchAI 评分Google Research 发布 WAXAL:覆盖 27 种非洲语言的大规模开放语音数据集
Google Research 发布 WAXAL,一个覆盖 27 种撒哈拉以南非洲语言、服务超 1 亿使用者的开放语音数据集,采用 CC-BY-4.0 许可。该数据集包含约 1,846 小时 ASR 转写语音和超 565 小时 TTS 高保真录音,由非洲学术与社区机构主导采集,2021 年起历时多年完成。
Hugging Face BlogAI 评分
Hugging Face 发布 Alyah 基准:评估阿拉伯语 LLM 的阿联酋方言能力
Hugging Face 团队推出 Alyah(阿联酋方言中意为"北极星")基准,用于评估阿拉伯语 LLM 对阿联酋方言的语言、文化与语用理解能力。该基准包含 1,173 个由阿联酋母语者手工收集的多选题样本,覆盖问候语、诗歌、 heritage 知识等七类内容。
Hugging Face BlogAI 评分
Hugging Face Open ASR Leaderboard 新增多语言与长音频赛道,并发布 ASR 趋势预印本
Hugging Face 的 Open ASR Leaderboard 新增多语言与长音频转录赛道,并发布基于 60+ 模型的 ASR 趋势预印本。
Hugging Face BlogAI 评分
Hugging Face 发起 AI for Food Allergies 项目:用 AI 推进食物过敏研究
Hugging Face 发起 AI for Food Allergies 项目,计划打造首个社区驱动的研究实验室,探索 AI 如何推进食物过敏研究。全球约 2.2 亿人患有至少一种食物过敏,美国约占总人口 10%。项目将连接前沿 AI 与生物医学,开发开放协作项目,服务研究者、临床医生与患者。
Hugging Face BlogAI 评分
NVIDIA 发布 Nemotron-Personas-India:面向主权 AI 的合成印度人设数据集
NVIDIA 发布 Nemotron-Personas-India,首个对齐印度真实人口、地理与文化分布的开放合成 Indic 人设数据集,采用 CC BY 4.0 许可。
Hugging Face BlogAI 评分
NVIDIA 发布 Nemotron-Personas-Japan:面向主权 AI 的日语合成数据集
NVIDIA 发布首个面向日本的主权 AI 开源合成数据集 Nemotron-Personas-Japan,含 600 万条日语合成人物画像(100 万条记录、每条 6 个画像),总 token 约 14 亿,覆盖约 95 万个独特姓名和 1500 以上职业类别,以 CC BY 4.0 许可开放商用。
Hugging Face BlogAI 评分
Hugging Face 发布 Smol2Operator:面向 Computer Use 的 GUI 智能体后训练方案
Hugging Face 开源 Smol2Operator,以 SmolVLM2-2.2B-Instruct 为基线,通过两阶段训练将无 grounding 能力的视觉语言模型变为可操作 GUI 的智能体。
Hugging Face Blog精选AI 评分
Hugging Face 发布 Gaia2 智能体基准与 ARE 研究环境
Hugging Face 发布 GAIA 的后续智能体基准 Gaia2,并配套开源 Meta Agents Research Environments(ARE)框架,用于运行、调试和评估智能体。
推荐理由:Gaia2 把智能体评测从只读检索扩展到读写交互,并给出各模型在歧义、适应性和时间推理上的差距。
Hugging Face BlogAI 评分
SandboxAQ 发布 SAIR:500 万+ AI 生成蛋白质-配体结构数据集加速药物研发
SandboxAQ 发布 Structurally Augmented IC50 Repository(SAIR),这是目前最大的共折叠 3D 蛋白质-配体结构数据集,包含超 500 万个 AI 生成的高精度结构,每个结构均配有 ChEMBL 或 BindingDB 的实验测定 IC₅₀ 标签。
OpenAI NewsAI 评分 OpenAI 评估 gpt-oss 开放权重的最坏情况前沿风险
OpenAI 在论文中研究了发布 gpt-oss 的最坏情况前沿风险,提出"恶意微调"(MFT)方法,通过微调让 gpt-oss 在生物学和网络安全两个领域尽可能发挥最大能力。
Hugging Face Blog精选AI 评分
LeRobot 进入驾驶学校:全球最大开源自动驾驶数据集
Hugging Face 博客发布 LeRobot 相关新内容,标题称其为全球最大的开源自动驾驶数据集。
Hugging Face BlogAI 评分
Hugging Face 发布 Docmatix:面向文档视觉问答的超大规模数据集
Hugging Face 发布 Docmatix,一个包含 240 万张图像、950 万问答对(源自 130 万份 PDF)的文档视觉问答数据集,规模是此前数据集的 240 倍。
Hugging Face Blog精选AI 评分
NuminaMath 如何赢得首届 AIMO 进步奖
Numina 与 Hugging Face 合作的 NuminaMath 7B TIR 赢得首届 AIMO 进步奖,在私有测试集 50 题中解出 29 题。方案基于 DeepSeekMath-Base 7B 做两阶段微调,先学自然语言链式推理,再用 GPT-4 生成的工具集成推理数据训练模型调用 Python REPL。
推荐理由:NuminaMath 团队复盘了夺冠方案的两阶段微调、SC-TIR 解码与内部验证集设计,可供做数学推理微调的人参考。
Hugging Face Blog精选AI 评分
Hugging Face 的 Transformers Code Agent 登顶 GAIA 基准
Hugging Face 用 Transformers Agents 构建的 Code Agent 在 GAIA 基准验证集上取得 44.2%,排名第一,比第二名高 4 分;测试集得分 33.3%,排名第二,并在 Level 3 难题上取得最佳平均分。
推荐理由:原文公开了 Code Agent 在 GAIA 上的完整实现细节与得分,可据此了解代码动作相对 动作的取舍。
Hugging Face BlogAI 评分
Hugging Face 推出 Open Arabic LLM Leaderboard,评估阿拉伯语大模型
Hugging Face 发布 Open Arabic LLM Leaderboard(OALL),专门评估和比较阿拉伯语 LLM 性能,服务全球超 3.8 亿阿拉伯语使用者。
Hugging Face BlogAI 评分
Hugging Face 推出希伯来语 LLM 开放排行榜
Hugging Face 发布专为希伯来语设计的开放 LLM 排行榜,填补低资源语言评测空白。榜单包含希伯来语问答、情感准确率、Winograd Schema Challenge 和英希翻译四项基准,采用 few-shot 提示格式评测。
Hugging Face BlogAI 评分
Hugging Face 发布 Open Medical-LLM Leaderboard:医疗大模型基准评测
Hugging Face 推出 Open Medical-LLM Leaderboard,用统一平台评测大语言模型在医疗任务上的表现,以准确率为主要指标,覆盖 MedQA、MedMCQA、PubMedQA 及 MMLU 医学与生物学子集。
Hugging Face Blog精选AI 评分
Hugging Face 发布 Cosmopedia:用 Mixtral 生成 250 亿 token 合成预训练数据
Hugging Face 发布 Cosmopedia,一个由 Mixtral-8x7B-Instruct-v0.1 生成的合成预训练数据集,包含超 3000 万个文件、250 亿 token,并开源了端到端流水线代码、数据集和基于它训练的 1B 模型 cosmo-1b。
推荐理由:原文完整公开了从提示词构建到去污染的合成数据流水线,可据此复现或迁移到自有预训练数据生产。
Hugging Face Blog精选AI 评分
Hugging Face 联合 Intel Labs 推出 SetFit:无需提示词的高效少样本学习框架
Hugging Face 与 Intel Labs、UKP Lab 合作推出 SetFit,一个面向 Sentence Transformers 的高效少样本微调框架,无需提示词或 verbaliser。
推荐理由:原文给出 SetFit 的两阶段训练流程与 RAFT 基准对比,读者可了解无提示词少样本分类的实现方式与成本。
OpenAI NewsAI 评分 OpenAI 推出可逆生成模型 Glow
OpenAI 提出可逆生成模型 Glow,采用可逆 1x1 卷积,在简化架构的同时可生成逼真的高分辨率图像并支持高效采样。该模型还能发现可用于操控数据属性的特征,相关代码与在线可视化工具已开放。