Hugging Face Dataset Hub 新增四项数据集搜索功能
Hugging Face 为 Dataset Hub 的数据集搜索新增按模态、大小、格式和库四项筛选功能,可按文本、图像、音频等模态及最小/最大行数过滤,超过 10B 行的数据集也能被检索到。
Hugging Face 为 Dataset Hub 的数据集搜索新增按模态、大小、格式和库四项筛选功能,可按文本、图像、音频等模态及最小/最大行数过滤,超过 10B 行的数据集也能被检索到。
Hugging Face 用 Transformers Agents 构建的 Code Agent 在 GAIA 基准验证集上取得 44.2%,排名第一,比第二名高 4 分;测试集得分 33.3%,排名第二,并在 Level 3 难题上取得最佳平均分。
推荐理由:原文公开了 Code Agent 在 GAIA 上的完整实现细节与得分,可据此了解代码动作相对 动作的取舍。
Google 发布 Gemma 2 系列开源大模型,包含 9B 和 27B 两个尺寸的基座版与指令微调版共 4 个开放权重模型,上下文长度 8K tokens,采用允许商用和再分发的宽松许可。
推荐理由:梳理 Gemma 2 的滑窗注意力、软截断与蒸馏等训练细节,并给出与 Llama 3、Qwen 1.5 的基准对比。
Hugging Face 与 Argilla 合作的 Data Is Better Together 计划已产出 DIBT/10k_prompts_ranked 数据集,由 385 人参与完成 1 万条合成与人工提示词的质量排序,并被用于训练 SPIN 等新模型。
Stability AI 的 Stable Diffusion 3 Medium(2B 参数)已在 Hugging Face Hub 发布,并可通过 Diffusers 调用,官方同时提供 DreamBooth 与 LoRA 训练脚本。
推荐理由:原文给出 SD3 Medium 的架构变化与 Diffusers 集成细节,读者可据此判断显存占用与推理速度的取舍。
Hugging Face 正在重新设计 Transformers 文档,原因是新内容不断增量叠加,导致文档体验割裂、难导航且过时。改版将面向用 AI 构建产品的开发者,采用代码优先、解决方案导向的写法,并以灵活结构取代 Diátaxis 的刚性框架,让内容整合而非追加。
Mistral AI 在 la Plateforme 上线模型定制功能,提供三个入口:开源微调代码库 mistral-finetune、平台上的无服务器微调服务,以及面向特定客户的定制训练服务。
推荐理由:Mistral 同时给出开源微调代码库与托管微调服务,读者可据此比较自建与托管两条落地路径。
Hugging Face 上线 NPC-Playground,一个由 Cubzh 和 Gigax 打造的 3D 演示,让用户在浏览器中与 LLM 驱动的 NPC 互动,并用几行 Lua 脚本教它们新技能。
Mistral AI 发布非生产许可 MNPL,允许开发者将技术用于非商业用途并支持研究工作,Codestral 于当日在该许可下发布。Mistral 表示,此举意在让基于其技术开展业务的一方以公平可持续的方式行事,同时公司会继续以 Apache 2.0 发布模型和代码,并逐步整合 Apache 2.0 与 MNPL 两条产品线。
推荐理由:Mistral 推出 MNPL 非生产许可,读者可了解其开源与商业化的边界如何重新划分。
TII 发布第二代 Falcon 2 模型,包括 11B 基础 LLM 和具备图像理解能力的 11B VLM,LLM 训练数据超过 5000B tokens,覆盖英语及另外十种语言。
推荐理由:TII 公布 Falcon 2 的 11B LLM 与 VLM 训练细节和评测数据,可对照同尺寸开源模型看性能与许可条件。
Hugging Face 宣布 AMD Instinct MI300 GPU 已在 Hugging Face 平台获得一等公民级集成,用户无需改动代码即可通过 transformers 和 text-generation-inference 在 Azure ND MI300x V5 虚拟机上部署模型。
Hugging Face 与微软在 Microsoft Build 上宣布深化战略合作,将 Llama 3、Mistral 7B、Command R Plus、Qwen 1.5 110B 等热门开源模型加入 Azure 模型目录的 Hugging Face Collection,支持一键部署。
Hugging Face 与 Dell 联合发布 Dell Enterprise Hub,让企业在 Dell 平台上本地训练和部署开源模型,将原本数周的工程工作缩短至几分钟。
Hugging Face 在 Transformers 中新增 KV Cache 量化功能,通过降低 KV 缓存精度减少长上下文生成的内存占用,对生成质量影响很小。
Hugging Face 与 LangChain 联合发布合作包 langchain-huggingface,可通过 pip install langchain-huggingface 安装。
Hugging Face 发布 Open Arabic LLM Leaderboard(OALL),专门评估和比较阿拉伯语 LLM 性能,服务全球超 3.8 亿阿拉伯语使用者。
Google 发布视觉语言模型家族 PaliGemma,由 SigLIP-So400m 图像编码器和 Gemma-2B 文本解码器组成,可输入图像和文本并输出文本。
推荐理由:原文给出 PaliGemma 的架构、三种 checkpoint 与微调代码,读者可据此判断它适合哪些视觉语言任务。
Hugging Face 发布 Transformers Agents 2.0,在原有 agent 类型之上新增两种可基于历史观察迭代的 agent,并加入社区 agent 分享功能。
推荐理由:官方披露了 Agents 2.0 的模块化设计与 GAIA 榜单成绩,读者可据此判断开源智能体框架的可用边界。
Hugging Face 发布专为希伯来语设计的开放 LLM 排行榜,填补低资源语言评测空白。榜单包含希伯来语问答、情感准确率、Winograd Schema Challenge 和英希翻译四项基准,采用 few-shot 提示格式评测。
Hugging Face Inference Endpoints 通过自定义 inference handler,把 Whisper ASR、Pyannote 说话人分离和推测解码组合在单个 API 端点中。
Hugging Face 推出 Open Medical-LLM Leaderboard,用统一平台评测大语言模型在医疗任务上的表现,以准确率为主要指标,覆盖 MedQA、MedMCQA、PubMedQA 及 MMLU 医学与生物学子集。
Mistral 发布最新开源模型 Mixtral 8x22B,采用稀疏 Mixture-of-Experts 架构,141B 参数中仅激活 39B,以 Apache 2.0 许可开放。
推荐理由:原文给出 Mixtral 8x22B 的激活参数、上下文窗口与开源许可,读者可据此判断其成本与部署取舍。
Ryght 正式发布面向生命科学知识工作者的免费安全平台 Ryght Preview,并借助 Hugging Face 专家支持计划加速其企业级生成式 AI 平台开发。
Hugging Face 发布视觉语言模型入门指南,梳理了 LLaVA 1.6、CogVLM、Qwen-VL、Fuyu-8B、KOSMOS-2 等开源 VLM 的模型规模、图像分辨率与 grounding 等能力,并介绍 Vision Arena、Open VLM Leaderboard 及 MMMU、MMBench 等评测基准。
Hugging Face 推出 Deploy on Google Cloud,可将 Hub 上数千个基础模型一键部署到 Google Cloud 的 Vertex AI 或 GKE,并作为自有账号内的 API Endpoint 运行。
Google 发布 CodeGemma 系列开源代码模型,包含 2B 基础模型、7B 基础模型和 7B Instruct 三个版本,基于预训练的 2B 和 7B Gemma checkpoint 额外训练 5000 亿 token 的英文、数学和代码数据。
推荐理由:Google 与 Hugging Face 联合发布三个开源代码模型,读者可对照 HumanEval 等基准数据判断其与同尺寸模型的差距。
Hugging Face 宣布与云安全公司 Wiz 合作提升平台及 AI/ML 生态安全,并已集成 Wiz 进行漏洞管理和云安全态势管理(CSPM)。Wiz 研究团队通过 pickle 在沙箱计算环境中运行任意代码,发现了相关缺陷,Hugging Face 表示已修复全部漏洞。
借助 🤗 Optimum Intel 对 SetFit 模型做训练后静态量化,可在 Intel Xeon CPU 上把推理速度提升 7.8 倍,实现生产级部署。
Hugging Face 发布面向非技术人群的 Transformers 入门指南,无需 Python 基础即可理解开源机器学习基础。教程以在 Hugging Face Space 的 JupyterLab notebook 中运行微软 Phi-2 LLM 为例,需租用 NVIDIA A10G Small GPU(24GB 显存,每小时几美元)。
Hugging Face 发布 Cosmopedia,一个由 Mixtral-8x7B-Instruct-v0.1 生成的合成预训练数据集,包含超 3000 万个文件、250 亿 token,并开源了端到端流水线代码、数据集和基于它训练的 1B 模型 cosmo-1b。
推荐理由:原文完整公开了从提示词构建到去污染的合成数据流水线,可据此复现或迁移到自有预训练数据生产。
Argilla 与 Hugging Face 推出 Data is Better Together 实验,几天内吸引 350 名社区贡献者完成超 11,000 条 prompt 评分,并发布含 10,000 条 prompt 用户评分的 10k_prompts_ranked 数据集。
Hugging Face 发布教程,展示如何用 Optimum Habana 的自定义 pipeline 类在 Intel Gaudi 2 AI 加速器上运行 Llama 2 系列模型(7b、13b、70b)进行文本生成。
Hugging Face 发布 TTS Arena,借鉴 LMSys 的 Chatbot Arena,让用户输入文本、对比两个 TTS 模型的合成语音并投票选出更自然的一方。首批上线模型包括 ElevenLabs、MetaVoice、OpenVoice、Pheme、WhisperSpeech 和 XTTS,投票结果将汇总到采用类 Elo 算法排名的公开排行榜。
Google 发布新的开源大语言模型 Gemma,Hugging Face 博客以“欢迎 Gemma”为题介绍了该模型。
Hugging Face 发布博客欢迎 Mixtral 上线,称其为 SOTA 混合专家模型。
Mistral AI 发布首个 7B 参数模型 Mistral 7B,称其在所有标准英文与代码基准上超过当时所有 13B 参数以下的开源模型,并以 Apache 2.0 许可发布,可无限制使用。
推荐理由:Mistral AI 首次公开其开源路线与 Mistral 7B 的基准表现,可了解开放权重模型当时的性能位置。
Mistral AI 发布 7.3B 参数的 Mistral 7B,采用 Apache 2.0 许可,可无限制使用并支持本地、云端(AWS/GCP/Azure)及 HuggingFace 部署。
推荐理由:Mistral 7B 以 Apache 2.0 开源并给出与 Llama 2 系列的逐项对比,读者可据此判断小参数模型的性价比位置。
Hugging Face 发布 Falcon 180B 模型。
Hugging Face 发布 IDEFICS,一个对先进视觉语言模型的开源复现。
Hugging Face 开源了 SD-Small 和 SD-Tiny 的知识蒸馏代码与模型权重。