Google Cloud TPU 现已开放给 Hugging Face 用户使用
Hugging Face 宣布 Google Cloud TPU v5e 正式上线 Inference Endpoints 和 Spaces,提供 v5litepod-1(1 核 16 GB,$1.375/小时)、v5litepod-4(4 核 64 GB,$5.50/小时)和 v5litepod-8(8 核 128 GB,$11.00/小时)三种配置。
Hugging Face 宣布 Google Cloud TPU v5e 正式上线 Inference Endpoints 和 Spaces,提供 v5litepod-1(1 核 16 GB,$1.375/小时)、v5litepod-4(4 核 64 GB,$5.50/小时)和 v5litepod-8(8 核 128 GB,$11.00/小时)三种配置。
Prezi 加入 Hugging Face Expert Support Program,将更小更高效的开源模型整合进其 ML 工作流,用于 Prezi AI 演示文稿生成。
Hugging Face Accelerate 在 0.30.0 版本中为 FSDP 加入自动 upcasting,使其在混合精度下与 DeepSpeed 行为对齐。
Hugging Face Embedding Container for Amazon SageMaker 正式 GA,AWS 用户可在 SageMaker 上部署嵌入模型构建 RAG 等生成式 AI 应用。
Hugging Face 将辅助生成(Assisted Generation)适配并优化到 Intel Gaudi,现已集成进 Optimum Habana。该方法基于 Speculative Sampling,通过草稿模型生成 K 个 token 再由目标模型评估,对大型 Transformer 模型通常可带来约 2x 加速。
Hugging Face 发布 TGI Benchmarking 工具,可在 Hugging Face Space 中部署 TGI 并运行 CLI 基准测试,同时给出吞吐量与延迟数据。该工具随 TGI 安装,需访问服务器运行,通过预填充吞吐量-延迟散点图展示不同 batch size 下的权衡,帮助用户按需调优部署。
Hugging Face 将 AWS Inferentia2 部署能力扩展到 Hub 上超 10 万个公开模型,新增 14 种模型架构和 6 类机器学习任务,并支持在 Amazon SageMaker 上部署。
Hugging Face 宣布 AMD Instinct MI300 GPU 已在 Hugging Face 平台获得一等公民级集成,用户无需改动代码即可通过 transformers 和 text-generation-inference 在 Azure ND MI300x V5 虚拟机上部署模型。
Hugging Face 与微软在 Microsoft Build 上宣布深化战略合作,将 Llama 3、Mistral 7B、Command R Plus、Qwen 1.5 110B 等热门开源模型加入 Azure 模型目录的 Hugging Face Collection,支持一键部署。
Hugging Face Spaces 上线 Dev Mode,支持一键从 VS Code 或 SSH 直连 Space,开发者无需再用 git 推送本地改动即可编辑代码。该功能目前处于 beta 阶段,仅面向 PRO 订阅用户开放,编辑后点击 Space 中的 Refresh 即可测试,满意后再 commit 和 merge 持久化。
Hugging Face 与 Dell 联合发布 Dell Enterprise Hub,让企业在 Dell 平台上本地训练和部署开源模型,将原本数周的工程工作缩短至几分钟。
Hugging Face 在 Transformers 中新增 KV Cache 量化功能,通过降低 KV 缓存精度减少长上下文生成的内存占用,对生成质量影响很小。
Hugging Face 现已支持通过 AWS 账户将组织升级至 Enterprise Hub,订阅入口在 AWS Marketplace,定价与 Hugging Face 公开价格一致,但账单由 AWS 账户结算。
Intel 在 OPEA 平台下展示了用 Gaudi 2 AI 加速器和 Xeon CPU 构建企业级 RAG 应用的方案,LLM 跑在 Gaudi 2 上、嵌入模型跑在 Granite Rapids CPU 上。
OpenAI 与 Stack Overflow 宣布达成 API 合作,将 Stack Overflow 的技术知识平台与 OpenAI 的 LLM 模型结合,帮助开发者进行 AI 开发。Stack Overflow 称其为全球领先的高技术内容知识平台,OpenAI 模型则被称为最受欢迎的 AI 开发 LLM。
Artificial Analysis 开发的 LLM 性能排行榜现已登陆 Hugging Face,覆盖超 100 个 serverless LLM API 端点,综合评估质量、价格与速度。
Hugging Face Inference Endpoints 通过自定义 inference handler,把 Whisper ASR、Pyannote 说话人分离和推测解码组合在单个 API 端点中。
Ryght 正式发布面向生命科学知识工作者的免费安全平台 Ryght Preview,并借助 Hugging Face 专家支持计划加速其企业级生成式 AI 平台开发。
Zama 将 Concrete ML 预编译模型部署到 Hugging Face Endpoints,通过自定义 inference handler 实现一键部署,用户可直接在加密数据上运行 FHE 推理而无需解密。
Gradio 推出 reload 模式,用 `gradio app.py` 替代 `python app.py` 启动应用,即可在不重启服务器的情况下拉取源码最新改动。
Hugging Face 推出 Deploy on Google Cloud,可将 Hub 上数千个基础模型一键部署到 Google Cloud 的 Vertex AI 或 GKE,并作为自有账号内的 API Endpoint 运行。
OpenAI 为微调 API 增加新功能,让开发者对微调拥有更多控制权,同时公布构建自定义模型的新方式。
借助 🤗 Optimum Intel 对 SetFit 模型做训练后静态量化,可在 Intel Xeon CPU 上把推理速度提升 7.8 倍,实现生产级部署。
Hugging Face Hub 推出 Deploy on Cloudflare Workers AI 集成,让开发者以无服务器 API 方式调用开源模型,由部署在 Cloudflare 边缘数据中心的 GPU 驱动,采用按请求计费模式。
Pollen Robotics 开源 pollen-vision 库,为机器人提供零样本视觉模型统一接口,首个版本聚焦 3D 物体检测,通过 OWL-ViT、Mobile SAM 和 RAM 组合输出物体在 3D 空间中的 (x, y, z) 坐标。
JetBrains 使用 OpenAI 的 API 构建了其史上增长最快的产品。该产品将 AI 嵌入开发者软件,具体模型版本与功能细节未披露。
Hugging Face 博客介绍 GaLore 方法,通过将梯度投影到低秩子空间,可在 NVIDIA RTX 4090 等消费级 GPU 上训练最高 7B 参数的 Llama 架构模型,作者报告优化器状态存储内存减少超过 82.5%。
推荐理由:原文给出 GaLore 在消费级 GPU 上训练 7B 模型的内存节省数据与 transformers 接入方式,便于评估落地成本。
Hugging Face 用 Optimum Intel 集成 Intel OpenVINO,对微软 2.7B 参数的 Phi-2 模型做 4-bit 权重量化,在搭载 Core Ultra 7 155H 的中端笔记本上实现本地推理。该方案利用 Meteor Lake 的 CPU、iGPU 与 NPU 加速,带来隐私、低延迟、离线、低成本等本地 LLM 优势。
Salesforce 集成 OpenAI 的企业级大语言模型,用于改造其客户应用。此次集成面向企业场景,强调可信与安全(trust and safety)。
Hugging Face 发布 Quanto,一个面向 Optimum 的 PyTorch 量化后端,支持 int2、int4、int8 和 float8 权重及 int8、float8 激活,可在 CUDA、MPS 等任意设备上运行。
Hugging Face 博客介绍如何借助 Optimum Intel 与 fastRAG,在基于 Xeon 的 CPU 上加速 BGE 等嵌入模型并接入现有 RAG 流程。
Hugging Face 发布教程,展示如何用 Optimum Habana 的自定义 pipeline 类在 Intel Gaudi 2 AI 加速器上运行 Llama 2 系列模型(7b、13b、70b)进行文本生成。
Hugging Face 发布教程,介绍如何在 Hugging Face Spaces 上借助 Gradio 免费运行 ComfyUI 工作流。
Mistral AI 发布 Mixtral 8x7B,一个采用 Apache 2.0 许可、开放权重的稀疏混合专家模型(SMoE)。该模型总参数量 46.7B,但每个 token 只使用 12.9B 参数,因此在同等速度与成本下运行,推理速度比 Llama 2 70B 快 6 倍,并在多数基准上匹配或超过 GPT3.5。
推荐理由:官方给出 Mixtral 8x7B 的稀疏 MoE 架构与推理成本数据,可据此判断开源模型的性价比取舍。
Mistral AI 发布 7.3B 参数的 Mistral 7B,采用 Apache 2.0 许可,可无限制使用并支持本地、云端(AWS/GCP/Azure)及 HuggingFace 部署。
推荐理由:Mistral 7B 以 Apache 2.0 开源并给出与 Llama 2 系列的逐项对比,读者可据此判断小参数模型的性价比位置。
Hugging Face 将 Intel OpenVINO 加入 Optimum Intel,用户可在多种 Intel 处理器上用 OpenVINO Runtime 对 Transformers 模型执行推理,模型可托管于 Hugging Face hub 或本地。
Hugging Face 发布教程,演示如何通过三个逐级抽象的层次实现多 GPU 分布式训练:原生 PyTorch DDP(torch.distributed)、🤗 Accelerate 对 pytorch.distributed 的轻量封装,以及 🤗 Transformer 的高层 Trainer API。
Hugging Face 推出 Inference Endpoints,可从 Hub 直接一键将模型部署到所选云平台的托管基础设施上,支持公有、受保护、私有三种访问级别。
Hugging Face Diffusers 自 0.5.1 版本起支持 Flax,可在 Google TPU 上实现快速推理。
推荐理由:Hugging Face 官方给出在 TPU 上跑 Stable Diffusion 的完整代码路径,可迁移到多设备并行推理。
Hugging Face 分享了 BLOOM(176B 参数、bf16 下 352GB)推理服务的优化过程,数周内将延迟降低 5 倍、吞吐提升 50 倍。