如何用 Intel Gaudi 2 和 Intel Xeon 构建高性价比企业级 RAG 应用
Intel 在 OPEA 平台下展示了用 Gaudi 2 AI 加速器和 Xeon CPU 构建企业级 RAG 应用的方案,LLM 跑在 Gaudi 2 上、嵌入模型跑在 Granite Rapids CPU 上。
Intel 在 OPEA 平台下展示了用 Gaudi 2 AI 加速器和 Xeon CPU 构建企业级 RAG 应用的方案,LLM 跑在 Gaudi 2 上、嵌入模型跑在 Granite Rapids CPU 上。
Hugging Face 发布专为希伯来语设计的开放 LLM 排行榜,填补低资源语言评测空白。榜单包含希伯来语问答、情感准确率、Winograd Schema Challenge 和英希翻译四项基准,采用 few-shot 提示格式评测。
Artificial Analysis 开发的 LLM 性能排行榜现已登陆 Hugging Face,覆盖超 100 个 serverless LLM API 端点,综合评估质量、价格与速度。
Hugging Face Inference Endpoints 通过自定义 inference handler,把 Whisper ASR、Pyannote 说话人分离和推测解码组合在单个 API 端点中。
Hugging Face 的 Leaderboards and Evals 团队发现,同一任务下仅改变提示词格式,模型得分波动可达约 10 分,Qwen1.5-7B 在 7 种提示变体下准确率从 51.2% 跌至 22.9%,且模型排名也随之改变。为此该团队与 .txt 合作,尝试用 Outlines 库的结构化生成约束输出,从输出端而非输入端减少提示词格式带来的方差。
Hugging Face 发布 StarCoder2-15B-Instruct-v0.1,这是首个完全自对齐、流程完全透明且许可宽松的代码大语言模型,仅用 StarCoder2-15B 自身生成指令-响应对进行微调,无需人工标注或从大型专有模型蒸馏数据。
Hugging Face 发布 Open CoT Leaderboard,不评模型绝对准确率,而是对比有无链式推理提示下的准确率差值 Δ。该榜单覆盖 LogiQA、LSAT 等 AGIEval 任务,目前实现 Classic 与 Reflect 两种提示策略,Mixtral-8x7B-Instruct-v0.1 已参与评测。
Hugging Face 发布 JAT(Jack of All Trades),一个基于 GPT-Neo 架构的多模态 Transformer 智能体,用单一网络在 157 项训练任务上达到专家平均性能的 65.8%。
Hugging Face 推出 Open Medical-LLM Leaderboard,用统一平台评测大语言模型在医疗任务上的表现,以准确率为主要指标,覆盖 MedQA、MedMCQA、PubMedQA 及 MMLU 医学与生物学子集。
Meta 发布 Llama 3 系列开源大模型,包含 8B 和 70B 两个尺寸,各有 base 与 instruct 版本,并推出基于 Llama 3 8B 微调的安全模型 Llama Guard 2,全部 5 个模型已上线 Hugging Face Hub。
推荐理由:Meta 发布 Llama 3 并同步接入 Hugging Face 生态,读者可了解新分词器、GQA 与 15T token 训练带来的变化。
Ryght 正式发布面向生命科学知识工作者的免费安全平台 Ryght Preview,并借助 Hugging Face 专家支持计划加速其企业级生成式 AI 平台开发。
Hugging Face 上线 LiveCodeBench 排行榜,基于 UC Berkeley、MIT 和 Cornell 研究者开发的基准,按题目发布时间窗口评估代码 LLM,以检测和防止数据污染。
Zama 将 Concrete ML 预编译模型部署到 Hugging Face Endpoints,通过自定义 inference handler 实现一键部署,用户可直接在加密数据上运行 FHE 推理而无需解密。
Gradio 推出 reload 模式,用 `gradio app.py` 替代 `python app.py` 启动应用,即可在不重启服务器的情况下拉取源码最新改动。
Hugging Face 发布 Idefics2,一个 8B 参数的通用多模态模型,可接受任意文本与图像序列输入并生成文本回复,采用 Apache 2.0 开源许可。
推荐理由:8B 参数、Apache 2.0 开源,并给出与更大模型的基准对比和微调入口,便于判断多模态选型。
Hugging Face 发布视觉语言模型入门指南,梳理了 LLaVA 1.6、CogVLM、Qwen-VL、Fuyu-8B、KOSMOS-2 等开源 VLM 的模型规模、图像分辨率与 grounding 等能力,并介绍 Vision Arena、Open VLM Leaderboard 及 MMMU、MMBench 等评测基准。
Hugging Face 推出 Deploy on Google Cloud,可将 Hub 上数千个基础模型一键部署到 Google Cloud 的 Vertex AI 或 GKE,并作为自有账号内的 API Endpoint 运行。
Google 发布 CodeGemma 系列开源代码模型,包含 2B 基础模型、7B 基础模型和 7B Instruct 三个版本,基于预训练的 2B 和 7B Gemma checkpoint 额外训练 5000 亿 token 的英文、数学和代码数据。
推荐理由:Google 与 Hugging Face 联合发布三个开源代码模型,读者可对照 HumanEval 等基准数据判断其与同尺寸模型的差距。
Hugging Face 宣布与云安全公司 Wiz 合作提升平台及 AI/ML 生态安全,并已集成 Wiz 进行漏洞管理和云安全态势管理(CSPM)。Wiz 研究团队通过 pickle 在沙箱计算环境中运行任意代码,发现了相关缺陷,Hugging Face 表示已修复全部漏洞。
MotherDuck 与 Numbers Station 推出的 DuckDB-NSQL-7B 可从自然语言生成 DuckDB SQL,该模型基于 Meta Llama-2-7b 微调,并用 DuckDB text-to-SQL 数据对进一步优化。
借助 🤗 Optimum Intel 对 SetFit 模型做训练后静态量化,可在 Intel Xeon CPU 上把推理速度提升 7.8 倍,实现生产级部署。
Hugging Face Hub 推出 Deploy on Cloudflare Workers AI 集成,让开发者以无服务器 API 方式调用开源模型,由部署在 Cloudflare 边缘数据中心的 GPU 驱动,采用按请求计费模式。
Hugging Face 博客介绍嵌入向量的二值(binary)与标量(int8)量化,用于降低检索的内存、磁盘占用与成本。二值量化把 float32 值转为 1-bit,内存和存储减少 32 倍,配合 rescoring 可保留约 96% 的检索性能;int8 量化缩小 4 倍,平均带来 3.66 倍检索加速,二值量化平均加速 24.76 倍。
推荐理由:原文给出二值与标量量化的实测数据与可复用脚本,读者可据此评估检索成本与性能的取舍。
Hugging Face 发布面向非技术人群的 Transformers 入门指南,无需 Python 基础即可理解开源机器学习基础。教程以在 Hugging Face Space 的 JupyterLab notebook 中运行微软 Phi-2 LLM 为例,需租用 NVIDIA A10G Small GPU(24GB 显存,每小时几美元)。
Lighthouz AI 联合 Hugging Face 推出 Chatbot Guardrails Arena,让用户与两个匿名 LLM 对话,尝试套取虚构银行 XYZ001 客户的敏感财务信息,并投票选出隐私保护更强的模型。
Hugging Face 博客介绍 GaLore 方法,通过将梯度投影到低秩子空间,可在 NVIDIA RTX 4090 等消费级 GPU 上训练最高 7B 参数的 Llama 架构模型,作者报告优化器状态存储内存减少超过 82.5%。
推荐理由:原文给出 GaLore 在消费级 GPU 上训练 7B 模型的内存节省数据与 transformers 接入方式,便于评估落地成本。
Hugging Face 发布 Cosmopedia,一个由 Mixtral-8x7B-Instruct-v0.1 生成的合成预训练数据集,包含超 3000 万个文件、250 亿 token,并开源了端到端流水线代码、数据集和基于它训练的 1B 模型 cosmo-1b。
推荐理由:原文完整公开了从提示词构建到去污染的合成数据流水线,可据此复现或迁移到自有预训练数据生产。
Hugging Face 用 Optimum Intel 集成 Intel OpenVINO,对微软 2.7B 参数的 Phi-2 模型做 4-bit 权重量化,在搭载 Core Ultra 7 155H 的中端笔记本上实现本地推理。该方案利用 Meteor Lake 的 CPU、iGPU 与 NPU 加速,带来隐私、低延迟、离线、低成本等本地 LLM 优势。
Hugging Face 发布 Quanto,一个面向 Optimum 的 PyTorch 量化后端,支持 int2、int4、int8 和 float8 权重及 int8、float8 激活,可在 CUDA、MPS 等任意设备上运行。
Hugging Face 面向 Enterprise Hub 组织推出 Train on DGX Cloud,可在 Hub 内直接调用 NVIDIA H100 GPU 微调 Llama、Mistral、Stable Diffusion 等模型。
推荐理由:原文给出了无代码微调的具体操作路径与按分钟计费价格,读者可据此判断企业团队接入 H100 训练的成本与门槛。
Hugging Face 博客介绍如何借助 Optimum Intel 与 fastRAG,在基于 Xeon 的 CPU 上加速 BGE 等嵌入模型并接入现有 RAG 流程。
Hugging Face 推出 WebSight 数据集,用于训练 AI 将网页截图转换为 HTML 代码。该数据集从 v0.1 的 82.3 万对 HTML 与截图样本扩展至 v0.2 的 200 万例,改用真实图像截图并切换至 Tailwind CSS。基于该数据集微调的视觉语言模型 Sightseer 可将网页截图转为可用的 HTML 代码,并能在生成结果中嵌入与原截图相近的图像。
UCLA 研究者推出 ConTextual,一个面向 LMM 的上下文敏感富文本视觉推理数据集,含 506 条指令,覆盖时间阅读、购物、导航、信息图等 8 类真实场景,并同步上线排行榜。
Argilla 与 Hugging Face 推出 Data is Better Together 实验,几天内吸引 350 名社区贡献者完成超 11,000 条 prompt 评分,并发布含 10,000 条 prompt 用户评分的 10k_prompts_ranked 数据集。
Hugging Face 发布教程,展示如何用 Optimum Habana 的自定义 pipeline 类在 Intel Gaudi 2 AI 加速器上运行 Llama 2 系列模型(7b、13b、70b)进行文本生成。
BigCode 发布新一代透明训练的开放代码大模型 StarCoder2,包含 3B、7B、15B 三个尺寸,分别由 ServiceNow、Hugging Face 和 NVIDIA 训练。
推荐理由:BigCode 公开了 StarCoder2 三个尺寸的模型、训练数据与训练代码,读者可据此了解开源代码模型的数据规模与开放程度。
Hugging Face 发布 TTS Arena,借鉴 LMSys 的 Chatbot Arena,让用户输入文本、对比两个 TTS 模型的合成语音并投票选出更自然的一方。首批上线模型包括 ElevenLabs、MetaVoice、OpenVoice、Pheme、WhisperSpeech 和 XTTS,投票结果将汇总到采用类 Elo 算法排名的公开排行榜。
Hugging Face 发布 AI 水印入门指南,介绍在生成时嵌入与生成后添加两类水印方法,并盘点 Hub 上的相关工具。文中还涉及 Glaze、Photoguard、Nightshade、Fawkes 等图像防篡改与数据投毒工具,以及 Truepic 基于 C2PA 标准的内容签名方案。文章同时讨论了水印器与检测器开放或闭源各自的利弊。
Google 发布新的开源大语言模型 Gemma,Hugging Face 博客以“欢迎 Gemma”为题介绍了该模型。
Hugging Face 发布教程,介绍如何在 Hugging Face Spaces 上借助 Gradio 免费运行 ComfyUI 工作流。