Hugging Face 发布 IDEFICS:开源复现的视觉语言模型
Hugging Face 发布 IDEFICS,一个对先进视觉语言模型的开源复现。
开源模型、框架与仓库动态:权重开放、社区项目爆火、开源与闭源的力量消长。
Hugging Face 发布 IDEFICS,一个对先进视觉语言模型的开源复现。
Hugging Face 博客发布消息称 Llama 2 已发布,并可在 Hugging Face 上获取。原文正文未能抓取,除标题外暂无更多细节。
Hugging Face 发布博客宣布 Falcon 模型已落地 Hugging Face 生态。原文正文抓取失败,仅标题可用,暂无更多细节。
Hugging Face 发布面向代码的大语言模型 StarCoder,标题称其在代码任务上达到当时的最先进水平。
Hugging Face 博客发布 ControlNet in 🧨 Diffusers,宣布 ControlNet 接入 Diffusers 库。
Hugging Face 与 Intel Labs、UKP Lab 合作推出 SetFit,一个面向 Sentence Transformers 的高效少样本微调框架,无需提示词或 verbaliser。
推荐理由:原文给出 SetFit 的两阶段训练流程与 RAFT 基准对比,读者可了解无提示词少样本分类的实现方式与成本。
OpenAI 训练并开源了神经网络 Whisper,其在英语语音识别上接近人类水平的鲁棒性和准确度。
推荐理由:OpenAI 开源语音识别模型 Whisper,读者可了解其在英语识别上的鲁棒性与准确度定位。
Hugging Face 发布教程,展示如何用 DeepSpeed-Inference、Accelerate 和 DeepSpeed ZeRO 为 176B 参数的 BLOOM 模型做推理,并给出各方案在 8x80GB A100 上的吞吐与加载耗时基准。
推荐理由:文章给出 BLOOM 176B 在多种 GPU 配置下的吞吐与加载耗时对比,可据此选择部署方案。
Hugging Face 发布 diffusers 0.3,为扩散模型工具箱新增图生图 pipeline、文本反转、实验性 inpainting pipeline、ONNX 导出器与 Mac 支持。其中显存优化让 Stable Diffusion 只需 3.2GB 显存,代价是约 10% 的速度损失;文本反转支持用 3-5 张样本个性化模型,社区几天内分享了 200 多个概念。
推荐理由:梳理 diffusers 0.3 新增的图生图、文本反转、inpainting 与显存优化,可据此判断扩散模型工具链的可用边界。
Hugging Face 发布教程,介绍如何用 Diffusers 库运行 Stable Diffusion 文生图模型,安装 diffusers==0.10.2 后通过 StableDiffusionPipeline.from_pretrained 加载 CompVis/stable-diffusion-v1-4 即可生成图像。
推荐理由:原文给出 Stable Diffusion 在 Diffusers 中的完整调用方式与自定义推理管线代码,可迁移到其他扩散模型。
Hugging Face 将 LLM.int8() 集成进 transformers 和 accelerate,用 8-bit 矩阵乘法把大模型显存占用降到约四分之一且不损失推理性能。
推荐理由:文章把 8-bit 量化原理、LLM.int8() 的离群值分解和 transformers 集成细节讲透,便于理解大模型显存占用来源。
Hugging Face 发布 BLOOM,一个 176B 参数的多语言大语言模型,可生成 46 种自然语言和 13 种编程语言的文本。该模型由 70 多个国家、250 多家机构的 1000 多名研究者协作完成,在法国 Jean Zay 超算上训练 117 天,并首次公开训练中间检查点和优化器状态。
推荐理由:BLOOM 以 176B 参数覆盖 46 种自然语言,并公开训练中间检查点,可据此了解开放大模型的训练与复现路径。
Hugging Face 发布 Gradio 3.0,对 Gradio 库做了彻底重设计,前端改用 Svelte 等现代技术,页面体积更小、加载更快,并新增 Gallery 组件和 TabbedInterface 类。
推荐理由:Gradio 3.0 的前端重写与 Blocks 低层 API 展示了从固定布局到自定义数据流的转变,可据此判断演示搭建方式的变化。
Hugging Face 宣布完成 1 亿美元 C 轮融资,由 Lux Capital 领投,Sequoia、Coatue 等参与,现有投资方 Addition、a_capital、SV Angel、Betaworks、AIX Ventures 等继续支持。
推荐理由:Hugging Face 官方披露 C 轮融资规模、领投方与资金用途,可了解其开源平台当时的规模与方向。
Hugging Face 收购机器学习初创公司 Gradio,Gradio 创始人以当事方身份宣布了这一消息。Gradio 于 2019 年由斯坦福博士生 Abubakar Abid 与室友 Ali Abdalla、Ali Abid、Dawood Khan 发布首版,从计算机视觉扩展到文本、语音和视频,至今已有超过 30 万个 demo 用它构建。
推荐理由:Gradio 创始人以当事方身份讲述被 Hugging Face 收购的经过,并回顾了这款开源库从 2019 年起步到 30 万 demo 的历程。
Hugging Face 宣布在 Transformers 库中加入 Perceiver IO,这是首个基于 Transformer、可处理文本、图像、音频、视频、点云等多种模态及其组合的神经网络。
推荐理由:Hugging Face 把 Perceiver IO 接入 Transformers,读者可了解这套统一处理文本、图像、音频、视频的架构如何落地调用。
OpenAI 发布 Triton 1.0,这是一门类 Python 的开源编程语言,让没有 CUDA 经验的研究者也能编写高效的 GPU 代码,性能多数情况下可达到专家水平。
推荐理由:OpenAI 开源 Triton 1.0,让没有 CUDA 经验的研究者也能写出接近专家水平的 GPU 代码。
OpenAI 推出 Jukebox,一个能生成音乐的神经网络,可输出多种流派和艺术家风格的原始音频,并包含初步的歌唱。OpenAI 同时发布了模型权重和代码,以及一个用于探索生成样本的工具。
推荐理由:OpenAI 公开 Jukebox 的模型权重与代码,读者可了解这套音乐生成神经网络的能力边界与开放程度。