跳到正文

#Hugging Face

今日 3 条
7月12日周二
  1. Hugging Face Blog78

    Hugging Face 发布 176B 参数开放多语言模型 BLOOM

    Hugging Face 发布 BLOOM,一个 176B 参数的多语言大语言模型,可生成 46 种自然语言和 13 种编程语言的文本。该模型由 70 多个国家、250 多家机构的 1000 多名研究者协作完成,在法国 Jean Zay 超算上训练 117 天,并首次公开训练中间检查点和优化器状态。

    推荐理由:BLOOM 以 176B 参数覆盖 46 种自然语言,并公开训练中间检查点,可据此了解开放大模型的训练与复现路径。

7月7日周四
6月29日周三
  1. Hugging Face Blog22

    如何用 Sentence Transformers 开启你的第一个机器学习项目

    Hugging Face 发布入门指南,以 Sentence Transformers 为例讲解如何从零启动第一个 ML 项目。该库可将句子、段落和图像转为嵌入向量,并通过 util.cos_sim 计算余弦相似度,已在 GitHub 收获近 8,000 stars,超过 3,000 个项目依赖它。文中还给出选题方法:先梳理工具能力,再从 Hugging Face Hub 等渠道寻找数据。

6月28日周二
  1. Hugging Face Blog62

    Hugging Face 发布 Evaluation on the Hub,无需写代码即可评测模型

    Hugging Face 推出 Evaluation on the Hub,由 AutoTrain 驱动,用户无需写一行代码即可在 Hub 上用任意数据集和指标评测任意模型。评测结果会以 Pull Request 形式写入模型卡元数据,并可在数据集页面的榜单中对比不同模型表现。官方已用该工具评测了数百个模型,并给出文本分类、命名实体识别和文本摘要等可直接试用的数据集。

    推荐理由:原文说明了无需写代码即可在 Hub 上评测任意模型与数据集,并给出配置流程和榜单入口。

6月23日周四
  1. Hugging Face Blog36

    Hugging Face 教程:如何用 Embeddings 快速搭建 FAQ 语义搜索

    Hugging Face 发布入门教程,演示如何用 Sentence Transformers 的 all-MiniLM-L6-v2 模型和 Inference API 为美国 Medicare FAQ 数据集生成嵌入向量,并上传至 Hub 免费托管。用户查询经嵌入后与数据集比对,即可找出语义最相似的 FAQ 条目。首次调用 API 约需 20 秒下载模型,后续请求会明显加快。

6月22日周三
6月15日周三
  1. Hugging Face Blog40

    Intel 与 Hugging Face 合作,通过 Optimum Intel 加速 Transformer 硬件

    Intel 正式加入 Hugging Face 硬件合作伙伴计划,双方将基于开源库 Optimum 共同构建面向 Transformer 训练、微调与推理的硬件加速方案。Optimum Intel 构建在 Intel Neural Compressor 之上,支持量化、剪枝与知识蒸馏,并已实现对 Habana Gaudi 加速器的支持,其性价比比 GPU 高出最多 40%。

6月14日周二
6月7日周二
5月26日周四
5月25日周三
5月20日周五
5月19日周四
  1. Hugging Face Blog12

    Sempre Health 如何借助 Hugging Face 专家加速计划加速其 ML 路线图

    Sempre Health 借助 Hugging Face 的 Expert Acceleration Program 搭建了自动分类并回复患者短信的 NLP 流水线,上线数周后近 20% 的入站消息由新系统自动处理。此前其基于规则的系统只能覆盖约 80% 的短信,Hugging Face 团队在标注质量、模型与方法选型上提供了指导,缩短了研发时间。

  2. Hugging Face Blog15

    Hugging Face 多模态团队发布伦理章程,将伦理原则置于研究生命周期核心

    Hugging Face 多模态学习团队发布伦理章程,将伦理原则正式纳入机器学习研究生命周期。章程明确了内容政策,禁止暴力、歧视、侵犯隐私、生成虚假信息及在医疗、法律等高风险领域的不谨慎使用,并提出透明、开放可复现、公平、自我批判和尊重署名五项价值观。该文件由多模态团队联合伦理运营、数据治理和隐私专家讨论形成,截至 2022 年 5 月仍在完善中,更新将通过 GitHub 追踪。

5月18日周三
5月17日周二
5月16日周一
  1. Hugging Face Blog62

    Gradio 3.0 发布,推出 Blocks 低层 API 与全新前端

    Hugging Face 发布 Gradio 3.0,对 Gradio 库做了彻底重设计,前端改用 Svelte 等现代技术,页面体积更小、加载更快,并新增 Gallery 组件和 TabbedInterface 类。

    推荐理由:Gradio 3.0 的前端重写与 Blocks 低层 API 展示了从固定布局到自定义数据流的转变,可据此判断演示搭建方式的变化。

5月13日周五
  1. Hugging Face Blog8

    Hugging Face 首届学生大使计划开放申请

    Hugging Face 开放首届 Student Ambassador Program 申请,截止日期为 2022 年 6 月 13 日,计划于 6 月 30 日启动、12 月 31 日结束。入选学生将获得 Hugging Face 团队的工作坊与支持、同行协作网络及官方大使认证,申请者需为在读大学生、修过至少一门机器学习或数据科学课程,并使用过 Hugging Face Hub 或相关库。

5月10日周二
5月9日周一
5月6日周五
5月4日周三
5月2日周一
4月28日周四
4月26日周二
4月25日周一
  1. Hugging Face Blog20

    Hugging Face 推出教育计划:目标 2023 年底教会 500 万人机器学习

    Hugging Face 发布教育计划,目标到 2023 年底教会 500 万人机器学习。该计划面向所有人、初学者和教师三类人群,提供 NLP、深度强化学习、Gradio 演示构建等免费课程,以及翻译成 8 种语言的免费教学工具包,教师可在 Hub 上免费创建课堂。此前 2022 年 3 月的 ML demo.cratization 巡讲已为 16 个国家超 1000 名学生授课。

4月22日周五
4月13日周三
4月12日周二
4月5日周二
  1. Hugging Face Blog22

    Hugging Face 为何在 Transformers 中放弃 DRY 原则

    Hugging Face 的 Transformers 库有意不遵循 DRY 原则,转而采用“单模型文件”策略:模型前向传播所需的全部代码只放在一个模型文件中,注意力机制代码因此被复制到 50 多个模型文件里。官方给出的理由包括该库由开源社区共建、建模代码本身就是产品、机器学习领域演进极快,以及模型发布后基本不再改动。

3月28日周一
3月23日周三
3月22日周二
3月17日周四
3月16日周三
  1. Hugging Face Blog22

    用 🤗 datasets 实现图像搜索

    Hugging Face 的 🤗 datasets 现已支持图像特征类型,可结合 sentence_transformers 和 faiss 为图像数据集构建相似度搜索应用。文中以英国图书馆数字化书籍插图数据集为例,通过 ImageFolder 加载器直接载入含 image 和 label 特征的 10000 行数据,并利用 datasets 内置的 faiss 索引能力实现图像检索。