TAPEX:无需真实数据的高效表格预训练
微软提出 TAPEX,通过让 BART 学习执行合成 SQL 查询来实现表格预训练,无需真实标注数据。该方法在 WikiSQL、TabFact、SQA 和 WikiTableQuestions 四个基准上均取得 SOTA,其中 WikiSQL 准确率达 89.6%,WikiTableQuestions 达 57.5%。
微软提出 TAPEX,通过让 BART 学习执行合成 SQL 查询来实现表格预训练,无需真实标注数据。该方法在 WikiSQL、TabFact、SQA 和 WikiTableQuestions 四个基准上均取得 SOTA,其中 WikiSQL 准确率达 89.6%,WikiTableQuestions 达 57.5%。
Hugging Face 深度强化学习课程第二单元第二部分讲解 Q-Learning,一种基于价值的 off-policy 方法,用 TD 方式逐步更新动作价值函数。文中从零实现首个 Q-Learning 智能体,并在 Frozen Lake v1 和自动驾驶出租车两个环境中训练,为第三单元的 Deep Q-Learning 打基础。
Sempre Health 借助 Hugging Face 的 Expert Acceleration Program 搭建了自动分类并回复患者短信的 NLP 流水线,上线数周后近 20% 的入站消息由新系统自动处理。此前其基于规则的系统只能覆盖约 80% 的短信,Hugging Face 团队在标注质量、模型与方法选型上提供了指导,缩短了研发时间。
Hugging Face 多模态学习团队发布伦理章程,将伦理原则正式纳入机器学习研究生命周期。章程明确了内容政策,禁止暴力、歧视、侵犯隐私、生成虚假信息及在医疗、法律等高风险领域的不谨慎使用,并提出透明、开放可复现、公平、自我批判和尊重署名五项价值观。该文件由多模态团队联合伦理运营、数据治理和隐私专家讨论形成,截至 2022 年 5 月仍在完善中,更新将通过 GitHub 追踪。
OpenAI 更新 DALL·E 2 研究预览进展,早期用户迄今已生成超过 300 万张图像,并帮助改进了安全流程。OpenAI 表示将开始每周从候补名单中新增最多 1000 名用户。
推荐理由:早期用户已生成超 300 万张图像,官方据此说明安全流程改进与每周放量节奏。
Hugging Face 深度强化学习课程更新第二单元第一部分,讲解基于价值的方法,并区分蒙特卡洛与时序差分学习。内容涵盖状态价值函数、动作价值函数与贝尔曼方程,为后续 Q-Learning 算法及 Deep Q-Learning 打基础。
Hugging Face 推出 Fellowship 计划,面向开源机器学习生态的贡献者,由 Hugging Face 团队成员或现任 Fellow 提名,无申请截止日期。
Hugging Face 研究科学家 Sasha Luccioni 在访谈中介绍了她在 Big Science 项目中主持碳足迹工作组的工作,研究范围不止于 CO2 排放,还包括制造成本,甚至测算一封邮件产生多少 CO2。
Hugging Face 发布 Gradio 3.0,对 Gradio 库做了彻底重设计,前端改用 Svelte 等现代技术,页面体积更小、加载更快,并新增 Gallery 组件和 TabbedInterface 类。
推荐理由:Gradio 3.0 的前端重写与 Blocks 低层 API 展示了从固定布局到自定义数据流的转变,可据此判断演示搭建方式的变化。
Hugging Face 博客发布“机器学习总监洞察”系列第二部分,聚焦 SaaS 领域,采访了 Salesforce 的 Omar Rahman 和 Amplitude 的 Cao (Danica) Xiao 等机器学习负责人。
Hugging Face 开放首届 Student Ambassador Program 申请,截止日期为 2022 年 6 月 13 日,计划于 6 月 30 日启动、12 月 31 日结束。入选学生将获得 Hugging Face 团队的工作坊与支持、同行协作网络及官方大使认证,申请者需为在读大学生、修过至少一门机器学习或数据科学课程,并使用过 Hugging Face Hub 或相关库。
Hugging Face 在 Optimum 1.2 中加入推理与 Transformers pipelines 支持,首批接入 ONNX Runtime,用户可将 AutoModelForXxx 直接替换为对应的 ORTModelForXxx。
Hugging Face 宣布完成 1 亿美元 C 轮融资,由 Lux Capital 领投,Sequoia、Coatue 等参与,现有投资方 Addition、a_capital、SV Angel、Betaworks、AIX Ventures 等继续支持。
推荐理由:Hugging Face 官方披露 C 轮融资规模、领投方与资金用途,可了解其开源平台当时的规模与方向。
fastai 用户现在可以用一行 Python 将模型上传至 Hugging Face Hub,并通过 from_pretrained_fastai 直接加载他人模型。
Hugging Face 推出免费深度强化学习课程,第一单元讲解深度强化学习基础,涵盖强化学习框架、马尔可夫性质、策略与价值方法等核心概念。课程使用 Stable Baselines3、RL Baselines3 Zoo 和 RLlib 等库,并让学员训练首个登月着陆器智能体并上传至 Hugging Face Hub。
Hugging Face 展示如何用 Accelerate 库无需改代码即可调用 PyTorch 的 FullyShardedDataParallel(FSDP)训练大模型。
HuggingFace AutoTrain 与数据标注平台 Kili 可组合成文本分类的主动学习流水线,实现数据清洗、模型选择和超参数优化的全自动。示例用 Google Play 上约 4 万条 Medium 用户评论,在 Kili 中按 Subscription、Content、Interface、User Experience 四类标注,再对分类结果做情感分析。
Hugging Face 发布系列文章,邀请多位机器学习总监分享 ML 在媒体、制药等行业的落地经验与挑战。BuzzFeed 的 Archi Mitra 谈到隐私优先个性化推荐、创作者辅助工具和贝叶斯测试;强生、微软、亚马逊出身的 Li Tan 则强调制药领域训练集需覆盖各族裔以保证 AI 公平性。
Hugging Face 与 Habana Labs 合作,展示如何在 AWS EC2 DL1 实例(搭载 8 颗 Habana Gaudi 处理器)上微调 BERT 模型。
Hugging Face 发布教育计划,目标到 2023 年底教会 500 万人机器学习。该计划面向所有人、初学者和教师三类人群,提供 NLP、深度强化学习、Gradio 演示构建等免费课程,以及翻译成 8 种语言的免费教学工具包,教师可在 Hub 上免费创建课堂。此前 2022 年 3 月的 ML demo.cratization 巡讲已为 16 个国家超 1000 名学生授课。
Hugging Face 发布博客,演示如何用其生态工具处理客户服务场景:将筛选最不满客户消息建模为文本分类任务,分为 very unsatisfied 到 very satisfied 五类。
Hugging Face 为 huggingface_hub 库新增 emissions_threshold 参数,可按训练碳排放量筛选 Hub 上的模型,例如筛选出 191 个排放不超过 100 克的模型。transformers 则通过集成 codecarbon,在 Trainer 训练时自动记录碳排放并生成 emissions.csv,方便开发者将数据填入模型卡。
OpenAI 发布研究《Hierarchical text-conditional image generation with CLIP latents》,提出一种基于 CLIP latents 的分层文本条件图像生成方法。
OpenAI 探讨在优化难以或高成本度量的目标时,如何应对 Goodhart 定律——"当一个度量成为目标,它就不再是好的度量"。该定律源自经济学,OpenAI 在训练中需直面这一挑战。
Hugging Face 机器学习工程师 Lewis Tunstall 在访谈中介绍了与 Leandro von Werra 合著的《NLP with Transformers》,并讲述了自己从 2018 年使用 pytorch-pretrained-bert 到加入 Hugging Face 的经历。
Habana Labs 与 Hugging Face 宣布合作,将 Habana 的 SynapseAI 软件套件与 Hugging Face Optimum 开源库集成,开发者只需几行代码即可在 Habana 处理器上加速 Transformer 训练。
Hugging Face 的 Transformers 库有意不遵循 DRY 原则,转而采用“单模型文件”策略:模型前向传播所需的全部代码只放在一个模型文件中,注意力机制代码因此被复制到 50 多个模型文件里。官方给出的理由包括该库由开源社区共建、建模代码本身就是产品、机器学习领域演进极快,以及模型发布后基本不再改动。
Hugging Face 将离线强化学习方法 Decision Transformer 集成进 transformers 库和 Hugging Face Hub,并发布 9 个 Gym 环境连续控制任务的预训练 checkpoint,覆盖 Hopper、Walker2D 和 Halfcheetah,Atari 环境 checkpoint 即将推出。
Hugging Face 发布机器学习专家访谈,嘉宾 Margaret Mitchell 讲述其从微软 Seeing AI 到创立 Google 伦理 AI 团队、再到加入 Hugging Face 的经历。
Hugging Face 推出为期 9 个月的 AI Research Residency Program,入选者将与 Science Team 研究员共同选定研究课题、开发新的机器学习技术,并以开放协作方式推进成果发表。项目为全职岗位,可远程参与,申请截止日期为 2022 年 4 月 3 日。
Hugging Face 发布教程,演示如何用 transformers 库微调 SegFormer 语义分割模型,并以自建的 segments/sidewalk-semantic 人行道数据集训练披萨配送机器人识别路面。教程覆盖从 Hub 加载数据集、用 SegformerImageProcessor 与 ColorJitter 做数据增强,到按 B0 至 B5 五种规模微调模型的完整流程。
Hugging Face 发布端到端教程,演示如何用 Hugging Face Transformers、Amazon SageMaker 和 AWS Inferentia 加速 BERT 文本分类推理。
Hugging Face 的 🤗 datasets 现已支持图像特征类型,可结合 sentence_transformers 和 faiss 为图像数据集构建相似度搜索应用。文中以英国图书馆数字化书籍插图数据集为例,通过 ImageFolder 加载器直接载入含 image 和 label 特征的 10000 行数据,并利用 datasets 内置的 faiss 索引能力实现图像检索。
OpenAI 发布 GPT-3 和 Codex 的新版本,可在已有文本中编辑或插入内容,而不再只是补全现有文本。
推荐理由:OpenAI 公布 GPT-3 与 Codex 新增编辑与插入能力,读者可了解补全之外的新交互方式。
Hugging Face 在 Transformers 中推出约束束搜索(constrained beam search),通过 model.generate() 的 force_words_ids 参数强制输出包含指定词。
OpenAI 发起意向征集,邀请研究者申请参与大语言模型经济影响的研究。该征集面向有意研究 LLM 经济影响的各方,具体参与方式与研究方向未在公告中详述。
OpenAI 分享了在语言模型安全与滥用问题上的最新思考,旨在帮助其他 AI 开发者应对已部署模型的安全与滥用问题。
BERT 是 Google AI Language 研究人员于 2018 年开发的 NLP 模型,全称 Bidirectional Encoder Representations from Transformers,可同时解决 11+ 种常见语言任务。
Hugging Face 发布教程,演示如何用 🤗 datasets 加载 beans 图像分类数据集,并借助 🤗 transformers 微调预训练的 google/vit-base-patch16-224-in21k 模型。
OpenAI 构建了一个面向 Lean 的神经定理证明器,能够解出多道高难度高中数学奥赛题,包括来自 AMC12 和 AIME 竞赛的题目,以及两道改编自 IMO 的题目。
推荐理由:OpenAI 用 Lean 神经定理证明器解出 AMC12、AIME 及两道改编自 IMO 的题目,可了解形式化数学推理的早期进展。