OpenAI 发布 DALL·E 3 系统卡
OpenAI 发布 DALL·E 3 系统卡,说明该图像生成模型在安全与部署方面的评估情况。
AI 画图的最前线:文生图模型迭代、图像编辑能力与创作工具生态的全部动态。
OpenAI 发布 DALL·E 3 系统卡,说明该图像生成模型在安全与部署方面的评估情况。
Hugging Face 博客发布文章,介绍如何在 iPhone、iPad 和 Mac 上通过 Core ML 加速 Stable Diffusion。原文正文抓取失败,仅标题可用。
Hugging Face 博客发布 ControlNet in 🧨 Diffusers,宣布 ControlNet 接入 Diffusers 库。
Hugging Face 发布用 Diffusers 的 Dreambooth 脚本微调 Stable Diffusion 的实验总结,指出 Dreambooth 容易过拟合,需要在训练步数和学习率之间找平衡,建议先用低学习率再逐步增加步数。
推荐理由:Hugging Face 基于多组对照实验给出 Dreambooth 微调 Stable Diffusion 的学习率、步数与先验保留建议,可直接迁移到自己的训练配置。
OpenAI 宣布 DALL·E API 从今天起进入公开测试,开发者可以开始用它构建应用。
Hugging Face Diffusers 自 0.5.1 版本起支持 Flax,可在 Google TPU 上实现快速推理。
推荐理由:Hugging Face 官方给出在 TPU 上跑 Stable Diffusion 的完整代码路径,可迁移到多设备并行推理。
OpenAI 宣布 DALL·E 取消等待名单,新用户可以直接开始创作。官方称,部署中积累的经验以及安全系统的改进,使更广泛的开放成为可能。
推荐理由:原文交代了 DALL·E 取消等待名单的开放变化,读者可据此了解其使用门槛与安全系统调整。
Hugging Face 发布 diffusers 0.3,为扩散模型工具箱新增图生图 pipeline、文本反转、实验性 inpainting pipeline、ONNX 导出器与 Mac 支持。其中显存优化让 Stable Diffusion 只需 3.2GB 显存,代价是约 10% 的速度损失;文本反转支持用 3-5 张样本个性化模型,社区几天内分享了 200 多个概念。
推荐理由:梳理 diffusers 0.3 新增的图生图、文本反转、inpainting 与显存优化,可据此判断扩散模型工具链的可用边界。
OpenAI 为 DALL·E 推出 outpainting 功能,可生成任意尺寸的图像,用于扩展创作画面、讲述更大的故事。
Hugging Face 发布教程,介绍如何用 Diffusers 库运行 Stable Diffusion 文生图模型,安装 diffusers==0.10.2 后通过 StableDiffusionPipeline.from_pretrained 加载 CompVis/stable-diffusion-v1-4 即可生成图像。
推荐理由:原文给出 Stable Diffusion 在 Diffusers 中的完整调用方式与自定义推理管线代码,可迁移到其他扩散模型。
OpenAI 宣布 DALL·E 进入测试版,将在未来几周从候补名单中邀请 100 万人使用。用户可用每月重置的免费额度生成图像,也可按 115 次生成一档、15 美元的价格购买额外额度。
推荐理由:原文给出 DALL·E 测试版开放规模与免费额度、付费增量价格,便于读者了解早期图像生成产品的开放方式。
Hugging Face 博客发布《The Annotated Diffusion Model》,基于 Ho 等人 2020 年的 DDPM 论文,用 PyTorch 逐步实现扩散模型。
推荐理由:以 PyTorch 逐步实现 DDPM,从数学推导到 U-Net 代码,适合想动手复现扩散模型的读者。
OpenAI 更新 DALL·E 2 研究预览进展,早期用户迄今已生成超过 300 万张图像,并帮助改进了安全流程。OpenAI 表示将开始每周从候补名单中新增最多 1000 名用户。
推荐理由:早期用户已生成超 300 万张图像,官方据此说明安全流程改进与每周放量节奏。
OpenAI 发布研究《Hierarchical text-conditional image generation with CLIP latents》,提出一种基于 CLIP latents 的分层文本条件图像生成方法。
OpenAI 训练了一个名为 DALL·E 的神经网络,可根据自然语言文本描述生成图像,覆盖自然语言可表达的多种概念。
推荐理由:OpenAI 公开 DALL·E 这一从文本生成图像的神经网络,可了解文生图方向的早期形态。
OpenAI 发现,正如在语言上训练的大型 Transformer 模型能生成连贯文本,同一模型在像素序列上训练后也能生成连贯的图像补全与样本。通过建立样本质量与图像分类准确率之间的相关性,OpenAI 表明其最佳生成模型在无监督设置下所含特征可与顶级卷积网络竞争。
推荐理由:OpenAI 用同一 Transformer 架构处理像素序列,并给出生成质量与分类精度的关联证据。