OpenAI 简化并稳定连续时间一致性模型,两步采样媲美扩散模型
OpenAI 简化、稳定并扩展了连续时间一致性模型,仅用两步采样即可达到与领先扩散模型相当的样本质量。
OpenAI 简化、稳定并扩展了连续时间一致性模型,仅用两步采样即可达到与领先扩散模型相当的样本质量。
Hugging Face 博客宣布 Diffusers 库已支持 Stable Diffusion 3.5 Large 模型。原文正文抓取失败,仅标题可用。
Hugging Face 展示了如何借助 Diffusers 库中的 Quanto 量化工具降低 Transformer 扩散模型的内存占用。以 PixArt-Sigma、Stable Diffusion 3 和 Aura Flow 为例,将扩散主干与文本编码器量化为 FP8 后,SD3 推理显存从 16.403 GB 降至 8.204 GB,质量几乎无损但延迟略有上升。
OpenAI 提出改进的一致性模型训练技术。一致性模型是一类新兴生成模型,无需对抗训练即可一步采样出高质量数据。
OpenAI 提出 Consistency Models,可在不依赖迭代采样的情况下实现图像、音频和视频生成,从而解决扩散模型生成速度慢的问题。扩散模型虽推动了这些领域的发展,但其迭代采样过程导致生成缓慢。
Stability AI 的 Stable Diffusion 3 Medium(2B 参数)已在 Hugging Face Hub 发布,并可通过 Diffusers 调用,官方同时提供 DreamBooth 与 LoRA 训练脚本。
推荐理由:原文给出 SD3 Medium 的架构变化与 Diffusers 集成细节,读者可据此判断显存占用与推理速度的取舍。
Artificial Analysis 推出文生图排行榜与 Image Arena,基于超 45,000 次人类图像偏好投票计算 ELO 分数,覆盖 Midjourney、DALL·E、Stable Diffusion、Playground 等主流开源与闭源模型。
Canva 推出 AI 驱动的 Magic Studio,服务其月活超 1.75 亿的视觉传播平台用户。该平台让缺乏设计训练的知识工作者也能制作演示文稿、视频、文档、网站和社交媒体图形。
Hugging Face 发布 AI 水印入门指南,介绍在生成时嵌入与生成后添加两类水印方法,并盘点 Hub 上的相关工具。文中还涉及 Glaze、Photoguard、Nightshade、Fawkes 等图像防篡改与数据投毒工具,以及 Truepic 基于 C2PA 标准的内容签名方案。文章同时讨论了水印器与检测器开放或闭源各自的利弊。
Hugging Face 发布教程,介绍如何在 Hugging Face Spaces 上借助 Gradio 免费运行 ComfyUI 工作流。
OpenAI 宣布 DALL·E 3 现已在 ChatGPT Plus 和 Enterprise 中可用。为准备更广泛的发布,OpenAI 为 DALL·E 3 开发了一套安全缓解措施,并同步分享了其在内容溯源研究方面的进展。
推荐理由:OpenAI 官方说明 DALL·E 3 已进入 ChatGPT Plus 与 Enterprise,并同步交代安全缓解措施与溯源研究进展。
OpenAI 发布 DALL·E 3 系统卡,说明该图像生成模型在安全与部署方面的评估情况。
Hugging Face 开源了 SD-Small 和 SD-Tiny 的知识蒸馏代码与模型权重。
Hugging Face 博客发布文章,介绍如何在 iPhone、iPad 和 Mac 上通过 Core ML 加速 Stable Diffusion。原文正文抓取失败,仅标题可用。
Hugging Face 博客发布 ControlNet in 🧨 Diffusers,宣布 ControlNet 接入 Diffusers 库。
Hugging Face 博客发布教程,介绍如何在 Apple Silicon 上通过 Core ML 使用 Stable Diffusion。原文正文抓取失败,仅标题可用。
Hugging Face 发布用 Diffusers 的 Dreambooth 脚本微调 Stable Diffusion 的实验总结,指出 Dreambooth 容易过拟合,需要在训练步数和学习率之间找平衡,建议先用低学习率再逐步增加步数。
推荐理由:Hugging Face 基于多组对照实验给出 Dreambooth 微调 Stable Diffusion 的学习率、步数与先验保留建议,可直接迁移到自己的训练配置。
OpenAI 宣布 DALL·E API 从今天起进入公开测试,开发者可以开始用它构建应用。
Hugging Face Diffusers 自 0.5.1 版本起支持 Flax,可在 Google TPU 上实现快速推理。
推荐理由:Hugging Face 官方给出在 TPU 上跑 Stable Diffusion 的完整代码路径,可迁移到多设备并行推理。
rinna 通过对 Stable Diffusion 进行微调,开发出支持日语提示词的文本生成图像模型 Japanese Stable Diffusion,模型已在 Hugging Face 和 GitHub 发布,代码基于 🧨 Diffusers。
OpenAI 宣布 DALL·E 取消等待名单,新用户可以直接开始创作。官方称,部署中积累的经验以及安全系统的改进,使更广泛的开放成为可能。
推荐理由:原文交代了 DALL·E 取消等待名单的开放变化,读者可据此了解其使用门槛与安全系统调整。
Hugging Face AutoTrain 新增图像分类任务,用户无需编写代码即可上传数据训练模型,AutoTrain 会自动尝试多种模型架构并挑选最优方案。演示中 5 个候选模型里表现最佳者达到 84% 准确率,训练少于 500 张图片、5 个候选模型时免费。
Hugging Face 发布 diffusers 0.3,为扩散模型工具箱新增图生图 pipeline、文本反转、实验性 inpainting pipeline、ONNX 导出器与 Mac 支持。其中显存优化让 Stable Diffusion 只需 3.2GB 显存,代价是约 10% 的速度损失;文本反转支持用 3-5 张样本个性化模型,社区几天内分享了 200 多个概念。
推荐理由:梳理 diffusers 0.3 新增的图生图、文本反转、inpainting 与显存优化,可据此判断扩散模型工具链的可用边界。
OpenAI 为 DALL·E 推出 outpainting 功能,可生成任意尺寸的图像,用于扩展创作画面、讲述更大的故事。
Hugging Face 发布教程,介绍如何用 Diffusers 库运行 Stable Diffusion 文生图模型,安装 diffusers==0.10.2 后通过 StableDiffusionPipeline.from_pretrained 加载 CompVis/stable-diffusion-v1-4 即可生成图像。
推荐理由:原文给出 Stable Diffusion 在 Diffusers 中的完整调用方式与自定义推理管线代码,可迁移到其他扩散模型。
Hugging Face 发布教程,演示如何在 Graphcore IPU 上用 Optimum Graphcore 库微调预训练 ViT 模型,并以 ChestX-ray14 数据集训练胸部 X 光分类器为例提供完整 notebook。
OpenAI 宣布 DALL·E 进入测试版,将在未来几周从候补名单中邀请 100 万人使用。用户可用每月重置的免费额度生成图像,也可按 115 次生成一档、15 美元的价格购买额外额度。
推荐理由:原文给出 DALL·E 测试版开放规模与免费额度、付费增量价格,便于读者了解早期图像生成产品的开放方式。
OpenAI 为 DALL·E 2 引入一项新技术,使其生成的人物图像更准确地反映世界人口的多样性,以减少偏见并提升安全性。
OpenAI 在 DALL·E 2 研究预览中,已有来自 118 个以上国家的 3000 多名艺术家将 DALL·E 融入创作流程。早期访问组的艺术家帮助发现了 DALL·E 的新用途,并在 DALL·E 功能决策中提供了关键意见。
OpenAI 为向广泛受众开放 DALL·E 2,在预训练阶段采取缓解措施以降低强大图像生成模型带来的风险。为此,OpenAI 设置了多种防护栏,防止生成的图像违反其内容政策。
Hugging Face 博客发布《The Annotated Diffusion Model》,基于 Ho 等人 2020 年的 DDPM 论文,用 PyTorch 逐步实现扩散模型。
推荐理由:以 PyTorch 逐步实现 DDPM,从数学推导到 U-Net 代码,适合想动手复现扩散模型的读者。
OpenAI 更新 DALL·E 2 研究预览进展,早期用户迄今已生成超过 300 万张图像,并帮助改进了安全流程。OpenAI 表示将开始每周从候补名单中新增最多 1000 名用户。
推荐理由:早期用户已生成超 300 万张图像,官方据此说明安全流程改进与每周放量节奏。
OpenAI 发布研究《Hierarchical text-conditional image generation with CLIP latents》,提出一种基于 CLIP latents 的分层文本条件图像生成方法。
Hugging Face 发布教程,演示如何用 transformers 库微调 SegFormer 语义分割模型,并以自建的 segments/sidewalk-semantic 人行道数据集训练披萨配送机器人识别路面。教程覆盖从 Hub 加载数据集、用 SegformerImageProcessor 与 ColorJitter 做数据增强,到按 B0 至 B5 五种规模微调模型的完整流程。
Hugging Face 发布教程,演示如何用 🤗 datasets 加载 beans 图像分类数据集,并借助 🤗 transformers 微调预训练的 google/vit-base-patch16-224-in21k 模型。
OpenAI 训练了一个名为 DALL·E 的神经网络,可根据自然语言文本描述生成图像,覆盖自然语言可表达的多种概念。
推荐理由:OpenAI 公开 DALL·E 这一从文本生成图像的神经网络,可了解文生图方向的早期形态。
OpenAI 发现,正如在语言上训练的大型 Transformer 模型能生成连贯文本,同一模型在像素序列上训练后也能生成连贯的图像补全与样本。通过建立样本质量与图像分类准确率之间的相关性,OpenAI 表明其最佳生成模型在无监督设置下所含特征可与顶级卷积网络竞争。
推荐理由:OpenAI 用同一 Transformer 架构处理像素序列,并给出生成质量与分类精度的关联证据。
OpenAI 提出可逆生成模型 Glow,采用可逆 1x1 卷积,在简化架构的同时可生成逼真的高分辨率图像并支持高效采样。该模型还能发现可用于操控数据属性的特征,相关代码与在线可视化工具已开放。
OpenAI 表示已生成一批图像,在多种尺度和视角下都能稳定骗过神经网络分类器。这一结果对上周提出的说法构成挑战,即自动驾驶汽车因从多个尺度、角度和视角采集图像而难以被恶意欺骗。