Pollo AI 借助 OpenAI 把创意变成营销活动
Pollo AI 结合 GPT-5.6、GPT-6 Astra 和 GPT-Image-2.5,帮助创作者把大胆想法转化为精细图像和电影感视频广告。
Pollo AI 结合 GPT-5.6、GPT-6 Astra 和 GPT-Image-2.5,帮助创作者把大胆想法转化为精细图像和电影感视频广告。
Google Research 提出 Diffusion Controller 框架,把扩散模型的去噪过程重构为连续控制问题,用一个轻量"转向阻尼"网络在冻结基座模型的前提下动态调整生成轨迹。
OpenAI 推出 ChatGPT Images 2.5,可将想法、草图和参考照片转化为更个性化、更精致的图像,更贴近用户原本的构想。
Diffusers 现已原生支持 Nunchaku 的 SVDQuant 4-bit 量化推理,加载 Nunchaku checkpoint 只需调用 from_pretrained(),无需本地编译 CUDA,内核通过 kernels 包从 Hub 下载。
推荐理由:原文给出 Nunchaku Lite 在 Diffusers 中的加载方式、显存与延迟数据,读者可据此判断消费级 GPU 跑扩散模型的实际收益。
Google Research 在 ICLR 2026 论文《On the Interpolation Effect of Score Smoothing in Diffusion Models》中解释了扩散模型的创造力来源。
Google DeepMind 发布 Nano Banana 2 Lite(gemini-3.1-flash-lite-image)和 Gemini Omni Flash(gemini-omni-flash-preview)两款模型,前者是 Nano Banana 家族中速度最快、成本最低的图像模型,后者支持高质量视频生成与对话式编辑。
推荐理由:Google DeepMind 同时放出图像与视频两款新模型,并给出延迟、单价和可用入口,便于开发者评估替换与串联方案。
Google Research 宣布在 Google Photos 的 Auto frame 功能中上线一种新的照片视角重构方法,把照片理解为 3D 场景并在其中自动移动虚拟相机位置。
推荐理由:Google Photos 的 Auto frame 新增 3D 感知重构图能力,读者可了解生成式补全如何改变拍摄后的取景空间。
OpenAI 发布 ChatGPT Images 2.0,改进了文字渲染、多语言支持和视觉推理能力。官方同时提到 Images 2.5 的新变化。
推荐理由:官方给出 ChatGPT Images 2.0 在文字渲染、多语言和视觉推理上的改进方向,可据此判断图像生成能力的迭代重点。
ChatGPT 支持通过清晰的提示词创建并迭代优化图像,几分钟内即可生成高质量视觉内容。教程涵盖提示词撰写、设计迭代等具体方法。
Google 开源 AI 模型 SpeciesNet 可对相机陷阱图像分类近 2,500 个动物类别,训练数据达 6,500 万张标注图像。该模型配合开源模型 MegaDetector 定位动物,在标准笔记本上每天可处理约 3 万张图像,低端游戏 GPU 上可达 25 万张以上。过去一年,研究团队已用它识别哥伦比亚的美洲狮、爱达荷州的麋鹿与黑熊、澳大利亚的食火鸡以及坦桑尼亚塞伦盖蒂的狮子和大象。
Hugging Face 发布 Modular Diffusers,用可复用的 block 组合扩散流水线,作为 DiffusionPipeline 之外更灵活的替代方案。
推荐理由:原文给出可组合模块的 API 与自定义块示例,读者可据此判断扩散流水线改写的成本与迁移路径。
Photoroom 发布 PRX 系列第三篇,用 32 张 H200、约 1500 美元算力预算在 24 小时内完成一次文生图模型训练,并开源训练代码与实验框架。
推荐理由:Photoroom 公开了 24 小时训练文生图模型的完整配方与代码,读者可据此复现并调整各组件。
Google DeepMind 发布 Nano Banana 2(Gemini 3.1 Flash Image),把 Nano Banana Pro 的世界知识、推理与画质带到 Flash 级速度。
推荐理由:原文列出 Nano Banana 2 在主体一致性、文字渲染和分辨率上的具体规格,可对照 Pro 版判断速度与质量的取舍。
Hugging Face 公布 PRX 文本到图像模型训练消融实验,以 1.2B 参数 PRX-1.2B 为基线,在 Flux VAE latent 空间、256×256 分辨率、全局 batch size 256 下训练 100k 步。
Berkeley AI Research 提出一种基于互信息的成像系统评估与优化框架,可直接从含噪测量中估计信息量,预测系统性能。该方法在彩色摄影、射电天文、无透镜成像和显微镜四个领域验证有效,优化后的设计达到端到端方法水平,且内存和计算需求更低、无需任务专用解码器。相关成果发表于 NeurIPS 2025 论文。
OpenAI 发布 ChatGPT Images 体验与 API 中的 GPT-Image-1.5,主打更快的图像生成。原文提到可进一步了解最新的 ChatGPT Images 2.5。
OpenAI 与 NORAD 合作为“NORAD Tracks Santa”推出三款 ChatGPT 节日工具,让家庭可以生成节日精灵、玩具涂色页和定制圣诞故事。
Hugging Face Diffusers 宣布支持 FLUX.2,并给出基于 diffusers/FLUX.2-dev-bnb-4bit 仓库的完整推理示例,transformer 与 Mistral3 文本编码器均以 bfloat16 加载并启用 CPU offload。
推荐理由:Diffusers 接入 FLUX.2 的示例代码与 4bit 量化仓库地址,可帮读者判断本地部署门槛与显存需求。
Google DeepMind 发布 Nano Banana Pro(Gemini 3 Pro Image),这是基于 Gemini 3 Pro 构建的高保真图像生成与编辑模型,已在 Google AI Studio 和 Vertex AI 面向企业以付费预览形式逐步开放。
推荐理由:Google DeepMind 发布 Gemini 3 Pro Image,开发者可据此了解其分辨率、文本渲染与 Google 搜索接地等能力边界。
Google DeepMind 发布 Nano Banana Pro(Gemini 3 Pro Image),基于 Gemini 3 Pro 构建,主打更强推理与世界知识、图像内多语言文字渲染,以及最多融合 14 张图像、保持 5 人一致性的编辑能力,支持 2K 和 4K 分辨率与多种画幅。
推荐理由:官方给出 Nano Banana Pro 的能力边界与各产品上线节奏,读者可据此判断图像生成在自身工作流中的可用性。
Hugging Face 介绍如何通过 MCP Server 将 Claude 接入 Hugging Face Spaces 生成图像,可调用 ZeroGPU 驱动的 AI 应用,免费账号即提供使用额度。
ChatGPT 图像生成可帮助用户从提示词、草图或上传图片创建品牌视觉与产品 mockup。该功能集成在 ChatGPT 中,面向需要快速产出品牌化素材的用户。
ChatGPT for Business 新增 o3、图像生成、增强记忆和内部知识功能。官方同步放出这些功能的上手演示。
OpenAI 宣布最新图像生成模型以 gpt-image-1 的形式在 API 中开放,开发者和企业可将专业级、可定制的视觉内容直接构建进自有工具和平台。
推荐理由:OpenAI 将最新图像生成模型以 gpt-image-1 接入 API,开发者可据此评估自有工具接入图像生成的路径。
OpenAI 发布 GPT-4o 的原生图像生成能力,官方称其在文字渲染和指令遵循方面更强。该发布还提到可了解 ChatGPT Images 2.5。
推荐理由:OpenAI 官方说明 GPT-4o 原生图像生成在文字渲染与指令遵循上的变化,可对照此前图像生成能力。
OpenAI 发布 GPT-4o 系统卡附录,介绍 4o 图像生成。该能力比此前的 DALL·E 3 系列模型显著更强,可生成照片级真实感输出,也能接收图像作为输入并进行变换。
推荐理由:GPT-4o 图像生成能力较 DALL·E 3 明显提升,并支持图像输入与变换,可据此了解其能力边界。
OpenAI 简化、稳定并扩展了连续时间一致性模型,仅用两步采样即可达到与领先扩散模型相当的样本质量。
Hugging Face 博客宣布 Diffusers 库已支持 Stable Diffusion 3.5 Large 模型。原文正文抓取失败,仅标题可用。
Hugging Face 展示了如何借助 Diffusers 库中的 Quanto 量化工具降低 Transformer 扩散模型的内存占用。以 PixArt-Sigma、Stable Diffusion 3 和 Aura Flow 为例,将扩散主干与文本编码器量化为 FP8 后,SD3 推理显存从 16.403 GB 降至 8.204 GB,质量几乎无损但延迟略有上升。
OpenAI 提出改进的一致性模型训练技术。一致性模型是一类新兴生成模型,无需对抗训练即可一步采样出高质量数据。
OpenAI 提出 Consistency Models,可在不依赖迭代采样的情况下实现图像、音频和视频生成,从而解决扩散模型生成速度慢的问题。扩散模型虽推动了这些领域的发展,但其迭代采样过程导致生成缓慢。
Stability AI 的 Stable Diffusion 3 Medium(2B 参数)已在 Hugging Face Hub 发布,并可通过 Diffusers 调用,官方同时提供 DreamBooth 与 LoRA 训练脚本。
推荐理由:原文给出 SD3 Medium 的架构变化与 Diffusers 集成细节,读者可据此判断显存占用与推理速度的取舍。
Artificial Analysis 推出文生图排行榜与 Image Arena,基于超 45,000 次人类图像偏好投票计算 ELO 分数,覆盖 Midjourney、DALL·E、Stable Diffusion、Playground 等主流开源与闭源模型。
Canva 推出 AI 驱动的 Magic Studio,服务其月活超 1.75 亿的视觉传播平台用户。该平台让缺乏设计训练的知识工作者也能制作演示文稿、视频、文档、网站和社交媒体图形。
Hugging Face 发布 AI 水印入门指南,介绍在生成时嵌入与生成后添加两类水印方法,并盘点 Hub 上的相关工具。文中还涉及 Glaze、Photoguard、Nightshade、Fawkes 等图像防篡改与数据投毒工具,以及 Truepic 基于 C2PA 标准的内容签名方案。文章同时讨论了水印器与检测器开放或闭源各自的利弊。
Hugging Face 发布教程,介绍如何在 Hugging Face Spaces 上借助 Gradio 免费运行 ComfyUI 工作流。
OpenAI 宣布 DALL·E 3 现已在 ChatGPT Plus 和 Enterprise 中可用。为准备更广泛的发布,OpenAI 为 DALL·E 3 开发了一套安全缓解措施,并同步分享了其在内容溯源研究方面的进展。
推荐理由:OpenAI 官方说明 DALL·E 3 已进入 ChatGPT Plus 与 Enterprise,并同步交代安全缓解措施与溯源研究进展。
OpenAI 发布 DALL·E 3 系统卡,说明该图像生成模型在安全与部署方面的评估情况。
Hugging Face 开源了 SD-Small 和 SD-Tiny 的知识蒸馏代码与模型权重。
Hugging Face 博客发布文章,介绍如何在 iPhone、iPad 和 Mac 上通过 Core ML 加速 Stable Diffusion。原文正文抓取失败,仅标题可用。