#图像生成
#图像生成
midjourney@midjourneyAI 评分
grok@grokAI 评分
OpenAI News精选AI 评分 OpenAI 推出 ChatGPT Images 2.5
OpenAI 推出 ChatGPT Images 2.5,可将想法、草图和参考照片转化为更个性化、更精致的图像,更贴近用户原本的构想。
midjourney@midjourneyAI 评分 我们已更新 V8.2 编辑模型以提升图像质量。如果你在过去 24 小时内遇到任何问题,请再试一次,并继续向我们反馈。谢谢!更多更新即将到来。
midjourney@midjourney精选AI 评分 Midjourney 宣布发布 V8.2 并将其设为平台默认模型,这次更新聚焦于美学、个性化和图像质量。作者表示新风格更具创意、更大胆、更前卫和新鲜,个性化效果也比以往更好。
Hugging Face Blog精选AI 评分
Diffusers 原生支持 Nunchaku 4-bit 扩散推理
Diffusers 现已原生支持 Nunchaku 的 SVDQuant 4-bit 量化推理,加载 Nunchaku checkpoint 只需调用 from_pretrained(),无需本地编译 CUDA,内核通过 kernels 包从 Hub 下载。
推荐理由:原文给出 Nunchaku Lite 在 Diffusers 中的加载方式、显存与延迟数据,读者可据此判断消费级 GPU 跑扩散模型的实际收益。
Google ResearchAI 评分Google Research 揭示扩散模型创造力来源:score smoothing 如何让模型学会插值
Google Research 在 ICLR 2026 论文《On the Interpolation Effect of Score Smoothing in Diffusion Models》中解释了扩散模型的创造力来源。
midjourney@midjourneyAI 评分
Google DeepMind精选AI 评分Google DeepMind 发布 Nano Banana 2 Lite 与 Gemini Omni Flash
Google DeepMind 发布 Nano Banana 2 Lite(gemini-3.1-flash-lite-image)和 Gemini Omni Flash(gemini-omni-flash-preview)两款模型,前者是 Nano Banana 家族中速度最快、成本最低的图像模型,后者支持高质量视频生成与对话式编辑。
推荐理由:Google DeepMind 同时放出图像与视频两款新模型,并给出延迟、单价和可用入口,便于开发者评估替换与串联方案。
DavidSHolz@DavidSHolzAI 评分 午夜过后 10 分钟,来和我及朋友们一起,在(即将建成的)Midjourney Spa 的空地上即兴创作一段音乐祝福吧。
midjourney@midjourneyAI 评分 我们今天下午将在这里举办 Midjourney Medical AMA(有问必答)。 在下方提出你们的问题,我们会尽量回答尽可能多的问题!❤️
midjourney@midjourneyAI 评分 midjourney@midjourneyAI 评分 midjourney@midjourneyAI 评分
Google Research精选AI 评分Google Photos 上线 Auto frame 新功能,用生成式 AI 重构照片视角
Google Research 宣布在 Google Photos 的 Auto frame 功能中上线一种新的照片视角重构方法,把照片理解为 3D 场景并在其中自动移动虚拟相机位置。
推荐理由:Google Photos 的 Auto frame 新增 3D 感知重构图能力,读者可了解生成式补全如何改变拍摄后的取景空间。
OpenAI News精选AI 评分 OpenAI 推出 ChatGPT Images 2.0
OpenAI 发布 ChatGPT Images 2.0,改进了文字渲染、多语言支持和视觉推理能力。官方同时提到 Images 2.5 的新变化。
推荐理由:官方给出 ChatGPT Images 2.0 在文字渲染、多语言和视觉推理上的改进方向,可据此判断图像生成能力的迭代重点。
OpenAI NewsAI 评分 如何用 ChatGPT 创建图像
ChatGPT 支持通过清晰的提示词创建并迭代优化图像,几分钟内即可生成高质量视觉内容。教程涵盖提示词撰写、设计迭代等具体方法。
Google ResearchAI 评分Google SpeciesNet:用 AI 识别野生动物
Google 开源 AI 模型 SpeciesNet 可对相机陷阱图像分类近 2,500 个动物类别,训练数据达 6,500 万张标注图像。该模型配合开源模型 MegaDetector 定位动物,在标准笔记本上每天可处理约 3 万张图像,低端游戏 GPU 上可达 25 万张以上。过去一年,研究团队已用它识别哥伦比亚的美洲狮、爱达荷州的麋鹿与黑熊、澳大利亚的食火鸡以及坦桑尼亚塞伦盖蒂的狮子和大象。
Hugging Face Blog精选AI 评分
Hugging Face 推出 Modular Diffusers,用可组合模块搭建扩散流水线
Hugging Face 发布 Modular Diffusers,用可复用的 block 组合扩散流水线,作为 DiffusionPipeline 之外更灵活的替代方案。
推荐理由:原文给出可组合模块的 API 与自定义块示例,读者可据此判断扩散流水线改写的成本与迁移路径。
Hugging Face Blog精选AI 评分
Photoroom 用 32 张 H200 在 24 小时内训练出文生图模型 PRX
Photoroom 发布 PRX 系列第三篇,用 32 张 H200、约 1500 美元算力预算在 24 小时内完成一次文生图模型训练,并开源训练代码与实验框架。
推荐理由:Photoroom 公开了 24 小时训练文生图模型的完整配方与代码,读者可据此复现并调整各组件。
Google DeepMind精选AI 评分Google DeepMind 发布 Nano Banana 2(Gemini 3.1 Flash Image)图像模型
Google DeepMind 发布 Nano Banana 2(Gemini 3.1 Flash Image),把 Nano Banana Pro 的世界知识、推理与画质带到 Flash 级速度。
推荐理由:原文列出 Nano Banana 2 在主体一致性、文字渲染和分辨率上的具体规格,可对照 Pro 版判断速度与质量的取舍。
Hugging Face BlogAI 评分
PRX 文本到图像模型训练设计:消融实验的经验
Hugging Face 公布 PRX 文本到图像模型训练消融实验,以 1.2B 参数 PRX-1.2B 为基线,在 Flux VAE latent 空间、256×256 分辨率、全局 batch size 256 下训练 100k 步。
Berkeley AI ResearchAI 评分
信息驱动的成像系统设计:Berkeley AI Research 提出基于互信息的成像系统评估框架
Berkeley AI Research 提出一种基于互信息的成像系统评估与优化框架,可直接从含噪测量中估计信息量,预测系统性能。该方法在彩色摄影、射电天文、无透镜成像和显微镜四个领域验证有效,优化后的设计达到端到端方法水平,且内存和计算需求更低、无需任务专用解码器。相关成果发表于 NeurIPS 2025 论文。
OpenAI News精选AI 评分 OpenAI 推出 ChatGPT Images 与 GPT-Image-1.5
OpenAI 发布 ChatGPT Images 体验与 API 中的 GPT-Image-1.5,主打更快的图像生成。原文提到可进一步了解最新的 ChatGPT Images 2.5。
OpenAI NewsAI 评分 OpenAI 与 NORAD 合作为“NORAD Tracks Santa”带来新玩法
OpenAI 与 NORAD 合作为“NORAD Tracks Santa”推出三款 ChatGPT 节日工具,让家庭可以生成节日精灵、玩具涂色页和定制圣诞故事。
Hugging Face Blog精选AI 评分
Diffusers 支持 FLUX.2,官方给出 4bit 量化推理示例
Hugging Face Diffusers 宣布支持 FLUX.2,并给出基于 diffusers/FLUX.2-dev-bnb-4bit 仓库的完整推理示例,transformer 与 Mistral3 文本编码器均以 bfloat16 加载并启用 CPU offload。
推荐理由:Diffusers 接入 FLUX.2 的示例代码与 4bit 量化仓库地址,可帮读者判断本地部署门槛与显存需求。
Google DeepMind精选AI 评分Google DeepMind 发布 Gemini 3 Pro Image(Nano Banana Pro)图像模型
Google DeepMind 发布 Nano Banana Pro(Gemini 3 Pro Image),这是基于 Gemini 3 Pro 构建的高保真图像生成与编辑模型,已在 Google AI Studio 和 Vertex AI 面向企业以付费预览形式逐步开放。
推荐理由:Google DeepMind 发布 Gemini 3 Pro Image,开发者可据此了解其分辨率、文本渲染与 Google 搜索接地等能力边界。
Google DeepMind精选AI 评分Google DeepMind 发布 Nano Banana Pro(Gemini 3 Pro Image)图像生成与编辑模型
Google DeepMind 发布 Nano Banana Pro(Gemini 3 Pro Image),基于 Gemini 3 Pro 构建,主打更强推理与世界知识、图像内多语言文字渲染,以及最多融合 14 张图像、保持 5 人一致性的编辑能力,支持 2K 和 4K 分辨率与多种画幅。
推荐理由:官方给出 Nano Banana Pro 的能力边界与各产品上线节奏,读者可据此判断图像生成在自身工作流中的可用性。
Hugging Face BlogAI 评分
如何将 Claude 连接 Hugging Face 生成图像
Hugging Face 介绍如何通过 MCP Server 将 Claude 接入 Hugging Face Spaces 生成图像,可调用 ZeroGPU 驱动的 AI 应用,免费账号即提供使用额度。
OpenAI NewsAI 评分 用 ChatGPT 图像生成创建品牌视觉
ChatGPT 图像生成可帮助用户从提示词、草图或上传图片创建品牌视觉与产品 mockup。该功能集成在 ChatGPT 中,面向需要快速产出品牌化素材的用户。
OpenAI NewsAI 评分 ChatGPT for Business 2025 年 4 月新功能:o3、图像生成、增强记忆与内部知识
ChatGPT for Business 新增 o3、图像生成、增强记忆和内部知识功能。官方同步放出这些功能的上手演示。
OpenAI News精选AI 评分 OpenAI 在 API 中上线最新图像生成模型 gpt-image-1
OpenAI 宣布最新图像生成模型以 gpt-image-1 的形式在 API 中开放,开发者和企业可将专业级、可定制的视觉内容直接构建进自有工具和平台。
推荐理由:OpenAI 将最新图像生成模型以 gpt-image-1 接入 API,开发者可据此评估自有工具接入图像生成的路径。
OpenAI News精选AI 评分 OpenAI 在 GPT-4o 中引入原生图像生成
OpenAI 发布 GPT-4o 的原生图像生成能力,官方称其在文字渲染和指令遵循方面更强。该发布还提到可了解 ChatGPT Images 2.5。
推荐理由:OpenAI 官方说明 GPT-4o 原生图像生成在文字渲染与指令遵循上的变化,可对照此前图像生成能力。
OpenAI News精选AI 评分 OpenAI 发布 GPT-4o 系统卡附录:4o 图像生成
OpenAI 发布 GPT-4o 系统卡附录,介绍 4o 图像生成。该能力比此前的 DALL·E 3 系列模型显著更强,可生成照片级真实感输出,也能接收图像作为输入并进行变换。
推荐理由:GPT-4o 图像生成能力较 DALL·E 3 明显提升,并支持图像输入与变换,可据此了解其能力边界。