Black Forest Labs 的 FLUX 3 Image 在 fal 上线
Black Forest Labs 的 FLUX 3 Image 已在 fal 平台上线,主打精准图像编辑,保留未修改部分。该模型支持原生 2K 和 4K 图像生成,最多可组合 10 张参考图,能在一次生成中完成多处定向编辑,并对布局和构图提供细致控制。
推荐理由:FLUX 3 Image 在 fal 上线,列出原生 2K/4K 生成与多参考图编辑等能力,可据此判断图像编辑工作流的变化。
文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。
Black Forest Labs 的 FLUX 3 Image 已在 fal 平台上线,主打精准图像编辑,保留未修改部分。该模型支持原生 2K 和 4K 图像生成,最多可组合 10 张参考图,能在一次生成中完成多处定向编辑,并对布局和构图提供细致控制。
推荐理由:FLUX 3 Image 在 fal 上线,列出原生 2K/4K 生成与多参考图编辑等能力,可据此判断图像编辑工作流的变化。
Black Forest Labs 的新旗舰图像模型 FLUX 3 Image 已在 OpenRouter 上线,支持文生图与多参考图编辑,原生渲染最高 4K。
推荐理由:FLUX 3 Image 在 OpenRouter 上线,给出多参考图编辑、4K 输出与按分辨率计费的具体价格,可据此评估图像生成成本。
Black Forest Labs 的新旗舰图像模型 FLUX 3 Image 已在 OpenRouter 上线,支持文生图和多参考图编辑,原生渲染最高 4K。
推荐理由:FLUX 3 Image 在 OpenRouter 上线,给出了多参考图编辑、4K 生成与按分辨率计费的具体信息。
Arena 分享 Google DeepMind 的 Gemini 4 Argon 与多款前沿模型在生成任务上的对比,单任务成本比 GPT-6.1 Sol 低 33%,比 Claude Opus 5.5 低 70%,并附上 @petergostev 的第一印象视频。评论区对评测方式提出质疑,认为用图形设计任务评估文本生成模型意义有限,也有人追问单任务成本是否包含思考 token。
推荐理由:原文给出 Gemini 4 Argon 与前沿模型的成本对比和实测片段,读者可据此判断其性价比定位。
Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御者开放,随后将逐步面向开发者、企业和消费者推出,起步价为每百万输入 token 2 美元、每百万输出 token 10 美元。
推荐理由:Gemini 4 Argon 的 1M 输出 token 与多项基准成绩,展示了长程复杂任务上的能力边界变化。
Ideogram 4.5 已在 fal 上线,定位为精准编辑图像模型。官方称连续进行十次编辑后,94–99% 未被要求改动的部分保持不变。该模型支持按原文渲染任意语言的文字排版,可用 mask 编辑或最多 4 张参考图引导修改,并在同一 endpoint 内完成文生图与编辑。
推荐理由:原文给出连续编辑的保持率区间和参考图数量,读者可据此判断图像编辑在多次修改后的稳定性。
微软研究院推出 Quine,一个面向生物学复杂性的 AI 研究系统,由生物学世界模型和连接模型、科学工具、文献与研究者的交互式 harness 两部分组成。该系统与 Broad Institute 合作用于胰腺导管腺癌(PDAC)研究,从数千个化合物中筛选并优先排序可驱动肿瘤细胞状态转变的候选物,最高排名的化合物在湿实验中产生了最大的预期状态转变,整个流程仅用一个周末完成。
推荐理由:微软研究院公开 Quine 的生物学世界模型与实验编排框架,并给出胰腺癌化合物筛选的湿实验验证结果。
美团 LongCat 宣布 LongCat-2.5-Preview 上线,总参数量 1.6T、激活约 48B,支持 1M token 上下文窗口,原生多模态。官方称该模型面向长周期任务,覆盖终端、浏览器、GUI、表格和设计工具等场景,现已开放 API(longcat.ai/platform/)和 Chat(longcat.ai/chat/)入口。
推荐理由:官方给出参数量、激活规模与 1M 上下文等关键规格,可据此判断它在长任务场景的定位。
Google Research 发布 AI video co-director 等多智能体框架,用于生成连贯的长篇多镜头视频,相关论文将出现在 COLM 2026 和 EMNLP 2026。
推荐理由:Google 把长视频生成拆成规划、分镜、自回归生成与闭环修正四套框架,并给出多组基准上的连续性提升结果。
Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,把近实时视频生成与语音对话结合,为原生实时对话模型加入动态视觉形象,即日起在 Gemini Enterprise 可用。
推荐理由:官方给出 Live Avatar 的能力边界与开放入口,读者可据此判断实时视频对话在企业场景的可用性。
Google DeepMind 推出 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,前者面向角色语音设计与逐行表演导演,后者面向高并发、低成本的配音与语音智能体场景。
推荐理由:官方给出两款 TTS 模型的语音设计、逐行导演能力与基准排名,可据此判断语音生成工作流的变化。
阿里发布 Qwen-Audio-3.1,ASR、TTS 与 Realtime 全面升级,并新增 TTS-Next 和 ASR-Next 两款模型,共五款模型覆盖理解、生成、交互与创作。
推荐理由:官方一次性给出五款音频模型的能力分工与降价幅度,可据此判断语音链路的选型与成本变化。
商汤发布 SenseNova U1.5 技术报告,推出开源 8B-MoT 原生统一模型,通过共享注意力连接理解与生成。模型采用 Pixel Shuffle 加 3×3 空间卷积实现原生 4K 生成,并用多专家在线策略蒸馏整合美学、OCR、信息图与编辑能力。
推荐理由:技术报告与训练配方同步开源,读者可据此了解统一多模态模型如何打通理解与生成。
Google DeepMind 推出 Gemini 3.8 Live 和 3.8 Live Extended Thinking 两款对话模型,可在后台处理任务而不打断对话。
推荐理由:官方给出两款对话模型的能力清单和接入入口,可据此判断实时语音与后台工具调用能覆盖哪些场景。
Google DeepMind 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两款对话模型,可在对话中说话、思考并在后台处理任务而不打断对话流。
推荐理由:官方给出两款实时对话模型的能力清单与开放入口,可据此判断实时语音加后台工具调用的可用边界。
World Labs 联合创始人 Fei-Fei Li、Justin Johnson、Ben Mildenhall 与 a16z 的 Martin Casado 在对话中介绍 Atlas,称其是首个统一像素生成与像素重建的模型,建立在“新视角预测”之上。
推荐理由:World Labs 团队解释 Atlas 以新视角预测统一生成与重建,并给出 3D 采集成本下降的具体量级。