跳到正文

多模态

文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。

最新精选

第 1–16 条 · 共 16 条
今天10月3日周六
  1. X:fal (@fal)71

    Black Forest Labs 的 FLUX 3 Image 在 fal 上线

    Black Forest Labs 的 FLUX 3 Image 已在 fal 平台上线,主打精准图像编辑,保留未修改部分。该模型支持原生 2K 和 4K 图像生成,最多可组合 10 张参考图,能在一次生成中完成多处定向编辑,并对布局和构图提供细致控制。

    推荐理由:FLUX 3 Image 在 fal 上线,列出原生 2K/4K 生成与多参考图编辑等能力,可据此判断图像编辑工作流的变化。

10月1日周四
  1. X:Arena (@arena)67

    Gemini 4 Argon 与前沿模型对比:单任务成本比 GPT-6.1 Sol 低 33%

    Arena 分享 Google DeepMind 的 Gemini 4 Argon 与多款前沿模型在生成任务上的对比,单任务成本比 GPT-6.1 Sol 低 33%,比 Claude Opus 5.5 低 70%,并附上 @petergostev 的第一印象视频。评论区对评测方式提出质疑,认为用图形设计任务评估文本生成模型意义有限,也有人追问单任务成本是否包含思考 token。

    推荐理由:原文给出 Gemini 4 Argon 与前沿模型的成本对比和实测片段,读者可据此判断其性价比定位。

  2. Google DeepMind78

    Google DeepMind 发布 Gemini 4 Argon 前沿模型

    Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御者开放,随后将逐步面向开发者、企业和消费者推出,起步价为每百万输入 token 2 美元、每百万输出 token 10 美元。

    推荐理由:Gemini 4 Argon 的 1M 输出 token 与多项基准成绩,展示了长程复杂任务上的能力边界变化。

  3. X:fal (@fal)66

    Ideogram 4.5 上线 fal,主打精准图像编辑

    Ideogram 4.5 已在 fal 上线,定位为精准编辑图像模型。官方称连续进行十次编辑后,94–99% 未被要求改动的部分保持不变。该模型支持按原文渲染任意语言的文字排版,可用 mask 编辑或最多 4 张参考图引导修改,并在同一 endpoint 内完成文生图与编辑。

    推荐理由:原文给出连续编辑的保持率区间和参考图数量,读者可据此判断图像编辑在多次修改后的稳定性。

9月29日周二
  1. Microsoft Research62

    微软研究院推出 Quine:面向生物学复杂性的 AI 研究系统

    微软研究院推出 Quine,一个面向生物学复杂性的 AI 研究系统,由生物学世界模型和连接模型、科学工具、文献与研究者的交互式 harness 两部分组成。该系统与 Broad Institute 合作用于胰腺导管腺癌(PDAC)研究,从数千个化合物中筛选并优先排序可驱动肿瘤细胞状态转变的候选物,最高排名的化合物在湿实验中产生了最大的预期状态转变,整个流程仅用一个周末完成。

    推荐理由:微软研究院公开 Quine 的生物学世界模型与实验编排框架,并给出胰腺癌化合物筛选的湿实验验证结果。

9月25日周五
  1. X:美团 LongCat (@Meituan_LongCat)70

    美团 LongCat-2.5-Preview 上线:1.6T 参数、1M token 上下文、原生多模态

    美团 LongCat 宣布 LongCat-2.5-Preview 上线,总参数量 1.6T、激活约 48B,支持 1M token 上下文窗口,原生多模态。官方称该模型面向长周期任务,覆盖终端、浏览器、GUI、表格和设计工具等场景,现已开放 API(longcat.ai/platform/)和 Chat(longcat.ai/chat/)入口。

    推荐理由:官方给出参数量、激活规模与 1M 上下文等关键规格,可据此判断它在长任务场景的定位。

  2. Google DeepMind70

    Google DeepMind 发布 Gemini 3.8 Live with Live Avatar

    Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,把近实时视频生成与语音对话结合,为原生实时对话模型加入动态视觉形象,即日起在 Gemini Enterprise 可用。

    推荐理由:官方给出 Live Avatar 的能力边界与开放入口,读者可据此判断实时视频对话在企业场景的可用性。

9月23日周三
  1. Google DeepMind69

    Google DeepMind 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS

    Google DeepMind 推出 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,前者面向角色语音设计与逐行表演导演,后者面向高并发、低成本的配音与语音智能体场景。

    推荐理由:官方给出两款 TTS 模型的语音设计、逐行导演能力与基准排名,可据此判断语音生成工作流的变化。

9月17日周四
  1. X:商汤 SenseTime (@SenseTime_AI)71

    商汤发布 SenseNova U1.5 技术报告:开源 8B-MoT 原生统一模型

    商汤发布 SenseNova U1.5 技术报告,推出开源 8B-MoT 原生统一模型,通过共享注意力连接理解与生成。模型采用 Pixel Shuffle 加 3×3 空间卷积实现原生 4K 生成,并用多专家在线策略蒸馏整合美学、OCR、信息图与编辑能力。

    推荐理由:技术报告与训练配方同步开源,读者可据此了解统一多模态模型如何打通理解与生成。

9月16日周三
9月4日周五
  1. X:World Labs (@theworldlabs)69

    World Labs 团队谈 Atlas:以新视角预测统一像素生成与重建

    World Labs 联合创始人 Fei-Fei Li、Justin Johnson、Ben Mildenhall 与 a16z 的 Martin Casado 在对话中介绍 Atlas,称其是首个统一像素生成与像素重建的模型,建立在“新视角预测”之上。

    推荐理由:World Labs 团队解释 Atlas 以新视角预测统一生成与重建,并给出 3D 采集成本下降的具体量级。