Claude Opus 5.5 制作浮雕卡片
Claude 官方账号展示了用 Opus 5.5 制作的浮雕卡片。该内容以视频形式呈现,未披露更多技术细节或参数信息。
Claude 官方账号展示了用 Opus 5.5 制作的浮雕卡片。该内容以视频形式呈现,未披露更多技术细节或参数信息。
Tavus 发布 Griffin,称其为首个通过视频图灵测试的模型,48% 与其实时对话的人认为它是真人,此前系统的通过率低于 3%。Griffin 在 NVIDIA 全双工 AI 视频基准上排名第一,被定义为首个 Human Interaction Model(HIM),可同时听、看、说,并生成完整画面而非仅面部。
Tavus 推出视频到视频模型 Griffin 的研究预览版,面向实时面对面对话,可从对话中学习交流行为,在对话中边看边听,能中途插话或在有人进入画面时作出回应。
Tavus 推出视频到视频模型 Griffin 的研究预览,面向实时面对面对话,可在对话中观看和聆听,并能在对方说到一半时打断或对进入画面的人作出回应。
Grok 4.7 正在 Grok 网页端和移动端推送,并成为所有模式的基础模型,包括 Fast、Expert、Build 和 Heavy。该消息由 Testing Catalog 转述,称其已进入 App。
Black Forest Labs 发布 FLUX 3 Image,一款支持 4K 精确编辑的新图像模型。用户已可在 Tools Playground 中试用新功能,开放权重计划在未来几周内发布。
Ideogram 发布新模型 Ideogram 4.5,称其只修改用户指定的区域,替换服装时人物身形与背景保持不变,可减少多次编辑后的画面瑕疵。
Tavus 推出 Griffin,公司称其为首个 Human Interaction Model(HIM),可在接收和生成视频的同时处理语音、面部表情、语调、手势和停顿。
AWS 发布开源决策模型 Strands Decider 2B,基于 Qwen3.5-2B 构建,可在本地运行,用于在预设选项中快速做出选择并给出置信度评分。该模型由 AWS 杰出工程师 Marc Brooker 受 TypeSafe 的 Jev 启发开发,曾在同尺寸模型的 Jevbench 排名中登顶。
Viggle Turbo v0.3 发布,这是面向 Qwen-Image-2.1 的加速模型,新增 9-step 模式,细节更精细、小文字渲染更好,颗粒感比 v0.2.1 更少、画面略柔和。该版本已在 ComfyUI 中提供 LoRA 或单文件 int8/fp8/GGUF 形式,模型权重发布于 Hugging Face。
Cohere 的 Embed 5 成为首个采用 RCP-nDCG@10 评测的模型系列,这是其最新评测方法,旨在改进对真实检索质量的评估。该系列基准测试结果因此呈现不同面貌。
Cohere 的 Embed 5 成为首个采用 RCP-nDCG@10 评估的模型家族,该新方法用于改进真实场景检索质量评估。传统 nDCG 只计算已在基准答案集中的结果,RCP-nDCG@10 则按每条结果的实际相关性打分,结果由人工评审和 MTEB 支撑。
Cohere 的 Embed 5 成为首个采用 RCP-nDCG@10 评估的模型家族,该新方法不再只认可基准答案键中已有的结果,而是对每条结果按实际相关性打分。Cohere 称 RCP-nDCG@10 的结果由人工评审和 MTEB 背书,并将于 10 月 8 日(周四)在 X Live 举办网络研讨会,讨论 RCP-nDCG@10、Embed 5 以及搜索与检索的未来。
小米 MiMo-V2.6-Pro 和 MiMo-V2.6-Flash 进入 Agent Arena,Pro 在开源模型中排名第 5,在 8.1K+ 真实智能体会话中净提升 +3.17%,较 MiMo-V2.5-Pro 的第 13 名提升 9 位、提高 10.4 个百分点。
推荐理由:Agent Arena 的实测排名与成本数据,可用来对比 MiMo-V2.6 两个版本在真实智能体会话中的表现差异。
Tavus 发布 Griffin,称其为首个通过视频图灵测试的模型,48% 的实时对话者认为它是真人,而此前系统的通过率低于 3%。该模型在 NVIDIA 的全双工 AI 视频基准上排名第一,并被称作首个 Human Interaction Model(HIM)。
Black Forest Labs 的 FLUX 3 Image 已在 fal 平台上线,主打精准图像编辑,保留未修改部分。该模型支持原生 2K 和 4K 图像生成,最多可组合 10 张参考图,能在一次生成中完成多处定向编辑,并对布局和构图提供细致控制。
推荐理由:FLUX 3 Image 在 fal 上线,列出原生 2K/4K 生成与多参考图编辑等能力,可据此判断图像编辑工作流的变化。
xAI 的 Grok Imagine Video 1.5 Lite 已在 fal 上线,这是 Grok Imagine 视频家族中的轻量级模型,支持文生视频和图生视频并带原生音频。该模型可生成 1 至 15 秒、480p/720p/1080p 分辨率的视频,覆盖从 16:9 到 9:16 的 7 种宽高比。
Grok Imagine Video 1.5 Lite 已在 fal 上线,是 Grok Imagine 视频家族中的轻量级模型。它支持文生视频与图生视频,可生成 1 至 15 秒、带原生音频的视频,输出 480p、720p 和 1080p,覆盖从 16:9 到 9:16 的 7 种宽高比。
微软 AI 的 MAI-Voice-2.1 已在 OpenRouter 上线,官方称其为 MAI 迄今保真度和表现力最高的文本转语音模型。该模型支持同一音色以 23 种语言说话并保持母语口音,定价为每 100 万字符 22 美元,面向有声书、播客、旁白和品牌音频场景。
Liquid AI 的 D1 模型已在 OpenRouter 上线,这是一个决策模型,输入应用状态和是/否、选择或评分问题,返回带每个选项概率的类型化答案。该模型零数据留存,定价为 $0.04/M 输入、$0 输出,上下文窗口 65K。
Black Forest Labs 的新旗舰图像模型 FLUX 3 Image 已在 OpenRouter 上线,支持文生图与多参考图编辑,原生渲染最高 4K。
推荐理由:FLUX 3 Image 在 OpenRouter 上线,给出多参考图编辑、4K 输出与按分辨率计费的具体价格,可据此评估图像生成成本。
Black Forest Labs 的新旗舰图像模型 FLUX 3 Image 已在 OpenRouter 上线,支持文生图和多参考图编辑,原生渲染最高 4K。
推荐理由:FLUX 3 Image 在 OpenRouter 上线,给出了多参考图编辑、4K 生成与按分辨率计费的具体信息。
Tavus 预览了其最新模型 Griffin,一款能看、能听、能发声并像人一样呈现的 Human Interaction Model,目前尚未公开可用,此次仅为有限的研究预览。
Ideogram 4.5 在 Artificial Analysis 的 AA-Image-Editing v2.0 榜单上位列第 23,是 Ideogram 首个进入该编辑榜的模型,同时在 AA-Image-T2I v2.0 上排名第 34,较 Ideogram 4.0 的第 40 名有所上升。
Ideogram 4.5 于 9 月 30 日发布,在 AA-Image-Editing v2.0 排名第 23(Ideogram 首个上榜的编辑模型),在 AA-Image-T2I v2.0 排名第 34,较 Ideogram 4.0 的第 40 名上升。
Ideogram 4.5 于 9 月 30 日发布,在 Artificial Analysis 的 AA-Image-Editing v2.0 榜单上排名第 23,是 Ideogram 首个登上该图像编辑榜的模型,在 AA-Image-T2I v2.0 上从 Ideogram 4.0 的第 40 名升至第 34 名。
Viggle AI 9 月在 HuggingFace 发布 3 个开放权重模型,其中 Viggle-Animate 与 Meridian 获评 Space of the Week。Qwen-Image-2.1-viggle-turbo 位列 trending Space 第 4、trending model 第 9,获 900+ likes、260K+ 下载量,并衍生 50+ 社区 Space。
Cloudflare 发布 Clef 和 Clef-flash 两款面向 AI 智能体的决策模型,返回带概率的简短分类而非长文本,用于路由工单、触发升级或转交人工。
Gemini 9 月发布回顾涵盖多项更新:Gemini 4 Argon 作为最新前沿模型,具备高级推理能力和 100 万 token 输出上限,主打网络安全防御等复杂任务。
Ai2 开源 AstaBrief 8B,一个把研究问题和检索到的文献片段转成带引用报告的模型,基于 Qwen3-8B 经 SFT 和 DPO 训练,权重与训练数据一并开放。
微软 AI 发布实时转录模型 MAI-Transcribe-2-Streaming,支持 60 种语言,首个部分结果延迟约 100 毫秒,微软称其在 Artificial Analysis 准确率排名第一,年底前音频价格为每小时 0.54 美元。
Black Forest Labs 发布 Flux 3 模型家族中的图像模型 Flux 3 Image,官方称其支持多步编辑而不改动图像其他部分,覆盖文生图、图生图、文字渲染和照片级真实感。
Griffin 发布,被称为首个通过视频图灵测试的模型,48% 与其实时对话的人认为它是真人,此前系统的通过率低于 3%。它还在 NVIDIA 的全双工 AI 视频基准上排名第一,被称为首个 Human Interaction Model(HIM)。
小米 MiMo-V2.6-Pro 和 MiMo-V2.6-Flash 登陆 Agent Arena,Pro 在 8.1K+ 真实智能体会话中净提升 +3.17%,位列开源模型第 5,较 MiMo-V2.5-Pro 的第 13 名提升 9 位、净提升提高 10.4 个百分点。
推荐理由:榜单给出了 MiMo-V2.6 两款模型在真实智能体会话中的排名与成本对比,可据此判断开源模型在 Agent 场景的位置。
商汤发布由 SenseNova 6.8 Flash Preview 驱动的 Dynamic Design,可将静态图像转化为动态内容。该功能以预览版形式亮相,官方演示展示了黄果树瀑布、青海门源等静态图片的动态化效果。
Google DeepMind 推出 Gemini 4 Argon,面向编码、企业知识工作与网络防御,首批开放给 Fairwind 计划的政府用户与可信网络安全人员,后续再向开发者、企业和消费者开放。
推荐理由:汇总了 Gemini 4 Argon 的基准、定价与可用范围,并列出同期多家模型与工具的动态,便于横向比较。
HiDream-O1-Video-1.0 以 1456 分进入 Image-to-Video Arena 排名第 7,距 gemini-omni-flash 差 8 分,与 dreamina-seedance-2.0 和 2.5 的差距在 20 分以内。
HiDream 的 HiDream-O1-Video-1.0 以 1456 分进入 Image-to-Video Arena 第 7 名,距 gemini-omni-flash 仅差 8 分,与 dreamina-seedance-2.0 和 2.5 的差距在 20 分以内。
Runway 机器人负责人 Andy Chen 介绍了公司在机器人方向的技术路线,并首次公开开源世界动作模型 Praxis-1。官方同时开放 Praxis-1 的早期访问申请,详情见 runway.com/praxis-1。
Google 放出 Gemini 4 Argon 的早期预览,称其在复杂工作流、网络防御和软件工程上展现前沿性能,Google 内部团队已从编码到量子计算广泛使用。在 PostTrainBench 上,Gemini 4 达到 45.3%,高于 Gemini 3.1 Pro 的 21.99%。作者表示这是朝构建能负责任自我改进的 AI 迈出的一步,并附上了基准测试结果。