Claude Opus 5.5 制作浮雕卡片
Claude 官方账号展示了用 Opus 5.5 制作的浮雕卡片。该内容以视频形式呈现,未披露更多技术细节或参数信息。
Claude 官方账号展示了用 Opus 5.5 制作的浮雕卡片。该内容以视频形式呈现,未披露更多技术细节或参数信息。
Tavus 发布 Griffin,称其为首个通过视频图灵测试的模型,48% 与其实时对话的人认为它是真人,此前系统的通过率低于 3%。Griffin 在 NVIDIA 全双工 AI 视频基准上排名第一,被定义为首个 Human Interaction Model(HIM),可同时听、看、说,并生成完整画面而非仅面部。
Tavus 推出视频到视频模型 Griffin 的研究预览版,面向实时面对面对话,可从对话中学习交流行为,在对话中边看边听,能中途插话或在有人进入画面时作出回应。
Tavus 推出视频到视频模型 Griffin 的研究预览,面向实时面对面对话,可在对话中观看和聆听,并能在对方说到一半时打断或对进入画面的人作出回应。
Grok 4.7 正在 Grok 网页端和移动端推送,并成为所有模式的基础模型,包括 Fast、Expert、Build 和 Heavy。该消息由 Testing Catalog 转述,称其已进入 App。
Black Forest Labs 发布 FLUX 3 Image,一款支持 4K 精确编辑的新图像模型。用户已可在 Tools Playground 中试用新功能,开放权重计划在未来几周内发布。
Ideogram 发布新模型 Ideogram 4.5,称其只修改用户指定的区域,替换服装时人物身形与背景保持不变,可减少多次编辑后的画面瑕疵。
Tavus 推出 Griffin,公司称其为首个 Human Interaction Model(HIM),可在接收和生成视频的同时处理语音、面部表情、语调、手势和停顿。
AWS 发布开源决策模型 Strands Decider 2B,基于 Qwen3.5-2B 构建,可在本地运行,用于在预设选项中快速做出选择并给出置信度评分。该模型由 AWS 杰出工程师 Marc Brooker 受 TypeSafe 的 Jev 启发开发,曾在同尺寸模型的 Jevbench 排名中登顶。
Viggle Turbo v0.3 发布,这是面向 Qwen-Image-2.1 的加速模型,新增 9-step 模式,细节更精细、小文字渲染更好,颗粒感比 v0.2.1 更少、画面略柔和。该版本已在 ComfyUI 中提供 LoRA 或单文件 int8/fp8/GGUF 形式,模型权重发布于 Hugging Face。
Cohere 的 Embed 5 成为首个采用 RCP-nDCG@10 评测的模型系列,这是其最新评测方法,旨在改进对真实检索质量的评估。该系列基准测试结果因此呈现不同面貌。
Cohere 的 Embed 5 成为首个采用 RCP-nDCG@10 评估的模型家族,该新方法用于改进真实场景检索质量评估。传统 nDCG 只计算已在基准答案集中的结果,RCP-nDCG@10 则按每条结果的实际相关性打分,结果由人工评审和 MTEB 支撑。
Cohere 的 Embed 5 成为首个采用 RCP-nDCG@10 评估的模型家族,该新方法不再只认可基准答案键中已有的结果,而是对每条结果按实际相关性打分。Cohere 称 RCP-nDCG@10 的结果由人工评审和 MTEB 背书,并将于 10 月 8 日(周四)在 X Live 举办网络研讨会,讨论 RCP-nDCG@10、Embed 5 以及搜索与检索的未来。
Google DeepMind 发布 SynthID Bio,这是一组面向 AI 生成生物设计的水印方法,可将不可感知的签名直接嵌入蛋白质序列而不影响其生物功能。该水印类似数字身份证,帮助 DNA 实验室验证合成蛋白质并保持序列数据库准确。这些工具以开放方式发布,供研究使用,以加强生物安全防护。
Google DeepMind 发布 SynthID Bio,这是一组面向 AI 生成生物设计的水印方法,可在不影响生物功能的前提下把不可感知的签名直接嵌入蛋白质序列。该水印类似数字身份证,可帮助 DNA 实验室验证合成蛋白质并保持序列数据库准确,相关工具以开放形式供研究使用。
推荐理由:原文给出 SynthID Bio 的嵌入方式与开放研究入口,读者可据此了解 AI 生物设计溯源的具体做法。
Claude Sonnet 5.5 的 xHigh 推理档位进入 Code Arena WebDev 榜单,以 1786 分排名第 3,混合价格 $8/M tokens,距第 2 名 GPT-6 Astra 的 1788 分仅差 2 分,价格约为其 80%。
Claude Sonnet 5.5 以 xHigh 推理模式进入 Code Arena: WebDev,得分 1786 分排名第 3,混合价格 $8/M tokens。
小米 MiMo-V2.6-Pro 和 MiMo-V2.6-Flash 进入 Agent Arena,Pro 在开源模型中排名第 5,在 8.1K+ 真实智能体会话中净提升 +3.17%,较 MiMo-V2.5-Pro 的第 13 名提升 9 位、提高 10.4 个百分点。
推荐理由:Agent Arena 的实测排名与成本数据,可用来对比 MiMo-V2.6 两个版本在真实智能体会话中的表现差异。
Arena 发布本周榜单更新,四款新模型改变了 Text、Code 和 Agent Arena 的帕累托前沿。
Arena 公布 Claude Sonnet 5.5(Max)首次进入 Agent Arena 即排名第 3,净提升 +12.5%,比排名第 13 的 Claude Sonnet 5(High,+4.4%)高出 8.1 个百分点;在 Chat 分类中以 +15.6% 位列第 1,高于 Fable 5.1(+11.49%)和 Opus 5.5(+10.29%)。
Arena 公布 Claude Sonnet 5.5 (Max) 在 Agent Arena 首次上榜即排名第 3,净提升 +12.5%,比排名第 13 的 Claude Sonnet 5 (High) 高出 8.1 个百分点。
推荐理由:榜单给出了 Claude Sonnet 5.5 在 Agent Arena 与 Code Arena 的排名、分数和每任务成本,可据此比较它与 Opus 5.5、GPT-6 Astra 的性价比。
Anthropic 的 Claude Sonnet 5.5(Max)在 Agent Arena 首次上榜即位列第 3,净提升 +12.5%,比排名第 13 的 Claude Sonnet 5(High,+4.4%)高出 8.1 个百分点。
Tavus 发布 Griffin,称其为首个通过视频图灵测试的模型,48% 的实时对话者认为它是真人,而此前系统的通过率低于 3%。该模型在 NVIDIA 的全双工 AI 视频基准上排名第一,并被称作首个 Human Interaction Model(HIM)。
xAI 的 Grok Imagine Video 1.5 Lite 已在 fal 上线,这是 Grok Imagine 视频家族中的轻量级模型,支持文生视频和图生视频并带原生音频。该模型可生成 1 至 15 秒、480p/720p/1080p 分辨率的视频,覆盖从 16:9 到 9:16 的 7 种宽高比。
Grok Imagine Video 1.5 Lite 已在 fal 上线,是 Grok Imagine 视频家族中的轻量级模型。它支持文生视频与图生视频,可生成 1 至 15 秒、带原生音频的视频,输出 480p、720p 和 1080p,覆盖从 16:9 到 9:16 的 7 种宽高比。
微软 AI 的 MAI-Voice-2.1-Flash 已在 OpenRouter 上线,这是一款面向实时响应的低延迟文本转语音模型。官方称其可在 150ms 内生成 45 秒音频,同一音色可用 23 种语言说话并保持母语口音,定价为每 100 万字符 15 美元,面向语音智能体、助手和呼叫中心等实时场景。
微软 AI 的 MAI-Voice-2.1 已在 OpenRouter 上线,官方称其为 MAI 迄今保真度和表现力最高的文本转语音模型。该模型支持同一音色以 23 种语言说话并保持母语口音,定价为每 100 万字符 22 美元,面向有声书、播客、旁白和品牌音频场景。
Black Forest Labs 的新旗舰图像模型 FLUX 3 Image 已在 OpenRouter 上线,支持文生图与多参考图编辑,原生渲染最高 4K。
推荐理由:FLUX 3 Image 在 OpenRouter 上线,给出多参考图编辑、4K 输出与按分辨率计费的具体价格,可据此评估图像生成成本。
Black Forest Labs 的新旗舰图像模型 FLUX 3 Image 已在 OpenRouter 上线,支持文生图和多参考图编辑,原生渲染最高 4K。
推荐理由:FLUX 3 Image 在 OpenRouter 上线,给出了多参考图编辑、4K 生成与按分辨率计费的具体信息。
Tavus 预览了其最新模型 Griffin,一款能看、能听、能发声并像人一样呈现的 Human Interaction Model,目前尚未公开可用,此次仅为有限的研究预览。
Ideogram 4.5 在 Artificial Analysis 的 AA-Image-Editing v2.0 榜单上位列第 23,是 Ideogram 首个进入该编辑榜的模型,同时在 AA-Image-T2I v2.0 上排名第 34,较 Ideogram 4.0 的第 40 名有所上升。
Ideogram 4.5 于 9 月 30 日发布,在 AA-Image-Editing v2.0 排名第 23(Ideogram 首个上榜的编辑模型),在 AA-Image-T2I v2.0 排名第 34,较 Ideogram 4.0 的第 40 名上升。
Ideogram 4.5 于 9 月 30 日发布,在 Artificial Analysis 的 AA-Image-Editing v2.0 榜单上排名第 23,是 Ideogram 首个登上该图像编辑榜的模型,在 AA-Image-T2I v2.0 上从 Ideogram 4.0 的第 40 名升至第 34 名。
Viggle AI 9 月在 HuggingFace 发布 3 个开放权重模型,其中 Viggle-Animate 与 Meridian 获评 Space of the Week。Qwen-Image-2.1-viggle-turbo 位列 trending Space 第 4、trending model 第 9,获 900+ likes、260K+ 下载量,并衍生 50+ 社区 Space。
Perplexity 近期开源了多项贡献,包括 pplx-decider-v1-27b 多模态决策模型,在 11 个基准上平均得分 85.7%,领先 Jev。pplx-embed-v2-context-9b-preview 为上下文嵌入向量模型,在 ConTEB 和 turbopuffer context-bench 上表现最佳。
Arena 宣布 OpenAI 的 GPT-6.1 Sol (Max) 进入 Agent Arena 第 5 名,提升 11.23%,并重塑帕累托前沿。其单任务中位成本为 $0.56,比 GPT-6 Sol 低 39% 且得分高 1.52 分,比 GPT-6 Astra 低 81% 且得分差距 1.04 分。
推荐理由:Agent Arena 榜单显示 GPT-6.1 Sol 以更低单任务成本进入前五,读者可据此比较它与 GPT-6 Sol、Claude 系列的性价比差距。
Cloudflare 发布 Clef 和 Clef-flash 两款面向 AI 智能体的决策模型,返回带概率的简短分类而非长文本,用于路由工单、触发升级或转交人工。
Gemini 9 月发布回顾涵盖多项更新:Gemini 4 Argon 作为最新前沿模型,具备高级推理能力和 100 万 token 输出上限,主打网络安全防御等复杂任务。
Ai2 开源 AstaBrief 8B,一个把研究问题和检索到的文献片段转成带引用报告的模型,基于 Qwen3-8B 经 SFT 和 DPO 训练,权重与训练数据一并开放。
微软 AI 发布实时转录模型 MAI-Transcribe-2-Streaming,支持 60 种语言,首个部分结果延迟约 100 毫秒,微软称其在 Artificial Analysis 准确率排名第一,年底前音频价格为每小时 0.54 美元。