每日 AI 简报:OpenAI Voices API、ChatGPT 虚拟试穿、Antigravity 接入 Claude 5.5、Claude Frontier Academy 等
OpenAI Python SDK 3.24.0 新增 Voices API,可从文本提示词或音频样本创建自定义语音;ChatGPT 全球上线虚拟试穿,可在自己的照片上查看购物结果中的服装。
OpenAI Python SDK 3.24.0 新增 Voices API,可从文本提示词或音频样本创建自定义语音;ChatGPT 全球上线虚拟试穿,可在自己的照片上查看购物结果中的服装。
Anthropic 展示了近期用 Claude 制作的一批创意项目,包括用 Opus 5.5 构建的可运转水车、浮雕卡片、木星卫星 3D 飞行网站和可拆解的喷气发动机交互 3D 模型。另有用户用 Claude Code 创作插画诗歌,用 Sonnet 5.5 制作纸折弹出式城市。
Anthropic 展示用户用 Claude 制作的创意项目,包括用 Opus 5.5 构建的可运行水车、可拆解的交互式 3D 喷气发动机,以及用 Sonnet 5.5 制作的纸折弹出式城市。另有用户在 Claude Code 中创作插画诗歌,以及跟随西雅图实时天气与时间的像素漫步项目。
Claude 官方账号展示了近期用 Claude 创作的一批作品,其中包括一个用 Opus 5.5 制作的 3D 网站,可带用户从银河系外一路飞抵木星的卫星。同批作品还有用 Opus 5.5 搭建的可运转水磨、可拆解剖切的交互式 3D 喷气发动机,以及用 Sonnet 5.5 绘制的折纸风格弹出式城市。
Krea 宣布 FLUX 3 Image 已在其平台上线。该模型支持多轮编辑且不改动其他像素,可用边界框排布图像,生成分辨率最高 4K,并支持最多 10 张参考图组合。
Anthropic 展示用户近期用 Claude 创作的作品,包括用 Opus 5.5 搭建的可运转水车、3D 喷气发动机和从银河系外飞至木星卫星的 3D 网站,以及用 Sonnet 5.5 制作的折纸弹出城市。另有作品用 Claude Code 绘制插画诗歌,以及一个跟随西雅图实时天气与时间变化的像素漫游项目。
PixVerse 上线 ChatGPT 插件,用户输入 "pixverse cinematic story" 并描述故事、情绪或风格,即可由 PixVerse 自动完成镜头、画面与节奏,生成电影级短片。插件可通过 app.pixverse.ai/cli/marketing 获取。
PixVerse 上线 ChatGPT 插件,用户添加插件后输入 pixverse cinematic story 并描述故事、情绪或风格,即可生成电影感短片,镜头、画面与节奏由 PixVerse 自动处理。
PixVerse 推出新插件,用户选择角色后即可让其开口说话,在镜头前自然地表达、反应和做手势,视频片段由 PixVerse 自动生成。
UniEvo-VL 是一个自进化框架,让单个多模态模型同时充当教师和学生,从自身建设性反馈中学习,在无外部监督下提升图像生成能力。该框架由 AK 在 X 上分享,发布于 10 月 1 日。
Tavus 发布 Griffin,称其为首个通过视频图灵测试的模型,48% 与其实时对话的人认为它是真人,此前系统的通过率低于 3%。Griffin 在 NVIDIA 全双工 AI 视频基准上排名第一,被定义为首个 Human Interaction Model(HIM),可同时听、看、说,并生成完整画面而非仅面部。
Karpathy 分享理解大语言模型输出的提示词技巧,包括要求模型用 ASD-STE100 受控语言写作,或提出 80% 接近该规范以降低严格程度。他还建议让模型生成图表、HTML 交互网页,以及用 ElevenLabs API key 配音的 3b1b 风格讲解视频。他认为随着模型变强,工作会更多上升到监督与理解层面,可以索取以往不划算的大型定制一次性软件产物。
Tavus 推出视频到视频模型 Griffin 的研究预览版,面向实时面对面对话,可从对话中学习交流行为,在对话中边看边听,能中途插话或在有人进入画面时作出回应。
Tavus 推出视频到视频模型 Griffin 的研究预览,面向实时面对面对话,可在对话中观看和聆听,并能在对方说到一半时打断或对进入画面的人作出回应。
Tavus 推出 Griffin,公司称其为首个 Human Interaction Model(HIM),可在接收和生成视频的同时处理语音、面部表情、语调、手势和停顿。
OpenAI 宣布在全球范围上线两项 ChatGPT 购物功能,包括虚拟试穿服装与配饰,以及把商品保存到应用内 Library 的 Favorites 收藏功能。
Google 在 Gemini Live 中上线 Guided Vision,可在兼容 Android 设备上通过共享摄像头,对镜头所指向的内容提供实时语音描述,帮助读取小字、描述周围环境、寻找或识别物体。
Runway Labs 发布 Project Continuum,一个围绕实时视频界面构建的操作系统研究应用,并给出四种与电脑交互方式的早期预览:Portals、Visual Thinking、Responsive Video Interfaces 和 Interactive Worlds。
Runway Labs 发布 Project Continuum,一个围绕实时视频界面构建的操作系统研究应用,并首次展示四种与电脑交互的新方式:Portals、Visual Thinking、Responsive Video Interfaces 和 Interactive Worlds。
Runway Labs 发布 Project Continuum,一个围绕实时视频界面构建的操作系统研究应用,并首次展示四种与电脑交互的新方式:Portals、Visual Thinking、Responsive Video Interfaces 和 Interactive Worlds。
Runway Labs 发布 Project Continuum,一个围绕实时视频界面构建的操作系统研究应用。官方同时放出一段简短的演示走查视频。
Tavus 发布 Griffin,称其为首个通过视频图灵测试的模型,48% 的实时对话者认为它是真人,而此前系统的通过率低于 3%。该模型在 NVIDIA 的全双工 AI 视频基准上排名第一,并被称作首个 Human Interaction Model(HIM)。
Black Forest Labs 的 FLUX 3 Image 已在 fal 平台上线,主打精准图像编辑,保留未修改部分。该模型支持原生 2K 和 4K 图像生成,最多可组合 10 张参考图,能在一次生成中完成多处定向编辑,并对布局和构图提供细致控制。
推荐理由:FLUX 3 Image 在 fal 上线,列出原生 2K/4K 生成与多参考图编辑等能力,可据此判断图像编辑工作流的变化。
fal 推出 Recast,可一键替换视频中的角色:上传一段现有视频和一张新角色的参考照片,即可在保留原始运动、镜头运动、剪辑和音频的前提下更换出镜人物。该功能由 H3 Max 驱动,fal 称其在整体质量、提示词理解和美学上优于领先视频模型。用户可在 fal 平台 minimax/h3-max/recast 页面试用,用于生成角色变体或为不同受众改编广告素材,无需重新拍摄。
xAI 的 Grok Imagine Video 1.5 Lite 已在 fal 上线,这是 Grok Imagine 视频家族中的轻量级模型,支持文生视频和图生视频并带原生音频。该模型可生成 1 至 15 秒、480p/720p/1080p 分辨率的视频,覆盖从 16:9 到 9:16 的 7 种宽高比。
Grok Imagine Video 1.5 Lite 已在 fal 上线,是 Grok Imagine 视频家族中的轻量级模型。它支持文生视频与图生视频,可生成 1 至 15 秒、带原生音频的视频,输出 480p、720p 和 1080p,覆盖从 16:9 到 9:16 的 7 种宽高比。
GPT-6.1 Astra 在生成简单 Gaussian Splats 上表现突出。用户让它结合 Blender MCP 与 Lichtfeld Studio,复刻了一个新的 ChatGPT agent 圆点,成品在基于 playcanvas 的 SuperSplat 编辑器中网页预览效果清晰锐利。
Black Forest Labs 的新旗舰图像模型 FLUX 3 Image 已在 OpenRouter 上线,支持文生图与多参考图编辑,原生渲染最高 4K。
推荐理由:FLUX 3 Image 在 OpenRouter 上线,给出多参考图编辑、4K 输出与按分辨率计费的具体价格,可据此评估图像生成成本。
Black Forest Labs 的新旗舰图像模型 FLUX 3 Image 已在 OpenRouter 上线,支持文生图和多参考图编辑,原生渲染最高 4K。
推荐理由:FLUX 3 Image 在 OpenRouter 上线,给出了多参考图编辑、4K 生成与按分辨率计费的具体信息。
OpenRouter 展示了一项图像编辑能力:用户可输入最多 14 张参考图,并用一条提示词完成精准编辑。该功能将多图参考与单提示词编辑结合,具体支持的模型与开放范围尚未在原文中说明。
Tavus 预览了其最新模型 Griffin,一款能看、能听、能发声并像人一样呈现的 Human Interaction Model,目前尚未公开可用,此次仅为有限的研究预览。
一位创作者用 Opus 5.5 做出了可剖切、可拆解的交互式 3D 喷气发动机。Claude 官方还盘点了近期用 Claude 完成的其他作品,包括 Opus 5.5 搭建的运转水磨、3D 星际漫游站点,以及 Sonnet 5.5 生成的折纸风格弹出式城市。
Anthropic 展示了近期用 Claude 创作的一批作品,包括用 Opus 5.5 搭建的可运转水车、浮雕卡片、可拆解的 3D 喷气发动机,以及用 Sonnet 5.5 制作的纸折叠立体城市。另有作品用 Claude Code 绘制插画,以及一个跟随西雅图真实天气和时间的像素漫游项目。
Perplexity 近期开源了多项贡献,包括 pplx-decider-v1-27b 多模态决策模型,在 11 个基准上平均得分 85.7%,领先 Jev。pplx-embed-v2-context-9b-preview 为上下文嵌入向量模型,在 ConTEB 和 turbopuffer context-bench 上表现最佳。
AI 音乐生成器 Suno 新增 Speech 功能,可将口述文本与匹配的背景音乐合成为单条音轨,用户输入想法或文字并描述想要的音色与音乐风格,模型即生成人声与音效。
论文 Adaptive Reward Routing 提出通过前向过程 RL 为音视频联合扩散模型做动态多奖励优化,取代单一评分方案。该方法面向生成式媒体,论文已在 HuggingFace 上线(2609.37200)。
Runway 展示时尚品牌如何用 Runway Dev 完成从草图到广告大片的流程:把草图渲染成真实服装、探索配色与图案、生成电商产品图,并制作棚拍或外景的模特照片与视频。完整演示已上线。
Gemini 9 月发布回顾涵盖多项更新:Gemini 4 Argon 作为最新前沿模型,具备高级推理能力和 100 万 token 输出上限,主打网络安全防御等复杂任务。
Suno 发布幕后内容,由 Braylon Browner 与艾美奖获奖编舞/导演 Nina McNeely 出镜,展示从舞蹈到歌曲、再到围绕动作构建完整创意世界的过程。
研究提出 EgoTools,聚焦真实第一视角视频中的工具中心推理,解决多数智能体演示忽略的"手中持有什么工具、如何使用"问题。该工作关注跨镜头切换时的工具身份保持,作者称首次尝试在镜头移开的瞬间就丢失了螺丝刀。论文已发布在 HuggingFace,编号 2609.39378。