Tavus 发布 Griffin 人机交互模型,48% 测试者一分钟通话后误认为真人
Tavus 推出 Griffin,公司称其为首个 Human Interaction Model(HIM),可在接收和生成视频的同时处理语音、面部表情、语调、手势和停顿。
Tavus 推出 Griffin,公司称其为首个 Human Interaction Model(HIM),可在接收和生成视频的同时处理语音、面部表情、语调、手势和停顿。
微软 AI 的 MAI-Voice-2.1-Flash 已在 OpenRouter 上线,这是一款面向实时响应的低延迟文本转语音模型。官方称其可在 150ms 内生成 45 秒音频,同一音色可用 23 种语言说话并保持母语口音,定价为每 100 万字符 15 美元,面向语音智能体、助手和呼叫中心等实时场景。
Tavus 预览了其最新模型 Griffin,一款能看、能听、能发声并像人一样呈现的 Human Interaction Model,目前尚未公开可用,此次仅为有限的研究预览。
微软 AI 发布实时转录模型 MAI-Transcribe-2-Streaming,支持 60 种语言,首个部分结果延迟约 100 毫秒,微软称其在 Artificial Analysis 准确率排名第一,年底前音频价格为每小时 0.54 美元。
Fermion AI 发布语音识别模型 Phonon-2,下载体积仅 164MB,官方称其平均准确率超过体积约为其 10 倍的 OpenAI Whisper large。该模型可在 MacBook Air 上 20 秒转写 1 小时音频,权重以 CC-BY-4.0 协议开放。
Eleven v4 是我们最具情感表现力的模型。 我们做了一个 demo 来展示它的情感范围,其中 [audio tags] 塑造每个提示词的情感。
Google DeepMind 推出 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,前者面向角色语音设计与逐行表演导演,后者面向高并发、低成本的配音与语音智能体场景。
推荐理由:官方给出两款 TTS 模型的语音设计、逐行导演能力与基准排名,可据此判断语音生成工作流的变化。
Google 发布迄今最先进的 Gemini 音频模型 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking。
推荐理由:原文区分了两个版本的定位差异,读者可据此判断日常对话与复杂任务该选哪一个。
Google DeepMind 发布两款实时对话模型 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking,前者面向规模化与成本效率,后者面向高复杂度任务与多步推理。
推荐理由:官方给出两款语音模型的基准成绩与开放渠道,可据此判断实时语音智能体的能力水位与成本取舍。
Google DeepMind 发布语音转文本模型 Gemini 3.5 Transcribe,可通过 Gemini API 在 Google AI Studio 和 Gemini Enterprise Agent Platform 使用,分为实时流式 gemini-3.5-transcribe-live 和预录音频 gemini-3.5-transcribe 两个接口。
推荐理由:官方给出流式与非流式两套 API 的 WER 数字和延迟对比,可据此判断语音转写能否接入现有产品。
OpenAI 发布新一代语音模型 GPT-Live,面向更自然的人机交互,目前已用于驱动 ChatGPT Voice。
推荐理由:OpenAI 发布新一代语音模型 GPT-Live,读者可了解它已接入 ChatGPT Voice 这一落地位置。
Google DeepMind 发布 Gemini 3.5 Live Translate,这是一款音频模型,可自动检测 70+ 语言并生成保留说话人语调、节奏和音高的近实时语音到语音翻译,且持续输出而非等说话人说完再翻译,全程仅落后几秒。
推荐理由:Gemini 3.5 Live Translate 支持 70+ 语言连续语音翻译,并同步开放 API 与 Google 产品入口,可据此判断实时翻译的落地方式。
NVIDIA 发布 Nemotron 3 Nano Omni,一款面向文档分析、多图推理、语音识别、长音视频理解与智能体电脑操作的全模态理解模型,在 MMlongbench-Doc、OCRBenchV2、WorldSense、DailyOmni、VoiceBench 等基准上取得领先成绩。
推荐理由:原文给出架构、训练配方与多模态基准对比,可据此判断开源全模态模型在文档、音视频与GUI任务上的位置。
Google DeepMind 发布 Gemini 3.1 Flash TTS,一款主打可控性与表现力的文本转语音模型,即日起在 Gemini API 和 Google AI Studio 面向开发者预览,企业版在 Vertex AI 预览,Workspace 用户可通过 Google Vids 使用。
推荐理由:官方给出音频标签控制方式与 70+ 语言支持,读者可据此判断语音生成的可控程度与接入渠道。
Google DeepMind 发布 Gemini 3.1 Flash Live,称其为目前质量最高的音频与语音模型,具备更高精度和更低延迟。该模型在 ComplexFuncBench Audio 上得分 90.8%,在 Scale AI 的 Audio MultiChallenge 上开启 thinking 后得分 36.1%。
推荐理由:官方给出语音模型的基准分数与多产品开放入口,可据此判断实时语音交互的可用边界。
Mistral AI 发布首个文本转语音模型 Voxtral TTS,4B 参数,支持英语、法语、德语、西班牙语、荷兰语、葡萄牙语、意大利语、印地语和阿拉伯语 9 种语言,可做情感表达与零样本跨语言音色适配。
推荐理由:官方给出 4B 参数、9 种语言、70ms 延迟与每千字符 0.016 美元的定价,读者可据此判断语音智能体的成本与选型空间。
Mistral AI 发布 Voxtral Transcribe 2,包含面向批量转写的 Voxtral Mini Transcribe V2 和面向实时场景的 Voxtral Realtime 两款语音转文字模型。
推荐理由:原文给出两款语音转写模型的延迟、价格与开源许可,读者可据此判断实时语音应用的选型空间。
Google 发布 MedGemma 1.5 4B,新增对 CT、MRI 和全切片病理等高维医学影像的支持,并同步推出医疗听写语音识别模型 MedASR。
推荐理由:原文给出 MedGemma 1.5 与 MedASR 的基准提升和开放下载入口,读者可据此判断医疗多模态模型的可用边界。
Google DeepMind 发布升级版 Gemini 2.5 Flash Native Audio,面向实时语音智能体,在函数调用、指令遵循和多轮对话三方面做了改进。
推荐理由:官方给出 Gemini 2.5 Flash Native Audio 在函数调用、指令遵循和多轮对话上的具体提升数据,可据此判断语音智能体的可用性变化。
OpenAI 发布更先进的语音到语音模型 gpt-realtime,并更新 Realtime API。新 API 能力包括 MCP server 支持、图像输入和 SIP 电话呼叫支持。
推荐理由:OpenAI 发布语音到语音新模型并扩展 Realtime API,读者可了解语音交互能力与接口支持的变化。
Mistral AI 发布 Voxtral 语音理解模型,提供 24B 和 3B 两个版本,均以 Apache 2.0 协议开源并上线自家 API。模型支持 32k token 上下文,可处理最长 30 分钟音频转写或 40 分钟音频理解,具备内置问答与摘要、多语言自动检测和语音触发函数调用能力,并保留 Mistral Small 3.1 的文本能力。
推荐理由:官方给出两款语音理解模型的尺寸、开源协议与 API 定价,可对照 Whisper、GPT-4o mini 等基准判断其成本位置。
OpenAI 宣布推出新旗舰模型 GPT-4 Omni(GPT-4o),可在音频、视觉和文本之间实时推理。
推荐理由:OpenAI 公布新旗舰模型 GPT-4o,可在音频、视觉与文本间实时推理,读者可据此了解其多模态能力定位。
OpenAI 训练并开源了神经网络 Whisper,其在英语语音识别上接近人类水平的鲁棒性和准确度。
推荐理由:OpenAI 开源语音识别模型 Whisper,读者可了解其在英语识别上的鲁棒性与准确度定位。