Google Research·· 2025-11-19精选AI 评分
Google 发布端到端实时语音到语音翻译模型,延迟降至 2 秒
Real-time speech-to-speech translation
Google Research 发布端到端语音到语音翻译(S2ST)模型,直接在原说话人音色下生成翻译音频,延迟仅 2 秒,而此前的级联方案延迟为 4–5 秒且会累积误差。
Google 端到端语音翻译把延迟从 4–5 秒压到 2 秒,并已落地 Meet 与 Pixel 10,可据此了解实时同传的技术取舍。
来源:Google Research · research.google