跳到正文

#语音

今日 1 条
10月3日周六
  1. X:Elvis Saravia (@omarsar0, DAIR.AI)38

    Onepin 推出 AI 语音质检层:逐行检查发音,只修错词不重录

    Onepin 发布 AI 语音质检层,在文本转语音之后逐行检查配音,用 400 万词发音词典核对人名与产品名,并提前拼读价格和日期。它按自然度、清晰度和词准确率给每行音频打分,出错时只修复那个词、不重新渲染整段。该工具兼容 ElevenLabs、OpenAI、Google 等 30 多家语音服务,免费起步、无需信用卡。

10月2日周五
  1. The Verge · AI53

    Suno 上线 Speech 功能,可同时生成语音与背景音乐

    AI 音乐平台 Suno 推出 Speech 功能并进入公开测试,可在网页和移动端根据脚本或提示词生成语音,并同时生成配套背景音乐。该功能提供 Simple 和 Advanced 两种模式,Advanced 可自定义脚本并调整 AI 语音性别、说话风格和生成多样性,语音最长约 8 分钟,背景音乐可用开关关闭。

10月1日周四
  1. X:Ethan Mollick (@emollick)36

    Ethan Mollick:AI 智能体将用语音/聊天替用户谈判,客服系统面临冲击

    Ethan Mollick 指出,各公司的客服智能体即将被 Dots & Muses 等 AI 智能体淹没,它们通过语音/聊天为用户争取更优价格。人们把这类工作交给智能体并省下钱的案例正在涌现,并将愈发病毒式传播。这些智能体可使用为人类搭建的渠道,忍受电话树、等待接通或被拒后反复重试。

9月30日周三
  1. _akhaliq48

    Audio8 ASR Infinite 流式语音识别模型 原生流式架构每秒解码 12.5 次 滚动 KV Cache 使内存和延迟保持恒定,即使 24/7 运行 每个时钟步输出一个文本 token(12.5 / 8.3 / 6.25 次决策/秒),平衡感知粒度与资源成本 huggingchat 的 ML 实习生搭建了 Gradio 工作流供试用:huggingface.co/spaces/akhali… huggingchat: huggingface.co/chat/ 模型:huggingface.co/Edge0/Audio8-…