Voice Arena 推出 Sales Agent Eval:让 AI 语音销售智能体与人类销售员比拼真实营收
Voice Arena 推出 Sales Agent Eval,邀请社区就这一真实场景销售对话智能体基准的方法论反馈。据其介绍,这是首个按真实销售营收对语音智能体排名并与人类基线对比的实时基准:一家 Voice Arena 旗下公司在美国销售在线课程,Meta 广告线索在 K 个商业 AI 语音智能体与三名人类销售员之间随机分配,按产生营收排名,每日结算更新榜单。
推出 Sales Agent Eval,由 @voicearena_ai 呈现
我们邀请社区就一个面向真实场景的销售对话智能体基准测试方法论提供反馈。据我们所知,这是首个根据真实销售产生的收入、将语音智能体与人类基线进行排名的实时基准测试。
概述
我们在一场真实实验中评估语音销售智能体,实验涉及真实客户和真实资金。一家在 Voice Arena 旗下注册的公司在美国销售一门在线课程。通过 Meta 广告获取的潜在客户被随机分配给 K 个商用 AI 语音智能体和三名人类销售人员。参与者按其产生的收入进行排名,排行榜实时更新,并在每天结束时定榜。
产品
参与者销售的是一门关于职场 AI 工具的自学在线课程,内容涵盖 ChatGPT、Excel 和生产力工具。我们选择这一品类,是因为它受众广泛、当前需求旺盛且制作成本相对较低。
在线课程可以在一次通话中以冲动消费的价格售出,通过数字化交付无需物流,且需要真正的异议处理能力。课程电话销售也是一个成熟的行业,因此人类基线反映的是真实实践。所有参与者在完全相同的报价规则下销售该课程(标价、固定的折扣阶梯和退款政策),这些规则在整个赛季期间保持不变。
参与者
参与者分为两类:K 个 AI 智能体和三名人类销售人员。AI 智能体是被评估的系统,而人类则提供基线。
AI 参与者是商用供应商的技术栈。要被纳入,供应商必须支持美式英语外呼、允许在通话过程中通过工具调用发送支付链接、公开单次通话成本和录音,并允许其配置在整个赛季期间被固定。我们基于同一份销售简报、知识库、工具集和合规规则集来配置每个智能体。只有语音、模型和延迟参数等平台特定设置会被调整,且每个智能体都获得相等的调优预算,即在单独的潜在客户池上进行试点通话。随后配置会被冻结并生成快照(模型、语音、提示词哈希和平台版本),任何更改都会创建一个新条目,并从零个潜在客户重新开始。
人类参与者是三名有电话销售经验的销售人员。他们获得与 AI 智能体相同的材料和报价规则,领取底薪加提成,并且在赛季期间看不到排行榜。每位销售人员单独报告成绩,三人也会作为一个合并的人类整体结果一起报告。
分配
每天收到的所有潜在客户都会在 AI 智能体和三名人类销售人员之间随机分配。每位参与者每天获得相同数量的新潜在客户,上限受人类拨打能力限制,约为每人 25 个新潜在客户。由于所有人都从同一个每日客户池中获取,每位参与者获得的潜在客户质量相同,且第一版不计入获取这些客户的广告成本。
在美国拨打电话
每位线索都在线索表单上明确给予事先书面同意,同意就课程相关事宜接受电话联系,包括由 AI 语音拨打。美国联邦通信委员会(FCC)于 2024 年确认,AI 生成的语音属于《电话消费者保护法》(TCPA)所定义的“人工语音”,因此 AI 拨打电话需要被叫方事先同意。我们从每位线索处收集相同的同意,因此 AI 与人类参与者使用完全相同的线索池。
所有参与者仅在线索所在时区的上午 8 点至晚上 9 点之间拨打电话;若州法律要求更窄的时间窗口,则遵循该窗口。每通电话都以品牌名称和录音提示开场,因为包括加利福尼亚州、佛罗里达州和宾夕法尼亚州在内的多个州要求通话双方都同意录音。AI 参与者还会说明拨打电话的是 AI。付款链接和后续跟进通过共享的注册号码以短信(SMS)发送,且在任一渠道退订后,所有参与者都会停止联系。
成本核算
第一版(Version 1)按总收入排名,但我们也衡量每位参与者的运营成本,以便与收入对照查看。对于 AI 参与者,运营成本是运行该智能体所产生的全部计费项目:语音识别、语言模型、语音合成、平台费用、电话时长(包括失败尝试和重拨)以及短信。供应商用量按赛季开始时的公开牌价快照计算,赛季中途的任何价格变动都会记录但不计入。对于人类参与者,运营成本是整个赛季每位销售人员的薪资和佣金。每条线索的运营成本等于总运营成本除以分配的线索数量。广告以及一次性设置和调优成本不计入其中。
排名与排行榜
参与者按总收入排名,这种比较是公平的,因为每个人每天获得的线索数量和质量都相同。收入是指每条线索首次购买所支付的金额,不含销售税。第一版不扣除退款和拒付,因此一笔销售在成交那一刻即被计入,无论之后发生什么。运营成本和扣除运营成本后的收入会与总收入并列展示,但不影响排名。
如果购买发生在线索分配后的 7 天内,则该笔购买有效,因此一条线索的结果在 7 天后即为最终结果。排行榜在每天结束时确定,在每位参与者的 500 条线索都超过 7 天期限之前,排名仍为暂定状态。
每个赛季包含 6 周的线索分配期,随后是 7 天的结算期,结算期结束后计算官方排名。
参与进来
我们希望这一方法论能由构建和购买销售智能体的人们共同塑造。请通过下方链接访问 Voice Arena 并填写申请表,以便:
- 帮助塑造方法论
- 阅读完整的详细版本
- 提交您的智能体以供评估
来源:shobhitbanga · x.com