← 返回这篇简报转录准确率能否验证“语音 Agent 可以取代接待员”的承诺?

语音代理测试:在处理真实通话前完成评估

Deepgram Learn ·

何塞·尼古拉斯·弗朗西斯科(Jose Nicholas Francisco)描述了如何使用涵盖九种场景的测试套件对语音代理进行测试,对整段对话进行评分,覆盖各类失败情形,并在提示词修改后重新运行该测试套件。 阅读 4 条观点,查看支持证据与原始来源。

理解这篇

4 个要点

综合解读

  1. 始于一个九场景测试套件

    弗朗西斯科将语音代理测试描述为始于一个包含九种场景的测试套件及相应的通过标准,该标准对整段对话进行整体评分。

    支持这项说法 1

    语音代理测试始于一个包含九种场景的测试套件及相应的通过标准,该标准对整段对话进行整体评分。

    Jose Nicholas Francisco · 段落 1

    原始摘录
    Voice agent testing starts with a nine-scenario suite and pass criteria that score a conversation as a whole.
    上下文

    上线就绪与否,取决于代理能否在真实通话中顺利完成任务。每个场景仅需一段录音及一份书面终态说明,即可在用户实际拨打前得出明确结论。提示词修改后需重新运行该测试套件。

    原始上下文

    Launch readiness comes down to whether the agent finishes the job on a real call. One recording per scenario and a written end state give you the answer before your callers do. Re-run the suite after prompt edits.

    回到原文语境 →
  2. 对整通电话评分,而非仅对转录文本评分

    弗朗西斯科指出,需对整通电话进行评分:记录代理何时发言、其作出了哪些承诺,以及呼叫者是否最终获得了他们所寻求的结果。基于词级(word-level)的评分无法反映打断、确认循环,或对错误订单号所作的自信复述。

    支持这项说法 1

    测试意味着对整通电话进行评分:记录代理的发言时机、其所作承诺,以及呼叫者是否带着预期目标离开通话。词错误率(WER)仅衡量转录文本,因此任何基于词级的评分都无法揭示代理是否打断了呼叫者、是否陷入确认循环;对错误订单号所作的自信复述亦无法被该类评分捕获。

    Jose Nicholas Francisco · 段落 2

    原始摘录
    Testing means scoring the whole call. You record when the agent spoke, what it committed to, and whether the caller left with what they came for. WER measures a transcript , so no word-level score tells you whether the agent interrupted the caller or looped on a confirmation. A confident read-back of the wrong order number also falls outside that score.
    回到原文语境 →
  3. 覆盖真实世界的故障模式

    该测试套件覆盖了中断、静音、口音、愤怒情绪及错拨号码等情形——而这些正是典型“理想路径”(happy-path)演示所忽略的真实世界故障模式。

    支持这项说法 1

    该测试套件覆盖了中断、静音、口音、愤怒情绪及错拨号码等情形——而这些正是典型“理想路径”(happy-path)演示所忽略的情形。

    Jose Nicholas Francisco · 段落 6

    原始摘录
    The suite covers interruptions, silence, accents, anger, and wrong numbers that happy-path demos miss.
    回到原文语境 →
  4. 每次提示词修改后均需重新运行完整测试套件

    弗朗西斯科指出,细微的提示词修改可能引发显著且依赖于模型的行为变化,因此每次提示词修改后均需重新运行全部测试套件。

    支持这项说法 1

    细微的提示词修改可能引发显著且依赖于模型的行为变化,因此每次提示词修改后均需重新运行该测试套件。

    Jose Nicholas Francisco · 段落 8

    原始摘录
    Small prompt edits can produce large, model-dependent behavior changes, so every prompt edit re-runs the suite.
    回到原文语境 →

关键段落4

带明确归属与语境的原文片段。打开原始文本核查出处。

智能体验证工作流

始于一个九场景测试套件

译文

语音代理测试始于一个包含九种场景的测试套件及相应的通过标准,该标准对整段对话进行整体评分。

原始摘录
Voice agent testing starts with a nine-scenario suite and pass criteria that score a conversation as a whole.
上下文

上线就绪与否,取决于代理能否在真实通话中顺利完成任务。每个场景仅需一段录音及一份书面终态说明,即可在用户实际拨打前得出明确结论。提示词修改后需重新运行该测试套件。

原始上下文

Launch readiness comes down to whether the agent finishes the job on a real call. One recording per scenario and a written end state give you the answer before your callers do. Re-run the suite after prompt edits.

智能体验证工作流

覆盖真实世界的故障模式

译文

该测试套件覆盖了中断、静音、口音、愤怒情绪及错拨号码等情形——而这些正是典型“理想路径”(happy-path)演示所忽略的情形。

原始摘录
The suite covers interruptions, silence, accents, anger, and wrong numbers that happy-path demos miss.

← 返回:覆盖困难场景,提示词改动后重测

智能体验证工作流

对整通电话评分,而非仅对转录文本评分

译文

测试意味着对整通电话进行评分:记录代理的发言时机、其所作承诺,以及呼叫者是否带着预期目标离开通话。词错误率(WER)仅衡量转录文本,因此任何基于词级的评分都无法揭示代理是否打断了呼叫者、是否陷入确认循环;对错误订单号所作的自信复述亦无法被该类评分捕获。

原始摘录
Testing means scoring the whole call. You record when the agent spoke, what it committed to, and whether the caller left with what they came for. WER measures a transcript , so no word-level score tells you whether the agent interrupted the caller or looped on a confirmation. A confident read-back of the wrong order number also falls outside that score.
智能体验证工作流

每次提示词修改后均需重新运行完整测试套件

译文

细微的提示词修改可能引发显著且依赖于模型的行为变化,因此每次提示词修改后均需重新运行该测试套件。

原始摘录
Small prompt edits can produce large, model-dependent behavior changes, so every prompt edit re-runs the suite.

← 返回:覆盖困难场景,提示词改动后重测

来源与研究方法

这些观点均关联原始来源。转述已明确标注,不作为逐字原话展示。

打开转录或来源材料 (在新标签页中打开)报告问题

继续了解这些人物的观点

相关研究

继续研究相关话题

以下资料涉及本文的话题;讨论相同话题不代表观点一致。