话题 / 模型评估

观点转述

缺乏类别级分析时,WER 可能产生误导

当错误类别不相关,或将非流式 ASR 模型与流式模型进行比较时,词错误率可能会产生误导。作者表示,许多基准测试未能区分流式与非流式使用场景。

观点背后的信息

译文仅辅助阅读;核查观点请以原始摘录为准。

Cartesia | 语音 AI 模型选型指南

如果你关注的是错误或不相关的错误类别,或者将非流式 ASR 模型(其本身更容易做到准确)与流式 ASR 模型进行对比,那么 STT/ASR 的词错误率(WER)就是一个具有误导性的指标。遗憾的是,许多基准测试并未区分 ASR 的流式与非流式使用场景。

原始摘录
Word Error Rate (WER) for STT/ASR is a misleading metric if you’re looking at the wrong or irrelevant classes of errors. Or if you’re comparing a non-streaming ASR model (which is inherently easier to be accurate on) with a streaming ASR model. Unfortunately many benchmarks do not distinguish between ASR streaming vs non-streaming use cases.