WER (Word Error Rate, доля ошибок в словах) показывает, сколько ошибок допустило распознавание речи по сравнению с эталонным текстом. Замены, пропуски и вставки слов складывают и делят на число слов в эталоне. Чем ниже WER на одних и тех же записях при одной методике, тем меньше ошибок.
Значение WER описывает конкретную проверку: набор записей, версию системы и правила сравнения текста. Результат на студийной начитке не переносится на разговор с шумом и перебиваниями, поэтому сервис для интервью, лекций или звонков проверяют на похожем материале.
Как считают WER?
Формула: WER = (S + D + I) / N. Чтобы получить проценты, результат умножают на 100.
- S (substitutions), замены: вместо произнесённого слова в расшифровке стоит другое.
- D (deletions), пропуски: слова из эталона нет в расшифровке.
- I (insertions), вставки: в расшифровке появилось слово, которого нет в эталоне.
- N: число слов в эталоне.
Перед подсчётом тексты выравнивают: ищут сопоставление с наименьшим числом операций. Иначе одно пропущенное слово в начале сдвинуло бы все остальные, и каждое из них засчиталось бы ошибкой.
WER может быть больше 100%: если вставок много, ошибок окажется больше, чем слов в эталоне. Поэтому WER нельзя всегда читать как долю неверно распознанных слов: метрика учитывает и лишний текст.
Как выглядит расчёт на примере?
Эталон: «Мы отправим готовый отчёт завтра утром». Расшифровка: «Мы отправим отчёт сегодня утром коллегам». В эталоне 6 слов.
| Эталон | Расшифровка | Результат сопоставления |
|---|---|---|
| Мы отправим | Мы отправим | Совпадение |
| готовый | слова нет | Пропуск |
| отчёт | отчёт | Совпадение |
| завтра | сегодня | Замена |
| утром | утром | Совпадение |
| слова нет | коллегам | Вставка |
Одна замена, один пропуск и одна вставка: (1 + 1 + 1) / 6 = 0,5, то есть WER 50%. Пример учебный: он показывает формулу и ничего не говорит о качестве конкретного сервиса.
В формуле все ошибки весят одинаково, хотя последствия у них разные. Замена «завтра» на «сегодня» меняет срок, пропуск «готовый» влияет на смысл меньше. Поэтому, кроме числа, читайте сами ошибки.
Почему подготовка текста меняет результат?
Перед подсчётом договоритесь, что считать совпадением. Обычно тексты приводят к одному регистру и убирают пунктуацию. Числа приводят к одной записи: без такого правила «15» и «пятнадцать» засчитаются как замена. Отдельно решают, как быть с «е» и «ё», сокращениями, дефисами и словами-паразитами.
Если эталон очищен от запинок, а расшифровка дословная, часть «ошибок» окажется разницей в подготовке текста. Эталон и проверяемый текст должны соответствовать одной задаче.
Запишите правила до сравнения и примените их ко всем вариантам одинаково. Если поменять нормализацию для одного результата, числа перестанут описывать одну и ту же проверку.
Почему проценты разных сервисов нельзя сравнивать напрямую?
За процентом может стоять WER на открытом наборе записей, ошибка по символам, результат внутреннего теста или общая оценка точности. Сравнивать такие числа можно, только если известны метрика, записи, эталон и правила подсчёта.
Даже у одной модели число зависит от версии и набора данных. В статье OpenAI о модели Whisper для русского языка на наборе Common Voice 9 приведён WER 8,2% у версии large и 7,1% у large-v2. На другом наборе записей те же модели покажут другие значения.
Если выбираете сервис, дайте всем вариантам один и тот же файл и сравните результаты с одним эталоном. Остальные критерии выбора собраны в материале о том, как выбрать сервис транскрибации.




