Открытая модель распознавания речи Whisper от OpenAI работает и с русским языком: она переводит русскую речь в текст. Модель можно скачать и запустить у себя или вызвать через API OpenAI. Модель выдаёт текст; разметку спикеров, редактор и готовый документ добавляет программа или сервис вокруг неё.
Если вы ищете «Whisper онлайн», сначала решите, что нужно: запустить именно эту модель или получить готовую расшифровку разговора с подписями участников. Ниже разобраны оба пути и то, как сравнить их на своей записи.
Что такое Whisper?
OpenAI опубликовала Whisper в 2022 году. Код и веса модели распространяются по лицензии MIT, их можно скачать из репозитория OpenAI. Модель распознаёт речь на многих языках, включая русский, определяет язык записи, расставляет таймкоды и умеет переводить речь на английский. Перевода на другие языки в ней нет.
Whisper обрабатывает звук окнами по 30 секунд. Инструмент из репозитория OpenAI сам проходит длинный файл окнами и склеивает текст.
У модели есть версии разных размеров, от tiny до large. Чем крупнее версия, тем больше ей нужно памяти видеокарты и тем медленнее она работает на том же оборудовании. Как модель обучали, описано в исследовательской статье OpenAI.
Насколько точно Whisper распознаёт русский?
В статье OpenAI для русского языка на открытом наборе Common Voice 9 приведён WER 8,2% у версии large и 7,1% у large-v2. WER показывает долю ошибок в словах: замен, пропусков и вставок относительно эталонного текста.
Common Voice состоит из коротких фраз, которые добровольцы читают вслух. В интервью, на совещании или в телефонном разговоре есть шум, перебивания, фамилии и термины, и результат на таком материале будет другим. Замеры версии large-v3 OpenAI приводит в репозитории модели, на наборах Common Voice 15 и FLEURS.
Как читать такие числа и почему их нельзя сравнивать без методики, разобрано в статье «WER: как измеряют точность распознавания речи». Сравнение Whisper с другими моделями для русского языка есть в обзоре моделей распознавания, готовые сервисы собраны в статье о нейросетях для транскрибации.
Какие ограничения у Whisper?
У Whisper нет встроенной диаризации: модель выдаёт сплошной текст без пометок, кто говорит. Чтобы подписать реплики, нужен отдельный инструмент или сервис, который делает такую разметку. Что это за задача, описано в статье о диаризации.
На тишине и паузах модель иногда выдаёт связную фразу, которой в записи не было. Такие места проверяйте по звуку.
Имена, числа и термины тоже требуют проверки, особенно в тексте, который будете цитировать. Крупная версия ошибается реже, но эту проверку не отменяет. Результат на одном фрагменте не гарантирует такой же на всём архиве.
При запуске у себя остальная работа ложится на вас: читать файлы разных форматов, сохранять результаты, обрабатывать сбои и оформлять документ. Часть этого берут на себя готовые программы-оболочки.




