Перейти к основному контенту

Whisper на русском: что это и где его пределы

Что умеет Whisper на русском, как запустить его у себя или через API, где он ошибается и чем готовый сервис расшифровки отличается от голой модели.

Whisper на русском: что это и где его пределы

Открытая модель распознавания речи Whisper от OpenAI работает и с русским языком: она переводит русскую речь в текст. Модель можно скачать и запустить у себя или вызвать через API OpenAI. Модель выдаёт текст; разметку спикеров, редактор и готовый документ добавляет программа или сервис вокруг неё.

Если вы ищете «Whisper онлайн», сначала решите, что нужно: запустить именно эту модель или получить готовую расшифровку разговора с подписями участников. Ниже разобраны оба пути и то, как сравнить их на своей записи.

Что такое Whisper?

OpenAI опубликовала Whisper в 2022 году. Код и веса модели распространяются по лицензии MIT, их можно скачать из репозитория OpenAI. Модель распознаёт речь на многих языках, включая русский, определяет язык записи, расставляет таймкоды и умеет переводить речь на английский. Перевода на другие языки в ней нет.

Whisper обрабатывает звук окнами по 30 секунд. Инструмент из репозитория OpenAI сам проходит длинный файл окнами и склеивает текст.

У модели есть версии разных размеров, от tiny до large. Чем крупнее версия, тем больше ей нужно памяти видеокарты и тем медленнее она работает на том же оборудовании. Как модель обучали, описано в исследовательской статье OpenAI.

Насколько точно Whisper распознаёт русский?

В статье OpenAI для русского языка на открытом наборе Common Voice 9 приведён WER 8,2% у версии large и 7,1% у large-v2. WER показывает долю ошибок в словах: замен, пропусков и вставок относительно эталонного текста.

Common Voice состоит из коротких фраз, которые добровольцы читают вслух. В интервью, на совещании или в телефонном разговоре есть шум, перебивания, фамилии и термины, и результат на таком материале будет другим. Замеры версии large-v3 OpenAI приводит в репозитории модели, на наборах Common Voice 15 и FLEURS.

Как читать такие числа и почему их нельзя сравнивать без методики, разобрано в статье «WER: как измеряют точность распознавания речи». Сравнение Whisper с другими моделями для русского языка есть в обзоре моделей распознавания, готовые сервисы собраны в статье о нейросетях для транскрибации.

Какие ограничения у Whisper?

У Whisper нет встроенной диаризации: модель выдаёт сплошной текст без пометок, кто говорит. Чтобы подписать реплики, нужен отдельный инструмент или сервис, который делает такую разметку. Что это за задача, описано в статье о диаризации.

На тишине и паузах модель иногда выдаёт связную фразу, которой в записи не было. Такие места проверяйте по звуку.

Имена, числа и термины тоже требуют проверки, особенно в тексте, который будете цитировать. Крупная версия ошибается реже, но эту проверку не отменяет. Результат на одном фрагменте не гарантирует такой же на всём архиве.

При запуске у себя остальная работа ложится на вас: читать файлы разных форматов, сохранять результаты, обрабатывать сбои и оформлять документ. Часть этого берут на себя готовые программы-оболочки.

Сравните результат на своей записи

или

Где запустить Whisper без установки?

Транскрибация через Whisper без установки возможна через API OpenAI или в стороннем сервисе, который прямо указывает, что использует эту модель. Название поставщика модели не говорит, какая модель обработает ваш файл в конкретном продукте: проверяйте это в его описании.

ПутьЧто нужноЧто получаетеЧто проверить
Whisper у себяВеса модели, окружение запуска, видеокартаТекст и то, что добавит программа запускаРесурсы, работу с длинными файлами, разметку спикеров, оформление
API OpenAIДоступ к API и интеграция со своей программойРаспознанный текст в формате APIУсловия обработки данных, доступность, дальнейшую обработку текста
Готовый сервисБраузер и файл или ссылка на видеоТо, что предусмотрел сервис: текст, редактор, документы, обработкиФункции, стоимость, условия и качество на своём материале

Через API запись обрабатывает OpenAI на своих серверах. До выбора этого пути проверьте условия обработки данных, доступность API для вашей страны и договора. Если в записи есть личные или конфиденциальные сведения, выбирайте способ запуска с учётом правил, которые на вас распространяются.

Чем готовый сервис отличается от модели?

Модель отвечает за распознавание, сервис добавляет то, что нужно для работы с текстом. В «Войси» это выглядит так:

  • Разделение по спикерам входит в транскрибацию. Имена подставляются из текста записи, если участник представился, его представили или несколько раз назвали по имени. Подробнее на странице разделения по спикерам онлайн.
  • Аудио и видео до 20 ГБ и 20 часов загружаются целиком, без нарезки. Можно загрузить архив до 100 файлов, передать видео по ссылке или записать речь с микрофона в кабинете.
  • Текст проверяется в редакторе и скачивается в PDF, Word или текстовом файле, есть субтитры.
  • Саммари, перевод текста и субтитров на 100 языков, таймкоды, свой запрос и экспорт входят в стоимость транскрибации.
  • До запуска можно уточнить параметры «Язык записи», «Сколько говорящих» и «Тематика записи». По готовым расшифровкам работает поиск.

Список описывает рабочий путь пользователя. Сравнений точности с Whisper здесь нет: качество распознавания проверяйте на своём файле.

Как сравнить варианты на своей записи?

  1. Возьмите один исходный файл, похожий на ваши задачи, и используйте его для всех вариантов без изменений.
  2. Запишите версию модели и настройки для запуска у себя или через API; для сервиса запишите выбранную обработку и параметры.
  3. Сохраните результаты до правок и сравните их с записью или эталоном по одинаковым правилам.
  4. Отдельно проверьте имена, термины, числа, пропуски речи и лишние фразы на паузах.
  5. Пройдите следующий рабочий шаг: найдите цитату, исправьте текст, скачайте документ или субтитры.

Если нужен именно Whisper, проверьте, что выбранный инструмент его использует. Если нужен готовый документ, сравнивайте ещё редактор, подписи участников и экспорт.

Частые вопросы о Whisper

Можно ли пользоваться Whisper бесплатно?

Код и веса распространяются по лицензии MIT, их можно скачать и запускать у себя без оплаты модели. Оборудование, настройка и поддержка остаются за вами. У API и сторонних сервисов свои тарифы.

Где запустить Whisper онлайн?

Через API OpenAI или в стороннем сервисе, который прямо указывает, что использует Whisper. Для запуска у себя нужно установить окружение и скачать веса модели.

Умеет ли Whisper разделять спикеров?

Встроенной диаризации у Whisper нет. Для подписей говорящих нужен отдельный инструмент или сервис, который делает такую разметку.

Использует ли «Войси» Whisper?

Состав моделей «Войси» в этой статье не раскрывается. На выходе вы получаете расшифровку с разделением по спикерам и именами из текста записи, редактор, экспорт, саммари, перевод и другие обработки. Качество проверьте на своём файле.

Как сравнить «Войси» с Whisper на своей записи?

Пропустите один и тот же файл через оба варианта и сравните результаты до правок с одним эталоном. Отдельно проверьте спикеров и оформление документа. В веб-кабинете «Войси» первый файл бесплатно.

Сравните результат на своей записи

или

Проверьте весь путь до документа

Загрузите файл, проверьте текст и спикеров, скачайте результат. Первый файл — за наш счёт.