Модель распознаёт то, что слышит. Шум, эхо и перекрывающиеся реплики съедают точность сильнее, чем разница между сервисами: на чистой записи Whisper и SpeechKit дают выше 95%, на шумной — теряют окончания и путают говорящих.
Если запись только предстоит, потратьте минуту на подготовку: это дешевле, чем потом вычитывать десять страниц текста.
Выбор модели под задачу
Для русского языка выбор невелик и он хороший: Whisper от OpenAI, ElevenLabs Scribe и Яндекс SpeechKit. Все три дают сопоставимую точность, различия — в цене, приватности и способе запуска.
Оценка редакции на одинаковых записях: интервью, лекция, телефонный звонок.
Разделение говорящих
Для интервью и встреч важно не только что сказано, но и кем. Базовый Whisper этого не умеет — нужен WhisperX или облачный сервис с диаризацией.
Практический совет: если участников больше трёх, разметка почти всегда требует ручной правки. Заложите на это время.
Хитрость: попросите участников в начале записи назвать себя. Это резко повышает качество автоматической разметки — модель привязывает голос к имени.
Вычитка и экспорт
Термины и имена — самое слабое место любой модели: проверьте их в первую очередь.
Цифры и даты — распознаются хорошо, но ошибка здесь дороже всего.
Пунктуация — расставляется автоматически, но длинные предложения стоит разбить.
Формат — для субтитров нужен SRT, для протокола DOCX, для дальнейшей обработки обычный текст.
Расшифровать запись без VPN
≈1 ₽ за минуту
Модель OpenAI Whisper, WhisperX и ещё 54 сервисов на одном балансе.
Без VPN — модели открываются с российского адреса
Оплата картой РФ, для юрлиц счёт и закрывающие
Старт без карты: стартового баланса хватает на первые задачи