Распознавание речи онлайн

Нейросеть переводит русскую речь из любого файла в текст.
Бесплатно, без регистрации, файл удаляется сразу.

Перетащите файл сюда или
MP3, WAV, M4A, OGG, видео тоже подойдёт · до 30 минут и 60 МБ

Как работает распознавание речи на этой странице

  1. Вы загружаете файл. Аудио или видео до 30 минут и 60 МБ. Формат не важен: mp3, m4a, ogg, wav, flac, mp4 и другие принимаются напрямую.
  2. Сервер распознаёт речь. Нейросетевая модель, настроенная на русский язык, превращает звук в текст и расставляет знаки препинания. Обработка идёт на наших собственных серверах, без сторонних облачных API.
  3. Вы забираете текст. Результат появляется на странице: скопируйте, скачайте .txt или сохраните ссылку, она работает 7 дней. Аудио удаляется сразу.

Чем нейросетевое распознавание отличается от старого

Ещё несколько лет назад «распознавание речи» означало диктовку: говорить чётко, по одному слову, без шума, и всё равно править каждую строчку. Современные нейросетевые модели обучены на десятках тысяч часов реальной речи и понимают обычный разговор: с паузами, оговорками, разной скоростью, региональным произношением. Они же расставляют знаки препинания и делят текст на предложения, чего распознавание прошлого поколения не умело вовсе.

На практике это значит, что голосовое сообщение, запись с диктофона или созвон распознаются близко к дословному без подготовки. Ошибки остаются там, где не разобрал бы и человек: сильный шум, эхо, несколько людей одновременно, невнятная речь. Точность на чистой записи обычно выше 90 процентов слов, на шумной может упасть заметно ниже.

Сервис настроен на русскую речь. Иностранная речь целиком распознаётся плохо, отдельные английские слова и термины внутри русского текста обычно в порядке. Разделения по говорящим и таймкодов нет: результат — сплошной текст.

Что можно распознать

Почему бесплатно и без регистрации: сервис работает на тех же серверах, что и Flockit, продукт для записи и расшифровки встреч. Короткие файлы обрабатываются в свободные мощности, поэтому ограничения только технические: 30 минут на файл и несколько файлов в час. Для длинных записей, разделения по говорящим, протоколов и интеграций есть Flockit.

Вопросы и ответы

Какая нейросеть используется?

Модель распознавания речи, обученная на русской речи, работает на наших серверах. Файлы не передаются во внешние облачные сервисы распознавания.

Можно ли диктовать в микрофон прямо на странице?

Нет, только загрузить файл. Запишите речь в диктофон телефона и загрузите запись: получится точнее, чем диктовка в реальном времени.

Есть ли API?

Нет, сервис работает только через страницу. Для интеграций есть Flockit.

Сколько стоит?

Ничего. Тарифов и подписок нет, ограничения технические: до 30 минут и 60 МБ на файл, несколько файлов в час с одного устройства.

Что с персональными данными?

Их не собираем: нет регистрации и аккаунтов. Аудио удаляется сразу после распознавания, текст хранится 7 дней только по ссылке результата.