// материалы · распознавание речи

Что такое распознавание речи (ASR)

Automatic speech recognition, speech-to-text — преобразование речи в текст. На входе аудио: файл или живой поток из телефонной линии, на выходе текст с разметкой, с которым уже можно работать.

Обновлено 8 сентября 2026 г.

Что получает и что возвращает

Распознавание речи (ASR) принимает аудио и возвращает текст. Аудио приходит либо файлом — запись разговора, лекции, голосового сообщения, — либо потоком, пока человек ещё говорит. Качество результата зависит от входа: частоты дискретизации (телефонная линия — 8000 Гц, запись с микрофона — обычно 16000 или 24000 Гц), кодека и шума.

Помимо самого текста современные системы возвращают разметку:

Текст
Расшифровка с пунктуацией и заглавными буквами, готовая для поиска, аналитики и показа человеку.
Сегменты с таймингами
Начало и конец каждого фрагмента, чтобы перейти к нужному месту записи или сопоставить текст со звуком.
Уверенность
Оценка модели для каждого фрагмента: низкая уверенность — повод отправить место на проверку человеку.

Как это устроено

Современное распознавание — нейросетевые модели, которые из звуковой волны получают последовательность слов, а затем восстанавливают пунктуацию и регистр, чтобы текст читался как написанный. В потоковом режиме система выдаёт промежуточные гипотезы по ходу речи и уточняет их, а окончательный результат фиксирует, когда собеседник делает паузу.

Файл или поток

Режим файла подходит, когда запись уже есть: её отправляют целиком и получают расшифровку с сегментами, таймингами и уверенностью. Так обрабатывают записи звонков для контроля качества, архивы встреч и голосовые сообщения.

Режим потока нужен для диалога: голосовой агент, IVR, голосовой ввод. Аудио уходит фрагментами по двустороннему каналу, промежуточные гипотезы приходят, пока человек говорит, финальный текст — по паузе. Без этого агент отвечал бы только после того, как запись закончилась и была обработана.

Где применяют

  • Контакт-центры: расшифровка звонков для контроля качества, поиск по разговорам, понимание речи в голосовых агентах.
  • Телефония и IVR: маршрутизация по сказанному, подтверждение данных голосом.
  • Записи встреч и лекций: текст с таймингами для навигации по записи.
  • Голосовой ввод в приложениях и устройствах.

Как это реализовано в Neuro ASR

Neuro ASR — собственная модель распознавания русской речи Neuro.net. Она принимает wav и pcm на 8000, 16000 и 24000 Гц, телефонный звук наравне со студийной записью, и возвращает текст с пунктуацией, сегменты с таймингами и уверенность по каждому фрагменту. Файл отправляется по REST, поток идёт по WebSocket с промежуточными гипотезами и финалом по паузе. Услышать поток в работе можно в демо голосового агента: распознавание, ответ и синтез в нём работают в одном потоке. Минута распознавания тарифицируется посекундно.