// продукт · распознавание речи
Распознавание речи
Текст из телефонных звонков и записей: файл целиком по REST или живой поток по WebSocket с промежуточными гипотезами.
neuro_asr_v2
Собственная модель Neuro.net
- Направление
- audio → text
- Форматы
- wav · pcm
- Частоты
- 8000 · 16000 · 24000 Гц
- Режимы
- REST · WebSocket
- Язык
- русский
Neuro ASR — модель распознавания русской речи neuro_asr_v2. Она принимает аудио в wav или pcm на 8000, 16000 или 24000 Гц и возвращает текст с пунктуацией, сегменты с таймингами и уверенность модели по каждому фрагменту.
// audio → text
Два режима
- REST
Файл
Отправьте запись целиком и получите расшифровку с сегментами, таймингами и уверенностью. Для записей разговоров, контроля качества и архивов.
- WS
Поток
Двусторонний канал для живого диалога: промежуточные гипотезы по ходу речи, финал по паузе. Для голосовых агентов и IVR.
wav · pcm · 8000 / 16000 / 24000 Гц

Что возвращает модель
Текст с пунктуацией
Знаки препинания и заглавные буквы ставит модель, постобработка на вашей стороне не нужна.
Сегменты с таймингами
Начало и конец каждого фрагмента, чтобы перейти к нужному месту записи.
Уверенность по фрагменту
Оценка модели для каждого сегмента: сомнительные места можно отправить на проверку человеку.
Телефонный звук 8 кГц
Записи со станции подаются как есть, наравне с записями 16 и 24 кГц. Пересемплировать не нужно.
Где применяют
// контакт-центр
Расшифровка разговоров
Записи звонков в текст для контроля качества и поиска по разговорам: сегменты и уверенность показывают, что слушать целиком.
Распознавание и синтез речи в контакт-центре// диалог
Голосовые агенты и IVR
Поток по WebSocket отдаёт промежуточные гипотезы, пока собеседник говорит, и финал по паузе: агент отвечает без ожидания конца записи.
Живой пример: агент на главной// интеграция
Подключение к продукту
Ключ доступа, REST для файлов, WebSocket для потока. Без SDK: любой язык, у которого есть HTTP-клиент.
Как подключить синтез и распознавание речи
// доступ
Как получить доступ
Доступ к API — на тарифе Pro: 16 600 минут распознавания в месяц включено, дальше 0,30 ₽ за минуту, тарификация посекундная, 20 одновременных запросов. Для выделенных лимитов, SLA и установки on-premise — Enterprise по договору.
// данные
Где обрабатывается аудио
В облаке Neuro.net на серверах в России или в вашем контуре без доступа в интернет. Аудио и расшифровки живут в оперативной памяти на время запроса, на диск не пишутся и в обучение моделей не попадают.