// продукт · распознавание речи

Распознавание речи

Текст из телефонных звонков и записей: файл целиком по REST или живой поток по WebSocket с промежуточными гипотезами.

neuro_asr_v2

Собственная модель Neuro.net

Направление
audio → text
Форматы
wav · pcm
Частоты
8000 · 16000 · 24000 Гц
Режимы
REST · WebSocket
Язык
русский

Neuro ASR — модель распознавания русской речи neuro_asr_v2. Она принимает аудио в wav или pcm на 8000, 16000 или 24000 Гц и возвращает текст с пунктуацией, сегменты с таймингами и уверенность модели по каждому фрагменту.

// audio → text

Два режима

  • REST

    Файл

    Отправьте запись целиком и получите расшифровку с сегментами, таймингами и уверенностью. Для записей разговоров, контроля качества и архивов.

  • WS

    Поток

    Двусторонний канал для живого диалога: промежуточные гипотезы по ходу речи, финал по паузе. Для голосовых агентов и IVR.

wav · pcm · 8000 / 16000 / 24000 Гц

Руки держат белые накладные наушники над светлым столом

Что возвращает модель

Где применяют

// доступ

Как получить доступ

Доступ к API — на тарифе Pro: 16 600 минут распознавания в месяц включено, дальше 0,30 ₽ за минуту, тарификация посекундная, 20 одновременных запросов. Для выделенных лимитов, SLA и установки on-premise — Enterprise по договору.

// данные

Где обрабатывается аудио

В облаке Neuro.net на серверах в России или в вашем контуре без доступа в интернет. Аудио и расшифровки живут в оперативной памяти на время запроса, на диск не пишутся и в обучение моделей не попадают.