// материалы · интеграция

Как подключить синтез и распознавание речи к продукту

Neuro TTS и Neuro ASR подключаются по HTTP: ключ доступа, REST для запросов целиком и WebSocket для потока. Ниже — порядок работ от выбора размещения до выхода в прод, без деталей внутреннего устройства моделей.

Обновлено 8 сентября 2026 г.

Что вы подключаете

Две модели за одним ключом доступа: Neuro TTS превращает текст в аудио, Neuro ASR — аудио в текст. Обе работают с wav и pcm на 8000, 16000 и 24000 Гц, обе доступны по REST и по WebSocket, обе выполняются в облаке Neuro.net в России или в вашем контуре. Спецификация запросов передаётся вместе с ключом.

Порядок работ

  1. 01

    Выберите размещение

    Облако Neuro.net: ключ и старт в тот же день, обновления моделей и мониторинг на стороне сервиса. Свой контур: те же модели контейнерами внутри периметра, работа без доступа в интернет, ваши правила хранения и логирования.

  2. 02

    Получите ключ и проверьте звук

    Синтез можно послушать в Playground на главной без регистрации. Доступ к API открывается на тарифе Pro, выделенные лимиты и on-premise — по договору Enterprise. SDK нет: подойдёт любой язык с HTTP-клиентом.

  3. 03

    Подключите синтез

    Один POST-запрос с текстом, идентификатором голоса и форматом вывода возвращает поток аудио. Читайте поток по мере поступления и отдавайте его дальше — в телефонную станцию или в плеер, не дожидаясь конца генерации. Пример запроса на cURL, Python и Node.js есть на странице синтеза.

  4. 04

    Подключите распознавание

    Для записей — режим файла по REST: отправьте запись целиком, получите текст с сегментами, таймингами и уверенностью. Для диалога — поток по WebSocket: отправляйте аудио фрагментами, принимайте промежуточные гипотезы и финал по паузе.

  5. 05

    Подберите формат и частоту

    Телефония: pcm 8000 Гц в обе стороны, без пересемплирования между станцией и моделями. Приложения и озвучивание: 16000 или 24000 Гц. wav — когда нужен файл с заголовком, pcm — когда нужен сырой поток.

  6. 06

    Посчитайте нагрузку

    Concurrency — число одновременных запросов без очереди: на Pro включено 10 для синтеза и 20 для распознавания, каждый дополнительный поток стоит 1 000 ₽ в месяц. Минуты аудио тарифицируются посекундно: оцените суммарную длительность реплик и записей, а не число вызовов.

Перед выходом в прод

  • Измерьте задержку до первого фрагмента аудио и до финального текста на своей сети — это ваши числа, а не общие.
  • Обрабатывайте обрыв потока и ошибки ответа как штатные события: повтор запроса для файла, переподключение для потока.
  • Не храните аудио дольше, чем нужно продукту: модели держат его только в оперативной памяти на время запроса.
  • Для персональных данных оформите поручение на обработку по 152-ФЗ и NDA в договоре Enterprise.
  • Запланируйте пиковую нагрузку заранее: дополнительный concurrency подключается по тарифу или договору.

Что дальше

Послушайте синтез в Playground, поговорите с голосовым агентом, в котором распознавание и синтез работают в одном потоке, и выберите вариант подключения на странице тарифов или через заявку Enterprise.