Что вы подключаете
Две модели за одним ключом доступа: Neuro TTS превращает текст в аудио, Neuro ASR — аудио в текст. Обе работают с wav и pcm на 8000, 16000 и 24000 Гц, обе доступны по REST и по WebSocket, обе выполняются в облаке Neuro.net в России или в вашем контуре. Спецификация запросов передаётся вместе с ключом.
Порядок работ
- 01
Выберите размещение
Облако Neuro.net: ключ и старт в тот же день, обновления моделей и мониторинг на стороне сервиса. Свой контур: те же модели контейнерами внутри периметра, работа без доступа в интернет, ваши правила хранения и логирования.
- 02
Получите ключ и проверьте звук
Синтез можно послушать в Playground на главной без регистрации. Доступ к API открывается на тарифе Pro, выделенные лимиты и on-premise — по договору Enterprise. SDK нет: подойдёт любой язык с HTTP-клиентом.
- 03
Подключите синтез
Один POST-запрос с текстом, идентификатором голоса и форматом вывода возвращает поток аудио. Читайте поток по мере поступления и отдавайте его дальше — в телефонную станцию или в плеер, не дожидаясь конца генерации. Пример запроса на cURL, Python и Node.js есть на странице синтеза.
- 04
Подключите распознавание
Для записей — режим файла по REST: отправьте запись целиком, получите текст с сегментами, таймингами и уверенностью. Для диалога — поток по WebSocket: отправляйте аудио фрагментами, принимайте промежуточные гипотезы и финал по паузе.
- 05
Подберите формат и частоту
Телефония: pcm 8000 Гц в обе стороны, без пересемплирования между станцией и моделями. Приложения и озвучивание: 16000 или 24000 Гц. wav — когда нужен файл с заголовком, pcm — когда нужен сырой поток.
- 06
Посчитайте нагрузку
Concurrency — число одновременных запросов без очереди: на Pro включено 10 для синтеза и 20 для распознавания, каждый дополнительный поток стоит 1 000 ₽ в месяц. Минуты аудио тарифицируются посекундно: оцените суммарную длительность реплик и записей, а не число вызовов.
Перед выходом в прод
- Измерьте задержку до первого фрагмента аудио и до финального текста на своей сети — это ваши числа, а не общие.
- Обрабатывайте обрыв потока и ошибки ответа как штатные события: повтор запроса для файла, переподключение для потока.
- Не храните аудио дольше, чем нужно продукту: модели держат его только в оперативной памяти на время запроса.
- Для персональных данных оформите поручение на обработку по 152-ФЗ и NDA в договоре Enterprise.
- Запланируйте пиковую нагрузку заранее: дополнительный concurrency подключается по тарифу или договору.
Что дальше
Послушайте синтез в Playground, поговорите с голосовым агентом, в котором распознавание и синтез работают в одном потоке, и выберите вариант подключения на странице тарифов или через заявку Enterprise.