// продукт · синтез речи

Синтез речи

Голос для агентов, IVR и озвучивания. Телефонные 8 кГц из коробки, поток с первого фрагмента.

neuro_tts_v2

Собственная модель Neuro.net

Направление
text → audio
Форматы
wav · pcm
Частоты
8000 · 16000 · 24000 Гц
Режимы
REST · WebSocket

Neuro TTS — модель синтеза русской речи neuro_tts_v2. Один POST-запрос с текстом и идентификатором голоса возвращает поток аудио в wav или pcm на 8000, 16000 или 24000 Гц; первые фрагменты приходят до окончания генерации.

Что умеет модель

Запрос синтеза

POST возвращает поток аудио в выбранном формате. Ключ в заголовке, текст и модель в теле.

curl -X POST "$NEURO_API_ENDPOINT/v1/text-to-speech/edsel/stream?output_format=pcm_24000" \
-H "xi-api-key: $NEURO_API_KEY" \
-H "Content-Type: application/json" \
-d '{"text": "Привет! Это новая модель синтеза речи от Neuro…", "model_id": "neuro_tts_v2"}' \
--output speech.pcm

Параметры

Обязательны все четыре.

voice_id
В пути запроса. Идентификатор голоса из каталога ниже.
output_format
В строке запроса: pcm_8000, pcm_16000 или pcm_24000.
text
В теле запроса. Текст реплики.
model_id
В теле запроса. Идентификатор модели.

// голоса

Каталог голосов

16 голосов neuro_tts_v2. Нажмите на карточку, чтобы послушать голос.

// тарифы

Минута синтезированного аудио тарифицируется посекундно: 50 минут в месяц на Free, 2 500 минут на Pro и 2 ₽ за минуту сверх пакета.

Тарифы

// enterprise

Та же модель в вашем контуре: установка on-premise, выделенные лимиты, SLA и поручение на обработку персональных данных в договоре.

Enterprise и on-premise

// материалы

Как устроен синтез речи, откуда берутся паузы и ударения и что проверять при выборе модели.

Что такое синтез речи (TTS)