// продукт · синтез речи
Синтез речи
Голос для агентов, IVR и озвучивания. Телефонные 8 кГц из коробки, поток с первого фрагмента.
neuro_tts_v2
Собственная модель Neuro.net
- Направление
- text → audio
- Форматы
- wav · pcm
- Частоты
- 8000 · 16000 · 24000 Гц
- Режимы
- REST · WebSocket
Neuro TTS — модель синтеза русской речи neuro_tts_v2. Один POST-запрос с текстом и идентификатором голоса возвращает поток аудио в wav или pcm на 8000, 16000 или 24000 Гц; первые фрагменты приходят до окончания генерации.
Что умеет модель
// поток
Первый фрагмент до конца генерации
Аудио отдаётся по мере синтеза. Агент отвечает раньше, чем собеседник замечает паузу.
// текст
Нормализация внутри модели
Числа, суммы, даты, телефоны и аббревиатуры проговариваются так, как их произнёс бы человек.
// телефония
Телефонный формат pcm 8000 Гц
Формат, который принимает телефонная станция. Без конвертации на вашей стороне.
// форматы
wav и pcm на трёх частотах
8000, 16000 и 24000 Гц: телефония, распознавание и озвучивание без пересемплирования.
// стабильность
Стабильный тембр на длинных репликах
Тембр и темп не плывут на репликах в несколько предложений.
// playground
Playground: голос и частота без кода
Голос и частота выбираются мышкой, готовый запрос копируется одной кнопкой.
Запрос синтеза
POST возвращает поток аудио в выбранном формате. Ключ в заголовке, текст и модель в теле.
curl -X POST "$NEURO_API_ENDPOINT/v1/text-to-speech/edsel/stream?output_format=pcm_24000" \-H "xi-api-key: $NEURO_API_KEY" \-H "Content-Type: application/json" \-d '{"text": "Привет! Это новая модель синтеза речи от Neuro…", "model_id": "neuro_tts_v2"}' \--output speech.pcm
Параметры
Обязательны все четыре.
- voice_id
- В пути запроса. Идентификатор голоса из каталога ниже.
- output_format
- В строке запроса: pcm_8000, pcm_16000 или pcm_24000.
- text
- В теле запроса. Текст реплики.
- model_id
- В теле запроса. Идентификатор модели.
// голоса
Каталог голосов
16 голосов neuro_tts_v2. Нажмите на карточку, чтобы послушать голос.
// тарифы
Минута синтезированного аудио тарифицируется посекундно: 50 минут в месяц на Free, 2 500 минут на Pro и 2 ₽ за минуту сверх пакета.
Тарифы// enterprise
Та же модель в вашем контуре: установка on-premise, выделенные лимиты, SLA и поручение на обработку персональных данных в договоре.
Enterprise и on-premise// материалы
Как устроен синтез речи, откуда берутся паузы и ударения и что проверять при выборе модели.
Что такое синтез речи (TTS)