// продукт · синтез речи
Синтез речи
Голос для агентов, IVR и озвучивания. Телефонные 8 кГц из коробки, поток с первого фрагмента.
neuro_tts_v2
Собственная модель Neuro.net
- Направление
- text → audio
- Форматы
- mp3 · wav · pcm · µ-law · A-law
- Частоты
- 8000–48000 Гц
- Режимы
- REST · WebSocket
Neuro TTS — модель синтеза русской речи neuro_tts_v2. Один POST-запрос с текстом и идентификатором голоса возвращает поток аудио в mp3, wav или pcm на частотах от 8 до 48 кГц, для телефонии µ-law и A-law; первые фрагменты приходят до окончания генерации.
Что умеет модель
// поток
Первый фрагмент до конца генерации
Аудио отдаётся по мере синтеза. Агент отвечает раньше, чем собеседник замечает паузу.
// текст
Нормализация внутри модели
Числа, суммы, даты, телефоны и аббревиатуры проговариваются так, как их произнёс бы человек.
// телефония
Телефонные pcm, µ-law и A-law 8000 Гц
Форматы, которые принимает телефонная станция. Без конвертации на вашей стороне.
// форматы
mp3, wav и pcm на шести частотах
8000, 16000, 22050, 24000, 44100 и 48000 Гц: телефония, распознавание, озвучивание и публикация без пересемплирования.
// стабильность
Стабильный тембр на длинных репликах
Тембр и темп не плывут на репликах в несколько предложений.
// playground
Playground: голос и частота без кода
Голос и частота выбираются мышкой, готовый запрос копируется одной кнопкой.
Запрос синтеза
POST возвращает поток аудио в выбранном формате. Ключ в заголовке, текст и модель в теле.
curl -X POST "$NEURO_API_ENDPOINT/v1/text-to-speech/edsel/stream?output_format=pcm_24000" \-H "xi-api-key: $NEURO_API_KEY" \-H "Content-Type: application/json" \-d '{"text": "Привет! Это новая модель синтеза речи от Neuro…", "model_id": "neuro_tts_v2"}' \--output speech.pcm
Параметры
Обязательны все четыре.
- voice_id
- В пути запроса. Идентификатор голоса из каталога ниже.
- output_format
- В строке запроса: pcm_<частота> или wav_<частота> на 8–48 кГц, mp3_44100_128 и другие битрейты, ulaw_8000, alaw_8000. Без параметра — mp3_44100_128.
- text
- В теле запроса. Текст реплики.
- model_id
- В теле запроса. Идентификатор модели.
// голоса
Каталог голосов
16 голосов neuro_tts_v2. Нажмите на карточку, чтобы послушать голос.
// тарифы
Минута синтезированного аудио тарифицируется посекундно: до 20 минут на Free, от 100 минут на платных тарифах от 500 ₽ в месяц, сверх пакета от 2 ₽ за минуту.
Тарифы// enterprise
Та же модель в вашем контуре: установка on-premise, выделенные лимиты, SLA и поручение на обработку персональных данных в договоре.
Enterprise и on-premise// материалы
Как устроен синтез речи, откуда берутся паузы и ударения и что проверять при выборе модели.
Что такое синтез речи (TTS)