Что делает синтез речи
Синтез речи (text-to-speech, TTS) получает текст и возвращает аудио с голосом, читающим этот текст. Раньше для голосовых меню записывали диктора и склеивали фразы из фрагментов; синтез снимает это ограничение: любая новая реплика, сумма или дата озвучивается в момент запроса, без студии и без монтажа.
Голос и модель — разные вещи. Модель определяет качество, задержку и режимы работы; голос — тембр и манеру речи внутри модели. В запросе указываются и модель, и голос: одна модель может говорить десятками голосов.
Как это устроено
Современный синтез строится на нейросетевых моделях, и путь от текста к звуку в общих чертах одинаков у разных систем. Сначала текст нормализуется: «3 500 ₽» превращается в «три тысячи пятьсот рублей», дата и номер телефона — в слова. Затем модель определяет, как это произнести: ударения, паузы, интонацию фразы. После этого генерируется само аудио с нужным тембром и на нужной частоте дискретизации.
Потоковая отдача означает, что аудио уходит клиенту по мере генерации: первые фрагменты приходят раньше, чем модель закончила фразу. Для голосового агента это разница между ответом «сразу» и паузой, которую собеседник замечает.
Форматы и частоты
Аудио возвращается либо в контейнере wav, либо как сырой поток pcm без заголовка. Частота дискретизации выбирается под задачу: телефонная станция принимает 8000 Гц, приложения и озвучивание обычно используют 16000 или 24000 Гц. Если модель отдаёт нужную частоту сразу, пересемплировать на своей стороне не нужно.
Где применяют
- Голосовые агенты и IVR: динамические реплики вместо записанных фраз.
- Уведомления: суммы платежей, даты доставки, номера договоров и заказов.
- Озвучивание курсов, инструкций и материалов; пакетная генерация по расписанию.
- Доступность интерфейсов для людей, которым удобнее слушать, чем читать.
На что смотреть при выборе
- Потоковая отдача: через сколько миллисекунд приходит первый фрагмент аудио, а не вся фраза.
- Нормализация: как читаются суммы, даты, телефоны и аббревиатуры без предварительной разметки.
- Телефонный формат: отдаёт ли модель pcm 8000 Гц напрямую или нужен пересемплинг.
- Стабильность на длинных репликах: не меняются ли тембр и темп внутри нескольких предложений.
- Размещение и данные: облако в нужной юрисдикции или установка в контур, что хранится после запроса.
- Тарификация: за что берут деньги — за символы, за минуты аудио, с округлением или посекундно.
Как это реализовано в Neuro TTS
Neuro TTS — собственная модель синтеза русской речи Neuro.net. Она отдаёт аудио потоком в wav или pcm на 8000, 16000 и 24000 Гц, нормализует числа, суммы, даты и аббревиатуры внутри модели и подключается одним POST-запросом по REST или по WebSocket. В каталоге 16 голосов; послушать синтез можно в Playground на главной без регистрации, а цена минуты считается посекундно.