// материалы · синтез речи

Что такое синтез речи (TTS)

Text-to-speech — преобразование написанного текста в звучащую речь. На входе строка текста, на выходе аудио, которое можно проиграть в телефонной линии, приложении или сохранить в файл.

Обновлено 8 сентября 2026 г.

Что делает синтез речи

Синтез речи (text-to-speech, TTS) получает текст и возвращает аудио с голосом, читающим этот текст. Раньше для голосовых меню записывали диктора и склеивали фразы из фрагментов; синтез снимает это ограничение: любая новая реплика, сумма или дата озвучивается в момент запроса, без студии и без монтажа.

Голос и модель — разные вещи. Модель определяет качество, задержку и режимы работы; голос — тембр и манеру речи внутри модели. В запросе указываются и модель, и голос: одна модель может говорить десятками голосов.

Как это устроено

Современный синтез строится на нейросетевых моделях, и путь от текста к звуку в общих чертах одинаков у разных систем. Сначала текст нормализуется: «3 500 ₽» превращается в «три тысячи пятьсот рублей», дата и номер телефона — в слова. Затем модель определяет, как это произнести: ударения, паузы, интонацию фразы. После этого генерируется само аудио с нужным тембром и на нужной частоте дискретизации.

Потоковая отдача означает, что аудио уходит клиенту по мере генерации: первые фрагменты приходят раньше, чем модель закончила фразу. Для голосового агента это разница между ответом «сразу» и паузой, которую собеседник замечает.

Форматы и частоты

Аудио возвращается либо в контейнере wav, либо как сырой поток pcm без заголовка. Частота дискретизации выбирается под задачу: телефонная станция принимает 8000 Гц, приложения и озвучивание обычно используют 16000 или 24000 Гц. Если модель отдаёт нужную частоту сразу, пересемплировать на своей стороне не нужно.

Где применяют

  • Голосовые агенты и IVR: динамические реплики вместо записанных фраз.
  • Уведомления: суммы платежей, даты доставки, номера договоров и заказов.
  • Озвучивание курсов, инструкций и материалов; пакетная генерация по расписанию.
  • Доступность интерфейсов для людей, которым удобнее слушать, чем читать.

На что смотреть при выборе

  • Потоковая отдача: через сколько миллисекунд приходит первый фрагмент аудио, а не вся фраза.
  • Нормализация: как читаются суммы, даты, телефоны и аббревиатуры без предварительной разметки.
  • Телефонный формат: отдаёт ли модель pcm 8000 Гц напрямую или нужен пересемплинг.
  • Стабильность на длинных репликах: не меняются ли тембр и темп внутри нескольких предложений.
  • Размещение и данные: облако в нужной юрисдикции или установка в контур, что хранится после запроса.
  • Тарификация: за что берут деньги — за символы, за минуты аудио, с округлением или посекундно.

Как это реализовано в Neuro TTS

Neuro TTS — собственная модель синтеза русской речи Neuro.net. Она отдаёт аудио потоком в wav или pcm на 8000, 16000 и 24000 Гц, нормализует числа, суммы, даты и аббревиатуры внутри модели и подключается одним POST-запросом по REST или по WebSocket. В каталоге 16 голосов; послушать синтез можно в Playground на главной без регистрации, а цена минуты считается посекундно.