// материалы · контакт-центр

Распознавание и синтез речи в контакт-центре

Речевые модели закрывают в контакт-центре две задачи: понимать, что говорит абонент, и отвечать ему голосом. Ниже — где именно стоят ASR и TTS, как они работают в реальном времени на телефонной линии и что проверять перед внедрением.

Обновлено 8 сентября 2026 г.

Где стоят речевые модели

Первая линия входящих звонков, исходящие кампании, подтверждение заявок и статусов, контроль качества разговоров — в каждой из этих точек есть либо речь абонента, которую нужно превратить в текст, либо текст, который нужно произнести. Первое делает распознавание речи (ASR), второе — синтез (TTS). Вместе с логикой диалога они образуют голосового агента.

Что делает распознавание

В живом диалоге распознавание работает потоком: аудио с линии уходит по WebSocket фрагментами, промежуточные гипотезы приходят, пока абонент ещё говорит, финальный текст фиксируется по паузе. Так агент понимает намерение без ожидания конца записи и может ответить сразу.

После разговора та же модель расшифровывает запись целиком по REST. На выходе текст с пунктуацией, сегменты с таймингами и уверенность по каждому фрагменту: сомнительные места отправляются на прослушивание человеку, остальное читается как текст. Это основа контроля качества и поиска по разговорам.

Что делает синтез

Синтез заменяет записанные фразы динамическими репликами: сумма платежа, дата доставки и номер договора озвучиваются в момент разговора. Аудио отдаётся потоком, поэтому агент начинает говорить раньше, чем сгенерирована вся фраза. Для телефонии модель отдаёт pcm 8000 Гц напрямую — станция принимает поток без конвертации.

Реальное время на телефонной линии

Голосовой агент — это распознавание, языковая модель для логики ответа и синтез в одном потоке. Абонент говорит, поток распознаётся, ответ формируется и озвучивается, а если абонент перебивает, синтез останавливается. Ограничения телефонии здесь жёсткие: 8000 Гц на входе и выходе, счёт задержек на сотни миллисекунд, десятки разговоров одновременно в пиковый час.

Как это звучит, можно проверить в демо голосового агента на главной странице: распознавание, ответ и синтез на моделях Neuro.net работают в нём в одном потоке, это живой разговор, а не запись.

Типовые сценарии автоматизации

ОтрасльЗадачиЧто важно
Банки и страхованиеУведомления о платежах, верификация, работа с задолженностью.Суммы, даты и номера договоров озвучиваются без ручной нарезки.
Ритейл и доставкаПодтверждение заказов, интервалы доставки, обратная связь.Пиковая нагрузка в часы доставки: concurrency под расписание.
ТелекомIVR, автоинформирование, обслуживание абонентской базы.Голосовые агенты для поддержки абонентов, телемаркетинга и опросов.
Медицина и госуслугиЗапись на приём, напоминания, подтверждение визитов.Данные не покидают контур: установка on-premise.

Что проверить перед внедрением

  • Задержка до первого фрагмента аудио у синтеза и до финального текста у распознавания: измерьте на своей линии, а не по обещаниям.
  • Телефонный формат: pcm 8000 Гц на входе и на выходе без пересемплирования между станцией и моделями.
  • Нормализация чисел: сумма, дата и номер договора должны читаться словами без разметки на вашей стороне.
  • Перебивание: агент должен замолкать, когда собеседник заговорил, а не дочитывать реплику.
  • Concurrency: сколько разговоров идёт одновременно в пиковый час и что происходит с лишними.
  • Данные: где обрабатывается аудио, хранится ли оно после ответа, есть ли поручение на обработку ПДн.

Данные и договор

Разговоры с абонентами — персональные данные. В облаке Neuro.net аудио обрабатывается на серверах в России, живёт в оперативной памяти на время запроса и не сохраняется; когда политика безопасности запрещает внешние сервисы, те же модели ставятся в контур заказчика и работают без доступа в интернет. Поручение на обработку персональных данных по 152-ФЗ, NDA и регламент безопасности оформляются в договоре Enterprise; для старта без договора есть тариф Pro с посекундной тарификацией минут.