Где стоят речевые модели
Первая линия входящих звонков, исходящие кампании, подтверждение заявок и статусов, контроль качества разговоров — в каждой из этих точек есть либо речь абонента, которую нужно превратить в текст, либо текст, который нужно произнести. Первое делает распознавание речи (ASR), второе — синтез (TTS). Вместе с логикой диалога они образуют голосового агента.
Что делает распознавание
В живом диалоге распознавание работает потоком: аудио с линии уходит по WebSocket фрагментами, промежуточные гипотезы приходят, пока абонент ещё говорит, финальный текст фиксируется по паузе. Так агент понимает намерение без ожидания конца записи и может ответить сразу.
После разговора та же модель расшифровывает запись целиком по REST. На выходе текст с пунктуацией, сегменты с таймингами и уверенность по каждому фрагменту: сомнительные места отправляются на прослушивание человеку, остальное читается как текст. Это основа контроля качества и поиска по разговорам.
Что делает синтез
Синтез заменяет записанные фразы динамическими репликами: сумма платежа, дата доставки и номер договора озвучиваются в момент разговора. Аудио отдаётся потоком, поэтому агент начинает говорить раньше, чем сгенерирована вся фраза. Для телефонии модель отдаёт pcm 8000 Гц напрямую — станция принимает поток без конвертации.
Реальное время на телефонной линии
Голосовой агент — это распознавание, языковая модель для логики ответа и синтез в одном потоке. Абонент говорит, поток распознаётся, ответ формируется и озвучивается, а если абонент перебивает, синтез останавливается. Ограничения телефонии здесь жёсткие: 8000 Гц на входе и выходе, счёт задержек на сотни миллисекунд, десятки разговоров одновременно в пиковый час.
Как это звучит, можно проверить в демо голосового агента на главной странице: распознавание, ответ и синтез на моделях Neuro.net работают в нём в одном потоке, это живой разговор, а не запись.
Типовые сценарии автоматизации
| Отрасль | Задачи | Что важно |
|---|---|---|
| Банки и страхование | Уведомления о платежах, верификация, работа с задолженностью. | Суммы, даты и номера договоров озвучиваются без ручной нарезки. |
| Ритейл и доставка | Подтверждение заказов, интервалы доставки, обратная связь. | Пиковая нагрузка в часы доставки: concurrency под расписание. |
| Телеком | IVR, автоинформирование, обслуживание абонентской базы. | Голосовые агенты для поддержки абонентов, телемаркетинга и опросов. |
| Медицина и госуслуги | Запись на приём, напоминания, подтверждение визитов. | Данные не покидают контур: установка on-premise. |
Что проверить перед внедрением
- Задержка до первого фрагмента аудио у синтеза и до финального текста у распознавания: измерьте на своей линии, а не по обещаниям.
- Телефонный формат: pcm 8000 Гц на входе и на выходе без пересемплирования между станцией и моделями.
- Нормализация чисел: сумма, дата и номер договора должны читаться словами без разметки на вашей стороне.
- Перебивание: агент должен замолкать, когда собеседник заговорил, а не дочитывать реплику.
- Concurrency: сколько разговоров идёт одновременно в пиковый час и что происходит с лишними.
- Данные: где обрабатывается аудио, хранится ли оно после ответа, есть ли поручение на обработку ПДн.
Данные и договор
Разговоры с абонентами — персональные данные. В облаке Neuro.net аудио обрабатывается на серверах в России, живёт в оперативной памяти на время запроса и не сохраняется; когда политика безопасности запрещает внешние сервисы, те же модели ставятся в контур заказчика и работают без доступа в интернет. Поручение на обработку персональных данных по 152-ФЗ, NDA и регламент безопасности оформляются в договоре Enterprise; для старта без договора есть тариф Pro с посекундной тарификацией минут.