// neuro speech

Речь, которую не отличают от человеческой

Neuro TTS и Neuro ASR — собственные модели синтеза и распознавания русской речи. API по REST и WebSocket, wav и pcm на 8, 16 и 24 кГц, облако в России или установка в ваш контур.

neuro_tts_v2neuro_asr_v2REST · WebSocket

250 / 500
Голос
Формат

  • neuro_tts_v2
  • neuro_asr_v2
  • wav · pcm
  • 8000 / 16000 / 24000 Гц
  • REST
  • WebSocket
  • русский язык
  • данные в РФ
  • on-premise
  • посекундная тарификация

// голос для бизнеса

Дайте бизнесу голос

Обе модели разработаны и обучены командой Neuro.net. Подключение по REST или WebSocket без SDK, concurrency под пиковую нагрузку по тарифу или договору, размещение в облаке Neuro.net в России или в вашем контуре.

// отрасли

Где применяют синтез и распознавание речи

Типовые задачи по отраслям: что делает синтез, что — распознавание, какие ограничения важны.

  • TTS + ASR

    Контакт-центры

    Первая линия, исходящие кампании, подтверждение заявок и статусов.

    Динамические реплики вместо записанных фраз, расшифровка для контроля качества

  • TTS + ASR

    Банки и страхование

    Уведомления о платежах, верификация, работа с задолженностью.

    Суммы, даты и номера договоров озвучиваются без ручной нарезки

  • TTS + ASR

    Ритейл и доставка

    Подтверждение заказов, интервалы доставки, обратная связь.

    Пиковая нагрузка в часы доставки: concurrency под расписание

  • TTS + ASR

    Телеком

    IVR, автоинформирование, обслуживание абонентской базы.

    Голосовые агенты для поддержки абонентов, телемаркетинга и проведения опросов.

  • TTS + ASR

    Медицина и госуслуги

    Запись на приём, напоминания, подтверждение визитов.

    Данные не покидают контур: доступна установка on-premise

  • TTS

    Медиа и обучение

    Озвучивание курсов, инструкций и материалов, доступность интерфейсов.

    Пакетная генерация по расписанию, голоса каталога

// синтез речи

Синтез речи: Neuro TTS

neuro_tts_v2 держит поток до конца реплики. Голос не плывёт на длинных фразах и не спотыкается на числах и аббревиатурах.

  • Поток без пауз

    Аудио отдаётся фрагментами по мере генерации. Агент начинает говорить раньше, чем модель досчитала фразу.

  • Числа и сокращения

    «3 500 ₽» читается как «три тысячи пятьсот рублей», а не по символам. Нормализация внутри модели.

  • Телефония без прослойки

    pcm 8000 Гц отдаётся напрямую: пересемплировать на своей стороне не нужно.

  • Один запрос

    POST с текстом и voice_id возвращает поток аудио. Ключ в заголовке, JSON в теле.

Студийный микрофон с мятной полосой на белом фоне

// распознавание речи

Распознавание речи: Neuro ASR

neuro_asr_v2 принимает телефонный звук 8 кГц и записи 16 и 24 кГц в wav или pcm. На выходе — текст с пунктуацией, сегменты с таймингами и уверенность модели по фрагменту.

REST и WebSocket
Руки держат белые накладные наушники над светлым столом

Что возвращает модель

  • Текст с пунктуацией и заглавными буквами, без постобработки.
  • Сегменты с таймингами для навигации по записи.
  • Уверенность модели по фрагменту, чтобы отправлять сомнительные места на проверку.
  • Телефонное аудио 8 кГц наравне со студийной записью.

// audio → text

audio → text

  • RESTФайл

    Отправьте запись целиком и получите расшифровку с сегментами, таймингами и уверенностью.

  • WSПоток

    Двусторонний канал для живого диалога: промежуточные гипотезы по ходу речи, финал по паузе.

wav · pcm · 8000 / 16000 / 24000 Гц

// размещение

Облако или ваш контур

Одни и те же модели. Разница только в том, где они выполняются и кто отвечает за инфраструктуру.

Коридор дата-центра с белыми шкафами и мятными линиями на полу
SaaSстарт в тот же день

Облако Neuro

Модели работают в российских дата-центрах. Вы получаете ключ и начинаете сразу: железо, обновления и мониторинг на нас.

  • Доступ к API на тарифах от 2 000 ₽ в месяц
  • Обновления моделей без вашего участия
  • Оплата по факту, посекундно
  • Автомасштабирование под пик
  • SLA по договору
Одиночный белый серверный шкаф в пустом светлом помещении
On-premiseвнедрение по проекту

Ваш контур

Ставим те же модели внутрь вашего периметра: на собственные серверы или в частное облако. Аудио не выходит за границу сети.

  • Поставка контейнерами, разворачивание за смену
  • Работа в сети без доступа в интернет
  • Ваши правила хранения, логирования и доступа
  • Сайзинг под пиковую нагрузку и concurrency
  • Лицензия на инсталляцию, обновления по регламенту

// соответствие

Требования российского права

Служба безопасности заказчика задаёт эти вопросы первыми. Ответы собраны здесь, документы передаём по запросу.

РФ

Обработка, хранение и резервные копии — на серверах на территории России.

  • 152-ФЗ
  • 242-ФЗ
  • реестр Минцифры
  • 152-ФЗ · 242-ФЗ

    Данные остаются в России

    Обработка и хранение на серверах на территории РФ. Требование о локализации баз персональных данных выполняется.

  • трансграничная передача

    За границу ничего не уходит

    Аудио, тексты и метаданные не передаются в иностранные юрисдикции. Зарубежные подрядчики к обработке не привлекаются.

  • хранение

    Только оперативная память

    Аудио и расшифровки живут в RAM на время запроса и удаляются после ответа. На диск не пишем, для обучения моделей не используем.

  • реестр минцифры

    Отечественное ПО

    Продукт включён в Единый реестр российских программ для ЭВМ и баз данных.

  • документы

    Поручение и NDA

    Заключаем поручение на обработку персональных данных по 152-ФЗ, NDA и согласуем регламент информационной безопасности.

  • изоляция

    Если нельзя наружу

    Когда политика запрещает внешние сервисы, ставим модели в ваш контур, и данные не покидают периметр вовсе.

// демо агента

Поговорите с агентом

Голосовой агент на моделях Neuro.net: распознавание, ответ и синтез в одном потоке. Спросите, как устроен синтез или распознавание, или просто поболтайте. Это живой разговор, не запись.

// вопросы

Что спрашивают до подписания

Где физически обрабатывается аудио?

В облачном варианте — на серверах в российских дата-центрах. В on-premise — на вашем железе. Трансграничная передача не осуществляется ни в одном из вариантов.

Вы храните наши записи?

Нет. Аудио и расшифровки находятся в оперативной памяти на время обработки запроса и удаляются после ответа. На диск не пишутся, в обучение моделей не попадают.

Чем голос отличается от модели?

Модель определяет качество, задержку и режимы работы. Голос — тембр и манера речи внутри модели. В запросе указываются и модель, и голос.

Как считается минута?

По длительности аудио: синтезированного для TTS, поданного на вход для ASR. Тарификация посекундная, округления вверх до минуты нет.

Что такое concurrency?

Число одновременных запросов, которые обрабатываются без очереди. На Старте включено 5 для синтеза и 10 для распознавания, на Профи 10 и 20, на Бизнесе 20 и 40; каждый дополнительный поток стоит 1 000 ₽ в месяц (подробнее в тарифах).

Можно ли начать без договора?

Да. Free открывает Playground: 50 минут синтеза в месяц, карта не нужна. Доступ к API открывается на платных тарифах от 2 000 ₽ в месяц.

// enterprise

Когда голос стоит в критичном контуре

Пиковые нагрузки, выделенные лимиты, установка внутри периметра и SLA в договоре.

Обсудить внедрение
Масштаб
Выделенные лимиты запросов и concurrency под пиковую нагрузку.
SLA
Доступность и время реакции фиксируются договором.
On-premise
Установка моделей внутрь периметра, работа без интернета.
Безопасность
Поручение на обработку ПДн, NDA, согласование регламента.
Биллинг
Постоплата, счета и акты, единый договор на обе модели.
Поддержка
Выделенный канал и приоритет обращений на время внедрения.

// начать

Послушайте, потом решайте

Синтез на этой странице работает без регистрации: введите текст, выберите голос, нажмите «Синтезировать». Регистрация бесплатна: личный кабинет с playground, историей запросов и учётом минут.