// neuro speech

Речь, которую не отличают от человеческой

Neuro TTS и Neuro ASR — собственные модели синтеза и распознавания русской речи. API по REST и WebSocket, wav и pcm на 8, 16 и 24 кГц, облако в России или установка в ваш контур.

neuro_tts_v2neuro_asr_v2REST · WebSocket

250 / 500
Голос
Формат

  • neuro_tts_v2
  • neuro_asr_v2
  • wav · pcm
  • 8000 / 16000 / 24000 Гц
  • REST
  • WebSocket
  • русский язык
  • данные в РФ
  • on-premise
  • посекундная тарификация

// голос для бизнеса

Дайте бизнесу голос

Обе модели разработаны и обучены командой Neuro.net. Подключение по REST или WebSocket без SDK, concurrency под пиковую нагрузку по тарифу или договору, размещение в облаке Neuro.net в России или в вашем контуре.

// отрасли

Где применяют синтез и распознавание речи

Типовые задачи по отраслям: что делает синтез, что — распознавание, какие ограничения важны.

  • TTS + ASR

    Контакт-центры

    Первая линия, исходящие кампании, подтверждение заявок и статусов.

    Динамические реплики вместо записанных фраз, расшифровка для контроля качества

  • TTS + ASR

    Банки и страхование

    Уведомления о платежах, верификация, работа с задолженностью.

    Суммы, даты и номера договоров озвучиваются без ручной нарезки

  • TTS + ASR

    Ритейл и доставка

    Подтверждение заказов, интервалы доставки, обратная связь.

    Пиковая нагрузка в часы доставки: concurrency под расписание

  • TTS + ASR

    Телеком

    IVR, автоинформирование, обслуживание абонентской базы.

    Голосовые агенты для поддержки абонентов, телемаркетинга и проведения опросов.

  • TTS + ASR

    Медицина и госуслуги

    Запись на приём, напоминания, подтверждение визитов.

    Данные не покидают контур: доступна установка on-premise

  • TTS

    Медиа и обучение

    Озвучивание курсов, инструкций и материалов, доступность интерфейсов.

    Пакетная генерация по расписанию, голоса каталога

// синтез речи

Синтез речи: Neuro TTS

neuro_tts_v2 держит поток до конца реплики. Голос не плывёт на длинных фразах и не спотыкается на числах и аббревиатурах.

  • Поток без пауз

    Аудио отдаётся фрагментами по мере генерации. Агент начинает говорить раньше, чем модель досчитала фразу.

  • Числа и сокращения

    «3 500 ₽» читается как «три тысячи пятьсот рублей», а не по символам. Нормализация внутри модели.

  • Телефония без прослойки

    pcm 8000 Гц отдаётся напрямую: пересемплировать на своей стороне не нужно.

  • Один запрос

    POST с текстом и voice_id возвращает поток аудио. Ключ в заголовке, JSON в теле.

Студийный микрофон с мятной полосой на белом фоне

// распознавание речи

Распознавание речи: Neuro ASR

neuro_asr_v2 принимает телефонный звук 8 кГц и записи 16 и 24 кГц в wav или pcm. На выходе — текст с пунктуацией, сегменты с таймингами и уверенность модели по фрагменту.

REST и WebSocket
Руки держат белые накладные наушники над светлым столом

Что возвращает модель

  • Текст с пунктуацией и заглавными буквами, без постобработки.
  • Сегменты с таймингами для навигации по записи.
  • Уверенность модели по фрагменту, чтобы отправлять сомнительные места на проверку.
  • Телефонное аудио 8 кГц наравне со студийной записью.

// audio → text

audio → text

  • RESTФайл

    Отправьте запись целиком и получите расшифровку с сегментами, таймингами и уверенностью.

  • WSПоток

    Двусторонний канал для живого диалога: промежуточные гипотезы по ходу речи, финал по паузе.

wav · pcm · 8000 / 16000 / 24000 Гц

// размещение

Облако или ваш контур

Одни и те же модели. Разница только в том, где они выполняются и кто отвечает за инфраструктуру.

Коридор дата-центра с белыми шкафами и мятными линиями на полу
SaaSстарт в тот же день

Облако Neuro

Модели работают в российских дата-центрах. Вы получаете ключ и начинаете сразу: железо, обновления и мониторинг на нас.

  • Доступ к API после оплаты Pro
  • Обновления моделей без вашего участия
  • Оплата по факту, посекундно
  • Автомасштабирование под пик
  • SLA по договору
Одиночный белый серверный шкаф в пустом светлом помещении
On-premiseвнедрение по проекту

Ваш контур

Ставим те же модели внутрь вашего периметра: на собственные серверы или в частное облако. Аудио не выходит за границу сети.

  • Поставка контейнерами, разворачивание за смену
  • Работа в сети без доступа в интернет
  • Ваши правила хранения, логирования и доступа
  • Сайзинг под пиковую нагрузку и concurrency
  • Лицензия на инсталляцию, обновления по регламенту

// соответствие

Требования российского права

Служба безопасности заказчика задаёт эти вопросы первыми. Ответы собраны здесь, документы передаём по запросу.

РФ

Обработка, хранение и резервные копии — на серверах на территории России.

  • 152-ФЗ
  • 242-ФЗ
  • реестр Минцифры
  • 152-ФЗ · 242-ФЗ

    Данные остаются в России

    Обработка и хранение на серверах на территории РФ. Требование о локализации баз персональных данных выполняется.

  • трансграничная передача

    За границу ничего не уходит

    Аудио, тексты и метаданные не передаются в иностранные юрисдикции. Зарубежные подрядчики к обработке не привлекаются.

  • хранение

    Только оперативная память

    Аудио и расшифровки живут в RAM на время запроса и удаляются после ответа. На диск не пишем, для обучения моделей не используем.

  • реестр минцифры

    Отечественное ПО

    Продукт включён в Единый реестр российских программ для ЭВМ и баз данных.

  • документы

    Поручение и NDA

    Заключаем поручение на обработку персональных данных по 152-ФЗ, NDA и согласуем регламент информационной безопасности.

  • изоляция

    Если нельзя наружу

    Когда политика запрещает внешние сервисы, ставим модели в ваш контур, и данные не покидают периметр вовсе.

// демо агента

Поговорите с агентом

Голосовой агент на моделях Neuro.net: распознавание, ответ и синтез в одном потоке. Спросите, как устроен синтез или распознавание, или просто поболтайте. Это живой разговор, не запись.

// вопросы

Что спрашивают до подписания

Где физически обрабатывается аудио?

В облачном варианте — на серверах в российских дата-центрах. В on-premise — на вашем железе. Трансграничная передача не осуществляется ни в одном из вариантов.

Вы храните наши записи?

Нет. Аудио и расшифровки находятся в оперативной памяти на время обработки запроса и удаляются после ответа. На диск не пишутся, в обучение моделей не попадают.

Чем голос отличается от модели?

Модель определяет качество, задержку и режимы работы. Голос — тембр и манера речи внутри модели. В запросе указываются и модель, и голос.

Как считается минута?

По длительности аудио: синтезированного для TTS, поданного на вход для ASR. Тарификация посекундная, округления вверх до минуты нет.

Что такое concurrency?

Число одновременных запросов, которые обрабатываются без очереди. На Pro включено 10 для синтеза и 20 для распознавания, каждый дополнительный поток — 1 000 ₽ в месяц (подробнее в тарифах).

Можно ли начать без договора?

Да. Free открывает Playground: 50 минут синтеза и 50 минут распознавания в месяц. Доступ к API появляется на Pro.

// enterprise

Когда голос стоит в критичном контуре

Пиковые нагрузки, выделенные лимиты, установка внутри периметра и SLA в договоре.

Обсудить внедрение
Масштаб
Выделенные лимиты запросов и concurrency под пиковую нагрузку.
SLA
Доступность и время реакции фиксируются договором.
On-premise
Установка моделей внутрь периметра, работа без интернета.
Безопасность
Поручение на обработку ПДн, NDA, согласование регламента.
Биллинг
Постоплата, счета и акты, единый договор на обе модели.
Поддержка
Выделенный канал и приоритет обращений на время внедрения.

// начать

Послушайте, потом решайте

Синтез на этой странице работает без регистрации: введите текст, выберите голос, нажмите «Синтезировать». Регистрация бесплатна: личный кабинет с playground, историей запросов и учётом минут.