// neuro speech

Технологии голосового ИИ

Отечественные модели Neuro ASR и Neuro TTS для синтеза и распознавания русской речи.

neuro_tts_v2neuro_asr_v2REST · WebSocket

250 / 500
Голос
Формат

  • neuro_tts_v2
  • neuro_asr_v2
  • wav · pcm
  • 8000 / 16000 / 24000 Гц
  • REST
  • WebSocket
  • русский язык
  • данные в РФ
  • on-premise
  • посекундная тарификация

// голос для бизнеса

Дайте бизнесу голос

Выведите свой бизнес на новый уровень с помощью передовых голосовых AI-решений, созданных на базе собственных технологий, легко интегрируемых в существующую инфраструктуру и готовых масштабироваться вместе с вашим бизнесом.

// отрасли

Где применяют синтез и распознавание речи

Типовые задачи по отраслям: что делает синтез, что — распознавание, какие ограничения важны.

  • TTS + ASR

    Контакт-центры

    Первая линия, исходящие кампании, подтверждение заявок и статусов.

    Динамические реплики вместо записанных фраз, расшифровка для контроля качества

  • TTS + ASR

    Банки и страхование

    Уведомления о платежах, верификация, работа с задолженностью.

    Суммы, даты и номера договоров озвучиваются без ручной нарезки

  • TTS + ASR

    Ритейл и доставка

    Подтверждение заказов, интервалы доставки, обратная связь.

    Пиковая нагрузка в часы доставки: concurrency под расписание

  • TTS + ASR

    Телеком

    IVR, автоинформирование, обслуживание абонентской базы.

    Голосовые агенты для поддержки абонентов, телемаркетинга и проведения опросов.

  • TTS + ASR

    Медицина и госуслуги

    Запись на приём, напоминания, подтверждение визитов.

    Данные не покидают контур: доступна установка on-premise

  • TTS

    Медиа и обучение

    Озвучивание курсов, инструкций и материалов, доступность интерфейсов.

    Пакетная генерация по расписанию, голоса каталога

// синтез речи

Синтез речи: Neuro TTS

neuro_tts_v2 держит поток до конца реплики. Голос не плывёт на длинных фразах и не спотыкается на числах и аббревиатурах.

  • Поток без пауз

    Аудио отдаётся фрагментами по мере генерации. Агент начинает говорить раньше, чем модель досчитала фразу. TTFA p50 менее 120 мс.

  • Числа и сокращения

    «3 500 ₽» читается как «три тысячи пятьсот рублей», а не по символам. Нормализация внутри модели.

  • Телефония без прослойки

    pcm 8000 Гц отдаётся напрямую: пересемплировать на своей стороне не нужно.

  • Один запрос

    POST с текстом и voice_id возвращает поток аудио. Ключ в заголовке, JSON в теле.

Студийный микрофон с мятной полосой на белом фоне

// распознавание речи

Распознавание речи: Neuro ASR

neuro_asr_v2 принимает файлы в любом распространённом формате и поток PCM на 8 или 16 кГц. Возвращает текст с пунктуацией, сегменты с таймингами и уверенность модели по фрагменту.

REST и WebSocket
Руки держат белые накладные наушники над светлым столом

Что возвращает модель

  • Текст с пунктуацией и заглавными буквами, без постобработки.
  • Сегменты с таймингами для навигации по записи.
  • Уверенность модели по фрагменту, чтобы отправлять сомнительные места на проверку.
  • Телефонный звук 8 кГц наравне со студийной записью.

// audio → text

audio → text

  • RESTФайл

    Отправьте запись целиком и получите расшифровку с сегментами, таймингами и уверенностью.

  • WSПоток

    Двусторонний канал для живого диалога: промежуточные гипотезы по ходу речи.

файлы: wav · mp3 · ogg · flac · m4a · поток: PCM 8 / 16 кГц

// размещение

Облако или ваш контур

Одни и те же модели. Разница только в том, где они выполняются и кто отвечает за инфраструктуру.

Коридор дата-центра с белыми шкафами и мятными линиями на полу
SaaSстарт в тот же день

Облако Neuro

Модели работают в российских дата-центрах. Вы получаете ключ и начинаете сразу: железо, обновления и мониторинг на нас.

  • Доступ к API на тарифах от 500 ₽ в месяц
  • Обновления моделей без вашего участия
  • Оплата по факту, посекундно
  • Автомасштабирование под пик
  • SLA по договору
Одиночный белый серверный шкаф в пустом светлом помещении
On-premiseвнедрение по проекту

Ваш контур

Ставим те же модели внутрь вашего периметра: на собственные серверы или в частное облако. Аудио не выходит за границу сети.

  • Поставка контейнерами, разворачивание за смену
  • Работа в сети без доступа в интернет
  • Ваши правила хранения, логирования и доступа
  • Сайзинг под пиковую нагрузку и concurrency
  • Лицензия на инсталляцию, обновления по регламенту

// соответствие

Требования российского права

РФ

Обработка, хранение и резервные копии на серверах на территории России.

  • 152-ФЗ
  • 242-ФЗ
  • реестр Минцифры
  • 152-ФЗ · 242-ФЗ

    Данные остаются в России

    Обработка, хранение и резервные копии на серверах на территории РФ. Требование о локализации баз персональных данных выполнено.

  • хранение

    Не храним ваши запросы

    Аудио и текст запроса к API живут в оперативной памяти, пока идёт обработка, и удаляются после ответа. Для обучения моделей не используются. Записи, которые вы загрузили в историю распознавания в консоли, хранятся, пока вы их не удалите.

  • реестр минцифры

    Отечественное ПО

    Продукт включён в Единый реестр российских программ для ЭВМ и баз данных.

// демо агента

Поговорите с агентом

Голосовой агент на моделях Neuro.net: распознавание, ответ и синтез в одном потоке. Спросите, как устроен синтез или распознавание, или просто поболтайте. Это живой разговор, не запись.

// вопросы

FAQ

Где физически обрабатывается аудио?

В облачном варианте на серверах в российских дата-центрах, в on-premise на вашем железе. Трансграничной передачи нет ни в одном из вариантов.

Вы храните наши записи?

Запросы к API не храним: аудио и расшифровка находятся в оперативной памяти на время обработки и удаляются после ответа, в обучение моделей не попадают. Записи, загруженные в историю распознавания в консоли, хранятся, пока вы их не удалите.

Чем голос отличается от модели?

Модель определяет качество, задержку и режимы работы. Голос задаёт тембр и манеру речи внутри модели. В запросе указываются и модель, и голос.

Как считается минута?

По длительности аудио: синтезированного для TTS, поданного на вход для ASR. Тарификация посекундная, округления вверх до минуты нет.

Что такое concurrency?

Число одновременных запросов, которые обрабатываются без очереди. На Start включено 1 для синтеза и 3 для распознавания, на Pro 3 и 10, на Scale 5 и 20, на Business 10 и 40. С тарифа Pro каждый дополнительный поток стоит 1 000 ₽ в месяц (подробнее в тарифах).

Можно ли начать без договора?

Да. Free открывает Playground: 20 минут синтеза или распознавания в месяц, карта не нужна. Доступ к API открывается на платных тарифах от 500 ₽ в месяц.

// начать

Послушайте, потом решайте

Синтез на этой странице работает без регистрации: введите текст, выберите голос, нажмите «Синтезировать». Регистрация бесплатна: личный кабинет с playground, историей запросов и учётом минут.