Local AI
Внедрение ИИ в закрытом контуре
Бесплатный аудит
Голосовой ИИ

Голосовой ИИ на русском языке — на вашем сервере

Голосовой ИИ — это связка распознавания речи, языковой модели и синтеза, развёрнутая на вашем сервере. Он принимает звонки, расшифровывает планёрки, размечает разговоры менеджеров по чек-листу и отвечает голосом. Русскую речь распознаём на GigaAM-v3 и T-one, синтезируем на Silero. Записи и расшифровки остаются внутри контура: во внешние сервисы не уходит ни один файл.

700 тыс.часов русской речи в обучении GigaAM-v3
70 млнпараметров у потоковой T-one — сильна на телефонии
100%записей и расшифровок остаётся внутри контура
2–4недели на пилот одного голосового сценария

Где голосовой ИИ окупается быстрее всего

Голос имеет смысл там, где речь уже есть и её никто не обрабатывает: разговоры менеджеров слушают выборочно, протоколы планёрок пишут вручную, а на складе набирать текст просто нечем.

01

Приём и разбор звонков

Система снимает поток с телефонии, распознаёт реплики по ходу разговора, вытаскивает суть обращения и заводит его в CRM. Типовое закрывает сама, спорное переводит на человека вместе с готовой расшифровкой.

02

Расшифровка встреч и планёрок

Запись превращается в текст с разделением по говорящим, поверх текста собирается протокол: решения, поручения, сроки. Поручения уходят задачами в трекер или воронку.

ИИ внутри Битрикс24
03

Контроль качества разговоров

Модель слушает все разговоры менеджеров, а не десять записей в месяц. Проверка по чек-листу: поздоровался, выявил потребность, назвал цену, договорился о следующем шаге.

ИИ в отделе продаж
04

Ассистент на складе и в цехе

Руки заняты, на руках перчатки, вокруг шум. Сотрудник говорит — система пишет: приёмка, брак, замер, статус наряда. Работает на мини-ПК прямо на участке, интернет не нужен.

05

Озвучка ответов и уведомлений

Синтез на Silero: подтверждение записи, напоминание о визите, зачитывание инструкции. Голос стоит на том же сервере, что и текстовая часть, отдельного облака не требуется.

06

Голосовой ввод в учётные системы

Диктовка вместо набора: заявка, отчёт мастера, комментарий к сделке. Текст сразу нормализуется под поля системы — числа, даты и артикулы приводятся к нужному формату.

ИИ и 1С

Модели для русской речи: что берём и почему

Все модели ниже — с открытыми весами и разворачиваются локально. Одна универсальная не закрывает всё: телефония, переговорная и цех — три разные акустические задачи.

GigaAM-v3

Сбер

Обучена на 700 тыс. часов русской речи. По заявлению разработчиков, ошибается примерно вдвое реже Whisper-large-v3 на русском. Наш вариант по умолчанию для разбора уже записанных файлов: звонки за день, совещания, диктофонные записи.

Открытые веса

T-one

Т-Банк

70 млн параметров, потоковая архитектура. В открытых тестах на телефонии показывает себя сильно на сжатом и шумном сигнале. Берём, когда ответ нужен по ходу разговора, а не через минуту после него.

Потоковая

Vosk

Alpha Cephei

Лёгкое офлайн-распознавание для слабого железа: промышленные мини-ПК, терминалы сбора данных, участки без сети. Точность ниже, но для коротких команд и словаря в пару сотен фраз её хватает.

Офлайн

Whisper

OpenAI

Держим как запасной вариант и для многоязычных записей. На русском проигрывает GigaAM-v3, зато ровно тянет десятки языков — полезно, когда в разговорах участвуют подрядчики из других стран.

Многоязычная

Silero

Silero

Синтез речи. Русский голос, управление скоростью и паузами, работа на обычном CPU. Используем для озвучки ответов, голосовых меню и уведомлений — там, где текст нужно произнести, а не показать.

Синтез

Сценарий, модель и требование к задержке

Выбор модели определяется каналом связи и тем, сколько секунд у системы есть на ответ. Ниже — как мы обычно раскладываем сценарии по стеку.

Подбор модели распознавания и синтеза речи под голосовой сценарий
СценарийМодельЗадержкаГде ставится
Приём и маршрутизация входящего звонкаT-one + SileroДо секунды на реплику, иначе слышна паузаУзел рядом с телефонией, GPU
Разбор записей звонков за деньGigaAM-v3Не критична, очередь на ночьОбщий GPU-узел контура
Расшифровка встречи и протоколGigaAM-v3 + диаризацияМинуты после окончания встречиТот же узел, отдельная очередь
Контроль качества по чек-листуGigaAM-v3 + Qwen или GigaChatЧасы, отчёт к утруУзел с текстовой моделью
Ассистент на складе и в цехеT-one или Vosk локально1–2 секунды, работа без сетиМини-ПК на участке
Озвучка ответов и уведомленийSileroДоли секунды на короткую фразуТот же сервис, что и текст
Записи на нескольких языкахWhisper large-v3Не критична, батчОбщий GPU-узел контура

Подводные камни голосового ИИ, о которых говорят редко

Демо на чистой студийной записи выглядит убедительно у любого подрядчика. Проблемы начинаются на реальном материале, и вот они — по частоте появления в проектах.

  1. Диаризация — отдельная задача, а не опция. Разделить говорящих на телефонном разговоре с двумя каналами легко. Совещание, записанное одним микрофоном в комнате, — худший случай: перебивания, эхо, три голоса разом. Ошибку разметки говорящих мы закладываем заранее и не строим на ней ничего юридически значимого.
  2. Пунктуация и заглавные буквы в звуке не содержатся. Точки, запятые и регистр дорисовывает отдельный постпроцессор. На длинных сложных фразах он ошибается, поэтому расшифровка встречи — это черновик для человека, а не стенограмма под подпись.
  3. Первыми ломаются числа, артикулы и термины. «Двадцать три сорок пять» — время, сумма или номер детали? Лечится словарём вашей номенклатуры и правилами нормализации, а если не хватает — дообучением на ваших данных. Без этого шага голосовой ввод в учётную систему бесполезен.
  4. Телефония режет частоты. Кодек сжимает сигнал до узкой полосы, и модель, обученная на студийных записях, на нём проседает. Поэтому на линии мы начинаем с T-one, а не с самой «сильной» модели из чужой таблицы бенчмарков.
  5. Шум цеха софтом до конца не убирается. Гарнитура с направленным микрофоном и кнопка push-to-talk дают больше, чем модель покрупнее. На участке железо влияет на итоговую точность сильнее выбора архитектуры.
  6. Запись разговоров — правовой вопрос, а не технический. Нужны уведомление собеседника, основание для обработки персональных данных и регламент хранения. Хранилище и сроки удаления мы настраиваем внутри контура, но решение о самой записи принимает ваш юрист.
  7. Ошибку считаем на ваших записях. Любая опубликованная цифра точности получена на чужом наборе данных. Перед пилотом мы берём ваши файлы, размечаем эталон и меряем ошибку на них — иначе сравнение моделей теряет смысл.

Как мы запускаем голосовой сценарий

Порядок один и тот же независимо от того, идёт речь о телефонии или о цехе. Сначала измеряем, потом выбираем, и только потом что-то внедряем.

01

Снимаем записи и меряем базу

Берём 100–200 реальных записей нужного типа, размечаем эталонную расшифровку и считаем текущую ошибку. Без этой цифры любое «стало лучше» остаётся вкусовщиной.

02

Подбираем модель под канал

Гоняем GigaAM-v3, T-one, Vosk и Whisper на ваших файлах, сравниваем ошибку, задержку и нагрузку. Выбираем не лучшую в среднем, а лучшую на вашем канале связи.

03

Добавляем словарь и постобработку

Номенклатура, фамилии, аббревиатуры, форматы дат и сумм. Здесь же пунктуация, разделение по говорящим и приведение чисел к виду, который примет учётная система.

04

Встраиваем в рабочий контур

Телефония, почта, CRM, 1С, трекер задач. Голосовой ИИ пишет туда, где люди уже работают, и передаёт человеку всё, что не проходит порог уверенности.

05

Ставим на мониторинг

Дашборд по доле распознанного, задержке, числу эскалаций и промахам словаря. Раз в неделю разбираем худшие записи и правим словарь или пороги.

Что нужно из железа под голосовой ИИ

Разбор уже записанных файлов к железу нетребователен: записи становятся в очередь и обрабатываются ночью на общем GPU-узле контура. Отдельный сервер под голос в такой схеме обычно не нужен — он делит ресурс с текстовыми моделями, которые ночью почти простаивают.

Потоковое распознавание считается иначе. Нагрузка растёт с числом одновременных разговоров, поэтому запас закладывается по пиковому часу телефонии, а не по среднему за сутки. T-one при 70 млн параметров в этом смысле удобна: она заметно легче крупных моделей и позволяет держать больше параллельных сессий на той же карте.

Крайний случай — участок без сети. Там ставится мини-ПК с Vosk или T-one и локальным словарём, а синтез на Silero спокойно живёт на CPU. Как всё это стыкуется с остальным контуром и какие требования к серверу возникают на объёме, разобрано на странице локального ИИ, а состав стека — в каталоге открытых моделей.

Вопросы и ответы

Частые вопросы про голосовой ИИ на русском

Какая модель лучше распознаёт русскую речь — GigaAM-v3 или T-one?

Вопрос поставлен неверно: у них разные роли. GigaAM-v3 обучена на 700 тыс. часов русской речи и, по заявлению разработчиков, ошибается примерно вдвое реже Whisper-large-v3 — её берут, когда файл уже записан и время на обработку есть. T-one при 70 млн параметров работает потоково и уверенно держит телефонный канал с его сжатием и шумом, поэтому её ставят туда, где ответ нужен по ходу разговора. В проектах они часто живут рядом: одна на линии, вторая на ночном разборе записей. Финальный выбор делается замером на ваших записях, а не по чужим таблицам.

Нужен ли GPU, чтобы запустить голосовой ИИ?

Для разбора записей — да, но отдельный сервер обычно не требуется: файлы становятся в очередь на общий GPU-узел контура и обрабатываются ночью. Потоковое распознавание считается по пиковому часу телефонии, потому что нагрузка растёт с числом одновременных разговоров, а не с их суммарной длительностью. Лёгкие сценарии живут на CPU: короткие команды на складе через Vosk, озвучка уведомлений через Silero. Конфигурацию мы считаем на диагностике по вашему реальному трафику звонков и числу переговорных, а не по усреднённым рекомендациям из документации.

Законно ли записывать и расшифровывать разговоры сотрудников и клиентов?

Техническую часть мы закрываем: запись, распознавание и хранение разворачиваются внутри вашего контура, доступ к расшифровкам разграничен по ролям, удаление идёт по расписанию, каждое обращение к архиву журналируется. Юридическая часть остаётся за вами. Собеседника нужно уведомлять о записи, для обработки персональных данных требуется основание, а голос и содержание разговора — это персональные данные. Отдельно оформляется согласие сотрудников на прослушивание их разговоров и определяются сроки хранения. Мы даём инструменты и настройки, но решение о самой записи принимает ваш юрист.

Насколько точно система делит запись по говорящим?

Зависит от того, как записывали. Телефонный разговор обычно приходит двумя отдельными каналами — там разделение почти безошибочное. Совещание, снятое одним микрофоном в комнате, даёт худший результат: перебивания, эхо, несколько голосов одновременно. На таких файлах диаризация путается, и мы это закладываем в постановку: протокол собирается по содержанию решений, а не по формальной привязке каждой фразы к фамилии. Если разделение критично, вопрос решается петличными микрофонами или регламентом «говорим по очереди». Одним софтом эта проблема закрывается лишь частично.

Может ли голосовой ИИ полностью заменить оператора на линии?

На типовых обращениях — во многом да: в проекте по автоматизации бронирования 92% заявок закрывается без участия оператора. Но это заявки с понятной структурой: проверить доступность, посчитать стоимость, подтвердить. Как только разговор уходит в конфликт, нестандартные условия или эмоции, сценарий обязан передать человека вместе с расшифровкой и историей обращения. Иначе экономия на минуте разговора оборачивается потерей клиента. Мы всегда закладываем порог уверенности и правило эскалации, а полностью безлюдную линию не проектируем — на длинном горизонте она обходится дороже.

Сколько времени занимает запуск голосового сценария?

Диагностика с замером на ваших записях — несколько дней. Пилот одного сценария укладывается в 2–4 недели: подбор модели, словарь номенклатуры, постобработка, интеграция с телефонией или трекером, замер ошибки до и после. Дальше сценарий расширяется итерациями по 1–2 недели: новые типы обращений, дополнительные поля в учётной системе, новые площадки. Дольше всего в таких проектах идёт не техника, а согласования — регламент записи разговоров и доступы к телефонии на вашей стороне. Об этом стоит договориться до старта, иначе пилот встанет на организационном шаге.

Первый шаг

Бесплатный аудит: посчитаем эффект внедрения ИИ на ваших цифрах

30–40 минут разбора: смотрим ваши процессы, отмечаем, что можно передать ИИ, считаем ROI-модель на ваших объёмах и сроках. Вы уходите с расчётом и картой внедрения — даже если работать дальше не будете.

Нажимая кнопку, вы соглашаетесь с политикой обработки данных. Отвечаем в течение одного рабочего дня.