# Голосовой ИИ на русском языке — на вашем сервере

> Голосовой ИИ на открытых моделях GigaAM-v3, T-one и Silero: приём звонков, расшифровка встреч, контроль качества менеджеров. Всё работает внутри контура.

- Источник: https://lokai.ru/golosovoy-ii/
- Организация: Local AI — Внедрение ИИ в закрытом контуре
- Обновлено: 2026-08-07
- Раздел: Главная → Услуги → Голосовой ИИ

---

Голосовой ИИ — это связка распознавания речи, языковой модели и синтеза, развёрнутая на вашем сервере. Он принимает звонки, расшифровывает планёрки, размечает разговоры менеджеров по чек-листу и отвечает голосом. Русскую речь распознаём на GigaAM-v3 и T-one, синтезируем на Silero. Записи и расшифровки остаются внутри контура: во внешние сервисы не уходит ни один файл.

- **700 тыс.** — часов русской речи в обучении GigaAM-v3
- **70 млн** — параметров у потоковой T-one — сильна на телефонии
- **100%** — записей и расшифровок остаётся внутри контура
- **2–4** — недели на пилот одного голосового сценария

## Где голосовой ИИ окупается быстрее всего

Голос имеет смысл там, где речь уже есть и её никто не обрабатывает: разговоры менеджеров слушают выборочно, протоколы планёрок пишут вручную, а на складе набирать текст просто нечем.

### Приём и разбор звонков

Система снимает поток с телефонии, распознаёт реплики по ходу разговора, вытаскивает суть обращения и заводит его в CRM. Типовое закрывает сама, спорное переводит на человека вместе с готовой расшифровкой.

### Расшифровка встреч и планёрок

Запись превращается в текст с разделением по говорящим, поверх текста собирается протокол: решения, поручения, сроки. Поручения уходят задачами в трекер или воронку.

[ИИ внутри Битрикс24](https://lokai.ru/integratsiya-bitrix24/)

### Контроль качества разговоров

Модель слушает все разговоры менеджеров, а не десять записей в месяц. Проверка по чек-листу: поздоровался, выявил потребность, назвал цену, договорился о следующем шаге.

[ИИ в отделе продаж](https://lokai.ru/vnedrenie-ii-v-prodazhah/)

### Ассистент на складе и в цехе

Руки заняты, на руках перчатки, вокруг шум. Сотрудник говорит — система пишет: приёмка, брак, замер, статус наряда. Работает на мини-ПК прямо на участке, интернет не нужен.

### Озвучка ответов и уведомлений

Синтез на Silero: подтверждение записи, напоминание о визите, зачитывание инструкции. Голос стоит на том же сервере, что и текстовая часть, отдельного облака не требуется.

### Голосовой ввод в учётные системы

Диктовка вместо набора: заявка, отчёт мастера, комментарий к сделке. Текст сразу нормализуется под поля системы — числа, даты и артикулы приводятся к нужному формату.

[ИИ и 1С](https://lokai.ru/vnedrenie-ii-v-1s/)

## Модели для русской речи: что берём и почему

Все модели ниже — с открытыми весами и разворачиваются локально. Одна универсальная не закрывает всё: телефония, переговорная и цех — три разные акустические задачи.

### GigaAM-v3 (Сбер)

Обучена на 700 тыс. часов русской речи. По заявлению разработчиков, ошибается примерно вдвое реже Whisper-large-v3 на русском. Наш вариант по умолчанию для разбора уже записанных файлов: звонки за день, совещания, диктофонные записи.

Лицензия: Открытые веса

### T-one (Т-Банк)

70 млн параметров, потоковая архитектура. В открытых тестах на телефонии показывает себя сильно на сжатом и шумном сигнале. Берём, когда ответ нужен по ходу разговора, а не через минуту после него.

Лицензия: Потоковая

### Vosk (Alpha Cephei)

Лёгкое офлайн-распознавание для слабого железа: промышленные мини-ПК, терминалы сбора данных, участки без сети. Точность ниже, но для коротких команд и словаря в пару сотен фраз её хватает.

Лицензия: Офлайн

### Whisper (OpenAI)

Держим как запасной вариант и для многоязычных записей. На русском проигрывает GigaAM-v3, зато ровно тянет десятки языков — полезно, когда в разговорах участвуют подрядчики из других стран.

Лицензия: Многоязычная

### Silero (Silero)

Синтез речи. Русский голос, управление скоростью и паузами, работа на обычном CPU. Используем для озвучки ответов, голосовых меню и уведомлений — там, где текст нужно произнести, а не показать.

Лицензия: Синтез

## Сценарий, модель и требование к задержке

Выбор модели определяется каналом связи и тем, сколько секунд у системы есть на ответ. Ниже — как мы обычно раскладываем сценарии по стеку.

*Подбор модели распознавания и синтеза речи под голосовой сценарий*

| Сценарий | Модель | Задержка | Где ставится |
|---|---|---|---|
| Приём и маршрутизация входящего звонка | T-one + Silero | До секунды на реплику, иначе слышна пауза | Узел рядом с телефонией, GPU |
| Разбор записей звонков за день | GigaAM-v3 | Не критична, очередь на ночь | Общий GPU-узел контура |
| Расшифровка встречи и протокол | GigaAM-v3 + диаризация | Минуты после окончания встречи | Тот же узел, отдельная очередь |
| Контроль качества по чек-листу | GigaAM-v3 + Qwen или GigaChat | Часы, отчёт к утру | Узел с текстовой моделью |
| Ассистент на складе и в цехе | T-one или Vosk локально | 1–2 секунды, работа без сети | Мини-ПК на участке |
| Озвучка ответов и уведомлений | Silero | Доли секунды на короткую фразу | Тот же сервис, что и текст |
| Записи на нескольких языках | Whisper large-v3 | Не критична, батч | Общий GPU-узел контура |

## Подводные камни голосового ИИ, о которых говорят редко

Демо на чистой студийной записи выглядит убедительно у любого подрядчика. Проблемы начинаются на реальном материале, и вот они — по частоте появления в проектах.

1. **Диаризация — отдельная задача, а не опция.** Разделить говорящих на телефонном разговоре с двумя каналами легко. Совещание, записанное одним микрофоном в комнате, — худший случай: перебивания, эхо, три голоса разом. Ошибку разметки говорящих мы закладываем заранее и не строим на ней ничего юридически значимого.
2. **Пунктуация и заглавные буквы в звуке не содержатся.** Точки, запятые и регистр дорисовывает отдельный постпроцессор. На длинных сложных фразах он ошибается, поэтому расшифровка встречи — это черновик для человека, а не стенограмма под подпись.
3. **Первыми ломаются числа, артикулы и термины.** «Двадцать три сорок пять» — время, сумма или номер детали? Лечится словарём вашей номенклатуры и правилами нормализации, а если не хватает — [дообучением на ваших данных](https://lokai.ru/doobuchenie-modeley/). Без этого шага голосовой ввод в учётную систему бесполезен.
4. **Телефония режет частоты.** Кодек сжимает сигнал до узкой полосы, и модель, обученная на студийных записях, на нём проседает. Поэтому на линии мы начинаем с T-one, а не с самой «сильной» модели из чужой таблицы бенчмарков.
5. **Шум цеха софтом до конца не убирается.** Гарнитура с направленным микрофоном и кнопка push-to-talk дают больше, чем модель покрупнее. На участке железо влияет на итоговую точность сильнее выбора архитектуры.
6. **Запись разговоров — правовой вопрос, а не технический.** Нужны уведомление собеседника, основание для обработки персональных данных и регламент хранения. Хранилище и сроки удаления мы настраиваем внутри контура, но решение о самой записи принимает ваш юрист.
7. **Ошибку считаем на ваших записях.** Любая опубликованная цифра точности получена на чужом наборе данных. Перед пилотом мы берём ваши файлы, размечаем эталон и меряем ошибку на них — иначе сравнение моделей теряет смысл.

## Как мы запускаем голосовой сценарий

Порядок один и тот же независимо от того, идёт речь о телефонии или о цехе. Сначала измеряем, потом выбираем, и только потом что-то внедряем.

1. **Снимаем записи и меряем базу**  
   Берём 100–200 реальных записей нужного типа, размечаем эталонную расшифровку и считаем текущую ошибку. Без этой цифры любое «стало лучше» остаётся вкусовщиной.
2. **Подбираем модель под канал**  
   Гоняем GigaAM-v3, T-one, Vosk и Whisper на ваших файлах, сравниваем ошибку, задержку и нагрузку. Выбираем не лучшую в среднем, а лучшую на вашем канале связи.
3. **Добавляем словарь и постобработку**  
   Номенклатура, фамилии, аббревиатуры, форматы дат и сумм. Здесь же пунктуация, разделение по говорящим и приведение чисел к виду, который примет учётная система.
4. **Встраиваем в рабочий контур**  
   Телефония, почта, CRM, 1С, трекер задач. Голосовой ИИ пишет туда, где люди уже работают, и передаёт человеку всё, что не проходит порог уверенности.
5. **Ставим на мониторинг**  
   Дашборд по доле распознанного, задержке, числу эскалаций и промахам словаря. Раз в неделю разбираем худшие записи и правим словарь или пороги.

## Что нужно из железа под голосовой ИИ

Разбор уже записанных файлов к железу нетребователен: записи становятся в очередь и обрабатываются ночью на общем GPU-узле контура. Отдельный сервер под голос в такой схеме обычно не нужен — он делит ресурс с текстовыми моделями, которые ночью почти простаивают.

Потоковое распознавание считается иначе. Нагрузка растёт с числом одновременных разговоров, поэтому запас закладывается по пиковому часу телефонии, а не по среднему за сутки. T-one при 70 млн параметров в этом смысле удобна: она заметно легче крупных моделей и позволяет держать больше параллельных сессий на той же карте.

Крайний случай — участок без сети. Там ставится мини-ПК с Vosk или T-one и локальным словарём, а синтез на Silero спокойно живёт на CPU. Как всё это стыкуется с остальным контуром и какие требования к серверу возникают на объёме, разобрано на странице [локального ИИ](https://lokai.ru/lokalnyy-ii/), а состав стека — в [каталоге открытых моделей](https://lokai.ru/modeli/).

## Частые вопросы про голосовой ИИ на русском

**Какая модель лучше распознаёт русскую речь — GigaAM-v3 или T-one?**

Вопрос поставлен неверно: у них разные роли. GigaAM-v3 обучена на 700 тыс. часов русской речи и, по заявлению разработчиков, ошибается примерно вдвое реже Whisper-large-v3 — её берут, когда файл уже записан и время на обработку есть. T-one при 70 млн параметров работает потоково и уверенно держит телефонный канал с его сжатием и шумом, поэтому её ставят туда, где ответ нужен по ходу разговора. В проектах они часто живут рядом: одна на линии, вторая на ночном разборе записей. Финальный выбор делается замером на ваших записях, а не по чужим таблицам.

**Нужен ли GPU, чтобы запустить голосовой ИИ?**

Для разбора записей — да, но отдельный сервер обычно не требуется: файлы становятся в очередь на общий GPU-узел контура и обрабатываются ночью. Потоковое распознавание считается по пиковому часу телефонии, потому что нагрузка растёт с числом одновременных разговоров, а не с их суммарной длительностью. Лёгкие сценарии живут на CPU: короткие команды на складе через Vosk, озвучка уведомлений через Silero. Конфигурацию мы считаем на диагностике по вашему реальному трафику звонков и числу переговорных, а не по усреднённым рекомендациям из документации.

**Законно ли записывать и расшифровывать разговоры сотрудников и клиентов?**

Техническую часть мы закрываем: запись, распознавание и хранение разворачиваются внутри вашего контура, доступ к расшифровкам разграничен по ролям, удаление идёт по расписанию, каждое обращение к архиву журналируется. Юридическая часть остаётся за вами. Собеседника нужно уведомлять о записи, для обработки персональных данных требуется основание, а голос и содержание разговора — это персональные данные. Отдельно оформляется согласие сотрудников на прослушивание их разговоров и определяются сроки хранения. Мы даём инструменты и настройки, но решение о самой записи принимает ваш юрист.

**Насколько точно система делит запись по говорящим?**

Зависит от того, как записывали. Телефонный разговор обычно приходит двумя отдельными каналами — там разделение почти безошибочное. Совещание, снятое одним микрофоном в комнате, даёт худший результат: перебивания, эхо, несколько голосов одновременно. На таких файлах диаризация путается, и мы это закладываем в постановку: протокол собирается по содержанию решений, а не по формальной привязке каждой фразы к фамилии. Если разделение критично, вопрос решается петличными микрофонами или регламентом «говорим по очереди». Одним софтом эта проблема закрывается лишь частично.

**Может ли голосовой ИИ полностью заменить оператора на линии?**

На типовых обращениях — во многом да: в проекте по автоматизации бронирования 92% заявок закрывается без участия оператора. Но это заявки с понятной структурой: проверить доступность, посчитать стоимость, подтвердить. Как только разговор уходит в конфликт, нестандартные условия или эмоции, сценарий обязан передать человека вместе с расшифровкой и историей обращения. Иначе экономия на минуте разговора оборачивается потерей клиента. Мы всегда закладываем порог уверенности и правило эскалации, а полностью безлюдную линию не проектируем — на длинном горизонте она обходится дороже.

**Сколько времени занимает запуск голосового сценария?**

Диагностика с замером на ваших записях — несколько дней. Пилот одного сценария укладывается в 2–4 недели: подбор модели, словарь номенклатуры, постобработка, интеграция с телефонией или трекером, замер ошибки до и после. Дальше сценарий расширяется итерациями по 1–2 недели: новые типы обращений, дополнительные поля в учётной системе, новые площадки. Дольше всего в таких проектах идёт не техника, а согласования — регламент записи разговоров и доступы к телефонии на вашей стороне. Об этом стоит договориться до старта, иначе пилот встанет на организационном шаге.

---

Бесплатный аудит и расчёт окупаемости на ваших данных: https://lokai.ru/besplatnyy-audit-ii/

Почта: hello@lokai.ru · 123112, Москва, ММДЦ «Москва-Сити» · Пн–Пт, 09:00–19:00 МСК
