Приём и разбор звонков
Система снимает поток с телефонии, распознаёт реплики по ходу разговора, вытаскивает суть обращения и заводит его в CRM. Типовое закрывает сама, спорное переводит на человека вместе с готовой расшифровкой.
Голосовой ИИ — это связка распознавания речи, языковой модели и синтеза, развёрнутая на вашем сервере. Он принимает звонки, расшифровывает планёрки, размечает разговоры менеджеров по чек-листу и отвечает голосом. Русскую речь распознаём на GigaAM-v3 и T-one, синтезируем на Silero. Записи и расшифровки остаются внутри контура: во внешние сервисы не уходит ни один файл.
Голос имеет смысл там, где речь уже есть и её никто не обрабатывает: разговоры менеджеров слушают выборочно, протоколы планёрок пишут вручную, а на складе набирать текст просто нечем.
Система снимает поток с телефонии, распознаёт реплики по ходу разговора, вытаскивает суть обращения и заводит его в CRM. Типовое закрывает сама, спорное переводит на человека вместе с готовой расшифровкой.
Запись превращается в текст с разделением по говорящим, поверх текста собирается протокол: решения, поручения, сроки. Поручения уходят задачами в трекер или воронку.
ИИ внутри Битрикс24Модель слушает все разговоры менеджеров, а не десять записей в месяц. Проверка по чек-листу: поздоровался, выявил потребность, назвал цену, договорился о следующем шаге.
ИИ в отделе продажРуки заняты, на руках перчатки, вокруг шум. Сотрудник говорит — система пишет: приёмка, брак, замер, статус наряда. Работает на мини-ПК прямо на участке, интернет не нужен.
Синтез на Silero: подтверждение записи, напоминание о визите, зачитывание инструкции. Голос стоит на том же сервере, что и текстовая часть, отдельного облака не требуется.
Диктовка вместо набора: заявка, отчёт мастера, комментарий к сделке. Текст сразу нормализуется под поля системы — числа, даты и артикулы приводятся к нужному формату.
ИИ и 1СВсе модели ниже — с открытыми весами и разворачиваются локально. Одна универсальная не закрывает всё: телефония, переговорная и цех — три разные акустические задачи.
Обучена на 700 тыс. часов русской речи. По заявлению разработчиков, ошибается примерно вдвое реже Whisper-large-v3 на русском. Наш вариант по умолчанию для разбора уже записанных файлов: звонки за день, совещания, диктофонные записи.
Открытые веса70 млн параметров, потоковая архитектура. В открытых тестах на телефонии показывает себя сильно на сжатом и шумном сигнале. Берём, когда ответ нужен по ходу разговора, а не через минуту после него.
ПотоковаяЛёгкое офлайн-распознавание для слабого железа: промышленные мини-ПК, терминалы сбора данных, участки без сети. Точность ниже, но для коротких команд и словаря в пару сотен фраз её хватает.
ОфлайнДержим как запасной вариант и для многоязычных записей. На русском проигрывает GigaAM-v3, зато ровно тянет десятки языков — полезно, когда в разговорах участвуют подрядчики из других стран.
МногоязычнаяСинтез речи. Русский голос, управление скоростью и паузами, работа на обычном CPU. Используем для озвучки ответов, голосовых меню и уведомлений — там, где текст нужно произнести, а не показать.
СинтезВыбор модели определяется каналом связи и тем, сколько секунд у системы есть на ответ. Ниже — как мы обычно раскладываем сценарии по стеку.
| Сценарий | Модель | Задержка | Где ставится |
|---|---|---|---|
| Приём и маршрутизация входящего звонка | T-one + Silero | До секунды на реплику, иначе слышна пауза | Узел рядом с телефонией, GPU |
| Разбор записей звонков за день | GigaAM-v3 | Не критична, очередь на ночь | Общий GPU-узел контура |
| Расшифровка встречи и протокол | GigaAM-v3 + диаризация | Минуты после окончания встречи | Тот же узел, отдельная очередь |
| Контроль качества по чек-листу | GigaAM-v3 + Qwen или GigaChat | Часы, отчёт к утру | Узел с текстовой моделью |
| Ассистент на складе и в цехе | T-one или Vosk локально | 1–2 секунды, работа без сети | Мини-ПК на участке |
| Озвучка ответов и уведомлений | Silero | Доли секунды на короткую фразу | Тот же сервис, что и текст |
| Записи на нескольких языках | Whisper large-v3 | Не критична, батч | Общий GPU-узел контура |
Демо на чистой студийной записи выглядит убедительно у любого подрядчика. Проблемы начинаются на реальном материале, и вот они — по частоте появления в проектах.
Порядок один и тот же независимо от того, идёт речь о телефонии или о цехе. Сначала измеряем, потом выбираем, и только потом что-то внедряем.
Берём 100–200 реальных записей нужного типа, размечаем эталонную расшифровку и считаем текущую ошибку. Без этой цифры любое «стало лучше» остаётся вкусовщиной.
Гоняем GigaAM-v3, T-one, Vosk и Whisper на ваших файлах, сравниваем ошибку, задержку и нагрузку. Выбираем не лучшую в среднем, а лучшую на вашем канале связи.
Номенклатура, фамилии, аббревиатуры, форматы дат и сумм. Здесь же пунктуация, разделение по говорящим и приведение чисел к виду, который примет учётная система.
Телефония, почта, CRM, 1С, трекер задач. Голосовой ИИ пишет туда, где люди уже работают, и передаёт человеку всё, что не проходит порог уверенности.
Дашборд по доле распознанного, задержке, числу эскалаций и промахам словаря. Раз в неделю разбираем худшие записи и правим словарь или пороги.
Разбор уже записанных файлов к железу нетребователен: записи становятся в очередь и обрабатываются ночью на общем GPU-узле контура. Отдельный сервер под голос в такой схеме обычно не нужен — он делит ресурс с текстовыми моделями, которые ночью почти простаивают.
Потоковое распознавание считается иначе. Нагрузка растёт с числом одновременных разговоров, поэтому запас закладывается по пиковому часу телефонии, а не по среднему за сутки. T-one при 70 млн параметров в этом смысле удобна: она заметно легче крупных моделей и позволяет держать больше параллельных сессий на той же карте.
Крайний случай — участок без сети. Там ставится мини-ПК с Vosk или T-one и локальным словарём, а синтез на Silero спокойно живёт на CPU. Как всё это стыкуется с остальным контуром и какие требования к серверу возникают на объёме, разобрано на странице локального ИИ, а состав стека — в каталоге открытых моделей.
Вопрос поставлен неверно: у них разные роли. GigaAM-v3 обучена на 700 тыс. часов русской речи и, по заявлению разработчиков, ошибается примерно вдвое реже Whisper-large-v3 — её берут, когда файл уже записан и время на обработку есть. T-one при 70 млн параметров работает потоково и уверенно держит телефонный канал с его сжатием и шумом, поэтому её ставят туда, где ответ нужен по ходу разговора. В проектах они часто живут рядом: одна на линии, вторая на ночном разборе записей. Финальный выбор делается замером на ваших записях, а не по чужим таблицам.
Для разбора записей — да, но отдельный сервер обычно не требуется: файлы становятся в очередь на общий GPU-узел контура и обрабатываются ночью. Потоковое распознавание считается по пиковому часу телефонии, потому что нагрузка растёт с числом одновременных разговоров, а не с их суммарной длительностью. Лёгкие сценарии живут на CPU: короткие команды на складе через Vosk, озвучка уведомлений через Silero. Конфигурацию мы считаем на диагностике по вашему реальному трафику звонков и числу переговорных, а не по усреднённым рекомендациям из документации.
Техническую часть мы закрываем: запись, распознавание и хранение разворачиваются внутри вашего контура, доступ к расшифровкам разграничен по ролям, удаление идёт по расписанию, каждое обращение к архиву журналируется. Юридическая часть остаётся за вами. Собеседника нужно уведомлять о записи, для обработки персональных данных требуется основание, а голос и содержание разговора — это персональные данные. Отдельно оформляется согласие сотрудников на прослушивание их разговоров и определяются сроки хранения. Мы даём инструменты и настройки, но решение о самой записи принимает ваш юрист.
Зависит от того, как записывали. Телефонный разговор обычно приходит двумя отдельными каналами — там разделение почти безошибочное. Совещание, снятое одним микрофоном в комнате, даёт худший результат: перебивания, эхо, несколько голосов одновременно. На таких файлах диаризация путается, и мы это закладываем в постановку: протокол собирается по содержанию решений, а не по формальной привязке каждой фразы к фамилии. Если разделение критично, вопрос решается петличными микрофонами или регламентом «говорим по очереди». Одним софтом эта проблема закрывается лишь частично.
На типовых обращениях — во многом да: в проекте по автоматизации бронирования 92% заявок закрывается без участия оператора. Но это заявки с понятной структурой: проверить доступность, посчитать стоимость, подтвердить. Как только разговор уходит в конфликт, нестандартные условия или эмоции, сценарий обязан передать человека вместе с расшифровкой и историей обращения. Иначе экономия на минуте разговора оборачивается потерей клиента. Мы всегда закладываем порог уверенности и правило эскалации, а полностью безлюдную линию не проектируем — на длинном горизонте она обходится дороже.
Диагностика с замером на ваших записях — несколько дней. Пилот одного сценария укладывается в 2–4 недели: подбор модели, словарь номенклатуры, постобработка, интеграция с телефонией или трекером, замер ошибки до и после. Дальше сценарий расширяется итерациями по 1–2 недели: новые типы обращений, дополнительные поля в учётной системе, новые площадки. Дольше всего в таких проектах идёт не техника, а согласования — регламент записи разговоров и доступы к телефонии на вашей стороне. Об этом стоит договориться до старта, иначе пилот встанет на организационном шаге.
30–40 минут разбора: смотрим ваши процессы, отмечаем, что можно передать ИИ, считаем ROI-модель на ваших объёмах и сроках. Вы уходите с расчётом и картой внедрения — даже если работать дальше не будете.