Работа с документами
Договоры, спецификации, акты, конструкторская документация. Модель извлекает поля, сверяет с шаблоном, готовит проект ответа. Ни один файл не покидает файловое хранилище компании.
Локальный ИИ — это модели, индексы и интерфейсы на вашем железе, без единого запроса наружу. Такой контур оправдан, когда данные нельзя выпускать за периметр или когда нагрузка постоянная и облачные счета растут линейно. Ниже — какое железо нужно под какие модели, что даёт квантизация, как считать экономику против облака и в каких случаях локальный ИИ вам не нужен.
Локальный ИИ — развёртывание всей цепочки на инфраструктуре заказчика: веса моделей, движок инференса, векторная база, оркестрация агентов, журналы и веб-интерфейс. Внешние API отключены на уровне сети, а не галочкой в настройках. Сервер может стоять в вашей серверной, в арендованной стойке или в выделенном контуре российского ЦОД — важно, что периметр контролируете вы.
Причин уходить в свой контур обычно три, и они редко про моду. Первая — данные: персональные, медицинские, коммерческая тайна, конструкторская документация. Вторая — экономика на объёме: облачный счёт растёт с каждым токеном, стоимость своего сервера зафиксирована в момент покупки. Третья — независимость: открытые веса скачиваются один раз, и отзыв доступа к репозиторию не выключает то, что уже развёрнуто.
На типовом проекте разворачивается 16 сервисов — шесть AI-отделов, координатор между ними, аудит и мониторинг. Код, данные и сервер принадлежат заказчику, условия выхода зафиксированы в договоре. Состав работ и вилки по деньгам разобраны на странице внедрения под ключ, а список моделей — в каталоге стека.
Сценарии, которые заказчики не готовы отдавать в чужое облако. Все шесть работают на открытых моделях и не требуют выхода в интернет.
Договоры, спецификации, акты, конструкторская документация. Модель извлекает поля, сверяет с шаблоном, готовит проект ответа. Ни один файл не покидает файловое хранилище компании.
Поиск с генерацией ответа по внутренней базе: инструкции, приказы, техкарты. Сотрудник спрашивает своими словами и получает ответ со ссылкой на конкретный пункт документа.
Распознавание русской речи локальными GigaAM-v3 и T-one, разметка тем, контроль скрипта, сводка по менеджерам. Детали — на странице голосового ИИ.
Классификация обращения, черновик ответа, маршрутизация на ответственного. Отправку подтверждает человек: необратимые действия остаются за людьми.
Запросы к хранилищу на естественном языке, автосборка отчётов, комментарии к отклонениям. Выгрузка данных наружу не требуется ни на одном шаге.
Модель учится вашим формулировкам, кодам и сокращениям на ваших же архивах. Как устроен процесс — в разделе дообучения моделей.
Требования зависят не от «мощности ИИ», а от трёх параметров: размер модели, разрядность весов и длина контекста при нужном числе параллельных пользователей. Ниже — рабочие ориентиры, с которых мы начинаем расчёт.
| Класс задачи | Модель | VRAM | Примерная конфигурация |
|---|---|---|---|
| Классификация, извлечение полей, короткие ответы | 7–14B: Qwen, Gemma, Mistral, T-lite | 16–24 ГБ | Одна профессиональная GPU, 64 ГБ RAM, NVMe под индексы |
| Ассистент по базе регламентов с поиском | 24–32B: Qwen, GLM, Gemma | 24–48 ГБ | Одна карта на 48 ГБ либо две по 24 ГБ, 128 ГБ RAM |
| Агенты с инструментами, длинный контекст, код | 70B и выше: Llama, Qwen, GLM | 80–160 ГБ | 2–4 GPU по 48–80 ГБ, быстрый межкарточный обмен |
| Крупные MoE-модели уровня фронтира | DeepSeek, Kimi, GigaChat Ultra | от 300 ГБ | Серверный узел на 8 GPU либо CPU-инференс с очень большим RAM |
| Распознавание русской речи | GigaAM-v3, T-one, Vosk | 8–16 ГБ | Одна GPU среднего уровня; Vosk работает и без видеокарты |
| Синтез речи | Silero, открытые VITS | 4–8 ГБ | Младшая GPU, часть сценариев тянет процессор |
| Эмбеддинги и векторный поиск | multilingual-e5, BGE-M3, ru-en-RoSBERTa | 4–8 ГБ | Делит карту с другими сервисами, узкое место — диск и RAM |
Квантизация — сжатие весов модели за счёт снижения разрядности. Именно она определяет, влезет ли модель в вашу карту, поэтому цифры «сколько нужно VRAM» без указания формата бессмысленны.
Спор «своё или облако» решается не идеологией, а профилем нагрузки. Мы заполняем эту таблицу вашими цифрами на бесплатной диагностике и показываем обе экономики рядом.
| Статья | Локальный контур | Облачный API |
|---|---|---|
| Стартовые вложения | GPU-сервер от 1,5–2 млн ₽ либо помесячная аренда мощностей | Ноль, оплата с первого запроса |
| Счёт при росте нагрузки | Не меняется: электричество, место в стойке, обслуживание | Растёт линейно — больше пользователей и контекста, больше токенов |
| Точка равенства | Считается на диагностике: объём запросов, длина контекста, срок амортизации | До этой точки облако дешевле, и мы об этом говорим прямо |
| Дообучение на своих данных | Без ограничений, включая полный fine-tuning | Ограничено политикой вендора и форматом данных |
| Где живут данные | Внутри периметра, внешний трафик закрыт | У провайдера, по его правилам хранения |
| Основной риск | Отказ железа — закрывается резервным узлом и снимками состояния | Смена тарифов, ограничение доступа, изменение модели без вашего согласия |
| Кто обслуживает | Ваш администратор плюс подписка на развитие, $2,5–5k в месяц | Провайдер, вы не управляете обновлениями |
Локальность сама по себе ничего не защищает. Внутренний контур закрывается теми же средствами, что и любая корпоративная система, и это отдельный слой работ в проекте.
Подключаемся к вашему каталогу пользователей. Отдельных паролей у ИИ-системы нет, увольнение сотрудника закрывает доступ автоматически.
Права наследуются от источника. Если у менеджера нет доступа к папке в документообороте, поиск не покажет ему фрагмент из неё даже в ответе модели.
Кто спросил, что ответила модель, какие документы попали в контекст, что сделал агент. Журнал пишется в хранилище, где записи нельзя изменить задним числом.
GPU-узлы вынесены в отдельный сегмент, исходящий трафик в интернет закрыт по умолчанию, обновления приходят через контролируемое зеркало.
Отправка письма, изменение документа, проводка в учётной системе — любое необратимое действие подтверждает человек. Это правило не отключается настройкой.
Каждое обновление версионировано и криптографически подписано, проверено человеком перед раскаткой. Возврат к прежней версии — одним действием.
Отговариваем регулярно. Если ваш случай попадает в этот список, свой контур добавит расходов и не добавит эффекта.
Зависит от моделей и профиля нагрузки. Для одного сценария на модели в 7–14 млрд параметров в 4-битной квантизации хватает одной профессиональной карты — это нижняя граница, GPU-сервер от 1,5–2 млн ₽. Агентные сценарии с длинным контекстом требуют двух-четырёх карт и уводят конфигурацию заметно выше. Часто разумнее стартовать на аренде GPU в российском ЦОД, снять реальную нагрузку за пару месяцев и покупать железо уже под известный профиль. На диагностике мы считаем оба варианта на ваших цифрах и показываем, где проходит точка равенства.
Да, это частый вариант. Если есть свободные GPU, виртуализация или сервер, закупленный под другую задачу, начинаем с инвентаризации: модель карт, объём VRAM, версия драйверов, пропускная способность диска и сети. Обычно выясняется, что под пилот мощностей достаточно, а докупать нужно только оперативную память или быстрый диск под векторные индексы. Поставку нового железа предлагаем тогда, когда текущей конфигурации объективно не хватает под нужную длину контекста и число параллельных пользователей.
На типовых корпоративных задачах разрыв меньше, чем ожидают. Извлечение полей из документов, классификация обращений, ответы по регламентам, черновики писем — здесь открытая модель на 14–32 млрд параметров с хорошо настроенным поиском работает на уровне облачной. Разрыв заметен на длинных цепочках рассуждения, сложном коде и редких доменах. Поэтому мы не выбираем модель по обещаниям: собираем набор реальных примеров вашего процесса и сравниваем кандидатов на нём. Что именно берём под какую задачу, разобрано в каталоге открытых моделей.
Это главный риск своего контура, и его закрывают заранее. Минимум — резервный узел, на который переключается нагрузка, и регулярные снимки состояния: веса, индексы, конфигурация, журналы. Мониторинг следит за температурой, памятью и очередью запросов и предупреждает до отказа. Для критичных сценариев закладываем деградацию: если ИИ недоступен, процесс возвращается в ручной режим, а не встаёт целиком. Резервирование провайдера работает и в гибридной схеме — при сбое основного контура система переключается сама, если политика по данным это допускает.
Снимает самую тяжёлую часть — передачу персональных данных третьему лицу и за пределы страны. Но локальность не заменяет остальное: нужны согласия субъектов, регламент обработки, разграничение доступа, журналирование и меры защиты под нужный уровень защищённости. Мы передаём проектную документацию по контуру: где стоят узлы, какие данные куда попадают, кто имеет доступ, как ведутся журналы. Формальная аттестация и юридическая часть остаются за вашей службой ИБ или профильным подрядчиком. Тему разбираем подробнее в материале про безопасность и 152-ФЗ.
Администратора на вашей стороне мы обучаем в ходе внедрения: он перезапускает сервисы, читает журналы, заводит пользователей, пополняет базу знаний. Развитием занимается подписка за $2,5–5 тыс. в месяц — еженедельные релизы с полным changelog, ручная проверка перед раскаткой, гейт на вашей стороне, мониторинг и SLA, новые сценарии. Подписку можно не брать: система остаётся работоспособной, код и данные ваши, условия выхода прописаны в договоре. Но без сопровождения контур перестаёт получать обновления моделей и правки под изменившиеся процессы.
30–40 минут разбора: смотрим ваши процессы, отмечаем, что можно передать ИИ, считаем ROI-модель на ваших объёмах и сроках. Вы уходите с расчётом и картой внедрения — даже если работать дальше не будете.