Local AI
Внедрение ИИ в закрытом контуре
Бесплатный аудит
Услуги

Локальный ИИ на вашем сервере: железо, модели, контур

Локальный ИИ — это модели, индексы и интерфейсы на вашем железе, без единого запроса наружу. Такой контур оправдан, когда данные нельзя выпускать за периметр или когда нагрузка постоянная и облачные счета растут линейно. Ниже — какое железо нужно под какие модели, что даёт квантизация, как считать экономику против облака и в каких случаях локальный ИИ вам не нужен.

0запросов уходит из локального контура во внешние сервисы
4–8недель до работающего пилота на вашем железе
16сервисов в поставке: 6 AI-отделов, координатор, аудит, мониторинг
×4во столько раз меньше VRAM нужно весам в 4 битах против FP16

Что такое локальный ИИ и что входит в контур

Локальный ИИ — развёртывание всей цепочки на инфраструктуре заказчика: веса моделей, движок инференса, векторная база, оркестрация агентов, журналы и веб-интерфейс. Внешние API отключены на уровне сети, а не галочкой в настройках. Сервер может стоять в вашей серверной, в арендованной стойке или в выделенном контуре российского ЦОД — важно, что периметр контролируете вы.

Причин уходить в свой контур обычно три, и они редко про моду. Первая — данные: персональные, медицинские, коммерческая тайна, конструкторская документация. Вторая — экономика на объёме: облачный счёт растёт с каждым токеном, стоимость своего сервера зафиксирована в момент покупки. Третья — независимость: открытые веса скачиваются один раз, и отзыв доступа к репозиторию не выключает то, что уже развёрнуто.

На типовом проекте разворачивается 16 сервисов — шесть AI-отделов, координатор между ними, аудит и мониторинг. Код, данные и сервер принадлежат заказчику, условия выхода зафиксированы в договоре. Состав работ и вилки по деньгам разобраны на странице внедрения под ключ, а список моделей — в каталоге стека.

Что чаще всего запускают в закрытом контуре

Сценарии, которые заказчики не готовы отдавать в чужое облако. Все шесть работают на открытых моделях и не требуют выхода в интернет.

01

Работа с документами

Договоры, спецификации, акты, конструкторская документация. Модель извлекает поля, сверяет с шаблоном, готовит проект ответа. Ни один файл не покидает файловое хранилище компании.

02

Ассистент по регламентам

Поиск с генерацией ответа по внутренней базе: инструкции, приказы, техкарты. Сотрудник спрашивает своими словами и получает ответ со ссылкой на конкретный пункт документа.

03

Разбор звонков и переписки

Распознавание русской речи локальными GigaAM-v3 и T-one, разметка тем, контроль скрипта, сводка по менеджерам. Детали — на странице голосового ИИ.

04

Первая линия поддержки

Классификация обращения, черновик ответа, маршрутизация на ответственного. Отправку подтверждает человек: необратимые действия остаются за людьми.

05

Аналитика по внутренним данным

Запросы к хранилищу на естественном языке, автосборка отчётов, комментарии к отклонениям. Выгрузка данных наружу не требуется ни на одном шаге.

06

Дообучение под вашу номенклатуру

Модель учится вашим формулировкам, кодам и сокращениям на ваших же архивах. Как устроен процесс — в разделе дообучения моделей.

Какое железо нужно под какие модели

Требования зависят не от «мощности ИИ», а от трёх параметров: размер модели, разрядность весов и длина контекста при нужном числе параллельных пользователей. Ниже — рабочие ориентиры, с которых мы начинаем расчёт.

Ориентиры для инференса в 4-битной квантизации; под дообучение памяти нужно в 2–3 раза больше
Класс задачиМодельVRAMПримерная конфигурация
Классификация, извлечение полей, короткие ответы7–14B: Qwen, Gemma, Mistral, T-lite16–24 ГБОдна профессиональная GPU, 64 ГБ RAM, NVMe под индексы
Ассистент по базе регламентов с поиском24–32B: Qwen, GLM, Gemma24–48 ГБОдна карта на 48 ГБ либо две по 24 ГБ, 128 ГБ RAM
Агенты с инструментами, длинный контекст, код70B и выше: Llama, Qwen, GLM80–160 ГБ2–4 GPU по 48–80 ГБ, быстрый межкарточный обмен
Крупные MoE-модели уровня фронтираDeepSeek, Kimi, GigaChat Ultraот 300 ГБСерверный узел на 8 GPU либо CPU-инференс с очень большим RAM
Распознавание русской речиGigaAM-v3, T-one, Vosk8–16 ГБОдна GPU среднего уровня; Vosk работает и без видеокарты
Синтез речиSilero, открытые VITS4–8 ГБМладшая GPU, часть сценариев тянет процессор
Эмбеддинги и векторный поискmultilingual-e5, BGE-M3, ru-en-RoSBERTa4–8 ГБДелит карту с другими сервисами, узкое место — диск и RAM

Квантизация: почему одна модель просит то 60, то 15 гигабайт

Квантизация — сжатие весов модели за счёт снижения разрядности. Именно она определяет, влезет ли модель в вашу карту, поэтому цифры «сколько нужно VRAM» без указания формата бессмысленны.

  1. FP16 — 2 байта на параметр. Модель на 14 млрд параметров занимает около 28 ГБ только под веса. Сверху ложатся KV-кэш и активации.
  2. 8 бит — 1 байт на параметр. Те же 14B укладываются примерно в 14 ГБ. На большинстве прикладных задач потеря качества в пределах погрешности замера.
  3. 4 бита (AWQ, GPTQ, GGUF Q4) — около 0,5 байта. 14B превращаются в 7–8 ГБ, и модель помещается в одну карту. Самый ходовой формат для продуктивных внедрений.
  4. KV-кэш считается отдельно. Он растёт с длиной контекста и числом одновременных запросов. На договорах в сотню страниц кэш съедает больше памяти, чем сами веса.
  5. Ниже 4 бит качество начинает сыпаться. На задачах со строгим форматом — JSON, коды номенклатуры, суммы в документах — деградация видна раньше, чем в свободном тексте.
  6. Проверяем на ваших данных, а не на бенчмарках. Перед выкаткой прогоняем набор реальных примеров в двух разрядностях и сравниваем точность, задержку и долю сломанного формата. Если 4 бита ломают структуру ответа — берём 8 и докупаем память.

Локальный ИИ против облака: как считать на горизонте года

Спор «своё или облако» решается не идеологией, а профилем нагрузки. Мы заполняем эту таблицу вашими цифрами на бесплатной диагностике и показываем обе экономики рядом.

Модель сравнения стоимости владения ИИ-контуром на горизонте 12 месяцев
СтатьяЛокальный контурОблачный API
Стартовые вложенияGPU-сервер от 1,5–2 млн ₽ либо помесячная аренда мощностейНоль, оплата с первого запроса
Счёт при росте нагрузкиНе меняется: электричество, место в стойке, обслуживаниеРастёт линейно — больше пользователей и контекста, больше токенов
Точка равенстваСчитается на диагностике: объём запросов, длина контекста, срок амортизацииДо этой точки облако дешевле, и мы об этом говорим прямо
Дообучение на своих данныхБез ограничений, включая полный fine-tuningОграничено политикой вендора и форматом данных
Где живут данныеВнутри периметра, внешний трафик закрытУ провайдера, по его правилам хранения
Основной рискОтказ железа — закрывается резервным узлом и снимками состоянияСмена тарифов, ограничение доступа, изменение модели без вашего согласия
Кто обслуживаетВаш администратор плюс подписка на развитие, $2,5–5k в месяцПровайдер, вы не управляете обновлениями

Контур безопасности: доступы, журналы, сегментация

Локальность сама по себе ничего не защищает. Внутренний контур закрывается теми же средствами, что и любая корпоративная система, и это отдельный слой работ в проекте.

SSO и единая точка входа

Подключаемся к вашему каталогу пользователей. Отдельных паролей у ИИ-системы нет, увольнение сотрудника закрывает доступ автоматически.

RBAC на уровне данных

Права наследуются от источника. Если у менеджера нет доступа к папке в документообороте, поиск не покажет ему фрагмент из неё даже в ответе модели.

Журналирование каждого действия

Кто спросил, что ответила модель, какие документы попали в контекст, что сделал агент. Журнал пишется в хранилище, где записи нельзя изменить задним числом.

Сегментация сети

GPU-узлы вынесены в отдельный сегмент, исходящий трафик в интернет закрыт по умолчанию, обновления приходят через контролируемое зеркало.

Human-in-the-loop

Отправка письма, изменение документа, проводка в учётной системе — любое необратимое действие подтверждает человек. Это правило не отключается настройкой.

Подписанные релизы и откат

Каждое обновление версионировано и криптографически подписано, проверено человеком перед раскаткой. Возврат к прежней версии — одним действием.

Когда локальный ИИ не нужен — и мы об этом говорим

Отговариваем регулярно. Если ваш случай попадает в этот список, свой контур добавит расходов и не добавит эффекта.

  • Нет чувствительных данных. Маркетинговые тексты, публичный контент, открытые справочники спокойно живут в облаке. Содержать под это сервер незачем.
  • Нагрузка редкая и неровная. Несколько сотен запросов в месяц или пик раз в квартал — карта простаивает, а амортизация идёт.
  • Гипотеза ещё не проверена. Проверять идею дешевле в облаке, если данные это позволяют. На пилоте важен ответ «работает или нет», а не место размещения — начните с пилота на одном процессе.
  • Нужна модель на пределе возможностей. Самые сильные закрытые модели на своём железе не поднять, а открытые аналоги требуют серверного узла на несколько GPU и соответствующего бюджета.
  • Некому обслуживать. Свой контур — это дежурство, мониторинг, обновления и обновление базы знаний. Без администратора на вашей стороне или подписки на сопровождение система деградирует за пару месяцев.
Вопросы и ответы

Частые вопросы про локальный ИИ

Сколько стоит железо под локальный ИИ?

Зависит от моделей и профиля нагрузки. Для одного сценария на модели в 7–14 млрд параметров в 4-битной квантизации хватает одной профессиональной карты — это нижняя граница, GPU-сервер от 1,5–2 млн ₽. Агентные сценарии с длинным контекстом требуют двух-четырёх карт и уводят конфигурацию заметно выше. Часто разумнее стартовать на аренде GPU в российском ЦОД, снять реальную нагрузку за пару месяцев и покупать железо уже под известный профиль. На диагностике мы считаем оба варианта на ваших цифрах и показываем, где проходит точка равенства.

Можно развернуть на том железе, что уже есть в компании?

Да, это частый вариант. Если есть свободные GPU, виртуализация или сервер, закупленный под другую задачу, начинаем с инвентаризации: модель карт, объём VRAM, версия драйверов, пропускная способность диска и сети. Обычно выясняется, что под пилот мощностей достаточно, а докупать нужно только оперативную память или быстрый диск под векторные индексы. Поставку нового железа предлагаем тогда, когда текущей конфигурации объективно не хватает под нужную длину контекста и число параллельных пользователей.

Локальная модель будет заметно слабее облачной?

На типовых корпоративных задачах разрыв меньше, чем ожидают. Извлечение полей из документов, классификация обращений, ответы по регламентам, черновики писем — здесь открытая модель на 14–32 млрд параметров с хорошо настроенным поиском работает на уровне облачной. Разрыв заметен на длинных цепочках рассуждения, сложном коде и редких доменах. Поэтому мы не выбираем модель по обещаниям: собираем набор реальных примеров вашего процесса и сравниваем кандидатов на нём. Что именно берём под какую задачу, разобрано в каталоге открытых моделей.

Что будет, если сервер выйдет из строя?

Это главный риск своего контура, и его закрывают заранее. Минимум — резервный узел, на который переключается нагрузка, и регулярные снимки состояния: веса, индексы, конфигурация, журналы. Мониторинг следит за температурой, памятью и очередью запросов и предупреждает до отказа. Для критичных сценариев закладываем деградацию: если ИИ недоступен, процесс возвращается в ручной режим, а не встаёт целиком. Резервирование провайдера работает и в гибридной схеме — при сбое основного контура система переключается сама, если политика по данным это допускает.

Локальный ИИ закрывает требования 152-ФЗ?

Снимает самую тяжёлую часть — передачу персональных данных третьему лицу и за пределы страны. Но локальность не заменяет остальное: нужны согласия субъектов, регламент обработки, разграничение доступа, журналирование и меры защиты под нужный уровень защищённости. Мы передаём проектную документацию по контуру: где стоят узлы, какие данные куда попадают, кто имеет доступ, как ведутся журналы. Формальная аттестация и юридическая часть остаются за вашей службой ИБ или профильным подрядчиком. Тему разбираем подробнее в материале про безопасность и 152-ФЗ.

Кто обслуживает систему после сдачи проекта?

Администратора на вашей стороне мы обучаем в ходе внедрения: он перезапускает сервисы, читает журналы, заводит пользователей, пополняет базу знаний. Развитием занимается подписка за $2,5–5 тыс. в месяц — еженедельные релизы с полным changelog, ручная проверка перед раскаткой, гейт на вашей стороне, мониторинг и SLA, новые сценарии. Подписку можно не брать: система остаётся работоспособной, код и данные ваши, условия выхода прописаны в договоре. Но без сопровождения контур перестаёт получать обновления моделей и правки под изменившиеся процессы.

Первый шаг

Бесплатный аудит: посчитаем эффект внедрения ИИ на ваших цифрах

30–40 минут разбора: смотрим ваши процессы, отмечаем, что можно передать ИИ, считаем ROI-модель на ваших объёмах и сроках. Вы уходите с расчётом и картой внедрения — даже если работать дальше не будете.

Нажимая кнопку, вы соглашаетесь с политикой обработки данных. Отвечаем в течение одного рабочего дня.