# Локальный ИИ на вашем сервере: железо, модели, контур

> Локальный ИИ в контуре компании: какое железо нужно под какие модели, что даёт квантизация, сколько стоит год против облака и когда on-premise не нужен.

- Источник: https://lokai.ru/lokalnyy-ii/
- Организация: Local AI — Внедрение ИИ в закрытом контуре
- Обновлено: 2026-08-07
- Раздел: Главная → Услуги → Локальный ИИ

---

Локальный ИИ — это модели, индексы и интерфейсы на вашем железе, без единого запроса наружу. Такой контур оправдан, когда данные нельзя выпускать за периметр или когда нагрузка постоянная и облачные счета растут линейно. Ниже — какое железо нужно под какие модели, что даёт квантизация, как считать экономику против облака и в каких случаях локальный ИИ вам не нужен.

- **0** — запросов уходит из локального контура во внешние сервисы
- **4–8** — недель до работающего пилота на вашем железе
- **16** — сервисов в поставке: 6 AI-отделов, координатор, аудит, мониторинг
- **×4** — во столько раз меньше VRAM нужно весам в 4 битах против FP16

## Что такое локальный ИИ и что входит в контур

Локальный ИИ — развёртывание всей цепочки на инфраструктуре заказчика: веса моделей, движок инференса, векторная база, оркестрация агентов, журналы и веб-интерфейс. Внешние API отключены на уровне сети, а не галочкой в настройках. Сервер может стоять в вашей серверной, в арендованной стойке или в выделенном контуре российского ЦОД — важно, что периметр контролируете вы.

Причин уходить в свой контур обычно три, и они редко про моду. Первая — данные: персональные, медицинские, коммерческая тайна, конструкторская документация. Вторая — экономика на объёме: облачный счёт растёт с каждым токеном, стоимость своего сервера зафиксирована в момент покупки. Третья — независимость: открытые веса скачиваются один раз, и отзыв доступа к репозиторию не выключает то, что уже развёрнуто.

На типовом проекте разворачивается 16 сервисов — шесть AI-отделов, координатор между ними, аудит и мониторинг. Код, данные и сервер принадлежат заказчику, условия выхода зафиксированы в договоре. Состав работ и вилки по деньгам разобраны на странице [внедрения под ключ](https://lokai.ru/vnedrenie-ii-pod-klyuch/), а список моделей — в [каталоге стека](https://lokai.ru/modeli/).

## Что чаще всего запускают в закрытом контуре

Сценарии, которые заказчики не готовы отдавать в чужое облако. Все шесть работают на открытых моделях и не требуют выхода в интернет.

### Работа с документами

Договоры, спецификации, акты, конструкторская документация. Модель извлекает поля, сверяет с шаблоном, готовит проект ответа. Ни один файл не покидает файловое хранилище компании.

### Ассистент по регламентам

Поиск с генерацией ответа по внутренней базе: инструкции, приказы, техкарты. Сотрудник спрашивает своими словами и получает ответ со ссылкой на конкретный пункт документа.

### Разбор звонков и переписки

Распознавание русской речи локальными GigaAM-v3 и T-one, разметка тем, контроль скрипта, сводка по менеджерам. Детали — на странице [голосового ИИ](https://lokai.ru/golosovoy-ii/).

### Первая линия поддержки

Классификация обращения, черновик ответа, маршрутизация на ответственного. Отправку подтверждает человек: необратимые действия остаются за людьми.

### Аналитика по внутренним данным

Запросы к хранилищу на естественном языке, автосборка отчётов, комментарии к отклонениям. Выгрузка данных наружу не требуется ни на одном шаге.

### Дообучение под вашу номенклатуру

Модель учится вашим формулировкам, кодам и сокращениям на ваших же архивах. Как устроен процесс — в разделе [дообучения моделей](https://lokai.ru/doobuchenie-modeley/).

## Какое железо нужно под какие модели

Требования зависят не от «мощности ИИ», а от трёх параметров: размер модели, разрядность весов и длина контекста при нужном числе параллельных пользователей. Ниже — рабочие ориентиры, с которых мы начинаем расчёт.

*Ориентиры для инференса в 4-битной квантизации; под дообучение памяти нужно в 2–3 раза больше*

| Класс задачи | Модель | VRAM | Примерная конфигурация |
|---|---|---|---|
| Классификация, извлечение полей, короткие ответы | 7–14B: Qwen, Gemma, Mistral, T-lite | 16–24 ГБ | Одна профессиональная GPU, 64 ГБ RAM, NVMe под индексы |
| Ассистент по базе регламентов с поиском | 24–32B: Qwen, GLM, Gemma | 24–48 ГБ | Одна карта на 48 ГБ либо две по 24 ГБ, 128 ГБ RAM |
| Агенты с инструментами, длинный контекст, код | 70B и выше: Llama, Qwen, GLM | 80–160 ГБ | 2–4 GPU по 48–80 ГБ, быстрый межкарточный обмен |
| Крупные MoE-модели уровня фронтира | DeepSeek, Kimi, GigaChat Ultra | от 300 ГБ | Серверный узел на 8 GPU либо CPU-инференс с очень большим RAM |
| Распознавание русской речи | GigaAM-v3, T-one, Vosk | 8–16 ГБ | Одна GPU среднего уровня; Vosk работает и без видеокарты |
| Синтез речи | Silero, открытые VITS | 4–8 ГБ | Младшая GPU, часть сценариев тянет процессор |
| Эмбеддинги и векторный поиск | multilingual-e5, BGE-M3, ru-en-RoSBERTa | 4–8 ГБ | Делит карту с другими сервисами, узкое место — диск и RAM |

## Квантизация: почему одна модель просит то 60, то 15 гигабайт

Квантизация — сжатие весов модели за счёт снижения разрядности. Именно она определяет, влезет ли модель в вашу карту, поэтому цифры «сколько нужно VRAM» без указания формата бессмысленны.

1. **FP16 — 2 байта на параметр.** Модель на 14 млрд параметров занимает около 28 ГБ только под веса. Сверху ложатся KV-кэш и активации.
2. **8 бит — 1 байт на параметр.** Те же 14B укладываются примерно в 14 ГБ. На большинстве прикладных задач потеря качества в пределах погрешности замера.
3. **4 бита (AWQ, GPTQ, GGUF Q4) — около 0,5 байта.** 14B превращаются в 7–8 ГБ, и модель помещается в одну карту. Самый ходовой формат для продуктивных внедрений.
4. **KV-кэш считается отдельно.** Он растёт с длиной контекста и числом одновременных запросов. На договорах в сотню страниц кэш съедает больше памяти, чем сами веса.
5. **Ниже 4 бит качество начинает сыпаться.** На задачах со строгим форматом — JSON, коды номенклатуры, суммы в документах — деградация видна раньше, чем в свободном тексте.
6. **Проверяем на ваших данных, а не на бенчмарках.** Перед выкаткой прогоняем набор реальных примеров в двух разрядностях и сравниваем точность, задержку и долю сломанного формата. Если 4 бита ломают структуру ответа — берём 8 и докупаем память.

## Локальный ИИ против облака: как считать на горизонте года

Спор «своё или облако» решается не идеологией, а профилем нагрузки. Мы заполняем эту таблицу вашими цифрами на бесплатной диагностике и показываем обе экономики рядом.

*Модель сравнения стоимости владения ИИ-контуром на горизонте 12 месяцев*

| Статья | Локальный контур | Облачный API |
|---|---|---|
| Стартовые вложения | GPU-сервер от 1,5–2 млн ₽ либо помесячная аренда мощностей | Ноль, оплата с первого запроса |
| Счёт при росте нагрузки | Не меняется: электричество, место в стойке, обслуживание | Растёт линейно — больше пользователей и контекста, больше токенов |
| Точка равенства | Считается на диагностике: объём запросов, длина контекста, срок амортизации | До этой точки облако дешевле, и мы об этом говорим прямо |
| Дообучение на своих данных | Без ограничений, включая полный fine-tuning | Ограничено политикой вендора и форматом данных |
| Где живут данные | Внутри периметра, внешний трафик закрыт | У провайдера, по его правилам хранения |
| Основной риск | Отказ железа — закрывается резервным узлом и снимками состояния | Смена тарифов, ограничение доступа, изменение модели без вашего согласия |
| Кто обслуживает | Ваш администратор плюс подписка на развитие, $2,5–5k в месяц | Провайдер, вы не управляете обновлениями |

## Контур безопасности: доступы, журналы, сегментация

Локальность сама по себе ничего не защищает. Внутренний контур закрывается теми же средствами, что и любая корпоративная система, и это отдельный слой работ в проекте.

### SSO и единая точка входа

Подключаемся к вашему каталогу пользователей. Отдельных паролей у ИИ-системы нет, увольнение сотрудника закрывает доступ автоматически.

### RBAC на уровне данных

Права наследуются от источника. Если у менеджера нет доступа к папке в документообороте, поиск не покажет ему фрагмент из неё даже в ответе модели.

### Журналирование каждого действия

Кто спросил, что ответила модель, какие документы попали в контекст, что сделал агент. Журнал пишется в хранилище, где записи нельзя изменить задним числом.

### Сегментация сети

GPU-узлы вынесены в отдельный сегмент, исходящий трафик в интернет закрыт по умолчанию, обновления приходят через контролируемое зеркало.

### Human-in-the-loop

Отправка письма, изменение документа, проводка в учётной системе — любое необратимое действие подтверждает человек. Это правило не отключается настройкой.

### Подписанные релизы и откат

Каждое обновление версионировано и криптографически подписано, проверено человеком перед раскаткой. Возврат к прежней версии — одним действием.

## Когда локальный ИИ не нужен — и мы об этом говорим

Отговариваем регулярно. Если ваш случай попадает в этот список, свой контур добавит расходов и не добавит эффекта.

- **Нет чувствительных данных.** Маркетинговые тексты, публичный контент, открытые справочники спокойно живут в облаке. Содержать под это сервер незачем.
- **Нагрузка редкая и неровная.** Несколько сотен запросов в месяц или пик раз в квартал — карта простаивает, а амортизация идёт.
- **Гипотеза ещё не проверена.** Проверять идею дешевле в облаке, если данные это позволяют. На пилоте важен ответ «работает или нет», а не место размещения — начните с [пилота на одном процессе](https://lokai.ru/vnedrenie-ii-v-biznes/).
- **Нужна модель на пределе возможностей.** Самые сильные закрытые модели на своём железе не поднять, а открытые аналоги требуют серверного узла на несколько GPU и соответствующего бюджета.
- **Некому обслуживать.** Свой контур — это дежурство, мониторинг, обновления и обновление базы знаний. Без администратора на вашей стороне или подписки на сопровождение система деградирует за пару месяцев.

## Частые вопросы про локальный ИИ

**Сколько стоит железо под локальный ИИ?**

Зависит от моделей и профиля нагрузки. Для одного сценария на модели в 7–14 млрд параметров в 4-битной квантизации хватает одной профессиональной карты — это нижняя граница, GPU-сервер от 1,5–2 млн ₽. Агентные сценарии с длинным контекстом требуют двух-четырёх карт и уводят конфигурацию заметно выше. Часто разумнее стартовать на аренде GPU в российском ЦОД, снять реальную нагрузку за пару месяцев и покупать железо уже под известный профиль. На диагностике мы считаем оба варианта на ваших цифрах и показываем, где проходит точка равенства.

**Можно развернуть на том железе, что уже есть в компании?**

Да, это частый вариант. Если есть свободные GPU, виртуализация или сервер, закупленный под другую задачу, начинаем с инвентаризации: модель карт, объём VRAM, версия драйверов, пропускная способность диска и сети. Обычно выясняется, что под пилот мощностей достаточно, а докупать нужно только оперативную память или быстрый диск под векторные индексы. Поставку нового железа предлагаем тогда, когда текущей конфигурации объективно не хватает под нужную длину контекста и число параллельных пользователей.

**Локальная модель будет заметно слабее облачной?**

На типовых корпоративных задачах разрыв меньше, чем ожидают. Извлечение полей из документов, классификация обращений, ответы по регламентам, черновики писем — здесь открытая модель на 14–32 млрд параметров с хорошо настроенным поиском работает на уровне облачной. Разрыв заметен на длинных цепочках рассуждения, сложном коде и редких доменах. Поэтому мы не выбираем модель по обещаниям: собираем набор реальных примеров вашего процесса и сравниваем кандидатов на нём. Что именно берём под какую задачу, разобрано в [каталоге открытых моделей](https://lokai.ru/modeli/).

**Что будет, если сервер выйдет из строя?**

Это главный риск своего контура, и его закрывают заранее. Минимум — резервный узел, на который переключается нагрузка, и регулярные снимки состояния: веса, индексы, конфигурация, журналы. Мониторинг следит за температурой, памятью и очередью запросов и предупреждает до отказа. Для критичных сценариев закладываем деградацию: если ИИ недоступен, процесс возвращается в ручной режим, а не встаёт целиком. Резервирование провайдера работает и в гибридной схеме — при сбое основного контура система переключается сама, если политика по данным это допускает.

**Локальный ИИ закрывает требования 152-ФЗ?**

Снимает самую тяжёлую часть — передачу персональных данных третьему лицу и за пределы страны. Но локальность не заменяет остальное: нужны согласия субъектов, регламент обработки, разграничение доступа, журналирование и меры защиты под нужный уровень защищённости. Мы передаём проектную документацию по контуру: где стоят узлы, какие данные куда попадают, кто имеет доступ, как ведутся журналы. Формальная аттестация и юридическая часть остаются за вашей службой ИБ или профильным подрядчиком. Тему разбираем подробнее в [материале про безопасность и 152-ФЗ](https://lokai.ru/blog/bezopasnost-ii-152-fz/).

**Кто обслуживает систему после сдачи проекта?**

Администратора на вашей стороне мы обучаем в ходе внедрения: он перезапускает сервисы, читает журналы, заводит пользователей, пополняет базу знаний. Развитием занимается подписка за $2,5–5 тыс. в месяц — еженедельные релизы с полным changelog, ручная проверка перед раскаткой, гейт на вашей стороне, мониторинг и SLA, новые сценарии. Подписку можно не брать: система остаётся работоспособной, код и данные ваши, условия выхода прописаны в договоре. Но без сопровождения контур перестаёт получать обновления моделей и правки под изменившиеся процессы.

---

Бесплатный аудит и расчёт окупаемости на ваших данных: https://lokai.ru/besplatnyy-audit-ii/

Почта: hello@lokai.ru · 123112, Москва, ММДЦ «Москва-Сити» · Пн–Пт, 09:00–19:00 МСК
