Local AI
Внедрение ИИ в закрытом контуре
Бесплатный аудит
Услуги

Открытые модели ИИ: каталог стека для локального контура

Мы собираем стек только из моделей с открытыми весами — их можно развернуть на вашем железе, дообучить на ваших данных и не зависеть от чужого API. Одной модели на всё не бывает: текст, речь и поиск закрываются разными семействами. Ниже — что берём под какую задачу, какие у моделей ограничения и что говорят их лицензии.

Как мы выбираем модель под задачу

Правило простое: одна модель на всё — плохая архитектура. Стек собирается из нескольких. Крупная LLM держит рассуждение и агентные сценарии, лёгкая закрывает массовую классификацию, отдельная модель распознаёт речь, отдельная считает эмбеддинги для поиска. Так дешевле по железу и предсказуемее по качеству: маленькая модель не срывается там, где от неё требуют только разметить обращение.

Берём только открытые веса. Их можно скачать один раз, развернуть внутри периметра, дообучить на своих данных и зафиксировать версию на годы вперёд. Закрытые API удобны для черновой проверки гипотезы, но не годятся там, где документы нельзя выпускать наружу или где нужна гарантия, что поведение модели завтра не изменится без вашего согласия.

Публичные рейтинги читаем как ориентир, а не как приговор. Они плохо переносятся на конкретный домен: модель с высоким местом в таблице может путаться в вашей номенклатуре, а скромная — уверенно держать формат ответа. Поэтому финальный выбор всегда делает прогон на ваших примерах, порядок описан в конце страницы. Требования к железу под каждый класс моделей разобраны на странице локального ИИ.

Текстовые и агентные модели

Основа стека. Размер выбирается по задаче: от 7–14 млрд параметров под массовые операции до 70B и MoE-архитектур под агентов с инструментами и длинным контекстом.

Qwen

Alibaba

Самое широкое семейство по размерам — от компактных моделей до MoE. Сильная мультиязычность, включая русский, есть отдельные сборки под код и под рассуждение. Рабочая лошадка большинства наших внедрений. Ограничение: редакция лицензии отличается у отдельных сборок, проверяем каждую перед продуктивом.

Apache 2.0

DeepSeek

DeepSeek

MoE-архитектура: на каждый запрос активируется малая часть параметров, поэтому качество высокое, а инференс дешевле, чем у плотной модели того же класса. Сильна на рассуждении и коде. Ограничение: полноразмерные версии требуют серверного узла с несколькими GPU, в одну карту не помещаются.

MIT и своя лицензия

GLM

Zhipu / Z.ai

Заточена под агентные сценарии: устойчивый вызов инструментов, длинные цепочки действий, приличный код. Берём, когда агент должен не отвечать, а делать — заводить задачи, готовить документы, ходить в системы. Ограничение: русский слабее, чем у Qwen и российских моделей, компенсируем промптом и дообучением.

MIT

Kimi

Moonshot AI

Очень длинный контекст и агентные способности. Уместна там, где в один запрос нужно положить договор со всеми приложениями или переписку за месяц целиком. Ограничение: тяжёлая по железу, экономически оправдана только при постоянном потоке таких задач, а не в разовых разборах.

Modified MIT

Llama

Meta

Самая обкатанная экосистема: инструменты дообучения, квантизации и сервинга поддерживают её в первую очередь, готовых рецептов больше всего. Ограничение: лицензия не пермиссивная — есть условия по применению, атрибуции и распространению производных; русский уступает специализированным моделям.

Llama Community

Gemma

Google

Компактные модели с хорошим соотношением качества к занимаемой памяти. Удобны для массовых операций на одной карте: классификация, извлечение полей, короткие ответы по инструкции. Ограничение: собственные условия использования вместо стандартной открытой лицензии и слабое место на длинных рассуждениях.

Gemma Terms

Mistral

Mistral AI

Быстрые и лёгкие модели, аккуратно ведут себя на европейских языках и в структурированном выводе. Хороши там, где важна задержка, а не глубина рассуждения. Ограничение: часть моделей семейства выпущена под исследовательской лицензией, в продуктив берём только пермиссивные сборки.

Apache 2.0 и MRL

GigaChat

Сбер

Российская модель, открытые веса версий Ultra и Lightning. Обучена с большой долей русскоязычных данных, уверенно держит деловой стиль, отраслевую терминологию и формат официальных документов. Ограничение: экосистема инструментов вокруг неё моложе, чем у Qwen и Llama, готовых рецептов дообучения меньше.

Открытые веса

T-lite и T-pro

Т-Банк

Компактные русскоязычные модели: T-lite под массовые задачи, T-pro под более сложные. Дают качественный русский при скромных требованиях к VRAM, что удобно для одной карты. Ограничение: узкий диапазон размеров — для агентов с длинным контекстом нужна модель крупнее.

Открытые веса

Русская речь: распознавание и синтез

Отдельный слой стека. Для русского языка выбор модели решает больше, чем для текста: разница между удачным и неудачным вариантом видна уже на первой сотне разобранных звонков.

GigaAM-v3

Сбер

Обучена на 700 тыс. часов русской речи. По заявлению разработчиков, на русском ошибается примерно вдвое реже, чем Whisper-large-v3. Наш вариант по умолчанию для расшифровки звонков и встреч. Ограничение: специализация на русском — для многоязычных записей нужна другая модель.

Открытые веса

T-one

Т-Банк

70 млн параметров, потоковое распознавание: отдаёт текст по ходу разговора, а не после его окончания. В открытых тестах на телефонии показывает себя сильно на шумных записях. Берём под сценарии реального времени. Ограничение: небольшой размер, на сложной лексике уступает крупным моделям.

Открытые веса

Vosk

Alpha Cephei

Лёгкие офлайн-модели, работают без видеокарты и на слабом железе. Годятся для терминалов, киосков, встроенных устройств и площадок, где нет ни стабильной сети, ни GPU. Ограничение: точность ниже современных нейросетевых моделей, длинные монологи и наложение голосов разбирает хуже.

Apache 2.0

Whisper

OpenAI

Мультиязычная модель с предсказуемым качеством на десятках языков. Держим как запасной вариант распознавания и как основной там, где записи смешанные по языкам. Ограничение: на чистом русском уступает GigaAM, на паузах и тишине склонна дописывать несуществующий текст.

MIT

Silero и открытые VITS

Silero и сообщество

Синтез речи: быстрый, экономный по ресурсам, часть сценариев работает без GPU. Используем для озвучки ответов, уведомлений и голосовых роботов. Ограничение: у отдельных сборок лицензия ограничивает коммерческое использование — редакцию проверяем до внедрения, а не после.

Открытые веса

Эмбеддинги и поиск по вашим данным

Качество ответа по вашим документам определяется поиском не меньше, чем размером LLM: если в контекст попал не тот фрагмент, никакая модель это не исправит.

multilingual-e5

Microsoft

Универсальные многоязычные эмбеддинги, аккуратно работают на смешанных русско-английских текстах. Есть несколько размеров, поэтому точность можно разменять на скорость и память. Ограничение: небольшая длина входа — длинные документы приходится резать на фрагменты и продумывать нарезку.

MIT

BGE-M3

BAAI

Гибридный поиск в одной модели: плотные и разреженные представления плюс мультивекторное сопоставление. Держит длинные фрагменты, что удобно для регламентов, договоров и техкарт. Ограничение: тяжелее обычных эмбеддеров, первичная индексация большой базы занимает заметно больше времени.

MIT

ru-en-RoSBERTa

ai-forever

Русско-английская модель для семантического поиска, кластеризации и поиска дублей. Компактная, экономит память на больших индексах и быстро отвечает. Ограничение: узкая языковая пара — если в базе есть документы на других языках, берём multilingual-e5 или BGE-M3.

Открытые веса

Какую модель берём под конкретную задачу

Таблица — отправная точка, а не догма. Финальный выбор делается прогоном на ваших данных, но начинаем мы всегда с этих связок.

Рабочие связки моделей по типам задач в локальном контуре
ЗадачаЧто берёмПочему
Ответы по внутренним регламентамQwen или Gemma 7–14B плюс BGE-M3Модель среднего размера справляется, если поиск отдаёт точный фрагмент; экономит VRAM
Агент с инструментами: почта, задачи, документыGLM, Qwen или DeepSeek от 30BНужен устойчивый вызов функций и длинный контекст, малые модели рвутся на цепочках
Русская деловая переписка и документыGigaChat, T-pro, QwenБольшая доля русского в обучении, реже путают падежи, термины и формат реквизитов
Разбор звонков колл-центраGigaAM-v3, T-oneGigaAM обучена на 700 тыс. часов русской речи, T-one держит поток и шум телефонии
Расшифровка встреч на нескольких языкахWhisperМультиязычность и предсказуемое качество; на чистом русском уступает GigaAM
Распознавание офлайн и на слабом железеVoskРаботает без GPU, подходит для терминалов, складов и площадок без стабильной сети
Озвучка ответов и уведомленийSilero, открытые VITSБыстрый синтез на скромных ресурсах; лицензию сборки проверяем до внедрения
Поиск по разнородной базе документовBGE-M3Гибрид плотного и разреженного поиска, спокойно держит длинные фрагменты
Семантический поиск и поиск дублейru-en-RoSBERTa, multilingual-e5Хорошо ложатся на смешанные русско-английские тексты, экономны на больших индексах
Внутренние скрипты и разбор кодаQwen, DeepSeekОтдельные сборки под код и устойчивое форматирование ответа без ручной чистки

«Открытые веса» — что это значит юридически

Открытые веса и открытый исходный код — разные вещи. Публикуются параметры модели и код инференса; обучающие данные и полный рецепт обучения не раскрывает почти никто. Воспроизвести модель с нуля вы не сможете. Скачать, развернуть у себя, дообучить и зафиксировать версию на годы — сможете, и именно это нужно для работы в закрытом контуре.

Лицензии делятся на три группы. Пермиссивные — Apache 2.0 и MIT: коммерческое использование, модификация и дообучение без дополнительных условий. Вендорские — Llama Community License, Gemma Terms of Use: коммерческое использование разрешено, но есть пункты про запрещённые применения, атрибуцию и порядок распространения производных моделей. Некоммерческие вроде CC BY-NC в продуктивные внедрения мы не берём вообще.

Два момента, о которых чаще всего забывают. Первый: дообученная модель наследует лицензию базовой — адаптер поверх Llama остаётся под условиями Llama. Второй: редакция лицензии меняется от сборки к сборке внутри одного семейства, поэтому проверять надо карточку конкретной версии, а не название модели вообще.

В проектной документации мы фиксируем по каждой модели точное имя сборки, дату загрузки, редакцию лицензии и хеш весов. Это же снимает санкционный риск: веса скачиваются один раз и живут у вас, закрытие доступа к репозиторию не выключает то, что уже развёрнуто. Как модельный стек встраивается в контур безопасности — на странице локального ИИ.

Как проверяем модель на ваших данных перед внедрением

Выбор по рейтингам мы не делаем. Порядок один и тот же на каждом проекте и занимает от нескольких дней до полутора недель внутри пилота.

  1. Собираем тестовый набор. 100–300 реальных примеров из вашего процесса с эталонными ответами, которые проверил профильный сотрудник. Без этого сравнивать нечего и спорить не о чем.
  2. Отбираем 3–4 кандидата. Разные семейства и разные размеры — обязательно и крупная модель, и компактная, чтобы увидеть, где заканчивается запас качества и начинается переплата за железо.
  3. Гоняем в равных условиях. Один промпт, один и тот же поиск, одна разрядность весов. Меряем точность, задержку, потребление VRAM и стоимость запроса в пересчёте на месяц работы.
  4. Проверяем устойчивость формата. Если на выходе нужен JSON, код номенклатуры или сумма из документа, считаем долю ответов, которые пришлось чинить руками. Часто именно это решает выбор.
  5. Считаем нагрузку. Пиковое число параллельных запросов, длина контекста, требуемая задержка ответа. Из этого получается конфигурация железа, а не наоборот.
  6. Решаем про дообучение. Если разрыв с эталоном держится на терминологии и формулировках, идём в дообучение на ваших данных, а не берём модель на порядок крупнее.
  7. Фиксируем версию. Сборка, хеш, лицензия, дата, результаты прогона — всё уходит в проектную документацию. Следующее обновление модели проходит тот же прогон, прежде чем попасть в продуктив.
Вопросы и ответы

Частые вопросы про открытые модели

Почему вы не работаете на закрытых облачных моделях?

Работаем — на этапе черновой проверки гипотезы, когда характер данных это допускает. Но в продуктив на закрытом API идти не готовы по трём причинам. Данные уходят к третьему лицу, и для персональных данных, медицинских записей или конструкторской документации это неприемлемо. Модель за API меняется без вашего согласия: то, что работало вчера, завтра отвечает иначе, а вернуть прежнюю версию нельзя. И доступ можно потерять — из-за санкций, смены условий или блокировки. Открытые веса снимают все три пункта сразу и делают поведение системы воспроизводимым.

Какая модель лучше для русского языка?

Для текста ровно работают Qwen, GigaChat и T-pro: все три обучены с большой долей русскоязычных данных и держат деловой стиль. Разница между ними на конкретном домене обычно меньше, чем разница между удачно и неудачно настроенным поиском по вашей базе. Для речи выбор яснее: GigaAM-v3, по заявлению разработчиков, ошибается на русском примерно вдвое реже Whisper-large-v3, а T-one лучше держит телефонию и потоковый режим. Ответ на вопрос «какая лучше» даёт прогон на ваших примерах, а не публичный рейтинг.

Насколько открытые модели отстают от закрытых?

Разрыв зависит от задачи, а не от общего места в рейтинге. На извлечении полей, классификации, ответах по регламентам и черновиках документов открытые модели среднего размера закрывают потребность полностью — упирается всё в качество поиска и промпта. На длинных цепочках рассуждения, сложном коде и редких доменах отставание ещё заметно; там помогают крупные MoE-модели вроде DeepSeek или Kimi, но они требуют серверного узла с несколькими GPU. Публиковать проценты отставания без ссылки на измерение мы не станем: на вашем домене они окажутся другими.

Можно дообучить открытую модель на наших данных?

Да, это одна из главных причин их выбирать. Обычно достаточно LoRA — адаптера поверх базовой модели: обучение занимает часы, а не недели, результат весит десятки мегабайт и откатывается одним действием. Полный fine-tuning берём, когда меняется сам стиль рассуждения, а не только лексика и номенклатура. Юридически важный момент: дообученная модель наследует лицензию базовой, поэтому под дообучение стараемся брать пермиссивные сборки. Требования к объёму и качеству данных разобраны на странице дообучения моделей.

Как часто нужно обновлять модели?

Реже, чем кажется. Развёрнутая модель не портится со временем и через год отвечает так же, как в день приёмки. Смысл обновляться появляется, когда новая версия семейства даёт заметный прирост на вашем тестовом наборе или когда меняется сам процесс. На практике это одно-два обновления в год. Каждое проходит тот же прогон на ваших примерах и ручную проверку перед раскаткой, версия фиксируется и подписывается, откат возможен одним действием. Менять работающую модель ради свежего релиза мы не предлагаем.

Сколько моделей одновременно крутится на сервере?

На типовом внедрении три-четыре. Крупная LLM под рассуждение и агентные сценарии, лёгкая под массовые операции вроде классификации обращений, эмбеддер под поиск и, если есть голосовые сценарии, модель распознавания речи. Полный объём памяти одновременно они не занимают: лёгкие модели делят карту, крупная получает выделенные ресурсы, загрузка балансируется оркестратором. Конкретный набор и требования к VRAM считаем на диагностике — разбор конфигураций и таблица по железу есть на странице локального ИИ.

Первый шаг

Бесплатный аудит: посчитаем эффект внедрения ИИ на ваших цифрах

30–40 минут разбора: смотрим ваши процессы, отмечаем, что можно передать ИИ, считаем ROI-модель на ваших объёмах и сроках. Вы уходите с расчётом и картой внедрения — даже если работать дальше не будете.

Нажимая кнопку, вы соглашаетесь с политикой обработки данных. Отвечаем в течение одного рабочего дня.