Local AI
Внедрение ИИ в закрытом контуре
Бесплатный аудит
Дообучение

Дообучение моделей под задачи и язык вашей компании

Дообучение моделей нужно не всегда. В большинстве задач сначала помогает грамотный промпт с правилами, потом RAG по вашей базе знаний, и только если модель всё равно путает термины, формат и логику решений, мы обучаем её на ваших данных — LoRA или QLoRA, реже полный тюнинг. Обучение идёт на вашем сервере: датасет и веса не покидают контур.

Три уровня настройки: правила, RAG, дообучение моделей

Между «модель отвечает мимо» и «нужно переобучать веса» лежат два более дешёвых шага. Пропускать их невыгодно: они закрывают заметную часть претензий за дни, а не за недели.

01

Промпт и правила

Системная инструкция, примеры удачных ответов, жёсткая схема вывода. Закрывает тон, формат и границы: о чём модель говорит, о чём молчит, когда зовёт человека. День-два работы, правится без остановки сервиса.

02

RAG по базе знаний

Модель получает нужный фрагмент ваших регламентов прямо в момент ответа и ссылается на источник. Поменялся документ — поменялся ответ, переобучать ничего не надо.

Как это работает у цифровых сотрудников
03

Дообучение весов

LoRA или QLoRA поверх открытой модели, реже полный тюнинг. Нужно, когда важен не факт из документа, а навык: стабильно принимать однотипное решение, держать формат, говорить языком вашей отрасли.

Каталог открытых моделей

Почему дообучение моделей — не первый шаг

Запрос обычно звучит одинаково: «обучите модель на наших данных». Чаще всего за ним стоит другая проблема — модель просто не видит нужный документ в момент ответа. Это лечится поиском и правилами, а не обучением, и обходится в разы дешевле.

У тюнинга есть неприятное свойство: он зашивает знание в веса. Обновился регламент — веса устарели, нужен новый цикл обучения, новая проверка и новый выкат. RAG обновляется за время индексации документа, а откатывается удалением одного файла из базы.

Обратная сторона тоже есть. Поиск по документам не научит модель принимать решение: если правильный ответ нигде не записан и эксперт выводит его из опыта, никакой индекс не поможет. То же с форматом — когда модель раз за разом ломает структуру вывода, хотя правила ей даны прямым текстом.

Отсюда рабочий порядок: правила, потом RAG, потом замер, и дообучение только на остатке ошибок. На диагностике мы этот разбор делаем до любых обязательств — иногда он заканчивается выводом, что тюнинг вам не нужен вовсе. Записаться можно на странице бесплатного аудита.

Симптом — что применить: от промпта до полного тюнинга

Таблица собрана по реальным жалобам заказчиков. Слева — как проблему формулируют, справа — что мы на самом деле делаем и сколько это занимает.

Выбор способа настройки модели по симптому, срокам и стоимости
СимптомЧто применитьСрокиСтоимость
«Отвечает не в том тоне и не в том формате»Системный промпт, примеры, схема вывода1–3 дняВходит в пилот
«Придумывает факты, не знает наших регламентов»RAG по базе знаний со ссылкой на источник1–2 неделиПилот $3–5k
«База большая, находит не то»Пересборка индекса: чанкинг, реранкер, эмбеддинги multilingual-e5 или BGE-M31–2 неделиПилот $3–5k
«Путает номенклатуру, артикулы, сокращения»Словари и нормализация; тюнинг только если не помогло1–2 неделиПилот $3–5k
«Плывёт формат при записи в 1С или CRM»Строгая схема ответа и валидация на выходе, LoRA при сложной структуре2–3 неделиЧасть внедрения
«Тысячи однотипных решений, верный ответ известен»LoRA или QLoRA на исторических примерах3–6 недель вместе с разметкойЧасть внедрения от $30 000
«Узкая отрасль со своим языком, общая модель не тянет»Продолженное предобучение или полный тюнингОт 6 недель, оправдано редкоСчитаем отдельно после диагностики

Как готовим датасет для дообучения

Качество тюнинга определяется данными, а не гиперпараметрами. Основная часть трудозатрат проекта уходит именно сюда, и львиная доля этой работы — на стороне вашего эксперта.

  1. Собираем источники. Регламенты, инструкции, скрипты разговоров, переписка с клиентами, закрытые заявки, коммерческие предложения, которые в компании считают эталонными. Отдельно просим примеры того, как делать не надо — они нужны не меньше удачных.
  2. Превращаем в пары «вход — эталонный ответ». Сырые документы для обучения не годятся. Нужен формат задачи: вот запрос или ситуация, вот ответ, который вы приняли бы у сильного сотрудника без правок.
  3. Разметку ведёт эксперт с вашей стороны. Мы даём интерфейс, правила и выборку; решение принимает человек, который отвечает за процесс. Отданная на сторону разметка даёт формально аккуратный датасет и бесполезную модель.
  4. Вычищаем противоречия. Два эксперта — два разных «правильных» ответа на один и тот же вопрос: обычная история. Такие пары либо приводятся к одному правилу, либо выбрасываются. Конфликт в данных модель усваивает так же охотно, как и правило.
  5. Считаем объём трезво. По нашей практике на один узкий сценарий требуется порядка 500–2000 выверенных примеров. Сотня даёт эффектное демо и разваливается на потоке, а десятки тысяч несортированных строк работают хуже двух тысяч чистых.
  6. Откладываем hold-out до начала обучения. Часть примеров закрывается и в тюнинге не участвует. Только на них потом меряется качество — иначе вы измеряете память модели, а не её пользу в работе.

Как меряем качество и что считаем регрессом

Метрика выбирается до обучения, вместе с владельцем процесса. На классификации и маршрутизации это доля верных решений и матрица ошибок по классам: важно не среднее, а то, какие именно классы модель путает. На генерации — оценка экспертом по чек-листу плюс формальные проверки: соблюдён ли формат, есть ли ссылка на источник, не выдуман ли артикул.

Регресс — это когда новая версия в среднем лучше, но хуже на подмножестве, которое для вас критично. Классика: точность выросла на два пункта, а редкий, но дорогой тип обращения стал обрабатываться неверно. Поэтому рядом с обучающей метрикой всегда живёт регрессионный набор — задачи, которые модель решала до тюнинга и обязана решать после.

Каждая версия весов и конфигурации версионируется и криптографически подписывается, к ней прилагается changelog. Если версия просела на регрессионном наборе, из тестового контура она не выходит. Откат к предыдущей — одно действие, без пересборки сервиса.

Ни одна версия не уезжает в продуктив без ручной проверки человеком, и финальный гейт стоит на вашей стороне. Это то же правило, по которому мы выкатываем еженедельные релизы всей системы.

Как проходит проект по дообучению модели

Схема та же, что и на других наших работах: сначала бесплатный разбор, потом короткий платный пилот на одной метрике, и только после этого внедрение.

01

Диагностика и замер

Разбираем процесс, определяем, что именно модель делает неправильно, фиксируем метрику. Нередко на этом шаге выясняется, что тюнинг не нужен: хватает правил и базы знаний.

входит
02

Пилот на одном сценарии · 2–4 недели

Собираем датасет, обучаем LoRA, сравниваем с базовой моделью на отложенной выборке. Одна метрика, честное сравнение «до и после», решение по цифрам.

$3–5k
03

Внедрение в контур

Обученная модель встаёт рядом с RAG и агентами, подключаются интеграции, права, журналирование и дашборды. Сумма пилота идёт в зачёт.

от $30 000
04

Подписка на развитие

Дообучение — не разовая операция. Накопленные за квартал примеры и правки экспертов уходят в новый цикл, каждая версия проходит регрессионный набор и ваш гейт.

$2,5–5k/мес

Данные для обучения не покидают контур

Обучение идёт на вашем сервере или в вашем выделенном контуре. Датасет никуда не копируется, внешние API на время тюнинга не используются, промежуточные чекпоинты лежат там же, где исходные документы. Доступ к обучающей выборке разграничен по ролям и журналируется: видно, кто и когда её открывал. Как устроен сам периметр, разобрано на странице локального ИИ.

Базовую модель подбираем с оглядкой на лицензию: у части открытых весов условия использования отличаются от Apache 2.0, и это проверяется до старта, а не после. Обученная надстройка, код обвязки и датасет принадлежат вам, условия выхода зафиксированы в договоре. Что из открытых моделей мы держим в стеке и под какие задачи, собрано в каталоге моделей, а логика выбора базовой модели разобрана в отдельном материале блога.

Чего мы не делаем. Не обучаем на персональных данных без обезличивания, если сценарий не требует их напрямую и на это нет основания. Не используем чужие лицензионные корпуса. И не обещаем, что после тюнинга модель перестанет ошибаться: дообучение сдвигает поведение, а не отменяет природу вероятностной модели — необратимые действия всё равно подтверждает человек.

Вопросы и ответы

Частые вопросы про дообучение моделей

Как понять, что нужно именно дообучение, а не RAG?

Простой тест: возьмите десяток случаев, где модель ошиблась, и проверьте, лежит ли верный ответ хоть в каком-то вашем документе. Если лежит, а модель его не нашла или проигнорировала — это задача поиска и промпта, тюнинг здесь ничего не исправит. Если правильного ответа нет нигде и эксперт выводит его из опыта, дообучение оправдано. Второй признак — ошибка не в фактах, а в форме: модель стабильно ломает формат или тон, хотя правила ей даны. Этот разбор мы проводим на диагностике, бесплатно и до любых обязательств.

Сколько примеров нужно собрать для дообучения?

По нашей практике на один узкий сценарий — порядка 500–2000 выверенных пар «вход — эталонный ответ». Сотня примеров даёт красивую демонстрацию и рассыпается на реальном потоке. Десятки тысяч строк, собранных без разбора, работают хуже двух тысяч вычищенных: противоречия в данных модель запоминает не менее охотно, чем правила. Объём сильно зависит от разнообразия входов. Если формулировки клиентов однотипны, хватает нижней границы; если каждый случай уникален, потребуется существенно больше. Точную оценку называем после того, как посмотрим на ваши исторические данные.

Не забудет ли модель после дообучения то, что умела раньше?

Такой риск существует, он называется катастрофическим забыванием и на полном тюнинге проявляется заметно. Поэтому по умолчанию мы идём через LoRA и QLoRA: базовые веса остаются нетронутыми, обучается небольшая надстройка, которую можно отключить или заменить. Дополнительно ведём регрессионный набор — задачи, которые модель решала до обучения и должна решать после. Если новая версия просела на них, она не выходит за пределы тестового контура. Каждая версия весов подписана и версионирована, возврат к предыдущей выполняется одним действием и не требует пересборки сервиса.

Кто занимается разметкой данных — вы или мы?

Инструменты, правила разметки и выборку готовим мы, решения принимает эксперт с вашей стороны — человек, которого в компании считают носителем правильного ответа. Обычно это руководитель подразделения или сильный специалист, и его время оказывается главным дефицитом проекта. Реалистичная нагрузка — несколько часов в неделю на протяжении пилота. Отдавать разметку внешнему подрядчику в такой задаче бессмысленно: он разметит быстро и формально верно, а модель научится не вашим стандартам. Чтобы разгрузить эксперта, мы делаем предразметку: он проверяет и правит, а не пишет с нуля.

Где физически идёт обучение и что происходит с данными?

На вашем сервере либо в вашем выделенном контуре. Обучающая выборка наружу не копируется, внешние API во время тюнинга не задействуются, промежуточные чекпоинты хранятся рядом с исходными документами. Доступ к датасету разграничен по ролям, обращения журналируются. Персональные данные обезличиваются до обучения, если сценарий не требует их напрямую. Обученные веса, конфигурации и код обвязки принадлежат вам, условия выхода прописаны в договоре. После завершения работ модель продолжает работать без нашего участия — это принципиальное условие, а не жест доброй воли.

Дообучение уберёт галлюцинации?

Снизит, но не уберёт. Тюнинг учит модель формату, стилю и типовым решениям, а не честности: при пробеле в данных она по-прежнему способна заполнить его правдоподобной выдумкой. Галлюцинации на фактах лечатся другим набором мер — обязательной опорой на найденный документ, ссылкой на источник прямо в ответе, валидацией структуры на выходе и явным отказом отвечать, когда релевантного ничего не нашлось. Сверху — подтверждение человеком на любом необратимом действии. Подрядчик, обещающий безошибочную модель после дообучения, продаёт не результат, а надежду.

Первый шаг

Бесплатный аудит: посчитаем эффект внедрения ИИ на ваших цифрах

30–40 минут разбора: смотрим ваши процессы, отмечаем, что можно передать ИИ, считаем ROI-модель на ваших объёмах и сроках. Вы уходите с расчётом и картой внедрения — даже если работать дальше не будете.

Нажимая кнопку, вы соглашаетесь с политикой обработки данных. Отвечаем в течение одного рабочего дня.