Промпт и правила
Системная инструкция, примеры удачных ответов, жёсткая схема вывода. Закрывает тон, формат и границы: о чём модель говорит, о чём молчит, когда зовёт человека. День-два работы, правится без остановки сервиса.
Дообучение моделей нужно не всегда. В большинстве задач сначала помогает грамотный промпт с правилами, потом RAG по вашей базе знаний, и только если модель всё равно путает термины, формат и логику решений, мы обучаем её на ваших данных — LoRA или QLoRA, реже полный тюнинг. Обучение идёт на вашем сервере: датасет и веса не покидают контур.
Между «модель отвечает мимо» и «нужно переобучать веса» лежат два более дешёвых шага. Пропускать их невыгодно: они закрывают заметную часть претензий за дни, а не за недели.
Системная инструкция, примеры удачных ответов, жёсткая схема вывода. Закрывает тон, формат и границы: о чём модель говорит, о чём молчит, когда зовёт человека. День-два работы, правится без остановки сервиса.
Модель получает нужный фрагмент ваших регламентов прямо в момент ответа и ссылается на источник. Поменялся документ — поменялся ответ, переобучать ничего не надо.
Как это работает у цифровых сотрудниковLoRA или QLoRA поверх открытой модели, реже полный тюнинг. Нужно, когда важен не факт из документа, а навык: стабильно принимать однотипное решение, держать формат, говорить языком вашей отрасли.
Каталог открытых моделейЗапрос обычно звучит одинаково: «обучите модель на наших данных». Чаще всего за ним стоит другая проблема — модель просто не видит нужный документ в момент ответа. Это лечится поиском и правилами, а не обучением, и обходится в разы дешевле.
У тюнинга есть неприятное свойство: он зашивает знание в веса. Обновился регламент — веса устарели, нужен новый цикл обучения, новая проверка и новый выкат. RAG обновляется за время индексации документа, а откатывается удалением одного файла из базы.
Обратная сторона тоже есть. Поиск по документам не научит модель принимать решение: если правильный ответ нигде не записан и эксперт выводит его из опыта, никакой индекс не поможет. То же с форматом — когда модель раз за разом ломает структуру вывода, хотя правила ей даны прямым текстом.
Отсюда рабочий порядок: правила, потом RAG, потом замер, и дообучение только на остатке ошибок. На диагностике мы этот разбор делаем до любых обязательств — иногда он заканчивается выводом, что тюнинг вам не нужен вовсе. Записаться можно на странице бесплатного аудита.
Таблица собрана по реальным жалобам заказчиков. Слева — как проблему формулируют, справа — что мы на самом деле делаем и сколько это занимает.
| Симптом | Что применить | Сроки | Стоимость |
|---|---|---|---|
| «Отвечает не в том тоне и не в том формате» | Системный промпт, примеры, схема вывода | 1–3 дня | Входит в пилот |
| «Придумывает факты, не знает наших регламентов» | RAG по базе знаний со ссылкой на источник | 1–2 недели | Пилот $3–5k |
| «База большая, находит не то» | Пересборка индекса: чанкинг, реранкер, эмбеддинги multilingual-e5 или BGE-M3 | 1–2 недели | Пилот $3–5k |
| «Путает номенклатуру, артикулы, сокращения» | Словари и нормализация; тюнинг только если не помогло | 1–2 недели | Пилот $3–5k |
| «Плывёт формат при записи в 1С или CRM» | Строгая схема ответа и валидация на выходе, LoRA при сложной структуре | 2–3 недели | Часть внедрения |
| «Тысячи однотипных решений, верный ответ известен» | LoRA или QLoRA на исторических примерах | 3–6 недель вместе с разметкой | Часть внедрения от $30 000 |
| «Узкая отрасль со своим языком, общая модель не тянет» | Продолженное предобучение или полный тюнинг | От 6 недель, оправдано редко | Считаем отдельно после диагностики |
Качество тюнинга определяется данными, а не гиперпараметрами. Основная часть трудозатрат проекта уходит именно сюда, и львиная доля этой работы — на стороне вашего эксперта.
Метрика выбирается до обучения, вместе с владельцем процесса. На классификации и маршрутизации это доля верных решений и матрица ошибок по классам: важно не среднее, а то, какие именно классы модель путает. На генерации — оценка экспертом по чек-листу плюс формальные проверки: соблюдён ли формат, есть ли ссылка на источник, не выдуман ли артикул.
Регресс — это когда новая версия в среднем лучше, но хуже на подмножестве, которое для вас критично. Классика: точность выросла на два пункта, а редкий, но дорогой тип обращения стал обрабатываться неверно. Поэтому рядом с обучающей метрикой всегда живёт регрессионный набор — задачи, которые модель решала до тюнинга и обязана решать после.
Каждая версия весов и конфигурации версионируется и криптографически подписывается, к ней прилагается changelog. Если версия просела на регрессионном наборе, из тестового контура она не выходит. Откат к предыдущей — одно действие, без пересборки сервиса.
Ни одна версия не уезжает в продуктив без ручной проверки человеком, и финальный гейт стоит на вашей стороне. Это то же правило, по которому мы выкатываем еженедельные релизы всей системы.
Схема та же, что и на других наших работах: сначала бесплатный разбор, потом короткий платный пилот на одной метрике, и только после этого внедрение.
Разбираем процесс, определяем, что именно модель делает неправильно, фиксируем метрику. Нередко на этом шаге выясняется, что тюнинг не нужен: хватает правил и базы знаний.
Собираем датасет, обучаем LoRA, сравниваем с базовой моделью на отложенной выборке. Одна метрика, честное сравнение «до и после», решение по цифрам.
Обученная модель встаёт рядом с RAG и агентами, подключаются интеграции, права, журналирование и дашборды. Сумма пилота идёт в зачёт.
Дообучение — не разовая операция. Накопленные за квартал примеры и правки экспертов уходят в новый цикл, каждая версия проходит регрессионный набор и ваш гейт.
Обучение идёт на вашем сервере или в вашем выделенном контуре. Датасет никуда не копируется, внешние API на время тюнинга не используются, промежуточные чекпоинты лежат там же, где исходные документы. Доступ к обучающей выборке разграничен по ролям и журналируется: видно, кто и когда её открывал. Как устроен сам периметр, разобрано на странице локального ИИ.
Базовую модель подбираем с оглядкой на лицензию: у части открытых весов условия использования отличаются от Apache 2.0, и это проверяется до старта, а не после. Обученная надстройка, код обвязки и датасет принадлежат вам, условия выхода зафиксированы в договоре. Что из открытых моделей мы держим в стеке и под какие задачи, собрано в каталоге моделей, а логика выбора базовой модели разобрана в отдельном материале блога.
Чего мы не делаем. Не обучаем на персональных данных без обезличивания, если сценарий не требует их напрямую и на это нет основания. Не используем чужие лицензионные корпуса. И не обещаем, что после тюнинга модель перестанет ошибаться: дообучение сдвигает поведение, а не отменяет природу вероятностной модели — необратимые действия всё равно подтверждает человек.
Простой тест: возьмите десяток случаев, где модель ошиблась, и проверьте, лежит ли верный ответ хоть в каком-то вашем документе. Если лежит, а модель его не нашла или проигнорировала — это задача поиска и промпта, тюнинг здесь ничего не исправит. Если правильного ответа нет нигде и эксперт выводит его из опыта, дообучение оправдано. Второй признак — ошибка не в фактах, а в форме: модель стабильно ломает формат или тон, хотя правила ей даны. Этот разбор мы проводим на диагностике, бесплатно и до любых обязательств.
По нашей практике на один узкий сценарий — порядка 500–2000 выверенных пар «вход — эталонный ответ». Сотня примеров даёт красивую демонстрацию и рассыпается на реальном потоке. Десятки тысяч строк, собранных без разбора, работают хуже двух тысяч вычищенных: противоречия в данных модель запоминает не менее охотно, чем правила. Объём сильно зависит от разнообразия входов. Если формулировки клиентов однотипны, хватает нижней границы; если каждый случай уникален, потребуется существенно больше. Точную оценку называем после того, как посмотрим на ваши исторические данные.
Такой риск существует, он называется катастрофическим забыванием и на полном тюнинге проявляется заметно. Поэтому по умолчанию мы идём через LoRA и QLoRA: базовые веса остаются нетронутыми, обучается небольшая надстройка, которую можно отключить или заменить. Дополнительно ведём регрессионный набор — задачи, которые модель решала до обучения и должна решать после. Если новая версия просела на них, она не выходит за пределы тестового контура. Каждая версия весов подписана и версионирована, возврат к предыдущей выполняется одним действием и не требует пересборки сервиса.
Инструменты, правила разметки и выборку готовим мы, решения принимает эксперт с вашей стороны — человек, которого в компании считают носителем правильного ответа. Обычно это руководитель подразделения или сильный специалист, и его время оказывается главным дефицитом проекта. Реалистичная нагрузка — несколько часов в неделю на протяжении пилота. Отдавать разметку внешнему подрядчику в такой задаче бессмысленно: он разметит быстро и формально верно, а модель научится не вашим стандартам. Чтобы разгрузить эксперта, мы делаем предразметку: он проверяет и правит, а не пишет с нуля.
На вашем сервере либо в вашем выделенном контуре. Обучающая выборка наружу не копируется, внешние API во время тюнинга не задействуются, промежуточные чекпоинты хранятся рядом с исходными документами. Доступ к датасету разграничен по ролям, обращения журналируются. Персональные данные обезличиваются до обучения, если сценарий не требует их напрямую. Обученные веса, конфигурации и код обвязки принадлежат вам, условия выхода прописаны в договоре. После завершения работ модель продолжает работать без нашего участия — это принципиальное условие, а не жест доброй воли.
Снизит, но не уберёт. Тюнинг учит модель формату, стилю и типовым решениям, а не честности: при пробеле в данных она по-прежнему способна заполнить его правдоподобной выдумкой. Галлюцинации на фактах лечатся другим набором мер — обязательной опорой на найденный документ, ссылкой на источник прямо в ответе, валидацией структуры на выходе и явным отказом отвечать, когда релевантного ничего не нашлось. Сверху — подтверждение человеком на любом необратимом действии. Подрядчик, обещающий безошибочную модель после дообучения, продаёт не результат, а надежду.
30–40 минут разбора: смотрим ваши процессы, отмечаем, что можно передать ИИ, считаем ROI-модель на ваших объёмах и сроках. Вы уходите с расчётом и картой внедрения — даже если работать дальше не будете.