TGViewer
Инжиниринг корпорации Инжиниринг корпорации @corp_engineering · 692 subscribers
Post #273 477
Дообучение LLM на своих данных

Не отпускает нас тема ИИ. Из переписки с подписчиком:

«Мы решили дообучить модель на своих данных…»

Далее подробности опускаю. Заканчивается всё вопросом,

«...что мы сделали не так?»

Ну, давайте разберемся!

Когда люди доходят до темы корпоративного ИИ, у них довольно быстро возникает соблазнительная мысль: «А давайте дообучим модель на наших данных – и она станет умной именно про нас».
Звучит красиво и заманчиво. Но на практике это почти всегда, скажем мягко, преждевременный энтузиазм.

Дообучение – это процесс дополнительно «натаскивания» готовой модели на специальных данных, чтобы она лучше решала конкретный класс задач. Если совсем грубо, то вот модель была «умная вообще», а стала «лучше заточена вот под это». Например, лучше пишет на вашем родном языке, в нужном вам стиле, лучше понимает вашу терминологию, устойчивее выдаёт нужный формат ответа, точнее работает на вашем типе запросов.

Но это не «просто загрузить файлы» – это именно изменение самой модели. Это сложная и дорогая инженерная работа: подготовка корпуса, чистка данных, разметка, выбор сценария обучения, контроль деградации, тестирование, инфраструктура, оценка эффекта. И если сделать это криво, можно не улучшить модель, а просто испортить хорошую базу за свои же деньги. Красиво, бодро, по-корпоративному.

Поэтому базовое правило такое: лезть в дообучение надо в самую последнюю очередь.

Сначала нужно выжать всё из более дешёвых и управляемых вещей:
– нормализация запросов (человек пишет как попало, а система перед ответом переформулирует это в рабочий запрос);
– нормальный промптинг;
– архитектура RAG + качество своих документов;
– попробовать модель большего масштаба или лучшего класса;
– память, инструменты, маршрутизация, правила вызова модели.

Во большинстве реальных задач этого уже хватает с головой. А иногда и с двумя головами, если в компании их вообще используют.

Когда дообучение бизнесу действительно нужно? Вот несколько жёстких критериев.
1. У вас есть большой и качественный массив однотипных данных, а не свалка файлов «как бог послал».
2. Задача массовая, повторяемая и дорогая, так что улучшение качества даст заметный экономический эффект.
3. Вам нужно не просто «знать ваши документы», а изменить поведение модели: стиль, формат ответа, устойчивость на специальной терминологии, типовые шаблоны рассуждения.
4. Вы уже попробовали все архитектуры RAG, инструкции и нормальную обвязку – и этого реально не хватило.
5. У вас есть чем мерить результат, а не просто надежда, что «ну теперь-то точно полетит».

Если этого нет – скорее всего, вам нужно не дообучение, а порядок в данных и голове.

И ещё важный момент. Если вы всё же дошли до точки, где дообучение правда оправдано, то делать это «своими силами на коленке» – обычно плохая идея. Лучше, чтобы дообучение проводил специализированный подрядчик, даже если вы ИТ-компания или мните себя таковой.

Почему? Потому что там слишком много мест, где можно тихо и дорого накосячить:
– испортить обучающий корпус;
– переобучить модель;
– получить красивую демку и плохую эксплуатацию;
– потратить бюджет и не получить устойчивого эффекта.

То есть коротко: дообучение – это не первый инструмент, а последний. Когда все остальное уже не помогает, а задачу нужно решить хоть как-нибудь, а альтернатив нет или они ещё хуже.

Во всех остальных случаях бизнесу обычно нужен не fine-tuning, а less-tuning – поменьше магии, побольше здравого смысла.

Хорошего вам дня и трудового настроя!

#ИИ #ИИавтоматизация
  • 🔥 5
  • 👍 3
More from @corp_engineering
  1. Sep 24, 2026Со следующей недели возвращаюсь к регулярным постам. Извиняюсь за паузу – последние недели…
  2. Sep 6, 2026Добро пожаловать в эру AGI Похоже, дождались. 3 сентября OpenAI представила GPT-6 Astra. М…
  3. Sep 1, 2026Обещал не беспокоить, но в соседнем паблике люди стали спорить о дилемме двух морковок. Ка…
  4. Aug 31, 2026Ближайшие пару недель здесь, скорее всего, будет тихо. Я занят, времени мало, да и особого…
  5. Aug 28, 2026Кто здесь думает, а кто вычисляет Пару дней назад попалась занятная статья. «ИИ не думает,…
  6. Aug 25, 2026Процессы и заработная плата Ранее я предложил вам использовать систему оплаты труда, состо…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →