TGViewer
Всеволод Викулин Всеволод Викулин @vikulin_ai · 5.28K subscribers
Post #36 2.17K
Когда вам стоит дообучать LLM

Хватит сидеть на промптах! Альтман нас ограничивает! Мы хотим дообучить опенсорс LLM на наших данных, чтобы оптимизировать нашу задачу.
По теореме о бесплатных завтраках вы абсолютно правы. Оптимизация под конкретную область должна бить базовое решение. Теоретически. А на практике?

На практике.

Начнём издалека. Вы купили автомобиль. Не самые глупые люди много времени настраивали двигатель, коробку передач, рулевое управление… чтобы все работало вместе хорошо. Сбалансированно. Вот вы его купили и стали тюнинговать. Вкорячили турбину, занизили, поставили колонки в багажник (и не забыли проинформировать ГИБДД!)

Если вы не Xzibit, то большой шанс, что машина потеряет статус «все стабильно работает», которого добивались инженеры на заводе. Нештатные ситуации будут случаться намного чаще. Будет хуже управляться, иногда ломаться и чаще кряхтеть. А могли бы просто спокойно ездить на дачу на заводском…

Сева, блин, при чем тут LLM?

В обучении базовых LLM есть стадия “alignment”. Она нужна, чтобы модель поняла, что вообще от нее хочет человек. Изначально модель пыталась просто токен следующий предсказать, никто ей не объяснил, что вообще-то она создана, чтобы созвоны суммаризовывать. "Заводской" alignment делает много умных ИИ-инженеров в несколько стадий (более подробно смотрите мою любимую лекцию)

Можно считать, что это базовая настройка модели, которая еще защищает ее от делания гадостей. Когда ее просят наврать в ответе, послать пользователя на 3 буквы, выдать коды доступы к Зиону системный промпт. Вам в продукте весь этот треш не нужен. Вот когда вы модель дообучаете, вы ломаете эту настройку. Веса меняются, никто не обещает теперь, что модель не заглючит, и она не сломается от первой промпт-инъекции.

Неправильное дообучение может, например, заставить модель сильнее галлюцинировать. Почему? Посмотрите, например, статью от коллег из Google. Вы добавили в обучающее множество информацию, которой не было у модели во время pretraining. Это вызывает у нее противоречие: "я про это первый раз слышу, вы сейчас просите так отвечать, мне теперь всегда надо ответы придумывать?" Я так тоже делал в универе, когда пропустил 90% материала и пытался выучить билеты за ночь.

Когда нужно дообучать?

Я знаю ровно 3 кейса:

1) Невозможно в промпте описать все ваши продуктовые желания. Например, вы хотите с помощью LLM писать карточки товаров, максимизируя CTR клика. Словами это так просто не передать.

2) У вас так много запросов, что вам дешевле поднять LLM на своем железе, чем платить за каждый запрос в API.

3) Вы не хотите, чтобы данные выходили за ваш контур.

Заключение

Делайте дообучение, только если без него совсем нельзя. Например, еще есть промпты и RAG.
А если уж решили прокачивать вашу LLM, то делайте это как Xzibit. Чтобы разобраться, как это делать, настоятельно рекомендую этот канал.
  • 👍 29
  • 🔥 5
  • ❤ 4
  • 🐳 2
  • 🤝 1
More from @vikulin_ai
  1. Sep 21, 2026Кому можно вайбкодить и как это делать Управление AI-агентами очень похоже на управление л…
  2. Sep 16, 2026Кто управляет разработкой AI-проекта Несколько лет назад во время очередного релиза я поня…
  3. Sep 8, 2026Всеобъемлющая статья про инференс LLM Многие у меня спрашивают, как посчитать GPU и как по…
  4. Aug 30, 2026Как стать AI-native компанией AI всегда был гонкой инфраструктуры. Если вы хотите крутые A…
  5. Aug 25, 2026Первый обзор научной статьи в этом канале Я не фанат читать свежие статьи. Сам когда-то за…
  6. Aug 18, 2026Вам LLM побыстрее или подешевле? Выберите только одно Почему-то во всех командах, где я ра…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →