TGViewer
Аналитик данных Аналитик данных @dataanlitics · 6.25K subscribers
Post #271 1.6K
🔎 A Primer on LLM Post-Training (разбор статьи PyTorch)

1. Что такое post-training?
Это этап «доводки» модели после pre-training. Цель — научить LLM вести диалог, следовать правилам и предпочтениям. Используются: system prompt, SFT, reward shaping.

2. Формат данных
Метки позволяют модели понимать роли участников и завершение диалога:

<|begin_of_text|>
<|start|system|>…<|end|system|>
<|start|user|>…<|end|user|>
<|start|assistant|>…<|end|assistant|>


3. Техники post-training

a) SFT (Supervised Fine-Tuning)
Подражание «правильным» ответам. Потеря считается только по части ответа. Проблемы: ограничена качеством датасета, плохие примеры сильно портят результат. Решение → rejection sampling (генерируем несколько ответов и выбираем лучший).

b) RL (Reinforcement Learning, напр. RLHF)
Модель оптимизируется по наградной функции. Может превзойти авторов данных. Использует policy gradient. Минусы: вычислительно тяжёлый, нестабильный, требует сложной инфраструктуры.

c) DPO (Direct Preference Optimization)
Похоже на RLHF, но без RL. Обучение на парах: «лучший vs худший ответ». Преимущества: стабильность, эффективность. Минусы: нет exploration, зависит от качества пар.

4. Сравнение методов

| Метод | Exploration | Обучение | Сложность | Стабильность | Нагрузка |
|-------------|-------------|-----------------|-----------------|--------------|----------|
| SFT | ❌ Нет | Supervised | Низкая | Высокая | Низкая |
| DPO | ❌ Нет | Offline, sup. | Низкая | Очень высокая| Низкая |
| PPO (RL) | ✅ Есть | On-policy RL | Очень высокая | Низкая | Очень высокая |

5. Reward Models
- Outcome RM — оценивают результат.
- Process RM — оценивают шаги рассуждения (chain-of-thought).
- Rule-based reward — проверки на соответствие правилам (например, код прошёл тесты).

6. Test-time compute & reasoning
Подходы: Chain-of-Thought, ReAct, DeepSeek R1. Часто вводят токены <think>...</think>. Требуется reward-оценка рассуждений и сильная инфраструктура.

7. Инфраструктурные аспекты
RL требует массового inference, хранения KV cache, collectors и синхронизаций весов. Pipelines должны быть гибкими: разные loss-функции, reward модели, sandbox-тесты.

✅ Выводы
Post-training превращает LLM из «просто автодополнителя» в осмысленного собеседника.
SFT — базовый и простой, но ограниченный.
DPO — лёгкий и эффективный способ обучения на предпочтениях.
RL (PPO) — мощный, но очень дорогой и сложный.
Будущее — за моделями, которые учат не только ответы, но и процесс мышления.

Источник: https://pytorch.org/blog/a-primer-on-llm-post-training/
  • ❤ 1
  • 👍 1
More from @dataanlitics
  1. Sep 22, 2026👣 Google открыла исходный код AX, среды для запуска AI-агентов в продакшене. AX изолирует…
  2. Sep 15, 2026📘 Бесплатный 17-страничный PDF по Hidden Markov Models (HMM) Короткий материал от Stanfor…
  3. Sep 15, 2026🔥 Один из лучших обучающих курсов на StepiK по SQL SQL можно знать годами и всё равно тер…
  4. Sep 10, 2026✔️ Hugging Face запустила агента для ML-экспериментов Платформа встроила в свой чат-бот от…
  5. Aug 19, 2026Как нормально тестировать AI-агента, если правильный ответ ещё ничего не доказывает У обыч…
  6. Aug 16, 2026⚡️ Harness Engineering - полный курс на русском Как заставить AI-агента писать код надёжно…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →