Сергей Долгов перевёл «The Smol Training Playbook» — самую популярную публикацию на HuggingFace о том, как создают, тренируют и дообучают языковые модели.
➡️ Что внутри
🔘Архитектура: MHA → GQA → MLA, позиционные кодировки (RoPE, NoPE), почему DeepSeek выбрал именно такие решения
🔘Претрейн: как собирать данные, выбирать learning rate, batch size, schedulers (WSD vs Cosine vs Multi-Step)
🔘Scaling laws: сколько данных нужно для модели N параметров, как считать FLOPs
🔘Post-training: SFT, DPO, GRPO, RLVR — когда что использовать и почему on-policy лучше off-policy
🔘Практика: как команда SmolLM3 обучала модель на 384×H100 за 11 триллионов токенов
➡️ Для кого
Для тех, кто хочет понять, как реально устроен процесс обучения LLM — не на уровне «скачал модель с HuggingFace», а на уровне «почему GQA ratio 4, а не 8» и «когда WSD лучше cosine decay».
Сергею — огромное спасибо за качественную вёрстку и время на перевод. Настольная книга для всех, кто копает в сторону ML.
📎 Оригинал на HF, версия на русском в прикреплённой PDF.
@neuro_channel
Post #2707
1.04K
Forwarded from Нейроканал
SMOL_секреты_создания_LLM_мирового_класса_Перевод_t_me_aivkube.pdf14.6 MB- ❤ 2
- 👍 1