Большинство туториалов по LLM заканчиваются на фразе загрузите модель из Hugging Face и запустите fine-tuning.
Этот репозиторий идет в противоположную сторону.
Автор реализовал Transformer с нуля на чистом PyTorch, опираясь на статью Attention Is All You Need. Без
transformers, trl и peft. Цель — не дообучить готовую модель, а разобраться, как она устроена.
Причем это уже не просто реализация архитектуры.
Репозиторий проводит через весь жизненный цикл современной LLM:
строим Transformer;
предобучаем на сырых текстах;
обучаем следовать инструкциям (SFT);
тренируем Reward Model;
применяем DPO/PPO;
доходим до GRPO и reasoning-моделей.
Основная идея идея репозитория:
превращаем текст в числа, затем учим модель предсказывать следующий токен, постепенно меняем данные и функцию потерь, пока модель не начинает делать то, что нам нужно.
Все алгоритмы написаны вручную на PyTorch, поэтому хорошо видно, что происходит на каждом этапе обучения.
По словам автора, модели можно обучать даже на одной GPU — от миллионов до миллиардов параметров.
Для тех, кто хочет понять, как на самом деле обучаются современные LLM, а не только пользоваться готовыми библиотеками, это один из самых интересных открытых проектов, которые я видел за последнее время.
@tldr_data
