У Stanford CS336 — Language Modeling from Scratch подход почти буквальный: студенты собирают языковую модель с нуля. Сначала tokenizer, Transformer и optimizer, затем profiling и FlashAttention2 на Triton, distributed training, scaling laws и подготовка pretraining data из Common Crawl. Курс заканчивается post-training. Открыты записи лекций и код заданий.
CMU Generative AI смотрит шире одной языковой модели. В программе Transformers и LLM, pretraining и fine-tuning, RLHF и DPO, diffusion models, vision-language и multimodal foundation models, state-space models, генерация кода, аудио и видео. Есть слайды и пять наборов заданий: отдельно по LLM, генерации изображений, адаптации языковых моделей и multimodality.
Отдельная ветка есть у MIT — 6.S184 Introduction to Flow Matching and Diffusion Models. Это курс про генеративные модели для непрерывных данных: ODE и SDE, flow matching, score matching, classifier-free guidance, latent spaces, VAE, U-Net и Diffusion Transformer. Здесь доступны записи всех лекций, конспект и лабораторные; по ходу курса собирается latent diffusion model.
Следующий вопрос — как такие модели обучать и запускать в масштабе. CMU Large Language Model Systems начинается с GPU programming и постепенно приходит к distributed training, FlashAttention, Mixture of Experts, ZeRO, quantization, speculative decoding, vLLM и SGLang. Это уже systems-часть самой foundation model: вычисления, память и инфраструктура, необходимые для её обучения и inference.
Похожая логика у Berkeley Scalable AI, но курс охватывает весь жизненный цикл большой модели: architecture → pre-training → post-training → efficient inference → deployment. В практических заданиях студенты оптимизируют training stack, обучают модели с нуля, занимаются post-training и inference/serving. Публично доступны слайды и задания; записи лекций требуют аккаунт Berkeley.
И наконец, foundation model уже не обязательно означает только текст. В CMU Multimodal Machine Learning разбирают representation, alignment, grounding и reasoning между разными модальностями, multimodal Transformers, vision-language models, video и multimodal generation. Курс идёт сейчас, записи и материалы выкладываются по ходу семестра.
Если разложить эту группу курсов по слоям, получится примерно так:
data → architecture → pre-training → scaling → post-training → inference → multimodalityStanford CS336 показывает этот путь на языковой модели, CMU Generative AI расширяет его на другие классы генеративных моделей, MIT отдельно разбирает diffusion и flow matching, а CMU LLM Systems и Berkeley Scalable AI уходят в вычислительную сторону обучения и inference.
Вместе с предыдущей подборкой получаются две части одной картины: сначала мы строим и обучаем foundation model, затем собираем вокруг неё систему.