Очень рекомендую сохранить осенний курс Стэнфорда MS&E 319 — Efficient Generative Language Models.
Курс идёт от предобучения до инференса и постобучения. Материалы и записи лекций обещают выкладывать позже.
Мне особенно нравится его исходная идея: модели становятся всё больше, но бюджет всегда ограничен. Если есть конкретная задача и ограниченные вычислительные ресурсы, как выбрать цель обучения, архитектуру модели и способ инференса так, чтобы получить максимум за свои деньги и не запускать GPT-6 на каждой задаче.
«Просто купить ещё GPU» тоже вариант — и сейчас это фактически основной подход рынка.
В курсе будут MoE, attention, сжатие KV Cache, квантизация, speculative decoding, а также LoRA, RLHF, DPO и дистилляция. Все эти обычно разрозненные техники рассматриваются через один вопрос: какую именно часть вычислений, памяти или времени они экономят и чем за это приходится платить.
Например, если нужно снизить стоимость использования модели, один подход позволяет на каждом запросе задействовать только часть параметров, другой уменьшает объём данных, которые нужно хранить и перемещать, третий ускоряет генерацию ответа. Сначала нужно понять, какую именно проблему решает каждый метод, и только потом выбирать подходящий для своей задачи и смотреть, какие из них можно сочетать.
Мне самому при оценке ИИ-компаний особенно интересен именно этот уровень: можно ли на тот же бюджет обучить более сильную модель или обслужить больше пользователей. Когда понимаешь компромиссы этих методов, релизы моделей и изменения их стоимости становятся намного понятнее.
У курса есть определённый порог входа, но если тема интересна, точно стоит следить:
https://web.stanford.edu/class/msande319/👉
@PythonPortal