Так исторически сложилось, что я гораздо больше для своих задач юзаю BERT, чем GPT, и материалов на этом канале про BERT было уже довольно много, но мне очень сильно зашел вот этот туториал с написание Берта с нуля. При чем с нуля – это совсем с нуля, там авторы сами пишут функцию для батчинга, embedding layer, multihead attention, при чем это все с пояснениями, указанием размерностей и с выводом преобразований на каждом этапе
Вообще кодинг с нуля правда очень сильно помогает в понимании бейзлайнов, если не самому его писать, то хотя бы так
Post #723
4.46K