TGViewer
Python Portal Python Portal @pythonportal · 50.3K subscribers
Post #6072 4.4K
Если хотите разобраться, как обучить большую модель с нуля, рекомендую посмотреть вот это ↓

Сооснователь ARC Prize и создатель Keras Франсуа Шолле недавно посоветовал путь для изучения LLM с нуля.

Он сказал, что если вам 17 лет или вообще сколько угодно и вы хотите с нуля научиться создавать LLM, просто прочитайте главы 15 и 16 его книги *Deep Learning with Python*.

Я бегло их просмотрел, и эти две главы точно стоит сохранить.

Глава 15 начинается с самых базовых языковых моделей и постепенно доходит до

Character-level Language Model → Seq2Seq → Attention → QKV → Scaled Dot-Product Attention → Multi-Head Attention → Self-Attention → Transformer

Там даже есть отдельный раздел с объяснением того, почему вообще работает Dot-Product Attention.

Сам он говорит, что это одно из лучших объяснений этой темы.

Автор не останавливается на формулах вроде QKᵀ / √d. Он начинает с Word2Vec и пространства эмбеддингов, а затем объясняет, как Transformer слой за слоем через Attention постепенно превращает связи между токенами в отношения расстояний в векторном пространстве.

Глава 16 ещё практичнее. В ней напрямую показывают, как обучить mini-GPT с нуля.

Разбирается, как взять почти 1 миллиард токенов из C4, собрать словарь SentencePiece на 32 тысячи токенов, настроить mini-GPT на 41 миллион параметров с 8 слоями, 8 головами внимания и размером скрытого состояния 512, а затем самостоятельно собрать конвейер данных, сделать weight tying, прогрев скорости обучения, предобучение и генерацию с temperature и top-k.

От токенизатора, конвейера данных, causal attention, weight tying и прогрева скорости обучения до предобучения, greedy decoding, temperature и top-k sampling. По сути, вас шаг за шагом проводят через полный процесс обучения GPT.

Для этого даже не нужен дорогой сервер.

В официальном примечании указано, что весь пример можно запустить на бесплатной T4 в Google Colab. Обучение займёт около 6 часов. На A100 — чуть больше часа.

Дальше в книге разбираются Gemma, SFT, RLHF, RAG и мультимодальные модели.

Поэтому если меня спросят

«Я никогда раньше не обучал большую модель. С чего начать?»

Эти две главы действительно могут быть отличной отправной точкой.

Третье издание *Deep Learning with Python* сейчас доступно для бесплатного чтения онлайн, а все сопутствующие ноутбуки полностью открыты. Их можно просто загрузить в Colab и запустить.

В 2026 году для изучения LLM уже необязательно сразу садиться и разбирать сотню научных статей.

Если один раз самостоятельно обучить GPT на 41 миллион параметров от подготовки данных до генерации текста, очень многие концепции после этого естественным образом складываются в единую картину.

👉 @PythonPortal
  • 👍 10
  • ❤ 4
More from @pythonportal
  1. Oct 4, 2026«Изучение математики. Почему память, практика и техника важнее таланта» Чтобы освоить мате…
  2. Oct 3, 2026«Как обучить нейросеть» — краткий конспект лекций курса MIT по глубокому обучению за 2024…
  3. Oct 3, 2026Tencent выпустила новую модель для перевода, которая, по их словам, обходит Google Transla…
  4. Oct 2, 2026Один из лучших ресурсов по производительности SQL: use-the-index-luke.com 👉 @PythonPortal
  5. Oct 2, 2026Многие постоянно путаются в этом: В чём на самом деле разница между 100 МБ/с и 100 Мбит/с?…
  6. Oct 1, 2026Исследователи MIT математически доказали, что ChatGPT устроен так, что может затягивать по…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →