TGViewer
Big Ledovsky | AI изнутри Big Ledovsky | AI изнутри @big_ledovsky · 2.06K subscribers
Post #181 1.12K
Ревью Intro to LLM от Андрея Карпати

Решил наконец посмотреть (пересмотреть) видео Андрея Карпати (Andrej Karpathy) на ютубе.

Краткая справка. Андрей - один из пионеров глубокого обучения начала 2010-х, когда оно совершило серьезный прорыв. Работал в Open AI, но потом оттуда ушел. Последнее время раз в несколько месяцев выпускает видео, где то рассказывает про нейронные сети, то что-то кодит. Мой интерес с одной стороны связан желанием быть в мете* современного ML с его LLM (Large Language Models, ChatGPT и др). Я писал про мое восприятие технологического прогресса и сложности нахождения в мете в этом посте. Но еще мне просто нравится слушать Андрея, потому что он рассказывает интересно.


Могу порекомендовать каждому часовое видео, которое называется Intro to LLM**. Оно одновременно очень доступное, но при этом подошло бы в качестве вводного занятия серьезного курса лекций. Вот концепции, которые кажутся мне очень важными

- LLM стоит воспринимать как быстрое мышление. Книга "думай медленно, решай быстро" популяризировала идею о наличии быстрого (интуитивного) и медленного (логического). Так вот текущий LLM - первое. Текущий челлендж - научить LLM построению цепочек логических связей.
- LLM стоит воспринимать как процессор в операционной системе, а не как самодостаточный искусственный интеллект. Данная концепция называется LLM OS. Сама LLM это процессор, оперативная память это контекст (= последняя ваша переписка), есть возможность воспользоваться внешними программами (запустить код на питоне, сходить в браузер), есть интерфейсы взаимодействия в виде speech2text/text2speech и генерации видео
- Обучение LLM можно воспринимать, как сжатие обучающего датасета, примерно как это делает ZIP архиватор или MP3 кодек. Обучающий датасет для модели весит ~10 Tb и сжимается ~ в 100 раз до 140 Gb в модели Llama v2 с 7 млрд параметрами. В отличии от ZIP архива LLM сжимает данные с потерями. В этом плане она больше похожа на MP3 формат.

* Слово мета часто используют для описания коллективного понимания эффективных подходов, архитектур и алгоритмов
** Если сложно слушать на английском, но на ютубе есть автосгенерированный перевод

#tech
YouTube [1hr Talk] Intro to Large Language Models This is a 1 hour general-audience introduction to Large Language Models: the core technical component behind systems like ChatGPT, Claude, and Bard. What they are, where they are headed, comparisons and analogies to present-day operating systems, and some…
  • 👍 7
  • 🔥 2
  • ❤ 1
More from @big_ledovsky
  1. Oct 5, 2026Разбирался в текущих железках NVIDIA Моя текущая роль предполагает отвечать на вопросы в д…
  2. Oct 1, 2026Блокировка ChatGPT Никогда такого не было и вот опять 🙂 Теперь уже мой личный аккаунт, ко…
  3. Sep 28, 2026Про openspec Решил попробовать openspec для adhoc задач, фреймворк для spec driven develop…
  4. Sep 24, 2026Годный курс по AI для менеджеров Меня довольно часто спрашивают, что я могу порекомендоват…
  5. Sep 22, 2026Про Jev 1. Наконец-то! Появились LLM, которые отвечают не текстом, а сразу тем что нужно.…
  6. Sep 21, 2026Что станет с поиском и рекомендациями в эпоху LLM 🦜 По следам дискуссии на Practical ML Р…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →