TGViewer
я так понимаю, Роман Васильев я так понимаю, Роман Васильев @ravasiliev_ch · 3.29K subscribers
Post #144 3.85K
Въезжаем в ИИ в 2026. Часть 2. Как работают LLM'ки - разбираемся на пальцах (1/2)

Если сильно упростить, современные LLM - это модели, которые очень хорошо умеют предсказывать следующее слово по предыдущему тексту.

Самая близкая бытовая аналогия - старый-добрый T9 на телефонах. В нулевых он тоже пытался угадать, что вы хотите напечатать дальше. Принцип был ровно тот же: есть контекст - есть вероятность следующего слова. Просто модели тогда были маленькие, контекст короткий, словари ограниченные. Этого хватало, чтобы дописать SMS, но не чтобы вести осмысленный диалог.
С LLM произошло то же самое, но в экстремальном масштабе. Модель получает текст, считает вероятности следующего слова, выбирает одно из них, добавляет к тексту, и повторяет этот шаг снова и снова. Так, слово за словом, и рождается ответ. Даже длинный текст или код - это просто сотни таких итераций подряд.

Ключевая разница здесь - масштаб. Мощность таких моделей во многом определяется числом параметров - настраиваемых коэффициентов, которые модель подбирает во время обучения. У GPT-3 в 2020 году их было около 175 миллиардов; у более новых моделей точные цифры не раскрываются, но они явно крупнее. По порядку величины это сопоставимо с числом нейронов в человеческом мозге (80–90 млрд), пусть и не один в один.
Но важен не только сам размер: критично и то, насколько мы умеем эти параметры обучать (железо и масштаб вычислений), и какие архитектуры позволяют делать это эффективно. Именно в этом и был основной рывок последних лет.

Почему всё это вообще стало возможным?

Во-первых, данные.
Современные модели обучаются на колоссальных объёмах текстов: интернет, книги, код, документация, диалоги - по сути, почти всё, что человечество успело написать в цифровом виде. Если очень грубо, это объём текста, который человек физически не смог бы прочитать за несколько тысяч лет непрерывного чтения

Во-вторых, железо.
Идеи нейросетей были понятны ещё в 90-х, но обучать их было банально не на чем. Перелом случился, когда GPU начали массово использоваться не только для графики, но и для вычислений: сначала CUDA (примерно 2006–2007 годы), затем специализированные GPU под машинное обучение. Именно параллельные вычисления сделали возможным обучение моделей с сотнями миллиардов параметров.

И в-третьих, архитектура.
В 2017 году появились трансформеры. Они позволили моделям перестать читать текст строго последовательно и начать обрабатывать весь контекст сразу через attention. Это резко повысило эффективность обучения и позволило масштабировать модели дальше.

И в-четвёртых, человеческий фидбэк (Reinforcement Learning with Human Feedback)
Большие модели сначала учатся просто продолжать текст, не имея представления о том, что считать хорошим ответом, а что - плохим. Поэтому поверх базового обучения их напрямую дообучают на человеческих оценках.
Люди смотрят на ответы модели и размечают их с точки зрения полезности, после чего она начинает оптимизироваться не только под правдоподобие текста, но и под ожидания человека.

Дальше случился самый интересный эффект.
Когда модели стали достаточно большими, у них начали появляться способности, которые никто специально не закладывал: перевод, программирование, рассуждения.
В итоге сегодня есть целые лаборатории, которые пытаются разобраться, как именно эта система к этому пришла, и почему рост масштаба приводит к таким эффектам. Параллельно обсуждаются и риски - в первую очередь связанные с тем, что поведение больших моделей становится всё сложнее предсказывать.

Таким образом, LLM - это не интеллект в человеческом смысле. Это самый мощный автокомплит, который мы смогли построить. И, как оказалось, даже этого уже достаточно, чтобы заметно изменить то, как мы работаем, пишем и ищем информацию 🙂
YouTube Large Language Models explained briefly A light intro to LLMs, chatbots, pretraining, and transformers. Dig deeper here: https://www.youtube.com/playlist?list=PLZHQObOWTQDNU6R1_67000Dx_ZCJB-3pi Technical details as a talk: https://youtu.be/KJtZARuO3JY This was made for an exhibit at the Computer…
  • ❤ 19
  • ❤‍🔥 6
  • 🥰 6
  • 👍 3
More from @ravasiliev_ch
  1. Sep 19, 2026И немного фоточек/видео по мотивам школы!
  2. Sep 19, 2026🏫 Как я был директором ШАРа 2026 Яндекс каждый год проводит летние школы по разным профес…
  3. Aug 11, 2026👀 Про аналитическую насмотренность Больше года назад на одной из моих лекций в ШАРе молод…
  4. Jul 28, 2026🏆 Преподавание ML студентам очно в Москве Знаю, что этот канал читают многие мои выпускни…
  5. May 26, 2026📺 Аузан про образование в эпоху ИИ Посмотрел классный монолог Александра Аузана, декана э…
  6. May 24, 2026Сходил в гости в Доверительный интервал 🙂 Получилось 49 минут разговоров про аналитику с…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →