Въезжаем в ИИ в 2026. Часть 2. Как работают LLM'ки - разбираемся на пальцах (1/2)
Если сильно упростить, современные LLM - это модели, которые очень хорошо умеют предсказывать следующее слово по предыдущему тексту.
Самая близкая бытовая аналогия - старый-добрый T9 на телефонах. В нулевых он тоже пытался угадать, что вы хотите напечатать дальше. Принцип был ровно тот же: есть контекст - есть вероятность следующего слова. Просто модели тогда были маленькие, контекст короткий, словари ограниченные. Этого хватало, чтобы дописать SMS, но не чтобы вести осмысленный диалог.
С LLM произошло то же самое, но в экстремальном масштабе. Модель получает текст, считает вероятности следующего слова, выбирает одно из них, добавляет к тексту, и повторяет этот шаг снова и снова. Так, слово за словом, и рождается ответ. Даже длинный текст или код - это просто сотни таких итераций подряд.
Ключевая разница здесь - масштаб. Мощность таких моделей во многом определяется числом параметров - настраиваемых коэффициентов, которые модель подбирает во время обучения. У GPT-3 в 2020 году их было около 175 миллиардов; у более новых моделей точные цифры не раскрываются, но они явно крупнее. По порядку величины это сопоставимо с числом нейронов в человеческом мозге (80–90 млрд), пусть и не один в один.
Но важен не только сам размер: критично и то, насколько мы умеем эти параметры обучать (железо и масштаб вычислений), и какие архитектуры позволяют делать это эффективно. Именно в этом и был основной рывок последних лет.
Почему всё это вообще стало возможным?
Во-первых, данные.
Современные модели обучаются на колоссальных объёмах текстов: интернет, книги, код, документация, диалоги - по сути, почти всё, что человечество успело написать в цифровом виде. Если очень грубо, это объём текста, который человек физически не смог бы прочитать за несколько тысяч лет непрерывного чтения
Во-вторых, железо.
Идеи нейросетей были понятны ещё в 90-х, но обучать их было банально не на чем. Перелом случился, когда GPU начали массово использоваться не только для графики, но и для вычислений: сначала CUDA (примерно 2006–2007 годы), затем специализированные GPU под машинное обучение. Именно параллельные вычисления сделали возможным обучение моделей с сотнями миллиардов параметров.
И в-третьих, архитектура.
В 2017 году появились трансформеры. Они позволили моделям перестать читать текст строго последовательно и начать обрабатывать весь контекст сразу через attention. Это резко повысило эффективность обучения и позволило масштабировать модели дальше.
И в-четвёртых, человеческий фидбэк (Reinforcement Learning with Human Feedback)
Большие модели сначала учатся просто продолжать текст, не имея представления о том, что считать хорошим ответом, а что - плохим. Поэтому поверх базового обучения их напрямую дообучают на человеческих оценках.
Люди смотрят на ответы модели и размечают их с точки зрения полезности, после чего она начинает оптимизироваться не только под правдоподобие текста, но и под ожидания человека.
Дальше случился самый интересный эффект.
Когда модели стали достаточно большими, у них начали появляться способности, которые никто специально не закладывал: перевод, программирование, рассуждения.
В итоге сегодня есть целые лаборатории, которые пытаются разобраться, как именно эта система к этому пришла, и почему рост масштаба приводит к таким эффектам. Параллельно обсуждаются и риски - в первую очередь связанные с тем, что поведение больших моделей становится всё сложнее предсказывать.
Таким образом, LLM - это не интеллект в человеческом смысле. Это самый мощный автокомплит, который мы смогли построить. И, как оказалось, даже этого уже достаточно, чтобы заметно изменить то, как мы работаем, пишем и ищем информацию 🙂
Post #144
3.85K