У закона нет конкретного имени или формулировки, его сотни раз замечали и в покере, и в шахматах, и вот теперь в LLM.
Самая известная работа, в которой был описан этот закон для обучения трансформеров, определила развитие ИИ. Обычно такие законы называют законы масштабирования или scaling laws
Закон говорит, что ошибка модели зависит от трех величин: C - сколько вычислений вы использовали для обучения, D - размер датасета, N - сколько параметров в модели.
Теперь самое важное: эта зависимость офигеть какая точная (смотрите первую картинку) Посмотрите, как хорошо все точки кладутся на одну ровную линию. Я таких ровных прямых не видел, когда делал лабораторные по физике (возможно, конечно, дело во мне). Наклон этой линии определяет, как модель хороша при масштабировании - чем выше наклон, тем проще растить качество.
Все архитектуры можно и нужно масштабировать. Неважно, у вас сверточная сеть, рекуррентная LSTM-сеть или трансформер. Но все они масштабируются по разному. Сравните на 2 картинке наклон трансформеров и LSTM. Так как вычисления дешевеют, нужно брать ту архитектуру, которая масштабируется максимально хорошо.
C ростом параметров/данных/GPU растут все возможные метрики на различных задачах: перевод становится точнее, ответы на вопросы корректнее, задачи по математике начинают решаться. Даже текст, который генерирует модель, все сложнее и сложнее отличить от текста, написанного человеком.
Про этот закон сам Альтман сказал следующее:
Cамое важное знание, обнаруженное в моей жизни, заключалось в том, что масштабирование моделей ИИ приводит к невероятным и предсказуемым улучшениям интеллекта. У меня был странный опыт, когда я рассказывал об этом другим людям, пытаясь уговорить других людей дать нам деньги на это.
Теперь вы понимаете, как Альтман планировал добежать до AGI: взять самую эффективную архитектуру в мире (трансформер), собрать все данные в мире (интернет) и собрать все венчурные деньги мира.
Но кое-что пошло не так. У Альтмана кончились

