Почему AGI не за углом 2/2
Представляю вам The Next Big Thing в дообучении LLM: сочетание RL и LoRA.
LoRA — это лёгкая надстройка над большой моделью, которая позволяет менять поведение без вмешательства в её фундаментальные способности. По сути, это дополнительные матрицы, накладывающиеся поверх основной архитектуры, чтобы корректировать ответы модели. Она сохраняет широкий, обобщающий интеллект, полученный после масштабного обучения, и вместе с этим получает новые навыки, добавленные поверх.
Навыки становятся съёмными модулями. Их можно подключать и отключать, обучать быстро и дёшево, тестировать отдельно, обновлять без риска разрушить ядро. И это освобождает базовую модель от давления RL, который раньше приходилось встраивать прямо в неё.
Что это означает на практике?
1. Стоимость обучения снижается, потому что не нужно трогать гигантскую базовую модель.
2. Скорость обучения увеличивается, потому что LoRA-модули маленькие.
3. Гибкость возрастает: reasoning можно подключать как модуль, а не жёстко вшивать.
4. Интеллект модели растёт за счёт того, что она использует ровно те навыки, которые нужны сейчас, а не полный мешок всех параметров.
И дальше начинается самое интересное. Такая архитектура разрушает старый порочный круг. База остаётся максимально широкой, обобщающей и мощной. А поведенческие слои живут отдельно, позволяют настраивать модель под конкретные цели и требования, не влияя на её фундаментальные способности.
В этот момент развитие LLM перестаёт быть тяжёлым, цикличным, медленным процессом. Оно превращается в модульную инженерную работу: обновил слой, заменил модуль, улучшил конкретный навык — и система уже стала другой.
Post #68
367
- 👍 3
- ❤ 2
- 🔥 2