TGViewer
Knowledge Accumulator Knowledge Accumulator @knowledge_accumulator · 5.69K subscribers
Post #328 3.51K
LLM + Эволюционные стратегии = ?

Напомню основную суть Evolution Strategies, про которые я уже когда-то писал:
Итак, вы находитесь в текущей точке пространства параметров - Theta. Метод пытается совершить градиентный подъём в нём, но, так как градиентов-то никаких нет, мы пытаемся его оценить как бы с помощью конечной разности. Одна итерация метода выглядит так:

1) Сэмплируем N стандартных нормальных шумов
2) Генерируем N новых Theha_i = Theta + Sigma * Noise_i
3) Получаем качество в этих точках - R_i
4) Оценка градиента Grad равна сумме по всем R_i * Noise_i / (N * Sigma)
5) Делаем шаг по нему: Theta_new = Theta + Alpha * Grad


У одной команды ресёрчеров родилась смелая идея - а что, если оптимизировать LLM с помощью такого метода? Для этого нужно использовать метод с пачкой оптимизаций (не особо гениальных, надо сказать):

- Вместо того, чтобы передавать шумы на воркеры для эвала, мы просто передаём рандом сид, и потом восстанавливаем такой же шум из него
- Чтобы минимизировать затраты по памяти, мы применяем этот шум in-place по одному тензору, а после эвала точно таким же образом вычитаем этот шум обратно
- Также, при подсчёте итогового шага мы делаем всё in-place для экономии памяти, слой за слоем

То есть, по факту применяется самый базовый ES-алгоритм, и получаются результаты, сопоставимые с GRPO-обучением на их задаче. Я не собираюсь детально оценивать, лучше это или хуже бейзлайна, интересен даже сам факт сопоставимости.

Главная загадка природы - как ES с размером популяции 30 (!!!) смог оптимизировать модель с миллиардом параметров? Авторы отсылают к идее о том, что обучение LLM на самом деле происходит в пространстве гораздо меньшей размерности, чем кажется.

Они упоминают статью Intrinsic Dimensionality Explains the Effectiveness of Language Model Fine-Tuning [2020]. У Техножрицы были про неё отдельные посты, я же ограничусь совсем кратким пересказом:

Авторы берут разные языковые модели и дообучают их на задачах, но при этом искусственно ограничивают размерность подпространства, что-то типа LoRA. Они перебирают размерность этого обучения и смотрят на качество, затем высчитывают так называемый d_90 = какой размерности нужна "LoRA", чтобы получить 90% от качества полной модели.

Результаты получились такие - во-первых, в процессе претрейна d_90, если запускать из данного чекпоинта, падает со временем. Во-вторых, чем больше модель, тем меньше этот самый d_90. То есть, если предобучить большую модель на большом датасете, то дотюнивать модель можно в пространстве очень маленькой размерности.

На мой взгляд, это всё очень интересно. В то же время, возникает вопрос - если вся модель файнтюнится с помощью ES, потому что это всё происходит в пространстве маленькой размерности, получается, что можно напрямую LoRA с помощью ES? Есть повод задуматься о том, что можно выжать из претрейна LLM таким образом. Может быть, суперинтеллект и не выйдет, но, вполне возможно, получится хорошо забустить генерализацию или другие желаемые качества. А так, как пространство параметров маленькое, переобучения можно почти не бояться, и нужно совсем немного данных.

@knowledge_accumulator
  • 👍 21
  • ❤ 3
  • 🔥 1
More from @knowledge_accumulator
  1. Sep 20, 2026Почувствуйте AGI Все эти годы я писал о том, что не верю в потенциал LLM превратиться в су…
  2. Sep 5, 2026Предсказать среднее могут не только лишь все Классическая задача машинного обучения - трен…
  3. Aug 17, 2026Долина vs Нью-Йорк Если что-то находится далеко от нас, нам свойственно излишне обобщать с…
  4. Jul 30, 2026Кто виноват в сливе рекламного бюджета? При создании рекламного line item рекламодатель ус…
  5. Jul 13, 2026Покатался на яхте в Американской глубинке После переезда в Калифорнию произошло неожиданно…
  6. Jun 30, 2026Да кто такие эти ваши producer-side A/B-тесты? В своей яндексовской эре работы над рекомен…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →