TGViewer
ml phys ml phys @mlphys · 2.89K subscribers
Post #96 1.6K
Думаю все слышали что openai релизную новую версию gpt-4o. Она в 2 раза дешевле, и чуток проседает по некоторым бенчмаркам. Да и сама gpt-4o это (вероятнее всего) "дистилят" большой, умной и медленной модели gpt-4. До этого релизнули целую пачку ллам, и маленькие модели тоже сдистилированны из большой.

А что вообще такое дистиляция ЛЛМ?

Наверное максимально общим определением дистиляции нейросетей было бы перенос знаний из одной модели в другую. Однако под это попадает и обучение на синтетических данных (как например openchat), что сложно назвать дистиляцией (иначе обучившись на произведениях Пушкина я бы смог сказать что сдистилировал его мозг себе в ллм), так что наверное стоит еще добавить условие на использование латентного состояния модели.

Обычная любая работа по ужиманию моделей идет в 2 этапа - определям где есть избыточность - какие слои можно сделать меньше, какие головы убрать, каких экспертов выключить, ... . Для этого можно использовать анализ градиентов по параметрам (долго) или всякие эвристики (типо косинусной близости векторов до и после слоя, значения каких то компонент активаций и много чего еще)

После того как мы выкинули часть параметров, запруненую нейронку нужно дотюнить, что бы не сильно просесть в качестве. Можно конечно ее учить просто на данных, однако есть более интересные подходы. Например уча модель мы можем считать лосс не между унитарным распределением на нужном токене (и выходами модели), а на логитах бОльшей модели.

Так же можно добавить лосс на разницу активаций на промежуточных слоях (а если мы ужали модель так, что там отличаются размерности, вставить туда дополнительно обучаемый линейный слой, уча маленькую модель подражать большой, и активации отличались только простым линейным преобразованиям (см картинку)

И дает ли это результат?
Например резульаты нвидивских моделй minitron - дистиляция 4б модели из 15б дает на порядки лучшие результаты чем обучение с 0ля на в 4 раза больших данных.
При этом сама модель после пруна (обрезки слоев без дообучения) - перформит довольно плохо, вся магия именно в дистиляции (таблица)

Что можно посмотреть
Статья про немотроны
Mini llm (тут можно умереть в математике)
Любые посты на @mlphys
  • 👍 5
  • ❤ 3
  • 🥰 1
More from @mlphys
  1. Oct 1, 2026Это конец подписочных B2C бизнесов - Openai dot сама сканит почту - Поняла что есть подпис…
  2. Sep 29, 2026Тлдр сегодняшнего dev day open ai За те же лимиты надо будет платить 500 баксов Не тратьте…
  3. Sep 29, 20266.1 sol все таки выходит
  4. Sep 29, 2026Dots - новая система от openai, always on ai Живёт в приложении на телефоне и компьютере,…
  5. Sep 20, 2026Дайте астре почилить хотя бы в воскресенье
  6. Sep 16, 2026https://mimo.xiaomi.com/rl/ Риал тайм дашборд трейнинга новой модели сиаоми
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →