Думаю все слышали что openai релизную новую версию gpt-4o. Она в 2 раза дешевле, и чуток проседает по некоторым бенчмаркам. Да и сама gpt-4o это (вероятнее всего) "дистилят" большой, умной и медленной модели gpt-4. До этого релизнули целую пачку ллам, и маленькие модели тоже сдистилированны из большой.
А что вообще такое дистиляция ЛЛМ?
Наверное максимально общим определением дистиляции нейросетей было бы перенос знаний из одной модели в другую. Однако под это попадает и обучение на синтетических данных (как например openchat), что сложно назвать дистиляцией (иначе обучившись на произведениях Пушкина я бы смог сказать что сдистилировал его мозг себе в ллм), так что наверное стоит еще добавить условие на использование латентного состояния модели.
Обычная любая работа по ужиманию моделей идет в 2 этапа - определям где есть избыточность - какие слои можно сделать меньше, какие головы убрать, каких экспертов выключить, ... . Для этого можно использовать анализ градиентов по параметрам (долго) или всякие эвристики (типо косинусной близости векторов до и после слоя, значения каких то компонент активаций и много чего еще)
После того как мы выкинули часть параметров, запруненую нейронку нужно дотюнить, что бы не сильно просесть в качестве. Можно конечно ее учить просто на данных, однако есть более интересные подходы. Например уча модель мы можем считать лосс не между унитарным распределением на нужном токене (и выходами модели), а на логитах бОльшей модели.
Так же можно добавить лосс на разницу активаций на промежуточных слоях (а если мы ужали модель так, что там отличаются размерности, вставить туда дополнительно обучаемый линейный слой, уча маленькую модель подражать большой, и активации отличались только простым линейным преобразованиям (см картинку)
И дает ли это результат?
Например резульаты нвидивских моделй minitron - дистиляция 4б модели из 15б дает на порядки лучшие результаты чем обучение с 0ля на в 4 раза больших данных.
При этом сама модель после пруна (обрезки слоев без дообучения) - перформит довольно плохо, вся магия именно в дистиляции (таблица)
Что можно посмотреть
Статья про немотроны
Mini llm (тут можно умереть в математике)
Любые посты на @mlphys
Post #96
1.6K


- 👍 5
- ❤ 3
- 🥰 1