Хотела написать еще про пару очень актуальных ablation studies –
The False Promise of Imitating Proprietary LLMshttps://arxiv.org/abs/2305.15717Сейчас вышло довольно много работ, где предлагается натюнить модель поменьше на ответах модели побольше, тем самым забустив качество и даже обогнав модель-учителя на отдельных заданиях (Distilling Step-by-Step, например). Датасеты типа ShareGPT и GPT4all также выкладываются, чтобы можно было научиться имитировать ChatGPT. Но насколько такое обучение может реально вытянуть качество модели, гораздо меньшей по размеру?
Тут в статье авторы собрали broad-coverage датасет из ShareGPT, HC3 и r/ChatGPT, а также task-specific QA датасет (взяли вопросы и просили ChatGPT ответить). Дальше обучали на этом модели и варьировали число параметров (GPT-2 1.5B, LLaMA 7B и 13B) и число токенов в обучающем датасете (0.3M–150M tokens)
Что обнаружили: в pairwise сравнении ChatGPT и LLaMA 13B, натренированной таким способом, 40% ответов LLaMA были сочтены одинаково хорошими или лучше ChatGPT, по мнению и людей-разметчиков, и GPT-4. Но дальше провели автоматическое сравнение на задачах MMLU, HumanEval и Natural Questions (результаты на
скриншоте). Там оказалось, что
обученная на imitation data модель оказалась хуже, чем изначальная. На Natural Question даже видно, что чем больше на таких данные обучали, тем хуже модель ставновилась. Это при том, что в датасете была даже часть конкретно с QA-задачками
И напротив, скейлить размер модели, при прочих равных, приближало метрики к уровню ChatGPT на этих бенчмарках
Какие выводы из всего этого делают авторы: 1) скорее всего, получить перфоманс огромной модели, обучившись на датасете в тысячу примеров, не получится. Да, хорошие данные это очень важно, но capabilities gap остается и его не преодолеть без увеличения числа параметров. 2)
при обучении на imitation data модели учатся повторять стиль ответа ChatGPT, но не приобретают ее скилы (например, не приобретают фактологичность, скорее даже наоборот). Поэтому ответы таких моделей нравятся разметчикам, так как не всегда им хватает экспертизы и времени на фактчекинг.
Если в целом ваша задача выучить определенную стилистику ответов, это может быть даже не плохо. Например, авторы показывают, что само обучение на генерациях ChatGPT снижает токсичность модели