TGViewer
я обучала одну модель я обучала одну модель @def_model_train · 4.48K subscribers
Post #953 1.93K
Хотела написать еще про пару очень актуальных ablation studies – The False Promise of Imitating Proprietary LLMs
https://arxiv.org/abs/2305.15717

Сейчас вышло довольно много работ, где предлагается натюнить модель поменьше на ответах модели побольше, тем самым забустив качество и даже обогнав модель-учителя на отдельных заданиях (Distilling Step-by-Step, например). Датасеты типа ShareGPT и GPT4all также выкладываются, чтобы можно было научиться имитировать ChatGPT. Но насколько такое обучение может реально вытянуть качество модели, гораздо меньшей по размеру?

Тут в статье авторы собрали broad-coverage датасет из ShareGPT, HC3 и r/ChatGPT, а также task-specific QA датасет (взяли вопросы и просили ChatGPT ответить). Дальше обучали на этом модели и варьировали число параметров (GPT-2 1.5B, LLaMA 7B и 13B) и число токенов в обучающем датасете (0.3M–150M tokens)

Что обнаружили: в pairwise сравнении ChatGPT и LLaMA 13B, натренированной таким способом, 40% ответов LLaMA были сочтены одинаково хорошими или лучше ChatGPT, по мнению и людей-разметчиков, и GPT-4. Но дальше провели автоматическое сравнение на задачах MMLU, HumanEval и Natural Questions (результаты на скриншоте). Там оказалось, что обученная на imitation data модель оказалась хуже, чем изначальная. На Natural Question даже видно, что чем больше на таких данные обучали, тем хуже модель ставновилась. Это при том, что в датасете была даже часть конкретно с QA-задачками

И напротив, скейлить размер модели, при прочих равных, приближало метрики к уровню ChatGPT на этих бенчмарках

Какие выводы из всего этого делают авторы: 1) скорее всего, получить перфоманс огромной модели, обучившись на датасете в тысячу примеров, не получится. Да, хорошие данные это очень важно, но capabilities gap остается и его не преодолеть без увеличения числа параметров. 2) при обучении на imitation data модели учатся повторять стиль ответа ChatGPT, но не приобретают ее скилы (например, не приобретают фактологичность, скорее даже наоборот). Поэтому ответы таких моделей нравятся разметчикам, так как не всегда им хватает экспертизы и времени на фактчекинг.

Если в целом ваша задача выучить определенную стилистику ответов, это может быть даже не плохо. Например, авторы показывают, что само обучение на генерациях ChatGPT снижает токсичность модели
  • 🔥 5
  • 👍 3
  • 😁 1
  • 😢 1
More from @def_model_train
  1. Mar 28, 2026Моя любимая текущая конспирологическая теория из твиттера: claude mythos настолько силен в…
  2. Mar 12, 2026За неделю вышло несколько интересных новостей на стыке ML и нейробиологии: я про экспериме…
  3. Mar 8, 2026Другая поразившая меня часть этой хроники – это очень необычное понимание того, что такое…
  4. Mar 8, 2026Если вы еще не устали за неделю читать про противостояние Антропика и DoD, то я могу вам п…
  5. Mar 2, 2026Юдковский наконец-то победил в своей борьбе, и искусственный интеллект решил сам разбомбит…
  6. Nov 27, 2025Я в целом согласна с оценкой, что Суцкевер в своем интервью выдал примерно 3 бита информац…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →