TGViewer
я обучала одну модель я обучала одну модель @def_model_train · 4.48K subscribers
Post #940 2.36K
Статья с завораживающим названием Distilling Step-by-Step! Outperforming Larger Language Models with Less Training Data and Smaller Model Sizes
https://arxiv.org/abs/2305.02301

В качестве затравки авторы утверждают: 🌸«our 770M T5 model outperforms the 540B PaLM model using only 80% of available data on a benchmark task» 🌸

Что по факту они предлагают делать:
1. Взять действительно большую LLM (они используют PaLM)
2. Попросить ее нагенарить для нужного датасета ответы + объяснение, почему именно такой ответ выбран (rationale). Под ответами в статье в основном имеются в виду конкретно ответы на вопросы, выбрать что-то из multiple choice, задачки на логику и тд. Промт делают достаточно простой, просто во few-shot запихивают пару примеров ответов
3. Обучить на этих данных модель поменьше. Модель-ученика тренируют предсказывать и ответ, и объясение (через спецтокены label и rationale соответственно). Лосс на них считают по отдельности и складывают
4. ???
5. PROFIT

Имхо авторы занимаются здесь хайпожорством, так как дистилляцией такой подход сложно назвать. Вроде еще год назад, что ChatGPT, все поняли, что качество моделей сильно возрастает, если попросить их мыслить step by step и объяснять свой путь принятия решения. Я видела пару работ и про классификаторы, где использовалась ровно такая же логика: модель отдельно просили выдавать лейбл и отдельно объяснение; объяснение далее не использовалось, но сама необходимость его генерации очень бустило качество

В статье показано только то, что огромные LLM очень хорошо генерят эти rationale и на этом можно неплохо обучаться, а не пытаться от маленькой модели такой reasoning без дообучения просить

Неожиданно пожалуй, насколько крутой рост по метриках на бенчмарках это даает и насколько меньше данных оказывается нужно. Так что годный proof of concept получается, но с очень уж претенциозным названием
  • ❤ 22
More from @def_model_train
  1. Mar 28, 2026Моя любимая текущая конспирологическая теория из твиттера: claude mythos настолько силен в…
  2. Mar 12, 2026За неделю вышло несколько интересных новостей на стыке ML и нейробиологии: я про экспериме…
  3. Mar 8, 2026Другая поразившая меня часть этой хроники – это очень необычное понимание того, что такое…
  4. Mar 8, 2026Если вы еще не устали за неделю читать про противостояние Антропика и DoD, то я могу вам п…
  5. Mar 2, 2026Юдковский наконец-то победил в своей борьбе, и искусственный интеллект решил сам разбомбит…
  6. Nov 27, 2025Я в целом согласна с оценкой, что Суцкевер в своем интервью выдал примерно 3 бита информац…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →