Статья с завораживающим названием Distilling Step-by-Step! Outperforming Larger Language Models with Less Training Data and Smaller Model Sizes
https://arxiv.org/abs/2305.02301
В качестве затравки авторы утверждают: 🌸«our 770M T5 model outperforms the 540B PaLM model using only 80% of available data on a benchmark task» 🌸
Что по факту они предлагают делать:
1. Взять действительно большую LLM (они используют PaLM)
2. Попросить ее нагенарить для нужного датасета ответы + объяснение, почему именно такой ответ выбран (rationale). Под ответами в статье в основном имеются в виду конкретно ответы на вопросы, выбрать что-то из multiple choice, задачки на логику и тд. Промт делают достаточно простой, просто во few-shot запихивают пару примеров ответов
3. Обучить на этих данных модель поменьше. Модель-ученика тренируют предсказывать и ответ, и объясение (через спецтокены label и rationale соответственно). Лосс на них считают по отдельности и складывают
4. ???
5. PROFIT
Имхо авторы занимаются здесь хайпожорством, так как дистилляцией такой подход сложно назвать. Вроде еще год назад, что ChatGPT, все поняли, что качество моделей сильно возрастает, если попросить их мыслить step by step и объяснять свой путь принятия решения. Я видела пару работ и про классификаторы, где использовалась ровно такая же логика: модель отдельно просили выдавать лейбл и отдельно объяснение; объяснение далее не использовалось, но сама необходимость его генерации очень бустило качество
В статье показано только то, что огромные LLM очень хорошо генерят эти rationale и на этом можно неплохо обучаться, а не пытаться от маленькой модели такой reasoning без дообучения просить
Неожиданно пожалуй, насколько крутой рост по метриках на бенчмарках это даает и насколько меньше данных оказывается нужно. Так что годный proof of concept получается, но с очень уж претенциозным названием
Post #940
2.36K

- ❤ 22