Seq vs Seq: An Open Suite of Paired Encoders and Decoders
Вам никогда не было интересно, что будет, если замаскировать аттеншн у энкодера, чуть-чуть поучить и получить декодер? Или наоборот?
Авторы сегодняшней статьи решили проверить именно это. Они взяли рецепт обучения от ModernBERT, убрали из него пару небольших деталей (типа мёржинга моделей, разные \theta для локального и глобального RoPE и так далее) и обучили набор моделей Ettin от 17M параметров до 1B параметров как на MLM, так и на CLM тасках на DCLM/Dolma. Получается матч между энкодерами и декодерами как по архитектуре, так и по данным — можно сравнивать напрямую.
Чтобы доказать, что модели достаточно хороши, авторы сделали таблички со сравнениями с Pythia, DistillGPT, Olmo и SmolLM-2 для декодеров и с ModernBERT, BERT, DistilRoBERTa и MiniLM для энкодеров. Везде Ettin побеждает — искать метрики для квена мы не будем, чтобы не портить авторам удовольствие от своей работы :P
Так как топ моделей на MTEB занимают большие декодеры, которые переобучали на задачи для энкодеров на небольшом числе данных, авторы решили провести эксперимент: поменять задачу обучения на противоположную (CLM -> MLM; MLM -> CLM) и посмотреть, как поменяются метрики моделей после continued pretraining на 50B токенов с противоположной таской.
Дальше идут замеры на трёх задачах:
- Классификация (MNLI) — и для декодеров, и для энкодеров добавляют классификационные головы и тюнят на трейне бенчей.
- Retrieval (MSMarco) — то же самое.
- Генерация (ARC, HS, PIQA, etc) — для декодеров всё понятно, для энкодеров — повторяют рецепт из BERTs are Generative In-Context Learners. Приятно встретить старого знакомого в списке литературы.
Результаты довольно предсказуемы — как в генеративных, так и в энкодерных задачах побеждают соответствующие базовые модели. Добавление второго шага обучения роняет скоры в "родных" задачах, но немножко повышает скоры в "неродных" задачах. Забавно, что чёткого тренда не наблюдается — в зависимости от скейла моделей скоры гуляют и в некоторых случаях выигрывают то Enc-from-Dec, то Dec-from-Enc.
Выводы:
- Если есть крутые декодеры, то мы можем их превратить в энкодеры и качество решения классификационных задач чуть повысится.
- Если есть ещё и крутые энкодеры сопоставимых размеров, то лучше брать их, а не декодеров — качество будет выше.
- Из того, что у нас есть большие декодеры не следует, что энкодеры больше не нужны. Да, мы можем конвертить заскейленные декодеры в энкодеры и получать соту на мтебе, но заскейленный до того же размера энкодер будет лучше конвертнутого декодера.
Мысли:
- MLM достаточно разреженная по сигналу таска — на каждый пример из датасета мы получаем всего 15-30% маскированных токенов, тогда как на CLM мы на каждом токене получаем сигнал для обучения. Получается, что декодеры сойдутся до заданной перплексии быстрее энкодеров — так что разрыв в тасках может быть ещё выше, если продолжать учить энкодеры дальше.
- Авторы не учили ни энкодеры, ни декодеры на контрастиве, только на MLM/CLM. Сохранится ли результат после такого тюна?
- Есть у меня чуйка, что в будущем почти все ллмки станут гибридами с мамбой/rwkv. Раз мы там кодируем контекст в стейте (и этот контекст точно раскодируется моделью в текст), как себя покажут в той же таблице стейты гибридов в задачах поиска и классификации? А после контрастива?
Код, веса, данные и даже промежуточные чекпоинты выложены, респект ребятам. Ну и я доволен — эта статья ответила на некоторые вопросы, которые меня давно уже мучают.
Статья
Блог на хф
Модели
Код
Post #253
1.45K
- 🔥 11