📌 Задумывались, насколько хорош ModernBERT по сравнению с декодерами вроде LLaMA?
Результаты оказались неожиданными: их энкодер-модель превзошла оригинальный ModernBERT, а декодер — даже LLaMA 3.2 и SmolLM2
Модели серии называются Ettin — от 17M до 1B параметров, при этом даже самая компактная поддерживает контекст в 8k токенов.
Особенности проекта:
— Честное head-to-head сравнение encoder vs decoder моделей с одинаковыми SOTA-рецептами
— Энкодеры по-прежнему выигрывают в задачах классификации и поиска, даже по сравнению с существенно более крупными декодерами
— Обучение всех моделей проводилось на академических мощностях: 4×H100 на каждую, 17M-модель можно натренировать на 2T токенов менее чем за неделю
— Выложены 200+ чекпоинтов с точной историей данных между ними, доступных в raw-формате для дообучения и анализа
Разработчики подчёркивают: даже при росте популярности декодеров, энкодеры всё ещё актуальны и конкурентоспособны, особенно при больших объёмах данных и долгих тренировках.
📎 Статья: https://arxiv.org/abs/2507.11412
💻 Код и данные: https://github.com/JHU-CLSP/ettin-encoder-vs-decoder
📖 Блог на HuggingFace:https://huggingface.co/blog/ettin
Post #1958
6.8K



- ❤ 31
- 👍 13
- 🔥 9
- ☃ 6
- 👨💻 1