Дистилляция в байтовые модели открывает новые законы скейлинга.
Breaking the Token Ceiling: Distilling Smaller, Stronger Byte ModelsKalyani Marathe, Artidoro Pagnoni, Tomasz Limisiewicz, Margaret Li, Mike Lewis, Luke Zettlemoyer, Srinivasan IyerPaper:
https://arxiv.org/abs/2609.12303Review:
https://arxiviq.substack.com/p/breaking-the-token-ceiling-distillingCode: N/A
Model: N/A
ЧТО сделали: Авторы провели масштабное теоретическое и эмпирическое исследование овертрейнинга dense-трансформеров с архитектурой decoder-only на стыке двух осей: парадигмы токенизации (BPE-токены против сырых байтов UTF-8) и функции потерь (supervised cross-entropy против дистилляции знаний). Чтобы переносить знания от крупных моделей-учителей с BPE-словарями без вычислительно неподъёмных многопроходных авторегрессионных вычислений, исследователи разработали два метода однопроходной конвертации логитов: приближённую условную маргинализацию Marginalize-It и точный метод End-Of-Token, расширяющий байтовый словарь структурным разделителем конца токена <eot>. Обучив сетку 1B-моделей на объёме до 1 триллиона байт с учителем Llama 3-8B, авторы вывели степенные законы скейлинга, связывающие тренировочные FLOPs, валидационный лосс в битах на байт (BPB) и точность на восьми бенчмарках.
ПОЧЕМУ это важно: Общепринятые подходы к токенизации опираются на эвристики вроде Byte Pair Encoding (BPE), которые создают узкие места в репрезентации данных, раздувают словарь, страдают от артефактов на границах слов и требуют колоссальных объёмов памяти для сохранения логитов при офлайн-дистилляции. Байтовые архитектуры традиционно уступали токенным при малых вычислительных бюджетах из-за удлинения последовательностей. Однако эта работа доказывает, что байтовые модели демонстрируют значительно более крутую траекторию скейлинга и заметно более высокий асимптотический потолок качества. Точно дистиллированные байтовые модели превосходят токенные аналоги по средней точности на задачах на величину до 4%, догоняют их по качеству всего на 1/6 объёма обучающих данных и сокращают затраты дискового пространства на хранение логитов учителя примерно в пять раз за счёт отказа от усечения top-k.
Для практиков: Долгое время считалось, что учить языковые модели напрямую на сырых символах или байтах вычислительно неэффективно по сравнению с BPE-токенизацией. Данная работа опровергает этот тезис для режимов длительного обучения с большим бюджетом вычислений. При переносе знаний из 8B-учителя в компактные 1B-модели токенные ученики быстро упираются в плато, где дальнейшие вычисления дают околонулевой прирост. Байтовые модели стартуют медленнее, так как тратят ресурсы на сборку слов из байтов, но сохраняют устойчивый прогресс на длинной дистанции. Добавление простого разделителя <eot> позволяет переводить распределение учителя в байтовые последовательности за один проход, обеспечивая то же качество при экономии 84% обучающих данных и 80% места на диске под логиты. Если ваша цель — выжать максимум качества из компактной модели для инференса на устройствах при наличии мощностей для долгого обучения, дистилляция напрямую в байтовую архитектуру позволяет преодолеть фундаментальные ограничения стандартных токенизаторов.
Дистиллировать в байты тут:
https://t.me/gonzo_ML_podcasts/4805