TGViewer
КПД КПД @quant_prune_distill · 3.49K subscribers
Post #614 2K
🔬 Метод

За основу берут метод из H-Net, но моделируют на уровне токенов, а не бит.

Dynamic Large Concept Model (DLCM) работает следующим образом:

1️⃣ Токенизируем текст каким-то токенизатором
2️⃣ Прогоняем текст через некий энкодер
3️⃣ Затем считаем похожесть (косинусное расстояние) между прошлой query и текущим ключом. Если расстояние больше заданного порога, то начинаем следующий токен, иначе сливаем текущий токен с тем что есть. Получаем таким образом укороченную последовательность.
4️⃣ Прогоняем эту укороченную последовательность через основную модель.
5️⃣ Декодируем обратно в исходное пространство токенов через cross-attention на исходную последовательность токенов.

При обучении задается желаемое сжатие R (сколько в среднем исходных токенов сжимаются в латентный токен). Для поддержания целевой степени сжатия добавляется вспомогательный лосс, который способствует тому, чтобы в среднем R токенов сливалось в один токен.

На обучении разбиение на токены сэмплируют из распределения Бернулли для exploration, на инференсе разбивают по порогу 0.5.

Из деталей реализации стоит отметить следующее. Так как при подаче батча с фиксированной длиной исходных токенов число латентных может разниться, в данной работе реплицируют их на этапе обучения. Flex Attention с паддингами выглядит естественным решением, но оказывается, что это работает медленнее (в 1.4-1.7 раз), чем Flash Attention c репликацией.

🧪 Эксперименты

Метод валидируют, обучая семейство моделей Llama-like архитектуры, используя токенизатор DeepSeek.
Для подбора оптимальных гипепараметров используют \muP параметризацию, как для энкодера, так и основной модели. Параметры настраивают на маленькой 87M модели и масштабируют на большие.

Кроме того, в данной статье предлагают scaling law лосса в зависимости от степени сжатия R, и доли параметров, приходящихся на энкодер P. Оказывается, что R=4 более менее оптимальный выбор с точки зрения соотношения качество/скорость.

Для оценки качества берут выборку из 12 бенчмарков из lm-eval-harness. DLCM дает прирост почти на всех бенчах и в среднем 2-3% качества по сравнению с стандартной токенизацией. Основной прирост на задачах, требующих reasoning,

Глобальная регуляризация (приведение среднего сжатия к R) лучше, чем на уровне отдельного предложения.

💡 Выводы

Неплохой результат с очевидной практической пользой - солидной экономией вычислений за счет более коротких последовательностей. Интересно, будет ли данное направление дальше развиваться и увидим ли мы SOTA-level LLM c отходом от стандартной токенизации?
  • 👍 7
  • 🔥 2
  • 🙏 2
More from @quant_prune_distill
  1. Oct 7, 2026А еще есть красивая демка
  2. Oct 7, 2026⚙️ Метод MMD есть мера различия между двумя распределениями P, Q. Задается некоторый полож…
  3. Oct 7, 2026🧠 Representation-Space MMD for Diffusion Language Models 📄 Статья Первое, что приходит в…
  4. Oct 7, 2026А вообще, можно энкодить все на языке brainfuck и иметь Тьюринг-полную систему.
  5. Oct 7, 2026Jev не генеративен, потому что он не выбирает следующий токен, а выбирает один из варианто…
  6. Oct 6, 2026Совпадение? Не думаю!
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →