TGViewer
КПД КПД @quant_prune_distill · 3.49K subscribers
Post #536 2.82K
🧪Эксперименты

Авторы обучают семейство Llama-like языковых моделей размером от 7M до 2.5B параметров на выборках до 100М уникальных токенов. Всего обучаются по 100 AR и диффузионных моделей.

Для обеих парадигм строят зависимость валидационного лосса от числа эпох. AR сначала идут бодрее, но потом начинают переобучаться, в то время, как диффузия продолжает улучшаться по лоссу на валидации даже при нескольких сотнях эпох.
И самый низкий лосс достигается диффузионной моделью на заданной сетке параметров. Поверх обученных моделей фитируют data-constrained scaling law откуда выходит, что диффузионки могут несколько сотен раз эффективно проходиться по одним и тем же токенам.

Затем сравнивают 0-шоты, которые едва-едва лучше рандома, используя чекпоинты с наименьшим валидационным лоссом. И диффузия оказывается несколько лучше в data-constrained settings.

Полученный результат авторы объясняют тем, что диффузионная постановка дает автоматически некоторую аугментацию за счет зашумления данных и прохода по последовательностям в произвольном порядке.

Можно ли поднять качество AR-моделей за счет аугментации? Attention drop / маскирование токенов в AR никак не помогает. А вот обучение с разными перестановками порядка токенов будто бы позволяет достичь того же валидационного лосса, что и диффузия.

🤔 Критика

Блогпост, вышедший вскоре, разносит методологию данной статейки, хоть и в целом подтверждает ключевые выводы. Авторы блогпоста обращают внимание на следующие моменты:

📌 Лосс для диффузии и авторегрессии сранивать вообще-то некорректно, так как один - это правдподобие, а другой - оценка на него.

📌 В правильное выражение для лосса диффузии входит множитель, зависящий от шага диффузии, без которого формула, использованная в первой статье неверна.

📌 Early stopping на валидации делать не кошерно. Валидационный лосс для AR может начать расти из-за самоуверенных неточных предсказаний, но качество на бенчмарках все равно продолжит расти. И, собственно, так оно и оказывается.

📌 Используемая зависимости для scaling laws справедлива только в ограниченном диапазоне, так как в ней нигде не возникает возможность роста валидационного лосса, которая имеет место в большом числе эпох.

Критики проводят примерно те же эксперименты, но на больших моделях / объёмах данных и приходят к тому же выводы, что диффузия при большом количестве проходов выходит на лучшее качество.

Кроме того, отмечают авторы, диффузия обладает двухсторонним вниманием, которое более выразительно и потенциально может выжать нечто большее из контекста.

💡 Выводы

Не знаю, насколько близок тот момент, когда человечество будет реально упираться в данные, а не вычисления, и 100 эпох по квадриллиону токенов будет чем-то посильным, а пока на ближайшее будущее авторегрессионная парадигма все еще остается предпочтительной в NLP, будучи более вычислительно эффективной. Интересно, насколько выводы переносятся на файнтьюны на маленьких датасетах. Сможет ли диффузия выжать больше из маленького SFT датасета? Кроме того, диффузионный подход, будучи более молодым здесь, возможно, имеет еще некий потенциал для прокачки.
  • ❤ 8
  • 👍 3
More from @quant_prune_distill
  1. Oct 7, 2026А еще есть красивая демка
  2. Oct 7, 2026⚙️ Метод MMD есть мера различия между двумя распределениями P, Q. Задается некоторый полож…
  3. Oct 7, 2026🧠 Representation-Space MMD for Diffusion Language Models 📄 Статья Первое, что приходит в…
  4. Oct 7, 2026А вообще, можно энкодить все на языке brainfuck и иметь Тьюринг-полную систему.
  5. Oct 7, 2026Jev не генеративен, потому что он не выбирает следующий токен, а выбирает один из варианто…
  6. Oct 6, 2026Совпадение? Не думаю!
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →