TGViewer
КПД КПД @quant_prune_distill · 3.49K subscribers
Post #535 2.03K
🔬 Метод

Есть такие scaling laws, описывающие зависимость функции ошибки от размера модели и бюджета обучения. На практике датасет ограничен, и интуитивно понятно, что многократный проход по нему с какого-то момента не будет приносить особой пользы.

В статье было исследование поведение AR LLM в условии ограниченных данных и предложен модифицированный закон Шиншиллы, учитывающий diminishing return от повторного прохода по данным. Для авторегрессивных LM 4-раза эпохи примерно так же хороши, как одна, а дальше польза от роста бюджета обучения уменьшается.

В AR парадигме модель предсказывает обычно следующий токен слева направо (хотя существуют и вариации с произвольным порядком). Диффузионая LLM в самой популярной постановке учится расшумлять исходный текст, в котором токены заменяются с некоторой вероятностью на специальный [MASK] токен.

AR имеет более сильный inductive bias, но диффузия зато может работать в произвольном порядке и на каждой эпохе видя по-разному данные, может извлечь что-то новое.

Лосс для авторегресии - это честное правдоподобие модели на примере данных, а для диффузии - нижняя граница.
More from @quant_prune_distill
  1. Oct 7, 2026А еще есть красивая демка
  2. Oct 7, 2026⚙️ Метод MMD есть мера различия между двумя распределениями P, Q. Задается некоторый полож…
  3. Oct 7, 2026🧠 Representation-Space MMD for Diffusion Language Models 📄 Статья Первое, что приходит в…
  4. Oct 7, 2026А вообще, можно энкодить все на языке brainfuck и иметь Тьюринг-полную систему.
  5. Oct 7, 2026Jev не генеративен, потому что он не выбирает следующий токен, а выбирает один из варианто…
  6. Oct 6, 2026Совпадение? Не думаю!
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →