Есть такие scaling laws, описывающие зависимость функции ошибки от размера модели и бюджета обучения. На практике датасет ограничен, и интуитивно понятно, что многократный проход по нему с какого-то момента не будет приносить особой пользы.
В статье было исследование поведение AR LLM в условии ограниченных данных и предложен модифицированный закон Шиншиллы, учитывающий diminishing return от повторного прохода по данным. Для авторегрессивных LM 4-раза эпохи примерно так же хороши, как одна, а дальше польза от роста бюджета обучения уменьшается.
В AR парадигме модель предсказывает обычно следующий токен слева направо (хотя существуют и вариации с произвольным порядком). Диффузионая LLM в самой популярной постановке учится расшумлять исходный текст, в котором токены заменяются с некоторой вероятностью на специальный
[MASK] токен.AR имеет более сильный inductive bias, но диффузия зато может работать в произвольном порядке и на каждой эпохе видя по-разному данные, может извлечь что-то новое.
Лосс для авторегресии - это честное правдоподобие модели на примере данных, а для диффузии - нижняя граница.