TabDDPM
Статья сотрудников лаборатории Яндекс, в которой исследуется применимость диффузионных моделей для задач генерации синтетических табличных данных. Авторы сравнивают свою работу с многочисленными бейзлайнами - VAE и GAN-ми. Для этого они семплируют синтетические данные из генеративных моделей и затем обучают на этих данных классические модели: случайный лес, CatBoost и т.п. Авторы показывают, что их метод обходит другие по качеству в различных сценариях, в том числе в сценарии защиты приватных данных.
Работа может быть полезна исследователем, МЛ инженерам и аналитикам данных.
статья | код
Post #10
366