TabFM - придумали foundation-модель для табличных данных (что? 😅), и она SOTA на TabArena. Не прошло и года, новый лидер
В отличие от привычных LightGBM, CatBoost или TabM, она работает в zero-shot режиме: для нового датасета не требуется обучение или подбор гиперпараметров, достаточно передать обучающие строки в качестве контекста. TabFM рассматривает задачу табличного ML как in-context learning. Вместо обучения под конкретный датасет обучающие строки передаются модели как контекст. Веса модели не обновляются - достаточно одного forward pass. Архитектура сочетает идеи TabPFN и TabICL: row/column attention, компрессию строк и transformer для in-context learning. Модель обучали на сотнях миллионов синтетических таблиц, ибо открытых данных мало. Из минусов - лицензия только для некоммерческого использования
Удивительно, но это действительно работает. Во всех моих экспериментах TabFM показал качество выше, чем бустинги, даже без какого-либо обучения под датасет. Причем на самом большом датасете контекст пришлось сократить из-за нехватки памяти, но TabFM все равно показала лучший результат.
Ниже - сравнение качества и времени работы. Время указано для GPU, без которого TabFM работал бы еще на пару порядков медленнее
Post #236
872
AI.Insaf UPD: Когда под анонсом в канале Яндекса я поделился своими изысканиями, мне прислали ссылку на открытый бенчмарк TabArena (см 2я картинка). Выводы там в целом аналогичны моим: метрики LightGBM статистически значимо не отличаются от TabM. Но, к удивлению,…

- 👍 13
- ❤ 3
- 🤯 2