نکته جالب TabFM اینه که مسئله پیشبینی روی دادههای جدولی رو به یه مسئله In-Context Learning (ICL) تبدیل کرده - دقیقاً همون منطقی که مدلهای زبانی مثل GPT ازش استفاده میکنن.
تفاوت با روش سنتی: به جای اینکه برای هر دیتاست جدید یه مدل جدید train کنید (مثل XGBoost که باید hyperparameter tuning و feature engineering انجام بدید)، کل دیتاست (هم دادههای train و هم ردیفهای test) رو بهعنوان یه prompt واحد به مدل میدید و مدل توی یک forward pass پیشبینی میکنه. یعنی صفر تا صد zero-shot - بدون training، بدون tuning.
نحوهی آموزش: چون دیتاستهای جدولی باکیفیت و متنوع (به خاطر مالکیت خصوصی و حساسیت دادههای صنعتی) کمیابن، گوگل مدل رو کاملاً روی صدها میلیون دیتاست synthetic آموزش داده که با Structural Causal Models (SCM) تولید شدن.
نتایج: روی بنچمارک TabArena (۳۸ دیتاست classification و ۱۳ تا regression)، حتی در حالت zero-shot عملکردش با baseline های heavily-tuned مثل gradient-boosted trees قابل رقابته و با یه نسخه ensemble (ترکیب ۳۲ متغیر با NNLS solver و SVD features) نتایج بهتری هم میگیره.
دسترسی:
وزنها روی HuggingFace هم موجودن (نسخهی PyTorch و JAX/Flax)
به زودی از طریق BigQuery هم با یه دستور ساده
AI.PREDICT در SQL قابل استفاده میشه