مقاله بررسی میکند آیا مدل میتواند از ابتدا، با دادههایی که خودش تولید میکند، الگوهای قابلانتقال به دادههای واقعی یاد بگیرد.
روش: دو مدل با وزنهای تصادفی همزمان آموزش میبینند:
مولد: برنامههایی مینویسد که اجرا میشوند و دنبالههای بایت تولید میکنند.
یادگیرنده: پیشبینی بایت بعدی این دنبالهها را یاد میگیرد.
مولد با آموزش تقویتی، بابت تولید ساختارهای قابلیادگیری در مرز توانایی یادگیرنده پاداش میگیرد؛ صرفاً سختکردن داده با نویز کافی نیست.
با افزایش محاسبات، خطای پیشبینی روی متن، تصویر، گفتار، موسیقی و کدِ دیدهنشده کاهش یافت. مدل قابلیت یادگیری از مثالهای داخل زمینه را نشان داد و مولد، ساختارهایی مانند دنباله فیبوناچی کشف کرد. خودبازی از نمونهگیری تصادفی برنامهها بهتر بود؛ اما روش مبتنی بر دستور زبان مصنوعی در متن و کد قویتر عمل کرد.
🔊
Self-Play Pretraining with Zero Data #مقاله
➡️
@AI_DeepMind✔️
@AI_Person