محققان دانشگاه پرینستون معماری جدیدی تحت عنوان Recurrent Looped Transformer (RLT) معرفی کردهاند که با هدف بهینهسازی پردازش توالیها در مدلهای زبانی طراحی شده است.
این مدل با حذف بازنشانی (Reset) در مرزهای Prompt و پاسخ، وضعیت کلی را در تمام توکنها حفظ میکند. در این معماری، ۹۶ بلوک منطقی برای هر توکن در نظر گرفته شده که منجر به افزایش عمق محاسباتی بدون تغییر در حجم کار ثابت میشود.
مهمترین ویژگیهای این مدل عبارتند از:
- تداوم وضعیت: یک State واحد که در طول تمام مراحل پردازش بدون بازنشانی باقی میماند.
- ساختار هیبریدی: ترکیب انکودر علی (Causal) و دکودر بازگشتی برای ادغام ویژگیها.
- یکپارچگی در یادگیری: طراحی واحد برای مراحل پیشآموزش، تنظیم دقیق (SFT) و تقویت یادگیری (RL).
برای بررسی جزئیات فنی و دسترسی به پیادهسازی، میتوانید از منابع زیر استفاده کنید:
- مقاله علمی
- مخزن گیتهاب پروژه
- وبلاگ تخصصی محقق
معماری RLT: نوآوری در ترنسفورمرهای بازگشتی برای بهینهسازی مدلهای زبانی
📊 Data➕Science 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما
