مقاله جدید A Mathematical Explanation of Transformers چارچوب ریاضی دقیقی برای تحلیل معماری ترنسفورمر و مدلهای زبانی بزرگ ارائه میدهد. در این پژوهش، ترنسفورمر به عنوان گسستهسازی یک معادله دیفرانسیل-انتگرال پیوسته مدلسازی شده است.
مهمترین محورهای ریاضی این مقاله عبارتند از:
• تحلیل مکانیزم Self-attention به عنوان یک اپراتور انتگرالی غیرمحلی
• تعریف Layer normalization به عنوان تصویرسازی بر یک مجموعه محدود
• یکپارچهسازی لایههای تماممتصل و توابع فعالساز در ساختار ریاضی واحد
نویسندگان در نهایت با استفاده از روشهای گسستهسازی عددی، این مدل ریاضی را به Vision Transformers و ترنسفورمرهای کانولوشنی تعمیم دادهاند.
تبیین ریاضی ترنسفورمرها؛ فرمولاسیون معماری یادگیری عمیق با معادلات دیفرانسیل
📊 Data➕Science 🇮🇷 - هوش مصنوعی و علم داده به فارسی
📩 ارتباط با ما
