مطالب خوب و بهدردبخور در حوزهی هوش مصنوعی و پردازش زبان طبیعی!
شکرشکن شوند همه طوطیان هند
زین قند پارسی که به بنگاله میرود
اگر انتقاد، پیشنهاد و یا مطلب مفیدی (لینک، پست و ...) داشتید:
@AliAkbarBadri
@mmsamiei
@MmahdiAghajani
Post #219
1.88K
مقاله former-∞
یکی از گرفتاریهای ترنسفورمرها نحوه برخورد اونها با دنبالههای طولانیه، این قضیه مخصوصا در ترنسفورمرهای کلاسیک که محاسبه، از مرتبه درجه دو نسبت به طول دنباله رشد میکنه، نمود بیشتری داره. نسخههای مختلفی از ترنسفورمرها در مقالات مختلف پیشنهاد شدند تا این درد رو تخفیف بدند ولی چیزی که در همه این ترنسفورمرها مشترکه، ظرفیت محدود توجه است؛ یعنی همیشه به یک طول محدودی از دنبالهها میتونیم توجه کنیم. مقاله مدل former-∞ که در این پست بررسی میکنیم در پی دادن پاسخی به این پرسشه که آیا میتونیم ترنسفورمری داشته باشیم که به دنبالهای با طول بی نهایت توجه کنیم؟ (برای درک قضیه، معماری lstm رو در نظر بگیرید که میتونه دنبالهای با طول بی نهایت رو پردازش کنه)
ایده پیشنهادی این مقاله استفاده از پیوستهسازی ورودیها و همچنین انجام توجه پیوستهست. در ساختار خودش هم، این معماری یک حافظه کوتاه مدت گسسته و یک حافظه بلند مدت پیوسته داره. حافظه کوتاه مدت که شبیه به همان ساختار اصلی ترنسفورمرهاست و حاوی تعدادی توکنه. اما در مورد حافظه بلندمدت، این حافظه قراره که بیانگر کل تاریخچه توکنهای دیدهشده توسط مدل به صورت پیوسته باشه. قطعا سوال الان توی ذهنتون اینه که چگونه پیوستهست؟ به صورت مختصر و مفید، فرض کنید که یک دنباله داریم که متشکل از ۱۰۰۰ تا توکن با سایز امبدینگ ۱۲۸ است. حالا مدل به جای این که سعی کنه برای هر بعد امبدینگ ۱۰۰۰ توکن رو ذخیره کنه، میاد و یک مدل رگرشن (مثلا درجه سه) روی این هزار تا نمونه اموزش میده و پارامترهای اون مدل رو که به مراتب کمتر از ۱۰۰۰ هستند ذخیره میکنه. به اصطلاح و دید فنی، یک سیگنال پیوسته رو از روی نمونههای گسستهای که داره میسازه. وقتی هم که بخواد در هر گام زمانی به این حافظه بلندمدتش توکنهای دیگه ای رو اضافه کنه اول، از مدل پیوسته حافظه بلندمدتش نمونهبرداری میکنه و توکنهای مورد نظر رو به این نمونههای برداشته شده الحاق میکنه و یک مدل رگرشن دیگهای آموزش میده.
حالا نوبت قلب ترنسفومر یا انجام توجه است. هر یک از توکنهای دنباله ورودی که اسمش رو X میگذاریم روی دو حافظه کوتاه مدت گسسته و حافظه بلندمدت پیوسته عملیات توجه رو انجام میدهند و حاصل این دو توجه با هم جمع میشوند. عملیات توجه روی حافظه گسسته که شبیه همون ترنسفورمر عادیه اما داستان برای توجه روی حافظه پیوسته فرق میکنه. داستان به این صورته که مدل از روی پارامترهای مدل رگرشنی که برای پیوستهسازی استفاده کرده بود بردارهای کلید (K) و مقدار (V) رو میسازه. حالا از روی این بردارها و بردارهای کوئری (Q) که برای توکنهای ورودی دنباله X داشتیم دو پارامتر میانگین و واریانس برای یک توزیع گاوسی رو پیدا میکنه. حالا این توزیع گاوسی قراره که به مثابه پنجره روی حافظه پیوسته عمل کنه و حاصل توجه از اعمال یک جور کانولوشن با این پنجره گاوسی رو حافظه پیوسته به دست میاد. در نهایت هم که حاصل دو توجه گسسته و پیوسته با هم جمع میشوند.
برای آزمایش هم این مدل را روی وظایفی که نیاز به هندل کردن دنباله با طول زیاد بوده آموزشش دادن و نتایجش رو با مدل Transformer-XL مقایسه کردهاند و نشون دادهاند که از اون بهتر عمل کرده. مثلا یک نمونه وظیفه این بوده که دنبالهای تصادفی شامل تعدادی عدد تولید کردهاند و از مدل خواسته اند که در خروجی اعداد رو به ترتیب نزولی فرکانسشون در دنباله ورودی، خروجی بدهد.
در صورتی که کنجکاوتر شدید میتونید ویدئو یانیک کیلچر شیرینزبان رو در توضیح این مقاله مشاهده کنید:
https://www.youtube.com/watch?v=0JlB9gufTw8
لینک مقاله:
https://arxiv.org/abs/2109.00301
پ.ن. با معرفی کردن کانال به بقیه، حمایتش کنید.
#paper
#read
@nlp_stuff
Telegram stuff یکی از گرفتاریهای ترنسفورمرها نحوه برخورد اونها با دنبالههای طولانیه، این قضیه مخصوصا در ترنسفورمرهای کلاسیک که محاسبه، از مرتبه درجه دو نسبت به طول دنباله رشد میکنه، نمود بیشتری داره. نسخههای مختلفی از ترنسفورمرها در مقالات مختلف پیشنهاد شدند تا این درد رو تخفیف بدند ولی چیزی که در همه این ترنسفورمرها مشترکه، ظرفیت محدود توجه است؛ یعنی همیشه به یک طول محدودی از دنبالهها میتونیم توجه کنیم. مقاله مدل former-∞ که در این پست بررسی میکنیم در پی دادن پاسخی به این پرسشه که آیا میتونیم ترنسفورمری داشته باشیم که به دنبالهای با طول بی نهایت توجه کنیم؟ (برای درک قضیه، معماری lstm رو در نظر بگیرید که میتونه دنبالهای با طول بی نهایت رو پردازش کنه)
ایده پیشنهادی این مقاله استفاده از پیوستهسازی ورودیها و همچنین انجام توجه پیوستهست. در ساختار خودش هم، این معماری یک حافظه کوتاه مدت گسسته و یک حافظه بلند مدت پیوسته داره. حافظه کوتاه مدت که شبیه به همان ساختار اصلی ترنسفورمرهاست و حاوی تعدادی توکنه. اما در مورد حافظه بلندمدت، این حافظه قراره که بیانگر کل تاریخچه توکنهای دیدهشده توسط مدل به صورت پیوسته باشه. قطعا سوال الان توی ذهنتون اینه که چگونه پیوستهست؟ به صورت مختصر و مفید، فرض کنید که یک دنباله داریم که متشکل از ۱۰۰۰ تا توکن با سایز امبدینگ ۱۲۸ است. حالا مدل به جای این که سعی کنه برای هر بعد امبدینگ ۱۰۰۰ توکن رو ذخیره کنه، میاد و یک مدل رگرشن (مثلا درجه سه) روی این هزار تا نمونه اموزش میده و پارامترهای اون مدل رو که به مراتب کمتر از ۱۰۰۰ هستند ذخیره میکنه. به اصطلاح و دید فنی، یک سیگنال پیوسته رو از روی نمونههای گسستهای که داره میسازه. وقتی هم که بخواد در هر گام زمانی به این حافظه بلندمدتش توکنهای دیگه ای رو اضافه کنه اول، از مدل پیوسته حافظه بلندمدتش نمونهبرداری میکنه و توکنهای مورد نظر رو به این نمونههای برداشته شده الحاق میکنه و یک مدل رگرشن دیگهای آموزش میده.
حالا نوبت قلب ترنسفومر یا انجام توجه است. هر یک از توکنهای دنباله ورودی که اسمش رو X میگذاریم روی دو حافظه کوتاه مدت گسسته و حافظه بلندمدت پیوسته عملیات توجه رو انجام میدهند و حاصل این دو توجه با هم جمع میشوند. عملیات توجه روی حافظه گسسته که شبیه همون ترنسفورمر عادیه اما داستان برای توجه روی حافظه پیوسته فرق میکنه. داستان به این صورته که مدل از روی پارامترهای مدل رگرشنی که برای پیوستهسازی استفاده کرده بود بردارهای کلید (K) و مقدار (V) رو میسازه. حالا از روی این بردارها و بردارهای کوئری (Q) که برای توکنهای ورودی دنباله X داشتیم دو پارامتر میانگین و واریانس برای یک توزیع گاوسی رو پیدا میکنه. حالا این توزیع گاوسی قراره که به مثابه پنجره روی حافظه پیوسته عمل کنه و حاصل توجه از اعمال یک جور کانولوشن با این پنجره گاوسی رو حافظه پیوسته به دست میاد. در نهایت هم که حاصل دو توجه گسسته و پیوسته با هم جمع میشوند.
برای آزمایش هم این مدل را روی وظایفی که نیاز به هندل کردن دنباله با طول زیاد بوده آموزشش دادن و نتایجش رو با مدل Transformer-XL مقایسه کردهاند و نشون دادهاند که از اون بهتر عمل کرده. مثلا یک نمونه وظیفه این بوده که دنبالهای تصادفی شامل تعدادی عدد تولید کردهاند و از مدل خواسته اند که در خروجی اعداد رو به ترتیب نزولی فرکانسشون در دنباله ورودی، خروجی بدهد.
در صورتی که کنجکاوتر شدید میتونید ویدئو یانیک کیلچر شیرینزبان رو در توضیح این مقاله مشاهده کنید:
https://www.youtube.com/watch?v=0JlB9gufTw8
لینک مقاله:
https://arxiv.org/abs/2109.00301
پ.ن. با معرفی کردن کانال به بقیه، حمایتش کنید.
#paper
#read
@nlp_stuff


