TGViewer
NLP stuff NLP stuff @nlp_stuff · 3.86K subscribers
Post #214 1.99K
به شبکه فرصت تامل بدهیم!

یکی از تفاوت‌های اساسی انسان با مدل‌های یادگیری ماشین این است که میزان زمان پاسخدهی انسان برای پاسخ به یک مساله می‌تواند تابعی از سختی آن مساله باشد حال آن که در مدل‌های یادگیری ماشین میزان زمان پاسخدهی تنها وابسته به معماری مدل و یا اندازه ورودی است (برای مثال هر چه قدر رشته ورودی به یک شبکه بازگشتی طولانی‌تر باشد بیشتر طول می‌کشد تا شبکه پاسخ نهایی را تولید کند). به بیان بهتر، ذهن انسان می‌تواند برای حل یک مساله با ورودی دشوارتر بیشتر تمرکز و توجه برای حل آن بگذارد، چیزی که یادگیری ماشین قادر به آن نیست. حال محققینی از deepmind با الگوگیری از این ایده، با ارائه مدلی به نام PonderNet سعی در عملیاتی کردن آن کرده‌اند. این مدل در درون خود یک شبکه به نام تابع گام را پیاده‌سازی کرده است که با گرفتن x (یعنی ورودی مساله) و h_n (یعنی حالت نهان تابع گام در گام قبل) سه خروجی y_n (حدس مدل از خروجی در گام n)، h_n+1 (حالت نهان بعدی تابع گام) و البته λ_n (که احتمال توقف مدل در گام n) را تولید میکند. به بیان شهودی‌تر، شبکه در هر گام زمانیش یک خروجی و احتمال به خاتمه رسیدن کار در این گام را محاسبه می‌کند. این مدل برای فاز اموزش خود نکاتی در مورد تابع هدف و طرز بهینه‌سازی آن دارد که در صورت جلب توجهتان می‌توانید مقاله‌ را بخوانید اما برای فاز تست، جواب نهایی این گونه تولید می‌شود که در هر گام با توجه به احتمال خاتمه کار، یک عدد از توزیع برنولی با پارامتر احتمال خاتمه نمونه‌برداری می‌شود و در مورد ادامه یا خاتمه کار مدل با آن تصمیم‌گیری می‌شود.

نویسندگان مقاله با آزمایش مدل روی چند وظیفه از جمله parity و پرسش و پاسخ روی bAbi ادعا کرده‌اند که این مدل نسبت به داده‌های خارج از توزیع خود در زمان اموزش مقاوم‌تر و بهتر عمل می‌کنند. در پرانتز، تسک parity به این صورت است که یک بردار با سایز ۶۴ داریم که تعداد رندومی از عناصر آن یک و منفی یک هستند و باقی عناصر صفر هستند. حال با توجه به این ورودی مدل بایستی تشخیص دهد که آیا تعداد یک ها زوج هستند یا فرد. نکته اینجاست که با توجه به در هم آمیخته بودن صفر و یک و منفی یک‌ها، مدل برای تشخیص زوج یا فرد بودن تعداد یک‌ها، نمی‌تواند از جمع عناصر استفاده کند و واقعا مجبور است بشمارد. خالقان PonderNet همچنین پیشنهاد داده‌اند که از این مدل، با توجه به این که نسبت به پیچیدگی مساله تنظیم می‌شود، می‌توان در وسایلی مانند موبایل‌ها که از منابع پردازشی کمتری برخوردار هستند استفاده کرد. در واقع به جای این که بار پیچیدگی مساله بر معماری مدل و سخت افزار آن بیافتد در طول زمان تقسیم خواهد شد.

لینک مقاله:
https://arxiv.org/abs/2107.05407

#read
#paper

@nlp_stuff
More from @nlp_stuff
  1. Jan 6, 2026اندر حکایات بازی با کلمات: AI Engineering vs ML Engineering/Data Scientist این روزها عناوی…
  2. Mar 3, 2025مفهوم Agent چیست و چگونه کار می‌کنند؟ خانم چیپ هوین بلاگ پست مفصلی راجع به Agent (به قول ر…
  3. Feb 28, 2025خلاصه‌تر فکر کن از اونجایی که در مسائل استدلالی (reasoning) ، مدل برای رسیدن به جواب نهایی…
  4. Feb 23, 2025چه قدر تا بی‌کارشدن بک‌اندی‌ها فاصله داریم؟ عمده استفاده برنامه‌نویس‌ها از LLM‌ها در سطح پ…
  5. Feb 20, 2025به سوی سیستم‌۲ پیشرفت‌های هوش مصنوعی در دهه ۲۰۱۰، مدیون آموزش مدل‌های بزرگ دیپ لرنینگی روی…
  6. Feb 8, 2025مدل‌های استدلالی (reasoning) چیست و چگونه ساخته می‌شوند؟ حتما این روزها بارها مدل‌های استد…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →