TGViewer
NLP stuff NLP stuff @nlp_stuff · 3.86K subscribers
Post #175 1.33K
پاداش کافی است؟

هفته پیش مقاله‌ای تحت عنوان Reward Is Enough منتشر شد که با توجه به نویسنده‌های بزرگ آن نظیر دیوید سیلور و ریچارد ساتن انتظار می‌رفت که حرف نویی برای گفتن داشته باشد (پیشاپیش برای دانلودکردنش زور نزنید، دسترسی رایگان ندارد). اما بر خلاف انتظار این مقاله حرفی برای گفتن نداشت و صرفا سعی داشت که بگوید داشتن Reward در یک محیط مساوی است با به دست آوردن هوش عمومی (General Intelligence) و تمامی جنبه‌های متنوع آن اعم از یادگیری، دانش، فهم، حافظه و غیره. به این نحو که مثلا یک سنجاب برای این که خوراکی بیشتری را جمع کند نیاز دارد که ببیند و تفاوت فصل‌ها را درک کند؛ پس اگر بتواند سیاستی را یاد بگیرد که تعداد بلوط‌های جمع‌‌آوری شده‌اش بیشتر شود نهایتا دیدن و فهمیدن گردش فصل‌ها را هم یاد می‌گیرد. به همین نحو، مقاله در پی این است که نشان دهد هوش چیزی نیست جز افزایش پاداش.
یانیک کیلچر نیز در آخرین ویدئو خود به بررسی این مقاله (البته به وسیله بولدوزر) پرداخته است و دمار از روزگار آن درآورده. کیلچر در مخالفت کامل با ایده این مقاله معتقد است که صرف داشتن پاداش و حتی یادگیری برای هوشمند شدن کافی نیست و مثال می‌آورد که یک باکتری و حتی یک میمون بدون واردشدن به چرخه تکامل هرگز به هوشمندی انسان نمی‌رسند و بخشی از هوشمندی انسان مدیون قابلیت‌های پیش‌ساخته (prebuilt functionality) یا حداقل سوگیری‌های القایی (inductive bias) است که سیم‌کشی‌های مغز او حتی در نسخه نوزاد او نیز (شاید به لطف تکامل و انتخاب طبیعی) وجود دارند. در کل در این ویدئو بحث بیشتر فلسفی است و از آن جایی که خود مقاله حرفی برای گفتن ندارد بیشتر زمان ویدئو نیز صرف حمله به آن شده است.

در ادامه کیلچر عصبی در ۲۴ ساعت گذشته (احتمالا تحت تاثیر این وقایع) در توییت‌های خود به هایپ‌کنندگان هوش مصنوعی حمله کرده و گفته که نیمچه دستاوردهای اسمی فعلی هوش چیزی جز آمار و احتمال دانستن نیست.

https://www.youtube.com/watch?v=dmH1ZpcROMk

#watch
#paper

@nlp_stuff
YouTube Reward Is Enough (Machine Learning Research Paper Explained) #reinforcementlearning #deepmind #agi What's the most promising path to creating Artificial General Intelligence (AGI)? This paper makes the bold claim that a learning agent maximizing its reward in a sufficiently complex environment will necessarily develop…
More from @nlp_stuff
  1. Jan 6, 2026اندر حکایات بازی با کلمات: AI Engineering vs ML Engineering/Data Scientist این روزها عناوی…
  2. Mar 3, 2025مفهوم Agent چیست و چگونه کار می‌کنند؟ خانم چیپ هوین بلاگ پست مفصلی راجع به Agent (به قول ر…
  3. Feb 28, 2025خلاصه‌تر فکر کن از اونجایی که در مسائل استدلالی (reasoning) ، مدل برای رسیدن به جواب نهایی…
  4. Feb 23, 2025چه قدر تا بی‌کارشدن بک‌اندی‌ها فاصله داریم؟ عمده استفاده برنامه‌نویس‌ها از LLM‌ها در سطح پ…
  5. Feb 20, 2025به سوی سیستم‌۲ پیشرفت‌های هوش مصنوعی در دهه ۲۰۱۰، مدیون آموزش مدل‌های بزرگ دیپ لرنینگی روی…
  6. Feb 8, 2025مدل‌های استدلالی (reasoning) چیست و چگونه ساخته می‌شوند؟ حتما این روزها بارها مدل‌های استد…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →