Post #3993
4.02K
"در دنیای #هوش_مصنوعی، #دیوید_سیلور برای من نمادی از تواضع و موفقیت است. چه در زمان حضور در #دیپ_مایند، پیش از پیوستن به #گوگل، و چه پس از آن، او همواره دانشمند و مدیری فعال و تأثیرگذار بوده است. به راستی که میتوان او را مصداق ضربالمثل 'درخت هر چه پربارتر، افتادهتر' دانست. دورهی آموزشی او در زمینه #یادگیری_تقویتی، منبعی ارزشمند و الهامبخش است.
اخیراً در پادکستی با حضور ایشان، نکات بسیار مهمی درباره کمبودهای الگوریتمهای فعلی مطرح شده که برای علاقهمندان به این حوزه بسیار روشنگر است. در این پادکست، سیلور بر اهمیت #یادگیری_تقویتی با استفاده از بازخورد انسانی در توسعه مدلهای زبان بزرگ تأکید میکند. اما نکتهی قابل توجه اینجاست که او هشدار میدهد ارائهی بازخورد انسانی در هر مرحله ممکن است مانع از کشف ایدههای نو توسط سیستمها شود. در واقع با توضیح اینکه چطور استفاده از RL در بازی AlphaGo توانایی فراتراز انسان را نشان میدهد، باید راه کاری برای بهتر شدن و فراتر رقتن از RLHF در مدلهای LLM را در پیش گرفت.
این پادکست تو یوتیوب منتشر سده و فکر میکنم خیلی برای علاقه مندان RL جذاب باشه
https://www.youtube.com/watch?v=zzXyPGEtseI
https://www.linkedin.com/in/ali-hadi-a9432551
- 👍 20
- ❤ 4