Amirkabir Artificial Intelligence Student Summit
رویداد دانشجویی هوش مصنوعی امیرکبیر
صفحه اینستاگرام رویداد:
https://www.instagram.com/aaiss.amirkabir
ارتباط با ما:
@aaiss_2026
Post #422
991
🤔 یادگیری تقویتی (Reinforcement Learning) چیست؟
💡 یادگیری تقویتی (Reinforcement Learning) روشی از یادگیری ماشین است که در آن مدل بهجای دریافت جواب درست، فقط بازخورد (Feedback) میگیرد.
1️⃣ این بازخورد معمولاً به شکل یک عدد است:
عدد مثبت → کار خوب 👍
عدد منفی → کار بد 😞
👍 مدل باید از روی همین عدد بفهمد دفعه بعد چه کاری بهتر است انجام دهد.
🧱اجزای اصلی در یادگیری تقویتی
در هر مسئلهٔ RL چهار مفهوم اصلی وجود دارد:
❄️ عامل (Agent): چیزی که تصمیم میگیرد
❄️ محیط (Environment): دنیایی که عامل در آن قرار دارد
❄️ عمل (Action): کاری که عامل میتواند انجام دهد
❄️ پاداش (Reward): عددی که نشان میدهد نتیجهٔ عمل خوب بوده یا بد
هیچ «جواب درست»ی وجود ندارد؛ فقط نتیجه وجود دارد.
😠 مدل چطور یاد میگیرد؟
مدل یک چرخه را بارها تکرار میکند:
1️⃣ یک عمل انجام میدهد
2️⃣ محیط واکنش نشان میدهد
3️⃣ پاداش یا جریمه دریافت میکند
4️⃣ تصمیمهای آیندهاش را کمی اصلاح میکند
📈 این اصلاحها کوچک هستند، اما با تکرار زیاد، رفتار مدل بهتر و بهتر میشود.
🤖مثال واقعی: آموزش یک ربات برای راه رفتن
در ابتدای آموزش:
🥶 ربات هیچ دانشی ندارد
🥶 حرکتها تصادفی هستند
🥶 اشتباه زیاد است
اما:
حرکتهایی که باعث جلو رفتن میشوند پاداش میگیرند 🍬
حرکتهایی که باعث افتادن میشوند جریمه میشوند 🙅♂️
✔️ بعد از هزاران تکرار، ربات بدون اینکه قانون خاصی به او داده شود، راه رفتن را یاد میگیرد.
🙊 چرا یادگیری تقویتی بسیار مؤثر است؟
یادگیری تقویتی در مسائلی میدرخشد که:
🥶 قانون مشخصی ندارند
🥶 تصمیمها زنجیرهای و وابسته به هم هستند
🥶 نتیجهٔ یک کار ممکن است با تأخیر مشخص شود
به همین دلیل RL توانسته:
♟ انسان را در بازیهایی مثل Go و شطرنج شکست دهد
🤖 رباتها را بدون برنامهنویسی مستقیم آموزش دهد
🧪 سیستمهایی بسازد که با تجربه بهتر میشوند، نه با دادهٔ از قبل آماده
✅ Telegram 📱 Instagram
🌐 Website
❄️❄️❄️❄️
💡 یادگیری تقویتی (Reinforcement Learning) روشی از یادگیری ماشین است که در آن مدل بهجای دریافت جواب درست، فقط بازخورد (Feedback) میگیرد.
1️⃣ این بازخورد معمولاً به شکل یک عدد است:
عدد مثبت → کار خوب 👍
عدد منفی → کار بد 😞
👍 مدل باید از روی همین عدد بفهمد دفعه بعد چه کاری بهتر است انجام دهد.
🧱اجزای اصلی در یادگیری تقویتی
در هر مسئلهٔ RL چهار مفهوم اصلی وجود دارد:
❄️ عامل (Agent): چیزی که تصمیم میگیرد
❄️ محیط (Environment): دنیایی که عامل در آن قرار دارد
❄️ عمل (Action): کاری که عامل میتواند انجام دهد
❄️ پاداش (Reward): عددی که نشان میدهد نتیجهٔ عمل خوب بوده یا بد
هیچ «جواب درست»ی وجود ندارد؛ فقط نتیجه وجود دارد.
😠 مدل چطور یاد میگیرد؟
مدل یک چرخه را بارها تکرار میکند:
1️⃣ یک عمل انجام میدهد
2️⃣ محیط واکنش نشان میدهد
3️⃣ پاداش یا جریمه دریافت میکند
4️⃣ تصمیمهای آیندهاش را کمی اصلاح میکند
📈 این اصلاحها کوچک هستند، اما با تکرار زیاد، رفتار مدل بهتر و بهتر میشود.
🤖مثال واقعی: آموزش یک ربات برای راه رفتن
در ابتدای آموزش:
🥶 ربات هیچ دانشی ندارد
🥶 حرکتها تصادفی هستند
🥶 اشتباه زیاد است
اما:
حرکتهایی که باعث جلو رفتن میشوند پاداش میگیرند 🍬
حرکتهایی که باعث افتادن میشوند جریمه میشوند 🙅♂️
✔️ بعد از هزاران تکرار، ربات بدون اینکه قانون خاصی به او داده شود، راه رفتن را یاد میگیرد.
🙊 چرا یادگیری تقویتی بسیار مؤثر است؟
یادگیری تقویتی در مسائلی میدرخشد که:
🥶 قانون مشخصی ندارند
🥶 تصمیمها زنجیرهای و وابسته به هم هستند
🥶 نتیجهٔ یک کار ممکن است با تأخیر مشخص شود
به همین دلیل RL توانسته:
♟ انسان را در بازیهایی مثل Go و شطرنج شکست دهد
🤖 رباتها را بدون برنامهنویسی مستقیم آموزش دهد
🧪 سیستمهایی بسازد که با تجربه بهتر میشوند، نه با دادهٔ از قبل آماده
✅ Telegram 📱 Instagram
🌐 Website
❄️❄️❄️❄️
- 🔥 10
- 👨💻 1







