انتقل إلى المحتوى الرئيسي

التعلّم المعزّز

الوكلاء والمكافآت والسياسات المثلى، من الجداول التبويبية إلى الشبكات العميقة.

مدّة الدورة: 8 ساعات

تفرّق هذه الدورة بين ما يحلّه التعلّم المعزّز بالفعل وما لا يحلّه، ثمّ تبني وكيلًا لبيئة Gymnasium من الصفر. الخيط الأحمر ثلاث بيئات متدرّجة الصعوبة: FrozenLake لخوارزميات الجداول من الوحدة 2 إلى الوحدة 6، ثمّ CartPole حيث ندخل الشبكات في الوحدتين 7 و8، وأخيرًا LunarLander مع PPO ومقارنة تنفيذنا اليدوي بمكتبة Stable-Baselines3 في الوحدة 9، ثمّ المشروع في الوحدة 10.

ما ستتعلّمه

  • صياغة مسألة بوصفها عمليّة قرار ماركوفية، ومعرفة متى تُنتهك فرضيّة ماركوف
  • حساب دوالّ القيمة يدويًا ثمّ عبر معادلات بلمان وطرائق مونت كارلو
  • تنفيذ تعلّم Q تبويبيًا على FrozenLake ومعرفة حدوده
  • تدريب DQN مع تخزين الرجعة والشبكة الهدف على CartPole
  • تدريب REINFORCE ثمّ A2C ثمّ PPO بأيديكم، ومقارنة نتيجتكم بـStable-Baselines3
  • قراءة منحنيات المكافأة عبر بذور متعدّدة وتقدير التباين الحقيقي

المتطلّبات المسبقة

  • الرياضيات للذكاء الاصطناعي (الدورة 03): الاحتمالات والتوقّع الشرطي
  • أساسيّات التعلّم العميق (الدورة 07): الانتشار العكسي وAdam
  • PyTorch (الدورة 09): طبقات nn وحلقة تدريب

وحدات الدورة

  1. الوكيل والبيئة والمكافأة: الإطار
  2. عمليّات القرار الماركوفية
  3. دوالّ القيمة ومعادلات بلمان
  4. البرمجة الديناميكية وطرائق مونت كارلو
  5. الفرق الزمني وتعلّم Q
  6. الاستكشاف: إبسيلون الجشع والبدائل
  7. شبكات Q العميقة وإعادة تشغيل التجربة
  8. طرائق تدرّج السياسة
  9. الممثّل والناقد وA2C وPPO
  10. مشروع: وكيل مدرَّب على بيئة Gymnasium

المكتبات المستخدمة

Gymnasium وPyTorch حاضران في كلّ وحدة. تظهر Stable-Baselines3 في الوحدة 9 لمقارنة تنفيذنا اليدوي بمرجع صناعي مُختبَر، فنرى بأعيننا ما الذي يجلبه الضبط الدقيق للـهايبربارامترات وما الذي لا يجلبه.

التقييم والشهادة

يُختَم المسار باختبار من 40 سؤالًا يغطّي الوحدات العشر: تصميم المكافأة، وانتهاك ماركوف، وحساب بلمان، والفرق بين SARSA وتعلّم Q، وأثر إبسيلون الثابت، ودور الشبكة الهدف، وتباين REINFORCE، وقصاصة PPO، والتباين بين البذور. عند النجاح تُمنح شهادة إتمام قابلة للتحقّق برقمها على المنصّة.