📄️ التعلّم المعزّز
دورة التعلّم المعزّز المميّزة: من عمليّات القرار الماركوفية وتعلّم Q، إلى شبكات Q العميقة وتدرّج السياسة وPPO على Gymnasium.
📄️ 1. الوكيل والبيئة والمكافأة
الوحدة 1 من دورة التعلّم المعزّز: حلقة التفاعل بين الوكيل والبيئة، والحلقة والعائد المخفوض، وما يميّز التعلّم المعزّز عن الإشراف، وفخاخ تصميم المكافأة.
📄️ 2. عمليّات القرار الماركوفية
الوحدة 2 من دورة التعلّم المعزّز: الحالات والأفعال والانتقالات والسياسة، وفرضيّة ماركوف والحالات التي تُنتهك فيها، وصياغة FrozenLake بلغة MDP.
📄️ 3. دوالّ القيمة وبلمان
الوحدة 3 من دورة التعلّم المعزّز: دالّتا القيمة V و Q، ومعادلات بلمان للتوقّع والأمثليّة، مع حساب يدوي كامل على شبكة 3×3.
📄️ 4. البرمجة الديناميكية ومونت كارلو
الوحدة 4 من دورة التعلّم المعزّز: تكرار القيمة وتكرار السياسة عندما نعرف النموذج، ومونت كارلو عندما لا نعرفه، وتباين العائدات.
📄️ 5. الفرق الزمنى وتعلّم Q
الوحدة 5 من دورة التعلّم المعزّز: تحديث TD، مقارنة SARSA بتعلّم Q، على السياسة مقابل خارج السياسة، تعلّم Q التبويبي على FrozenLake، ومعدّل التعلّم والتخفيض.