الوحدة 5 — الفرق الزمنى وتعلّم Q
خطر لريتشارد ساتون في السبعينيّات سؤال بسيط: لماذا انتظار نهاية الحلقة كما في مونت كارلو ما دام بلمان يقول إنّ قيمة الحاضر تعتمد فقط على المكافأة القادمة وقيمة الحالة القادمة؟ الإجابة هي الفرق الزمنى (Temporal Difference)، ومنه سيولد تعلّم Q — الخوارزميّة الأشهر في تاريخ التعلّم المعزّز.
تحديث الفرق الزمنى
فكرة TD: نُحدّث القيمة بعد خطوة واحدة، مستعملين قيمة الحالة القادمة الحاليّة (البوتسترابنغ) بدلًا من العائد الحقيقي:
يُسمّى الحدّ خطأ TD. هو الفرق بين ما رأينا فعلًا (مكافأة + قيمة الحالة الجديدة) وما توقّعناه (القيمة الحاليّة). كلّ تحديث يُقلّص هذا الفرق.
هذا يحقّق أفضل ما في العالمين:
- بلا نموذج، كمونت كا رلو: لا حاجة إلى معرفة .
- ببوتسترابنغ، كالبرمجة الديناميكية: لا حاجة إلى انتظار نهاية الحلقة.
- تباين أقلّ من مونت كارلو: التحديث لا يعتمد إلّا على خطوة واحدة، لا على كلّ الحلقة.
في المقابل، TD متحيّز لأنّ الذي نستعمله ليس القيمة الحقيقيّة بل تقديرنا الحالي. هذه المفاضلة تحيّز/تباين هي المحور المركزي للاختيار بين الطرائق.
SARSA: على السياسة
نُطبّق نفس الفكرة على . لكن هنا يظهر خياران يبدوان متشابهين:
SARSA (اختصار state-action-reward-state-action) يستعمل الفعل الذي اختاره الوكيل فعلًا:
SARSA على السياسة (on-policy): يُقيّم ويُحسّن السياسة نفسها التي يتّبعها. إذا كانت السياسة إبسيلون-جشعة، فإنّ SARSA يحسب لهذه السياسة الاستكشافيّة، لا للسياسة المُثلى.
تعلّم Q: خارج السياسة
تعلّم Q يستعمل بدلًا من ذلك :
تعلّم Q خارج السياسة (off-policy): يُقيّم السياسة الجشعة (المُثلى بالتقدير الحالي) بينما ينفّذ سياسة استكشافيّة مختلفة. هذا فارق نظري وعملي في آن.
تعلّم Q هو خوارزمية تبويبيّة تتقارب إلى بشرط زيارة كافية لكلّ زوج (حالة، فعل)، وهو ما يوفّره الاستكشاف الذي تدرسه الوحدة 6.