الوحدة 3 — دوالّ القيمة ومعادلات بلمان
يوفّر MDP الصياغة؛ يوفّر بلمان الآلية. جميع الخوارزميّات الجدوليّة اللاحقة (البرمجة الديناميكية، ومونت كارلو، وتعلّم Q) هي تقديرات لحلّ معادلات بلمان. يستحقّ الأمر ساعة لفهمها جيّدًا.
دالّتان مختلفتان لكن مرتبطتان
نُعرّف كمّيتين أساسيّتين وفق سياسة π:
- دالّة قيمة الحالة Vπ(s): العائد المتوقّع بدءًا من s باتّباع π إلى الأبد.
Vπ(s)=Eπ[Gt∣st=s]
- دالّة قيمة الحالة–الفعل Qπ(s,a): العائد المتوقّع بدءًا من s، مع فعل a في هذه الخطوة، ثمّ باتّباع π فيما بعد.
Qπ(s,a)=Eπ[Gt∣st=s,at=a]
العلاقة بين الاثنتين مباشرة: Vπ(s)=∑aπ(a∣s)Qπ(s,a). القيمة تلخّص الحالة تحت سياسة معطاة؛ والقيمة–الفعل تحتفظ بالفعل مفصّلًا، وهي التي تسمح باتّخاذ قرارات دون معرفة النموذج (لماذا؟ لأنّ اختيار argmaxaQ(s,a) لا يحتاج إلى P).
معادلة بلمان للتوقّع
الفكرة الأساسيّة: القيمة الآن هي مكافأة قادمة + قيمة الحالة القادمة، مع التخفيض. رياضيًا:
Vπ(s)=a∑π(a∣s)s′,r∑P(s′,r∣s,a)[r+γVπ(s′)]
هذه المعادلة تعرض Vπ بدلالة نفسها. البوتسترابنغ يعني بالضبط هذا: نُقدّر قيمة الحالة الحاضرة اعتمادًا على تقدير قيم الحالات المستقبليّة، لا عبر الرجوع إلى كامل التسلسل.
نظيرها لـQ:
Qπ(s,a)=s′,r∑P(s′,r∣s,a)[r+γa′∑π(a′∣s′)Qπ(s′,a′)]
معادلة بلمان للأمثليّة
عندما تكون السياسة مثلى π∗، تتّخذ في كلّ حالة الفعل الأفضل. يقود ذلك إلى معادلات مشابهة لكن مع max:
V∗(s)=amaxs′,r∑P(s′,r∣s,a)[r+γV∗(s′)]
Q∗(s,a)=s′,r∑P(s′,r∣s,a)[r+γa′maxQ∗(s′,a′)]
ما دام γ<1 توجد حلول وحيدة لهذه المعادلات، ويمكن حسابها تكراريًّا (تعرف الخوارزميّة باسم تكرار القيمة، وستبنيها الوحدة 4).
حساب يدوي كامل على شبكة 3×3
نتخيّل عالمًا بسيطًا: شبكة 3×3، الوكيل يبدأ في الخانة اليسرى العليا، وهدفه الخانة اليمنى السفلى (مكافأة +1)، والأفعال هي أربعة اتّجاهات حتميّة (لا انزلاق)، وكلّ خطوة تُكلّف −0,04، وγ=1 للتبسيط. سياسة π هنا: «يمين ثمّ أسفل».
نتّبع المسار: (0,0)→(0,1)→(0,2)→(1,2)→(2,2). أربع خطوات، مكافآتها −0,04,−0,04,−0,04,+1. لذا: