الوحدة 9 — الممثّل والناقد وA2C وPPO
انتهت الوحدة الثامنة بفكرة الخطّ الأساسي لكنّها تركت السؤال معلّقًا: كيف نتعلّم نفسه بجانب السياسة؟ الإجابة هي بنية الممثّل-الناقد، والاسم يُلخّص الفكرة: شبكة تختار الأفعال (الممثّل)، وشبكة تُقيّمها (الناقد). ثمّ نبني على هذه الفكرة A2C ثمّ PPO، وهذا الأخير الأكثر استعمالًا في العمل الصناعي منذ 2017.
الميزة كإشارة تعلّم
قدّمنا سابقًا الميزة:
هذه الكمّية أنظف من : تخبرنا كم كان الفعل أفضل من متوسّط ما تعمله السياسة في . م صادقتها على الاتّجاه لا تتأثّر بمقياس المكافأة (تكبير كلّ المكافآت بـ100 لا يُغيّر ميزة الأفعال النسبيّة، بخلاف نفسه).
تقدير عمليّ للميزة عبر TD:
هذا خطأ TD الذي رأيناه في الوحدة 5، مطبَّقًا هنا بوصفه بديلًا عن الميزة.
A2C: ممثّل-ناقد متزامن
A2C (Advantage Actor-Critic) يجمع في خوارزميّة واحدة:
- شبكة الممثّل تُنتج توزيعًا احتماليًّا على الأفعال.
- شبكة الناقد تُنتج تقديرًا للقيمة.
في كلّ خطوة (أو دفعة من خطوات) نُحسّن خسارتين:
نُضيف عادةً بونصًا للـإنتروبيا () لتشجيع الاستكشاف ومنع السياسة من الانهيار إلى فعل واحد جشعًا:
في التنفيذ، الشبكتان تتقاسمان الجذع (عدة طبقات مشتركة) وينقسمان في نهاية إلى رأسين — رأس السيا سة ورأس القيمة. هذا يُقلّل الأوزان ويُشجّع تعلّم تمثيلات مشتركة.
المشكلة التي أوجدت PPO
يبقى في A2C خلل: تحديثات الممثّل بلا سقف. إن أعطى ناقد شابّ ميزة ضخمة على فعل، يُحرّك الممثّل توزيعه تحريكًا كبيرًا، فتتغيّر السياسة تغييرًا حادًّا؛ فتنهار العيّنات اللاحقة (لأنّها تخضع لسياسة جديدة تمامًا)، فيتذبذب التدريب أو ينفجر.
الحلّ الأصلي من TRPO كان قيدًا صارمًا على تباعد كوليبك-لايبلر بين السياسة القديمة والجديدة. لكنّه صعب التنفيذ.
PPO (Proximal Policy Optimization) من شولمان وآخرين 2017 اقترح صيغة أبسط تُنجز الأثر نفسه: قصّ نسبة الاحتماليّة.
هدف PPO المقصوص
نُعرّف نسبة الاحتماليّة:
الهدف الكلاسيكي هو (يعادل تدرّج السياسة بأخذ نسبة الأهمّية). PPO يقصّ:
مع في الغالب. القراءة الحدسيّة: كلّما ابتعدت السياسة الجديدة عن القديمة (نسبة خارج )، توقّف الهدف عن مكافأة الابتعاد. هذا يُبقي التحديث في «قرب» السياسة القديمة، ومن ثمّ اسم «proximal».
فرقُ PPO عن A2C يبدو صغيرًا (تعديل صيغة الخسارة)، لكنّه يجعل التدريب أكثر استقرارًا بمراتب، ويسمح باستخدام كلّ دفعة من العيّنات عدّة مرّات (num_epochs = 4 أو 10) بدل مرّة واحدة.
الهايبربارامترات التي فعلًا تهمّ
قائمة قصيرة تركّز على ما يؤثّر:
- معدّل التعلّم: عادةً مع Adam، حسّاسيّته أعلى من كثير من المسائل الأخرى.
num_steps(طول الدُفعة): 128 إلى 2048. طويل جدًّا يُبطئ التكرارات، قصير جدًّا يعطي ميزة مضطربة.num_epochs: 4 إلى 10 مرّات على نفس الدفعة. أكثر من 20 يُخاطر بتحوّل السياسة بعيدًا.clip_epsilon: نقطة بداية.gamma: للمعظم.gae_lambda(لتقدير GAE للميزة): .ent_coef(بونص الإنتروبيا): ، مهمّ في مسائل الاستكشاف الصعبة.