انتقل إلى المحتوى الرئيسي

المراجعة والاختبار النهائي

عشر وحدات نقلت الوكيل من حلقة تفاعل بسيطة إلى تنفيذ PPO كامل على LunarLander. هذه الصفحة تُلخّص الرحلة، ثمّ تُحدّد ما سيقيسه الاختبار وكيف تستعدّون له.

الدورة في جدول

الوحدةما يجب أن يبقى
1. الإطارالحلقة: حالة → فعل → مكافأة؛ العائد المخفوض GtG_t لا مكافأة الخطوة القادمة؛ فخاخ تصميم المكافأة (الاختصار، التناثر، الوحدات)
2. MDPخماسيّة (S,A,P,R,γ)(S, A, P, R, \gamma)؛ فرضيّة ماركوف تُختصر في «الحاضر يكفي»؛ POMDP إذا انتهكت
3. بلمانVV للحالة، QQ للحالة-الفعل؛ بلمان للتوقّع (بوت‌سترابنغ) وللأمثليّة (max\maxQQ تُفضَّل عمليًّا لأنّ اختيار الفعل منها لا يحتاج PP
4. DP وMCتكرار القيمة/السياسة إذا PP معلوم؛ مونت كارلو بلا نموذج لكن بتباين مرتفع ومسائل حلقيّة فقط
5. TD وQ-learningتحديث بخطوة واحدة؛ SARSA على السياسة، تعلّم Q خارج السياسة؛ لا تنسوا إلغاء البوت‌سترابنغ عند terminated
6. الاستكشافإبسيلون-جشعة بسيطة لكن يجب تناقصها؛ سوفت‌ماكس وUCB بدائل مفيدة
7. DQNتخزين الرجعة (كسر الترابط)، الشبكة الهدف (تثبيت الأهداف)، Double DQN (تحيّز max\max)، Huber loss وقصّ التدرّج
8. تدرّج السياسةREINFORCE يرفع احتمال الأفعال ذات العائد المرتفع؛ التباين ضخم؛ الخطّ الأساسي يحلّه؛ الأفعال المستمرّة حصريّة تقريبًا
9. ممثّل-ناقد وPPOالميزة A=QVA = Q - V؛ A2C يمزج، PPO يقصّ نسبة الاحتماليّة لاستقرار التحديث؛ تفاصيل التنفيذ = 30% من الأداء
10. المشروعGAE، متوسّط 5 بذور، فيديو، وحدود النقل إلى الواقع (Sim-to-real، الأمان، كفاءة العيّنة)

الخيوط التي تعبر الدورة

كلّ الخوارزميّات تحلّ بلمان. البرمجة الديناميكية تحلّها بالحساب المباشر، ومونت كارلو بمتوسّط تجريبي، وتعلّم Q ببوت‌سترابنغ بخطوة واحدة، وDQN بتقريب QQ بشبكة عصبيّة، وممثّل-ناقد بتعلّم VV إلى جانب السياسة. ستطلبكم بعض أسئلة الاختبار إعادة اشتقاق أيّ منها من بلمان مباشرة.

اختيار الفعل والتحديث ليسا الشيء نفسه. الاختلاف بين SARSA وتعلّم Q، وبين على السياسة وخارج السياسة، هو بالضبط: أيّ فعل نضعه في التحديث؟ الفعل المُنفَّذ (على السياسة) أم أفضل فعل ممكن (خارج السياسة). خطأ هنا يخلط الخوارزميّات ويجعل نتائجهما تبدو متطابقة على البيئات السهلة، ويكشف الفارق في البيئات الخطرة.

التقييم يسبق المعمارية. أمام وكيل لا يتعلّم، الإغراء هو تكبير الشبكة أو تجربة خوارزميّة جديدة. الإجابة الصحيحة عادةً: راقبوا 20 حلقة عشوائيّة (هل المكافأة متناثرة؟)، اطبعوا QQ أو منحنى الخسارة (هل ينفجر؟)، جرّبوا تناقص إبسيلون أكثر بطئًا. تشخيص المشكلة قبل الحلّ يوفّر أيّامًا.

البذور والفيديو ليسا إضافيّتين. أرقام دون تباين بذور بيانات بلا مصداقيّة. منحنى نجاح دون فيديو يخفي غالبًا فشلًا نادرًا لكن حادًّا. هذه ليست ممارسات «للنشر الأكاديمي فقط»، بل ما يفصل النموذج المُختبَر من نموذج لم يُختبَر.

ماذا يقيس الاختبار

يتضمّن الاختبار 40 سؤالًا تشمل الوحدات العشر:

  • تصميم المكافأة: تحديد الفخّ في وصف مكافأة معطاة، وإعادة تصميمها.
  • صياغة MDP: هل الحالة ماركوفيّة؟ ماذا يجب إضافته إن لم تكن؟
  • حساب بلمان يدويًّا على شبكة صغيرة، مع إشارات مكافأة موجبة وسالبة.
  • SARSA مقابل تعلّم Q: من يتعلّم أيّ سياسة، ومتى يهمّ الفرق.
  • إبسيلون-جشعة: خطأ إبسيلون الثابت، والتناقص المناسب لأفق مهمّة.
  • DQN: دور تخزين الرجعة والشبكة الهدف، وما يحدث إذا حُذف كلّ منهما.
  • تدرّج السياسة: تباين REINFORCE، ودور الخطّ الأساسي في تقليصه.
  • PPO: صيغة القصّ ومتى تُفعَّل، وسبب استقرارها.
  • تباين البذور: قراءة منحنى بفترة ثقة، ورفض تقرير بذرة واحدة.

الأسئلة حالات تشخيص لا استظهار تعاريف: منحنى يهبط في نصف التدريب، أو وكيل نجح في التقييم وفشل في النشر، أو خسارة تنفجر بعد 50 ألف خطوة.

في حال النجاح

تُمنح شهادة الإتمام فورًا عند تجاوز عتبة 70%، ورقمها قابل للتحقّق من طرف ثالث على المنصّة. تُذكر الدورة صراحة في مسار المؤهّلات المهنيّة للذكاء الاصطناعي إلى جانب تعلّم عميق وأنظمة توصية وتعلّم آلي بالإشراف.

قبل أن تبدؤوا

استعيدوا الجدول أعلاه سطرًا سطرًا واسألوا أنفسكم: «ماذا سيحدث إن حذفت هذا؟». إن كنتم تعرفون لماذا تنفجر خسارة DQN دون شبكة هدف، ولماذا يتعلّق تعلّم Q عندما ϵ=0,01\epsilon = 0{,}01 ثابتة، ولماذا لا يمكن الحكم على PPO ببذرة واحدة، فأنتم مستعدّون. حظًّا موفّقًا!

الامتحان النهائي

هل أنت مستعدّ لاعتماد هذه الدورة؟

40 سؤالًا تُختار عشوائيًّا من بنك أسئلة الدورة · حدّ النجاح 70 % · شهادة PDF قابلة للتحقّق تُصدَر فورًا عند النجاح.

ابدأ الامتحان

يلزم تسجيل الدخول إلى حسابك في InSkillML مع اشتراك نشط. يمكنك أيضًا بدء الامتحان من دوراتي.