المراجعة والاختبار النهائي
عشر وحدات نقلت الوكيل من حلقة تفاعل بسيطة إلى تنفيذ PPO كامل على LunarLander. هذه الصفحة تُلخّص الرحلة، ثمّ تُحدّد ما سيقيسه الاختبار وكيف تستعدّون له.
الدورة في جدول
| الوحدة | ما يجب أن يبقى |
|---|---|
| 1. الإطار | الحلقة: حالة → فعل → مكافأة؛ العائد المخفوض لا مكافأة الخطوة القادمة؛ فخاخ تصميم المكافأة (الاختصار، التناثر، الوحدات) |
| 2. MDP | خماسيّة ؛ فرضيّة ماركوف تُختصر في «الحاضر يكفي»؛ POMDP إذا انتهكت |
| 3. بلمان | للحالة، للحالة-الفعل؛ بلمان للتوقّع (بوتسترابنغ) وللأمثليّة ()؛ تُفضَّل عمليًّا لأنّ اختيار الفعل منها لا يحتاج |
| 4. DP وMC | تكرار القيمة/السياسة إذا معلوم؛ مونت كارلو بلا نموذج لكن بتباين مرتفع ومسائل حلقيّة فقط |
| 5. TD وQ-learning | تحديث بخطوة واحدة؛ SARSA على السياسة، تعلّم Q خارج السياسة؛ لا تنسوا إلغاء البوتسترابنغ عند terminated |
| 6. الاستكشاف | إبسيلون-جشعة بسيطة لكن يجب تناقصها؛ سوفتماكس وUCB بدائل مفيدة |
| 7. DQN | تخزين الرجعة (كسر الترابط)، الشبكة الهدف (تثبيت الأهداف)، Double DQN (تحيّز )، Huber loss وقصّ التدرّج |
| 8. تدرّج السياسة | REINFORCE يرفع احتمال الأفعال ذات العائد المرتفع؛ التباين ضخم؛ الخطّ الأساسي يحلّه؛ الأفعال المستمرّة حصريّة تقريبًا |
| 9. ممثّل-ناقد وPPO | الميزة ؛ A2C يمزج، PPO يقصّ نسبة الاحتماليّة لاستقرار التحديث؛ تفاصيل التنفيذ = 30% من الأداء |
| 10. المشروع | GAE، متوسّط 5 بذور، فيديو، وحدود النقل إلى الواقع (Sim-to-real، الأمان، كفاءة العيّنة) |
الخيوط التي تعبر الدورة
كلّ الخوارزميّات تحلّ بلمان. البرمجة الديناميكية تحلّها بالحساب المباشر، ومونت كارلو بمتوسّط تجريبي، وتعلّم Q ببوتسترابنغ بخطوة واحدة، وDQN بتقريب بشبكة عصبيّة، وممثّل-ناقد بتعلّم إلى جانب السياسة. ستطلبكم بعض أسئلة الاختبار إعادة اشتقاق أيّ منها من بلمان مباشرة.
اختيار الفعل والتحديث ليسا الشيء نفسه. الاختلاف بين SARSA وتعلّم Q، وبين على السياسة وخارج السياسة، هو بالضبط: أيّ فعل نضعه في التحديث؟ الفعل المُنفَّذ (على السياسة) أم أفضل فعل ممكن (خارج السياسة). خطأ هنا يخلط الخوارزميّات ويجعل نتائجهما تبدو متطابقة على البيئات السهلة، ويكشف الفارق في البيئات الخطرة.
التقييم يسبق المعمارية. أمام وكيل لا يتعلّم، الإغرا ء هو تكبير الشبكة أو تجربة خوارزميّة جديدة. الإجابة الصحيحة عادةً: راقبوا 20 حلقة عشوائيّة (هل المكافأة متناثرة؟)، اطبعوا أو منحنى الخسارة (هل ينفجر؟)، جرّبوا تناقص إبسيلون أكثر بطئًا. تشخيص المشكلة قبل الحلّ يوفّر أيّامًا.
البذور والفيديو ليسا إضافيّتين. أرقام دون تباين بذور بيانات بلا مصداقيّة. منحنى نجاح دون فيديو يخفي غالبًا فشلًا نادرًا لكن حادًّا. هذه ليست ممارسات «للنشر الأكاديمي فقط»، بل ما يفصل النموذج المُختبَر من نموذج لم يُختبَر.
ماذا يقيس الاختبار
يتضمّن الاختبار 40 سؤالًا تشمل الوحدات العشر:
- تصميم المكافأة: تحديد الفخّ في وصف مكافأة معطاة، وإعادة تصميمها.
- صياغة MDP: هل الحالة ماركوفيّة؟ ماذا يجب إضافته إن لم تكن؟
- حساب بلمان يدويًّا على شبكة صغيرة، مع إشارات مكافأة موجبة وسالبة.
- SARSA مقابل تعلّم Q: من يتعلّم أيّ سياسة، ومتى يهمّ الفرق.
- إبسيلون-جشعة: خطأ إبسيلون الثابت، والتناقص المناسب لأفق مهمّة.
- DQN: دور تخزين الرجعة والشبكة الهدف، وما يحدث إذا حُذف كلّ منهما.
- تدرّج السياسة: تباين REINFORCE، ودور الخطّ الأساسي في تقليصه.
- PPO: صيغة القصّ ومتى تُفعَّل، وسبب استقرارها.
- تباين البذور: قراءة منحنى بفترة ثقة، ورفض تقرير بذرة واحدة.
الأسئلة حالات تشخيص لا استظهار تعاريف: منحنى يهبط في نصف التدريب، أو وكيل نجح في التقييم وفشل في النشر، أو خسارة تنفجر بعد 50 ألف خطوة.
في حال النجاح
تُمنح شهادة الإتمام فورًا عند تجاوز عتبة 70%، ورقمها قابل للتحقّق من طرف ثالث على المنصّة. تُذكر الدورة صراحة في مسار المؤهّلات المهنيّة للذكاء الاصطناعي إلى جانب تعلّم عميق وأنظمة توصية وتعلّم آلي بالإشراف.
استعيدوا الجدول أعلاه سطرًا سطرًا واسألوا أنفسكم: «ماذا سيحدث إن حذفت هذا؟». إن كنتم تعرفون لماذا تنفجر خسارة DQN دون شبكة هدف، ولماذا يتعلّق تعلّم Q عندما ثابتة، ولماذا لا يمكن الحكم على PPO ببذرة واحدة، فأنتم مستعدّون. حظًّا موفّقًا!
الامتحان النهائي
هل أنت مستعدّ لاعتماد هذه الدورة؟
40 سؤالًا تُختار عشوائيًّا من بنك أسئلة الدورة · حدّ النجاح 70 % · شهادة PDF قابلة للتحقّق تُصدَر فورًا عند النجاح.
ابدأ الامتحانيلزم تسجيل الدخول إلى حسابك في InSkillML مع اشتراك نشط. يمكنك أيضًا بدء الامتحان من دوراتي.