المراجعة والاختبار النهائي
عشر وحدات، واقتناع واحد: الأداء يُكتسَب في المتغيّرات. وهذه هي الدورة مكثّفة — وحدةً وحدةً أوّلًا، ثمّ عبر الخيوط التي تعبرها كلّها.
الدورة في لمحة
| الوحدة | جوهر ما يُحفَظ |
|---|---|
| 1. المتغيّرات أم الخوارزمية | المتغيّر تمثيل؛ ولا يتعلّم النموذج إلّا ما يجعله الفضاء قابلًا للتعبير |
| 2. القيم الناقصة | اسأل لماذا تنقص (MCAR و MAR و MNAR) قبل كيف تملأ؛ والمؤشّر يحفظ الإشارة |
| 3. تغيير المقياس | لازم للمسافات والجداءات والتدرّج؛ لا لزوم له للأشجار؛ ولا يصلح الشكل |
| 4. الترميز الفئوي | الترقيم يُنشئ ترتيبًا زائفًا؛ one-hot عند قلّة الفئات، والهدف مع التنعيم بعدها |
| 5. التواريخ والدورات | فكّك التاريخ إلى عشرة متغيّرات؛ والجيب والمتمّم يقرّبان ديسمبر ويناير |
| 6. متغيّرات النصّ | TF-IDF افتراضًا، و n-grams للترتيب؛ ولا تُهمِل الطول والترقيم |
| 7. التجميع والنوافذ | الفارق عن العادة يتغلّب على القيمة الخامّ؛ وshift(1) قبل rolling |
| 8. تسرّب البيانات | يحسّن الدرجة فيخفى على المقاييس؛ أربع عائلات وسؤال واحد |
| 9. الاختيار | المرشّحات للتشذيب والتبديل للحَسْم؛ وكلفة التشغيل تهمّ |
| 10. خطوط المعالجة | Pipeline يجعل التسرّب مستحيلًا بنيويًّا ويُلغي الفارق مع الإنتاج |
الخيوط العابرة للدورة كلّها
اضبط على التدريب وطبّق في كلّ مكان. تعود العبارة نفسها في الوحدات 2 و3 و4 و6 و10. فكلّ إحصاءة متعلّمة — وسيطٌ ومتوسّط وانحراف معياري ومتوسّطات فئات ومفردات وأوزان IDF — تُحسَب على بيانات التدريب وحدها. وهذا ليس احترازًا بين احترازات، بل هو الحدّ الفاصل بين درجة حقيقية ودرجة مُختَلَقة.
سؤال الإتاحة، مطروحًا على كلّ متغيّر. «هل هذه المعلومة معلومة سلفًا لحظة وجوب التنبّؤ؟» يأتي من دورة التعلّم المُوجَّه، ويبني الوحدة 8، ويحاكم متغيّرات الوحدة 5 الزمنية كما يحاكم تجميعات الوحدة 7. فالمتغيّر شديد التنبّؤ وغير المتاح في الإنتاج ليس ميزةً: بل هو تسرّب.
انسِب القيمة إلى مرجعها الوجيه. هذه هي الآليّة التي تعطي أكبر العوائد: مبلغٌ يُقاس إلى عادة العميل (الوحدة 7)، وفئةٌ تُستبدَل بمعدّل تحوّلها (الوحدة 4)، وقيمةٌ تُقيَّس حسب المجموعة لا على السكّان. فالقيمة الخامّ قليلًا ما تقول قدر ما يقوله الفارق.
اختيار التحويل يتبع النموذج المقصود. فتغيير المقياس لا لزوم له للأشجار ولا غنى عنه لـ PCA والنماذج المنظَّمة؛ والترميز الدوري نفيسٌ لنموذج خطّي هامشيٌّ لشجرة؛ وارتفاع عدد الفئات يعالجه LightGBM معالجةً أصيلة. فلا معالجة مسبقة كونية، بل معالجات ملاءمة لغرض.
الاختبار النهائي
يتضمّن الاختبار 40 سؤالًا تغطّي الوحدات العشر: آليات النقص واسترا تيجيات التعويض، واختيار تغيير المقياس وتحويلات التوزيع، والترميز حسب عدد الفئات، والمتغيّرات الزمنية والدورية، وتمثيلات النصّ، والتجميعات والنوافذ، وتحديد التسرّبات، وأساليب الاختيار، وبناء خطوط المعالجة.
وتعرض أسئلة عدّة وضعياتٍ مصغّرة: متغيّرٌ مشتبه فيه عليك أن تحكم بتسرّبه أو سلامته، ومجموعة بيانات عليك أن تختار ترميزها، ودرجةٌ مرتفعة على نحو شاذّ عليك أن تجد سببها. فغاية الدورة الحُكْم لا الاستذكار.
وتُمنَح عند النجاح شهادة إتمام فورًا، ورقمها قابل للتحقّق من أيّ طرف على المنصّة.
أعِد قراءة الجدول أعلاه، ثمّ اسأل عن كلّ سطر: «وإن أخطأتُ هنا، كيف سأرى ذلك؟». فإن جاء الجواب — لماذا يُحيّز التعويض بالمتوسّط في حالة MNAR، ولماذا يهدم rolling من دون shift نموذجًا زمنيًّا، ولم اذا ينبغي أن تقلقك درجة ممتازة — فأنت مستعدّ. حظًّا موفّقًا!
الامتحان النهائي
هل أنت مستعدّ لاعتماد هذه الدورة؟
40 سؤالًا تُختار عشوائيًّا من بنك أسئلة الدورة · حدّ النجاح 70 % · شهادة PDF قابلة للتحقّق تُصدَر فورًا عند النجاح.
ابدأ الامتحانيلزم تسجيل الدخول إلى حسابك في InSkillML مع اشتراك نشط. يمكنك أيضًا بدء الامتحان من دوراتي.