الوحدة 11 — المراجعة والاختبار
هذه الدورة انطلقت من فكرة واحدة: التوصية ليست تنبّؤًا بنقطة بل ترتيبًا لقائمة، على مصفوفة نادرة، من إشارات مبهمة، لخدمة هدف تجاريّ. كلّ ما تلا ذلك كان تفعيلًا تدريجيًّا لهذا التأطير. قبل الاختبار، نُجمّع القرارات الحرجة في شبكة يمكن الرجوع إليها في العمل.
القرارات التي تُميّز نظامًا ناجحًا
الصياغة. اختر مقياس الترتيب المطابق لهدفك: Recall@k لتغطية أفضل قائمة، NDCG@k حين تختلف درجات الصلة، MAP لأمثلة أكاديميّة كثيرة. RMSE مقبول للمقارنة الأكاديميّة، مضلّل في الإنتاج.
نوع الإشارة. الصريحة (نجوم) نادرة وموثوقة؛ الضمنيّة (نقر، دقائق، إتمام) غزيرة ومبهمة. أيّ نظام إنتاج جادّ يستعمل الاثنين، مع توزين ثقة على الإشارات الضمنيّة.
اختيار الخوارزميّة. جوار العنصر لمنصّة صغيرة (أقلّ من ألف عنصر). تفكيك المصفوفة (FunkSVD أو iALS بحسب طبيعة الإشارة) للمنصّات المتوسّطة. النموذج ذو البُرجَين حين تكون الميّزات غنيّة أو المقياس يفوق عشرة ملايين عنصر.
البداية الباردة. لا يُحلّ بخوارزميّة واحدة. حجز حصّة من قائمة التوصية للجديد، استبيان قصير للمستخدم الجديد، الشعبيّة كخيار افتراضيّ، واستكشاف محسوب لكسر الحلقة.
التقييم. تقسيم زمنيّ (لا عشوائيّ)، جدول متعدّد المقاييس (Recall, NDCG, Coverage, Diversity, Cold-user)، خطّ مرجعيّ ثلاثيّ قبل أيّ نموذج معقّد، ثمّ اختبار A/B حيّ.
الانحيازات. تحيّز الموضع يُعالَج بـIPS بشرط توفّر بيانات عشوائيّة صغيرة لتقدير الميل. تحيّز الشعبيّة يُخفَّف بعيّنات سالبة موزونة أو إعادة تعيير الدرجات. حلقة التغذية الراجعة لا تُكسَر إلّا بالاستكشاف المستمرّ.