الوحدة 8 — مقاييس الجودة: FID وInception Score
نموذجان توليديّان أنتجا صورًا مختلفة على CelebA. أيّهما أفضل؟ السؤال يبدو بديهيًّا، لكنّ جوابه يتطلّب مقاييس قادرة على أن تُعطي حكمًا رقميًّا. FID هو المعيار الحاليّ في الأدبيّات، لكنّه ليس بريئًا: يمكن التلاعب به، ولا يقيس كلّ شيء. هذه الوحدة تعرض ما يقيس فعلًا، وما يُخفيه.
Inception Score: الفكرة الأولى وحدودها
Inception Score (IS) اقترحه Salimans وآخرون في 2016 مع Improved GAN. الفكرة: نمرّر الصور المولّدة على شبكة Inception V3 المدرَّبة على ImageNet، ونحصل على توزيع احتمالات على 1000 صنف لكلّ صورة.
نقي س شيئين معًا:
- الوضوح: لكلّ صورة يجب أن يكون التوزيع مركّزًا على صنف واحد (صورة قطّة تُعطي احتمالًا مرتفعًا لـ«قطّة»).
- التنوّع: التوزيع المهمَّش يجب أن يكون موزّعًا على كثير من الأصناف.
الصيغة تجمعهما في تباعد KL:
قيمة أعلى تعني نموذجًا أفضل. مقياس ذكيّ، لكنّ عيوبه ثقيلة:
- لا يستعمل مرجعًا حقيقيًّا. نموذج يُنتج ألف صورة قطط مختلفة نظيفة تمامًا يعطي درجة عالية، حتّى لو لم يشبه شيء منها ما في مجموعة التدريب.
- يعتمد على أصناف ImageNet. صور بلا صنف صريح (وجوه، مشاهد داخليّة، فنّ تجريديّ) تُقيَّم بشكل سيّئ لأنّ التوزيع الشرطيّ لا يتركّز.
- يمكن التلاعب به بسهولة: تدريب نموذج على مجموعة بيانات تُحاكي بالضبط بنية ImageNet يرفع IS دون أن يعكس جودة حقيقيّة.
هذه العيوب دفعت إلى مقياس أكثر متانة.