الوحدة 10 — التقييم قبل الضبط وبعده
النموذج المضبوط يُنتج نصًّا يبدو أفضل. لكنّ الشعور غير القياس، والقياس غير المنهجي غالبًا مضلّل. هذه الوحدة تُنظّم التقييم في ثلاث طبقات: مقاييس آلية على مهمّة الهدف، حكم بشري في الأعمى، واختبار انحدار على الكفاءات العامّة.
الشرط المسبق: جيب اختبار محفوظ
قبل أيّ تدريب، افرز جيب اختبار (test set) لا يُلمَس أبدًا. ليس
مجموعة التحقّق (المستعملة أثناء التدريب لاختيار المعاملات الفائقة)، بل
مجموعة ثالثة مستقلّة تمامًا. القسمة النموذجية:
- 80% تدريب (1600 مثال)
- 10% تحقّق (200 مثال، تُقاس عليها خسارة كلّ 100 خطوة)
- 10% اختبار (200 مثال، تُلمَس مرّة واحدة فقط عند التقييم النهائي)
القاعدة الذهبية: جيب الاختبار لا يُقاس عليه أثناء التطوير. إذا اطّلعت على أدائه وعدّلتَ المعاملات على ضوئه، فقد فُقد استقلاله وأصبح مجموعة تحقّق إضافية.
مقاييس آلية على مهمّة الهدف
لمهمّة توليد محاضر منظّمة، ثلاث فئات من المقاييس:
مقاييس الشكل: تُقاس امتثال المخرج للبنية المطلوبة.
- نسبة المحاضر التي تحتوي كلّ الأقسام المطلوبة (حاضرون، نقاط، قرارات، مهامّ)
- نسبة المحاضر التي تحترم عدد الأقسام المتوقّع
- نسبة المهامّ ذات تاريخ صحيح التنسيق
هذه المقاييس بسيطة كتابةً (تعابير نمطية أو محلّلات JSON) لكنّها تقيس مباشرة الفائدة الأولى للضبط الدقيق.
مقاييس التشابه النصّي: BLEU، ROUGE-L، BERTScore.
from evaluate import load
rouge = load("rouge")
results = rouge.compute(
predictions=generated_summaries,
references=reference_summaries,
)
print(results) # {'rouge1': 0.42, 'rouge2': 0.19, 'rougeL': 0.31}
هذه المقاييس مؤشّرة لا حاكمة: نموذج يُنتج ملخّصًا صحيحًا بألفاظ مختلفة عن المرجع يحصل على ROUGE منخفض رغم جودته. استعملها للمقارنة بين نقاط تفتيش، لا كحكم مطلق.
مقاييس المحتوى: هل تظهر القرارات الفعلية في المحضر؟ هذا يتطلّب تعليم
البيانات (المرجع يحوي قائمة قرارات مُلحقة)، ثمّ حساب نسبة الالتقاط
(recall) والدقّة (precision) على القرارات المستخرَجة.
حكم بشري في الأعم ى
المقاييس الآلية تفوت الكثير: قد يصنع النموذج ملخّصًا صحيح البنية، سطحيًّا لكن غير مضلّل، وتحصل عليه المقاييس على درجة عالية. أو قد يصنع ملخّصًا مركزًا وذكيًّا يستعمل ألفاظًا مختلفة، فيقع في مقاييس منخفضة.
الحكم البشري يبقى المرجع النهائي. لكن يجب أن يكون في الأعمى، أي دون أن يعرف المُقيِّم أي مخرج من أي نموذج. الترتيب النموذجي:
- اجمع 30-50 مثال اختبار.
- لكلّ مثال، ولِّد جوابًا من: النموذج الأصلي (قبل الضبط)، النموذج المضبوط، ومن الممكن نموذج مرجعي (GPT-4).
- اعرض الأجوبة الثلاثة بترتيب عشوائي بلا تسمية للمُقيِّم.
- اطلب تقييمًا على معايير محدّدة (0-5 لكلّ من: البنية، الاكتمال، الدقّة، القراءة).
- احسب متوسّطات الأجوبة وحدّد أيّها الأفضل بأغلبية إحصائية.
هذه العملية تستغرق يومًا كاملًا لكنّها تعطي حكمًا موثوقًا يبرّر مواصلة التخصّص أو التوقّف عنده.