انتقل إلى المحتوى الرئيسي

الوحدة 2 — مشهد النماذج الصغيرة المفتوحة

عالم النماذج المفتوحة الصغيرة يتحرّك بسرعة، لكنّه مستقرّ حول عدد محدود من العائلات يستحقّ كلّ منها اسمًا وسياقًا. في الوحدة السابقة اتّفقنا على أن نموذجًا من 1 إلى 4 مليارات مُعامِل يكفي غالبًا لمهمّة تصنيف بطاقات الدعم وتلخيصها؛ هنا نختار الأسرة التي ننطلق منها.

العائلات الرئيسة اليوم

Phi من مايكروسوفت، وأشهر إصداراتها Phi-3-mini بـ3,8 مليار مُعامِل وPhi-3.5-mini. مصمّمة أساسًا لتكون صغيرة قويّة، دُرِّبت على بيانات صناعيّة عالية الجودة، وتتفوّق في الاستدلال والبرمجة بأحجامها الصغيرة. رخصة MIT، والقيود التجاريّة عمليًّا شبه معدومة.

Gemma من جوجل، بأحجام 2 و7 مليارات مُعامِل، ثمّ Gemma 2 بأحجام مماثلة. جودتها في اللغة الإنجليزيّة ممتازة، وفي العربيّة معقولة لمهامّ التصنيف والاستخراج، أقلّ إتقانًا للفصحى في التوليد الطويل. رخصتها خاصّة لكنّها تسمح بالاستخدام التجاريّ.

Qwen من Alibaba، إصداراتها من 0,5 إلى 7 مليارات مُعامِل. الأقوى عادة على اللغة العربيّة بين النماذج المفتوحة في فئتها، ويرجع ذلك إلى تدريبها على قدر معتبر من النصوص متعدّدة اللغات. رخصة Apache 2.0 في أغلب الإصدارات الصغيرة.

Llama من Meta، وقد نزلت Llama 3 وLlama 3.1 و3.2 إلى أحجام صغيرة (1 مليار و3 مليارات). الرخصة مُقيَّدة قليلًا: مسموحة تجاريًّا مع سقف مستخدمين شهريّ عالٍ لا يلامسه المستخدم العاديّ، لكن ينبغي قراءتها.

Mistral ومشتقّاتها بأحجام 7 مليارات، وحديثًا Ministral بـ3 مليارات. جودتها في الفرنسيّة والإنجليزيّة ممتازة، وفي العربيّة متوسّطة. رخصة Apache 2.0 على الإصدارات الأساسيّة.

قراءة بطاقة نموذج قبل الاعتماد

لا تحمّل نموذجًا وتُدخله في مشروع دون أن تقرأ بطاقته على Hugging Face. البطاقة الجادّة تحوي على الأقلّ:

  • الرخصة بالنصّ الكامل، لا بالاختصار. رخصة تبدو مفتوحة قد تخفي شرط ذكر أو حظرًا على تدريب نماذج أخرى بمخرجاتها.
  • اللغات المدرّب عليها وحصّتها في مجموعة التدريب. نموذج «متعدّد اللغات» قد يكون 92% منه إنجليزيًّا، فلا تنتظر منه أعجوبة في العربيّة.
  • البيانات المُستخدَمة ومصدرها إن كان معلنًا. هذا يُهمّ للامتثال، ولمعرفة ما إذا كان النموذج «رأى» بيانات مشابهة لعملك.
  • التقييمات المرجعيّة: نتائج على MMLU، وGSM8K، وHellaSwag، وإن أمكن على تقييم عربيّ مثل ArabicMMLU.
  • المخاطر والقيود المعروفة التي أقرّ بها الفريق الناشر.

تقييم عمليّ في اللغة العربيّة

لا تكتفِ بالأرقام المُعلنة. اختبر النموذج بنفسك على عيّنة من عشرين طلبًا بالفصحى تعكس أسلوب مستخدميك: بعضها بلهجة مخفَّفة، بعضها بأخطاء إملائيّة شائعة (همزة، شدّة، ألف مقصورة)، بعضها بأرقام هنديّة وأخرى بأرقام عربيّة، بعضها يمزج الإنجليزيّة والعربيّة.

معايير الجودة الثلاثة التي نتحقّق منها:

  • الفهم: هل يستخلص النموذج المقصود من طلب غير رسميّ؟
  • الإخلاص: هل يبقى في نطاق الطلب ولا يخترع معلومات؟
  • جودة التوليد بالعربيّة الفصحى: صياغة سليمة، أخطاء نحويّة نادرة، لا خلط بين المذكّر والمؤنّث في العناصر البسيطة.

على تجربتنا في تصنيف بطاقات الدعم إلى خمس فئات، تُعطي Qwen 2.5 بـ3 مليارات مُعامِل نتائج ممتازة، بينما تتفوّق Phi-3-mini في مهامّ الاستدلال المنطقيّ رغم ضعفها النسبيّ في التوليد العربيّ الحرّ.

المفاضلة العمليّة

نموذج قوّته 3 مليارات مُعامِل مكمَّم على 4 بتّات يشغل نحو 1,8 جيجابايت من الذاكرة، ويعمل بسرعة مقبولة على معالج مركزيّ حديث. هذا هو حجم الاستهداف الأمثل لجهاز موظّف دعم عاديّ.

انتباه إلى نسخ النموذج المكمَّمة الجاهزة

النسخ المكمَّمة التي تجدها على Hugging Face، وخاصّة صيغ GGUF، قد لا يكون قدّمها الفريق الناشر الرسميّ. تحقّق دائمًا من ناشر الملفّ ومن مطابقة الاختزال (sha256) قبل التحميل، فبعض النسخ تخفي طبقة تكميم رديئة تُفقد النموذج جودته.

الخلاصة

  • خمس عائلات مسيطرة اليوم: Phi، وGemma، وQwen، وLlama، وMistral في أحجامها الصغيرة.
  • Qwen غالبًا الأقوى على العربيّة في هذه الفئة، وPhi في الاستدلال، وMistral في اللغات اللاتينيّة.
  • بطاقة النموذج يجب أن تُقرأ بالكامل: الرخصة، اللغات، بيانات التدريب، التقييمات، القيود.
  • اختبار العربيّة على بيانات مؤسّستك أهمّ من أرقام التقييم المرجعيّة العامّة.

الوحدة التالية: كيف نقرّب نموذجًا صغيرًا من أداء نموذج كبير بواسطة تقطير المعرفة.