الوحدة 10 — مشروع: مساعد متخصّص على جهاز العمل
الوحدات التسع السابقة أعطتنا القطع كلّها. هذه الوحدة تجمعها في مساعد كامل قابل للتشغيل الفعليّ، ثمّ تقيّمه بصرامة مقابل الحلّ السحابيّ، وتحسب كلفته السنويّة الحقيقيّة، وتُقرّر ما يبقى محلّيًّا وما يُوجَّه إلى نموذج كبير.
المكوّنات المجمَّعة
المسار الكامل من بطاقة دعم واردة إلى إجابة معروضة للموظّف:
- قاعدة نموذج: Qwen 2.5 بـ3 مليارات مُعامِل، مفتوح المصدر (Apache 2.0)
- ضبط دقيق: QLoRA على 2000 بطاقة معنونة يدويًّا، دورة 45 دقيقة على GPU مؤجَّر
- تكميم: Q4_K_M عبر أدوات llama.cpp، حجم نهائيّ 1,8 غيغابايت
- تشغيل: Ollama يخدم على
localhost:11434بذاكرة عاملة 2,3 غيغابايت - اندماج: إضافة متصفّح خفيفة (300 سطر جافاسكريبت) داخل أداة إدارة البطاقات
الطبقة الأخيرة، الأكثر أهمّية لتجربة المستخدم، تقدّم أربع وظائف:
- تصنيف إلى خمس فئات
- ملخّص في جُملة واحدة
- اقتراح إجابة أوّليّة استنادًا إلى قوالب معتمَدة سلفًا
- علامة ثقة: عالية، متوسّطة، منخفضة
بروتوكول التقييم النهائيّ
على 200 بطاقة حقيقيّة محجوزة (لم تُستخدم في التدريب ولا في اختيار الفوقيّات):
| المقياس | النموذج المحلّي | GPT-4 عبر الواجهة |
|---|---|---|
| دقّة التصنيف | 91% | 93% |
| جودة التلخيص (/5) | 4,3 | 4,5 |
| زمن الاستجابة المتوسّط | 3,8 ث | 6,2 ث |
| كلفة لكلّ بطاقة | ~0 دولار | 0,004 دولار |
| توفّر بدون شبكة | نعم | لا |
فارق نقطتين في الدقّة، وفارق قابل للإدراك في التلخيص، مقابل مكاسب واضحة في السرعة، الكلفة، والاس تقلاليّة.
الحساب الاقتصاديّ السنويّ
فرضيّات: فريق دعم من 10 موظّفين، كلّ منهم يعالج 60 بطاقة في اليوم، 220 يوم عمل سنويًّا.
الحجم السنويّ: 10 × 60 × 220 = 132 ألف بطاقة.
السيناريو أ: واجهة سحابيّة كبيرة:
- كلفة استدلال: 132 ألف × 0,004 دولار = 528 دولارًا
- كلفة تدقيق ومراجعة قانونيّة سنويّة: مقدَّرة 3000 دولار (نقل بيانات)
- المجموع: 3528 دولارًا سنويًّا
السيناريو ب: نموذج محلّي:
- كلفة تدريب أوّليّ (GPU مؤجَّر): 5 دولارات (10 دورات ضبط تجريبيّة)
- إعادة تدريب فصليّة: 4 × 5 = 20 دولارًا سنويًّا
- كلفة كهرباء إضافيّة (النموذج على الجهاز): ضئيلة، مقدَّرة 50 دولارًا لعشرة أجهزة سنويًّا
- كلفة تدقيق قانونيّ: منخفضة جدًّا، ~500 دولار
- المجموع: 575 دولارًا سنويًّا
فارق 2953 دولارًا سنويًّا لصالح النموذج المحلّي، مع تحسين تجربة الموظّف (سرعة، عمل دون اتّصال) ومركز الخصوصيّة.
حدود المشروع وما لا يفعله جيّدًا
الأمانة العلميّة تفرض ذكر الحالات التي أخفق فيها النموذج المحلّي في التقييم:
- بطاقات معقّدة تتضمّن عدّة مواضيع (شحن + مالي + شكوى تقنيّة معًا): النموذج ينحاز لأحد المواضيع ويهمل الآخرين. النموذج الكبير يتعامل معها أفضل.
- بطاقات بلهجة عاميّة قويّة لا تشبه مجموعة التدريب: الفهم ينخفض. حلّه إثراء التدريب بمثل هذه البطاقات.
- بطاقات ذات سياق تاريخيّ طويل (تبادلات سابقة عديدة): سياق 2048 جُملة يضيق. حلّه تلخيص التبادلات السابقة قبل التمرير للنموذج.
- بطاقات تحتاج معرفة قانونيّة أو تنظيميّة محدَّثة: النموذج الصغير لا يواكب. حلّه توجيه هذه الفئة لموظّف قانونيّ متخصّص، لا لنموذج آخر.
آليّة التوجيه إلى نموذج كبير
النموذج الصغير لا يجيب دائم ًا وحده. سياسة توجيه بسيطة:
def traiter_ticket(ticket):
# المحاولة الأولى: نموذج محلّي
resultat = ollama_local(ticket)
# التوجيه للنموذج الكبير إذا:
if resultat.confiance < 0.6:
return grand_modele_api(ticket)
if len(ticket.historique) > 5:
return grand_modele_api(ticket)
if ticket.categorie_precedente == "juridique":
return traitement_humain(ticket)
return resultat
في التقييم، هذا التوجيه أدّى إلى معالجة 88% من البطاقات محلّيًّا و12% عبر واجهة كبيرة أو موظّف. الكلفة السنويّة الفعليّة تصبح: 575 + (0,12 × 132 ألف × 0,004) = 638 دولارًا، أي أقلّ من خُمس السيناريو السحابيّ الخالص.
قائمة تحقّق للنشر
قبل تعميم الحلّ على الفريق كاملًا:
- النموذج مُختبَر على 200 بطاقة حقيقيّة بدقّة موثَّقة
- التوثيق الفنّيّ يذكر النسخة الدقيقة للنموذج ومصدر أوزانه
- قالب المطالبة (Modelfile) في مستودع Git داخليّ مع تاريخ
- سياسة إعادة التدريب موثّقة (فصليًّا، على أيّ بيانات، من يقرّر)
- الإضافة المتصفّح جربها 3 موظّفين على الأقلّ في الإنتاج لأسبوع
- سياسة الاستخدام الموقّعة من كلّ موظّف يستخدم الأداة
- مسار تصعيد واضح: كيف يُشير الموظّف إلى نتيجة رديئة، ومن يعالجها
لا تعمّم مساعدًا على كامل الفريق قبل أن تمرّ عليه عشرة أيّام إنتاجيّة من موظّف أو موظّفَين متطوّعَين. النقاط العمياء في نتيجة النموذج تظهر في الاستخدام الحقيقيّ، لا في التقييم على مجموعة اختبار.
الخلاصة
- المساعد الكامل يجمع: نموذج مفتوح، ضبط دقيق، تكميم، تشغيل عبر Ollama، اندماج بإضافة متصفّح.
- التقييم على 200 بطاقة يُظهر جودة قريبة من النموذج الكبير، بفوارق واضحة في السرعة والكلفة.
- الحساب السنويّ لعشرة موظّفين يوفّر ~2900 دولار مقابل السيناريو السحابيّ.
- 12% من البطاقات تحتاج توجيهًا لنموذج كبير أو موظّف بشريّ: هذا لا يُلغي الحلّ بل يُنضِجه.
- قائمة تحقّق نشر منظّمة تمنع إخفاقات ا لتعميم السريع.
الوحدة التالية: المراجعة النهائيّة، وشبكة قرار «متى نموذج صغير، متى نموذج كبير»، والاختبار.