المراجعة والاختبار النهائي
عشر وحدات للانتقال من نموذج لغوي يعرف الشبكة العامّة إلى مساعد مستندي يعرف مؤسّستك الخاصّة، ويستشهد ويعترف حين لا يعرف. هذه هي الدورة مُكثَّفة، ثم الخيوط التي تعبرها، ثم شجرة التشخيص التي تصلح مرجعًا في الإنتاج.
الدورة في لمحة
| الوحدة | الجوهر الواجب حفظه |
|---|---|
| 1. لماذا نُثبِّت في المستندات | المعرفة المُجمَّدة تُنتج هلوسات؛ RAG لا يعوّض التخصيص بل يجيبان عن سؤالين مختلفين؛ والسرّية حجّة تحسم في المؤسّسة |
| 2. استخراج النصّ | لكلّ تنسيق أعطاله: ترتيب القراءة (PDF)، الترويسات (HTML)، OCR للممسوح؛ ما وراء البيانات تُساوي النصّ قيمةً |
| 3. التقطيع | القسمي بحجم 300 – 500 رمز وتداخل 10 – 20 % نقطة انطلاق سليمة؛ البنيوي أفضل حين يتوفّر تصنيف العناوين والجداول |
| 4. التضمينات والفهرس | متعدّد اللغات إجباري للعربية؛ HNSW سريع؛ فلاتر ما وراء البيانات تُنفّذ الأذونات؛ تغيير النموذج يعني إعادة الفهرسة كلّها |
| 5. البحث الكثيف والمعجمي والهجين | BM25 يُنقذ الكثيف على المصطلحات النادرة والأسماء المختصرة؛ RRF يدمج الترتيبين بلا معايرة |
| 6. إعادة الترتيب | cross-encoder يُقفز بالدقّة قفزة حقيقية؛ 20 مرشّحًا ← 5 محتفَظ بها؛ MMR ينوِّع المصادر |
| 7. التعليمة والاستشهاد | تعليمة الامتناع تفصل الموثوق من المهلوس؛ «الضائع في المنتصف» يفرض ترتيبًا مدروسًا؛ الاستشهاد يُحقَّق برمجيًّا |
| 8. التقييم | افصل الاسترجاع عن التوليد؛ Recall@k وMRR للأوّل، الأمانة والملاءمة والتغطية للثاني؛ نموذج حَكَم يُشغِّل المقياس آليًّا |
| 9. الكلفة والتخزين المؤقّت | ثلاث طبقات: تضمين، إجابة (حرفيّة ثم دلاليّة)، prompt caching؛ إعادة الفهرسة بالبصمة توفّر 90 % |
| 10. المشروع الكامل | مجلّدات مفصولة، أذونات بمبدأ «افتراضيًّا سرّيّ»، إطلاق تجريبي بعشرة مستخدمين، حلقة أسبوعية لجمع الأعطال |
الخيوط التي تعبر الدورة
كلّ شيء يعود إلى فصل الفهرسة عن الاستفسار. فالفهرسة عملية بطيئة تُنجَز مرّة (ثم تدريجيًّا)، والاستفسار عملية سريعة تحدث آلاف المرّات يوميًّا. المشاريع الفاشلة تخلط بينهما، فيصير كلّ سؤال يعيد فهرسة شيء ما، فتنهار الاستجابة والكلفة معًا. القاعدة: الفهرس يُبنى مرّة ويُقرأ ملايين المرّات.
السرّية ليست خيارًا إضافيًّا بل قيدًا هيكليًّا. فلاتر الأذونات في ما وراء البيانات (الوحدة 4)، وحذف المقاطع الحسّاسة من السياق قبل الإرسال إلى النموذج (الوحدة 7)، ومبدأ «افتراضيًّا سرّيّ» عند وسم المستندات (الوحدة 10) ينتظمون معًا في سياسة واحدة. نسيانها في مرحلة واحدة يُلغي الجهد في المراحل الأخرى.
الأمانة تُبنى في التعليمة وتُقاس في التقييم وتُصان في السجلّ. قاعدة الامتناع الصريحة (الوحدة 7) لا تُغني عن قياس الأمانة على مجموعة موصوفة (الوحدة 8) ولا عن التسجيل الذي يُتيح كشف انحدار الجودة (الوحدة 9). الاعتماد على الانطباع بدل هذه الثلاثيّة هو ما ينتج مساعدات «تعمل يوم الإطلاق وتفشل بعد شهر بلا أن يلاحظ أحد».
التحسين يستحقّ قياسًا، والقياس يستحقّ مجموعة أسئلة. لا تُتَّخذ قرارات تصميم على نتيجتين تجريبيّتين. حجم المقطع، تداخل، نموذج تضمين، إضافة BM25، إعادة ترتيب، عتبة MMR، كلّها اختيارات لا يحسمها إلّا القياس على مجموعة 100 – 200 سؤال موصوف. الاستثمار في هذه المجموعة يُسدَّد عشرات المرّات خلال حياة المشروع.
شجرة التشخيص: «الإجابة سيّئة، أين أبحث؟»
المرجع العملي حين يُبلَّغ عطب:
-
أوّلًا: هل المقطع الصحيح في الفهرس أصلًا؟
- افحص يدويًّا:
store.get(where={"source": path}) - إن لم يكن، المشكلة في الاستخراج (الوحدة 2) أو التقطيع (3).
- افحص يدويًّا:
-
ثانيًا: هل هو ضمن العشرين المسترجَعة؟
- نفِّذ الاستفسار وطالِع أوّل العشرين.
- إن لم يكن، المشكلة في الاسترجاع (الوحدة 4 و5): نموذج تضمين ضعيف، أو BM25 مفقود، أو فلتر خانق.
-
ثالثًا: هل هو ضمن الخمسة الأولى بعد إعادة الترتيب؟
- إن لم يكن، المشكلة في إعادة الترتيب (الوحدة 6): نموذج غير مناسب للغة، أو غياب مطلق.
-
رابعًا: هل النموذج المولّد استعمله؟
- افحص هل الإجابة تستشهد بالمقطع، وهل محتواها متّسق معه.
- إن لم يكن، المشكلة في التعليمة (الوحدة 7): «الضائع في المنتصف»، أو تعليمة نظام غير كافية.
-
خامسًا: هل النظام يعرف أنّه فشل؟
- إن كانت الإجابة خاطئة والنظام ادّعى الصواب، فتعليمة الامتناع رخوة.
- إن كان لا يُعلَم بالفشل إلّا يدويًّا، فالتقييم (الوحدة 8) غائب.
هذه الشجرة تختصر ساعات من التخبّط لأنّها تُلزم بالتشخيص قبل الحلّ.
الاختبار النهائي
يتضمّن الاختبار 40 سؤالًا تشمل الوحدات العشر: اختيار المقاربة الصحيحة بين RAG والتخصيص والسياق الطويل، وأعطال استخراج التنسيقات المختلفة، ومفاضلات التقطيع الحقيقية، واختيار نموذج التضمين والقاعدة المتّجهية، وحلّ الأعطال المعجمية بـBM25، ومكاسب إعادة الترتيب، وقواعد الامتناع والاستشهاد، ومقاييس التقييم وشجرة تشخيصها، وتحسينات الكلفة، وتنظيم المشروع في الإنتاج.
وتعرض عدّة أسئلة حالات للتشخيص: مساعد يجيب برقم من قانون بلد آخر، وسؤال بمصطلح مختصر يفوته الاسترجاع الكثيف، وجدول قطعه التقطيع نصفين، وذاكرة مؤقّتة تُعيد إجابة لإجراء أُلغِيَ، وفلتر أذونات نُسي فيسرّب مقطعًا سرّيًّا. المُقيَّم هو الحُكم المُتدرَّب عبر الدورة، لا استظهار أسماء المكتبات.
وفي حال النجاح تُمنح شهادة الإتمام فورًا؛ ورقمها قابل للتحقّق من أيّ طرف على المنصّة.
راجع الجدول أعلاه، وعلى كلّ سطر اسأل نفسك: «كيف سأرى أنّني مخطئ هنا؟». فإن عرفت أن تقول لماذا لا يعوّض السياق الطويل RAG، ولماذا يُنقذ BM25 المصطلحات النادرة، ولماذا الاستشهاد الذي لا يُتحقّق منه لا يساوي شيئًا، ولماذا مجمو عة 5 أسئلة ليست تقييمًا، فأنت مستعدّ. حظًّا موفّقًا!
الامتحان النهائي
هل أنت مستعدّ لاعتماد هذه الدورة؟
40 سؤالًا تُختار عشوائيًّا من بنك أسئلة الدورة · حدّ النجاح 70 % · شهادة PDF قابلة للتحقّق تُصدَر فورًا عند النجاح.
ابدأ الامتحانيلزم تسجيل الدخول إلى حسابك في InSkillML مع اشتراك نشط. يمكنك أيضًا بدء الامتحان من دوراتي.