انتقل إلى المحتوى الرئيسي

الدرس 4 — المهامّ

معالجة اللغة ليست مهمّة واحدة بل عائلة مهامّ متباينة الصعوبة والقيمة. وهذا الدرس يرتّبها ويقول أيّها يستحقّ الاستثمار.

تصنيف النصوص: الأكثر قيمة والأقلّ بهرجة

المهمّة: أعطِ نصّاً، وأعد فئة. وهي أبسط المهامّ وأكثرها إنتاجاً للقيمة في الأعمال.

الاستخدامات الحقيقية:

  • توجيه تذاكر الدعم إلى الفريق المناسب تلقائياً.
  • تصفية الرسائل المزعجة وإساءة الاستخدام، وهي من أنجح تطبيقات المجال.
  • تحليل المشاعر في تعليقات العملاء ومراجعاتهم.
  • تصنيف المستندات بحسب النوع أو الأولوية.
  • كشف اللغة قبل أيّ معالجة أخرى.

المقاييس هي مقاييس التصنيف من دورة تعلّم الآلة: الإحكام والاستدعاء ومصفوفة الالتباس، لا الدقّة وحدها.

لماذا لا تحتاج نموذجاً كبيراً هنا

لتصنيف ملايين التذاكر شهرياً، نموذج صغير مصقول على بياناتك أرخص بمراتب وأسرع في الاستجابة وأدقّ في الغالب من نداء نموذج لغوي كبير لكلّ تذكرة. النموذج الكبير مفيد لتوليد بيانات وسم أوّلية، ثمّ تدرّب نموذجك الخفيف عليها.

استخراج المعلومات

المهمّة: احصل على حقول منظّمة من نصّ حرّ. وهذه المهمّة تحوّل مستندات إلى بيانات، ولذلك قيمتها التشغيلية عالية.

التعرّف على الكيانات المسمّاة (NER): تحديد الأسماء والشركات والأماكن والتواريخ والمبالغ في النصّ. الأساس لكلّ ما بعده.

استخراج الحقول من المستندات: رقم الفاتورة، المبلغ، تاريخ الاستحقاق، أطراف العقد. صار روتيناً في المحاسبة والتأمين.

استخراج العلاقات: من يعمل عند من، وأيّ شركة استحوذت على أيّ شركة.

الترجمة الآلية

المهمّة التي شكّلت تاريخ المجال. المقاربات القديمة كانت إحصائية وتُنتج نصّاً مفهوماً وركيكاً، والمحوّلات قلبت الوضع: الترجمة اليوم قريبة من مستوى مقبول مهنياً بين اللغات الكبرى.

الحدود الباقية عملياً:

  • الفروق بين اللغات ذات الموارد الكبيرة وغيرها واسعة: الجودة تتراجع كثيراً في اللغات قليلة النصوص الرقمية.
  • الاصطلاحات والأمثال تُترجَم حرفياً أحياناً بنتائج غريبة.
  • المصطلحات المتخصّصة تقتضي معجماً أو صقلاً على مجالك.
  • الاتّساق في مستند طويل: قد يُترجَم المصطلح نفسه بطريقتين في صفحتين.

التلخيص

نوعان مختلفان تماماً:

الاستخلاصي (extractive): اختيار أهمّ الجمل من النصّ الأصلي وعرضها. آمن، لأنّ كلّ جملة موجودة فعلاً في المصدر، وأحياناً غير سلس.

التوليدي (abstractive): إنتاج نصّ جديد يعبّر عن المضمون. أسلس بكثير، وقادر على اختلاق معلومة لم ترد في الأصل. وهذا خطر حقيقي في السياقات الطبّية والقانونية.

القاعدة العملية: التلخيص التوليدي في سياق يقتضي دقّة يحتاج تحقّقاً بشرياً، لا استخداماً تلقائياً.

الإجابة عن الأسئلة والبحث الدلالي

البحث الدلالي يعتمد على التمثيلات المتّجهية من الدرس السابق: يجد المستندات القريبة في المعنى، لا المطابقة في الكلمات. هذا حلّ مشكلة قديمة: البحث الحرفي لا يجد «كيف أرجع منتجاً» عند البحث بـ«سياسة الاستبدال».

الإجابة عن الأسئلة تُبنى فوقه: تسترجع المقاطع الأقرب، ثم تسأل نموذجاً لغوياً أن يصوغ الجواب من هذه المقاطع فقط. وهذه هي بنية RAG، وهي أهمّ نمط تطبيقي في الأعمال اليوم لأنّها تربط الجواب بمصادر يمكن عرضها.

ترتيب المهامّ بحسب النسبة بين القيمة والصعوبة

كيف تُقاس جودة النصّ المولَّد

مسألة صعبة تستحقّ التوضيح، لأنّها سبب كثير من الأرقام المضلِّلة.

المقاييس الآلية الكلاسيكية — مثل BLEU للترجمة وROUGE للتلخيص — تقيس التشابه اللفظي مع مرجع بشري. وهي رخيصة وسريعة، وتعاقب الصياغة الجيّدة المختلفة عن المرجع، ولا تكشف الاختلاق.

ولهذا يُستخدم اليوم مزيج: مقياس آلي للمتابعة السريعة، وتقييم بشري على عيّنة، وأحياناً تقييم بنموذج آخر. ولا يوجد رقم واحد يكفي، وأيّ ادّعاء يعتمد على مقياس آلي وحده يستحقّ الشكّ.


في ثلاث جمل

تصنيف النصوص واستخراج الحقول والبحث الدلالي هي المهامّ الأكثر إنتاجاً للقيمة والأكثر موثوقية، ولا تحتاج غالباً إلى نموذج كبير بل إلى نموذج صغير مصقول. والترجمة والتلخيص الاستخلاصي والإجابة المستندة إلى استرجاع مفيدة مع مراجعة، والتلخيص التوليدي والاستدلال متعدّد الخطوات هشّان ويحتاجان إشرافاً بشرياً. وقياس جودة النصّ المولَّد لا يُحسم بمقياس آلي واحد، لأنّ المقاييس اللفظية تعاقب الصياغة الجيّدة ولا تكشف الاختلاق.


التاليالدرس 5: الحدود ←