الوحدة 2 — التدريب المسبق: البيانات والرموز وقوانين التوسّع
للنموذج الذي سنعتمد عليه في المساعد — نحو 7 إلى 8 مليار وسيط، برخصة سمحة — سيرةٌ محدّدة: تدرَّب على تريليونات الرموز. لن نُعيد هذا التدريب، ذلك ليس واقعيًا. لكنّ فهم كيف جرى يوضّح ما يجيده النموذج وما لا يجيده، ولماذا تُفشل بعض اللغات ما تُنجحه لغات أخرى.
القاعدة قبل النموذج
النموذج اللغوي الكبير هو، قبل كلّ شيء، نتيجةُ مجموعة نصوص. تتألّف هذه المجموعة، في نماذج الجيل الحالي، من مصادر رئيسية أربعة: زحفٌ عامّ للويب (Common Crawl وفروعه المنقّاة مثل C4 وFineWeb)، وموسوعات وكتب رقمية (ويكيبيديا، وGutenberg)، وكود مصدر (GitHub بعد ترشيح تراخيصه)، ومنتديات ونقا شات (StackExchange وReddit). تُخلَط هذه المصادر بأوزان تُختار تجريبيًا: كم من الكود مقابل النصّ الطبيعي؟ كم من الفرنسية مقابل الإنجليزية؟ ينعكس هذا الخلط مباشرة على قدرات النموذج النهائية.
الترشيح، خطوة تُغيّر كلّ شيء
الزحف الخام يحوي كمّيات هائلة من الفوضى: صفحات مكرّرة، وقوائم بيع، وسبام تحسين محرّكات البحث، ومحتوى تُنتجه نماذج أخرى. تدريبٌ على هذه المادة الخام يُعطي نموذجًا يُحسِن تقليد السبام أكثر من إتقان اللغة. ولذلك، تُستَعمل مصفوفة ترشيحات مرتّبة:
- تصفية اللغة: إبقاء اللغات المستهدَفة فقط، بواسطة مصنّف لغوي سريع.
- تصفية الجودة: نماذج تصنيف تحكم على «معقولية» الفقرة، مُدرَّبة على تمييز نصّ ويكيبيديا من نصّ سبام.
- الترشيح المحتوى الحسّاس: عناوين ومعرّفات شخصية، ومحتوى غير قانوني بحسب مصفوفة القوانين.
- الحدّ الأدنى من الطول: التخلّص من صفحات المحاضرات القصيرة والقوائم البسيطة.
يلي ذلك خطوة أشدّ حسمًا مما تبدو: إزالة التكرار.
إزالة التكرار
الويب مُشبَع بالنسخ المكرّرة. مقالة تُنسخ في عشرات المواقع، وقوالب قانونية موحّدة بالحرف تظهر في مليون صفحة. لو تدرّب النموذج على هذه المادة كما هي، فسيرى نفس التسلسل من الرموز آلاف المرّات: نتيجةً لذلك يحفظه بدلًا من أن يعمّم منه، وهذا يُظهر ما يُسمّى تلوث بيانات التقييم لاحقًا.
يعمل الدُبلوك على مستويين. المستوى الوثائقي يُلغي الوثائق المتشابهة عبر تجزئة MinHash: يُقارن كلّ زوجٍ من الوثائق بمقياس Jaccard على أنقاض متتالياتها، وتُبقى نسخة واحدة من كلّ مجموعة قريبة. والمستوى الفقري أدقّ: يزال أيّ تسلسل من عشرات الرموز يظهر مرّتين أو أكثر في المجموعة كلّها، ما يقتل قوالب متكرّرة تدخل عبر آلاف الصفحات ولو كانت الوثائق مختلفة.
كتبت مجموعة MinerU عام 2022 نتيجة تُفسّر أهمّية هذا العمل: إزالة التكرار وحدها تُحسّن الأداء بقدر يفوق مضاعفة الحجم في بعض الحالات. النظافة مقدَّمة على الكمّية.
قوانين التوسّع، وثورة Chinchilla
كيف نوزّع ميزانية حساب معلومة بين حجم النموذج وعدد الرموز ؟ الجواب المُخطئ الذي ساد قبل 2022 كان: كبّر النموذج، وأضف رموزًا بقدر ما تستطيع. أظهرت ورقة Chinchilla من DeepMind أنّ هذا خطأ منظّم.
عرّفَت الورقة ميزانية الحساب بصيغة تقريبية:
حيث وسائط النموذج و رموز التدريب. من أجل ثابتة، فقد بحث الفريق عن التوليفة التي تُصغّر الخسارة. النتيجة اللافتة: يجب أن ينمو و بالنسبة نفسها تقريبًا. أي أنّ نموذجًا من مليار وسيط يجب أن يرى نحو 20 مليار رمز؛ ونموذجًا بـ 70 مليار وسيط يستحقّ نحو 1.4 تريليون رمز.
قبل Chinchilla كانت النماذج الكبيرة تحت التدريب بشكل منهجي: أوزان كثيرة على رموز قليلة، فتُهدر السعة. نموذج GPT-3 مع 175 مليار وسيط دُرِّب على 300 مليار رمز؛ الحساب نفسه، مُعاد توزيعه، كان يُنتج نموذجًا أصغر بمرتين وأفضل بمرتين.
النتيجة العملية لمشروعنا: نموذج 7 مليار وسيط جيّد يجب أن يكون قد رأى قرابة تريليون رمز أو أكثر. إذا صادفت نموذجًا مفتوحًا بحجم مماثل دُرِّب على 100 مليار فقط، فهو تحت التدريب، وستُلاحظ ذلك في جودة الإجابات — بحجم يُخفي فقرًا.
الكلفة الحقيقية
نموذج 7 مليار وسيط، مدرَّب على 1.5 تريليون رمز، يستهلك تقريبًا:
على معالج رسومي H100 يُنتج نحو عملية فاصلة عائمة في الثانية بأمانة تدريب، يستغرق ذلك نحو ثانية على معالج واحد. بعتاد من 500 معالج H100 يعمل بالتوازي، يقارب هذا 17 يومًا من التشغيل المتواصل، وكلفة تفوق 250 ألف دولار من الطاقة والاستئجار وحده — دون احتساب هندسة الفريق. فقط أكبر المؤسسات تنجز هذا. الأغلبية العظمى تعتمد نماذج مفتوحة جاهزة.
حصّة اللغات في المجموعة
المجموعة العامّة تحكمها الإنجليزية: قرابة 60 إلى 80 بالمائة عادةً. الفرنسية بضع نقاط، والعربية بمرتبة أقلّ، والصينية والإسبانية بينهما. هذا التوزيع ليس صدفة، بل انعكاس لتوزيع الويب.
النتيجة الملموسة: يُفهم نموذج الجيل الحالي العربيةَ بجودة أدنى مما يفهم الإنجليزية، وينتج ترميزًا فرعيًا أقلّ كفاءة (رموز أكثر لنفس النصّ)، وتزداد كلفة الاستخدام بالمناسبة. ولمشروعنا الذي قد يخدم جمهورًا ناطقًا بالعربية، هذا معطى استراتيجي: يجب اختبار النموذج على نصوص بلغة الجمهور الفعلي قبل الاعتماد، لا الاكتفاء بالبطاقة الفنيّة الرسمية.
لا تُنبّهك بطاقةُ النموذج المفتوحة عادةً إذا كان تحت التدريب. لا مؤشر واضح على أنّ حجمه الاسمي فقيرٌ في الرموز. تفحّص دائمًا الرقم في وثيقة النموذج: كم رمزًا رأى؟ إذا كان أقلّ بكثير من 15 ضعف عدد وسائطه، فتوقّع فقرًا في المعرفة العامّة وجودةً منخفضة في التوليد الحرّ. لا يعالج الضبط الدقيق هذا العيب البنيوي.
في الخلاصة
- المجموعة تعبر أربع مراحل: جمع، ثمّ تصفية جودة، ثمّ إزالة تكرار على مستويين، ثمّ ترجيح بين المصادر.
- قوانين Chinchilla تقول: النموذج وعدد الرموز ينموان بالنسبة نفسها تقريبًا؛ نحو 20 رمزًا لكلّ وسيط.
- ميزانية الحساب ونموذج 7 مليار وسيط جيّد يستوجب حوالي تريليون رمز؛ وهو ما يُترجَم إلى ملايين الدولارات.
- حصّة اللغة في المجموعة تُحدِّد جودة النموذج فيها؛ الجمهور غير الناطق بالإنجليزية يستحقّ تقييمًا مستقلًّا قبل الاعتماد.
الوحدة التالية: كيف نحوّل نموذج التدريب المسبق الخام إلى نموذج يتّبع تعليماتنا بدلًا من إتمام النصوص كيفما اتّفق.