انتقل إلى المحتوى الرئيسي

المراجعة والاختبار النهائي

عشر وحدات للانتقال من نقد الشبكات التكرارية إلى Transformer كامل مُدرَّب على ترجمة تواريخ. هذه هي الدورة مُكثَّفة، ثمّ الخيوط التي تعبرها، ثمّ ما ينتظرك في الامتحان.

الدورة في لمحة

الوحدةالجوهر الواجب حفظه
1. حدود التكرارالتسلسل يُقيّد الموازاة؛ Bahdanau فتح الانتباه، Vaswani استبدل التكرار بالكامل
2. QKVجداء نقطي، قسمة على dk\sqrt{d_k}، softmax، متوسط موزون؛ فصل الأدوار الثلاثة هو المفتاح
3. رؤوس متعدّدةتقسيم البُعد لا زيادته؛ dk=dmodel/hd_k = d_{\text{model}}/h يحفظ الكلفة ويُنوّع العلاقات
4. ترميز الموضعالانتباه يجهل الترتيب؛ الجيبي بلا معاملات، RoPE داخل الانتباه هو افتراض 2024
5. متبقّي وطبقيpre-norm افتراض للأعماق الكبيرة؛ LayerNorm مستقلّ عن الحزمة عكس BatchNorm
6. BERTمرمّز ثنائي الاتّجاه، MLM على 15% من الجتونات؛ CLS للتصنيف، الجتونات كلّها للاستخراج
7. GPTقناع سببي واحد يُحوّل الكتلة إلى مولّد؛ KV cache يُحوّل O(n2)O(n^2) إلى O(n)O(n) لكلّ خطوة
8. T5انتباه متقاطع، «كلّ شيء نصّ إلى نصّ»؛ الاختيار بين العائلات يعتمد على شكل المهمّة
9. الكلفة التربيعيةمصفوفة الأوزان n2n^2 هي العنق؛ FlashAttention يُلغي تخزينها، الأنماط الإفرادية تُبدّل الاعتماد البعيد بالذاكرة
10. تنفيذ كاملجمع الكتل الست في 150 سطرًا؛ اختبر الأشكال، ثمّ درِّب على مهمّة لعبة قبل الحقيقيّة

الخيوط التي تعبر الدورة

الانتباه أرخص من التكرار لأنّه موازٍ. كلّ الفرق بين شبكة تكرارية وTransformer يعود إلى هذا التبديل: الحساب التسلسلي يُهدر مسرّعات الرسوميات، والانتباه لا. من هنا جاءت كلّ ثورة النماذج الضخمة. لكنّ ثمن الموازاة مصفوفة n×nn \times n في كلّ طبقة، وهذا الثمن هو ما فتح موضوع الوحدة 9. المفاضلة بين الموازاة الكاملة، والانتباه الفعّال، وأنماط الإفراد، مفاضلة يومية حين تختار المعمارية لمشروع طول سياقه غير محسوم.

كلّ الأنواع الثلاثة كتلة واحدة بتوصيلات مختلفة. المرمّز، وفاكّ الترميز، وencoder-decoder ليست معماريّات متمايزة: بل نفس كتلة MultiHeadAttention+FFN\text{MultiHeadAttention} + \text{FFN}، مع اختلاف واحد جوهري في من يستعلم من. الانتباه الذاتي في BERT (Q=K=V=xQ=K=V=x)، الانتباه الذاتي المقنَّع في GPT (نفس الشيء مع قناع سببي)، الانتباه المتقاطع في T5 (QQ من فاكّ الترميز، K,VK, V من المرمّز). حين تُوعي هذا، تنتقل بين النماذج دون أن تُعيد تعلّم الشيفرة.

التدريب والاستدلال نظامان متمايزان، والقناع السببي بمفرده يُوجَّل تلقائيًّا. أخطر عيب صامت في هذه الدورة: نسيان القناع السببي في التدريب. الخسارة تنهار، لكنّ التوليد يعطي هراءً. لا يوجد استثناء يُرفع، ولا رسالة تحذير: فقط نموذج يبدو أنّه يعمل ثمّ لا يعمل. نفس المنطق يطبَّق على model.eval() أثناء التوليد (يعطّل الإسقاط) وعلى torch.no_grad() (يوفّر ذاكرة كبيرة). هذه ليست تفاصيل: بل نصف الأعطال العمليّة.

الاختيار بين العائلات يعتمد على شكل المهمّة لا على الحداثة. رفض جديد لعرض قديم في مجالنا: «GPT-4 يحلّ كلّ شيء». نظريًّا، صحيح. عمليًّا، على مهمّة تصنيف نصوص فرنسيّة، CamemBERT بحجم 110 مليون معامل يفوز على GPT-3.5 في الدقّة والسرعة والكلفة. على تلخيص عربي، mBART أو AraT5 يفوقان GPT-3.5. النموذج المخصّص يفوز حين تكون بياناتك متوفّرة. النماذج الكبيرة العامّة تكسب حين لا تكون.

الامتحان النهائي

يتضمّن الامتحان 40 سؤالًا تشمل الوحدات العشر: حساب الانتباه بيدك على 3 جتونات، وتحديد أبعاد الرؤوس عند تغيير dmodeld_{\text{model}}، وقراءة نتيجة softmax مطبَّق على المحور الخطأ، واختيار العائلة (encoder، decoder، encoder-decoder) حسب المهمّة، وتشخيص نسيان القناع السببي، وتقدير ذاكرة الانتباه حسب nn، والتمييز بين LayerNorm وBatchNorm، وقرار متى تُشغّل FlashAttention.

تعرض عدّة أسئلة حالات للتشخيص: نموذج يعطي خسارة تدريب صفر ولا يُنتج شيئًا مفيدًا في التوليد؛ مصفوفة انتباه مستوية تدلّ على dk\sqrt{d_k} منسيّة؛ نموذج يعمل حتى 512 جتونًا ثمّ ينهار بعد ذلك بسبب مواضع مُتعلَّمة؛ استدلال أبطأ 20 مرّة على 2048 جتون بلا KV cache؛ خطأ خارج الذاكرة على 8192 جتون بلا FlashAttention. المُقيَّم هنا هو الحكم، لا استظهار توقيعات الواجهة.

في حال النجاح، تُمنح شهادة الإتمام فورًا؛ ورقمها قابل للتحقّق من أيّ طرف على المنصّة.

قبل أن تبدأ

استعِد الجدول أعلاه، واسأل نفسك عن كلّ سطر: «ما العَرَض الذي سأراه لو أخطأت هنا؟». فإن عرفتَ أن تشرح لماذا تنهار softmax على أبعاد كبيرة بلا dk\sqrt{d_k}، ولماذا لا يستطيع فاكّ الترميز أن يقرأ مستقبله، ولماذا يعمل التوليد أضعاف بلا KV cache، ولماذا يفشل نموذج مواقع مُتعلَّمة خارج طول تدريبه، فأنت مستعدّ. حظًّا موفّقًا!

الامتحان النهائي

هل أنت مستعدّ لاعتماد هذه الدورة؟

40 سؤالًا تُختار عشوائيًّا من بنك أسئلة الدورة · حدّ النجاح 70 % · شهادة PDF قابلة للتحقّق تُصدَر فورًا عند النجاح.

ابدأ الامتحان

يلزم تسجيل الدخول إلى حسابك في InSkillML مع اشتراك نشط. يمكنك أيضًا بدء الامتحان من دوراتي.