انتقل إلى المحتوى الرئيسي

الوحدة 3 — الضبط الكامل وكلفته الحقيقية

قبل الحديث عن LoRA وQLoRA، من الضروري فهم لماذا لم يعد الضبط الكامل (تحديث كلّ معامل من معاملات النموذج) هو الخيار الافتراضي. الجواب في ثلاثة أرقام: الذاكرة اللازمة، والزمن، والمخاطر التي يجرّها. سنحسب هذه الأرقام على نموذج بسبعة مليارات معامل، وهو حجم بلغ في 2026 نقطة التوازن الشائعة.

من أين تأتي متطلّبات الذاكرة؟

عند تدريب نموذج، ذاكرة وحدة المعالجة الرسومية تخزّن أربعة أشياء متمايزة، كلّ منها ثقيل بحدّ ذاته:

  1. أوزان النموذج نفسها.
  2. التدرّجات (gradients): لكلّ وزن تدرّج مقابل.
  3. حالات المُستمثِل (optimizer states): Adam يحتفظ بمتوسّطات المتحرّكة للتدرّجات وللتدرّجات المربّعة، أي متغيّرَين إضافيَّين لكلّ وزن.
  4. التفعيلات المتوسّطة (activations): مخرجات كلّ طبقة، ضرورية للانتشار الخلفي.

سنمرّ عليها واحدة واحدة على نموذج بسبعة مليارات معامل بدقّة نصف (FP16 أو BF16، أي 2 بايت لكلّ رقم).

حساب مفصّل لنموذج بسبعة مليارات

الأوزان: 7×109×2=147 \times 10^9 \times 2 = 14 غيغا بايت.

التدرّجات: بالحجم نفسه: 1414 غيغا بايت.

حالات المُستمثِل Adam: هنا المفاجأة. Adam يحتفظ بمتوسّطي مرتبة أولى وثانية، ودائمًا في FP32 حتّى ضمن تدريب مختلط الدقّة، لضمان الاستقرار العددي. أي: 2×7×109×4=562 \times 7 \times 10^9 \times 4 = 56 غيغا بايت. تُضاف إلى ذلك نسخة FP32 من الأوزان للتحديث الدقيق: 2828 غيغا بايت أخرى.

التفعيلات: تعتمد على حجم الدفعة وطول التسلسل. لدفعة من 4 مع طول 2048 رمزًا، تقدَّر بحدود 1010 إلى 2020 غيغا بايت.

المجموع التقريبي: 14+14+56+28+15=12714 + 14 + 56 + 28 + 15 = 127 غيغا بايت. هذا يستلزم على الأقلّ أربع بطاقات A100 بسعة 40 غيغا بايت أو بطاقتَي H100 بسعة 80 غيغا بايت، أي عتاد مركز بيانات لا يتوفّر لفريق متوسّط.

الصيغة العامّة

للاختصار في ذهنك، لكلّ مليار معامل:

ذاكرة (غيغا)2+2+8+4=16\text{ذاكرة (غيغا)} \approx 2 + 2 + 8 + 4 = 16

أي 16 غيغا بايت لكلّ مليار عند التدريب الكامل بـAdam. نموذج 13 مليار يستلزم إذن حوالي 208 غيغا بايت، ونموذج 70 مليار يتجاوز التيرابايت الواحد — وهنا يصير التدريب مشروع مركز بيانات لا مشروع فريق.

المُستمثِلات الموفّرة للذاكرة

جزئيًّا، يمكن تخفيف الفاتورة:

  • SGD مع Momentum: يحتفظ بمتوسّط مرتبة واحدة فقط، لا اثنين. يوفّر نحو 30 غيغا على نموذج 7 مليار، لكنّه أبطأ في التقارب.
  • Adafactor: يحلّ محلّ المتوسّطات الكاملة بتقريب عاملي رتبته 1، مما يخفّض حالات المُستمثِل إلى بضعة غيغا فقط.
  • DeepSpeed ZeRO Stage 3: يقسّم الأوزان والتدرّجات وحالات المُستمثِل بين بطاقات متعدّدة، فيصبح كلّ بطاقة تحمل جزءًا فقط.

هذه الحلول تُبقي الضبط الكامل ممكنًا، لكنّها لا تجعله رخيصًا.

النسيان الكارثي

المشكلة الثانية أعمق من الذاكرة، وهي النسيان الكارثي (catastrophic forgetting): عند تدريب نموذج على مهمّة جديدة بأوزانه الكاملة، يميل إلى فقدان كفاءاته السابقة. نموذج مُدرَّب على تلخيص اجتماعات قد يصبح ضعيفًا في الحساب أو في الترجمة.

سبب ذلك أنّ الأوزان الحاملة للكفاءات الأصلية تُعدَّل هي أيضًا، والأمثلة الجديدة (ألفَي محضر) لا تحوي إشارة تُبقي على تلك الكفاءات. النتيجة: نموذج ممتاز في المهمّة الجديدة، رديء في كلّ ما سواها. هذه المشكلة أقلّ حدّة بكثير مع PEFT، حيث تُجمَّد أوزان النموذج الأصلي.

متى يظلّ الضبط الكامل مبرَّرًا؟

رغم كلّ هذا، ثمّة حالات ضيّقة يبقى فيها الضبط الكامل الخيار الصائب:

  • نماذج صغيرة: أقلّ من مليار معامل، حيث الفاتورة تبقى في متناول بطاقة واحدة.
  • تخصّص كامل: النموذج مخصَّص كلّيًّا لمجال ضيّق (طبّ، قانون) والنسيان الكارثي مقبول لأنّ الكفاءات العامّة لا تهمّ.
  • نتيجة قصوى: بحث علمي يقارن سقوف الأداء دون قيد ميزانية.
  • بنى جديدة: نموذج جديد كلّيًّا، حيث لا محوّلات جاهزة.

خارج هذه الحالات، الضبط الكامل في 2026 قرار غير مبرَّر تقنيًّا واقتصاديًّا.

قاعدة يومية

اضرب عدد المعاملات (بالمليار) في 16 لتحصل على الحدّ الأدنى التقريبي لذاكرة الضبط الكامل بـAdam بالغيغا. إذا كان الرقم أكبر من ذاكرة عتادك، اقفز مباشرة إلى LoRA.

الفخّ الشائع

كثير من الأدلّة القديمة توحي بأنّ نموذج 7B «يمكن ضبطه على A100 واحدة». هذا صحيح فقط للـاستدلال، لا للضبط الكامل. للتدريب، أعد الحساب دائمًا.

الخلاصة

  • الضبط الكامل لنموذج بسبعة مليارات معامل يستلزم نحو 127 غيغا بايت من ذاكرة GPU، أي عتاد مركز بيانات، لا حاسب فريق.
  • Adam مسؤول عن أكثر من نصف هذه الفاتورة عبر حالاته المُخزَّنة في FP32.
  • النسيان الكارثي يُتلف كفاءات النموذج الأصلي، وهو ما يجعل الضبط الكامل مخاطرة مضاعفة.
  • الحالات التي تُبرّر الضبط الكامل ضيّقة: نماذج صغيرة، تخصّص كامل، ميزانية بحثية، أو بنى جديدة كلّيًّا.

في الوحدة التالية: عائلة PEFT (Parameter-Efficient Fine-Tuning) وكيف تلتفّ حول هذه القيود بتجميد معظم الأوزان.