#alignment-rlhf — نماذج LLM وTransformers
المحاذاة وRLHF: تعلّم ما يفضّله البشر.
ما ستُجرّبه
- مرحبًا بك في #alignment-rlhf. على الشاشة، 12 إجابة يمكن للنموذج الأساسي أن يقدّمها عن سؤال «كيف أنام جيدًا؟»، موزّعة على قوس: حجم الفقاعة يعكس احتمال أن ينتجها النموذج، وهي رمادية لأنه لا يوجد بعد نموذج مكافأة. النموذج الأساسي يعرف الكتابة، لا الإرضاء: قد ينتج «نم فحسب» بنفس السهولة التي ينتج بها نصيحة حقيقية. RLHF (التعلّم المعزّز من التغذية الراجعة البشرية) يصلح ذلك في ثلاث مراحل: جمع تفضيلات بشرية بين أزواج من الإجابات، تدريب نموذج مكافأة يحاكي هذه التفضيلات، ثم تحسين السياسة لتعظيم هذه المكافأة تحت حاجز KL. الحدود الملوّنة حول الفقاعات هي غشّ بيداغوجي مخصّص لك: أخضر = إجابة مفيدة فعلًا، أحمر = إجابة خطيرة. نموذج المكافأة نفسه لن يراها أبدًا.
- المرحلة الأولى: جمع التفضيلات. اكتب
/compare: يولّد النموذج الأساسي إجابتَين، A وB، عليك أن تقارن بينهما. - اقرأ A وB، ثم قل أيّهما تفضّل:
/prefer aأو/prefer b. أنت لا تكتب الإجابة الصحيحة، ولا تعطي علامة من 10: أنت تختار بين اثنتين. هذا بالضبط عمل المُقيِّمين في RLHF، يُكرَّر عشرات الآلاف من المرّات. - زوج واحد لا يكفي. اكتب
/auto 20: يقوم قاضٍ محاكاة، يقارن بناءً على الفائدة والسلامة الحقيقيتَين للإجابات (مع بعض التشويش)، بحسم 20 زوجًا جديدًا مسحوبة من النموذج الأساسي. - المرحلة الثانية: اكتب
/rewardلتدريب نموذج المكافأة على هذه الأزواج. هو لا يرى الفائدة ولا السلامة: فقط ثلاث سمات سطحية — الطول، الكلمات الإيجابية، المؤشرات الملموسة (أرقام، مدد). يتعلّمr(x) = w · f(x)بحيث تتطابقP(a ≻ b) = σ(r(a) − r(b))مع الأحكام: هذا نموذج Bradley-Terry. - المرحلة الثالثة: تحسين السياسة. اكتب
/step 30: 30 تكرارًا لـlogits ← logits + lr · (r − r̄ − β · (log π − log π₀)). الحدّ β هو عقوبة KL: يُبقي السياسة قريبة من النموذج الأساسي π₀ (β = 0.5 الآن). - ماذا لو أزلنا الحاجز؟ اكتب
/kl 0: β = 0، لا مزيد من العقوبة. ستكون السياسة حرّة في تعظيم المكافأة دون أن تسأل من أين تأتي الإجابات. - أعد تشغيل التحسين:
/step 50. راقب الإجابة 11 («7 نصائح مذهلة»)، مؤشّر KL، شريط الطول والفائدة الحقيقية المتوقّعة. - دورك:
/answer 11لقراءة الإجابة الفائزة وسماتها الخفية؛/sampleلسحب إجابة وفق السياسة الحالية؛/compareثم حكم لرؤية ما تقدّمه السياسة المنحرفة الآن للقضاة؛/auto 40ثم/rewardلتصحيح نموذج المكافأة بأزواج مسحوبة من السياسة المنحرفة (RLHF متكرّر)؛/kl 0.5ثم/step 50لمشاهدة العقوبة تشدّ السياسة إلى الإجابات الجيّدة؛/lr 0.1لتحسين ألطف؛/resetللبدء من جديد. المحطّة التالية: #multi-armed-bandit، أوّل قناة في محور التعلّم المعزّز، حيث تلتقي بالاستكشاف والاستغلال، أساس كل طرق التعلّم القائمة على المكافأة.
أوامر القناة
/compare— يسحب إجابتَين من السياسة الحالية: زوج A / B للتقييم./prefer <a|b>— يسجّل حكمك على الزوج الحالي: a أو b./auto <5..40>— يضيف n حكمًا مُحاكًى: أزواج مسحوبة من السياسة، يحسمها القاضي (الفائدة + السلامة، مع تشويش)./reward— يعيد تدريب نموذج المكافأة الخطّي (Bradley-Terry) على كل زوج مُقيَّم./step <1..50>— n تكرار لتحسين السياسة: logits ← logits + lr·(r − r̄ − β·(log π − log π₀))./kl <0..1>— المعامل β لعقوبة KL: القوّة التي تشدّ السياسة نحو النموذج الأساسي./lr <0.01..1>— معدّل التعلّم لتحسين السياسة./answer <1..12>— يُبرز إجابة واحدة (حلقة بيضاء) ويكشف ما يراه نموذج المكافأة… وما لا يراه./sample— يسحب إجابة واحدة من السياسة الحالية ويعرضها كاملة./reset— يعود إلى النموذج الأساسي: بلا أزواج، نموذج مكافأة جديد، β = 0.5، lr = 0.5.
المسرد
- المحاذاة (alignment)
- جعل النموذج يفعل ما يريده مستخدموه فعلًا — مفيد، صادق، آمن — لا فقط ما يقيسه هدفه التدريبي. النموذج الأساسي يتنبّأ بالكلمة التالية؛ المحاذاة تحوّله إلى مساعد. RLHF هو الوصفة الأكثر انتشارًا لذلك.
- RLHF
- التعلّم المعزّز من التغذية الراجعة البشرية: (1) يقارن البشر أزواجًا من الإجابات، (2) يتعلّم نموذج مكافأة محاكاة هذه التفضيلات، (3) تُحسَّن السياسة (النموذج اللغوي) لتعظيم هذه المكافأة تحت عقوبة KL. هذا ما حوّل GPT-3 إلى ChatGPT.
- نموذج المكافأة (reward model)
- نموذج يمنح إجابةً درجةً
r(x)، مُدرَّب على إعادة إنتاج التفضيلات البشرية. يحلّ محلّ القاضي البشري خلال التحسين، حيث يجب تسجيل الملايين من الإجابات. هنا هو خطّي على ثلاث سمات سطحية؛ عمليًا هو LLM ذو رأ س عدديّ. إنه وكيل: موثوق قرب البيانات التي رآها، غير موثوق في غيرها. - التفضيلات الزوجية (Bradley-Terry)
- بدلًا من درجة مطلقة، نسأل القاضي «A أم B؟». يربط نموذج Bradley-Terry هذا الخيار بالدرجات:
P(a ≻ b) = σ(r(a) − r(b)). تدريب نموذج المكافأة يعود إلى تعظيم أرجحية الأحكام المرصودة. المقارنات أكثر موثوقية وأكثر اتّساقًا بين المُقيِّمين من العلامات من 1 إلى 10. - السياسة (LLM)
- في التعلّم المعزّز، السياسة
πهي ما يختار الأفعال؛ في RLHF، هي النموذج اللغوي نفسه: توزيع على الإجابات الممكنة. هنا، softmax على 12 إجابة. النموذج الأساسيπ₀هو السياسة الابتدائية، تُحفظ مجمّدة كمرجع. - PPO
- Proximal Policy Optimization (التحسين المقارَب للسياسة): أشهر خوارزمية تعلّم معزّز للمرحلة الثالثة من RLHF. تصعد بتدرّج المكافأة المتوقّعة مع تقييد حجم كل خطوة (نسبة احتمال محدودة). النسخة المبسّطة في هذه القناة تحتفظ بالأساسي:
logits ← logits + lr · (r − r̄ − β · (log π − log π₀))، حيثr̄هو متوسّط المكافأة (خطّ أساس). - عقوبة KL
- حدّ
β · KL(π ‖ π₀)يُطرح من المكافأة: يُعاقب السياسة حين تبتعد عن النموذج الأساسي. بدونه، تندفع السياسة نحو إجابات يُبالغ نموذج المكافأة في تقديرها دون أن يراها. نقطة الاتّزان هيπ ∝ π₀ · exp(r / β): β كبير = حذر، β صغير = جريء، β = 0 = لا حاجز. - اختراق المكافأة (reward hacking)
- تجد السياسة إجابات تحصد مكافأة عالية دون أن تحقّق النيّة الكامنة خلفها (قانون Goodhart). هنا: إجابات طويلة تملّقية مليئة بالأرقام، يبالغ نموذج المكافأة في تقديرها بالاستقراء، بينما فائدتها الحقيقية منخفضة. عقوبة KL ونموذج مكافأة يُعاد تدريبه بانتظام على السياسة الحالية هما العلاجان الكلاسيكيّان.
- التملّق (sycophancy)
- ميل النموذج المُحاذَى بـRLHF إلى مجاملة المستخدم، والاتّفاق مع آرائه، وتلطيف إجاباته، لأن القضاة البشر فضّلوا هذه النبرة قليلًا فضخّمها نموذج المكافأة. حالة خاصة من اختراق المكافأة، مرئية هنا في إجابات «سؤال ممتاز!».
- DPO وRLAIF وConstitutional AI
- ثلاث نُسَخ من RLHF. DPO (Direct Preference Optimization) يتخطّى نموذج المكافأة وخوارزمية التعلّم المعزّز: خسارة مباشرة على الأزواج المفضَّلة تضبط السياسة، مع الشدّ الضمني نفسه نحو π₀. RLAIF يستبدل القضاة البشر بـLLM يطبّق قائمة مبادئ — «دستور» Constitutional AI من Anthropic — لإنتاج تفضيلات على نطاق واسع.
قنوات أخرى في نماذج LLM وTransformers
- #tokenization — التقطيع وBPE: كيف يُقطِّع نموذج LLM النص.
- #attention — الانتباه الذاتي: كل كلمة تنظر إلى الأخريات.
- #transformer-block — كتلة المحوّل: الانتباه، الوصلات التجاوزية، التسوية، شبكة FFN.
- #generation-temperature — التوليد: الحرارة وtop-k وtop-p.
- #rag — RAG: الإجابة انطلاقًا من وثائقك.
- #alignment-rlhf — المحاذاة وRLHF: تعلّم ما يفضّله البشر.