انتقل إلى المحتوى الرئيسي

جارٍ تحميل المختبر المرئي…

#activationالشبكات العصبية

لماذا نحتاج دالة تفعيل؟ ReLU وsigmoid وtanh وLeaky ReLU وGELU وتلاشي التدرج.

ما ستُجرّبه

  1. مرحبًا بك في #activation. على الشاشة، منحنى sigmoid على المجال [-5, 5] ونقطة وردية عند x = 2.5. يحسب العصبون f(Σ w·x + b). من دون f، فإن تكديس عشر طبقات يعادل تركيب عشر دوال خطية… أي دالة خطية واحدة: انحدار عاجز عن فصل XOR. دالة التفعيل هي ما يجعل الشبكة غير خطية.
  2. ادفع النقطة أكثر نحو اليمين: اكتب /x 4. انظر أين تحطّ f(x)، وقبل كل شيء بمقدار كم تحرّكت.
  3. بالنسبة للتعلم، ما يهم ليس f(x) بل f'(x)، أي الميل. هذا ما يضربه الانتشار الخلفي (backpropagation) طبقةً تلو أخرى لإعادة الخطأ إلى الوراء. أظهرها: /derivative.
  4. انتقل إلى ReLU: /function relu. على يمين الصفر، الميل يساوي 1 مهما كانت قيمة x: لا إشباع. هذه التفصيلة أتاحت تدريب AlexNet عام 2012 وأطلقت التعلم العميق من جديد.
  5. لكن ReLU لديها عقب أخيل. ضع النقطة على اليسار: /x -2.
  6. ركّب جميع الدوال الخمس: /compare. لاحظ GELU (بالأزرق الفاتح): ناعمة مثل sigmoid حول الصفر، خطية مثل ReLU على اليمين، وسالبة قليلًا (انخفاض عند -0.17). هذه دالة تفعيل المحولات: BERT وGPT ومعظم نماذج LLM.
  7. دورك: /function gelu ثم /x -0.75 (انخفاض GELU)، /function tanh ثم /x 0 (الميل الأقصى = 1)، /derivative لمقارنة المشتقات الخمس، /reset للبدء من جديد. الخطوة التالية: قناة #gradient-descent، حيث يصبح هذا الميل هو الاتجاه الذي تتحرك فيه الأوزان.

أوامر القناة

  • /function <relu|sigmoid|tanh|leaky|gelu>غيّر دالة التفعيل المرسومة.
  • /x <value -5..5>حرّك النقطة الوردية على طول المنحنى.
  • /derivativeأظهر أو أخفِ منحنى المشتقة f'(x).
  • /compareركّب الدوال الخمس، كل واحدة بلونها الخاص.
  • /resetالعودة إلى sigmoid، x = 2.5، بلا مشتقة وبلا مقارنة.

المسرد

دالة التنشيط
دالة لاخطّية تُطبَّق على المجموع الموزون لعصبون. بدونها ينهار تكديس الطبقات إلى دالة خطّية واحدة: هذا ما يمنح الشبكة قوّتها.
ReLU
max(0, x). ميل 1 يمين الصفر (لا تشبّع)، و0 يساره. سريعة وفعّالة: التنشيط الافتراضي للشبكات العميقة منذ 2012.
Sigmoid
1 / (1 + e^(−x))، الخرج بين 0 و1. تتشبّع عند الطرفين: يقترب الميل من 0 فتُحاصَر الشبكة العميقة. تبقى مفيدة كخرج للاحتمال.
Tanh
الظل الزائدي، خرج بين −1 و1، متمركز عند الصفر (أفضل من sigmoid للطبقات المخفية)، لكنّه يتشبّع أيضًا.
Leaky ReLU
ReLU مع ميل صغير (0.01) يسار الصفر: لا يموت عصبون تمامًا أبدًا، ويمكنه أن يستيقظ.
GELU
تنشيط ناعم x·Φ(x) (Φ = دالة التوزيع التراكمية الغاوسية): قريب من ReLU يمينًا، وسالب قليلًا قرب الصفر. مستعمَل في BERT وGPT ومعظم Transformers.
التشبّع
منطقة تنبطح فيها الدالة: المشتقّة قريبة من الصفر وينقطع تدفّق إشارة التعلّم. تتشبّع sigmoid وtanh عند الأطراف.
تلاشي التدرّج
في الانتشار الخلفي تتضاعف المشتقّات من طبقة إلى أخرى. إذا كانت كلّها 0.1، فإن عشر طبقات تعطي 10⁻¹⁰: الطبقات الأولى لا تتعلّم.
العصبون الميت
عصبون ReLU يكون ما قبل التنشيط لديه سالبًا دومًا: الخرج 0، والتدرّج 0، ولن يستيقظ. يحدّ Leaky ReLU وحسن التهيئة من المشكلة.

قنوات أخرى في الشبكات العصبية

  • #neuronلنفكّك عصبونًا: مداخل، أوزان، مجموع، دالة تفعيل.
  • #dropoutتنظيم dropout: الصديق الأفضل للشبكات العميقة.
  • #activationلماذا نحتاج دالة تفعيل؟ ReLU وsigmoid وtanh وLeaky ReLU وGELU وتلاشي التدرج.
  • #gradient-descentالخسارة تضاريس. يخبرنا التدرج بأي اتجاه هو الأعلى، فنخطو في الاتجاه المعاكس.
  • #backpropagationمخطّط الحسابات يُعاد تشغيله معكوسًا: كل عقدة تستقبل ∂L/∂(نفسها) وقاعدة السلسلة تتكفّل بالباقي.
  • #overfittingنموذج كبير على قليل من النقاط: يلتوي حدّ القرار حتى يحفظ الضجيج عن ظهر قلب.
  • #cnn-filtersالصورة شبكة من الأرقام. مرشّح 3×3 ينزلق فوقها، يضرب، يجمع: هذا هو الالتفاف.
  • #is-it-einsteinهل هذا أينشتاين؟ وجهان يمرّان بماسح شبكة لم تتعلّم سوى أينشتاين: هيثم → لا، أينشتاين → نعم. المشاهدة مجانية؛ التعديل بريميوم.
  • #embeddings-3dالكلمة تصبح متّجهًا: القُرب في الفضاء = القُرب في المعنى، ويمكنك إجراء عمليات حسابية عليها.