#activation — الشبكات العصبية
لماذا نحتاج دالة تفعيل؟ ReLU وsigmoid وtanh وLeaky ReLU وGELU وتلاشي التدرج.
ما ستُجرّبه
- مرحبًا بك في #activation. على الشاشة، منحنى
sigmoidعلى المجال [-5, 5] ونقطة وردية عندx = 2.5. يحسب العصبونf(Σ w·x + b). من دون f، فإن تكديس عشر طبقات يعادل تركيب عشر دوال خطية… أي دالة خطية واحدة: انحدار عاجز عن فصل XOR. دالة التفعيل هي ما يجعل الشبكة غير خطية. - ادفع النقطة أكثر نحو اليمين: اكتب
/x 4. انظر أين تحطّf(x)، وقبل كل شيء بمقدار كم تحرّكت. - بالنسبة للتعلم، ما يهم ليس
f(x)بل f'(x)، أي الميل. هذا ما يضربه الانتشار الخلفي (backpropagation) طبقةً تلو أخرى لإعادة الخطأ إلى الوراء. أظهرها:/derivative. - انتقل إلى ReLU:
/function relu. على يمين الصفر، الميل يساوي 1 مهما كانت قيمة x: لا إشباع. هذه التفصيلة أتاحت تدريب AlexNet عام 2012 وأطلقت التعلم العميق من جديد. - لكن ReLU لديها عقب أخيل. ضع النقطة على اليسار:
/x -2. - ركّب جميع الدوال الخمس:
/compare. لاحظ GELU (بالأزرق الفاتح): ناعمة مثل sigmoid حول الصفر، خطية مثل ReLU على اليمين، وسالبة قليلًا (انخفاض عند -0.17). هذه دالة تفعيل المحولات: BERT وGPT ومعظم نماذج LLM. - دورك:
/function geluثم/x -0.75(انخفاض GELU)،/function tanhثم/x 0(الميل الأقصى = 1)،/derivativeلمقارنة المشتقات الخمس،/resetللبدء من جديد. الخطوة التالية: قناة #gradient-descent، حيث يصبح هذا الميل هو الاتجاه الذي تتحرك فيه الأوزان.
أوامر القناة
/function <relu|sigmoid|tanh|leaky|gelu>— غيّر دالة التفعيل المرسومة./x <value -5..5>— حرّك النقطة الوردية على طول المنحنى./derivative— أظهر أو أخفِ منحنى المشتقة f'(x)./compare— ركّب الدوال الخمس، كل واحدة بلونها الخاص./reset— العودة إلى sigmoid، x = 2.5، بلا مشتقة وبلا مقارنة.
المسرد
- دالة التنشيط
- دالة لاخطّية تُطبَّق على المجموع الموزون لعصبون. بدونها ينهار تكديس الطبقات إلى دالة خطّية واحدة: هذا ما يمنح الشبكة قوّتها.
- ReLU
max(0, x). ميل 1 يمين الصفر (لا تشبّع)، و0 يساره. سريعة وفعّالة: التنشيط الافتراضي للشبكات العميقة منذ 2012.- Sigmoid
1 / (1 + e^(−x))، الخرج بين 0 و1. تتشبّع عند الطرفين: يقترب الميل من 0 فتُحاصَر الشبكة العميقة. تبقى مفيدة كخرج للاحتمال.- Tanh
- الظل الزائدي، خرج بين −1 و1، متمركز عند الصفر (أفضل من sigmoid للطبقات المخفية)، لكنّه يتشبّع أيضًا.
- Leaky ReLU
- ReLU مع ميل صغير (0.01) يسار الصفر: لا يموت عصبون تمامًا أبدًا، ويمكنه أن يستيقظ.
- GELU
- تنشيط ناعم
x·Φ(x)(Φ = دالة التوزيع التراكمية الغاوسية): قريب من ReLU يمينًا، وسالب قليلًا قرب الصفر. مستعمَل في BERT وGPT ومعظم Transformers. - التشبّع
- منطقة تنبطح فيها الدالة: المشتقّة قريبة من الصفر وينقطع تدفّق إشارة التعلّم. تتشبّع sigmoid وtanh عند الأطراف.
- تلاشي التدرّج
- في الانتشار الخلفي تتضاعف المشتقّات من طبقة إلى أخرى. إذا كانت كلّها 0.1، فإن عشر طبقات تعطي 10⁻¹⁰: الطبقات الأولى لا تتعلّم.
- العصبون الميت
- عصبون ReLU يكون ما قبل التنشيط لديه سالبًا دومًا: الخرج 0، والتدرّج 0، ولن يستيقظ. يحدّ Leaky ReLU وحسن التهيئة من المشكلة.
قنوات أخرى في الشبكات العصبية
- #neuron — لنفكّك عصبونًا: مداخل، أوزان، مجموع، دالة تفعيل.
- #dropout — تنظيم dropout: الصديق الأفضل للشبكات العميقة.
- #activation — لماذا نحتاج دالة تفعيل؟ ReLU وsigmoid وtanh وLeaky ReLU وGELU وتلاشي التدرج.
- #gradient-descent — الخسارة تضاريس. يخبرنا التدرج بأي اتجاه هو الأعلى، فنخطو في الاتجاه المعاكس.
- #backpropagation — مخطّط الحسابات يُعاد تشغيله معكوسًا: كل عقدة تستقبل ∂L/∂(نفسها) وقاعدة السلسلة تتكفّل بالباقي.
- #overfitting — نموذج كبير على قليل من النقاط: يلتوي حدّ القرار حتى يحفظ الضجيج عن ظهر قلب.
- #cnn-filters — الصورة شبكة من الأرقام. مرشّح 3×3 ينزلق فوقها، يضرب، يجمع: هذا هو الالتفاف.
- #is-it-einstein — هل هذا أينشتاين؟ وجهان يمرّان بماسح شبكة لم تتعلّم سوى أينش تاين: هيثم → لا، أينشتاين → نعم. المشاهدة مجانية؛ التعديل بريميوم.
- #embeddings-3d — الكلمة تصبح متّجهًا: القُرب في الفضاء = القُرب في المعنى، ويمكنك إجراء عمليات حسابية عليها.