#dropout — الشبكات العصبية
تنظيم dropout: الصديق الأفضل للشبكات العميقة.
ما ستُجرّبه
- مرحبًا بك في #dropout. على الشاشة، شبكة MLP صغيرة
2-8-8-1. عند كل تمريرة أمامية (forward pass)، تُطفأ عشوائيًا نسبة من العصبونات المخفية: هذا هو dropout، من أكثر أساليب التنظيم فعاليةً على الإطلاق. - طبّق معدلًا قدره 50%. اكتب
/dropout 0.5. - اسحب قناعًا جديدًا:
/resample. يتغير السحب في كل تمريرة أمامية. هذا ما يمنع الشبكة من الاعتماد المفرط على عصبون واحد. - اختر مجموعة بيانات:
/dataset moons،/dataset circles، أو/dataset xor. سيدفع الضجيج الشبكةَ إلى الإفراط في التوفيق (overfitting) ما لم تتوفر لها شبكة أمان. - لندرّب من دون dropout لنشهد حدوث الإفراط في التوفيق. اضبط المعدل على صفر
/dropout 0، ثم شغّل/train 60. يرسم اللوح الأيمن خسارة التدريب (بالأزرق) وخسارة التحقق (بالبرتقالي). - الآن اضبط
/dropout 0.3وأعد تشغيل/train 60. تنغلق الفجوة بين التدريب والتحقق: يقوم dropout بتنظيم الشبكة من دون تغيير المعمارية إطلاقًا. - العب بحرية:
/dropout 0.7(قوي جدًا، نقص في التوفيق)،/dataset xor،/reset،/resample. ستشرح قناة #gradient-descent لماذا ينجح هذا الأمر رياضيًا.
أوامر القناة
/dropout <0..0.9>— اضبط معدل dropout للطبقات المخفية./resample— اسحب قناعًا جديدًا بجذر عشوائي مختلف./dataset <moons|circles|xor>— غيّر مجموعة البيانات ثنائية الأبعاد./train <epochs=1..200>— درّب شبكة MLP بمعمارية 2-8-8-1 بمعدل dropout الحالي./reset— امسح التدريب وأعد dropout إلى 0.
المسرد
- Dropout
- أثناء التدريب، يُطفَأ كل عصبون مخفي باحتمال p عند كل مثال. لا يعود بمقدو ر الشبكة الاعتماد على عصبون بعينه: تتعلّم سمات مكرّرة وتُعمّم أفضل.
- معدّل Dropout
- احتمال
pإطفاء عصبون (عادةً من 0.2 إلى 0.5). مرتفع جدًا: الشبكة تتوقّف عن التعلّم؛ منخفض جدًا: يزول الأثر. - القناع
- السحب الثنائي (0 أو 1 لكل عصبون) المُطبَّق على طبقة لمثال معيّن. يُسحَب قناع جديد في كل مرور.
- Inverted dropout
- أثناء التدريب، تُقسَم التنشيطات الباقية على
1 − pليتوافق مقياس المُخرَج مع الاستدلال، حيث لا يُطفَأ شيء. - التنظيم
- أيّ تقنية تحدّ من قدرة النموذج على حفظ بيانات التدريب: dropout، عقوبة L2، الإيقاف المبكر، تعزيز البيانات.
- التجميع الضمني
- يعرِّف كل قناع شبكة فرعية مختلفة؛ عند الاستدلال تسلك الشبكة الكاملة سلوك متوسّط تلك الشبكات الفرعية. «تجميع» مجاني.
- خسارة التحقّق
- الخطأ المقيس على بيانات لم تُرَ أثناء التدريب. إذا صعدت بينما تنخفض خسارة التدريب فالنموذج يُفرِط في التخصيص.
- التكيّف المتبادَل
- حين يتعلّم العصبونات تصحيح أخطاء بعضها بعضًا فتصبح عديمة الفائدة وحدها. يكسره Dropout بجعل كل جار غير موثوق.
قنوات أخرى في الشبكات العصبية
- #neuron — لنفكّك عصبونًا: مداخل، أوزان، مجموع، دالة تفعيل.
- #dropout — تنظيم dropout: الصديق الأفضل للشبكات العميقة.
- #activation — لماذا نحتاج دالة تفعيل؟ ReLU وsigmoid وtanh وLeaky ReLU وGELU وتلاشي التدرج.
- #gradient-descent — الخسارة تضاريس. يخبرنا التدرج بأي اتجاه هو الأعلى، فنخطو في الاتجاه المعاكس.
- #backpropagation — مخطّط الحسابات يُعاد تشغيله معكوسًا: كل عقدة تستقبل ∂L/∂(نفسها) وقاعدة السلسلة تتكفّل بالباقي.
- #overfitting — نموذج كبير على قليل من النقاط: يلتوي حدّ القرار حتى يحفظ الضجيج عن ظهر قلب.
- #cnn-filters — الصورة شبكة من الأرقام. مرشّح 3×3 ينزلق فوقها، يضرب، يجمع: هذا هو الالتفاف.
- #is-it-einstein — هل هذا أينشتاين؟ وجهان يمرّان بماسح شبكة لم تتعلّم سوى أينشتاين: هيثم → لا، أينشتاين → نعم. المشاهدة مجانية؛ التعديل بريميوم.
- #embeddings-3d — الكلمة تصبح متّجهًا: القُرب في الفضاء = القُرب في المعنى، ويمكنك إجراء عمليات حسابية عليها.