انتقل إلى المحتوى الرئيسي

جارٍ تحميل المختبر المرئي…

#dropoutالشبكات العصبية

تنظيم dropout: الصديق الأفضل للشبكات العميقة.

ما ستُجرّبه

  1. مرحبًا بك في #dropout. على الشاشة، شبكة MLP صغيرة 2-8-8-1. عند كل تمريرة أمامية (forward pass)، تُطفأ عشوائيًا نسبة من العصبونات المخفية: هذا هو dropout، من أكثر أساليب التنظيم فعاليةً على الإطلاق.
  2. طبّق معدلًا قدره 50%. اكتب /dropout 0.5.
  3. اسحب قناعًا جديدًا: /resample. يتغير السحب في كل تمريرة أمامية. هذا ما يمنع الشبكة من الاعتماد المفرط على عصبون واحد.
  4. اختر مجموعة بيانات: /dataset moons، /dataset circles، أو /dataset xor. سيدفع الضجيج الشبكةَ إلى الإفراط في التوفيق (overfitting) ما لم تتوفر لها شبكة أمان.
  5. لندرّب من دون dropout لنشهد حدوث الإفراط في التوفيق. اضبط المعدل على صفر /dropout 0، ثم شغّل /train 60. يرسم اللوح الأيمن خسارة التدريب (بالأزرق) وخسارة التحقق (بالبرتقالي).
  6. الآن اضبط /dropout 0.3 وأعد تشغيل /train 60. تنغلق الفجوة بين التدريب والتحقق: يقوم dropout بتنظيم الشبكة من دون تغيير المعمارية إطلاقًا.
  7. العب بحرية: /dropout 0.7 (قوي جدًا، نقص في التوفيق)، /dataset xor، /reset، /resample. ستشرح قناة #gradient-descent لماذا ينجح هذا الأمر رياضيًا.

أوامر القناة

  • /dropout <0..0.9>اضبط معدل dropout للطبقات المخفية.
  • /resampleاسحب قناعًا جديدًا بجذر عشوائي مختلف.
  • /dataset <moons|circles|xor>غيّر مجموعة البيانات ثنائية الأبعاد.
  • /train <epochs=1..200>درّب شبكة MLP بمعمارية 2-8-8-1 بمعدل dropout الحالي.
  • /resetامسح التدريب وأعد dropout إلى 0.

المسرد

Dropout
أثناء التدريب، يُطفَأ كل عصبون مخفي باحتمال p عند كل مثال. لا يعود بمقدور الشبكة الاعتماد على عصبون بعينه: تتعلّم سمات مكرّرة وتُعمّم أفضل.
معدّل Dropout
احتمال p إطفاء عصبون (عادةً من 0.2 إلى 0.5). مرتفع جدًا: الشبكة تتوقّف عن التعلّم؛ منخفض جدًا: يزول الأثر.
القناع
السحب الثنائي (0 أو 1 لكل عصبون) المُطبَّق على طبقة لمثال معيّن. يُسحَب قناع جديد في كل مرور.
Inverted dropout
أثناء التدريب، تُقسَم التنشيطات الباقية على 1 − p ليتوافق مقياس المُخرَج مع الاستدلال، حيث لا يُطفَأ شيء.
التنظيم
أيّ تقنية تحدّ من قدرة النموذج على حفظ بيانات التدريب: dropout، عقوبة L2، الإيقاف المبكر، تعزيز البيانات.
التجميع الضمني
يعرِّف كل قناع شبكة فرعية مختلفة؛ عند الاستدلال تسلك الشبكة الكاملة سلوك متوسّط تلك الشبكات الفرعية. «تجميع» مجاني.
خسارة التحقّق
الخطأ المقيس على بيانات لم تُرَ أثناء التدريب. إذا صعدت بينما تنخفض خسارة التدريب فالنموذج يُفرِط في التخصيص.
التكيّف المتبادَل
حين يتعلّم العصبونات تصحيح أخطاء بعضها بعضًا فتصبح عديمة الفائدة وحدها. يكسره Dropout بجعل كل جار غير موثوق.

قنوات أخرى في الشبكات العصبية

  • #neuronلنفكّك عصبونًا: مداخل، أوزان، مجموع، دالة تفعيل.
  • #dropoutتنظيم dropout: الصديق الأفضل للشبكات العميقة.
  • #activationلماذا نحتاج دالة تفعيل؟ ReLU وsigmoid وtanh وLeaky ReLU وGELU وتلاشي التدرج.
  • #gradient-descentالخسارة تضاريس. يخبرنا التدرج بأي اتجاه هو الأعلى، فنخطو في الاتجاه المعاكس.
  • #backpropagationمخطّط الحسابات يُعاد تشغيله معكوسًا: كل عقدة تستقبل ∂L/∂(نفسها) وقاعدة السلسلة تتكفّل بالباقي.
  • #overfittingنموذج كبير على قليل من النقاط: يلتوي حدّ القرار حتى يحفظ الضجيج عن ظهر قلب.
  • #cnn-filtersالصورة شبكة من الأرقام. مرشّح 3×3 ينزلق فوقها، يضرب، يجمع: هذا هو الالتفاف.
  • #is-it-einsteinهل هذا أينشتاين؟ وجهان يمرّان بماسح شبكة لم تتعلّم سوى أينشتاين: هيثم → لا، أينشتاين → نعم. المشاهدة مجانية؛ التعديل بريميوم.
  • #embeddings-3dالكلمة تصبح متّجهًا: القُرب في الفضاء = القُرب في المعنى، ويمكنك إجراء عمليات حسابية عليها.