الوحدة 6 — GRU: تبسيط فعّال
طوَت LSTM سبع عشرة سنة من الهيمنة على المتتاليات قبل أن تُقتَرَح GRU (Gated Recurrent Unit) عام 2014 من فريق يوشوا بنجيو. الفكرة كانت جريئة: هل تحتاج فعلًا إلى ثلاث بوّابات ومسارين للحالة، أم تكفي بنية أخفّ؟ نصف عقد من التجارب أعطى الجواب: تكفي في معظم الحالات.
البنية المُبسَّطة
تتخلّى GRU عن حالة الخلية المستقلّة: حالة مخفية واحدة تُدير الذاكرة الطويلة والمُخرَج معًا. وتحتفظ ببوّابتين لا ثلاث:
- بوّابة التحديث : تُقرّر إلى أيّ حدّ نستبدل الحالة القديمة بمرشّح جديد
- بوّابة الإرجاع : تُقرّر إلى أيّ حدّ ننسى الحالة القديمة قبل حساب المرشّح
التركيبة الأخيرة عبقرية في بساطتها: مجموع محدَّب بين الحالة السابقة والمرشّح الجديد. إن كانت فالحالة تعبر بلا تعديل ()، والتدرّج يمرّ. إن كانت فالحالة تُعاد كتابتها بالمرشّح الجديد. الوسيط يُغذّي الجزءين المتكاملين معًا، وهذا التقييد بالضبط هو ما يوفّر البوّابة الثالثة.
التدرّج، لماذا يمرّ
مشتقّة الحالة تعطي مباشرة:
المصطلح الأوّل هو مسار مباشر، مثله مثل في LSTM. حين تختار الشبكة أن تُبقي حالتها ()، ينتقل التدرّج بمعامل قريب من 1. حلّ التدرّج المتلاشي يبقى صحيحًا بالمبدأ نفسه.
مقارنة بوسائط متكافئة
مع نفس و، عدد وسائط GRU:
مقابل لـLSTM. الفارق 25% ذاكرةً وحسابًا. على الفيل الأحمر مع و، هذا يعني 12 864 وسيطًا لـGRU مقابل 17 152 لـLSTM.
في الأدبيات، النتائج متكافئة إحصائيًا في معظم مهام السلاسل الزمنية والنصوص متوسّطة الطول. على المهام النادرة التي تتفوّق فيها إحدى المعماريّتين، الفرق يبقى صغيرًا. القرار العملي يميل إلى GRU إذن، عند تساوي كلّ ما سوى ذلك: أخفّ، أسرع، أقلّ عرضة للإفراط في التعلّم على قواعد بيانات صغيرة.