الوحدة 6 — التقطيع الدلالي: U-Net وDeepLab
مشروع تقاطع الطرق يحتاج أكثر من الصناديق. لعدّ السيّارات في ممرّ محدّد أو تجاوز مُشاة على الرصيف، نحتاج إلى معرفة أيّ بكسل ينتمي إلى الطريق وأيّه إلى الرصيف. هذه الوحدة تعرض التقطيع الدلالي: تصنيف كلّ بكسل من الصورة إلى صنف واحد من مجموعة صارمة.
المُشفِّر-فاكّ الشفرة مع وصلات التخطّي
المعمارية الأساسية للتقطيع الدلالي هي المُشفِّر-فاكّ الشفرة (encoder-decoder). المُشفِّر يُقلّص الدقّة تدريجيًا مع زيادة العمق (كـCNN تقليدية للتصنيف)، ويلتقط سمات دلالية غنيّة. فاكّ الشفرة يعكس هذا: يرفع الدقّة تدريجيًا حتى تعود إلى دقّة الدخل، وينتج قناعًا يُصنّف كلّ بكسل.
المشكلة الأولى: المُشفِّر يُفقد المعلومات المكانية الدقيقة أثناء التقليص. حين نُعيد الرفع، لا نستطيع استعادة حواف حادّة بين الطريق والرصيف.
طرح U-Net (Ronneberger et al.، 2015، للتصوير الطبّي أصلًا) الحلّ العبقري: وصلات التخطّي (skip connections). كلّ طبقة في المُشفِّر تُوصَل مباشرةً بالطبقة المقابلة في فاكّ الشفرة، ما يُتيح لفاكّ الشفرة أن يستعيد التفاصيل المكانية الدقيقة التي فقدها المُشفِّر. الاسم «U-Net» جاء من شكل المعمارية عند رسمها: حرف U، مع الوصلات الأفقية التي تعبر بين الجانبين.
معمارية U-Net بالتفصيل
كلّ خطوة في المُشفِّر تتكوّن من ثلاث عمليّات:
- التفافيتان 3×3 مع تنشيط ReLU لاستخراج السمات
- تجميع أقصى (max pooling) 2×2 لتنصيف الدقّة
- تضعيف عدد القنوات في الخطوة التالية
وفاكّ الشفرة يعكس ذلك:
- تفكيك الالتفاف (deconvolution) أو رفع الدقّة (upsampling) لمضاعفة الدقّة
- تسلسل مع خريطة سمات المُشفِّر الم قابلة عبر وصلة التخطّي
- التفافيتان 3×3 مع ReLU لدمج المعلومات
الطبقة الأخيرة التفافية 1×1 تُقلّص القنوات إلى عدد الأصناف، ثم softmax على البكسلات ينتج قناعًا للأصناف.
Atrous Convolution وDeepLab
U-Net يعمل بالتقليص ثم الرفع، وهو ما يُفقد دقّة تدريجيًا. عائلة DeepLab (Chen et al.، Google، من v1 إلى v3+) اقترحت مقاربة مختلفة: الاحتفاظ بدقّة عالية طوال الشبكة، مع توسيع الحقل الاستقبالي بطريقة أخرى.
الأداة الأساسية هي الالتفاف الموسّع (atrous convolution، أو dilated convolution). التفاف 3×3 عادي ينظر إلى 9 بكسلات متجاورة. التفاف مُوسَّع بمعامل ينظر إلى 9 بكسلات لكن بينها فراغ: بكسل، تخطّي، بكسل، تخطّي. النتيجة حقل استقبالي أوسع بدون زيادة عدد الوسائط.
بجمع معدّلات مختلفة بالتوازي في وحدة Atrous Spatial Pyramid Pooling (ASPP)، تلتقط DeepLab أنماطًا على مقاييس متعدّدة في نفس الطبقة. هذا مفيد للتقطيع الحضري حيث تتعايش الأجسام الصغيرة (لوحة إشارة) مع الكبيرة (طريق واسع).
DeepLabv3+ أضاف فاكّ شفرة خفيفًا لصقل الحواف، و يُعدّ اليوم مرجعًا صلبًا للتقطيع الدلالي على البيانات الحضرية مثل Cityscapes.
خسارة Dice وخسارة IoU
الخسارة الافتراضية للتقطيع هي إنتروبيا متقاطعة على البكسلات: نُطبّقها كأنّ كلّ بكسل مثال تصنيف مستقلّ. تعمل جيّدًا حين تكون الأصناف متوازنة تقريبًا. لكن على تقاطع طرق نموذجي:
- بكسلات «سماء»: 30%
- بكسلات «طريق»: 40%
- بكسلات «مبانٍ»: 25%
- بكسلات «مُشاة»: أقلّ من 1%
عدم التوازن الحادّ يجعل الشبكة تختار حلّ الكسل: توقّع «طريق» أو «سماء» لكلّ بكسل، والحصول على خسارة إنتروبيا متقاطعة منخفضة. المُشاة يختفي كليًّا من التنبّؤ.
خسارة Dice تعالج ذلك مباشرة. تُقاس بين قناع مُتنبَّأ به وقناع حقيقي :