الوحدة 4 — Word2Vec وGloVe وهندسة المعنى
قدَّمت الوحدة السابقة قيدًا رئيسًا لـTF-IDF: كلمتان مترادفتان تُعامَلان كأنّهما لا صلة بينهما. Word2Vec الذي طرحه توماس ميكولوف وزملاؤه في 2013 كان جوابًا صادمًا آنذاك: كلّ كلمة تصبح متّجهًا كثيفًا في فضاء بأبعاد عدّة مئات، والمسافات في هذا الفضاء تعكس القرابة الدلالية. ما كان قبل ذلك «مصفوفة متناثرة تراوغ فيها كلّ كلمة» صار «سحابة نقاط منظّمة».
سنستأنف جسم مراجعاتنا العربية لنُدرّب تضميناتنا الخاصّة، ونرى ماذا تعرف، وما تُنتِج من تحيّزات لن يعرف نموذج التصنيف أنّه ورثها.
الفرضية التوزيعية
كلّ ما تفعله Word2Vec وGloVe وأمثالهما ينبني على مقولة قديمة لعالم اللسانيات جون فيرث: «تعرف الكلمة بجيران ها». إذا ظهرت كلمة منتج عادةً بجوار شراء وسعر وجودة، وظهرت كلمة سلعة بجوار الجيران أنفسهم تقريبًا، فمن المعقول أن يكون معناهما قريبًا.
الفرضية التوزيعية تحوّل السؤال الفلسفي «ما معنى كلمة؟» إلى مسألة إحصائية: ما التوزيع الشرطي للكلمات التي تظهر في محيطها؟ Word2Vec لا يفعل شيئًا آخر: يتعلّم متّجهًا لكلّ كلمة بحيث يكون هذا المتّجه قادرًا على التنبّؤ بمتّجهات الجيران.
Skip-gram وCBOW: هيكلان لهدف واحد
يقترح Word2Vec طريقتين عكسيّتين للتعلّم.
CBOW (Continuous Bag of Words): تُقدَّم إلى الشبكة سياق (بضع كلمات على اليمين واليسار)، ويُطلب منها التنبّؤ بالكلمة المركزية. مثلًا من المنتج ... جدا سأشتريه، على النموذج أن يقول جيد.
Skip-gram: تُقدَّم الكلمة المركزية، ويُطلب من النموذج التنبّؤ بكلمات السياق كلّها. من جيد، على النموذج أن يعطي احتمالًا كبيرًا لـالمنتج وجدا وسأشتريه.
Skip-gram أثقل من CBOW (يُنتج أمثلة أكثر لكلّ نصّ)، لكنّه يشتغل أفضل على الكلمات النادرة، وهي حال معظم أسماء العلامات التجارية في مراجعاتنا. هو الاختيار الافتراضي للجُسُم الحرّة الطويلة.
الشبكة نفسها بسيطة صادمًا: طبقة تضمين ذات بُعدًا ( نموذجيًّا)، ثمّ طبقة إسقاط على المفردات، ثمّ سوفتماكس. الكلمة تصبح متّجهها المتعلَّم في الطبقة الأولى.