#context-memory — الذكاء الاصطناعي الوكيلي
نافذة السياق وذاكرة العميل: عدّ الرموز، الاقتطاع، التلخيص، الفهرسة.
ما ستُجرّبه
- مرحبًا بك في قناة #context-memory. لا يملك نموذج اللغة الكبير (LLM) ذاكرة دائمة: في كل استدعاء تُعيد تقديم كل شيء يحتاج إلى معرفته داخل نافذة السياق، وهي طابور رموز محدود الطول (8k أو 128k أو 1M حسب النموذج). العميل الذي يعمل لفترة يملؤها بسرعة: تعليمات system، وأمثلة few-shot، وسجل محادثات user وassistant، ومشاهدات الأدوات، ووثائق RAG. على الشاشة: الشريط = نافذتك، والخطّ الأبيض = حدّ النموذج، والمقياس أعلاه = نسبة الامتلاء، وفي الأسفل الذاكرة الخارجية (وثائق مفهرسة يمكنك استرجاعها عند الطلب). ستملأ النافذة الآن، ثم تضغطها.
- لنبدأ بنموذج صغير. اكتب
/model llama-3: ينخفض الحدّ إلى 8000 رمز. في النماذج ذات النافذة الصغيرة، كل رمز مكلف — وهنا يمكنك رؤية استراتيجيات إدارة السياق في العمل. - أضف رسالة مستخدم. اكتب
/add user A long test user message with some explanation: تظهر كتلة نيلية ويرتفع المقياس. - أمثلة few-shot هي أزواج سؤال/جواب توضع في بداية السياق لإظهار الصيغة المتوقّعة. اكتب
/few-shot 3: تظهر ثلاث كتل خضراء دفعة واحدة. - الآن دور RAG (الاسترجاع المعزّز للتوليد). بدلًا من حشو كل شيء في السياق، تفهرس الوثائق في ذاكرة خارجية ولا تستدعي منها إلا الأكثر صلة في كل استعلام. اكتب
/rag REST API documentation: تُضاء الوثائق الثلاث الأقرب (بحسب تشابه جيب التمام على المتّجهات embeddings) في الشبكة السفلية وتُضاف إلى السياق باللون البنفسجي. - بدأت النافذة تمتلئ. أولى استراتيجيات الضغط: النافذة المنزلقة (sliding window). اكتب
/truncate sliding: تختفي أقدم رسائل user/assistant، ويُحافَظ على كتل system وfew-shot. - بديل أدقّ: التلخيص بدل الحذف. اكتب
/summarize 3: تندمج أقدم ثلاث كتل user/assistant في كتلة ملخّص واحدة تنخفض تكلفتها إلى نحو ربع الرموز الأصلية.