ذاكرة AI Agent أصبحت أغلى مشكلة في البنية التحتية لعام 2026

كل مؤسسة نشرت AI agents على نطاق واسع في عام 2026 واجهت نفس العقبة: لم يكن النموذج هو عنق الزجاجة أبدًا. بل كانت الذاكرة. على وجه التحديد، تبين أن تكلفة تخزين واسترجاع وإعادة إرسال السياق (context) في كل طلب هي المكان الذي ذهبت إليه الميزانية فعليًا — ليس على الـ tokens المولدة، بل على الـ tokens التي تُعاد تغذيتها إلى النموذج فقط حتى يتمكن من تذكر ما كان يفعله قبل خمس دقائق.
هذا التحول مهم لأنه يعكس الحكمة التقليدية من 2023-2024، عندما كانت نوافذ السياق الأكبر تُعتبر حلًا لفقدان ذاكرة الـ agent. في عام 2026، استقر حجم نافذة السياق فعليًا عبر النماذج المتطورة (frontier models)، وانتقلت استثمارات الصناعة إلى طبقة معمارية منفصلة: ذاكرة دائمة قابلة للاستعلام تقع أسفل نافذة السياق بدلًا من محاولة حشر كل شيء فيها.
لماذا لم تكن نوافذ السياق قادرة على حل هذه المشكلة أبدًا
نافذة السياق هي ذاكرة عمل سريعة ومكلفة ومتقلبة — أقرب إلى ذاكرة الوصول العشوائي (RAM) منها إلى القرص الصلب. معاملتها كتخزين طويل الأجل يعني أن كل agent يعمل لأكثر من بضع جولات يدفع ضريبة إعادة الإرسال: نفس تاريخ المحادثة، ومخرجات الأدوات، والقرارات السابقة تُسلسل وتُعاد إلى النموذج في كل استدعاء، سواء كانت لا تزال ذات صلة أم لا.
على نطاق الإنتاج، هذا ليس خطأ تقريبيًا. وجدت المؤسسات التي تدير agents مع آلاف المستخدمين المتزامنين أن إعادة إرسال السياق (context re-transmission) — وليس الاستدلال على tokens جديدة — كان أكبر بند في ميزانيتها. وكيل دعم يتولى جلسة استكشاف أخطاء مكونة من 40 جولة كان يعيد إرسال أول 39 جولة في كل سؤال متابعة، معظمها لا علاقة له بالسؤال الحالي.
كيف تبدو حزمة الذاكرة (memory stack) لعام 2026 فعليًا
تعالج البنى التي ظهرت هذا العام الذاكرة كنظام من الدرجة الأولى بمنطق استرجاع خاص به، وليس كـ prompt أطول. النهج الأكثر استشهادًا — من بحث Mem0، الذي تم اختباره في ECAI 2025 وتحسينه حتى أبريل 2026 — يستخدم استخراجًا هرميًا في مسار واحد: بينما يولد agent الحقائق خلال جلسة، تُعالج تلك الحقائق كبيانات منظمة قابلة للاستعلام بدلاً من نص خام موجود في نص الجلسة.
يجري الاسترجاع بعد ذلك ثلاث عمليات تسجيل متوازية — التشابه الدلالي، مطابقة الكلمات المفتاحية، ومطابقة الكيانات — ويدمج النتائج قبل تغذية أي شيء مرة أخرى إلى النموذج. في معيار LoCoMo (1,540 سؤالًا عبر أربع فئات)، سجل هذا النهج 92.5 بينما استخدم متوسط 6,956 token فقط لكل استعلام، مقابل حوالي 26,000 token لخط الأساس ذي السياق الكامل الذي يغطي نفس المجال. في مجموعة أسئلة LongMemEval المكونة من 500 سؤال، سجل 94.4 بتكلفة token مماثلة. هذا يمثل تخفيضًا بمقدار 4 أضعاف في الـ tokens لكل استعلام وانخفاضًا محسوبًا بنسبة 91% في زمن الاستجابة مقارنة بحشر التاريخ الكامل في الـ prompt في كل مرة.
تظهر المكاسب بأقصى حد في الاستعلامات التي كانت تكسر agents سابقًا: تحسّن الاستدلال الزمني (تذكر ما حدث ومتى وبأي ترتيب) بمقدار 29.6 نقطة، والاستدلال متعدد القفزات (ربط الحقائق عبر جولات سابقة متعددة) بمقدار 23.1 نقطة مقارنة بالجيل السابق من الذاكرة المستندة إلى الاسترجاع.
نموذج النطاق الذي يجعل هذا عمليًا
الجزء الآخر الذي نضج في 2026 هو تحديد نطاق الذاكرة (memory scoping) — تحديد الحقائق التي تنتمي إلى أي كيان. النمط الذي أصبح قريبًا من المعيار هو تسلسل هرمي رباعي المستويات: user_id، agent_id، run_id/session_id، وapp_id/org_id، مع ترتيب تلقائي في وقت الاسترجاع بحيث يسحب الاستعلام الذاكرة الأكثر تحديدًا وذات الصلة أولاً (هذه الجلسة، هذا المستخدم) قبل العودة إلى النطاقات الأوسع (المعرفة العامة للمؤسسة).
بدون هذا، تنتهي الفرق إما بتسرب الذاكرة — تفاصيل جلسة أحد المستخدمين تتسرب إلى أخرى — أو ذاكرة عامة جدًا لتكون مفيدة، لأن كل شيء يُسطّح في مخزن واحد غير متمايز.
ماذا يعني هذا إذا كنت تبني أو تشتري agents الآن
ثلاثة آثار ملموسة لأي شخص ينشر agents في الإنتاج اليوم:
خصص ميزانية للبنية التحتية للذاكرة كبند منفصل، وليس كترقية لنافذة السياق. إذا كان نموذج التكلفة الخاص بك يحسب فقط استدلال النموذج ولا يتتبع بشكل منفصل تكاليف الاسترجاع وإعادة الإرسال، فسوف تفاجأ بالفاتورة على نطاق واسع.
قيّم أطر الذاكرة (memory frameworks) بنفس الطريقة التي تقيم بها قاعدة بيانات — وليس كقالب prompt. يتنافس الآن أكثر من عشرين إطارًا وواجهة خلفية لمتجر المتجهات (vector store) في هذا المجال عبر أنظمة Python وTypeScript البيئية. اختر واحدًا بناءً على زمن استجابة الاسترجاع وكفاءة الـ tokens عند مستوى التزامن المتوقع، وليس على مدى سهولة ربطه بـ prompt موجود.
صمم للذاكرة ذات النطاق المحدد من اليوم الأول. إضافة نموذج نطاق رباعي المستويات إلى نظام بدأ بمخزن ذاكرة مسطح واحد هو أغلى بكثير من بنائه من البداية — تعامل مع فصل المستخدم/agent/الجلسة/المؤسسة كقرار متعلق بالمخطط (schema)، وليس كفكرة لاحقة.
الفرق التي تعرضت للحرق في 2026 لم تكن تلك التي لديها نماذج أضعف. بل كانت تلك التي افترضت أن نافذة سياق أكبر هي بديل عن بنية ذاكرة فعلية، واكتشفت بالطريقة الصعبة أنها مشكلة مختلفة تمامًا.