وكلاء ترميز الذكاء الاصطناعي يحرقون عشرات الآلاف من Tokens قبل أن يقرأوا Prompt الخاص بك

مشاركة:
وكلاء ترميز الذكاء الاصطناعي يحرقون عشرات الآلاف من Tokens قبل أن يقرأوا Prompt الخاص بك

قبل أن يقرأ وكيل ترميز الذكاء الاصطناعي كلمة واحدة تكتبها، يكون قد أنفق بالفعل آلافا من Tokens في تقديم نفسه: system prompts, tool schemas, تذكيرات scaffolding. وقد قامت مقارنة مستقلة حديثة لمنصتي وكيلين شائعتين، Claude Code و OpenCode، بقياس هذا الحمل الإضافي مباشرة باستخدام proxy تسجيل التقط الحمولات JSON الدقيقة المرسلة إلى API النموذج. وكانت الفجوة كبيرة بما يكفي لتغيير طريقة تفكير أي شخص يدير هذه الأدوات على نطاق واسع فيما يتعلق بالتكلفة.

في مهمة أساسية من الدورة الأولى على Claude Sonnet 4.5، أرسل Claude Code حوالي 32,800 Token قبل معالجة Prompt المستخدم الفعلي. وأرسل OpenCode حوالي 6,900 Token لنفس المهمة — بفارق 4.7 ضعفا. وتضيق الفجوة إلى 3.3 ضعفا على النماذج الأحدث لكنها لا تغلق. هذا الحمل الإضافي غير مرئي في الاستخدام العادي: تكتب Prompt، وتحصل على رد، ولا ترى أبدا الحمولة التي أُرسلت تحته. لكنه يُحاسب عليه مثل أي شيء آخر، ويتضاعف بطرق تهم بمجرد تجاوز الأمثلة الصغيرة.

أين تذهب Tokens فعليا

ينقسم الحمل الإضافي إلى ثلاثة مكونات قابلة للقياس. تمثل System prompts أصغر حصة لكنها حقيقية: system prompt الخاص بـ Claude Code يبلغ 27,344 حرفا (حوالي 6,500 Token)، مقابل 9,324 حرفا (~2,000 Token) لـ OpenCode. أما Tool schemas فهي التكلفة الأكبر — يشحن Claude Code 27 تعريف أداة تمتد لحوالي 99,778 حرفا (~24,000 Token)، بينما مجموعة أدوات OpenCode الأقل حجما المكونة من 10 أدوات تأتي بـ 20,856 حرفا (~4,800 Token). والباقي هو scaffolding: يحقن Claude Code كتل تذكيرية، كتالوجات وكيل، وتأطير سياق قبل رسالة المستخدم الفعلية؛ بينما لا يضيف OpenCode أيًا من ذلك افتراضيا.

ليس أي من هذا هدرا بمعنى أنه عديم الفائدة — فالمزيد من الأدوات وscaffolding الأغنى يعني عموما أن الوكيل يمكنه فعل المزيد دون طرح أسئلة توضيحية. إنها مقايضة تصميمية حقيقية بين القدرة لكل طلب والتكلفة لكل طلب، وهي مقايضة لا يراها معظم المستخدمين، ناهيك عن اختيارها.

تتفاقم الفجوة مع التكوين الواقعي

تقوم الأرقام الأساسية بتقليل ما تكلفه الإعدادات الإنتاجية فعليا. أضف ملف تعليمات مشروع نموذجيا بحجم 72 كيلوبايت (من نوع CLAUDE.md أو AGENTS.md الذي تحتفظ به معظم قواعد الأكواد الجادة حاليا) وكلتا الأداتين تلتقطان حوالي 20,000 Token إضافية لكل طلب — هذا الجزء مدفوع بالتكوين وليس بالأداة، لذا فهو يؤثر على كلا الأداتين بالتساوي. أضف طبقة من خمسة خوادم MCP (Model Context Protocol)، وهو إعداد شائع للفرق التي تربط Slack و Jira و قواعد البيانات أو APIs الداخلية، ويضيف كل خادم من 4,900 إلى 6,967 Token لكل طلب فقط للإعلان عن أدواته المتاحة.

اجمع كل هذا معا، ويصل تكوين إنتاج واقعي إلى 75,000 إلى 85,000 Token في العمق قبل أن يكتب المستخدم كلمة واحدة من طلبه الفعلي. على نافذة سياق تبلغ 200,000 Token، يستهلك ذلك أكثر من 40% من المساحة المتاحة بواسطة scaffolding قبل كتابة أو قراءة أي كود.

سلوك التخزين المؤقت هو حيث يحدث الانحراف الحقيقي في التكلفة

الفرق الأكثر تأثيرا ليس عدد Tokens الأساسي — بل ما يحدث لذلك الحمل الإضافي عبر الجلسة. يحافظ OpenCode على بادئة طلب مطابقة بالبايت عبر الدورات، مما يعني أن prompt caching يعمل بشكل مثالي تقريبا: يتم إعادة استخدام نفس Tokens من ذاكرة التخزين المؤقت دورة بعد دورة مع الحد الأدنى من إعادة الكتابة.

على النقيض، تتم إعادة كتابة scaffolding الخاص بـ Claude Code في منتصف الجلسة — كتل تذكيرية جديدة، سياق محدث، حالة أداة منعشة — مما يجبر cache على الإبطال وإعادة البناء بشكل متكرر. تراوح حجم كتابات cache المقاسة لـ Claude Code بين 5.9x إلى 54x مقارنة بـ OpenCode، اعتمادا على مدى “دفء” cache وقت القياس. كتابات cache ليست مجانية: فهي تُحاسب بعلاوة 1.25x على معدل الإدخال الأساسي لـ TTL قياسي لمدة 5 دقائق. الأداة التي تعيد كتابة cache الخاص بها باستمرار تدفع تلك العلاوة أكثر بكثير من تلك التي لا تفعل ذلك.

Subagents تضاعف المشكلة، وليس فقط إضافتها

الرقم الأكثر صرامة في المقارنة يتعلق بالتفويض. مهمة كلفت 121,000 Token تراكمي عند تشغيلها مباشرة كلفت 513,000 Token عندما تم توزيع نفس العمل على اثنين من Subagents — زيادة قدرها 4.2x لما ينبغي نظريا أن يكون نفس المبلغ الإجمالي من العمل مقسما. كل Subagent يدفع كامل الحمل الأساسي (system prompt, tool schemas, scaffolding) بشكل مستقل؛ التفويض لا يشارك تلك التكلفة، بل يضربها بعدد الوكلاء المنشأين.

هذا يهم مباشرة لكيفية تصميم الفرق لسير العمل الوكيلية. غالبا ما يُصوّر توزيع مهمة على Subagents على أنه ربح نقاء في التوازي — وكلاء أكثر، وقت حائطي أقل. لكن محاسبة Tokens تروي قصة مختلفة: إنها مقايضة تكلفة حقيقية، وبالنسبة للمهام الصغيرة أو المتوسطة، يمكن لمضاعفة الحمل الإضافي أن تفوق أي وقت توفره.

ماذا تفعل فعليا حيال ذلك

من المثير للاهتمام، في المهام المعقدة متعددة الخطوات تتقارب الأدوات: استخدم Claude Code 121,000 Token تراكمي عبر 3 طلبات (تجميع استدعاءات أدوات عدواني)، بينما استخدم OpenCode 132,000 Token عبر 9 طلبات متسلسلة. بالنسبة للعمل المعقد حقا، فجوة الحمل الأساسي تصبح أقل أهمية لأنها تُستهلك عبر عمل فعلي أكثر لكل طلب.

الاستنتاجات العملية: راجع حجم ملف CLAUDE.md/AGENTS.md الخاص بك — تلك الضريبة البالغة 20,000 Token تضرب كل طلب بغض النظر عن الأداة. كن متعمدا بشأن عدد خوادم MCP التي تبقها نشطة؛ كل منها هو تكلفة ثابتة لكل طلب سواء استخدمته في دورة معينة أم لا. وتعامل مع fan-out الخاص بـ Subagent كقرار تكلفة، وليس مجرد قرار سرعة — احجزه للمهام الكبيرة بما يكفي حيث يكون مضاعف الحمل 4x يستحق الدفع من أجل التوازي.

مشاركة:
وكلاء ترميز الذكاء الاصطناعي يحرقون عشرات الآلاف من Tokens قبل أن يقرأ | AIO APEX