محركات الألعاب تصبح أرض التدريب الأولى لـ AI Agents

مشاركة:
محركات الألعاب تصبح أرض التدريب الأولى لـ AI Agents

رهان General Intuition بقيمة 320 مليون دولار يفسر تحوّلًا تراكم لسنوات

في يونيو 2026، جمعت شركة AI الناشئة General Intuition 320 مليون دولار من Khosla Ventures وGeneral Catalyst وجيف بيزوس. الفرضية: تدريب AI Agents على ملايين الساعات من أسلوب اللعب بالفيديو ينتج وكلاء يفهمون الأفعال والعواقب واتخاذ القرارات في العالم الحقيقي بشكل أفضل من الوكلاء المدربين على النص وحده.

هذه ليست فكرة جديدة — إنها تتويج ممول جيدًا لأبحاث تراكمت منذ AlphaGo من DeepMind في عام 2016 والاختراقات في التعلم المعزز التي تلتها. ما تغير هو النطاق، والأدوات، والطموح التجاري الصريح. لم تعد محركات الألعاب مجرد فضول أكاديمي لأبحاث AI. بل أصبحت بنية تحتية.

لماذا ألعاب الفيديو تشكل بيئات تدريب استثنائية

تدريب AI Agent على العمل في العالم يتطلب محاكاة حيث يمكن للوكيل أن يحاول، ويفشل، ويعيد المحاولة — مليارات المرات، دون كسر أي شيء حقيقي. محاكاة العالم المادي مكلفة وبطيئة. ذراع روبوت يمكنه إجراء بضع مئات من المحاولات يوميًا في العالم الحقيقي. في محاكاة فيزيائية داخل محرك ألعاب، يمكن لنفس الذراع إجراء ملايين المحاولات بين ليلة وضحاها.

لكن الأمر يتجاوز السرعة الخام. بيئات الألعاب تمتلك خصائص فريدة وقيمة لتدريب Agent:

  • إشارات مكافأة كثيفة. الألعاب مصممة لتقديم تغذية راجعة باستمرار — نقاط، صحة، اقتراب من الأهداف، إكمال المهام. هذا هو بالضبط ما تحتاجه خوارزميات التعلم المعزز. نادرًا ما توفر المهام في العالم الحقيقي إشارات مكافأة واضحة بهذا التواتر.
  • التوليد الإجرائي. يمكن لمحركات الألعاب الحديثة توليد تنويعات لا حصر لها من البيئات: تخطيطات مختلفة، ظروف إضاءة، تكوينات عوائق، ومعاملات فيزيائية. هذا التنوع حاسم لإنتاج وكلاء يعممون خارج توزيع تدريبهم بدلاً من حفظ مجموعة ثابتة من السيناريوهات.
  • الفشل الرخيص. Agent يخطئ في تقدير قفزة داخل محرك ألعاب يخسر بضع ثوانٍ من وقت المحاكاة. Agent يخطئ في تقدير قرار ملاحة على أرض مصنع يكلف أموالاً حقيقية وقد يسبب ضررًا حقيقيًا. الألعاب تجعل الفشل قابلاً للتصرف، مما يسرع التعلم بمراتب حجمية.
  • بيانات الحقيقة الأساسية. كل حدث في محرك ألعاب يُسجل بدقة كاملة — الموقع، السرعة، الفعل المتخذ، المكافأة المستلمة. ضوضاء الاستشعار الفوضوية والرؤية الجزئية للعالم الحقيقي غير موجودة داخل المحاكاة.

المحركات المختارة — ولماذا تهم

محركات الألعاب الأكثر استخدامًا لتدريب AI هي Unity وUnreal Engine، مع OpenAI Gym وNVIDIA Isaac Sim (المبني على Omniverse) لخدمة حالات استخدام متخصصة في الروبوتات والمحاكاة الفيزيائية.

Unity ML-Agents Toolkit كان واحداً من أول Frameworks التي أضفت الطابع الرسمي على فكرة محرك الألعاب كأرض تدريب لـ AI. يوفر واجهة قياسية بين مشهد Unity وخوارزميات التعلم المعزز القائمة على Python، وقد استُخدم في آلاف الأوراق الأكاديمية، وهو العمود الفقري للعديد من Pipelines التدريب التجاري للوكلاء.

Unreal Engine 5 أصبح ذا أهمية متزايدة لبيئات التدريب فائقة الواقعية حيث دقة الصورة مهمة — محاكاة المركبات الذاتية القيادة، ملاحة الطائرات بدون طيار، وأبحاث AI المجسدة حيث فجوة المحاكاة والواقع (مشكلة النقل من المحاكاة إلى الواقع) هي مصدر قلق حاسم. الصور الأكثر واقعية تقلل تلك الفجوة.

NVIDIA Isaac Sim، المبني على منصة Omniverse، يستهدف الروبوتات تحديدًا. يوفر محاكاة دقيقة فيزيائيًا للحركيات الروبوتية، وأجهزة الاستشعار (LiDAR، كاميرات، وحدات قياس القصور الذاتي)، والبيئات المعقدة. تستخدم Boston Dynamics وFigure وشركات الروبوتات البشرية الأخرى Isaac Sim أو منصات مشابهة لتدريب سياسات التلاعب والملاحة لروبوتاتها مسبقًا قبل النشر على الأجهزة.

ما تعلمه بيانات أسلوب اللعب لـ AI ولا يستطيع النص تعليمه

نماذج اللغة الكبيرة المدربة على نصوص الإنترنت قادرة بشكل استثنائي على التفكير والكتابة واسترجاع المعرفة. لكن النص هو تمثيل مضغوط وثابت للعالم. إنه يصف ما حدث؛ لا يظهر كيفية التصرف.

أطروحة General Intuition — والأدبيات البحثية الأوسع التي تستند إليها — هي أن بيانات أسلوب اللعب تشفر شيئًا مختلفًا: اتخاذ قرار سببي، تسلسلي، مجسد. نموذج شاهد (أو لعب) مليون ساعة من Minecraft تعلم ضمنيًا كيف ترتبط المساحات ثلاثية الأبعاد، وكيف يجب جمع الموارد قبل بناء الأدوات، وكيفية الملاحة نحو هدف عبر تضاريس معقدة.

مشروع DeepMind SIMA، الذي أُعلن عنه في أوائل 2024 وتوسع بشكل كبير في السنوات اللاحقة، درّب Agent عامًا عبر تسعة ألعاب فيديو تجارية ووجد أن الوكلاء المدربين على بيئات ألعاب متنوعة نقلوا الاستراتيجيات إلى ألعاب جديدة وحتى إلى مهام روبوتية في العالم الحقيقي بشكل أكثر فعالية من الوكلاء المدربين على محاكاة الروبوتات وحدها. اتساع توزيع التدريب على الألعاب مهم بقدر حجمه.

مشكلة النقل من المحاكاة إلى الواقع — والتقدم المحرز فيها

التحدي المستمر مع التدريب على محرك الألعاب هو نقل السياسات إلى الأجهزة المادية. روبوت دُرِّب في محاكاة لالتقاط الأشياء سيفشل غالبًا على روبوت حقيقي لأن فيزياء المحاكاة، والاحتكاك، والعرض البصري لا تتطابق تمامًا مع الواقع.

عدة تقنيات قللت هذه الفجوة بشكل ملحوظ:

  • العشوائية النطاقية: تغيير المعاملات الفيزيائية، والإضاءة، والأنسجة بشكل عشوائي أثناء التدريب يجبر Agent على تطوير سياسات مقاومة لتلك التغييرات، بدلاً من حفظ تكوين محاكاة محدد.
  • العرض فائق الواقعية: أنظمة Lumen وNanite في Unreal Engine 5 تنتج صورًا قريبة بما يكفي من لقطات الكاميرا الحقيقية بحيث أن الوكلاء المدربين في بيئات UE5 يظهرون فجوات نقل من المحاكاة إلى الواقع أقل مقارنة بالمحركات الأقدم والأقل دقة.
  • Fine-tuning بالبيانات الحقيقية: تدريب سياسة في المحاكاة، ثم Fine-tuning على كمية صغيرة من بيانات العالم الحقيقي، أصبح هو Pipeline المعياري للنشر التجاري للروبوتات. توفر المحاكاة "المنهج الدراسي"؛ البيانات الحقيقية تصحح فجوة النطاق المتبقية.

ما وراء الروبوتات: وكلاء مدربون على الألعاب في البرمجيات

التدريب على محرك الألعاب لا يقتصر على الروبوتات المادية. نفس النهج يُطبق على الوكلاء البرمجيين — أنظمة AI تتنقل في واجهات المستخدم الرسومية، وتشغل متصفحات الويب، وتملأ الاستمارات، وتتفاعل مع تطبيقات سطح المكتب.

مشروع Cradle من Microsoft Research وعمل وكيل استخدام الكمبيوتر من Anthropic يستندان كلاهما إلى فكرة أن التنقل في واجهات المستخدم الرسومية يشترك في خصائص هيكلية مع التنقل في ألعاب الفيديو: كلاهما يتضمن تحديد العناصر القابلة للتفاعل في مشهد بصري، اختيار فعل، مراقبة النتيجة، وتعديل الاستراتيجية. التدريب على أسلوب اللعب يبني قدرة التفكير المكاني والتسلسلي الأساسي التي تنتقل إلى كليهما.

خلاصة عملية

  • إذا كنت تبني AI Agents تتفاعل مع بيئات مادية أو واجهات مستخدم معقدة، يجب أن تكون محاكاة محرك الألعاب ضمن بنيتك. الأدوات (Unity ML-Agents، Isaac Sim، Unreal Engine مع جسور Python) ناضجة وموثقة جيدًا.
  • بيئات التدريب المتنوعة أهم من الحجم وحده. Agent مدرب عبر 20 بيئة لعبة مختلفة سيعمم بشكل أفضل من Agent مدرب على 10 أضعاف البيانات من بيئة واحدة.
  • النقل من المحاكاة إلى الواقع هو مشكلة هندسية قابلة للحل، وليس عائقًا أساسيًا. العشوائية النطاقية بالإضافة إلى مجموعة بيانات صغيرة من Fine-tuning بالبيانات الحقيقية هي أفضل ممارسة حالية لمعظم تطبيقات الروبوتات.
  • راقب مسار أطروحة General Intuition. إذا تفوق الوكلاء المدربون على أسلوب اللعب على الوكلاء المدربين على النص في إنجاز المهام العامة، فالتداعيات على بنية Agent تمتد إلى ما هو أبعد من الروبوتات — إلى أي مجال حيث يكون اتخاذ القرار التسلسلي مهمًا.
مشاركة:
محركات الألعاب تصبح أرض التدريب الأولى لـ AI Agents | AIO APEX