نماذج الرؤية-اللغة-الإجراء تُعلّم روبوتات المستودعات التعامل مع أجسام لم ترَها من قبل

كان روبوت الالتقاط والوضع في المستودعات يحتاج تقليدياً إلى إرشادات مفصّلة عمّا يلتقطه. فالمهندسون يبرمجون نقاط الإمساك لكل رقم صنف، ويعيدون تدريب نماذج الرؤية عند قدوم خط إنتاج جديد، ويتقبّلون أن أي شيء جديد فعلاً — مرتجع غريب الشكل، أو منتج لا يزال في عبوة تجريبية — يُحوَّل إلى عامل بشري. لكن نماذج الرؤية-اللغة-الإجراء تكسر هذا القيد. فبدلاً من قواعد مبرمجة يدوياً لكل جسم، بات نموذج واحد مُدرَّب على بيانات الصور والنصوص بحجم الإنترنت وعلى حركات روبوتية حقيقية قادراً على التعميم على أجسام لم يُدرَّب صراحة على الإمساك بها، غالباً من المحاولة الأولى.
يُعدّ نموذج π0 من Physical Intelligence، وHelix من Figure AI، وGR00T N1 من NVIDIA أوضح الإشارات على أن هذا لم يعد مجرّب تجربة مخبرية. فقد شغّلت Figure نموذج Helix على أرضية إنتاج حية لشركة BMW. وعرضت Physical Intelligence — المدعومة من OpenAI وJeff Bezos وThrive Capital — نموذج π0 وهو يطوي ملابس ويخلّص طاولات لم يسبق أن رآها مُهيأة بهذه الطريقة. وتُجرّب مراكز تنفيذ Amazon حالياً أنظمة إمساك عامة مبنية على الفكرة الأساسية ذاتها لتقليل نسبة العناصر التي لا تزال تحتاج إلى يد بشرية. والقاسم المشترك بينها جميعاً معماري، وليس مجرد مجموعة بيانات أكبر.
لماذا وصل النهج القديم إلى طريق مسدود
تفصل الروبوتات الصناعية الكلاسيكية بين الإدراك والتخطيط والتحكم في مراحل متميزة مُهندَسة يدوياً. فنظام الرؤية يُعرّف الجسم ويُخمّن وضعه، والمُخطِّط يحسب المسار، والمتحكّم ينفّذه. وكل مرحلة تعمل جيداً للأجسام التي صُمّم النظام حولها، وتنكسر كل مرحلة على حدة عندما تواجه شيئاً خارج توزيع التدريب — عبوة عاكسة، كيس قابل للانضغاط، عنصر موضوع بزاوية غير مألوفة. وإعادة تدريب أي مرحلة واحدة لفئة أجسام جديدة عملية بطيئة، والمستودعات تُبدّل أرقام الأصناف باستمرار: فقد يتعامل مركز التنفيذ مع مئات الآلاف من العناصر المتميزة، مع إضافة عناصر جديدة يومياً.
هذا التناقض — بنية روبوتية مبنية على كتالوج ثابت، تُنشَر أمام كتالوج لا يتوقف عن التغيّر — هو المشكلة المحددة التي تستهدفها نماذج الرؤية-اللغة-الإجراء.
كيف تعمل نماذج الرؤية-اللغة-الإجراء فعلاً
ينطلق نموذج الرؤية-اللغة-الإجراء من نموذج رؤية-لغة كبير — من النوع المُدرَّب على مليارات أزواج الصور والتسميات النصية ونصوص الويب المفتوح — ويضيف modalidad ثالثة: الحركات الآلية. فتُسجَّل مسارات الروبوت كتسلسلات من مواضع المفاصل أو وضعيات أداة النهاية مقترنة بصور الكاميرا وأوصاف المهام، وتُحوَّل إلى رموز بالطريقة ذاتها التي تُحوَّل بها النصوص وتُدمَج في التدريب. فيتعلّم النموذج التنبؤ بـ"أي حركة تلي" بالطريقة ذاتها التي يتنبّأ بها نموذج اللغة بـ"أي كلمة تلي"، شرط ما يراه وما طُلب منه فعله.
وهذا مهم لأن النموذج يرث الفهم الواسع بمقياس الإنترنت الذي يملكه العمود الفقري للرؤية-اللغة حول ماهية الأجسام وكيف يتصرف العالم المادي — فهو قد رأى فعلياً ملايين الصور للأكياس والصناديق والأدوات وعبوات الطعام قبل أن يلمس ذراعاً روبوتية قط. ثم يُعلّمه الضبط الدقيق على كمية صغيرة نسبياً من بيانات المسارات الروبوتية الحقيقية ترجمة ذلك الفهم البصري إلى أوامر حركية، بدلاً من أن يضطر إلى إعادة تعلّم ما هو "الكيس" من الصفر باستخدام أمثلة مجموعة من الروبوت فقط. وهذه هي آلية التعميم: فالنموذج لا يحفظ نقاط الإمساك لأرقام أصناف معروفة، بل يطبّق حسّاً مشتركاً بصرياً ومادياً واسعاً على أي شيء أمام الكاميرا.
وقد كانت مجموعة بيانات Open X-Embodiment، وهي تعاون بين مؤسسات متعدّدة يجمع بيانات demonstrations روبوتية عبر عشرات منصات الروبوتات ومختبرات الأبحاث، محورية في هذا — إنها أقرب ما يملكه الحقل إلى نَص تدريب مشترك، والنماذج المُدرَّبة عليها تتفوّق باستمرار على تلك المُدرَّبة على بيانات أضيق من مختبر واحد.
مشكلة زمن الاستجابة، وكيف تُحلّ
قد يكون نموذج الرؤية-اللغة-الإجراء الكبير بطيئاً جداً بحيث لا يمكن تشغيله كحلقة تحكم مباشرة — فالإمساك المادي يتطلب تحديثات بترتيب عشرات الملّي ثواني، بينما قد تستغرق عملية التمرير الأمامي لنموذج بمليارات المعاملات وقتاً أطول بكثير. والحل الذي استقرّت عليه معظم هذه الأنظمة هرمي: فنموذج كبير وأبطأ يتولّى التفكير والتخطيط عالي المستوى ببضعة هيرتزات — "الجسم كيس رقائق مُجعّد، اقترب من هذه الزاوية" — بينما تتولّى سياسة صغيرة وسريعة التحكم المستمر لحظة بلحظة بالسرعة التي يتطلبها التلاعب المادي فعلاً. ويستخدم نموذج π0 من Physical Intelligence مطابقة التدفق لهذه الطبقة السريعة من التحكم المستمر تحديداً لأنها تستطيع توليد تسلسلات حركية سلسة وعالية التردد دون الحاجة إلى النموذج الكامل في الحلقة لكل أمر حركي.
ما لا يزال يحدّ من النشر
تظل بيانات المسارات الروبوتية أقل بمئات المرات من النصوص والصور التي جعلت نماذج اللغة الكبيرة ممكنة — فجمع ساعة واحدة من demonstrations روبوتية حقيقية أكثر كلفة بكثير من كشط صفحة ويب، ويتطلب أجهزة مادية ومساحة عمل وغالباً مشغّلاً بشرياً. وهذا الندرة هي القيد المُلزِم للحقل، ولهذا السبب يظل النقل من المحاكاة إلى الواقع — التدريب في المحاكاة ثم التكييف مع الأجهزة المادية — مشكلة بحثية نشطة وليس مشكلة محلولة.
والموثوقية على نطاق واسع هي السؤال المفتوح الآخر. فنموذج عام ينجح مع جسم جديد بنسبة 85% يبدو مثيراً في عرض توضيحي؛ لكن بحجم مراكز التنفيذ، يعني معدّل الفشل هذا عدداً كبيراً بالقيمة المطلقة من العناصر التي تسقط أو تُعطّل سيراً أو تحتاج إلى تدخل بشري. ومشغّلو المستودعات الذين يقيّمون هذه الأنظمة يراقبون معدّل النجاح من المحاولة الأولى على الأجسام غير المرئية فعلاً عن كثب أكثر بكثير من أي نتيجة معيارية، لأن هذا الرقم هو ما يحدد ما إذا كان الروبوت العام أرخص من منتقٍ بشري زائد روبوت مخصص لمهمة لأرقام الأصناف التي يعرفها بالفعل.
لمن يغيّر هذا المعادلة
يستفيد أوّلاً المشغّلون الكبار للتجارة الإلكترونية والخدمات اللوجستية التابعة لأطراف ثالثة — Amazon وGXO وDHL Supply Chain — لأن تقلّب أرقام الأصناف وتذبذب الأحجام الموسمية هما بالضبط الشرطان اللذان ينهار فيهما البرمجة المخصصة للمهام بأسرع صورة. وتواجه بائعات الروبوتات التي تبيع أنظمة ضيقة أحادية المهمة ضغطاً تنافسياً مباشراً هو الأكبر، إذ إن النموذج العام القادر على إعادة النشر عبر المهام دون أعمال هندسية جديدة يُقوّض قيمة الأجهزة المبنية حول قدرة ثابتة واحدة. ولدى المُدمِجات ومكاتب الأنظمة التي تجني أموالها من تخصيص برمجة الروبوتات لكل رقم صنف أكبر قدر من إعادة التدريب لأنفسها.
ما يجدر مراقبته
- معدّلات النجاح من المحاولة الأولى على الأجسام الجديدة فعلاً، كما يُبلّغ عنها المشغّلون لا البائعون — هذا هو الرقم الذي يحدّد فعلاً اقتصاديات النشر، ونادراً ما يُفصح عنه اليوم.
- نمو مجموعات بيانات المسارات الروبوتية. سواء تستمر مجموعات البيانات المشتركة على نمط Open X-Embodiment في التوسّع، أم أن خنادق البيانات المملوكة للمختبرات الفردية تبدأ بالهيمنة على الأداء بدلاً منها.
- مسارات تكلفة الأجهزة. فالبرمجيات العامة لا تهم تجارياً إلا إذا أصبحت الأذرع وأدوات الإمساك التي تشغّلها رخيصة بما يكفي للنشر على نطاق مراكز التنفيذ.
- ما إذا كانت النماذج العامة ستبدأ بالتفوّق على النماذج المخصصة للمهام في ميدانها الخاص — أرقام الأصناف عالية الحجم والمفهومة جيداً — وليس فقط في حالات الأجسام الجديدة حيث تمتلك حالياً أوضح تفوّق.
أمضت روبوتات المستودعات عقدين من الزمن وهي تتقن بشدة مجموعة ثابتة من المهام وتفشل بشدة في أي شيء خارجها. ونماذج الرؤية-اللغة-الإجراء هي أول نهج يعكس هذه المقايضة بطريقة ذات معنى تجاري — وكون Figure وPhysical Intelligence تُشغّلان هذه الأنظمة على أرضيات إنتاج حقيقية، لا في عروض بحثية فحسب، هو الجزء الذي يستحق الانتباه.