مدلهای بینایی-زبان-کنش در حال آموزش به رباتهای انبار برای پردازش اشیایی هستند که هرگز ندیدهاند

یک ربات انبارِ برداشتن و گذاشتن، بهطور سنتی، نیاز داشته که با جزئیات به آن گفته شود چه چیزی را برمیدارد. مهندسان برای هر SKU نقاط گرفتن را برنامهریزی میکنند، با رسیدن خط تولید جدید، مدلهای بینایی را بازآموزی میدهند، و میپذیرند که هر چیز واقعاً تازهای — یک کالای مرجوعی با شکل عجیب، یک محصول هنوز در بستهبندی توسعه — به یک انسان ارجاع داده میشود. مدلهای بینایی-زبان-کنش در حال شکستن این محدودیت هستند. به جای قواعد دستنویس برای هر شیء، یک مدل واحد که هم بر دادههای تصویر و متن در مقیاس اینترنت و هم بر حرکت واقعی ربات آموزش دیده است، اکنون به اشیایی تعمیم مییابد که هرگز صریحاً برای گرفتن آنها آموزش ندیده — و اغلب از همان اولین تلاش.
مدل π0 متعلق به Physical Intelligence، مدل Helix متعلق به Figure AI، و مدل GR00T N1 متعلق به NVIDIA روشنترین نشانههایی هستند که نشان میدهند این دیگر یک کنجکاوی آزمایشگاهی نیست. شرکت Figure مدل Helix را در یک خط تولید فعال BMW اجرا کرده است. شرکت Physical Intelligence — که توسط OpenAI، Jeff Bezos و Thrive Capital حمایت میشود — توانایی π0 را در تا کردن لباس و جمعآوری میزهایی که هرگز با آن پیکربندی ندیده بود، به نمایش گذاشته است. مراکز پردازش Amazon در حال آزمایش سیستمهای گرفتنِ عمومی هستند که بر پایه همان ایده بنیادی ساخته شدهاند تا سهم اقلامی را که هنوز به دست انسان نیاز دارند کاهش دهند. وجه مشترک همه این سیستمها معماری است، نه صرفاً یک مجموعه داده بزرگتر.
چرا رویکرد قدیمی به بنبست رسید
رباتیک صنعتی کلاسیک، ادراک، برنامهریزی و کنترل را به مراحل مجزای مهندسیشدهٔ دستی تفکیک میکند. یک سیستم بینایی شیء را شناسایی و وضعیت آن را تخمین میزند؛ یک برنامهریز مسیر حرکت را محاسبه میکند؛ یک کنترلکننده آن را اجرا میکند. هر مرحله برای اشیایی که سیستم حول آنها طراحی شده خوب کار میکند، و هر مرحله هنگام مواجهه با چیزی خارج از توزیع آموزشیاش بهطور مستقل از کار میافتد — یک بسته بازتابنده، یک کیسه تغییرشکلپذیر، یک کالای قرارگرفته در زاویهای غیرمعمول. بازآموزی هر یک از این مراحل برای یک دسته جدید از کالاها کند است، و انبارها بهطور مداوم SKUهای خود را عوض میکنند: یک مرکز پردازش ممکن است صدها هزار کالای متمایز را مدیریت کند، با افزودن موارد جدید بهصورت روزانه.
این ناهمخوانی — یک زیرساخت رباتیک ساختهشده برای یک فهرست ثابت، مستقر در برابر فهرستی که هرگز از تغییر باز نمیایستد — مسئله مشخصی است که مدلهای بینایی-زبان-کنش هدف آن قرار گرفتهاند.
مدلهای VLA واقعاً چگونه کار میکنند
یک مدل بینایی-زبان-کنش از یک مدل بزرگ بینایی-زبان آغاز میشود — از نوعی که بر میلیاردها جفت تصویر-توضیح و متن وب باز آموزش دیده — و یک سومین modalidad را اضافه میکند: کنشهای موتوری. مسیرهای حرکت ربات، که بهصورت دنبالههایی از موقعیت مفاصل یا وضعیتهای ابزار انتهایی همراه با تصاویر دوربین و توضیحات وظیفه ضبط شدهاند، دقیقاً به همان شیوهای که متن نشانهگذاری میشود، نشانهگذاری شده و در آموزش گنجانده میشوند. مدل یاد میگیرد «حرکت بعدی چیست» را پیشبینی کند، همانطور که یک مدل زبانی «کلمه بعدی چیست» را پیشبینی میکند، مشروط به آنچه میبیند و آنچه از آن خواسته شده انجام دهد.
این اهمیت دارد زیرا مدل، درک گسترده و در مقیاس اینترنتِ مدل پایه بینایی-زبان از ماهیت اشیاء و رفتار جهان فیزیکی را به ارث میبرد — این مدل عملاً میلیونها تصویر از کیسهها، جعبهها، ابزارها و ظروف غذا را پیش از آنکه هرگز یک بازوی رباتیک را لمس کند، دیده است. سپس تنظیم ظریف بر مقدار نسبتاً کمی داده واقعی از مسیر حرکت ربات، به آن میآموزد که آن درک بصری را به فرمانهای موتوری ترجمه کند، به جای آنکه مجبور باشد مفهوم «کیسه» را از صفر و تنها با مثالهای جمعآوریشده توسط ربات بازبیاموزد. این مکانیزم تعمیم است: مدل نقاط گرفتن برای SKUهای شناختهشده را حفظ نمیکند، بلکه عقل سلیم بصری و فیزیکی گستردهای را به هر آنچه جلوی دوربین است اعمال میکند.
مجموعه داده Open X-Embodiment، یک همکاری چندمؤسسهای که دادههای نمایش ربات را از دهها سکوی رباتیک و آزمایشگاه تحقیقاتی گرد هم آورده، نقشی محوری در این پیشرفت داشته — این مجموعه نزدیکترین چیزی است که این حوزه به یک پیکره آموزشی مشترک دارد، و مدلهای آموزشدیده بر آن بهطور مداوم عملکرد بهتری نسبت به مدلهای آموزشدیده بر دادههای محدودتر یک آزمایشگاه واحد نشان میدهند.
مشکل تأخیر، و نحوه حل آن
یک مدل بزرگ بینایی-زبان-کنش میتواند برای اجرا بهعنوان یک حلقه کنترل مستقیم بسیار کند باشد — گرفتن فیزیکی نیازمند بهروزرسانیهایی در حدود دهها میلیثانیه است، در حالی که عبور مستقیم یک مدل چندمیلیاردپارامتری میتواند بسیار بیشتر طول بکشد. راهحلی که در بیشتر این سیستمها همگرا شده سلسلهمراتبی است: یک مدل بزرگ و کندتر، استدلال و برنامهریزی سطح بالا را در حد چند هرتز انجام میدهد — «شیء یک کیسه چیپس مچاله است، از این زاویه نزدیک شو» — در حالی که یک سیاست کوچک و سریع، کنترل پیوسته لحظهبهلحظه را با سرعی که دستکاری فیزیکی واقعاً نیاز دارد مدیریت میکند. مدل π0 متعلق به Physical Intelligence از تطبیق جریان برای این لایه کنترل پیوسته سریع استفاده میکند، مشخصاً به این دلیل که میتواند دنبالههای کنشی نرم و با بسامد بالا تولید کند، بدون آنکه نیاز باشد مدل کامل برای هر فرمان موتوری در حلقه باشد.
چه چیزهایی هنوز استقرار را محدود میکنند
دادههای مسیر حرکت ربات همچنان چندین مرتبه بزرگی کمیابتر از دادههای متن و تصویری هستند که مدلهای زبانی بزرگ را ممکن ساختند — جمعآوری یک ساعت نمایش ربات در دنیای واقعی بسیار پرهزینهتر از خراشیدن یک صفحه وب است، و به سختافزار فیزیکی، فضای کار و اغلب یک اپراتور انسانی نیاز دارد. این کمیابی، محدودیت اصلی این حوزه است، و دلیل آن است که انتقال از شبیهسازی به واقعیت — آموزش در شبیهسازی و سپس تطبیق با سختافزار فیزیکی — همچنان یک مسئله تحقیقاتی فعال باقی مانده، نه یک مسئله حلشده.
قابلیت اطمینان در مقیاس، مسئله باز دیگر است. یک مدل عمومی که ۸۵ درصد مواقع بر یک شیء ناشناخته موفق عمل کند در یک نمایشی چشمگیر به نظر میرسد؛ اما در حجم یک مرکز پردازش، آن نرخ شکست هنوز به معنای تعداد قابل توجهی کالای سقوطکرده، گیرکرده در نوار نقاله، یا نیازمند مداخله انسانی است. گردانندگان انبار که این سیستمها را ارزیابی میکنند، نرخ موفقیت از اولین تلاش بر روی اشیای واقعاً ندیدهشده را بسیار دقیقتر از هر نمره معیاری دنبال میکنند، زیرا این عدد تعیین میکند که آیا یک ربات عمومی ارزانتر از یک برداشتکننده انسانی بهعلاوه یک ربات مختص وظیفه برای SKUهایی که از پیش میشناسد خواهد بود یا خیر.
این تحول برای چه کسانی شرایط را تغییر میدهد
اپراتورهای بزرگ تجارت الکترونیک و لجستیک شخص ثالث — Amazon، GXO، DHL Supply Chain — نخستین بهرهمندان هستند، زیرا چرخش SKU و نوسانات حجم فصلی دقیقاً شرایطی هستند که برنامهنویسی مختص وظیفه در آنها سریعتر از هم میپاشد. فروشندگان رباتیک که سیستمهای محدود و تکوظیفهای میفروشند، مستقیمترین فشار رقابتی را تجربه میکنند، زیرا یک مدل عمومی که بتواند بدون کار مهندسی جدید در وظایف مختلف مستقر شود، ارزش سختافزاری را که حول یک قابلیت ثابت ساخته شده تضعیف میکند. یکپارچهسازان و شرکتهای سیستمی که درآمدشان از سفارشیسازی برنامهنویسی ربات برای هر SKU است، بیشترین نیاز به بازآموزی خودشان را دارند.
چه چیزهایی را باید دنبال کرد
- نرخهای موفقیت از اولین تلاش بر روی اشیای واقعاً نوآورانه، گزارششده توسط اپراتورها نه فروشندگان — این عددی است که واقعاً اقتصاد استقرار را تعیین میکند، و امروزه بهندرت افشا میشود.
- رشد مجموعه دادههای مسیر حرکت ربات. اینکه آیا مجموعه دادههای مشترک به سبک Open X-Embodiment به مقیاسپذیری ادامه میدهند، یا اینکه خندقهای داده اختصاصی آزمایشگاههای منفرد شروع به غالب شدن بر عملکرد میکنند.
- مسیر هزینه سختافزار. نرمافزار عمومی تنها زمانی از نظر تجاری اهمیت دارد که بازوها و گیرندههایی که آن را اجرا میکنند به اندازه کافی ارزان شوند تا در مقیاس مرکز پردازش مستقر شوند.
- اینکه آیا مدلهای عمومی شروع به شکست دادن مدلهای مختص وظیفه در زمین خودشان میکنند — SKUهای با حجم بالا و خوب درکشده — نه فقط در موارد اشیای نوآورانه که در حال حاضر واضحترین مزیت را دارند.
رباتیک انبار دو دهه صرف کرد تا در مجموعهای ثابت از وظایف بسیار خوب و در هر چیز خارج از آنها بسیار ضعیف شود. مدلهای بینایی-زبان-کنش نخستین رویکردی هستند که این معامله را به شیوهای از نظر تجاری معنادار معکوس میکنند — و این واقعیت که Figure و Physical Intelligence این سیستمها را در کف تولید واقعی اجرا میکنند، نه فقط در نمایشهای تحقیقاتی، بخشی است که ارزش توجه دارد.