مدل‌های بینایی-زبان-کنش در حال آموزش به ربات‌های انبار برای پردازش اشیایی هستند که هرگز ندیدهاند

اشتراک‌گذاری:
مدل‌های بینایی-زبان-کنش در حال آموزش به ربات‌های انبار برای پردازش اشیایی هستند که هرگز ندیدهاند

یک ربات انبارِ برداشتن و گذاشتن، بهطور سنتی، نیاز داشته که با جزئیات به آن گفته شود چه چیزی را برمیدارد. مهندسان برای هر SKU نقاط گرفتن را برنامه‌ریزی میکنند، با رسیدن خط تولید جدید، مدل‌های بینایی را بازآموزی می‌دهند، و میپذیرند که هر چیز واقعاً تاز‌های — یک کالای مرجوعی با شکل عجیب، یک محصول هنوز در بسته‌بندی توسعه — به یک انسان ارجاع داده می‌شود. مدل‌های بینایی-زبان-کنش در حال شکستن این محدودیت هستند. به جای قواعد دستنویس برای هر شیء، یک مدل واحد که هم بر داده‌های تصویر و متن در مقیاس اینترنت و هم بر حرکت واقعی ربات آموزش دیده است، اکنون به اشیایی تعمیم می‌یابد که هرگز صریحاً برای گرفتن آنها آموزش ندیده — و اغلب از همان اولین تلاش.

مدل π0 متعلق به Physical Intelligence، مدل Helix متعلق به Figure AI، و مدل GR00T N1 متعلق به NVIDIA روشن‌ترین نشانه‌هایی هستند که نشان می‌دهند این دیگر یک کنجکاوی آزمایشگاهی نیست. شرکت Figure مدل Helix را در یک خط تولید فعال BMW اجرا کرده است. شرکت Physical Intelligence — که توسط OpenAI، Jeff Bezos و Thrive Capital حمایت می‌شود — توانایی π0 را در تا کردن لباس و جمع‌آوری میز‌هایی که هرگز با آن پیکر‌بندی ندیده بود، به نمایش گذاشته است. مراکز پردازش Amazon در حال آزمایش سیستم‌های گرفتنِ عمومی هستند که بر پایه همان ایده بنیادی ساخته شدهاند تا سهم اقلامی را که هنوز به دست انسان نیاز دارند کاهش دهند. وجه مشترک همه این سیستم‌ها معماری است، نه صرفاً یک مجموعه داده بزرگ‌تر.

چرا رویکرد قدیمی به بنبست رسید

رباتیک صنعتی کلاسیک، ادراک، برنامه‌ریزی و کنترل را به مراحل مجزای مهندسیشدهٔ دستی تفکیک می‌کند. یک سیستم بینایی شیء را شناسایی و وضعیت آن را تخمین می‌زند؛ یک برنامهریز مسیر حرکت را محاسبه می‌کند؛ یک کنترل‌کننده آن را اجرا می‌کند. هر مرحله برای اشیایی که سیستم حول آنها طراحی شده خوب کار می‌کند، و هر مرحله هنگام مواجهه با چیزی خارج از توزیع آموزشیاش بهطور مستقل از کار میافتد — یک بسته بازتابنده، یک کیسه تغییرشکل‌پذیر، یک کالای قرارگرفته در زاوی‌های غیرمعمول. بازآموزی هر یک از این مراحل برای یک دسته جدید از کالاها کند است، و انبار‌ها بهطور مداوم SKUهای خود را عوض میکنند: یک مرکز پردازش ممکن است صدها هزار کالای متمایز را مدیریت کند، با افزودن موارد جدید بهصورت روزانه.

این ناهمخوانی — یک زیرساخت رباتیک ساخته‌شده برای یک فهرست ثابت، مستقر در برابر فهرستی که هرگز از تغییر باز نمیایستد — مسئله مشخصی است که مدل‌های بینایی-زبان-کنش هدف آن قرار گرفتهاند.

مدل‌های VLA واقعاً چگونه کار میکنند

یک مدل بینایی-زبان-کنش از یک مدل بزرگ بینایی-زبان آغاز می‌شود — از نوعی که بر میلیارد‌ها جفت تصویر-توضیح و متن وب باز آموزش دیده — و یک سومین modalidad را اضافه می‌کند: کنش‌های موتوری. مسیر‌های حرکت ربات، که بهصورت دنباله‌هایی از موقعیت مفاصل یا وضعیت‌های ابزار انت‌هایی همراه با تصاویر دوربین و توضیحات وظیفه ضبط شدهاند، دقیقاً به همان شیو‌های که متن نشانه‌گذاری می‌شود، نشانه‌گذاری شده و در آموزش گنجانده میشوند. مدل یاد می‌گیرد «حرکت بعدی چیست» را پیشبینی کند، همانطور که یک مدل زبانی «کلمه بعدی چیست» را پیشبینی می‌کند، مشروط به آنچه می‌بیند و آنچه از آن خواسته شده انجام دهد.

این اهمیت دارد زیرا مدل، درک گسترده و در مقیاس اینترنتِ مدل پایه بینایی-زبان از ماهیت اشیاء و رفتار جهان فیزیکی را به ارث می‌برد — این مدل عملاً میلیون‌ها تصویر از کیسه‌ها، جعبه‌ها، ابزار‌ها و ظروف غذا را پیش از آنکه هرگز یک بازوی رباتیک را لمس کند، دیده است. سپس تنظیم ظریف بر مقدار نسبتاً کمی داده واقعی از مسیر حرکت ربات، به آن می‌آموزد که آن درک بصری را به فرمان‌های موتوری ترجمه کند، به جای آنکه مجبور باشد مفهوم «کیسه» را از صفر و تنها با مثال‌های جمع‌آوری‌شده توسط ربات بازبیاموزد. این مکانیزم تعمیم است: مدل نقاط گرفتن برای SKUهای شناخته‌شده را حفظ نمی‌کند، بلکه عقل سلیم بصری و فیزیکی گسترد‌های را به هر آنچه جلوی دوربین است اعمال می‌کند.

مجموعه داده Open X-Embodiment، یک همکاری چندمؤسس‌های که داده‌های نمایش ربات را از ده‌ها سکوی رباتیک و آزمایشگاه تحقیقاتی گرد هم آورده، نقشی محوری در این پیشرفت داشته — این مجموعه نزدیک‌ترین چیزی است که این حوزه به یک پیکره آموزشی مشترک دارد، و مدل‌های آموزشدیده بر آن بهطور مداوم عملکرد بهتری نسبت به مدل‌های آموزشدیده بر داده‌های محدودتر یک آزمایشگاه واحد نشان می‌دهند.

مشکل تأخیر، و نحوه حل آن

یک مدل بزرگ بینایی-زبان-کنش می‌تواند برای اجرا بهعنوان یک حلقه کنترل مستقیم بسیار کند باشد — گرفتن فیزیکی نیازمند بهروزرسانی‌هایی در حدود ده‌ها میلیثانیه است، در حالی که عبور مستقیم یک مدل چندمیلیاردپارامتری می‌تواند بسیار بیشتر طول بکشد. راهحلی که در بیشتر این سیستم‌ها همگرا شده سلسلهمراتبی است: یک مدل بزرگ و کند‌تر، استدلال و برنامه‌ریزی سطح بالا را در حد چند هرتز انجام می‌دهد — «شیء یک کیسه چیپس مچاله است، از این زاویه نزدیک شو» — در حالی که یک سیاست کوچک و سریع، کنترل پیوسته لحظهبهلحظه را با سرعی که دستکاری فیزیکی واقعاً نیاز دارد مدیریت می‌کند. مدل π0 متعلق به Physical Intelligence از تطبیق جریان برای این لایه کنترل پیوسته سریع استفاده می‌کند، مشخصاً به این دلیل که می‌تواند دنباله‌های کنشی نرم و با بسامد بالا تولید کند، بدون آنکه نیاز باشد مدل کامل برای هر فرمان موتوری در حلقه باشد.

چه چیز‌هایی هنوز استقرار را محدود میکنند

داده‌های مسیر حرکت ربات همچنان چندین مرتبه بزرگی کمیابتر از داده‌های متن و تصویری هستند که مدل‌های زبانی بزرگ را ممکن ساختند — جمع‌آوری یک ساعت نمایش ربات در دنیای واقعی بسیار پرهزینهتر از خراشیدن یک صفحه وب است، و به سخت‌افزار فیزیکی، فضای کار و اغلب یک اپراتور انسانی نیاز دارد. این کمیابی، محدودیت اصلی این حوزه است، و دلیل آن است که انتقال از شبیه‌سازی به واقعیت — آموزش در شبیه‌سازی و سپس تطبیق با سخت‌افزار فیزیکی — همچنان یک مسئله تحقیقاتی فعال باقی مانده، نه یک مسئله حل‌شده.

قابلیت اطمینان در مقیاس، مسئله باز دیگر است. یک مدل عمومی که ۸۵ درصد مواقع بر یک شیء ناشناخته موفق عمل کند در یک نمایشی چشمگیر به نظر می‌رسد؛ اما در حجم یک مرکز پردازش، آن نرخ شکست هنوز به معنای تعداد قابل توجه‌ی کالای سقوطکرده، گیرکرده در نوار نقاله، یا نیازمند مداخله انسانی است. گردانندگان انبار که این سیستم‌ها را ارزیابی میکنند، نرخ موفقیت از اولین تلاش بر روی اشیای واقعاً ندیده‌شده را بسیار دقیق‌تر از هر نمره معیاری دنبال میکنند، زیرا این عدد تعیین می‌کند که آیا یک ربات عمومی ارزان‌تر از یک برداشت‌کننده انسانی بهعلاوه یک ربات مختص وظیفه برای SKUهایی که از پیش می‌شناسد خواهد بود یا خیر.

این تحول برای چه کسانی شرایط را تغییر می‌دهد

اپراتور‌های بزرگ تجارت الکترونیک و لجستیک شخص ثالث — Amazon، GXO، DHL Supply Chain — نخستین بهرهمندان هستند، زیرا چرخش SKU و نوسانات حجم فصلی دقیقاً شرایطی هستند که برنامه‌نویسی مختص وظیفه در آنها سریع‌تر از هم میپاشد. فروشندگان رباتیک که سیستم‌های محدود و تکوظیف‌های میفروشند، مستقیمترین فشار رقابتی را تجربه میکنند، زیرا یک مدل عمومی که بتواند بدون کار مهندسی جدید در وظایف مختلف مستقر شود، ارزش سختافزاری را که حول یک قابلیت ثابت ساخته شده تضعیف می‌کند. یکپارچهسازان و شرکت‌های سیستمی که درآمدشان از سفارشی‌سازی برنامه‌نویسی ربات برای هر SKU است، بیشترین نیاز به بازآموزی خودشان را دارند.

چه چیز‌هایی را باید دنبال کرد

  • نرخ‌های موفقیت از اولین تلاش بر روی اشیای واقعاً نوآورانه، گزارش‌شده توسط اپراتور‌ها نه فروشندگان — این عددی است که واقعاً اقتصاد استقرار را تعیین می‌کند، و امروزه بهندرت افشا می‌شود.
  • رشد مجموعه داده‌های مسیر حرکت ربات. اینکه آیا مجموعه داده‌های مشترک به سبک Open X-Embodiment به مقیاس‌پذیری ادامه می‌دهند، یا اینکه خندق‌های داده اختصاصی آزمایشگاه‌های منفرد شروع به غالب شدن بر عملکرد میکنند.
  • مسیر هزینه سخت‌افزار. نرم‌افزار عمومی تنها زمانی از نظر تجاری اهمیت دارد که بازو‌ها و گیرنده‌هایی که آن را اجرا میکنند به اندازه کافی ارزان شوند تا در مقیاس مرکز پردازش مستقر شوند.
  • اینکه آیا مدل‌های عمومی شروع به شکست دادن مدل‌های مختص وظیفه در زمین خودشان میکنند — SKUهای با حجم بالا و خوب درک‌شده — نه فقط در موارد اشیای نوآورانه که در حال حاضر واضح‌ترین مزیت را دارند.

رباتیک انبار دو دهه صرف کرد تا در مجموع‌های ثابت از وظایف بسیار خوب و در هر چیز خارج از آنها بسیار ضعیف شود. مدل‌های بینایی-زبان-کنش نخستین رویکردی هستند که این معامله را به شیو‌های از نظر تجاری معنادار معکوس میکنند — و این واقعیت که Figure و Physical Intelligence این سیستم‌ها را در کف تولید واقعی اجرا میکنند، نه فقط در نمایش‌های تحقیقاتی، بخشی است که ارزش توجه دارد.

اشتراک‌گذاری: