مدل‌های هوش مصنوعی روی دستگاه بالاخره به اندازه‌ای خوب شده‌اند که جایگزین درخواست‌های ابری در گوشی‌های پرچمدار شوند

اشتراک‌گذاری:
مدل‌های هوش مصنوعی روی دستگاه بالاخره به اندازه‌ای خوب شده‌اند که جایگزین درخواست‌های ابری در گوشی‌های پرچمدار شوند

هر گوشی پرچمدار عرضه‌شده در سال ۲۰۲۶ به یک واحد پردازش عصبی اختصاصی مجهز است که می‌تواند مدل‌های زبانی را به‌صورت محلی اجرا کند. برای اولین بار، این سخت‌افزار به اندازه کافی سریع است که بتواند اکثر درخواست‌های روزمره هوش مصنوعی را بدون نیاز به ابر مدیریت کند. Snapdragon 8 Elite Gen 5 کوالکام با دو هسته Hexagon NPU خود استنتاج را با سرعت تقریبی ۲۲۰ توکن در ثانیه انجام می‌دهد – جهشی از حدود ۷۰ توکن در ثانیه در نسل قبلی. این تفاوت بین یک تأخیر محسوس و پاسخی است که آنی به نظر می‌رسد.


این موضوع مهم است زیرا داستان قابلیت‌های هوش مصنوعی در گوشی‌ها به‌آرامی تغییر کرده است. در دو سال گذشته، بازاریابی «گوشی هوش مصنوعی» به معنای یک کلاینت نازک بود که دستور شما را به یک مدل پیشرو میزبان‌شده در ابر ارسال می‌کرد. در سال ۲۰۲۶، سهم قابل توجهی از این ترافیک – خلاصه‌سازی، جستجوی محلی، دسته‌بندی اعلان‌ها، رونویسی زنده، ویرایش پایه تصویر – اکنون کاملاً روی تراشه اجرا می‌شود و ابر برای کارهای واقعاً سخت استدلالی محفوظ می‌ماند.


چه چیزی در سخت‌افزار تغییر کرده است

NPU Hexagon در Snapdragon 8 Elite Gen 5 تقریباً ۳۷٪ سریع‌تر از نسل قبلی خود است، اما تغییر مهم‌تر کارایی به ازای هر توکن است، نه توان عملیاتی خام. اجرای Llama 3.2 3B Instruct روی این تراشه پاسخی کوتاه را در کمتر از ۸ ثانیه با سرعت حدود ۱۰ توکن در ثانیه در شرایط واقعی تولید می‌کند – کندتر از عدد بازاریابی، اما هنوز به اندازه کافی سریع برای بیشتر کارهای سریع مانند بازنویسی یک پیام متنی یا خلاصه‌سازی یک رشته اعلان.


راه‌گشای عملی، کوانت‌سازی است. مدل‌های روی دستگاه نسل ۲۰۲۶ آموزش داده می‌شوند و سپس برای اجرا در دقت ۴-بیت یا پایین‌تر بدون افت کیفیت قابل توجه فشرده می‌شوند، که باعث می‌شود یک مدل واقعاً مفید با ۳ میلیارد پارامتر در حافظه و بودجه انرژی گوشی جا بگیرد. چارچوب Foundation Models اپل و Gemini Nano گوگل هر دو از این الگو پیروی می‌کنند – یک مدل کوچک‌تر که از یک مدل پیشرو بسیار بزرگ‌تر تقطیر شده و به‌طور خاص برای محدودیت‌های سیلیکون موبایل تنظیم شده است.


مدل هیبرید معماری واقعی است

هیچ سازنده گوشی ادعا نمی‌کند که مدل‌های روی دستگاه کاملاً جایگزین ابر می‌شوند، و این تصمیم درستی است. استدلال پیچیده چندمرحله‌ای، تولید کد، و هر چیزی که نیازمند دانش گسترده جهانی است همچنان به مدل‌های ابری هدایت می‌شود – سیستم‌های کلاس GPT-4o و کلاس Gemini Pro در آن کارها به‌طور قابل توجهی بهتر از هر چیزی هستند که امروز روی یک تراشه جا می‌گیرد. آنچه تغییر کرده منطق مسیریابی است: به جای اینکه هر درخواست به‌طور پیش‌فرض به ابر برود، گوشی‌ها اکنون ابتدا به‌صورت محلی اولویت‌بندی می‌کنند و فقط زمانی ارتقا می‌دهند که کار واقعاً به آن نیاز داشته باشد.


پیاده‌سازی اپل از این رویکرد از نظر معماری جالب‌ترین است. هنگامی که یک کار از توان روی دستگاه فراتر می‌رود، درخواست‌ها به Private Cloud Compute هدایت می‌شوند – سرورهای سفارشی سیلیکون اپل که به‌گونه‌ای ساخته شده‌اند که حتی خود اپل هم نمی‌تواند داده‌ها را در حال انتقال یا در حالت سکون بررسی کند. این پاسخ مستقیم به اعتراض اصلی به هوش مصنوعی ابری است: ارسال داده‌های شخصی به سروری که کنترل نمی‌کنید. Private Cloud Compute این نگرانی را از بین نمی‌برد، اما با گسترش تضمین‌های حریم خصوصی روی دستگاه به لایه ابر، آن را به‌طور قابل توجهی محدود می‌کند.


چرا این موضوع فراتر از بازاریابی اهمیت دارد

سه مزیت ملموس از تغییر به سمت استنتاج روی دستگاه توانمند ناشی می‌شود. اول، تأخیر: یک مدل محلی برای کارهای کوتاه در کمتر از یک ثانیه پاسخ می‌دهد، در مقابل ۲ تا ۴ ثانیه رفت و برگشت برای یک تماس ابری روی یک اتصال موبایل معمولی. دوم، عملکرد آفلاین: قابلیت‌هایی مانند رونویسی زنده، پاسخ‌های هوشمند و جستجوی عکس اکنون بدون اتصال به شبکه کار می‌کنند. سوم، و کم‌توجه‌ترین، هزینه – هر درخواستی که روی دستگاه پردازش می‌شود، درخواستی است که سازنده گوشی یا توسعه‌دهنده اپلیکیشن بابت آن هزینه استنتاج ابری نمی‌پردازد، که با مقیاس قابلیت‌های هوش مصنوعی به میلیاردها درخواست روزانه، عامل مهمی است.


هنگام خرید گوشی واقعاً به چه چیزی توجه کنیم

اعداد بازاریابی NPU (TOPS – تریلیون عملیات در ثانیه) به تنهایی تقریباً بی‌معنی هستند. آنچه اهمیت دارد این است که سازنده کدام مدل‌های خاص را برای اجرا روی آن سیلیکون بهینه کرده است، و سیستم عامل چگونه وظایف را بین پردازش محلی و ابری مسیریابی می‌کند. یک گوشی با NPU سریع اما بدون پشتیبانی از مدل روی دستگاه برای مورد استفاده شما، هیچ‌یک از این مزایا را ارائه نمی‌دهد. بررسی کنید که آیا خلاصه‌سازی، رونویسی و ویرایش پایه عکس به‌طور صریح در حالت آفلاین و حالت هواپیما اجرا می‌شوند – این آزمایش واقعی است، نه برگه مشخصات.


روند بزرگ‌تری که باید زیر نظر داشت: با بهبود مستمر مدل‌های روی دستگاه، تعریف «نیازمند ابر» رو به کاهش است. کاری که در سال ۲۰۲۴ نیاز به رفت و برگشت ابری داشت، ممکن است تا سال ۲۰۲۷ کاملاً روی تراشه اجرا شود. برای توسعه‌دهندگان اپلیکیشن، این به معنای طراحی قابلیت‌های هوش مصنوعی با یک بازگشت صریح محلی-اول است، نه اینکه فرض کنیم استنتاج ابری تنها پیش‌فرض قابل دوام است.

اشتراک‌گذاری: