يعمل وضع Ultrafast من OpenAI بواسطة GPT-5.6 Sol بسرعة 750 tokens في الثانية
TechCrunch

أطلقت OpenAI خدمة Ultrafast، وهي فئة خدمة API جديدة تشغل نموذج GPT-5.6 Sol بسرعة تصل إلى 750 token في الثانية — أي 14 ضعف سرعة وضع Standard الحالي، الذي يبلغ متوسطه نحو 53 token في الثانية. هذا الوضع متاح بنسخة معاينة محدودة لعملاء API المختارين بدءاً من 13 أغسطس.
تأتي مكاسب السرعة من شراكة مع Cerebras، الشركة الناشئة لشرائح الذكاء الاصطناعي المعروفة بمعالجاتها على مستوى الرقاقة الكاملة (wafer-scale). ويعد Ultrafast أول منتج تجاري لهذا التعاون، حيث يستخدم عتاد Cerebras لتسريع الاستدلال (inference) بشكل كبير على نموذج OpenAI الرئيسي دون أي تقليل في جودة المخرجات، وفقاً للشركة.
ما تعنيه حقاً 750 token في الثانية
الفرق بين 53 و750 token في الثانية هو الفرق بين نموذج يكتب بينما تقرأ وبين نموذج يقدم استجابة كاملة فورياً تقريبا. المقالة النمطية التي تبلغ 1000 كلمة تستغرق نحو 18 ثانية بالسرعة العادية وأقل من ثانيتين باستخدام Ultrafast. بالنسبة للتطبيقات في الوقت الفعلي (real-time)، فإن هذه الفجوة هائلة.
تقول OpenAI إن Ultrafast مصمم لسير العمل الذي فرض تاريخياً مقايضة بين السرعة والذكاء — حيث اختار المطورون نماذج أصغر وأسرع لأن النماذج الرائدة كانت بطيئة للغاية. الفكرة هي أنه يمكنك الآن تشغيل GPT-5.6 Sol، وهو نموذج بمستوى النماذج الرائدة، بسرعات لم تكن تحقُّقها في السابق سوى البدائل المختصرة.
حالات الاستخدام المستهدفة
تسلّط OpenAI الضوء على أربعة تطبيقات أساسية يفتح فيها الاستدلال دون الثانية (sub-second inference) إمكانيات جديدة: الاستجابة للحوادث (محللو الأمان الذين يحصلون على إجابات مباشرة أثناء التحقيق)، خدمة العملاء (Agent التي تتناسب مع وتيرة المكالمة الهاتفية)، تحليل الأسواق المالية (التعليق في الوقت الفعلي على تحركات الأسعار)، والتجارة الإلكترونية (توصيات المنتجات الديناميكية خلال جلسات التصفح النشطة).
هذه هي الفئات التي تقوم فيها المؤسسات الكبرى حالياً بتوجيه الاستعلامات بعيداً عن النماذج الرائدة خصيصاً بسبب قيود زمن الاستجابة (latency). وإذا أثبت Ultrafast صحة ادعاءات Benchmark الخاصة بالجودة على نطاق واسع، فإنه سيزيل هذا القيد.
اتصال Cerebras
قضت Cerebras سنوات في بناء رقاقات بمقياس الويفر كبديل لنهج GPU الخاص بـ Nvidia. معالجها CS-3 عبارة عن قالب واحد بمساحة 900 مم² بدلاً من مجموعة من الرقاقات الأصغر، مما يوازن تعقيد التصنيع مقابل إنتاجية الاستدلال الخام. وتعد هذه الشراكة أبرز انتشار تجاري لعتاد Cerebras حتى الآن.
لم تعلن OpenAI عن تسعير منفصل لوضع Ultrafast وهي تعمل على توسيع نطاق الوصول مع نمو السعة. وكما ذكرت لأول مرة TechCrunch، فقد جاء الإعلان مباشرة من مدونة المطورين الخاصة بـ OpenAI.
وردت في الأصل عن TechCrunch. اقرأ المقال الأصلي لمزيد من التفاصيل.
عرض المصدر الأصلي