OpenAI تستبدل Advanced Voice Mode الخاص بـ ChatGPT بنماذج GPT-Live full-duplex

في السابع من يوليو، أطلقت OpenAI نموذج GPT-Live، وهما نموذجا صوت جديدان — GPT-Live-1 و GPT-Live-1 mini — يمكنهما الاستماع والتحدث في وقت واحد، ليحلا محل وضع الصوت المتقدم (Advanced Voice Mode) القديم في ChatGPT لأكثر من 150 مليون مستخدم حول العالم.
كانت سلسلة المعالجة الصوتية السابقة تجمع بين مراحل منفصلة للكلام إلى نص، والنموذج اللغوي، والنص إلى كلام. كل انتقال بين هذه المراحل كان يضيف تأخيرًا ويجعل النظام غير قادر على الاستجابة بشكل طبيعي للمقاطعات في منتصف الجملة. أما GPT-Live فيدمج المراحل الثلاث في نموذج واحد يعالج الصوت الخام في الوقت الفعلي، تمامًا كما يظل الشخص منخرطًا في محادثة دون توقف للمعالجة.
ما الذي يفعله GPT-Live بالفعل
يدعم النظام تبادل الأدوار الطبيعي — بما في ذلك الإشارات الخلفية المناسبة مثل "ممم" أو البقاء صامتًا أثناء تفكير المستخدم — ويمكنه استمرار المحادثات لمدة تتراوح بين 30 و40 دقيقة، وهو امتداد ملحوظ مقارنة بتجربة الصوت السابقة. عندما يتطلب سؤال المستخدم بحثًا على الويب أو تفكيرًا أعمق أو عمليات وكيلية معقدة، يقوم GPT-Live بتوجيه الطلب إلى GPT-5.5 في الخلفية ويدمج النتيجة مرة أخرى في المحادثة الصوتية دون انقطاع مسموع. كما يتم دعم التنسيق البصري: يمكن للنماذج عرض المعلومات كنص أو مخرجات منظمة على الشاشة إلى جانب الرد الصوتي.
تطبق ضمانات مدمجة تلقائيًا ردودًا مناسبة للعمر للمستخدمين المراهقين وتوفر موارد عندما تتطرق المحادثات إلى مواضيع مثل إيذاء النفس.
الطرح والوصول
أصبح GPT-Live-1 mini الآن تجربة الصوت الافتراضية لجميع مستخدمي ChatGPT. ويحصل المشتركون في الخطط المدفوعة على إمكانية الوصول إلى GPT-Live-1، النموذج الأكبر ذي الأداء الأقوى في المهام المعقدة. وقد قامت OpenAI بتحسين كلا النموذجين ليتناسبا مع معظم اللغات المستخدمة على نطاق واسع عالميًا.
تم عرض ميزة الترجمة الفورية أثناء الإطلاق، على الرغم من أن عرضًا تجريبيًا باللغة الهندية جذب الانتباه بسبب لهجته الأمريكية الثقيلة وإلقائه غير الطبيعي — وهو تذكير بأن جودة الترجمة الفورية لا تزال تتطلب تحسينًا كبيرًا.
لماذا هذا مهم
تصف OpenAI الصوت بأنه أصبح "الواجهة الأساسية للحوسبة" للأعمال المعقدة والممتدة — وهو إطار يضع GPT-Live كبنية تحتية وليس مجرد ميزة. أكثر من 150 مليون شخص يتفاعلون بالفعل مع ChatGPT عبر الصوت والإملاء. من خلال دفع نموذج full-duplex لجميع المستخدمين افتراضيًا — وليس فقط لمستوى ميزة — تراهن OpenAI بشكل هيكلي على أن التفاعل الصوتي مع AI جاهز للاستخدام السائد.
كما يرفع هذا التحول من المخاطر التنافسية لكل من Gemini Live من Google وطبقة الصوت في Apple Intelligence وغيرها من منتجات voice AI التي لا تزال تطور قدرات مماثلة.
كما ورد أولاً في TechCrunch، أصبح GPT-Live-1 mini من OpenAI متاحًا الآن لجميع المستخدمين، بينما يتم طرح GPT-Live-1 للمشتركين المدفوعين.
Originally reported by TechCrunch. Read the original article for additional details.
View original source