اوپنایآی جایگزین Advanced Voice Mode چتجیپیتی با مدلهای full-duplex GPT-Live شد

OpenAI در ۸ جولای GPT-Live را راهاندازی کرد، یک جفت مدل صوتی جدید — GPT-Live-1 و GPT-Live-1 mini — که میتوانند همزمان گوش دهند و صحبت کنند و جایگزین Advanced Voice Mode قدیمی ChatGPT برای بیش از ۱۵۰ میلیون کاربر در سراسر جهان شدند.
pipeline صوتی پیشین، مراحل جداگانهای شامل Speech-to-Text، Language Model و Text-to-Speech را بهیکدیگر متصل میکرد. هر انتقال باعث افزایش تأخیر میشد و سیستم را قادر به پاسخ طبیعی به قطع کردن صحبت در میان جمله نمیکرد. GPT-Live هر سه را در یک مدل واحد ادغام میکند که صدای خام را بهصورت بلادرنگ پردازش میکند، درست مانند یک انسان که در طول مکالمه درگیر میماند بدون اینکه مکث پردازشی داشته باشد.
GPT-Live واقعاً چه کاری انجام میدهد
سیستم از نوبتگیری طبیعی پشتیبانی میکند — از جمله نشانههای بازخورد مناسب مانند «ممم» یا سکوت در حالی که کاربر فکر میکند — و میتواند مکالمات ۳۰ تا ۴۰ دقیقهای را حفظ کند، که افزایش قابل توجهی نسبت به تجربه صوتی قبلی است. هنگامی که سوال کاربر نیاز به جستجوی وب، استدلال عمیقتر یا کار عاملی پیچیده دارد، GPT-Live درخواست را به GPT-5.5 در پسزمینه ارسال میکند و نتیجه را بدون وقفه شنیداری به مکالمه صوتی بازمیگرداند. فرمتبندی بصری نیز پشتیبانی میشود: مدلها میتوانند اطلاعات را بهصورت متن یا خروجی ساختاریافته روی صفحه در کنار پاسخ صوتی نمایش دهند.
اقدامات ایمنی داخلی بهطور خودکار پاسخهای متناسب با سن را برای کاربران نوجوان اعمال میکنند و در مواقعی که مکالمات به موضوعاتی مانند خودآزاری نزدیک میشود، منابعی را ارائه میدهند.
عرضه و دسترسی
GPT-Live-1 mini اکنون تجربه صوتی پیشفرض برای همه کاربران ChatGPT است. مشترکین پولی به GPT-Live-1 دسترسی دارند، مدل بزرگتر با عملکرد قویتر در کارهای پیچیده. OpenAI هر دو مدل را برای رایجترین زبانهای جهان بهینهسازی کرده است.
یک ویژگی ترجمه زنده در طول عرضه نشان داده شد، هرچند یک دموی هندی به دلیل لهجه سنگین آمریکایی و ارائه غیرطبیعی توجه زیادی را جلب کرد — یادآوری اینکه کیفیت ترجمه بلادرنگ هنوز جای بهبود قابل توجهی دارد.
چرا این مهم است
OpenAI صدا را بهعنوان «رابط اصلی محاسبات» برای کارهای طولانی و پیچیده توصیف میکند — چارچوبی که GPT-Live را بهعنوان زیرساخت قرار میدهد نه یک ویژگی. بیش از ۱۵۰ میلیون نفر در حال حاضر از طریق Voice و Dictation با ChatGPT تعامل دارند. با ارائه یک مدل full-duplex بهطور پیشفرض به همه کاربران — نه فقط یک لایه ویژگی — OpenAI شرط ساختاری میزند که تعامل صوتی محور با هوش مصنوعی برای استفاده اصلی آماده است.
این تغییر همچنین اهمیت رقابتی را برای Google's Gemini Live، لایه صوتی Apple Intelligence و سایر محصولات صوتی هوش مصنوعی که هنوز در حال تکرار قابلیتهای مشابه هستند، افزایش میدهد.
همانطور که اولین بار توسط TechCrunch گزارش شد، GPT-Live-1 mini اکنون برای همه کاربران فعال است و GPT-Live-1 برای مشترکین پولی عرضه میشود.
Originally reported by TechCrunch. Read the original article for additional details.
View original source