اوپن‌ای‌آی جایگزین Advanced Voice Mode چت‌جی‌پی‌تی با مدل‌های full-duplex GPT-Live شد

TechCrunch
اشتراک‌گذاری:
اوپن‌ای‌آی جایگزین Advanced Voice Mode چت‌جی‌پی‌تی با مدل‌های full-duplex GPT-Live شد

OpenAI در ۸ جولای GPT-Live را راه‌اندازی کرد، یک جفت مدل صوتی جدید — GPT-Live-1 و GPT-Live-1 mini — که می‌توانند همزمان گوش دهند و صحبت کنند و جایگزین Advanced Voice Mode قدیمی ChatGPT برای بیش از ۱۵۰ میلیون کاربر در سراسر جهان شدند.

pipeline صوتی پیشین، مراحل جداگانه‌ای شامل Speech-to-Text، Language Model و Text-to-Speech را به‌یکدیگر متصل می‌کرد. هر انتقال باعث افزایش تأخیر می‌شد و سیستم را قادر به پاسخ طبیعی به قطع کردن صحبت در میان جمله نمی‌کرد. GPT-Live هر سه را در یک مدل واحد ادغام می‌کند که صدای خام را به‌صورت بلادرنگ پردازش می‌کند، درست مانند یک انسان که در طول مکالمه درگیر می‌ماند بدون اینکه مکث پردازشی داشته باشد.

GPT-Live واقعاً چه کاری انجام می‌دهد

سیستم از نوبت‌گیری طبیعی پشتیبانی می‌کند — از جمله نشانه‌های بازخورد مناسب مانند «ممم» یا سکوت در حالی که کاربر فکر می‌کند — و می‌تواند مکالمات ۳۰ تا ۴۰ دقیقه‌ای را حفظ کند، که افزایش قابل توجهی نسبت به تجربه صوتی قبلی است. هنگامی که سوال کاربر نیاز به جستجوی وب، استدلال عمیق‌تر یا کار عاملی پیچیده دارد، GPT-Live درخواست را به GPT-5.5 در پس‌زمینه ارسال می‌کند و نتیجه را بدون وقفه شنیداری به مکالمه صوتی بازمی‌گرداند. فرمت‌بندی بصری نیز پشتیبانی می‌شود: مدل‌ها می‌توانند اطلاعات را به‌صورت متن یا خروجی ساختاریافته روی صفحه در کنار پاسخ صوتی نمایش دهند.

اقدامات ایمنی داخلی به‌طور خودکار پاسخ‌های متناسب با سن را برای کاربران نوجوان اعمال می‌کنند و در مواقعی که مکالمات به موضوعاتی مانند خودآزاری نزدیک می‌شود، منابعی را ارائه می‌دهند.

عرضه و دسترسی

GPT-Live-1 mini اکنون تجربه صوتی پیش‌فرض برای همه کاربران ChatGPT است. مشترکین پولی به GPT-Live-1 دسترسی دارند، مدل بزرگ‌تر با عملکرد قوی‌تر در کارهای پیچیده. OpenAI هر دو مدل را برای رایج‌ترین زبان‌های جهان بهینه‌سازی کرده است.

یک ویژگی ترجمه زنده در طول عرضه نشان داده شد، هرچند یک دموی هندی به دلیل لهجه سنگین آمریکایی و ارائه غیرطبیعی توجه زیادی را جلب کرد — یادآوری اینکه کیفیت ترجمه بلادرنگ هنوز جای بهبود قابل توجهی دارد.

چرا این مهم است

OpenAI صدا را به‌عنوان «رابط اصلی محاسبات» برای کارهای طولانی و پیچیده توصیف می‌کند — چارچوبی که GPT-Live را به‌عنوان زیرساخت قرار می‌دهد نه یک ویژگی. بیش از ۱۵۰ میلیون نفر در حال حاضر از طریق Voice و Dictation با ChatGPT تعامل دارند. با ارائه یک مدل full-duplex به‌طور پیش‌فرض به همه کاربران — نه فقط یک لایه ویژگی — OpenAI شرط ساختاری می‌زند که تعامل صوتی محور با هوش مصنوعی برای استفاده اصلی آماده است.

این تغییر همچنین اهمیت رقابتی را برای Google's Gemini Live، لایه صوتی Apple Intelligence و سایر محصولات صوتی هوش مصنوعی که هنوز در حال تکرار قابلیت‌های مشابه هستند، افزایش می‌دهد.

همانطور که اولین بار توسط TechCrunch گزارش شد، GPT-Live-1 mini اکنون برای همه کاربران فعال است و GPT-Live-1 برای مشترکین پولی عرضه می‌شود.

Originally reported by TechCrunch. Read the original article for additional details.

View original source
اشتراک‌گذاری: