آنتروپیک Claude Opus 5 را با رکوردشکنی در بنچمارکها و قیمت برابر Opus 4.8 عرضه کرد

آنتروپیک (Anthropic) در تاریخ ۲۴ ژوئیه ۲۰۲۶ از Claude Opus 5 رونمایی کرد؛ مدلی که عملکردی بهمراتب بهتر از نسل قبلی دارد، اما قیمت آن ثابت مانده است: ۵ دلار به ازای هر میلیون توکن ورودی و ۲۵ دلار به ازای هر میلیون توکن خروجی، دقیقاً برابر با Claude Opus 4.8.
نتایج بنچمارکهای بینظیر
در Frontier-Bench نسخه ۰.۱، که یک ارزیابی مهندسی نرمافزار توسط frontierbench.ai اداره میشود، Opus 5 از تمام مدلهای دیگر – از جمله Fable 5 خود آنتروپیک – پیشی گرفته است. فاصله با Opus 4.8 چشمگیر است: امتیاز Opus 5 بیش از دو برابر نسل قبلی است، در حالی که هزینه هر وظیفه تکمیلشده پایینتر است.
این الگو در طیف گستردهای از ارزیابیها تکرار میشود. در ARC-AGI 3، که توانایی حل مسائل کاملاً جدید را میسنجد، امتیاز Opus 5 سه برابر بالاتر از بهترین مدل بعدی است. در Zapier AutomationBench – که میسنجد آیا یک مدل میتواند وظایف واقعی کسبوکار را از ابتدا تا انتها انجام دهد – نرخ موفقیت آن تقریباً ۱.۵ برابر بالاتر از هر رقیبی است، حتی در پایینترین سطح تلاش. در OSWorld 2.0، یک بنچمارک استفاده از کامپیوتر، Opus 5 با صرف کمی بیش از یکسوم هزینه هر وظیفه Fable 5، از بهترین نتیجه آن مدل پیشی میگیرد. همچنین در GDPval-AA، یک ارزیابی دانش کاربردی و استدلال، پیشتاز است.
طراحیشده برای وظایف عاملی (Agentic) و بلندمدت
آنتروپیک Opus 5 را «متفکر و پیشفعال» توصیف میکند؛ این توصیف نشاندهنده تمرکز طراحی مدل بر وظایف عاملی طولانیمدت است: عاملهای نرمافزاری که ساعتها اجرا میشوند، موانع غیرمنتظره را مدیریت میکنند و بدون دخالت انسان از خطاها بازیابی میشوند. این مدل با پنجره زمینه (context window) ۱ میلیون توکن و حداکثر خروجی ۱۲۸,۰۰۰ توکن عرضه میشود – ظرفیتی که برای پایگاههای کد بزرگ و جلسات تحلیل طولانی اهمیت دارد.
دو ویژگی بتا نیز همزمان عرضه شدند: افزودن یا حذف پویای ابزارها در حین مکالمه، که امکان تغییر ابزارها را در طول اجرای یک عامل فراهم میکند؛ و حالت جایگزین برای ادامه فعالیت عاملها زمانی که ابزار ترجیحی در دسترس نیست.
تنظیم سطح تلاش برای کنترل هزینه
یک تنظیم تلاش قابلپیکربندی به توسعهدهندگان اجازه میدهد بین هزینه و قابلیت توازن برقرار کنند. در سطوح تلاش پایینتر، Opus 5 همچنان از بیشتر مدلهای موجود بهتر عمل میکند؛ در حداکثر تلاش، با حدود نصف هزینه هر وظیفه Fable 5، به سطح عملکرد پیشرو آن نزدیک میشود. آنتروپیک همچنین حداقل طول پرامپت قابلکش را از ۱,۰۲۴ توکن به ۵۱۲ توکن کاهش داده است؛ این تغییر باعث میشود پرامپتهای کوتاهتری که پیش از این نمیتوانستند از کش بهره بگیرند، اکنون صرفهجویی واقعی داشته باشند. پردازش دستهای (batch processing) نیز میتواند هزینهها را تا ۵۰٪ بیشتر کاهش دهد.
دستاوردهای علمی و ایمنی
در ارزیابیهای داخلی علوم زیستی آنتروپیک، Opus 5 در تمام حوزههای آزمایششده نسبت به Opus 4.8 بهبود نشان داده است. بیشترین پیشرفت در شیمی آلی – استنباط ساختارهای مولکولی از دادههای طیفسنجی – با ۱۰.۲ درصد امتیاز بالاتر، و در پیشبینی عملکرد پروتئین با ۷.۷ درصد افزایش ثبت شده است. آنتروپیک میگوید Opus 5 «همراستاترین مدل تا به امروز» از نظر ارزیابیهای رفتاری داخلی است، با پایبندی بالاتر به اصول هوش مصنوعی قانونی (constitutional AI) و نرخ سوءاستفاده پایینتر.
جایگاه آن در ردیف محصولات
Opus 5 به مدل پیشفرض جدید در Claude Max و قویترین مدل موجود در Claude Pro تبدیل میشود و در هر دو نقش جایگزین Opus 4.8 میشود. با این حال، در وظایف امنیت سایبری همچنان از Fable 5 و Mythos 5 عقبتر است، جایی که آن مدلها همچنان پیشتاز هستند. طبق اعلامیه آنتروپیک، Claude Opus 5 بلافاصله از طریق API و در Claude.ai در دسترس است.
Originally reported by Anthropic. Read the original article for additional details.
View original source