آنتروپیک Claude Opus 5 را با رکوردشکنی در بنچمارک‌ها و قیمت برابر Opus 4.8 عرضه کرد

Anthropic
اشتراک‌گذاری:
آنتروپیک Claude Opus 5 را با رکوردشکنی در بنچمارک‌ها و قیمت برابر Opus 4.8 عرضه کرد

آنتروپیک (Anthropic) در تاریخ ۲۴ ژوئیه ۲۰۲۶ از Claude Opus 5 رونمایی کرد؛ مدلی که عملکردی به‌مراتب بهتر از نسل قبلی دارد، اما قیمت آن ثابت مانده است: ۵ دلار به ازای هر میلیون توکن ورودی و ۲۵ دلار به ازای هر میلیون توکن خروجی، دقیقاً برابر با Claude Opus 4.8.

نتایج بنچمارک‌های بی‌نظیر

در Frontier-Bench نسخه ۰.۱، که یک ارزیابی مهندسی نرم‌افزار توسط frontierbench.ai اداره می‌شود، Opus 5 از تمام مدل‌های دیگر – از جمله Fable 5 خود آنتروپیک – پیشی گرفته است. فاصله با Opus 4.8 چشمگیر است: امتیاز Opus 5 بیش از دو برابر نسل قبلی است، در حالی که هزینه هر وظیفه تکمیل‌شده پایین‌تر است.

این الگو در طیف گسترده‌ای از ارزیابی‌ها تکرار می‌شود. در ARC-AGI 3، که توانایی حل مسائل کاملاً جدید را می‌سنجد، امتیاز Opus 5 سه برابر بالاتر از بهترین مدل بعدی است. در Zapier AutomationBench – که می‌سنجد آیا یک مدل می‌تواند وظایف واقعی کسب‌وکار را از ابتدا تا انتها انجام دهد – نرخ موفقیت آن تقریباً ۱.۵ برابر بالاتر از هر رقیبی است، حتی در پایین‌ترین سطح تلاش. در OSWorld 2.0، یک بنچمارک استفاده از کامپیوتر، Opus 5 با صرف کمی بیش از یک‌سوم هزینه هر وظیفه Fable 5، از بهترین نتیجه آن مدل پیشی می‌گیرد. همچنین در GDPval-AA، یک ارزیابی دانش کاربردی و استدلال، پیشتاز است.

طراحی‌شده برای وظایف عاملی (Agentic) و بلندمدت

آنتروپیک Opus 5 را «متفکر و پیش‌فعال» توصیف می‌کند؛ این توصیف نشان‌دهنده تمرکز طراحی مدل بر وظایف عاملی طولانی‌مدت است: عامل‌های نرم‌افزاری که ساعت‌ها اجرا می‌شوند، موانع غیرمنتظره را مدیریت می‌کنند و بدون دخالت انسان از خطاها بازیابی می‌شوند. این مدل با پنجره زمینه (context window) ۱ میلیون توکن و حداکثر خروجی ۱۲۸,۰۰۰ توکن عرضه می‌شود – ظرفیتی که برای پایگاه‌های کد بزرگ و جلسات تحلیل طولانی اهمیت دارد.

دو ویژگی بتا نیز همزمان عرضه شدند: افزودن یا حذف پویای ابزارها در حین مکالمه، که امکان تغییر ابزارها را در طول اجرای یک عامل فراهم می‌کند؛ و حالت جایگزین برای ادامه فعالیت عامل‌ها زمانی که ابزار ترجیحی در دسترس نیست.

تنظیم سطح تلاش برای کنترل هزینه

یک تنظیم تلاش قابل‌پیکربندی به توسعه‌دهندگان اجازه می‌دهد بین هزینه و قابلیت توازن برقرار کنند. در سطوح تلاش پایین‌تر، Opus 5 همچنان از بیشتر مدل‌های موجود بهتر عمل می‌کند؛ در حداکثر تلاش، با حدود نصف هزینه هر وظیفه Fable 5، به سطح عملکرد پیشرو آن نزدیک می‌شود. آنتروپیک همچنین حداقل طول پرامپت قابل‌کش را از ۱,۰۲۴ توکن به ۵۱۲ توکن کاهش داده است؛ این تغییر باعث می‌شود پرامپت‌های کوتاه‌تری که پیش از این نمی‌توانستند از کش بهره بگیرند، اکنون صرفه‌جویی واقعی داشته باشند. پردازش دسته‌ای (batch processing) نیز می‌تواند هزینه‌ها را تا ۵۰٪ بیشتر کاهش دهد.

دستاوردهای علمی و ایمنی

در ارزیابی‌های داخلی علوم زیستی آنتروپیک، Opus 5 در تمام حوزه‌های آزمایش‌شده نسبت به Opus 4.8 بهبود نشان داده است. بیشترین پیشرفت در شیمی آلی – استنباط ساختارهای مولکولی از داده‌های طیف‌سنجی – با ۱۰.۲ درصد امتیاز بالاتر، و در پیش‌بینی عملکرد پروتئین با ۷.۷ درصد افزایش ثبت شده است. آنتروپیک می‌گوید Opus 5 «هم‌راستاترین مدل تا به امروز» از نظر ارزیابی‌های رفتاری داخلی است، با پایبندی بالاتر به اصول هوش مصنوعی قانونی (constitutional AI) و نرخ سوءاستفاده پایین‌تر.

جایگاه آن در ردیف محصولات

Opus 5 به مدل پیش‌فرض جدید در Claude Max و قوی‌ترین مدل موجود در Claude Pro تبدیل می‌شود و در هر دو نقش جایگزین Opus 4.8 می‌شود. با این حال، در وظایف امنیت سایبری همچنان از Fable 5 و Mythos 5 عقب‌تر است، جایی که آن مدل‌ها همچنان پیشتاز هستند. طبق اعلامیه آنتروپیک، Claude Opus 5 بلافاصله از طریق API و در Claude.ai در دسترس است.

Originally reported by Anthropic. Read the original article for additional details.

View original source
اشتراک‌گذاری:
آنتروپیک Claude Opus 5 را با رکوردشکنی در بنچمارک‌ها و قیمت برابر Opus 4.8 عرضه کرد | AIO APEX