Anthropic تطلق Claude Opus 5 بأرقام قياسية في الـBenchmark بنفس سعر Opus 4.8

Anthropic
مشاركة:
Anthropic تطلق Claude Opus 5 بأرقام قياسية في الـBenchmark بنفس سعر Opus 4.8

أصدرت Anthropic نموذج Claude Opus 5 في 24 يوليو 2026، وهو نموذج يقدم أداءً أفضل بشكل كبير من سابقه مع الحفاظ على نفس السعر: 5 دولارات لكل مليون Token إدخال و25 دولارًا لكل مليون Token إخراج، مطابق لـ Claude Opus 4.8.

نتائج Benchmark تتفرد بها

في Frontier-Bench v0.1، تقييم الهندسة البرمجية الذي يديره frontierbench.ai، يتصدر Opus 5 كل النماذج الأخرى – بما في ذلك Fable 5 من Anthropic نفسها. الفجوة مع Opus 4.8 واضحة: Opus 5 يضاعف أكثر من ضعفي نتيجة سابقه بينما يكلف أقل لكل مهمة مكتملة.

نفس النمط يتكرر عبر مجموعة من التقييمات. في ARC-AGI 3، الذي يقيس حل المشكلات الجديدة الحقيقية، يسجل Opus 5 ثلاث مرات أعلى من أفضل نموذج تالٍ. في Zapier AutomationBench – الذي يختبر ما إذا كان النموذج يمكنه إكمال مهام الأعمال الحقيقية من البداية إلى النهاية – فإن نسبة نجاحه أفضل بحوالي 1.5 مرة من أي منافس، حتى في أقل إعدادات الجهد. في OSWorld 2.0، وهو Benchmark لاستخدام الكمبيوتر، يتجاوز Opus 5 أفضل نتيجة لـ Fable 5 بأكثر بقليل من ثلث تكلفة Fable 5 لكل مهمة. كما يتصدر في GDPval-AA، وهو تقييم للمعرفة التطبيقية والاستدلال.

مُصمم للعمل الوكيل وطويل الأمد

تصف Anthropic Opus 5 بأنه "مدروس واستباقي"، وهي لغة تعكس تركيز تصميمه على المهام الوكيلة الممتدة: وكلاء برمجيون يعملون لساعات، ويواجهون عقبات غير متوقعة، ويتعافون من الأخطاء دون تدخل بشري. يأتي مع نافذة سياقية تبلغ مليون Token وحد أقصى للإخراج يبلغ 128,000 Token – وهو هامش مهم لقواعد البيانات الكبيرة وجلسات التحليل الممتدة.

تم إطلاق ميزتين تجريبيتين معه: تغييرات الأدوات في منتصف المحادثة، والتي تسمح بإضافة الأدوات أو إزالتها ديناميكيًا أثناء تشغيل وكيل، ووضع احتياطي "افتراضي" للحفاظ على عمل الوكلاء عندما تصبح الأداة المفضلة غير متاحة.

مقياس الجهد للتحكم في التكلفة

يتيح إعداد جهد قابل للتكوين للمطورين الموازنة بين التكلفة والقدرات. في إعدادات الجهد المنخفضة، لا يزال Opus 5 يتفوق على معظم النماذج المتاحة الأخرى؛ عند أقصى جهد، يقترب من قدرة Fable 5 الحدودية بتكلفة نصف لكل مهمة تقريبًا. كما خفضت Anthropic الحد الأدنى لطول الـPrompt القابل للتخزين المؤقت من 1,024 Token إلى 512 Token، مما يحقق توفيرًا حقيقيًا على الـPrompts الأقصر التي لم تستفد سابقًا من التخزين المؤقت. يمكن أن تخفض المعالجة المجمعة التكاليف بنسبة تصل إلى 50% إضافية.

مكاسب علمية وسلامة

في تقييمات علوم الحياة الداخلية لـAnthropic، يحسن Opus 5 الأداء مقارنة بـ Opus 4.8 في كل مجال تم اختباره. أكبر المكاسب في الكيمياء العضوية – استنتاج الهياكل الجزيئية من بيانات التحليل الطيفي، حيث يسجل Opus 5 أعلى بنسبة 10.2 نقطة مئوية – والتنبؤ بوظيفة البروتين، حيث يسجل أعلى بنسبة 7.7 نقطة مئوية. تقول Anthropic إن Opus 5 هو "أكثر نماذجها توافقًا حتى الآن" في عمليات التدقيق السلوكي الداخلي، مع التزام أعلى بمبادئ AI الدستورية ومعدلات إساءة استخدام أقل.

موقعه في التشكيلة

يصبح Opus 5 النموذج الافتراضي الجديد على Claude Max والأقوى المتاح على Claude Pro، ليحل محل Opus 4.8 في كلا الدورين. لا يزال متخلفًا عن Fable 5 و Mythos 5 في مهام الأمن السيبراني، حيث تحتفظ تلك النماذج الحدودية بالميزة. وفقًا لإعلان Anthropic، فإن Claude Opus 5 متاح فورًا عبر API وعلى Claude.ai.

Originally reported by Anthropic. Read the original article for additional details.

View original source
مشاركة: