آنتروپیک مدل Claude Opus 5.5 را با کاهش ۴۰ درصدی هزینه و بهترین نمرات ایمنی تا به امروز معرفی کرد

آنتروپیک مدل Claude Opus 5.5 را معرفی کرد؛ اولین مدل از نسل ۵.۵ که طبق اعلام این شرکت، توانمندترین و ایمنترین مدل منتشرشده تا به امروز است. این اعلامیه چند هفته پس از انتشار مقاله «پیشی گرفتن از مرز» توسط CEO آنتروپیک، داریو آمودئی، منتشر میشود که در آن خواستار هماهنگی استانداردهای ایمنی هوش مصنوعی میان آزمایشگاههای بزرگ شده بود.
Opus 5.5 در تمام معیارهایی که آنتروپیک اندازه میگیرد، پیشرفت قابل توجهی نسبت به Opus 5 دارد. این مدل در ارزیابیهای داخلی در کدنویسی Agent محور، استفاده از کامپیوتر و کارهای دانشی پیشتاز است — با امتیاز ۶۶.۴ درصد در Terminal-Bench 4.0، در مقابل ۵۷.۹ درصد GPT-6 Astra و ۵۲.۳ درصد Opus 5.
آزمایشهای واقعی این پیشرفت را تأیید میکنند: یک تستر خارجی مهاجرت ۶۸۰,۰۰۰ خط کد را در کمتر از یک روز انجام داد — کاری که آنتروپیک میگوید برای یک تیم مهندسی هفتهها طول میکشید. در آزمایش دیگری، Opus 5.5 در ۳۹ مورد از ۴۰ مورد زمان بارگذاری تمام صفحات یک اپلیکیشن وب را بدون تغییر در رفتار آن کاهش داد.
قیمتگذاری نیز کاهش قابل توجهی داشته است. توکنهای ورودی و خروجی به ترتیب ۴ و ۲۰ دلار به ازای هر میلیون توکن قیمتگذاری شدهاند — ۲۰ درصد کمتر از Opus 5. خواندن Cache که بیشترین هزینه را در بارهای کاری Agent محور دارد، به ۰.۲۰ دلار به ازای هر میلیون توکن رسیده، یعنی ۶۰ درصد کاهش. آنتروپیک همچنین اعلام کرد Opus 5.5 بیش از ۳۰ درصد سریعتر از نسل قبلی خروجی تولید میکند.
ایمنی مهمترین موضوع در اعلامیه آنتروپیک است. Opus 5.5 بالاترین امتیازات ثبتشده در آزمون رفتاری خودکار این شرکت را کسب کرده — مجموعهای که مدل را در هزاران سناریوی شبیهسازیشده آزمایش میکند. این مدل کمتر از Opus 5 اقدامات غیرقابل بازگشت انجام میدهد، در برابر prompt injection مقاومتر است و بهتر در محدودههای تعیینشده باقی میماند. ارزیابان خارجی Frontier Design و METR پیش از انتشار، این مدل را آزمایش کردند.
مدلهای Claude Sonnet 5.5 و Haiku 5.5 طی هفتههای آینده منتشر میشوند و خانواده مدلهای ۵.۵ را کامل میکنند.
در ابتدا توسط Anthropic گزارش شده است. برای جزئیات بیشتر مقالهٔ اصلی را بخوانید.
مشاهدهٔ منبع اصلی