Arena، پلتفرم رتبه‌بندی مدل‌های AI، در دور Series B مبلغ ۲۰۰ میلیون دلار جمع‌آوری کرد و ارزش‌گذاری‌اش به ۳.۱ میلیارد دلار رسید

TechCrunch
اشتراک‌گذاری:
Arena، پلتفرم رتبه‌بندی مدل‌های AI، در دور Series B مبلغ ۲۰۰ میلیون دلار جمع‌آوری کرد و ارزش‌گذاری‌اش به ۳.۱ میلیارد دلار رسید

Arena، پلتفرم ارزیابی مدل‌های AI که از دل یک پروژه پژوهشی UC Berkeley بیرون آمد، در دور تأمین مالی Series B خود ۲۰۰ میلیون دلار با ارزش‌گذاری ۳.۱ میلیارد دلار جذب کرد — این رقم تقریباً دو برابر ارزش ۱.۷ میلیارد دلاری این شرکت در دور Series A فقط ده ماه پیش است. Lightspeed Venture Partners و Khosla Ventures این دور را رهبری کردند و Salesforce Ventures، a16z، Felicis، Dell Technologies Capital، 01 Advisors و Endeavor Catalyst نیز در آن شرکت داشتند.

این شرکت در ژوئن ۲۰۲۶ به درآمد سالانه‌شده ۱۰۰ میلیون دلاری رسید؛ در مقایسه با ۳۰ میلیون دلار در زمان Series A — رشد ۳ برابری درآمد که موتور محرک شتاب ارزش‌گذاری است.

Arena در سال ۲۰۲۳ به‌عنوان یک آزمایش جمع‌سپاری رایگان آغاز به کار کرد: پاسخ‌های دو مدل AI را در کنار هم نشان بده و به‌صورت ناشناس از کاربران بخواه کدام بهتر است. این رویکرد که «chatbot arena» نام گرفته، اکنون ده‌ها میلیون بازدیدکننده ماهانه دارد که در مجموع روی کیفیت مدل‌ها در طیف گسترده‌ای از وظایف رأی می‌دهند. این داده‌ها به یکی از پُراستنادترین benchmark‌های حوزه AI تبدیل شده‌اند — آزمایشگاه‌هایی از Anthropic تا Google هنگام معرفی مدل‌های جدید به آن استناد می‌کنند.

محصول تجاری این شرکت «AI Evaluations» نام دارد که در سپتامبر ۲۰۲۵ راه‌اندازی شد و به آزمایشگاه‌های مدل و شرکت‌های بزرگ، تحلیل‌های عملکردی مبتنی بر بازخورد جامعه کاربری ارائه می‌دهد. استدلال اصلی این است که benchmark‌های ایستا دارند سیگنال خود را از دست می‌دهند؛ چرا که آزمایشگاه‌های AI یاد گرفته‌اند برای آن‌ها بهینه‌سازی کنند و مدل‌ها حتی می‌توانند تشخیص دهند که روی مجموعه‌های استاندارد آزمایش می‌شوند. ارزیابی واقع‌بینانه و کاربرمحور سخت‌تر می‌توان دستکاری کرد.

Arena اخیراً leaderboard خود را با افزودن دسته‌بندی alignment گسترش داده و مدل‌ها را بر اساس اقدامات غیرمجاز، انتساب نادرست و آنچه «deceptive completion» می‌نامد رتبه‌بندی می‌کند. در این رتبه‌بندی‌های اولیه، مدل‌های OpenAI رتبه‌های برتر را در اختیار دارند؛ Claude Opus 5.5 در رتبه ششم و Claude Fable در رتبه نهم قرار گرفتند.

این تأمین مالی بازتاب اطمینان فزاینده سرمایه‌گذاران است که ارزیابی مستقل AI یک کسب‌وکار ماندگار است، نه یک خلأ موقت که آزمایشگاه‌های مدل خودشان پر کنند. با شتاب گرفتن استقرار AI در شرکت‌ها، تقاضا برای تضمین کیفیت توسط اشخاص ثالث — به‌ویژه در صنایع تحت نظارت — انتظار می‌رود به موازات آن رشد کند.

این دور، که نخستین بار توسط TechCrunch گزارش شد، در اکتبر ۲۰۲۶ بسته شد.

در ابتدا توسط TechCrunch گزارش شده است. برای جزئیات بیشتر مقالهٔ اصلی را بخوانید.

مشاهدهٔ منبع اصلی
اشتراک‌گذاری: