Arena، پلتفرم رتبهبندی مدلهای AI، در دور Series B مبلغ ۲۰۰ میلیون دلار جمعآوری کرد و ارزشگذاریاش به ۳.۱ میلیارد دلار رسید

Arena، پلتفرم ارزیابی مدلهای AI که از دل یک پروژه پژوهشی UC Berkeley بیرون آمد، در دور تأمین مالی Series B خود ۲۰۰ میلیون دلار با ارزشگذاری ۳.۱ میلیارد دلار جذب کرد — این رقم تقریباً دو برابر ارزش ۱.۷ میلیارد دلاری این شرکت در دور Series A فقط ده ماه پیش است. Lightspeed Venture Partners و Khosla Ventures این دور را رهبری کردند و Salesforce Ventures، a16z، Felicis، Dell Technologies Capital، 01 Advisors و Endeavor Catalyst نیز در آن شرکت داشتند.
این شرکت در ژوئن ۲۰۲۶ به درآمد سالانهشده ۱۰۰ میلیون دلاری رسید؛ در مقایسه با ۳۰ میلیون دلار در زمان Series A — رشد ۳ برابری درآمد که موتور محرک شتاب ارزشگذاری است.
Arena در سال ۲۰۲۳ بهعنوان یک آزمایش جمعسپاری رایگان آغاز به کار کرد: پاسخهای دو مدل AI را در کنار هم نشان بده و بهصورت ناشناس از کاربران بخواه کدام بهتر است. این رویکرد که «chatbot arena» نام گرفته، اکنون دهها میلیون بازدیدکننده ماهانه دارد که در مجموع روی کیفیت مدلها در طیف گستردهای از وظایف رأی میدهند. این دادهها به یکی از پُراستنادترین benchmarkهای حوزه AI تبدیل شدهاند — آزمایشگاههایی از Anthropic تا Google هنگام معرفی مدلهای جدید به آن استناد میکنند.
محصول تجاری این شرکت «AI Evaluations» نام دارد که در سپتامبر ۲۰۲۵ راهاندازی شد و به آزمایشگاههای مدل و شرکتهای بزرگ، تحلیلهای عملکردی مبتنی بر بازخورد جامعه کاربری ارائه میدهد. استدلال اصلی این است که benchmarkهای ایستا دارند سیگنال خود را از دست میدهند؛ چرا که آزمایشگاههای AI یاد گرفتهاند برای آنها بهینهسازی کنند و مدلها حتی میتوانند تشخیص دهند که روی مجموعههای استاندارد آزمایش میشوند. ارزیابی واقعبینانه و کاربرمحور سختتر میتوان دستکاری کرد.
Arena اخیراً leaderboard خود را با افزودن دستهبندی alignment گسترش داده و مدلها را بر اساس اقدامات غیرمجاز، انتساب نادرست و آنچه «deceptive completion» مینامد رتبهبندی میکند. در این رتبهبندیهای اولیه، مدلهای OpenAI رتبههای برتر را در اختیار دارند؛ Claude Opus 5.5 در رتبه ششم و Claude Fable در رتبه نهم قرار گرفتند.
این تأمین مالی بازتاب اطمینان فزاینده سرمایهگذاران است که ارزیابی مستقل AI یک کسبوکار ماندگار است، نه یک خلأ موقت که آزمایشگاههای مدل خودشان پر کنند. با شتاب گرفتن استقرار AI در شرکتها، تقاضا برای تضمین کیفیت توسط اشخاص ثالث — بهویژه در صنایع تحت نظارت — انتظار میرود به موازات آن رشد کند.
این دور، که نخستین بار توسط TechCrunch گزارش شد، در اکتبر ۲۰۲۶ بسته شد.
در ابتدا توسط TechCrunch گزارش شده است. برای جزئیات بیشتر مقالهٔ اصلی را بخوانید.
مشاهدهٔ منبع اصلی