AIO APEX

AI-Leaderboard Arena sammelt 200 Millionen Dollar in Series B bei einer Bewertung von 3,1 Milliarden — Verdoppelung in 10 Monaten

TechCrunch
Teilen:
AI-Leaderboard Arena sammelt 200 Millionen Dollar in Series B bei einer Bewertung von 3,1 Milliarden — Verdoppelung in 10 Monaten

Arena, die aus einem Forschungsprojekt der UC Berkeley hervorgegangene Plattform zur Bewertung von AI-Modellen, hat in einer Series B 200 Millionen Dollar bei einer Bewertung von 3,1 Milliarden Dollar eingesammelt — fast das Doppelte der 1,7 Milliarden Dollar, mit denen das Unternehmen vor gerade einmal zehn Monaten in der Series A bewertet wurde. Lightspeed Venture Partners und Khosla Ventures führten die Runde an; Salesforce Ventures, a16z, Felicis, Dell Technologies Capital, 01 Advisors und Endeavor Catalyst beteiligten sich ebenfalls.

Im Juni 2026 erreichte das Unternehmen einen annualisierten Umsatz von 100 Millionen Dollar, gegenüber 30 Millionen Dollar zum Zeitpunkt der Series A — ein dreifacher Umsatzsprung, der die Bewertungsbeschleunigung antreibt.

Arena startete 2023 als kostenloses Crowdsourcing-Experiment: Zwei AI-Modelle zeigen ihre Antworten nebeneinander, und die Nutzer entscheiden anonym, welche besser ist. Dieser als «Chatbot Arena» bekannte Ansatz zieht inzwischen zig Millionen monatliche Besucher an, die gemeinsam über die Modellqualität bei einer Vielzahl von Aufgaben abstimmen. Die Daten haben sich zu einem der meistzitierten Benchmarks in der AI-Branche entwickelt — Labore von Anthropic bis Google verweisen bei der Vorstellung neuer Modelle darauf.

Das kommerzielle Produkt heißt AI Evaluations, wurde im September 2025 eingeführt und liefert Modelllaboren und Unternehmen Leistungsanalysen, die aus diesem Community-Feedback abgeleitet werden. Das zentrale Argument: Statische Benchmarks verlieren an Aussagekraft, weil AI-Labore gelernt haben, ihre Modelle darauf zu optimieren — und Modelle können sogar erkennen, wenn sie auf Standardsuiten getestet werden. Reale, nutzergetriebene Evaluation lässt sich deutlich schwerer manipulieren.

Arena hat sein Leaderboard kürzlich um eine Alignment-Kategorie erweitert, in der Modelle nach unautorisierten Aktionen, falscher Zuschreibung und sogenannter «Deceptive Completion» bewertet werden. In diesen vorläufigen Rankings belegen OpenAI-Modelle die Spitzenplätze; Claude Opus 5.5 landete auf Platz sechs, Claude Fable auf Platz neun.

Die Finanzierung spiegelt die wachsende Überzeugung der Investoren wider, dass unabhängige AI-Evaluation ein dauerhaftes Geschäftsmodell ist — und keine vorübergehende Lücke, die die Modelllabore selbst schließen werden. Mit dem sich beschleunigenden AI-Einsatz in Unternehmen dürfte die Nachfrage nach externer Qualitätssicherung — insbesondere in regulierten Branchen — entsprechend steigen.

Wie TechCrunch zuerst berichtete, wurde die Runde im Oktober 2026 abgeschlossen.

Ursprünglich berichtet von TechCrunch. Lesen Sie den Originalartikel für weitere Details.

Originalquelle ansehen
Teilen: