Arena, el leaderboard de AI, recauda 200 millones de dólares en una Serie B con valoración de 3.100 millones, duplicándose en 10 meses

Arena, la plataforma de evaluación de modelos de AI nacida de un proyecto de investigación de UC Berkeley, ha recaudado 200 millones de dólares en una Serie B con una valoración de 3.100 millones de dólares — casi el doble de los 1.700 millones a los que fue valorada en su Serie A hace apenas diez meses. Lightspeed Venture Partners y Khosla Ventures lideraron la ronda, con la participación de Salesforce Ventures, a16z, Felicis, Dell Technologies Capital, 01 Advisors y Endeavor Catalyst.
La compañía alcanzó los 100 millones de dólares en ingresos anualizados en junio de 2026, frente a los 30 millones en el momento de la Serie A — un salto de tres veces en ingresos que está impulsando la aceleración de su valoración.
Arena nació en 2023 como un experimento gratuito de crowdsourcing: mostrar las respuestas de dos modelos de AI en paralelo y preguntar a los usuarios de forma anónima cuál es mejor. Ese enfoque, denominado «chatbot arena», cuenta ahora con decenas de millones de visitantes mensuales que votan colectivamente sobre la calidad de los modelos en una amplia gama de tareas. Los datos se han convertido en uno de los benchmarks más citados en AI — laboratorios desde Anthropic hasta Google lo referencian al anunciar nuevos modelos.
El producto comercial se llama AI Evaluations, lanzado en septiembre de 2025, y ofrece a laboratorios de modelos y empresas análisis de rendimiento derivados de esa retroalimentación comunitaria. El argumento central: los benchmarks estáticos están perdiendo fiabilidad porque los laboratorios de AI han aprendido a optimizar para ellos, e incluso los modelos pueden detectar cuándo están siendo evaluados con suites estándar. La evaluación en el mundo real, impulsada por usuarios, es más difícil de manipular.
Arena amplió recientemente su leaderboard para incluir una categoría de alineamiento, clasificando modelos según acciones no autorizadas, atribución falsa y lo que denomina «deceptive completion». En esas clasificaciones preliminares, los modelos de OpenAI ocupan los primeros puestos; Claude Opus 5.5 quedó en sexto lugar y Claude Fable en noveno.
La financiación refleja la creciente convicción de los inversores de que la evaluación independiente de AI es un negocio duradero, no una brecha temporal que los propios laboratorios cerrarán. A medida que la implantación de AI en las empresas se acelera, se espera que la demanda de garantía de calidad por parte de terceros — especialmente en sectores regulados — crezca a la par.
Según informó TechCrunch por primera vez, la ronda se cerró en octubre de 2026.
Publicado originalmente por TechCrunch. Lee el artículo original para más detalles.
Ver fuente original