AIO APEX

Arena, o leaderboard de AI, capta 200 milhões de dólares em Série B com avaliação de 3,1 mil milhões, duplicando em 10 meses

TechCrunch
Compartilhar:
Arena, o leaderboard de AI, capta 200 milhões de dólares em Série B com avaliação de 3,1 mil milhões, duplicando em 10 meses

A Arena, plataforma de avaliação de modelos de AI nascida de um projeto de investigação da UC Berkeley, captou 200 milhões de dólares numa Série B com uma avaliação de 3,1 mil milhões de dólares — quase o dobro dos 1,7 mil milhões a que foi avaliada na sua Série A há apenas dez meses. A Lightspeed Venture Partners e a Khosla Ventures lideraram a ronda, com participação da Salesforce Ventures, a16z, Felicis, Dell Technologies Capital, 01 Advisors e Endeavor Catalyst.

A empresa atingiu 100 milhões de dólares em receita anualizada em junho de 2026, face aos 30 milhões no momento da Série A — um salto de 3x nas receitas que está a impulsionar a aceleração da avaliação.

A Arena começou em 2023 como um experimento gratuito de crowdsourcing: mostrar as respostas de dois modelos de AI lado a lado e perguntar anonimamente aos utilizadores qual é melhor. Esta abordagem, denominada «chatbot arena», conta hoje com dezenas de milhões de visitantes mensais que votam coletivamente sobre a qualidade dos modelos numa variedade de tarefas. Os dados tornaram-se um dos benchmarks mais citados em AI — laboratórios da Anthropic à Google referem-no ao anunciar novos modelos.

O produto comercial chama-se AI Evaluations, lançado em setembro de 2025, e fornece a laboratórios de modelos e empresas análises de desempenho derivadas dessa retroalimentação comunitária. O argumento central: os benchmarks estáticos estão a perder relevância porque os laboratórios de AI aprenderam a otimizá-los, e os modelos conseguem até detetar quando estão a ser testados em suites padrão. A avaliação no mundo real, orientada pelos utilizadores, é muito mais difícil de manipular.

A Arena expandiu recentemente o seu leaderboard para incluir uma categoria de alinhamento, classificando modelos segundo ações não autorizadas, atribuição falsa e o que designa por «deceptive completion». Nessas classificações preliminares, os modelos da OpenAI ocupam os primeiros lugares; o Claude Opus 5.5 ficou em sexto e o Claude Fable em nono.

O financiamento reflete a convicção crescente dos investidores de que a avaliação independente de AI é um negócio duradouro, e não uma lacuna temporária que os próprios laboratórios fecharão. À medida que a implementação de AI nas empresas se acelera, espera-se que a procura por garantia de qualidade por terceiros — especialmente em setores regulados — cresça em paralelo.

Conforme noticiado em primeira mão pela TechCrunch, a ronda fechou em outubro de 2026.

Publicado originalmente por TechCrunch. Leia o artigo original para mais detalhes.

Ver fonte original
Compartilhar: