A startup Arena, que começou como um projeto de pesquisa na Universidade da Califórnia em Berkeley em 2023, captou uma rodada Série B de duzentos milhões de dólares, alcançando uma valorização de três bilhões e cem milhões de dólares. O investimento foi anunciado nesta quinta-feira e marca um crescimento expressivo da empresa no mercado de inteligência artificial.
A companhia revelou que atingiu uma receita anualizada de cem milhões de dólares em junho deste ano. A rodada foi liderada pelas venture capitals Lightspeed Venture Partners e Khosla Ventures, com participação de investidores como Salesforce Ventures, 01 Advisors, Dell Technologies Capital, Endeavor Catalyst, Andreessen Horowitz, Felicis e outros fundos.
Apenas dez meses antes, em janeiro, a Arena havia levantado cento e cinquenta milhões de dólares numa rodada Série A, que atribuiu à empresa um valuation pós-money de um bilhão e setecentos milhões de dólares. Na época, a startup declarava uma receita anualizada de trinta milhões de dólares, o que significa que sua valorização quase dobrou em aproximadamente dez meses.
A plataforma oferece um sistema gratuito e colaborativo onde consumidores podem inserir comandos e solicitar projetos desenvolvidos por inteligência artificial, atribuindo notas para avaliar qual modelo apresenta melhor desempenho. A empresa afirma receber dezenas de milhões de visitantes mensais em seu site.
Em setembro do ano passado, a startup lançou seu produto comercial, denominado Avaliações de IA. O serviço fornece laboratórios de inteligência artificial e empresas com análises detalhadas de desempenho, baseadas nos feedbacks da comunidade usuária. A timing foi perfeita, pois neste ano as empresas de IA perceberam que seus modelos estavam manipulando testes de referência para obter boas pontuações sem realmente merecê-las.
Simultaneamente, as empresas demonstraram interesse em bantuan para identificar qual modelo atende melhor às suas necessidades internas, em vez de depender exclusivamente de benchmarks padronizados. A Arena declarou em seu comunicado de investimento que a inteligência artificial está evoluindo mais rapidamente do que a capacidade de avaliá-la, e que referências estáticas perdem eficácia quando os modelos percebem que estão sendo testados.
Com isso, a plataforma decidiu assumir o papel de terceiro neutro para medir o quão segura e alinhada a inteligência artificial realmente é quando está nas mãos de pessoas reais. A empresa também adicionou uma nova categoria ao seu ranking, chamada alinhamento. Nessa seção, os modelos são avaliados conforme critérios como ação não autorizada, quando o sistema executa tarefas que não lhe foram solicitadas; atribuição incorreta, quando credita declarações ou fatos a fontes erradas; e conclusão enganosa, quando mente sobre a conclusão de tarefas que não realizou.
Atualmente, diversos modelos da OpenAI ocupam as primeiras posições no ranking preliminar de alinhamento, enquanto os modelos Claude Opus 5.5 e Claude Fable aparecem na sexta e nona posições, respectivamente.
Fonte: TechCrunch