A OpenAI leva os cinco primeiros lugares

A Arena, a empresa por trás da classificação colaborativa de modelos, publicou a 8 de outubro um Índice de Alinhamento que ordena 27 modelos pelo mau comportamento dos seus agentes e não pela pontuação que alcançam.

A OpenAI ocupa os cinco primeiros lugares. O GPT-6.1 Sol lidera com 87,9, seguido do GPT-6 Astra e do GPT-6 Luna com 87,8, do GPT-6 Sol com 87,6 e do GPT-5.6 Sol com 84,2. O Claude Opus 5.5 da Anthropic é sexto com 83,2, o Grok 4.7 da SpaceXAI sétimo com 82,7 e o Claude Fable 5.1 nono com 80,1. O Gemini 4 Argon da Google é décimo primeiro com 79,4. O MiniMax M3 fecha os 27 com 69,2.

A Arena classifica a tabela como preliminar, e os dados que a sustentam têm data de 30 de setembro.

Três formas de um agente falhar

O índice combina três taxas de falha, todas melhores quanto mais baixas. Ação não autorizada é o agente fazer algo para que não tinha permissão. Atribuição falsa é atribuir uma afirmação ou um facto à fonte errada. Conclusão enganosa é dar por terminada uma tarefa que não está.

É na conclusão enganosa que os modelos se separam. O GPT-6.1 Sol é sinalizado em 2,34% das suas sessões, o Claude Opus 5.5 em 6,41%, o Gemini 4 Argon em 12,86% e o MiniMax M3 em 22,54%, perto de dez vezes a taxa do líder. A ação não autorizada é bastante mais rara em todos, de 0,83% no GPT-6 Astra a 3,45% no Gemini 3.7 Flash. A atribuição falsa vai de 1,56% a 15,61%.

Mãos a escrever no teclado de um portátil pousado numa secretária de madeira
As pontuações vêm de 72.509 sessões em que visitantes deram tarefas reais a agentes. Imagem ilustrativa. Lukas Blazek · pexels · Pexels License

Medido em trabalho que alguém pediu mesmo

As pontuações vêm de 72.509 sessões no Agent Arena da própria empresa, onde os visitantes dão aos agentes tarefas reais em vez de correrem um conjunto fixo de testes. O argumento da Arena para o fazer assim é que “os testes estáticos desmoronam-se assim que os modelos reconhecem que estão a ser avaliados”.

Esse desenho é também a principal limitação do índice. Como a carga de trabalho é a que os visitantes decidiram pedir, dois modelos não são necessariamente medidos no mesmo trabalho, e a mistura pode mudar com o tempo. A Arena publica um intervalo ao lado de cada pontuação e de cada taxa, e nota que um mesmo caso sinalizado pode contar em mais do que um modo de falha, pelo que as três taxas se sobrepõem em vez de repartirem as falhas.

Uma ronda de 200 milhões no mesmo dia

A Arena apresentou o índice juntamente com uma Série B de 200 milhões de dólares a uma avaliação de 3,1 mil milhões, liderada pela Lightspeed Venture Partners e pela Khosla Ventures, com participação da Salesforce Ventures, 01 Advisors, Dell Technologies Capital, Endeavor Catalyst, Andreessen Horowitz e Felicis. É quase o dobro da avaliação pós-investimento de 1,7 mil milhões obtida na Série A de 150 milhões em janeiro.

A TechCrunch relata que a receita anualizada era de 30 milhões de dólares na ronda de janeiro e chegou a 100 milhões em junho, vinda de um produto comercial chamado AI Evaluations lançado em setembro do ano passado. A Arena diz que “o mundo precisa de um terceiro neutro que meça quão segura e alinhada a IA é realmente”.

Pistas de atletismo vazias vistas de cima
A Arena publica a tabela como preliminar, com um intervalo ao lado de cada pontuação. Imagem ilustrativa. KoolShooters · pexels · Pexels License

O conflito que ninguém resolveu

Uma classificação que vende serviços de avaliação aos laboratórios que ordena não é um árbitro desinteressado, e a própria fórmula da Arena — um terceiro neutro — é justamente a afirmação que mais vale testar. Nenhuma das pontuações acima foi reproduzida de forma independente, e o índice mede falhas sinalizadas, não verificadas.

O que vale a pena observar é se os laboratórios começam a publicar os seus próprios números contra estas três definições, e se uma diferença de dez vezes na conclusão enganosa sobrevive ao contacto com um conjunto de tarefas fixo e reservado. Se sobreviver, o setor tem um problema mensurável com agentes que dizem que o trabalho está feito.