Dois resultados, o mesmo conjunto de modelos
A Mercor publicou na quinta-feira referências humanas para um conjunto de tarefas contabilísticas simplificadas, e a comparação é desequilibrada. Doze contabilistas juniores, todos certificados e com uma média de cerca de cinco anos e meio de experiência, obtiveram em média 37 por cento em quatro cenários de fecho mensal, com resultados individuais entre zero e cerca de 90 por cento e tempos de 30 a 180 minutos por tarefa. A Mercor diz que o Claude Opus 5 obteve 100 por cento nas vinte tentativas, concluindo cada uma em menos de dez minutos.
Dezoito meses antes, diz a Mercor, os modelos ficavam abaixo da média humana nas mesmas tarefas.
Esse é um número. O outro está no teste completo de que estas tarefas foram simplificadas, e é bastante menos lisonjeiro.
O que diz a versão difícil
O APEX-Accounting, construído pela Mercor com a empresa de software financeiro Ramp, são 160 tarefas distribuídas por dez empresas simuladas, com uma média de 7,5 ficheiros de entrada por tarefa e 2.186 critérios de avaliação escritos por profissionais de contabilidade. Nessa suite, a tabela da Mercor coloca o Claude Opus 5.5 nos 61,8 por cento, o Fable 5.1 nos 61,0 e o GPT-6 Astra nos 57,9, cada um com uma margem de erro perto de quatro pontos.

Os números de consistência são a leitura mais dura. Cada modelo é corrido oito vezes por tarefa. O modelo mais consistente acertou uma tarefa nas oito corridas apenas 2,6 por cento das vezes, e nenhum modelo resolveu por completo perto de 60 por cento das tarefas em qualquer corrida. A Mercor diz que cerca de sete em cada dez falhas dos três melhores modelos são falhas de raciocínio, e não de encontrar um ficheiro ou seguir uma instrução.
Porque a distância entre os dois números é a notícia
As tarefas simplificadas isolam aquilo em que os modelos atuais são inequivocamente bons: ler muitos ficheiros com cuidado, não perder um número e fazer o que a instrução dizia. São competências contabilísticas reais, e um humano a executá-las à décima primeira hora seguida executa-as pior do que uma máquina que não tem décima primeira hora.
O que as tarefas simplificadas retiram é tudo o que torna um fecho difícil: o juízo sobre que número está errado, o telefonema a quem o lançou, o saber que este cliente em concreto regista sempre o acréscimo tarde. A Mercor di-lo explicitamente: os autores notam que as tarefas medem apenas um subconjunto de competências contabilísticas e excluem a comunicação com o cliente e o contexto tácito.

Essa ressalva carrega muito peso, e vale a pena mantê-la colada aos 100 por cento.
De quem é este teste
Nenhum dos dois números é independente. A Mercor é um mercado que vende trabalho humano especializado a laboratórios de IA exatamente para este tipo de dados, e a Ramp vende software financeiro. Um teste que mostra que os modelos estão perto mas não lá é um teste que defende mais dados de especialistas, que é o produto da Mercor. Isso não torna as medições erradas — as grelhas foram escritas por profissionais de grandes firmas de contabilidade, e a avaliação é feita por um juiz-modelo que a empresa diz coincidir com avaliadores humanos em 97 por cento dos casos — mas é a avaliação de um fornecedor sobre um mercado onde vende.
As tarefas são ainda fixas e públicas, o que significa que o seu valor se degrada à medida que entram nos dados de treino. 61,8 por cento em outubro de 2026 é uma afirmação sobre este mês.
O que há para acompanhar é a coluna Pass^8 em vez da média do título. Um modelo que fecha as contas corretamente seis vezes em oito não fechou as contas. Produziu algo que um controller ainda tem de verificar, que é precisamente a parte que os 100 por cento não cobrem.