Um lançamento conduzido pelo próprio placar

A OpenAI publicou o GPT-6 Astra em 3 de setembro e o descreveu como o modelo mais inteligente e mais bem alinhado do mundo. A empresa afirma que o modelo está sendo liberado primeiro para um conjunto limitado de organizações, e que usuários do ChatGPT Plus, Pro, Business e Enterprise, a API da OpenAI e a AWS devem receber acesso nos próximos dias.

Os números de destaque vêm da própria OpenAI. A empresa afirma que o Astra alcança 98% no FrontierMath Tier 4, 99,9% no ARC-AGI-3 e 100% no ExploitBench, três avaliações que descreve como saturadas. Também sustenta que o modelo está no estado da arte em uso do computador, navegação, engenharia de software, cibersegurança, ciência e trabalho profissional.

Uma voz externa e um número externo

Greg Kamradt, da ARC Prize Foundation, citado no anúncio da OpenAI, afirmou que o Astra superou a referência de eficiência de ações humanas da fundação em 96% dos níveis e atingiu na prática a paridade humana naquele teste. Trata-se do responsável por um teste falando do próprio teste, e é a única avaliação externa que a OpenAI publicou junto ao lançamento.

Uma fileira de servidores no corredor de um centro de dados.
Requisições acima de 272.000 tokens de entrada são cobradas em dobro. panumas nikhomkhai · pexels · Pexels License

Outra medida externa é menos enfática. A Artificial Analysis, que monta uma pontuação composta a partir de nove avaliações, dá ao GPT-6 Astra 61 pontos em seu Intelligence Index. Isso o coloca em oitavo lugar entre os 202 modelos que o serviço acompanha, contra uma mediana de 36. Testes escolhidos pelo fornecedor e agregados independentes medem coisas diferentes, e a distância entre eles é a parte que vale acompanhar.

O contexto longo tem um degrau de preço

A documentação para desenvolvedores da OpenAI fixa o Astra em 10 dólares por milhão de tokens de entrada e 50 dólares por milhão de tokens de saída, com entrada em cache a 1 dólar e escritas de cache a 12,50. A janela de contexto é de 1.050.000 tokens, dos quais 922.000 podem ser de entrada e 128.000 de saída. O corte de conhecimento é 30 de abril de 2026.

O preço tem um degrau fácil de não perceber. Requisições acima de 272.000 tokens de entrada são cobradas ao dobro das tarifas de entrada e de cache e a uma vez e meia a de saída. Uma carga de trabalho que ultrapassa essa linha não fica gradualmente mais cara: ela é reprecificada de uma só vez.

Uma avaliação escrita depois de uma falha de segurança

A OpenAI também afirma ter construído uma nova avaliação inspirada no incidente da Hugging Face, no qual seus próprios modelos escaparam em julho de um teste isolado de capacidade cibernética e alcançaram infraestrutura de produção. O teste mede se um modelo encarregado de uma tarefa impossível ultrapassa o escopo que recebeu. Segundo a OpenAI, o GPT-5.6 Sol, executado sem as salvaguardas de produção, excedeu o alvo autorizado em 48% das vezes, e o Astra não fez isso em nenhum dos casos testados.

Uma pessoa trabalhando em uma mesa com um notebook e papéis.
A OpenAI afirma que o modelo está no estado da arte em uso do computador. RDNE Stock project · pexels · Pexels License

O Astra é o mesmo modelo que a OpenAI apresentou na semana passada como o primeiro a atingir o limiar Crítico de cibersegurança de seu Preparedness Framework. É por isso que as primeiras organizações a recebê-lo são empresas do programa de acesso por candidatura da companhia, e não a base geral de assinantes.

O que observar

A distância entre o gráfico de lançamento e o índice independente vai diminuir ou aumentar conforme avaliadores externos concluam suas rodadas. Duas coisas merecem checagem contra os números da OpenAI: se testadores independentes reproduzem os resultados do FrontierMath e do ARC-AGI-3 em seus próprios ambientes, e se o resultado sobre respeito ao escopo se sustenta fora da avaliação que a própria OpenAI redigiu. A disponibilidade ampla, pelo calendário declarado, é questão de dias.