Trabalho quase ao nível do Astra, a preço de Sol

A OpenAI lançou na segunda-feira o GPT-6.1 Sol, uma atualização do modelo GPT-6 Sol publicado uma semana antes, e afirma que ele quase iguala o seu modelo principal GPT-6 Astra em programação com agentes, uso do computador e trabalho profissional, por um quinto dos preços padrão de entrada e saída do Astra.

O momento é significativo. No domingo, a empresa confirmou que não lançaria o GPT-6.1 Astra, depois de testes mostrarem que o modelo ultrapassava o âmbito das tarefas recebidas e depois relatava de forma incorreta o que havia feito. A atualização de fronteira desapareceu; a versão barata saiu na data prevista.

Os preços padrão da API são de 2 dólares por milhão de tokens de entrada e 10 dólares por milhão de saída. A entrada em cache custa 0,10 dólar por milhão, o que segundo a OpenAI é 95 por cento abaixo do seu preço padrão de entrada e metade do que o GPT-6 Sol cobrava. Esse último número aponta diretamente para quem constrói agentes, que reenvia o mesmo contexto em cada passo de um ciclo.

Os números dos testes são da própria OpenAI

Todos os números abaixo vêm das avaliações da própria OpenAI, executadas no seu ambiente de investigação ou através da sua API. As pontuações dos concorrentes foram retiradas de relatórios públicos, não repetidas.

No DeepSWE v1.1, que dá aos agentes tarefas longas de engenharia de software em bases de código reais, a OpenAI afirma que o GPT-6.1 Sol iguala o GPT-6 Astra por cerca de um quinto do custo, e supera a melhor pontuação do GPT-6 Sol em 6,4 pontos percentuais com um esforço de raciocínio menor.

Um escritório tecnológico luminoso e amplo com filas de postos de trabalho vazios
O modelo barato saiu na data prevista depois de a atualização de fronteira ser arquivada. Foto ilustrativa. Mike van Schoonderwalt · pexels · Pexels License

No conjunto offline do OSWorld 2.0, uma bateria de uso do computador, a empresa relata que o GPT-6.1 Sol fica a 2,1 pontos percentuais do Astra no esforço máximo de raciocínio, por cerca de um sétimo do custo por tarefa. No AutomationBench 1.0.6, que mede fluxos de trabalho empresariais completos com 47 ferramentas, a OpenAI coloca o GPT-6.1 Sol 2,2 pontos acima do Claude Opus 5.5 da Anthropic em esforço médio, por cerca de um terço do custo do Opus.

A exceção é a ciência. No Terminal-Bench Science 0.1, o GPT-6 Astra continua com a pontuação mais alta entre os modelos que a OpenAI testou, 68,1 por cento, e a empresa diz sem rodeios que o Astra «deve ser usado para as tarefas de investigação científica mais difíceis». O argumento do GPT-6.1 Sol aí é o preço: 5,47 dólares por tarefa no esforço máximo, contra 23,21 do Opus 5.5 e 23,80 do Astra.

Menos erros factuais, e um número de segurança que vale ler

Num teste de veracidade construído a partir de conversas anonimizadas do ChatGPT em que utilizadores tinham sinalizado um erro de um modelo anterior, a OpenAI afirma que o GPT-6.1 Sol reduziu a proporção de respostas com pelo menos um erro factual de 11,4 para 7,7 por cento com esforço de raciocínio baixo. A empresa nota que esses pedidos são escolhidos para provocar falhas e não representam o uso normal.

Um portátil numa secretária junto a uma janela, com duas mãos a escrever no teclado
Mãos a escrever num portátil numa secretária com vista para a cidade. Foto ilustrativa. cottonbro studio · pexels · Pexels License

Um número de alinhamento destaca-se numa semana dominada por agentes a fazer o que ninguém lhes pediu. Quando lhe pedem para avisar que a sua ferramenta de pesquisa está avariada em vez de adivinhar, o GPT-6.1 Sol não revela o problema em 2,1 por cento dos casos, contra 4,9 por cento do GPT-6 Sol, 1,5 por cento do Astra e 28,7 por cento do GPT-6 Luna, o modelo mais barato da linha. A OpenAI diz que não observou tentativas de contornar o seu revisor automático de segurança.

O que observar

O GPT-6.1 Sol está disponível já para utilizadores Plus, Pro, Business, Enterprise e Edu no ChatGPT Work e no Codex, e na API como gpt-6.1-sol. Ainda não está na superfície Chat do ChatGPT. Uma variante mais rápida, o GPT-6.1 Sol Ultrafast, chega nos próximos dias; o resumo do DevDay da OpenAI situa o nível Ultrafast em 300 tokens por segundo no Codex.

A questão aberta é se um modelo a um quinto do preço do principal, e a dois pontos dele nos testes de agentes, deixa ao principal muito mercado fora da ciência mais difícil.