Um modelo base maior pelo preço antigo
A SpaceXAI lançou o Grok 4.7 na segunda-feira e manteve o preço do antecessor. A entrada custa 2 dólares por milhão de tokens e a saída 6 dólares por milhão, tal como no Grok 4.6, com uma variante rápida servida ao dobro da velocidade de saída pelo dobro do preço. A empresa descreve-o como o seu modelo mais capaz para programação e trabalho de conhecimento.
As mudanças por baixo são estruturais e não cosméticas. A SpaceXAI diz que o Grok 4.7 usa um modelo base novo e maior do que o do Grok 4.6, treinado com uma fase de aprendizagem por reforço mais longa sobre uma mistura de tarefas mais difícil, inclinada para problemas que levam muitas horas. Acrescenta que o modelo foi treinado para compreender de forma nativa o ambiente Grok Bot, a sua própria plataforma de agentes.
Os números da empresa, e os de outros
A própria tabela da SpaceXAI coloca o Grok 4.7 em 46,3% no CursorBench 4.0, acima dos 40,4% do Grok 4.6, à frente dos 41,7% que regista para o GPT-5.6 Sol mas atrás do Claude Fable 5.1 com 51,8%. No EEBench, um teste de engenharia elétrica, anuncia 64,0% contra 39,4% do GPT-5.6 Sol e 56,4% do Fable 5.1. No teste de agente jurídico da Harvey declara 19,6%, contra 6,7% do Fable 5.1.

São números declarados pelo fornecedor. O retrato independente é menos lisonjeiro. A Artificial Analysis, que faz as suas próprias avaliações, deu ao Grok 4.7 a pontuação de 46 no seu Intelligence Index v4.3.2, contra 53 para o Claude Fable 5.1 e para o GPT-6, segundo o The Decoder.
A diferença é mais clara num teste que ambos correram. A SpaceXAI anuncia 38,0% no Terminal-Bench 4.0. A Artificial Analysis mediu 26%, aproximadamente onde coloca o DeepSeek V4.1 Flash, com 27%, e muito abaixo dos 60% que regista para o GPT-6 Astra e dos 55% do Claude Fable 5.1.
Onde lidera de facto
No GDPval, que pontua trabalho profissional, a SpaceXAI publica um Elo de 1.695 para o Grok 4.7 na definição de maior esforço, atrás do Fable 5.1 com 1.735 mas à frente do GPT-6 Astra com 1.542. A empresa também anuncia 1.657 no AA Briefcase v1.1, logo abaixo dos 1.678 do Fable 5.1.

Lidos em conjunto, a tabela do fornecedor e o índice independente contam uma história coerente sobre posicionamento e não uma contradição: o modelo sai-se bem em trabalho profissional de várias horas com forma de documento e pior em tarefas longas de terminal, a um preço mais próximo dos modelos chineses de pesos abertos do que dos ocidentais de fronteira.
Uma nova camada de salvaguardas
A SpaceXAI diz que o Grok 4.7 chega com uma camada de salvaguardas inteiramente nova e que é o modelo mais sólido que testou em recusas e resistência a jailbreaks. Afirma liderar o teste de biossegurança da LatchBio com 62,4% e diz que o modelo deixa passar 3,3% das instruções de duplo uso arriscadas no HackerBench v0.3, o seu teste ciber interno. Ambos são medições da própria empresa.
Começou também a dar a parceiros selecionados de cibersegurança acesso por convite às capacidades de equipa vermelha do Grok 4.7 para investigação defensiva, uma versão mais estreita da questão de acesso que dividiu os laboratórios todo o ano.
O que vigiar
O modelo está disponível já no Cursor e no Grok Build, através da API Grok, e por ambientes de programação de terceiros, encaminhadores de modelos e plataformas de nuvem. Resta ver se a discrepância no Terminal-Bench se estreita à medida que chegam mais avaliações independentes, e se 2 dólares por milhão de tokens de entrada chegam para mover quem hoje paga 10 pelo Fable 5.1.