En större basmodell till gammalt pris

SpaceXAI släppte Grok 4.7 på måndagen och behöll föregångarens pris. Indata kostar 2 dollar per miljon tokens och utdata 6 dollar per miljon, samma som Grok 4.6, med en snabb variant som levereras med dubbel utmatningshastighet till dubbelt pris. Företaget beskriver den som sin mest kapabla modell för kodning och kunskapsarbete.

Förändringarna under huven är strukturella snarare än kosmetiska. SpaceXAI säger att Grok 4.7 bygger på en ny, större basmodell än Grok 4.6, tränad med en längre förstärkningsinlärningsomgång på en svårare uppgiftsmix som viktats mot problem som tar många timmar. Bolaget säger också att modellen tränats att förstå Grok Bot-miljön, dess egen agentplattform, från grunden.

Företagets siffror, och någon annans

SpaceXAI:s egen tabell ger Grok 4.7 46,3 procent på CursorBench 4.0, upp från 40,4 procent för Grok 4.6, före de 41,7 procent som anges för GPT-5.6 Sol men efter Claude Fable 5.1 på 51,8 procent. På EEBench, ett elektroteknikprov, rapporteras 64,0 procent mot 39,4 för GPT-5.6 Sol och 56,4 för Fable 5.1. På Harveys juridiska agenttest anges 19,6 procent mot 6,7 för Fable 5.1.

Närbild på ett kretskort med processorkapslar
SpaceXAI säger att modellen bygger på en ny, större basmodell. Illustrativ bild. Armando Are · pexels · Pexels License

Det är leverantörens egna siffror. Den oberoende bilden är mindre smickrande. Artificial Analysis, som kör egna utvärderingar, gav Grok 4.7 46 på sitt Intelligence Index v4.3.2, mot 53 för både Claude Fable 5.1 och GPT-6, enligt The Decoder.

Skillnaden syns tydligast i ett prov som båda kört. SpaceXAI rapporterar 38,0 procent på Terminal-Bench 4.0. Artificial Analysis mätte 26 procent, ungefär där mätningen placerar DeepSeek V4.1 Flash på 27 procent, och långt under de 60 procent som anges för GPT-6 Astra och 55 för Claude Fable 5.1.

Där den faktiskt leder

På GDPval, som bedömer professionellt arbete, publicerar SpaceXAI ett Elo-tal på 1 695 för Grok 4.7 i dess högsta ansträngningsläge, efter Fable 5.1 på 1 735 men före GPT-6 Astra på 1 542. Bolaget rapporterar också 1 657 på AA Briefcase v1.1, strax under Fable 5.1:s 1 678.

En rad skärmar på en utvecklares skrivbord i ett öppet kontorslandskap
Modellen finns i Cursor, Grok Build och Grok-API:t. Illustrativ bild. Kampus Production · pexels · Pexels License

Lästa tillsammans berättar leverantörstabellen och det oberoende indexet en sammanhängande historia om positionering snarare än en motsägelse: modellen klarar flertimmarsarbete i dokumentform bra och långa terminaluppgifter sämre, till ett pris närmare kinesiska öppna modeller än västerländska frontmodeller.

Ett nytt skyddslager

SpaceXAI säger att Grok 4.7 levereras med ett helt nytt skyddslager och är den starkaste modell bolaget testat på vägran och motstånd mot jailbreak. Man uppger sig toppa LatchBios biosäkerhetstest med 62,4 procent och att modellen släpper igenom 3,3 procent av riskabla dubbelanvändningsprompter på HackerBench v0.3, bolagets interna cybertest. Båda är företagets egna mätningar.

Bolaget har också börjat ge utvalda cybersäkerhetspartner inbjudningsbaserad tillgång till Grok 4.7:s red team-förmågor för försvarsforskning, en smalare version av den åtkomstfråga som splittrat labben hela året.

Vad som avgör fortsättningen

Modellen finns nu i Cursor och Grok Build, via Grok-API:t och genom tredjepartsverktyg, modellroutrar och molnplattformar. Det som avgör är om avvikelsen på Terminal-Bench krymper när fler oberoende utvärderingar kommer, och om 2 dollar per miljon indatatokens räcker för att flytta utvecklare som i dag betalar 10 för Fable 5.1.