Un modèle de base plus grand au prix d’avant

SpaceXAI a publié Grok 4.7 lundi en conservant le tarif de son prédécesseur. L’entrée coûte 2 dollars par million de jetons et la sortie 6 dollars par million, comme pour Grok 4.6, avec une variante rapide servie au double de la vitesse de sortie pour le double du prix. L’entreprise le présente comme son modèle le plus capable pour le code et le travail de connaissance.

Les changements sous le capot sont structurels et non cosmétiques. SpaceXAI indique que Grok 4.7 repose sur un modèle de base nouveau et plus grand que celui de Grok 4.6, entraîné par une phase d’apprentissage par renforcement plus longue sur un mélange de tâches plus difficile, pondéré vers des problèmes qui prennent de nombreuses heures. Elle ajoute que le modèle a été entraîné à comprendre nativement l’environnement Grok Bot, son propre exécutif d’agents.

Les chiffres de l’entreprise, et ceux des autres

Le tableau de SpaceXAI place Grok 4.7 à 46,3 % sur CursorBench 4.0, contre 40,4 % pour Grok 4.6, devant les 41,7 % qu’elle attribue à GPT-5.6 Sol mais derrière Claude Fable 5.1 à 51,8 %. Sur EEBench, un test d’ingénierie électrique, elle annonce 64,0 % contre 39,4 % pour GPT-5.6 Sol et 56,4 % pour Fable 5.1. Sur le test d’agent juridique de Harvey, elle annonce 19,6 %, contre 6,7 % pour Fable 5.1.

Gros plan d'une carte de circuit imprimé avec des boîtiers de processeur
SpaceXAI dit que le modèle repose sur une base plus grande. Image d'illustration. Armando Are · pexels · Pexels License

Ce sont des chiffres communiqués par le fournisseur. L’image indépendante est moins flatteuse. Artificial Analysis, qui mène ses propres évaluations, a noté Grok 4.7 à 46 sur son Intelligence Index v4.3.2, contre 53 pour Claude Fable 5.1 comme pour GPT-6, selon The Decoder.

L’écart est le plus net sur un test mené des deux côtés. SpaceXAI annonce 38,0 % sur Terminal-Bench 4.0. Artificial Analysis a mesuré 26 %, à peu près là où elle situe DeepSeek V4.1 Flash, à 27 %, et bien en dessous des 60 % qu’elle attribue à GPT-6 Astra et des 55 % de Claude Fable 5.1.

Là où il devance vraiment

Sur GDPval, qui évalue le travail professionnel, SpaceXAI publie un Elo de 1 695 pour Grok 4.7 à son réglage d’effort le plus élevé, derrière Fable 5.1 à 1 735 mais devant GPT-6 Astra à 1 542. L’entreprise annonce aussi 1 657 sur AA Briefcase v1.1, juste sous les 1 678 de Fable 5.1.

Une rangée d'écrans sur le bureau d'un développeur dans un espace ouvert
Le modèle est disponible dans Cursor, Grok Build et l'API Grok. Image d'illustration. Kampus Production · pexels · Pexels License

Lus ensemble, le tableau du fournisseur et l’indice indépendant racontent une histoire cohérente de positionnement plutôt qu’une contradiction : le modèle réussit le travail professionnel de plusieurs heures en forme de document et réussit moins les tâches longues en terminal, à un prix plus proche des modèles chinois à poids ouverts que des modèles de frontière occidentaux.

Une nouvelle pile de garde-fous

SpaceXAI affirme que Grok 4.7 arrive avec une pile de garde-fous entièrement nouvelle et qu’il est le modèle le plus solide qu’elle ait testé en matière de refus et de résistance au contournement. Elle dit dominer le test de biosécurité de LatchBio à 62,4 % et indique que le modèle laisse passer 3,3 % des requêtes à double usage risquées sur HackerBench v0.3, son test cyber interne. Ces deux chiffres sont des mesures maison.

Elle a aussi commencé à donner à des partenaires de cybersécurité sélectionnés un accès sur invitation aux capacités d’équipe rouge de Grok 4.7 pour la recherche défensive, version resserrée de la question d’accès qui divise les laboratoires depuis un an.

Ce qu’il faut surveiller

Le modèle est disponible dès maintenant dans Cursor et Grok Build, via l’API Grok, et par des environnements de code tiers, des routeurs de modèles et des plateformes cloud. Reste à voir si l’écart sur Terminal-Bench se réduit à mesure que d’autres évaluations indépendantes arrivent, et si 2 dollars par million de jetons d’entrée suffisent à déplacer des développeurs qui en paient 10 pour Fable 5.1.