Un modelo base mayor al precio de siempre
SpaceXAI lanzó Grok 4.7 el lunes y mantuvo el precio de su predecesor. La entrada cuesta 2 dólares por millón de tokens y la salida 6 dólares por millón, igual que Grok 4.6, con una variante rápida servida al doble de velocidad de salida por el doble de precio. La empresa lo describe como su modelo más capaz para programación y trabajo de conocimiento.
Los cambios de fondo son estructurales, no cosméticos. SpaceXAI dice que Grok 4.7 usa un modelo base nuevo y más grande que el de Grok 4.6, entrenado con una fase de aprendizaje por refuerzo más larga sobre una mezcla de tareas más difícil, cargada hacia problemas que llevan muchas horas. También afirma que el modelo fue entrenado para entender de forma nativa el entorno Grok Bot, su propio sistema de agentes.
Los números de la empresa, y los de otros
La propia tabla de SpaceXAI sitúa a Grok 4.7 en 46,3% en CursorBench 4.0, frente al 40,4% de Grok 4.6, por delante del 41,7% que registra para GPT-5.6 Sol y por detrás de Claude Fable 5.1 con 51,8%. En EEBench, una prueba de ingeniería eléctrica, informa de 64,0% frente al 39,4% de GPT-5.6 Sol y el 56,4% de Fable 5.1. En el banco de pruebas legal de Harvey declara 19,6%, frente al 6,7% de Fable 5.1.

Son cifras declaradas por el proveedor. El cuadro independiente es menos halagador. Artificial Analysis, que realiza sus propias evaluaciones, puntuó a Grok 4.7 con un 46 en su Intelligence Index v4.3.2, frente al 53 de Claude Fable 5.1 y de GPT-6, según The Decoder.
La diferencia se ve mejor en una prueba que ambos ejecutaron. SpaceXAI informa de 38,0% en Terminal-Bench 4.0. Artificial Analysis midió 26%, aproximadamente donde sitúa a DeepSeek V4.1 Flash, con 27%, y muy por debajo del 60% que registra para GPT-6 Astra y del 55% de Claude Fable 5.1.
Dónde sí encabeza
En GDPval, que puntúa trabajo profesional, SpaceXAI publica un Elo de 1.695 para Grok 4.7 en su ajuste de mayor esfuerzo, por detrás de Fable 5.1 con 1.735 pero por delante de GPT-6 Astra con 1.542. La empresa también informa de 1.657 en AA Briefcase v1.1, justo por debajo de los 1.678 de Fable 5.1.

Leídas juntas, la tabla del proveedor y el índice independiente cuentan una historia coherente sobre posicionamiento más que una contradicción: el modelo rinde bien en trabajo profesional de varias horas con forma de documento y peor en tareas largas de terminal, a un precio más cercano al de los modelos chinos de pesos abiertos que al de los occidentales de frontera.
Una nueva capa de salvaguardas
SpaceXAI dice que Grok 4.7 llega con una capa de salvaguardas completamente nueva y que es el modelo más sólido que ha probado en rechazos y en resistencia a jailbreaks. Informa de que encabeza el banco de bioseguridad de LatchBio con un 62,4% y de que el modelo deja pasar un 3,3% de indicaciones de doble uso arriesgadas en HackerBench v0.3, su prueba ciber interna. Ambas son mediciones propias de la empresa.
También ha empezado a dar a socios de ciberseguridad seleccionados acceso por invitación a las capacidades de equipo rojo de Grok 4.7 para investigación defensiva, una versión más estrecha de la cuestión de acceso que ha dividido a los laboratorios todo el año.
Qué vigilar
El modelo ya está disponible en Cursor y Grok Build, a través de la API de Grok y mediante entornos de programación de terceros, enrutadores de modelos y plataformas en la nube. Lo que hay que vigilar es si la discrepancia de Terminal-Bench se estrecha cuando lleguen más evaluaciones independientes, y si 2 dólares por millón de tokens de entrada bastan para mover a quienes hoy pagan 10 por Fable 5.1.