Un retraso atribuido a la recompensa

Grok 4.7 todavía no sale. Elon Musk dijo en una respuesta en X el 11 de septiembre que el modelo “necesita unos días más de cocción” y dio un motivo inusualmente técnico: SpaceXAI, la empresa detrás de Grok, podría haber penalizado demasiado la longitud de las respuestas durante el aprendizaje por refuerzo.

El resultado, según Musk, es un modelo que todavía abandona demasiado pronto tareas difíciles que sí es capaz de resolver y que aún no es lo bastante riguroso al comprobar su propio trabajo. El propio Musk matizó el diagnóstico al añadir “o algo así” a la explicación sobre la longitud, y no dio una nueva fecha de lanzamiento. TeslaNorth señaló que Musk presentó el retraso como un problema de ajuste y no como una función pendiente o un límite de hardware; Data Studios también informó del retraso.

Una fecha que ya se había movido

Musk lleva dando plazos públicos para el modelo desde julio. Según una recopilación de sus publicaciones hecha por CellCog, escribió el 24 de julio que faltaban cuatro semanas para Grok 4.7, el 12 de agosto que estaría listo en tres o cuatro semanas y a principios de septiembre que saldría “en 10 días”. Esa última publicación, de la madrugada del 2 de septiembre en hora europea, apuntaba a un lanzamiento en torno al 12 de septiembre, como informaron Big Hat Group y NextBigFuture.

Musk también ha descrito Grok 4.7 como un modelo de 2,1 billones de parámetros y, según NextBigFuture, afirmó que sería mejor que Grok 4.6 en todo salvo en velocidad de servicio, con mayor eficiencia de tokens. Nada de eso procede de la propia empresa: las notas de versión para desarrolladores de SpaceXAI no incluyen ninguna entrada, identificador de modelo ni precio para Grok 4.7.

Lo último que lanzó SpaceXAI

El modelo actual es Grok 4.6, lanzado el 12 de agosto. SpaceXAI dijo que se basa en Grok 4.5, que llegó en julio, con especial atención a los agentes de larga duración. Las notas de versión indican una ventana de contexto de 500.000 tokens y un precio de 2 dólares por millón de tokens de entrada, 0,50 dólares por la entrada en caché y 6 dólares por la salida.

Los agentes de larga duración son también lo que la empresa vende a las compañías. El 3 de septiembre abrió Grok Bot a las empresas, con controles de acceso, red y auditoría, y ofreció a los clientes de Grok y Cursor Enterprise dos semanas de uso gratuito para toda la organización. Un modelo que abandona pronto el trabajo difícil es justo el fallo que esa propuesta no puede permitirse.

Empleados de oficina trabajando con ordenadores de sobremesa
Una oficina diáfana. SpaceXAI vende agentes de larga duración a las empresas a través de Grok Bot. Fotografía de archivo. fauxels · pexels · Pexels License

Para qué sirve una penalización por longitud

Los modelos de razonamiento rinden mejor en problemas difíciles cuando generan más tokens, y esa verbosidad desperdicia cómputo en los fáciles. Una solución habitual es añadir una penalización por longitud a la recompensa del aprendizaje por refuerzo, para que el modelo aprenda a responder de forma más breve.

La investigación muestra cómo puede salir mal. Un artículo de mayo de 2025 sobre aprendizaje por refuerzo estable para un razonamiento eficiente concluyó que las recompensas con penalización por longitud pueden hacer que la precisión se desplome a medida que las respuestas se acortan. Su método, GRPO-λ, elimina la penalización cuando las respuestas del modelo a una pregunta son mayoritariamente erróneas y la mantiene cuando son mayoritariamente correctas.

Un artículo de junio de 2025, Just Enough Thinking, critica las penalizaciones uniformes que tratan igual todos los problemas. Su penalización adaptativa es inversamente proporcional a la frecuencia con la que el modelo resuelve una consulta, de modo que las fáciles pagan un coste alto por cada token extra y las difíciles quedan libres. Con un modelo de 1.500 millones de parámetros, los autores informaron de una reducción del 50 % en el uso medio de tokens sin una caída significativa del rendimiento.

Ecuaciones matemáticas escritas a mano en una pizarra
Ecuaciones en una pizarra. Las penalizaciones por longitud en el aprendizaje por refuerzo pueden cortar el trabajo en problemas difíciles. Fotografía de archivo. https://kaboompics.com/ · pexels · Pexels License

Por qué importa la explicación

El relato de Musk encaja de cerca con ese fallo. Un modelo al que se le cobra cada token tiene motivos para detenerse antes de resolver un problema difícil, y comprobar una respuesta también cuesta tokens. Ni Musk ni SpaceXAI han dicho qué penalización se usó ni cómo cambiará, así que se trata de un diagnóstico informal y no de una divulgación técnica.

Aun así, es un diagnóstico concreto. Señala una decisión de diseño de la recompensa que enfrenta el coste de inferencia con la persistencia, el mismo equilibrio en el que trabaja la investigación sobre razonamiento eficiente desde al menos 2025.

Qué vigilar

La próxima señal concreta será una entrada de Grok 4.7 en las notas de versión de SpaceXAI, con identificador de modelo, precio y ventana de contexto. Si el problema era la penalización por longitud, la prueba estará en cómo se compara su uso de tokens en tareas difíciles con el de Grok 4.6, y en si las cifras de referencia de la propia SpaceXAI, cuando se publiquen, se sostienen en pruebas independientes.