DrivingBench es una evaluación con una premisa poco habitual: da a un modelo de lenguaje puntero el control de la dirección, el acelerador y el freno de un Toyota Corolla real, y le pide recorrer un circuito fijo de conos en un aparcamiento vacío. El coche avanza a paso de peatón. Una persona ocupa el asiento del conductor, lista para frenar. El modelo ve la vía a través de dos cámaras y conduce con tres herramientas —observe, set_motion y stop_now—, emitiendo una orden cada vez.

En la clasificación actual, un modelo ha terminado. GPT-6 Astra alcanzó el 100 % de progreso con un tiempo de 5:22, en tres intentos que dieron 49 %, luego 100 % y después un abandono. El intento exitoso consumió 246,6 millones de tokens, que el benchmark cifra en 7,74 dólares.

Vista de una carretera vacía desde una cámara montada en el salpicadero
Los modelos ven el circuito por dos cámaras y emiten una orden cada vez. Fotografía ilustrativa. Sami Aksu · pexels · Pexels License

Ningún otro modelo ha completado el recorrido. Claude Fable 5.1 es segundo con un mejor progreso del 45 %, mejorando en sus tres intentos del 9 al 10 y al 45 %. Grok 4.6 es tercero con un 11 %, y GPT-5.6 Sol cuarto con un 6 %. Todos esos intentos acabaron sin terminar.

Por qué la distancia importa más que el ganador

Un benchmark en el que el líder saca 100 y el segundo 45 no mide un gradiente. Mide si la capacidad existe o no. La tarea combina razonamiento espacial a partir de imágenes de cámara, control continuo con latencia y la disciplina de seguir emitiendo correcciones pequeñas durante cinco minutos sin perder el hilo; en este circuito, tres de los cuatro modelos probados nunca llegaron lo bastante lejos como para ser puntuados en lo último.

El progreso se define como la distancia recorrida a lo largo del eje del circuito manteniéndose a menos de cuatro metros de él, como proporción de la longitud del eje hasta la zona de meta. Se registran además la distancia, las órdenes aceptadas y el coste en tokens, con cada orden, la razón declarada por el modelo, la telemetría del coche y el vídeo alineados fotograma a fotograma.

Un aparcamiento vacío con marcas pintadas visto desde arriba
El progreso se mide a lo largo del eje del circuito hasta la zona de meta. Fotografía ilustrativa. Jan van der Wolf · pexels · Pexels License

Lo que no demuestra

Esto es un circuito de conos a baja velocidad en un aparcamiento, no conducción. No hay tráfico, ni peatones, ni meteorología, ni velocidad. La comparación con un sistema de conducción diseñado para ello no se sostiene, y DrivingBench no pretende lo contrario: el objetivo es ver qué hace un modelo de propósito general cuando se le entrega un bucle de control físico para el que nunca fue entrenado.

El número de intentos también es pequeño —tres por modelo— y los resultados los publican los propios operadores del benchmark, sin auditoría externa. Un único intento del 100 % flanqueado por un 49 % y un abandono es una demostración, no una cifra de fiabilidad.

Qué vigilar

Si la distancia con el segundo se acorta a medida que los laboratorios lanzan modelos con mejor anclaje visual, y si DrivingBench publica suficientes trazas para que alguien ajeno al proyecto pueda repuntuar un intento.