Código privado, tareas reales

Un nuevo benchmark de programación de Specific Labs, una startup que afirma contar con el respaldo de Y Combinator, evalúa agentes de IA con tareas extraídas de bases de código privadas en producción que ha licenciado de empresas reales, en lugar de hacerlo con repositorios públicos que un modelo podría haber visto durante su entrenamiento. En la primera clasificación de Real-SWE, Fable 5.1 de Anthropic, ejecutado en Claude Code, resolvió el 38,8 % de sus intentos. Le siguieron GPT-6 Astra de OpenAI en Codex CLI, con un 33,8 %, y Gemini 3.8 Flash de Google en Gemini CLI, con un 31,2 %.

Las cifras son mediciones propias de Specific Labs, publicadas en septiembre de 2026. Son independientes de los fabricantes de los modelos, pero nadie más las ha replicado.

Cómo funciona el benchmark

Las tareas son problemas que los ingenieros de las empresas de origen resolvieron de verdad. Sus instrucciones tienen una media de 1742 caracteres y la tarea mediana exige modificar 11 archivos, según la página del benchmark. Entre las empresas figuran una competidora de Luma y Partiful con más de 200 000 usuarios y una plataforma fintech de consumo que procesa más de 100 000 extractos bancarios.

Cada modelo dispone de ocho intentos independientes por tarea dentro del entorno de agente (harness) que distribuye su propio fabricante, de modo que Real-SWE puntúa el modelo y su harness en conjunto, y no el modelo de forma aislada. La excepción es GLM 5.3 de Zhipu, que se ejecutó en Claude Code. La página atribuye la autoría a Snagnik Das, Siddhant Paliwal y Janak Sunil.

Una hilera de armarios de servidores con cableado tras puertas de rejilla
Cada modelo dispone de ocho intentos por tarea dentro del harness de agente de su propio fabricante. Fotografía de archivo. Brett Sayles · pexels · Pexels License

La clasificación

PuestoModelo y harnessResueltoCoste por intento
1Fable 5.1 (Claude Code)38,8 %6,96 dólares
2GPT-6 Astra (Codex CLI)33,8 %4,67 dólares
3Gemini 3.8 Flash (Gemini CLI)31,2 %2,50 dólares
4GLM 5.3 (Claude Code)28,8 %5,12 dólares
5Grok 4.6 (Grok Build)23,8 %3,44 dólares
5Muse Spark 1.3 (Muse Code)23,8 %2,74 dólares
7Kimi K3 (Kimi Code)18,8 %3,90 dólares
8GPT-5.6 Sol (Codex CLI)16,2 %2,65 dólares

El modo de fallo más habitual en todos los modelos fue un requisito pasado por alto, según la página del benchmark.

El coste por arreglo cuenta otra historia

Dividir el coste de un intento entre la proporción de intentos que tienen éxito cambia el orden. Un análisis de The D*AI*LY Brief sitúa a Fable 5.1 en unos 17,94 dólares por tarea resuelta, a GPT-6 Astra en 13,82 dólares, a Muse Spark 1.3 en 11,51 dólares y a Gemini 3.8 Flash en 8,01 dólares.

Fable 5.1 es el modelo con más probabilidades de completar una tarea. Gemini 3.8 Flash es la forma más barata de conseguir que una tarea quede resuelta: cuesta menos de la mitad que Fable por arreglo y resuelve aproximadamente cuatro tareas por cada cinco que resuelve Fable.

Primer plano de código de programación en una pantalla de ordenador
El fallo más habitual en todos los modelos fue un requisito pasado por alto. Fotografía de archivo. Godfrey Atima · pexels · Pexels License

Cautela con las cifras

La muestra es pequeña. Los resultados públicos se basan en diez tareas, cada una ejecutada ocho veces por cada uno de los ocho modelos, según la lectura que hace The D*AI*LY Brief de los recuentos de ejecuciones que figuran en la página. Eso significa que una sola tarea, resuelta o fallida en los ocho intentos, puede mover la puntuación de un modelo hasta diez puntos porcentuales. La diferencia entre el segundo y el tercer puesto es menor que eso.

Las bases de código son privadas por diseño, así que nadie ajeno puede examinar las tareas. Sunil dijo en Hacker News que el equipo iba a «publicar como código abierto algunas de nuestras tareas y trayectorias de los modelos» y que revisa manualmente las bases de código y las empresas que las aportan, según recoge el análisis.

Qué vigilar

Si Specific Labs publica las tareas y trayectorias que ha prometido, y si el orden se mantiene cuando el conjunto de tareas crezca más allá de diez. Un conjunto mayor también mostraría si los modelos más baratos conservan su ventaja en coste por arreglo en tareas más difíciles.