Código privado, tareas reales
Un nuevo benchmark de programación de Specific Labs, una startup que afirma contar con el respaldo de Y Combinator, evalúa agentes de IA con tareas extraídas de bases de código privadas en producción que ha licenciado de empresas reales, en lugar de hacerlo con repositorios públicos que un modelo podría haber visto durante su entrenamiento. En la primera clasificación de Real-SWE, Fable 5.1 de Anthropic, ejecutado en Claude Code, resolvió el 38,8 % de sus intentos. Le siguieron GPT-6 Astra de OpenAI en Codex CLI, con un 33,8 %, y Gemini 3.8 Flash de Google en Gemini CLI, con un 31,2 %.
Las cifras son mediciones propias de Specific Labs, publicadas en septiembre de 2026. Son independientes de los fabricantes de los modelos, pero nadie más las ha replicado.
Cómo funciona el benchmark
Las tareas son problemas que los ingenieros de las empresas de origen resolvieron de verdad. Sus instrucciones tienen una media de 1742 caracteres y la tarea mediana exige modificar 11 archivos, según la página del benchmark. Entre las empresas figuran una competidora de Luma y Partiful con más de 200 000 usuarios y una plataforma fintech de consumo que procesa más de 100 000 extractos bancarios.
Cada modelo dispone de ocho intentos independientes por tarea dentro del entorno de agente (harness) que distribuye su propio fabricante, de modo que Real-SWE puntúa el modelo y su harness en conjunto, y no el modelo de forma aislada. La excepción es GLM 5.3 de Zhipu, que se ejecutó en Claude Code. La página atribuye la autoría a Snagnik Das, Siddhant Paliwal y Janak Sunil.

La clasificación
| Puesto | Modelo y harness | Resuelto | Coste por intento |
|---|---|---|---|
| 1 | Fable 5.1 (Claude Code) | 38,8 % | 6,96 dólares |
| 2 | GPT-6 Astra (Codex CLI) | 33,8 % | 4,67 dólares |
| 3 | Gemini 3.8 Flash (Gemini CLI) | 31,2 % | 2,50 dólares |
| 4 | GLM 5.3 (Claude Code) | 28,8 % | 5,12 dólares |
| 5 | Grok 4.6 (Grok Build) | 23,8 % | 3,44 dólares |
| 5 | Muse Spark 1.3 (Muse Code) | 23,8 % | 2,74 dólares |
| 7 | Kimi K3 (Kimi Code) | 18,8 % | 3,90 dólares |
| 8 | GPT-5.6 Sol (Codex CLI) | 16,2 % | 2,65 dólares |
El modo de fallo más habitual en todos los modelos fue un requisito pasado por alto, según la página del benchmark.
El coste por arreglo cuenta otra historia
Dividir el coste de un intento entre la proporción de intentos que tienen éxito cambia el orden. Un análisis de The D*AI*LY Brief sitúa a Fable 5.1 en unos 17,94 dólares por tarea resuelta, a GPT-6 Astra en 13,82 dólares, a Muse Spark 1.3 en 11,51 dólares y a Gemini 3.8 Flash en 8,01 dólares.
Fable 5.1 es el modelo con más probabilidades de completar una tarea. Gemini 3.8 Flash es la forma más barata de conseguir que una tarea quede resuelta: cuesta menos de la mitad que Fable por arreglo y resuelve aproximadamente cuatro tareas por cada cinco que resuelve Fable.

Cautela con las cifras
La muestra es pequeña. Los resultados públicos se basan en diez tareas, cada una ejecutada ocho veces por cada uno de los ocho modelos, según la lectura que hace The D*AI*LY Brief de los recuentos de ejecuciones que figuran en la página. Eso significa que una sola tarea, resuelta o fallida en los ocho intentos, puede mover la puntuación de un modelo hasta diez puntos porcentuales. La diferencia entre el segundo y el tercer puesto es menor que eso.
Las bases de código son privadas por diseño, así que nadie ajeno puede examinar las tareas. Sunil dijo en Hacker News que el equipo iba a «publicar como código abierto algunas de nuestras tareas y trayectorias de los modelos» y que revisa manualmente las bases de código y las empresas que las aportan, según recoge el análisis.
Qué vigilar
Si Specific Labs publica las tareas y trayectorias que ha prometido, y si el orden se mantiene cuando el conjunto de tareas crezca más allá de diez. Un conjunto mayor también mostraría si los modelos más baratos conservan su ventaja en coste por arreglo en tareas más difíciles.