Dos resultados, un mismo conjunto de modelos
Mercor publicó el jueves líneas base humanas para un conjunto de tareas contables simplificadas, y la comparación es desigual. Doce contables júnior, todos colegiados y con una media de unos cinco años y medio de experiencia, promediaron un 37 por ciento en cuatro escenarios de cierre mensual, con resultados individuales que iban de cero a cerca del 90 por ciento y tiempos de entre 30 y 180 minutos por tarea. Mercor dice que Claude Opus 5 obtuvo el 100 por ciento en los veinte intentos, terminando cada uno en menos de diez minutos.
Dieciocho meses antes, dice Mercor, los modelos puntuaban por debajo de la media humana en esas mismas tareas.
Esa es una cifra. La otra está en el banco de pruebas completo del que se simplificaron esas tareas, y resulta bastante menos halagadora.
Qué dice la versión difícil
APEX-Accounting, construido por Mercor con la empresa de software financiero Ramp, son 160 tareas repartidas en diez empresas simuladas, con una media de 7,5 archivos de entrada por tarea y 2.186 criterios de corrección escritos por profesionales de la contabilidad. En esa suite, la tabla de Mercor sitúa a Claude Opus 5.5 en el 61,8 por ciento, a Fable 5.1 en el 61,0 y a GPT-6 Astra en el 57,9, cada uno con un margen de error cercano a cuatro puntos.

Las cifras de consistencia son la lectura más dura. Cada modelo se ejecuta ocho veces por tarea. El modelo más consistente acertó una tarea en las ocho ejecuciones solo el 2,6 por ciento de las veces, y ningún modelo resolvió por completo cerca del 60 por ciento de las tareas en ninguna ejecución. Mercor dice que aproximadamente siete de cada diez fallos de los tres mejores modelos son fallos de razonamiento, no de localizar un archivo o seguir una instrucción.
Por qué la brecha entre ambas cifras es la noticia
Las tareas simplificadas aíslan aquello en lo que los modelos actuales son indiscutiblemente buenos: leer muchos archivos con cuidado, no perder un número y hacer lo que decía la instrucción. Son competencias contables reales, y un humano que las ejecuta por undécima hora seguida las hace peor que una máquina que no tiene undécima hora.
Lo que las tareas simplificadas eliminan es todo lo que hace difícil un cierre: el juicio sobre qué cifra está mal, la llamada a quien la contabilizó, el saber que este cliente concreto siempre registra el devengo tarde. Mercor lo dice explícitamente: los autores señalan que las tareas miden solo un subconjunto de competencias contables y excluyen la comunicación con el cliente y el contexto tácito.

Esa salvedad carga con mucho peso, y conviene mantenerla pegada al 100 por ciento.
De quién es este banco de pruebas
Ninguna de las dos cifras es independiente. Mercor es un mercado que vende trabajo humano experto a laboratorios de IA precisamente para este tipo de datos, y Ramp vende software financiero. Un banco de pruebas que muestra que los modelos están cerca pero no llegan es un banco de pruebas que argumenta a favor de más datos expertos, que es el producto de Mercor. Eso no hace erróneas las mediciones — las rúbricas las escribieron profesionales de grandes firmas contables, y la corrección la hace un juez automático que la empresa dice que coincide con correctores humanos el 97 por ciento de las veces — pero es la evaluación propia de un proveedor sobre un mercado al que vende.
Las tareas además son fijas y públicas, lo que significa que su valor se degrada a medida que entran en los datos de entrenamiento. Un 61,8 por ciento en octubre de 2026 es una afirmación sobre este mes.
Lo que hay que vigilar es la columna Pass^8 más que la media del titular. Un modelo que cierra los libros correctamente seis veces de ocho no ha cerrado los libros. Ha producido algo que un controller todavía tiene que revisar, que es justo la parte que el 100 por ciento no cubre.