Cambiarlo todo menos el modelo

Salesforce AI Research y Salesforce Agentforce publicaron esta semana un marco llamado DarwinX que mejora a un agente de IA haciendo evolucionar el andamiaje que lo rodea —las instrucciones, herramientas, habilidades y flujos de trabajo que componen el arnés— sin tocar los pesos del modelo.

En WebArena-Infinity, un banco de pruebas de tareas de navegador, Salesforce informa de que el agente pasó de completar el 43,5% de las tareas al 93%. En Terminal-Bench 2.1 informa de una mejora del 75,5% al 83,2%, y en SWE-bench Verified del 80,8% al 84,2%. El modelo base principal fue GPT-5.5, y también se probó Claude Opus 4.8.

Son las cifras del propio desarrollador sobre su propio sistema, y ninguna evaluación independiente las ha reproducido todavía. La cifra del navegador en particular es lo bastante grande como para invitar a examinar cuánto margen dejaba sin aprovechar el arnés de partida.

Los dos problemas que dice resolver

Ajustar el arnés no es nuevo. Lo que DarwinX ataca son dos fallos que lo hacen difícil de hacer a mano.

Un ingeniero de software ante un monitor que muestra código fuente
Salesforce informa de mejoras en pruebas de navegador, terminal e ingeniería de software. Imagen ilustrativa. ThisIsEngineering · pexels · Pexels License

El primero es la dependencia del camino: una decisión temprana sobre cómo se escribe el andamiaje estrecha lo que se puede explorar después, y el proceso se atasca en un óptimo local que nadie eligió. El segundo es la interferencia entre tareas, cuando un cambio que mejora un tipo de tarea degrada otro en silencio.

DarwinX aborda ambos manteniendo varias variantes del arnés a la vez y dejando que las mejoras compitan, en lugar de reescribir una y otra vez la misma versión. Un cambio solo avanza si mejora la capacidad sin retroceder en las demás tareas del conjunto.

Por qué importa a quien no entrena modelos

La mayoría de los equipos que construyen sobre IA no tienen una tubería de ajuste fino. Llaman a un modelo alojado y escriben todo lo demás alrededor. Para ellos el arnés es lo único que pueden cambiar, y suele ajustarse a mano, por intuición, hasta que parece suficientemente bueno.

Las ramas de un árbol vistas desde abajo contra un cielo pálido
El marco mantiene varias variantes del arnés vivas y las hace competir. Imagen ilustrativa. Ishtiak Ahamed · pexels · Pexels License

Una búsqueda sistemática en ese espacio resulta por tanto directamente utilizable, cosa que un resultado de entrenamiento no es. Salesforce ha publicado un marco de código abierto llamado Beagle bajo licencia Apache 2.0 para que los equipos apliquen la evolución del arnés a sus propios agentes. El autor sénior de la investigación es Ran Xu.

Qué lo confirmaría

Dos cosas. La primera, que alguien ajeno a Salesforce reproduzca el salto en WebArena-Infinity sobre un arnés que no haya escrito, porque el tamaño de una mejora depende mucho de lo débil que fuera el punto de partida. La segunda, pruebas de que un arnés evolucionado aguanta en tareas que no estaban en el conjunto de evaluación: todo el método es una búsqueda contra un conjunto fijo de bancos de pruebas, y esas búsquedas tienen la costumbre conocida de encontrar el conjunto en lugar de la habilidad.