Att ändra allt utom modellen

Salesforce AI Research och Salesforce Agentforce publicerade i veckan ett ramverk kallat DarwinX, som förbättrar en AI-agent genom att utveckla ställningen runt den — instruktionerna, verktygen, färdigheterna och arbetsflödena som utgör selen — utan att röra modellens vikter.

På WebArena-Infinity, ett test för webbläsaruppgifter, rapporterar Salesforce att agenten gick från att klara 43,5 procent av uppgifterna till 93 procent. På Terminal-Bench 2.1 rapporterar bolaget 75,5 till 83,2 procent, och på SWE-bench Verified 80,8 till 84,2 procent. Den primära basmodellen var GPT-5.5, och Claude Opus 4.8 testades också.

Detta är utvecklarens egna siffror om sitt eget system, och ingen oberoende utvärdering har ännu återskapat dem. Särskilt webbläsarsiffran är stor nog att inbjuda till granskning av hur mycket utrymme den ursprungliga selen lämnade outnyttjat.

De två problem ramverket säger sig lösa

Att trimma selen är inget nytt. Det DarwinX siktar på är två felmoder som gör det svårt att göra för hand.

En mjukvaruingenjör vid en skärm som visar källkod
Salesforce rapporterar förbättringar i tester för webbläsare, terminal och programvaruutveckling. Illustrativ bild. ThisIsEngineering · pexels · Pexels License

Det första är stigberoende: ett tidigt val i hur ställningen skrivs begränsar vad som kan utforskas senare, och processen fastnar i ett lokalt optimum ingen valt. Det andra är tvärstörning mellan uppgifter, där en ändring som förbättrar en sorts uppgift tyst försämrar en annan.

DarwinX hanterar båda genom att hålla flera selvarianter vid liv samtidigt och låta förbättringar tävla, i stället för att gång på gång skriva om en enda version. En ändring går bara vidare om den förbättrar förmågan utan att backa på de övriga uppgifterna i uppsättningen.

Varför det spelar roll för dem som inte tränar modeller

De flesta team som bygger på AI har ingen finjusteringskedja. De anropar en driftad modell och skriver allt runt omkring. För dem är selen det enda de kan ändra, och den trimmas oftast för hand, på känsla, tills den verkar tillräckligt bra.

Grenarna på ett träd sedda underifrån mot en blek himmel
Ramverket håller flera selvarianter vid liv och låter dem tävla. Illustrativ bild. Ishtiak Ahamed · pexels · Pexels License

En systematisk sökning i det utrymmet är därför direkt användbar på ett sätt som ett träningsresultat inte är. Salesforce har släppt ett öppet ramverk kallat Beagle under Apache 2.0-licens så att team kan köra selutveckling mot sina egna agenter. Seniorförfattare på arbetet är Ran Xu.

Vad som skulle bekräfta det

Två saker. Den första är att någon utanför Salesforce återskapar hoppet på WebArena-Infinity med en sele de inte själva skrivit, eftersom storleken på en förbättring beror starkt på hur svag utgångspunkten var. Den andra är belägg för att en utvecklad sele håller på uppgifter som inte fanns i utvärderingsuppsättningen — hela metoden är en sökning mot en fast uppsättning tester, och sökningar mot fasta uppsättningar har en välkänd vana att hitta uppsättningen snarare än förmågan.