Att ändra allt utom modellen
Salesforce AI Research och Salesforce Agentforce publicerade i veckan ett ramverk kallat DarwinX, som förbättrar en AI-agent genom att utveckla ställningen runt den — instruktionerna, verktygen, färdigheterna och arbetsflödena som utgör selen — utan att röra modellens vikter.
På WebArena-Infinity, ett test för webbläsaruppgifter, rapporterar Salesforce att agenten gick från att klara 43,5 procent av uppgifterna till 93 procent. På Terminal-Bench 2.1 rapporterar bolaget 75,5 till 83,2 procent, och på SWE-bench Verified 80,8 till 84,2 procent. Den primära basmodellen var GPT-5.5, och Claude Opus 4.8 testades också.
Detta är utvecklarens egna siffror om sitt eget system, och ingen oberoende utvärdering har ännu återskapat dem. Särskilt webbläsarsiffran är stor nog att inbjuda till granskning av hur mycket utrymme den ursprungliga selen lämnade outnyttjat.
De två problem ramverket säger sig lösa
Att trimma selen är inget nytt. Det DarwinX siktar på är två felmoder som gör det svårt att göra för hand.

Det första är stigberoende: ett tidigt val i hur ställningen skrivs begränsar vad som kan utforskas senare, och processen fastnar i ett lokalt optimum ingen valt. Det andra är tvärstörning mellan uppgifter, där en ändring som förbättrar en sorts uppgift tyst försämrar en annan.
DarwinX hanterar båda genom att hålla flera selvarianter vid liv samtidigt och låta förbättringar tävla, i stället för att gång på gång skriva om en enda version. En ändring går bara vidare om den förbättrar förmågan utan att backa på de övriga uppgifterna i uppsättningen.
Varför det spelar roll för dem som inte tränar modeller
De flesta team som bygger på AI har ingen finjusteringskedja. De anropar en driftad modell och skriver allt runt omkring. För dem är selen det enda de kan ändra, och den trimmas oftast för hand, på känsla, tills den verkar tillräckligt bra.

En systematisk sökning i det utrymmet är därför direkt användbar på ett sätt som ett träningsresultat inte är. Salesforce har släppt ett öppet ramverk kallat Beagle under Apache 2.0-licens så att team kan köra selutveckling mot sina egna agenter. Seniorförfattare på arbetet är Ran Xu.
Vad som skulle bekräfta det
Två saker. Den första är att någon utanför Salesforce återskapar hoppet på WebArena-Infinity med en sele de inte själva skrivit, eftersom storleken på en förbättring beror starkt på hur svag utgångspunkten var. Den andra är belägg för att en utvecklad sele håller på uppgifter som inte fanns i utvärderingsuppsättningen — hela metoden är en sökning mot en fast uppsättning tester, och sökningar mot fasta uppsättningar har en välkänd vana att hitta uppsättningen snarare än förmågan.