Privat kod, verkliga uppgifter
Ett nytt kodningstest från Specific Labs, ett startupbolag som uppger att det backas av Y Combinator, prövar AI-agenter på uppgifter hämtade från privata produktionskodbaser som bolaget har licensierat från verkliga företag, i stället för på publika kodförråd som en modell kan ha sett under träningen. På Real-SWE:s första topplista löste Anthropics Fable 5.1, körd i Claude Code, 38,8 % av sina försök. OpenAI:s GPT-6 Astra i Codex CLI följde med 33,8 % och Googles Gemini 3.8 Flash i Gemini CLI med 31,2 %.
Siffrorna är Specific Labs egna mätningar, publicerade i september 2026. De är oberoende av modellföretagen, men ingen annan har upprepat dem.
Så fungerar testet
Uppgifterna är problem som ingenjörer på källföretagen faktiskt har löst. Instruktionerna är i genomsnitt 1 742 tecken långa och medianuppgiften kräver ändringar i 11 filer, enligt testets webbsida. Bland företagen finns en konkurrent till Luma och Partiful med över 200 000 användare och en fintechplattform för konsumenter som behandlar över 100 000 kontoutdrag.
Varje modell får åtta oberoende försök per uppgift i den agentmiljö (harness) som tillverkaren själv levererar, så Real-SWE betygsätter modellen och dess harness tillsammans snarare än modellen isolerat. Undantaget är Zhipus GLM 5.3, som kördes i Claude Code. Sidan anger Snagnik Das, Siddhant Paliwal och Janak Sunil som upphovspersoner.

Topplistan
| Placering | Modell och harness | Löst | Kostnad per försök |
|---|---|---|---|
| 1 | Fable 5.1 (Claude Code) | 38,8 % | 6,96 dollar |
| 2 | GPT-6 Astra (Codex CLI) | 33,8 % | 4,67 dollar |
| 3 | Gemini 3.8 Flash (Gemini CLI) | 31,2 % | 2,50 dollar |
| 4 | GLM 5.3 (Claude Code) | 28,8 % | 5,12 dollar |
| 5 | Grok 4.6 (Grok Build) | 23,8 % | 3,44 dollar |
| 5 | Muse Spark 1.3 (Muse Code) | 23,8 % | 2,74 dollar |
| 7 | Kimi K3 (Kimi Code) | 18,8 % | 3,90 dollar |
| 8 | GPT-5.6 Sol (Codex CLI) | 16,2 % | 2,65 dollar |
Det vanligaste felet för samtliga modeller var ett missat krav, enligt testets webbsida.
Kostnaden per lösning ger en annan bild
Delar man kostnaden för ett försök med andelen lyckade försök ändras ordningen. En analys från The D*AI*LY Brief landar på omkring 17,94 dollar per löst uppgift för Fable 5.1, 13,82 dollar för GPT-6 Astra, 11,51 dollar för Muse Spark 1.3 och 8,01 dollar för Gemini 3.8 Flash.
Fable 5.1 är den modell som mest sannolikt slutför en uppgift. Gemini 3.8 Flash är det billigaste sättet att få en uppgift slutförd, till mindre än hälften av Fables kostnad per lösning, samtidigt som den löser ungefär fyra uppgifter för varje fem som Fable löser.

Läs siffrorna med försiktighet
Urvalet är litet. De offentliga resultaten bygger på tio uppgifter, som var och en kördes åtta gånger för var och en av de åtta modellerna, enligt The D*AI*LY Briefs tolkning av antalet körningar som anges på sidan. Det innebär att en enda uppgift, löst eller misslyckad i alla åtta försök, kan flytta en modells resultat med upp till tio procentenheter. Avståndet mellan andra- och tredjeplatsen är mindre än så.
Kodbaserna är privata av princip, så utomstående kan inte granska uppgifterna. Sunil skrev på Hacker News att teamet skulle ”släppa en del av våra uppgifter och modelltrajektorier som öppen källkod” och att det manuellt granskar kodbaserna och de företag som tillhandahåller dem, uppgav analysen.
Att hålla koll på
Om Specific Labs publicerar de uppgifter och trajektorier som utlovats, och om ordningen håller i takt med att uppgiftsuppsättningen växer bortom tio. En större uppsättning skulle också visa om billigare modeller behåller sitt försprång i kostnad per lösning på svårare uppgifter.