Provet
Epoch AI publicerade den 23 september resultat från sitt Furniture Assembly Benchmark, som fotograferar tre Ikea-byggen halvvägs in i monteringen med avsiktligt införda fel, och ber en modell hitta dem.
Uppsättningen är 60 bilder. Modellen får monteringsanvisningen tillsammans med fotografierna, plus ett zoomverktyg och en Python-tolk, och ska identifiera varje steg där ett fel begåtts och ge en rimlig beskrivning av vart och ett. Rättningen sker i flera steg: modellen måste namnge rätt steg, och en språkmodell som rättare — GPT-5.6 Sol — kontrollerar om beskrivningen av felet stämmer, efter en medvetet generös måttstock.
Resultatet
GPT-6 Astra får 80 procent. Claude Fable 5.1 följer på 70, och Claude Opus 5 på 61.
Rörelsen är nyheten. Bästa resultatet i november 2025 var 28 procent, satt av Claude Opus 4.5. Tio månader senare ligger fronten på 80.

Hastigheten, som är den andra halvan
Astra tar dessutom tre minuter i median per uppgift, vilket Epoch beskriver som det snabbaste av alla modeller den utvärderat — mellan två och tio gånger snabbare än de som tidigare ledde.
Den kombinationen är vad som gör poängen intressant snarare än bara hög. En modell som resonerar sig fram till rätt svar på tjugo minuter per fotografi är ett forskningsresultat. En som gör det på tre är närmare något som skulle kunna sitta bakom en kamera.
Epoch är tydlig med att den inte är där än: fortfarande för långsam för hjälp i realtid under monteringen, även om forskarna menar att förmågan så småningom kan föras över till bilreparationer eller vitvarufix.
Vad det faktiskt mäter, och inte
Uppgiften är visuell och rumslig: jämför ett fotografi av ett fysiskt föremål mot en ritning av hur det ska se ut, och hitta avvikelsen. Det är en rimlig indikator på den sortens förankrade varseblivning som släpat efter textresonemang, och den är svår att lura genom utantillinlärning, eftersom felen införs med avsikt.
Förbehållen är verkliga. Testet använder tre möbler, vilket Epoch själv noterar begränsar hur långt resultatet generaliserar till fysiskt resonemang i stort. Rättaren är en språkmodell. Och Epoch byggde och körde testet själv, vilket gör det till en oberoende utvärdering av labbens modeller men inte till en oberoende utvärdering av Epochs metod.

Varför det förtjänar uppmärksamhet
Därför att det är ett av få test vars felläge är läsbart för vem som helst. Man behöver inte veta vad poängen betyder för att titta på ett foto av en hylla med en skiva bak och fram och förstå vad modellen ombetts göra.
Det är också ett ovanligt fall där det är en oberoende utvärderare, inte en leverantör, som rapporterar siffran som rört sig. Hoppet från 28 till 80 är Epochs mätning av andra bolags modeller, inte något bolags berättelse om sig självt.
Att hålla ögonen på
Om medianen på tre minuter fortsätter falla, och om någon utvidgar uppsättningen bortom tre byggen. Generaliseringsfrågan är den som dagens resultat inte kan besvara.