Vad som släpptes
Inception, uppstartsbolaget som grundades av forskarna från Stanford, UCLA och Cornell bakom den första diffusionsbaserade stora språkmodellen, lanserade Mercury 2.5 den 8 september. Bolaget kallar den den största diffusionsbaserade språkmodell som hittills tränats.
Inception uppger att modellen kör i över 1 100 tokens i sekunden i produktion — AlphaSignal anger 1 107 — på vanliga Nvidia-GPU:er i stället för specialiserad hårdvara, och att kontextfönstret vuxit från 128 000 till 260 000 tokens. Modellen får justerbart resonemang, inbyggd verktygsanvändning, ett JSON-läge och parallella verktygsanrop.
Om kvaliteten säger bolaget att Mercury 2.5 får tio poäng mer än Mercury 2 på det intelligensmått det hänvisar till, och beskriver resultatet som ungefär 40 procents förbättring. Det placerar modellen i nivå med GPT-5.6 Luna och Claude Haiku 4.5. Det är Inceptions egna siffror om Inceptions egen modell, och ingen oberoende utvärdering publicerades vid sidan av dem.
Varför diffusion är annorlunda
En konventionell språkmodell är autoregressiv: den producerar en token, betingar på den, producerar nästa, och så vidare. Sekvensen är flaskhalsen, och allt branschen gör för att snabba upp inferens — batchning, spekulativ avkodning, bättre kärnor — går runt den begränsningen i stället för att ta bort den.

En diffusionsbaserad språkmodell utgår från ett grovt utkast av hela svaret och förfinar tokens parallellt över flera pass. Det förändrar vad hårdvaran gör. Det är därför ett bolag med långt mindre kapital än frontlaboratorierna kan redovisa en genomströmningssiffra flera gånger deras, och därför siffran blir rubriken snarare än testresultatet.
Priset, och kunden det riktar sig till
Standardpriset är 0,20 dollar per miljon inmatade tokens och 0,75 dollar per miljon utmatade, med 80 procents lanseringsrabatt som drar ned det till 0,04 och 0,15. Nya användare får 100 miljoner tokens gratis. Modellen finns via Inceptions eget API, OpenRouter och Baseten.

Vilken kund det är byggt för syns i det kundfall Inception publicerade: en chef på OpenCall uppgav att svarstiden vid P99 sjönk från flera minuter till en sekund efter att Mercury tagits i bruk, med en medianlatens under 0,2 sekunder. Det är en röst- och supportarbetslast, där ett långsamt svar är ett misslyckat svar hur bra det än är. Inception backas av Menlo Ventures, Mayfield och Microsofts fond M12.
Vad som är värt att följa
Om kvalitetspåståendet håller vid utomstående utvärdering. Diffusionsbaserade språkmodeller har genomgående bytt träffsäkerhet mot hastighet, och paritet med Haiku-klassen är en blygsam men verklig ribba. Håll utkik efter om modellen dyker upp på en oberoende topplista, och efter om lanseringsrabatten på 80 procent förvandlas till varaktig användning när den löper ut.