Vad som är nytt i omgången
MLCommons publicerade den 16 september resultaten från MLPerf Inference v6.1, branschens riktmärke för hur snabbt hårdvara och mjukvara kan köra AI-modeller. Trettio organisationer skickade in resultat, vilket MLCommons kallar rekord, bland dem sex nykomlingar: Atlas Inference, Crusoe, Orrick Industries, ScitiX, VibeHPC och den enskilde bidragsgivaren Naeem Khoshnevis.
Omgången får två nya tester. Ett helt RAG-test, där svar hämtas med stöd av sökning, mäter en hel kedja för frågor och svar där en inbäddningsmodell, en hämtare, en omrankare och en språkmodell samverkar. Ett test av agentisk inferens på edge-enheter mäter samtal i flera turer där sammanhanget växer, med programmeringsuppgifter och krav på träffsäkerhet som systemet måste klara.
Frågebesvarande har utvecklats bortom en språkmodell som bara tränats på en textmassa, och därför lades RAG-testet till, sade Miro Hodak, som leder arbetsgruppen för MLPerf Inference tillsammans med en kollega.

Ny hårdvara och större system
Nya acceleratorer i omgången är AMD:s Ryzen AI Max+ 395 och Instinct MI350P, Intels Arc Pro B70 och Nvidias Rubin. Nvidias rack Vera Rubin NVL72 finns med som förhandsbidrag. MLCommons uppger att det största systemet använde 512 acceleratorer och att två blandade system deltog, ett med flera tillverkare och ett utspritt på flera platser.
Enligt branschgruppen har resultaten i testet för syn- och språkmodeller förbättrats 2,99 gånger på sex månader, och prestandan i DeepSeek-R1-testet har förbättrats 5,7 gånger på ett år. Bland deltagarna fanns också AMD, Cisco, CoreWeave, Dell, Google, Hewlett Packard Enterprise, Intel, Microsoft Azure, Nebius, Oracle, Red Hat och Supermicro.
Nvidias egna påståenden
I ett eget inlägg skriver Nvidia att Vera Rubin NVL72 gav upp till 3,7 gånger så hög genomströmning som bolagets GB300 NVL72 i Qwen3-VL-testet och upp till 2,5 gånger i DeepSeek-R1. Bolaget uppger att GB300 NVL72 skalade med 99 procents effektivitet över fyra rack, 288 GPU:er, och att enbart mjukvaruförbättringar höjt prestandan upp till 1,6 gånger sedan förra omgången.

Multiplarna är Nvidias egna jämförelser utifrån bolagets bidrag. Vera Rubin-siffrorna kommer från ett förhandsbidrag, som gäller hårdvara som ännu inte finns allmänt tillgänglig. Nvidia säger också att 19 partner skickade in resultat på dess plattformar.
Varför de nya testerna spelar roll
Inferenstester har länge handlat om en modell som svarar på en fråga. RAG- och agenttesterna mäter de system som många företag nu driftsätter, där flera modeller körs i följd och sammanhanget byggs upp under ett samtal. Hur många leverantörer som ställer upp i dem nästa omgång visar om de blir de siffror köpare jämför.