Reflection öppnar Beam och sätter driftkostnaden först
Reflection AI presenterade Beam den 5 oktober — den första modellen med öppna vikter från ett labb som grundades 2024 av två tidigare Google DeepMind-forskare, Misha Laskin och Ioannis Antonoglou. Vikterna är ännu inte ute. Reflection uppger att de publiceras under Apache 2.0-licens senare i oktober, tillsammans med en teknisk rapport, ett modellkort och verktyg för att köra, utvärdera och finjustera modellen, när red teaming och utvärderingar är klara. Före dess sker åtkomsten via väntelista.
Beam är en gles mixture-of-experts-transformer för enbart text: 501 miljarder parametrar totalt, 23 miljarder aktiva för varje enskild token. Reflection uppger att modellen förtränades på 23,8 biljoner tokens webbdata och licensierad data på under fyra veckor med 6 144 Nvidia GB300 NVL72-chipp, och att man därefter körde en förstärkningsinlärningsfas med över 100 miljoner rollouts på 10 500 av samma chipp i ytterligare fyra veckor. Kontextfönstret var 256 000 tokens under förstärkningsinlärningen och sträcktes ut till en miljon i mellanträningen.

Löftet är paritet med GLM 5.2 på en bråkdel av beräkningskraften
Reflections argument är inte att Beam är den starkaste öppna modellen som finns. Det är att Beam når resultat som är “jämförbara med GLM-5.2 med tre till fyra gånger mindre beräkningskraft vid inferens” — ett kostnadsargument, inte ett kapacitetsargument. Zhipu AI:s GLM 5.2 har ungefär 250 miljarder fler parametrar än Beam.
Samtliga publicerade testsiffror är Reflections egna och ingen av dem har reproducerats oberoende. I bolagets egen tabell får Beam 80,1 på Terminal-Bench v2.1 mot 81,0 för GLM 5.2, 86,6 för Alibabas Qwen 3.8-Max och 88,3 för Moonshot AI:s Kimi K3. På GPQA Diamond får den 90,5 mot 91,2 för GLM 5.2, 92,6 för Qwen 3.8-Max och 93,5 för Kimi K3. På AIME 2026 når den 97,8 mot GLM 5.2:s 99,2. På den svåra halvan av SWE-Bench Pro v2 får den 77,2, långt efter Kimi K3 på 84,3 och Qwen 3.8-Max på 88,2.
Rakt läst visar tabellen att Beam ligger omkring en poäng under GLM 5.2 rakt över och klart under de två större kinesiska modellerna. Det ligger nära det Reflection själv säger att den visar: bolaget kallar Beam “konkurrenskraftig” mot GLM 5.2 och säger att den “närmar sig” Qwen 3.8-Max på kodning och agentarbete.

Vad det har kostat att komma hit
Reflection har rest omkring 4,7 miljarder dollar, bland annat från Nvidia, Sequoia Capital och Lightspeed Venture Partners, till en värdering före pengarna på 25 miljarder dollar, rapporterar TechCrunch. Bolaget har tecknat beräkningsavtal på över 7 miljarder dollar med SpaceX och Nebius för tillgång till Nvidia GB300-chipp fram till 2029.
Bolagets inramning är geopolitisk: kinesiska labb håller fronten för öppna vikter, och ett västerländskt labb bör hålla en del av den. Av det underlag Reflection har publicerat tar Beam inte tillbaka den fronten. Vad den erbjuder är en modell som kan laddas ner, ändras och driftas i egen regi under en tillåtande licens, med en inferensnota som tillverkaren uppger är en tredjedel till en fjärdedel av den närmaste jämförbara öppna modellens.
Det som är värt att bevaka senare i oktober är vikterna och den tekniska rapporten. Oberoende körningar av Terminal-Bench och SWE-Bench Pro avgör om effektivitetslöftet håller utanför Reflections eget ramverk.