Reflection åpner Beam og setter driftskostnaden først
Reflection AI la fram Beam 5. oktober — den første modellen med åpne vekter fra et laboratorium som ble grunnlagt i 2024 av to tidligere Google DeepMind-forskere, Misha Laskin og Ioannis Antonoglou. Vektene er ennå ikke ute. Reflection sier de blir publisert under Apache 2.0-lisens senere i oktober, sammen med en teknisk rapport, et modellkort og verktøy for å kjøre, evaluere og finjustere modellen, når red teaming og evalueringene er ferdige. Fram til da skjer tilgangen via venteliste.
Beam er en tynn mixture-of-experts-transformer for bare tekst: 501 milliarder parametere i alt, 23 milliarder aktive for hvert enkelt token. Reflection sier modellen ble førtrent på 23,8 billioner tokens med webdata og lisensiert data på under fire uker med 6 144 Nvidia GB300 NVL72-brikker, og at de deretter kjørte en forsterkningslæringsfase med over 100 millioner rollouts på 10 500 av de samme brikkene i fire uker til. Kontekstvinduet var 256 000 tokens under forsterkningslæringen og ble strukket til en million i mellomtreningen.

Påstanden er likhet med GLM 5.2 på en brøkdel av regnekraften
Reflections argument er ikke at Beam er den sterkeste åpne modellen som finnes. Det er at Beam når resultater som er “sammenlignbare med GLM-5.2 med tre til fire ganger mindre regnekraft ved inferens” — et kostnadsargument, ikke et kapasitetsargument. Zhipu AIs GLM 5.2 har rundt 250 milliarder flere parametere enn Beam.
Alle testtallene som er publisert så langt, er Reflections egne, og ingen av dem er gjengitt uavhengig. I selskapets egen tabell får Beam 80,1 på Terminal-Bench v2.1 mot 81,0 for GLM 5.2, 86,6 for Alibabas Qwen 3.8-Max og 88,3 for Moonshot AIs Kimi K3. På GPQA Diamond får den 90,5 mot 91,2 for GLM 5.2, 92,6 for Qwen 3.8-Max og 93,5 for Kimi K3. På AIME 2026 kommer den til 97,8 mot GLM 5.2 sine 99,2. På den vanskelige halvdelen av SWE-Bench Pro v2 får den 77,2, langt bak Kimi K3 på 84,3 og Qwen 3.8-Max på 88,2.
Lest rett fram viser tabellen at Beam ligger omtrent ett poeng under GLM 5.2 over hele linja, og klart under de to større kinesiske modellene. Det er nær det Reflection selv sier den viser: selskapet kaller Beam “konkurransedyktig” mot GLM 5.2 og sier den “nærmer seg” Qwen 3.8-Max på koding og agentarbeid.

Hva det har kostet å komme hit
Reflection har hentet rundt 4,7 milliarder dollar, blant annet fra Nvidia, Sequoia Capital og Lightspeed Venture Partners, til en verdsettelse før penger på 25 milliarder dollar, melder TechCrunch. Selskapet har inngått regnekraftavtaler på over 7 milliarder dollar med SpaceX og Nebius for tilgang til Nvidia GB300-brikker fram til 2029.
Selskapets innramming er geopolitisk: kinesiske laboratorier holder fronten for åpne vekter, og et vestlig laboratorium bør holde en del av den. Ut fra det Reflection har publisert, tar Beam ikke den fronten tilbake. Det den tilbyr, er en modell som kan lastes ned, endres og driftes selv under en tillatende lisens, med en inferensregning produsenten anslår til en tredjedel eller en fjerdedel av den nærmeste sammenlignbare åpne modellens.
Det som er verdt å følge med på senere i oktober, er vektene og den tekniske rapporten. Uavhengige kjøringer av Terminal-Bench og SWE-Bench Pro avgjør om effektivitetspåstanden holder utenfor Reflections eget rammeverk.