Reflection åbner Beam og sætter driftsomkostningen forrest

Reflection AI fremlagde Beam den 5. oktober — den første model med åbne vægte fra et laboratorium, der blev grundlagt i 2024 af to tidligere Google DeepMind-forskere, Misha Laskin og Ioannis Antonoglou. Vægtene er endnu ikke ude. Reflection oplyser, at de bliver offentliggjort under Apache 2.0-licens senere i oktober sammen med en teknisk rapport, et modelkort og værktøjer til at køre, evaluere og finjustere modellen, når red teaming og evalueringerne er færdige. Indtil da sker adgangen via venteliste.

Beam er en sparsom mixture-of-experts-transformer til ren tekst: 501 milliarder parametre i alt, 23 milliarder aktive for hvert enkelt token. Reflection oplyser, at modellen blev fortrænet på 23,8 billioner tokens webdata og licenseret data på under fire uger med 6.144 Nvidia GB300 NVL72-chips, og at man derefter kørte en forstærkningslæringsfase med over 100 millioner rollouts på 10.500 af de samme chips i yderligere fire uger. Kontekstvinduet var 256.000 tokens under forstærkningslæringen og blev strakt til en million i mellemtræningen.

En processorchip på et kredsløbskort, set tæt på
Fortræningen tog under fire uger på 6.144 Nvidia GB300 NVL72-chips, oplyser Reflection. Illustration. Jeremy Waterhouse · pexels · Pexels License

Påstanden er lighed med GLM 5.2 for en brøkdel af regnekraften

Reflections argument er ikke, at Beam er den stærkeste åbne model, der findes. Det er, at Beam opnår resultater, der er “sammenlignelige med GLM-5.2 med tre til fire gange mindre regnekraft ved inferens” — et omkostningsargument, ikke et kapacitetsargument. Zhipu AIs GLM 5.2 har omkring 250 milliarder flere parametre end Beam.

Alle offentliggjorte testtal er Reflections egne, og ingen af dem er gengivet uafhængigt. I virksomhedens egen tabel får Beam 80,1 på Terminal-Bench v2.1 mod 81,0 for GLM 5.2, 86,6 for Alibabas Qwen 3.8-Max og 88,3 for Moonshot AIs Kimi K3. På GPQA Diamond får den 90,5 mod 91,2 for GLM 5.2, 92,6 for Qwen 3.8-Max og 93,5 for Kimi K3. På AIME 2026 når den 97,8 mod GLM 5.2’s 99,2. På den svære halvdel af SWE-Bench Pro v2 får den 77,2, langt efter Kimi K3 med 84,3 og Qwen 3.8-Max med 88,2.

Læst lige frem viser tabellen, at Beam ligger omkring et point under GLM 5.2 hele vejen og klart under de to større kinesiske modeller. Det er tæt på det, Reflection selv siger, den viser: virksomheden kalder Beam “konkurrencedygtig” over for GLM 5.2 og siger, at den “nærmer sig” Qwen 3.8-Max på kodning og agentarbejde.

En kontorbygning med glasfacade i en gade under en blå himmel
Reflection har hentet omkring 4,7 milliarder dollar og indgået regnekraftaftaler for over 7 milliarder frem til 2029. Illustration. Brett Sayles · pexels · Pexels License

Hvad det har kostet at komme hertil

Reflection har hentet omkring 4,7 milliarder dollar, blandt andet fra Nvidia, Sequoia Capital og Lightspeed Venture Partners, til en værdi før penge på 25 milliarder dollar, skriver TechCrunch. Virksomheden har indgået regnekraftaftaler for over 7 milliarder dollar med SpaceX og Nebius om adgang til Nvidia GB300-chips frem til 2029.

Virksomhedens indramning er geopolitisk: kinesiske laboratorier holder fronten for åbne vægte, og et vestligt laboratorium bør holde en del af den. Ud fra det, Reflection har offentliggjort, tager Beam ikke den front tilbage. Hvad den tilbyder, er en model, der kan hentes, ændres og driftes selv under en tilladende licens, med en inferensregning, som producenten sætter til en tredjedel eller en fjerdedel af den nærmeste sammenlignelige åbne models.

Det, der er værd at følge senere i oktober, er vægtene og den tekniske rapport. Uafhængige kørsler af Terminal-Bench og SWE-Bench Pro afgør, om effektivitetspåstanden holder uden for Reflections eget stillads.