A Reflection abre o Beam e põe o custo de operação à frente
A Reflection AI apresentou o Beam em 5 de outubro: o primeiro modelo de pesos abertos de um laboratório fundado em 2024 por dois ex-investigadores da Google DeepMind, Misha Laskin e Ioannis Antonoglou. Os pesos ainda não saíram. A Reflection disse que os vai publicar sob licença Apache 2.0 no final de outubro, com um relatório técnico, um cartão de modelo e ferramentas para executar, avaliar e ajustar o modelo, quando terminarem o red teaming e as avaliações. Até lá, o acesso é por lista de espera.
O Beam é um transformador esparso de mistura de especialistas, só de texto: 501 mil milhões de parâmetros no total, 23 mil milhões ativos por token. A Reflection afirmou que pré-treinou o modelo com 23,8 bilhões de tokens de dados da web e licenciados em menos de quatro semanas, em 6.144 chips Nvidia GB300 NVL72, e que depois correu uma fase de aprendizagem por reforço com mais de 100 milhões de rollouts em 10.500 desses mesmos chips durante outras quatro semanas. A janela de contexto foi de 256.000 tokens durante o reforço e foi esticada até um milhão no treino intermédio.

A tese é igualar o GLM 5.2 com uma fração da computação
O argumento da Reflection não é que o Beam seja o modelo aberto mais forte disponível. É que o Beam alcança resultados “comparáveis ao GLM-5.2 usando três a quatro vezes menos computação de inferência” — um argumento de custo, não de capacidade. O GLM 5.2, da Zhipu AI, tem cerca de 250 mil milhões de parâmetros mais do que o Beam.
Todos os números publicados até agora são da própria Reflection e nenhum foi reproduzido de forma independente. Na tabela da empresa, o Beam obtém 80,1 no Terminal-Bench v2.1 contra 81,0 do GLM 5.2, 86,6 do Qwen 3.8-Max da Alibaba e 88,3 do Kimi K3 da Moonshot AI. No GPQA Diamond consegue 90,5, contra 91,2 do GLM 5.2, 92,6 do Qwen 3.8-Max e 93,5 do Kimi K3. No AIME 2026 chega a 97,8 contra os 99,2 do GLM 5.2. Na metade difícil do SWE-Bench Pro v2 obtém 77,2, bem atrás do Kimi K3 com 84,3 e do Qwen 3.8-Max com 88,2.
Lida sem filtros, a tabela coloca o Beam cerca de um ponto abaixo do GLM 5.2 em todos os testes e claramente atrás dos dois modelos chineses maiores. É perto do que a Reflection diz que ela mostra: a empresa chama o Beam de “competitivo” com o GLM 5.2 e diz que está a “aproximar-se” do Qwen 3.8-Max em programação e trabalho de agentes.

O que custou chegar aqui
A Reflection levantou cerca de 4,7 mil milhões de dólares, incluindo da Nvidia, da Sequoia Capital e da Lightspeed Venture Partners, com uma avaliação pré-investimento de 25 mil milhões, noticiou o TechCrunch. Assinou mais de 7 mil milhões em acordos de computação com a SpaceX e a Nebius para acesso a chips Nvidia GB300 até 2029.
O enquadramento da empresa é geopolítico: os laboratórios chineses dominam a fronteira dos pesos abertos e um laboratório ocidental deveria ocupar parte dela. Pelas provas que a Reflection publicou, o Beam não recupera essa fronteira. O que oferece é um modelo que pode ser descarregado, modificado e alojado por conta própria sob uma licença permissiva, com uma fatura de inferência que o fabricante diz ser um terço a um quarto da do modelo aberto comparável mais próximo.
O que há para observar no final do mês são os pesos e o relatório técnico. Execuções independentes do Terminal-Bench e do SWE-Bench Pro vão decidir se a promessa de eficiência sobrevive fora do arnês da própria Reflection.