Reflection presenta Beam y pone el coste por delante
Reflection AI presentó Beam el 5 de octubre: el primer modelo de pesos abiertos de un laboratorio fundado en 2024 por dos antiguos investigadores de Google DeepMind, Misha Laskin e Ioannis Antonoglou. Los pesos aún no están disponibles. Reflection dijo que los publicará bajo licencia Apache 2.0 a finales de octubre, junto con un informe técnico, una ficha del modelo y herramientas para ejecutarlo, evaluarlo y ajustarlo, cuando terminen el red teaming y las evaluaciones. Hasta entonces, el acceso es por lista de espera.
Beam es un transformador disperso de mezcla de expertos, solo de texto: 501.000 millones de parámetros en total y 23.000 millones activos para cada token. Reflection afirmó que preentrenó el modelo con 23,8 billones de tokens de datos web y con licencia en menos de cuatro semanas sobre 6.144 chips Nvidia GB300 NVL72, y que después ejecutó una fase de aprendizaje por refuerzo de más de 100 millones de rollouts sobre 10.500 de esos mismos chips durante otras cuatro semanas. La ventana de contexto fue de 256.000 tokens durante el refuerzo y se amplió a un millón en el entrenamiento intermedio.

La tesis es igualar a GLM 5.2 con una fracción del cómputo
El argumento de Reflection no es que Beam sea el modelo abierto más potente. Es que Beam logra puntuaciones “comparables a GLM-5.2 usando entre tres y cuatro veces menos cómputo de inferencia”: un argumento de coste, no de capacidad. GLM 5.2, de Zhipu AI, tiene unos 250.000 millones de parámetros más que Beam.
Todas las cifras de referencia publicadas hasta ahora son de Reflection y ninguna ha sido reproducida de forma independiente. En la tabla de la empresa, Beam obtiene 80,1 en Terminal-Bench v2.1 frente a 81,0 de GLM 5.2, 86,6 de Qwen 3.8-Max de Alibaba y 88,3 de Kimi K3 de Moonshot AI. En GPQA Diamond logra 90,5 frente a 91,2 de GLM 5.2, 92,6 de Qwen 3.8-Max y 93,5 de Kimi K3. En AIME 2026 llega a 97,8 frente a los 99,2 de GLM 5.2. En la mitad difícil de SWE-Bench Pro v2 obtiene 77,2, muy por detrás de Kimi K3 con 84,3 y de Qwen 3.8-Max con 88,2.
Leída tal cual, la tabla sitúa a Beam alrededor de un punto por debajo de GLM 5.2 en todas las pruebas y claramente por detrás de los dos modelos chinos más grandes. Es casi lo que Reflection dice que muestra: la empresa califica a Beam de “competitivo” con GLM 5.2 y afirma que se “acerca” a Qwen 3.8-Max en programación y en tareas de agentes.

Lo que ha costado llegar hasta aquí
Reflection ha levantado unos 4.700 millones de dólares, con Nvidia, Sequoia Capital y Lightspeed Venture Partners entre sus inversores, con una valoración previa de 25.000 millones, según TechCrunch. Ha firmado más de 7.000 millones en acuerdos de cómputo con SpaceX y Nebius para acceder a chips Nvidia GB300 hasta 2029.
El encuadre de la empresa es geopolítico: los laboratorios chinos dominan la frontera de los pesos abiertos y un laboratorio occidental debería ocupar parte de ella. Con las pruebas que Reflection ha publicado, Beam no recupera esa frontera. Lo que ofrece es un modelo descargable, modificable y alojable por cuenta propia con una licencia permisiva, y una factura de inferencia que su fabricante cifra entre un tercio y un cuarto de la del modelo abierto comparable más próximo.
Lo que hay que vigilar a finales de mes son los pesos y el informe técnico. Ejecuciones independientes de Terminal-Bench y SWE-Bench Pro dirán si la promesa de eficiencia resiste fuera del propio arnés de Reflection.