Reflection ने Beam खोला, और चलाने की लागत को आगे रखा
Reflection AI ने 5 अक्टूबर को Beam पेश किया — यह उस प्रयोगशाला का पहला खुले वज़न वाला मॉडल है जिसकी स्थापना 2024 में Google DeepMind के दो पूर्व शोधकर्ताओं, मिशा लास्किन और इओआनिस आंतोनोग्लू ने की थी। वज़न अभी जारी नहीं हुए हैं। Reflection ने कहा कि red teaming और मूल्यांकन पूरे होने पर वह उन्हें अक्टूबर के अंत में Apache 2.0 लाइसेंस के तहत प्रकाशित करेगी, साथ में एक तकनीकी रिपोर्ट, एक मॉडल कार्ड और मॉडल को चलाने, परखने तथा फ़ाइन-ट्यून करने के उपकरण भी। उससे पहले पहुँच प्रतीक्षा-सूची से मिलेगी।
Beam केवल पाठ के लिए बना एक विरल mixture-of-experts ट्रांसफ़ॉर्मर है: कुल 501 अरब पैरामीटर, और किसी एक टोकन के लिए 23 अरब सक्रिय। Reflection ने कहा कि उसने मॉडल को वेब तथा लाइसेंस-प्राप्त डेटा के 23.8 ट्रिलियन टोकन पर चार सप्ताह से कम समय में 6,144 Nvidia GB300 NVL72 चिपों पर पूर्व-प्रशिक्षित किया, और फिर उन्हीं चिपों में से 10,500 पर चार और सप्ताह तक 10 करोड़ से अधिक rollouts वाला एक प्रबलन-अधिगम चरण चलाया। प्रबलन-अधिगम के दौरान संदर्भ-खिड़की 2,56,000 टोकन थी और मध्य-प्रशिक्षण में इसे दस लाख तक बढ़ाया गया।

दावा है GLM 5.2 के बराबर, पर गणना के एक अंश पर
Reflection का तर्क यह नहीं है कि Beam उपलब्ध सबसे मज़बूत खुला मॉडल है। तर्क यह है कि Beam “GLM-5.2 के तुलनीय” अंक पाता है, और वह भी “तीन से चार गुना कम inference गणना” के साथ — यह क्षमता का नहीं, लागत का तर्क है। Zhipu AI के GLM 5.2 में Beam से लगभग 250 अरब अधिक पैरामीटर हैं।
अब तक प्रकाशित सभी बेंचमार्क आँकड़े Reflection के अपने हैं और किसी की भी स्वतंत्र पुष्टि नहीं हुई है। कंपनी की तालिका में Beam को Terminal-Bench v2.1 पर 80.1 मिलते हैं, जबकि GLM 5.2 को 81.0, Alibaba के Qwen 3.8-Max को 86.6 और Moonshot AI के Kimi K3 को 88.3। GPQA Diamond पर उसे 90.5 मिलते हैं, जबकि GLM 5.2 को 91.2, Qwen 3.8-Max को 92.6 और Kimi K3 को 93.5। AIME 2026 पर वह 97.8 तक पहुँचता है, जबकि GLM 5.2 को 99.2 मिले। SWE-Bench Pro v2 के कठिन हिस्से पर उसे 77.2 मिलते हैं, जो Kimi K3 के 84.3 और Qwen 3.8-Max के 88.2 से काफ़ी पीछे है।
सीधे पढ़ने पर तालिका दिखाती है कि Beam हर जगह GLM 5.2 से लगभग एक अंक नीचे है और दोनों बड़े चीनी मॉडलों से स्पष्ट रूप से पीछे। यह उसी के करीब है जो Reflection कहती है: कंपनी Beam को GLM 5.2 के मुक़ाबले “प्रतिस्पर्धी” बताती है और कहती है कि कोडिंग तथा एजेंट-कार्य में वह Qwen 3.8-Max के “निकट पहुँच रहा” है।

यहाँ तक पहुँचने की कीमत
TechCrunch की रिपोर्ट के अनुसार Reflection ने Nvidia, Sequoia Capital और Lightspeed Venture Partners सहित निवेशकों से लगभग 4.7 अरब डॉलर जुटाए हैं, और उसका प्री-मनी मूल्यांकन 25 अरब डॉलर है। उसने 2029 तक Nvidia GB300 चिपों की पहुँच के लिए SpaceX तथा Nebius के साथ 7 अरब डॉलर से अधिक के गणना-समझौते किए हैं।
कंपनी का ढाँचा भू-राजनीतिक है: खुले वज़न की अग्रिम पंक्ति चीनी प्रयोगशालाओं के पास है, और एक पश्चिमी प्रयोगशाला को उसका एक हिस्सा संभालना चाहिए। Reflection ने जो साक्ष्य प्रकाशित किए हैं, उनके आधार पर Beam वह अग्रिम पंक्ति वापस नहीं लेता। वह जो देता है वह है एक ऐसा मॉडल जिसे उदार लाइसेंस के तहत डाउनलोड किया, बदला और स्वयं होस्ट किया जा सकता है, और जिसका inference बिल निर्माता के अनुसार निकटतम तुलनीय खुले मॉडल का एक-तिहाई से एक-चौथाई है।
इस महीने के अंत में देखने लायक चीज़ें हैं वज़न और तकनीकी रिपोर्ट। Terminal-Bench तथा SWE-Bench Pro की स्वतंत्र जाँच तय करेगी कि दक्षता का दावा Reflection के अपने ढाँचे के बाहर टिकता है या नहीं।