अग्रिम पंक्ति का एक मॉडल, जिसमें कहीं भी पूर्ण अटेंशन नहीं है

फ़रवरी में स्थापित बीजिंग की प्रयोगशाला नेवAI, जिसने पहले कोई मॉडल जारी नहीं किया था, ने Naive-N0.5-Flash को एमआईटी लाइसेंस के तहत प्रकाशित किया है। यह मिक्सचर-ऑफ-एक्सपर्ट्स मॉडल है, जिसमें कुल 309 अरब पैरामीटर और 15.5 अरब सक्रिय पैरामीटर हैं, और इसका दावा है कि इसकी मूल संदर्भ खिड़की दस लाख टोकन की है। असामान्य बात वह है जो अनुपस्थित है: मॉडल कार्ड के अनुसार, पूरे नेटवर्क में कहीं भी पूर्ण अटेंशन वाली परत नहीं है।

ट्रांसफ़ॉर्मर सामान्यतः कम से कम कुछ परतें रखते हैं जो पूरे संदर्भ को देखती हैं। वही परतें दूर तक की सूचना सुरक्षित रखती हैं, और दस लाख टोकन की लंबाई पर डीकोडिंग की अधिकांश लागत भी वहीं जाती है। Naive-N0.5-Flash उन्हें पूरी तरह हटा देता है। इसकी 48 परतें छह-छह परतों के आठ मॉड्यूल में बँटी हैं: पाँच स्लाइडिंग-विंडो अटेंशन परतें और उसके बाद एक डीपसीक स्पार्स अटेंशन परत, जिसमें पहले मॉड्यूल की पहली परत भी डीएसए से बदली गई है। इससे 39 स्लाइडिंग-विंडो परतें और 9 स्पार्स परतें बनती हैं।

स्लाइडिंग विंडो 128 टोकन की है। स्पार्स परतें पूरे इतिहास पर 16 हेड वाला एक हल्का इंडेक्सर चलाती हैं और फिर केवल उन 2,048 टोकन पर अटेंशन गणना करती हैं जिन्हें वह चुनता है। पूरा की-वैल्यू कैश रखा जाता है और इंडेक्सर अब भी सब कुछ पढ़ता है, इसलिए बचत भंडारण में नहीं, बल्कि अटेंशन गणना और मेमोरी ट्रैफ़िक में है।

डेटा हॉल के भीतर सर्वर रैक की कतारें
मॉडल पूरा की-वैल्यू कैश रखता है; बचत गणना में है, भंडारण में नहीं। प्रतीकात्मक चित्र। ThisIsEngineering · pexels · Pexels License

शियाओमी के खुले बेस मॉडल पर बना

Naive-N0.5-Flash शून्य से प्रशिक्षित नहीं है। यह शियाओमी के खुले-वज़न बेस मॉडल MiMo-V2.5 पर आधारित है, जिसका श्रेय नेवAI ने अपने आभार में दिया है, साथ ही स्पार्स अटेंशन के डिज़ाइन के लिए डीपसीक और इन्फ़रेंस ढाँचे के लिए SGLang परियोजना को। कंपनी के अनुसार, बेस मॉडल को नई अटेंशन संरचना के अनुकूल बनाना निरंतर पूर्व-प्रशिक्षण का एक उद्देश्य था: तीन चरणों में 3.25 ट्रिलियन टोकन, जिसमें 50 अरब टोकन इंडेक्सर वार्म-अप, 3 ट्रिलियन स्पार्स अटेंशन प्रशिक्षण और 200 अरब लर्निंग-रेट क्षय शामिल हैं।

यह वंशावली इस घोषणा को समझने के लिए मायने रखती है। यह किसी और के बेस मॉडल का बड़ा वास्तुशिल्पीय पुनर्निर्माण है, जो खुले तौर पर प्रकाशित हुआ है, न कि नया पूर्व-प्रशिक्षण — और इसे इस प्रमाण के रूप में पेश किया जा रहा है कि स्पार्स और स्लाइडिंग अटेंशन की मिश्रित संरचनाएँ दस लाख टोकन तक गुणवत्ता बनाए रख सकती हैं।

नेवAI ने अपना इन्फ़रेंस सिस्टम NaiveRT भी प्रकाशित किया है, जो कंपनी के अनुसार मेगा-कर्नेल फ़्यूज़न, प्रोग्रामैटिक डिपेंडेंट लॉन्च और स्पेकुलेटिव डीकोडिंग को जोड़ता है और मानक मोड में प्रति उपयोगकर्ता 50 टोकन प्रति सेकंड तथा “अल्ट्राफ़ास्ट” मोड में 2,000 टोकन प्रति सेकंड तक देता है। वज़न और इन्फ़रेंस कोड एमआईटी लाइसेंस पर हैं; होस्टेड एपीआई की कीमत प्रति दस लाख इनपुट टोकन 0.10 डॉलर, आउटपुट 0.40 डॉलर और प्रति दस लाख कैश रीड 0.01 डॉलर है।

बेंचमार्क के आँकड़े कंपनी के अपने हैं

मॉडल कार्ड कोडिंग और एजेंटिक कार्यों — SWE-Bench Pro, DeepSWE v1.1, Terminal-Bench 2.1, ALE-CLI, ProgramBench — तथा एआई शोध-विकास परीक्षणों, जिनमें PostTrainBench, MLE-bench-30 और PaperBench शामिल हैं, के परिणाम देता है। ये नेवAI के अपने मूल्यांकन हैं, स्वतंत्र परिणाम नहीं, और कंपनी अपने परीक्षण ढाँचे के बारे में स्पष्ट है: जहाँ अन्यथा न कहा गया हो, उसने परीक्षण Claude Code 2.1.207 के ज़रिये दस लाख टोकन संदर्भ, तापमान 1.0 और टॉप-पी 0.95 पर चलाए, जिसमें केवल बुनियादी फ़ाइल और बैश उपकरण उपलब्ध थे। प्रतिस्पर्धियों के अंक दूसरे निर्माताओं के ब्लॉग, मॉडल कार्ड और सार्वजनिक सूचियों से उद्धृत हैं, दोबारा नहीं चलाए गए।

व्हाइटबोर्ड पर आरेख पर चर्चा करते इंजीनियर
नेवAI का कहना है कि उसका इन्फ़रेंस सिस्टम स्वयं एआई-केंद्रित शोध से बना। प्रतीकात्मक चित्र। Godfrey Atima · pexels · Pexels License

उत्पाद से पहले मूल्यांकित प्रयोगशाला

नेवAI की स्थापना फ़रवरी 2026 में दाई जिफ़ेंग ने की, जो सिंघुआ विश्वविद्यालय में सहयुक्त प्राध्यापक हैं और पहले माइक्रोसॉफ़्ट रिसर्च एशिया तथा कंप्यूटर विज़न कंपनी सेंसटाइम में काम कर चुके हैं। टेनसेंट के समर्थन से प्रयोगशाला ने लगभग 40 करोड़ डॉलर जुटाए और करीब 1.42 अरब डॉलर का बताया गया मूल्यांकन हासिल किया — यह आँकड़ा पिछले सप्ताह ठीक इसलिए चर्चा में आया क्योंकि कंपनी ने तब तक कुछ भी जारी नहीं किया था।

अब उसने जारी किया है, और मॉडल कार्ड का तर्क किसी अंक के बजाय कंपनी का नारा है: “एआई से अग्रिम पंक्ति की एआई बनाना।” नेवAI कहती है कि NaiveRT स्वयं उस प्रक्रिया से बना और अनुकूलित हुआ जिसे वह एआई-केंद्रित शोध और विकास कहती है, और प्रक्रिया के लिए अपने तकनीकी ब्लॉग के एक केस स्टडी की ओर संकेत करती है।

देखना यह है कि यह वास्तुशिल्प दूसरों के कार्यभार के सामने टिकता है या नहीं। पूर्ण अटेंशन परत के बिना एक मॉडल इस बात की असली परीक्षा है कि 128 टोकन की खिड़की और स्पार्स रूप से चुने गए 2,048 टोकन दस लाख टोकन संदर्भ पर वैश्विक अटेंशन की जगह ले सकते हैं या नहीं, और एमआईटी लाइसेंस का अर्थ है कि बाहरी समूह कंपनी के आँकड़ों पर भरोसा करने के बजाय यह परीक्षा स्वयं कर सकते हैं। वज़न के लिए एफ़पी8 सक्षम एनवीडिया हार्डवेयर चाहिए और वे लगभग 315 जीबी लेते हैं, इसलिए यह परीक्षा सस्ती नहीं होगी।