पुरानी क़ीमत पर बड़ा बेस मॉडल
स्पेसएक्सएआई ने सोमवार को ग्रोक 4.7 जारी किया और अपने पिछले मॉडल की क़ीमत बरकरार रखी। इनपुट पर 2 डॉलर प्रति दस लाख टोकन और आउटपुट पर 6 डॉलर प्रति दस लाख टोकन लगते हैं, ठीक ग्रोक 4.6 जितना, जबकि एक तेज़ संस्करण दोगुनी आउटपुट गति पर दोगुनी क़ीमत में मिलता है। कंपनी इसे बताती है कोडिंग और ज्ञान-कार्य के लिए अपना सबसे सक्षम मॉडल।
भीतर के बदलाव सजावटी नहीं, ढाँचागत हैं। स्पेसएक्सएआई का कहना है कि ग्रोक 4.7 ग्रोक 4.6 से नया और बड़ा बेस मॉडल इस्तेमाल करता है, जिसे कठिन कार्यों के मिश्रण पर लंबे रीइन्फ़ोर्समेंट लर्निंग चक्र से प्रशिक्षित किया गया है और जिसमें कई घंटों तक चलने वाली समस्याओं को अधिक वज़न दिया गया है। कंपनी यह भी कहती है कि मॉडल को उसके अपने एजेंट रनटाइम ग्रोक बॉट को मूल रूप से समझने के लिए प्रशिक्षित किया गया।
कंपनी के आँकड़े, और किसी और के
स्पेसएक्सएआई की अपनी तालिका ग्रोक 4.7 को कर्सरबेंच 4.0 पर 46.3 प्रतिशत देती है, जो ग्रोक 4.6 के 40.4 प्रतिशत से ऊपर है और जीपीटी-5.6 सोल के लिए दर्ज 41.7 प्रतिशत से आगे, पर क्लॉड फ़ेबल 5.1 के 51.8 प्रतिशत से पीछे। इलेक्ट्रिकल इंजीनियरिंग परीक्षण ईईबेंच पर वह 64.0 प्रतिशत बताती है, जबकि जीपीटी-5.6 सोल के लिए 39.4 और फ़ेबल 5.1 के लिए 56.4 प्रतिशत। हार्वे के विधिक एजेंट परीक्षण पर वह 19.6 प्रतिशत बताती है, फ़ेबल 5.1 के 6.7 प्रतिशत के मुक़ाबले।

ये आपूर्तिकर्ता के घोषित आँकड़े हैं। स्वतंत्र तस्वीर कम आकर्षक है। अपनी अलग जाँच चलाने वाली आर्टिफ़िशियल एनालिसिस ने ग्रोक 4.7 को अपने इंटेलिजेंस इंडेक्स v4.3.2 पर 46 अंक दिए, जबकि क्लॉड फ़ेबल 5.1 और जीपीटी-6 दोनों को 53, द डिकोडर के अनुसार।
अंतर उस एक परीक्षण में सबसे साफ़ है जो दोनों ने चलाया। स्पेसएक्सएआई टर्मिनल-बेंच 4.0 पर 38.0 प्रतिशत बताती है। आर्टिफ़िशियल एनालिसिस ने 26 प्रतिशत मापा, लगभग वहीं जहाँ वह डीपसीक वी4.1 फ़्लैश को 27 प्रतिशत पर रखती है, और जीपीटी-6 एस्ट्रा के लिए दर्ज 60 तथा क्लॉड फ़ेबल 5.1 के 55 प्रतिशत से बहुत नीचे।
जहाँ यह वाक़ई आगे है
पेशेवर काम को आँकने वाले जीडीपीवैल पर स्पेसएक्सएआई अपने उच्चतम प्रयास सेटिंग में ग्रोक 4.7 के लिए 1,695 का एलो प्रकाशित करती है, जो फ़ेबल 5.1 के 1,735 से पीछे पर जीपीटी-6 एस्ट्रा के 1,542 से आगे है। कंपनी एए ब्रीफ़केस v1.1 पर 1,657 भी बताती है, फ़ेबल 5.1 के 1,678 से ठीक नीचे।

दोनों को साथ पढ़ें तो आपूर्तिकर्ता की तालिका और स्वतंत्र सूचकांक विरोधाभास नहीं, स्थिति का एक सुसंगत विवरण देते हैं: मॉडल कई घंटों वाले दस्तावेज़-रूपी पेशेवर काम में अच्छा है और लंबे टर्मिनल कार्यों में कमज़ोर, और उसकी क़ीमत पश्चिमी फ़्रंटियर मॉडलों से ज़्यादा चीनी खुले-वज़न मॉडलों के क़रीब है।
सुरक्षा उपायों की नई परत
स्पेसएक्सएआई कहती है कि ग्रोक 4.7 पूरी तरह नई सुरक्षा परत के साथ आता है और अस्वीकृति तथा जेलब्रेक प्रतिरोध में यह उसका परखा हुआ सबसे मज़बूत मॉडल है। वह बताती है कि लैचबायो के जैवसुरक्षा परीक्षण में 62.4 प्रतिशत के साथ वह शीर्ष पर है और उसके आंतरिक साइबर परीक्षण हैकरबेंच v0.3 पर मॉडल जोखिमभरे दोहरे-उपयोग संकेतों में से 3.3 प्रतिशत ही पार होने देता है। ये दोनों कंपनी के अपने माप हैं।
कंपनी ने चुनिंदा साइबर सुरक्षा साझेदारों को रक्षात्मक शोध के लिए ग्रोक 4.7 की रेड-टीम क्षमताओं तक आमंत्रण-आधारित पहुँच देना भी शुरू किया है, जो उस पहुँच-विवाद का सँकरा रूप है जिसने इस साल प्रयोगशालाओं को बाँटा है।
आगे क्या देखना है
मॉडल अभी कर्सर और ग्रोक बिल्ड में, ग्रोक एपीआई के ज़रिए, तथा तीसरे पक्ष के कोडिंग औज़ारों, मॉडल राउटरों और क्लाउड प्लेटफ़ॉर्मों पर उपलब्ध है। देखना यह है कि और स्वतंत्र मूल्यांकन आने पर टर्मिनल-बेंच का अंतर घटता है या नहीं, और क्या दस लाख इनपुट टोकन पर 2 डॉलर उन डेवलपरों को हिलाने के लिए काफ़ी है जो आज फ़ेबल 5.1 के लिए 10 डॉलर दे रहे हैं।