पुरानी क़ीमत पर बड़ा बेस मॉडल

स्पेसएक्सएआई ने सोमवार को ग्रोक 4.7 जारी किया और अपने पिछले मॉडल की क़ीमत बरकरार रखी। इनपुट पर 2 डॉलर प्रति दस लाख टोकन और आउटपुट पर 6 डॉलर प्रति दस लाख टोकन लगते हैं, ठीक ग्रोक 4.6 जितना, जबकि एक तेज़ संस्करण दोगुनी आउटपुट गति पर दोगुनी क़ीमत में मिलता है। कंपनी इसे बताती है कोडिंग और ज्ञान-कार्य के लिए अपना सबसे सक्षम मॉडल।

भीतर के बदलाव सजावटी नहीं, ढाँचागत हैं। स्पेसएक्सएआई का कहना है कि ग्रोक 4.7 ग्रोक 4.6 से नया और बड़ा बेस मॉडल इस्तेमाल करता है, जिसे कठिन कार्यों के मिश्रण पर लंबे रीइन्फ़ोर्समेंट लर्निंग चक्र से प्रशिक्षित किया गया है और जिसमें कई घंटों तक चलने वाली समस्याओं को अधिक वज़न दिया गया है। कंपनी यह भी कहती है कि मॉडल को उसके अपने एजेंट रनटाइम ग्रोक बॉट को मूल रूप से समझने के लिए प्रशिक्षित किया गया।

कंपनी के आँकड़े, और किसी और के

स्पेसएक्सएआई की अपनी तालिका ग्रोक 4.7 को कर्सरबेंच 4.0 पर 46.3 प्रतिशत देती है, जो ग्रोक 4.6 के 40.4 प्रतिशत से ऊपर है और जीपीटी-5.6 सोल के लिए दर्ज 41.7 प्रतिशत से आगे, पर क्लॉड फ़ेबल 5.1 के 51.8 प्रतिशत से पीछे। इलेक्ट्रिकल इंजीनियरिंग परीक्षण ईईबेंच पर वह 64.0 प्रतिशत बताती है, जबकि जीपीटी-5.6 सोल के लिए 39.4 और फ़ेबल 5.1 के लिए 56.4 प्रतिशत। हार्वे के विधिक एजेंट परीक्षण पर वह 19.6 प्रतिशत बताती है, फ़ेबल 5.1 के 6.7 प्रतिशत के मुक़ाबले।

प्रोसेसर पैकेज लगे मुद्रित सर्किट बोर्ड का नज़दीकी दृश्य
स्पेसएक्सएआई कहती है कि मॉडल नया और बड़ा बेस इस्तेमाल करता है। प्रतीकात्मक चित्र। Armando Are · pexels · Pexels License

ये आपूर्तिकर्ता के घोषित आँकड़े हैं। स्वतंत्र तस्वीर कम आकर्षक है। अपनी अलग जाँच चलाने वाली आर्टिफ़िशियल एनालिसिस ने ग्रोक 4.7 को अपने इंटेलिजेंस इंडेक्स v4.3.2 पर 46 अंक दिए, जबकि क्लॉड फ़ेबल 5.1 और जीपीटी-6 दोनों को 53, द डिकोडर के अनुसार।

अंतर उस एक परीक्षण में सबसे साफ़ है जो दोनों ने चलाया। स्पेसएक्सएआई टर्मिनल-बेंच 4.0 पर 38.0 प्रतिशत बताती है। आर्टिफ़िशियल एनालिसिस ने 26 प्रतिशत मापा, लगभग वहीं जहाँ वह डीपसीक वी4.1 फ़्लैश को 27 प्रतिशत पर रखती है, और जीपीटी-6 एस्ट्रा के लिए दर्ज 60 तथा क्लॉड फ़ेबल 5.1 के 55 प्रतिशत से बहुत नीचे।

जहाँ यह वाक़ई आगे है

पेशेवर काम को आँकने वाले जीडीपीवैल पर स्पेसएक्सएआई अपने उच्चतम प्रयास सेटिंग में ग्रोक 4.7 के लिए 1,695 का एलो प्रकाशित करती है, जो फ़ेबल 5.1 के 1,735 से पीछे पर जीपीटी-6 एस्ट्रा के 1,542 से आगे है। कंपनी एए ब्रीफ़केस v1.1 पर 1,657 भी बताती है, फ़ेबल 5.1 के 1,678 से ठीक नीचे।

खुले दफ़्तर में एक डेवलपर की मेज़ पर लगी मॉनिटरों की कतार
मॉडल कर्सर, ग्रोक बिल्ड और ग्रोक एपीआई में उपलब्ध है। प्रतीकात्मक चित्र। Kampus Production · pexels · Pexels License

दोनों को साथ पढ़ें तो आपूर्तिकर्ता की तालिका और स्वतंत्र सूचकांक विरोधाभास नहीं, स्थिति का एक सुसंगत विवरण देते हैं: मॉडल कई घंटों वाले दस्तावेज़-रूपी पेशेवर काम में अच्छा है और लंबे टर्मिनल कार्यों में कमज़ोर, और उसकी क़ीमत पश्चिमी फ़्रंटियर मॉडलों से ज़्यादा चीनी खुले-वज़न मॉडलों के क़रीब है।

सुरक्षा उपायों की नई परत

स्पेसएक्सएआई कहती है कि ग्रोक 4.7 पूरी तरह नई सुरक्षा परत के साथ आता है और अस्वीकृति तथा जेलब्रेक प्रतिरोध में यह उसका परखा हुआ सबसे मज़बूत मॉडल है। वह बताती है कि लैचबायो के जैवसुरक्षा परीक्षण में 62.4 प्रतिशत के साथ वह शीर्ष पर है और उसके आंतरिक साइबर परीक्षण हैकरबेंच v0.3 पर मॉडल जोखिमभरे दोहरे-उपयोग संकेतों में से 3.3 प्रतिशत ही पार होने देता है। ये दोनों कंपनी के अपने माप हैं।

कंपनी ने चुनिंदा साइबर सुरक्षा साझेदारों को रक्षात्मक शोध के लिए ग्रोक 4.7 की रेड-टीम क्षमताओं तक आमंत्रण-आधारित पहुँच देना भी शुरू किया है, जो उस पहुँच-विवाद का सँकरा रूप है जिसने इस साल प्रयोगशालाओं को बाँटा है।

आगे क्या देखना है

मॉडल अभी कर्सर और ग्रोक बिल्ड में, ग्रोक एपीआई के ज़रिए, तथा तीसरे पक्ष के कोडिंग औज़ारों, मॉडल राउटरों और क्लाउड प्लेटफ़ॉर्मों पर उपलब्ध है। देखना यह है कि और स्वतंत्र मूल्यांकन आने पर टर्मिनल-बेंच का अंतर घटता है या नहीं, और क्या दस लाख इनपुट टोकन पर 2 डॉलर उन डेवलपरों को हिलाने के लिए काफ़ी है जो आज फ़ेबल 5.1 के लिए 10 डॉलर दे रहे हैं।