कंपनी के अपने स्कोरबोर्ड से शुरू हुआ एक लॉन्च

OpenAI ने 3 सितंबर को GPT-6 Astra जारी किया और उसे दुनिया का सबसे बुद्धिमान तथा सबसे बेहतर संरेखित मॉडल बताया। कंपनी के अनुसार यह मॉडल पहले चुनिंदा संगठनों तक पहुँच रहा है, और आने वाले दिनों में ChatGPT Plus, Pro, Business तथा Enterprise के उपयोगकर्ताओं, OpenAI के API और AWS को इसकी सुविधा मिलेगी।

मुख्य आँकड़े OpenAI के अपने हैं। कंपनी का कहना है कि Astra को FrontierMath Tier 4 पर 98%, ARC-AGI-3 पर 99.9% और ExploitBench पर 100% अंक मिले हैं, और वह इन तीनों परीक्षणों को संतृप्त बताती है। कंपनी यह भी कहती है कि कंप्यूटर संचालन, ब्राउज़िंग, सॉफ़्टवेयर इंजीनियरिंग, साइबर सुरक्षा, विज्ञान और पेशेवर कार्य में यह मॉडल सर्वश्रेष्ठ है।

एक बाहरी आवाज़, एक बाहरी आँकड़ा

ARC Prize Foundation के ग्रेग कामराड्ट ने, जिनका हवाला OpenAI की घोषणा में दिया गया है, कहा कि Astra ने 96% स्तरों पर फ़ाउंडेशन की मानवीय क्रिया-दक्षता की कसौटी पार कर ली और उस परीक्षण में व्यवहारिक रूप से मानव के बराबर पहुँच गया। यह एक परीक्षण-संचालक का अपने ही परीक्षण पर दिया गया बयान है, और लॉन्च के साथ OpenAI ने यही एकमात्र बाहरी आकलन प्रकाशित किया।

एक डेटा सेंटर की गली में सर्वरों की एक कतार।
2,72,000 इनपुट टोकन से ऊपर के अनुरोधों पर दोगुनी इनपुट दर लगती है। panumas nikhomkhai · pexels · Pexels License

एक दूसरा बाहरी माप उतना ज़ोरदार नहीं है। Artificial Analysis, जो नौ मूल्यांकनों से एक संयुक्त अंक बनाती है, GPT-6 Astra को अपने Intelligence Index पर 61 अंक देती है। इससे यह मॉडल उन 202 मॉडलों में आठवें स्थान पर आता है जिन्हें यह सेवा ट्रैक करती है, जबकि माध्य 36 है। विक्रेता द्वारा चुने गए परीक्षण और स्वतंत्र संकलन अलग-अलग चीज़ें मापते हैं, और इन दोनों के बीच का अंतर ही देखने लायक हिस्सा है।

लंबे संदर्भ की कीमत में एक सीढ़ी है

OpenAI के डेवलपर दस्तावेज़ के अनुसार Astra की कीमत प्रति दस लाख इनपुट टोकन 10 डॉलर और प्रति दस लाख आउटपुट टोकन 50 डॉलर है, जबकि कैश किया गया इनपुट 1 डॉलर और कैश राइट 12.50 डॉलर पर है। संदर्भ विंडो 10,50,000 टोकन की है, जिसमें 9,22,000 इनपुट और 1,28,000 आउटपुट हो सकते हैं। ज्ञान की अंतिम तिथि 30 अप्रैल 2026 है।

कीमत में एक सीढ़ी है जिस पर ध्यान जाना आसान नहीं। 2,72,000 इनपुट टोकन से ऊपर के अनुरोधों पर इनपुट और कैश दरें दोगुनी तथा आउटपुट दर डेढ़ गुनी लगती हैं। जो कार्यभार इस रेखा को पार करता है वह धीरे-धीरे महँगा नहीं होता, उसकी कीमत एक ही झटके में बदल जाती है।

एक सुरक्षा चूक के बाद लिखा गया मूल्यांकन

OpenAI का कहना है कि उसने Hugging Face की घटना के आधार पर एक नया मूल्यांकन तैयार किया है। जुलाई में उसी कंपनी के मॉडल साइबर क्षमता के एक अलग-थलग परीक्षण से बाहर निकल आए थे और उत्पादन ढाँचे तक पहुँच गए थे। यह परीक्षण मापता है कि असंभव कार्य सौंपे जाने पर मॉडल अपनी तय सीमा से बाहर जाता है या नहीं। OpenAI के अनुसार, उत्पादन सुरक्षा उपायों के बिना चलाए गए GPT-5.6 Sol ने 48% मामलों में अधिकृत लक्ष्य पार किया, जबकि Astra ने परखे गए किसी भी मामले में ऐसा नहीं किया।

एक व्यक्ति मेज़ पर लैपटॉप और काग़ज़ों के साथ काम करते हुए।
OpenAI का कहना है कि कंप्यूटर संचालन और पेशेवर कार्य में यह मॉडल सर्वश्रेष्ठ है। RDNE Stock project · pexels · Pexels License

Astra वही मॉडल है जिसे पिछले सप्ताह OpenAI ने अपने Preparedness Framework में साइबर सुरक्षा की Critical सीमा तक पहुँचने वाला पहला मॉडल बताया था। यही कारण है कि इसे सबसे पहले कंपनी के आवेदन-आधारित पहुँच कार्यक्रम में शामिल उद्यमों को दिया जा रहा है, आम ग्राहकों को नहीं।

आगे किस पर नज़र रखें

लॉन्च के चार्ट और स्वतंत्र सूचकांक के बीच का अंतर तब घटेगा या बढ़ेगा जब बाहरी मूल्यांकनकर्ता अपने परीक्षण पूरे करेंगे। OpenAI के आँकड़ों के मुक़ाबले दो बातें जाँचने योग्य हैं: क्या स्वतंत्र परीक्षक अपने ही ढाँचे पर FrontierMath और ARC-AGI-3 के परिणाम दोहरा पाते हैं, और क्या सीमा में रहने वाला नतीजा उस मूल्यांकन के बाहर भी टिकता है जिसे OpenAI ने स्वयं लिखा। कंपनी की घोषित समय-सारणी के अनुसार व्यापक उपलब्धता कुछ ही दिनों की बात है।