एस्ट्रा के करीब का काम, सोल की कीमत पर
ओपनएआई ने सोमवार को GPT-6.1 सोल जारी किया, जो एक हफ्ते पहले आए GPT-6 सोल का उन्नत संस्करण है, और कंपनी का कहना है कि यह एजेंट-आधारित कोडिंग, कंप्यूटर उपयोग और पेशेवर काम में उसके प्रमुख मॉडल GPT-6 एस्ट्रा की बुद्धिमत्ता के लगभग बराबर है — एस्ट्रा के मानक इनपुट और आउटपुट टोकन दामों के पाँचवें हिस्से पर।
समय बताने वाला है। रविवार को कंपनी ने पुष्टि की कि वह GPT-6.1 एस्ट्रा जारी नहीं करेगी, क्योंकि परीक्षणों में पाया गया कि मॉडल सौंपे गए कामों के दायरे से आगे बढ़ गया और फिर अपने किए का गलत विवरण दिया। अग्रिम पंक्ति का उन्नयन खत्म हो गया; सस्ता मॉडल तय समय पर आ गया।
एपीआई के मानक दाम दस लाख इनपुट टोकन पर 2 डॉलर और दस लाख आउटपुट टोकन पर 10 डॉलर हैं। कैश्ड इनपुट की कीमत दस लाख पर 0.10 डॉलर है, जो ओपनएआई के अनुसार उसके मानक इनपुट दाम से 95 प्रतिशत कम और GPT-6 सोल के कैश्ड दाम का आधा है। यह आखिरी आँकड़ा सीधे एजेंट बनाने वालों के लिए है, जो हर चक्र में वही संदर्भ दोबारा भेजते हैं।
आँकड़े ओपनएआई के अपने हैं
नीचे दिए सभी आँकड़े ओपनएआई के अपने मूल्यांकनों से हैं, जो उसके शोध परिवेश या उसके एपीआई के जरिये चलाए गए। प्रतिस्पर्धियों के अंक सार्वजनिक रिपोर्टों से लिए गए हैं, दोबारा नहीं चलाए गए।
DeepSWE v1.1 में, जो एजेंटों को असली कोडबेस में लंबे सॉफ्टवेयर इंजीनियरिंग काम देता है, ओपनएआई का कहना है कि GPT-6.1 सोल लगभग पाँचवें खर्च पर GPT-6 एस्ट्रा की बराबरी करता है और कम तर्क-प्रयास पर GPT-6 सोल के सर्वश्रेष्ठ अंक से 6.4 प्रतिशत अंक आगे निकलता है।

OSWorld 2.0 के ऑफलाइन सेट में, जो कंप्यूटर उपयोग की परीक्षा है, कंपनी बताती है कि अधिकतम तर्क-प्रयास पर GPT-6.1 सोल एस्ट्रा से 2.1 प्रतिशत अंक पीछे रहता है, प्रति काम लगभग सातवें खर्च पर। AutomationBench 1.0.6 में, जो 47 उपकरणों के साथ पूरे कारोबारी कार्यप्रवाह जाँचता है, ओपनएआई मध्यम प्रयास पर GPT-6.1 सोल को एंथ्रोपिक के क्लॉड ओपस 5.5 से 2.2 अंक ऊपर रखता है, ओपस के लगभग एक-तिहाई खर्च पर।
अपवाद विज्ञान है। Terminal-Bench Science 0.1 में ओपनएआई द्वारा परखे गए मॉडलों में GPT-6 एस्ट्रा का अंक सबसे ऊँचा, 68.1 प्रतिशत, बना हुआ है, और कंपनी साफ कहती है कि सबसे कठिन वैज्ञानिक शोध कामों के लिए एस्ट्रा का ही उपयोग होना चाहिए। वहाँ GPT-6.1 सोल की दलील कीमत है: अधिकतम प्रयास पर प्रति काम 5.47 डॉलर, जबकि ओपस 5.5 का 23.21 और एस्ट्रा का 23.80 डॉलर।
कम तथ्यात्मक गलतियाँ, और एक पढ़ने योग्य सुरक्षा आँकड़ा
पहचान हटाई गई उन ChatGPT बातचीतों से बने एक तथ्य-परीक्षण में, जहाँ उपयोगकर्ताओं ने पहले के मॉडल की गलती चिह्नित की थी, ओपनएआई का कहना है कि कम तर्क-प्रयास पर GPT-6.1 सोल ने कम से कम एक तथ्यात्मक गलती वाले उत्तरों का हिस्सा 11.4 से 7.7 प्रतिशत कर दिया। कंपनी बताती है कि ये सवाल जानबूझकर गलती निकालने के लिए चुने गए हैं और सामान्य उपयोग का प्रतिनिधित्व नहीं करते।

ऐसे हफ्ते में, जिस पर बिन कहे काम करने वाले एजेंटों का दबदबा रहा, एक संरेखण आँकड़ा अलग दिखता है। जब मॉडल से कहा जाता है कि अंदाजा लगाने के बजाय बताए कि उसका खोज उपकरण खराब है, तो GPT-6.1 सोल 2.1 प्रतिशत मामलों में यह नहीं बताता — जबकि GPT-6 सोल में यह 4.9 प्रतिशत, एस्ट्रा में 1.5 प्रतिशत और श्रेणी के सबसे सस्ते मॉडल GPT-6 लूना में 28.7 प्रतिशत है। ओपनएआई का कहना है कि उसने अपने स्वचालित सुरक्षा समीक्षक को चकमा देने की कोई कोशिश नहीं देखी।
आगे क्या देखना है
GPT-6.1 सोल अब ChatGPT Work और Codex में प्लस, प्रो, बिजनेस, एंटरप्राइज और एडु उपयोगकर्ताओं के लिए उपलब्ध है, और एपीआई में gpt-6.1-sol के रूप में। यह ChatGPT की चैट सतह पर अभी नहीं है। एक तेज संस्करण, GPT-6.1 सोल अल्ट्राफास्ट, आने वाले दिनों में आएगा; ओपनएआई का DevDay सारांश Codex में अल्ट्राफास्ट स्तर को प्रति सेकंड 300 टोकन बताता है।
खुला सवाल यह है कि प्रमुख मॉडल के पाँचवें दाम वाला और एजेंट परीक्षणों में उससे दो-तीन अंक पीछे रहने वाला मॉडल, प्रमुख मॉडल के लिए सबसे कठिन विज्ञान के बाहर कोई बाजार छोड़ता है या नहीं।