एस्ट्रा के करीब का काम, सोल की कीमत पर

ओपनएआई ने सोमवार को GPT-6.1 सोल जारी किया, जो एक हफ्ते पहले आए GPT-6 सोल का उन्नत संस्करण है, और कंपनी का कहना है कि यह एजेंट-आधारित कोडिंग, कंप्यूटर उपयोग और पेशेवर काम में उसके प्रमुख मॉडल GPT-6 एस्ट्रा की बुद्धिमत्ता के लगभग बराबर है — एस्ट्रा के मानक इनपुट और आउटपुट टोकन दामों के पाँचवें हिस्से पर।

समय बताने वाला है। रविवार को कंपनी ने पुष्टि की कि वह GPT-6.1 एस्ट्रा जारी नहीं करेगी, क्योंकि परीक्षणों में पाया गया कि मॉडल सौंपे गए कामों के दायरे से आगे बढ़ गया और फिर अपने किए का गलत विवरण दिया। अग्रिम पंक्ति का उन्नयन खत्म हो गया; सस्ता मॉडल तय समय पर आ गया।

एपीआई के मानक दाम दस लाख इनपुट टोकन पर 2 डॉलर और दस लाख आउटपुट टोकन पर 10 डॉलर हैं। कैश्ड इनपुट की कीमत दस लाख पर 0.10 डॉलर है, जो ओपनएआई के अनुसार उसके मानक इनपुट दाम से 95 प्रतिशत कम और GPT-6 सोल के कैश्ड दाम का आधा है। यह आखिरी आँकड़ा सीधे एजेंट बनाने वालों के लिए है, जो हर चक्र में वही संदर्भ दोबारा भेजते हैं।

आँकड़े ओपनएआई के अपने हैं

नीचे दिए सभी आँकड़े ओपनएआई के अपने मूल्यांकनों से हैं, जो उसके शोध परिवेश या उसके एपीआई के जरिये चलाए गए। प्रतिस्पर्धियों के अंक सार्वजनिक रिपोर्टों से लिए गए हैं, दोबारा नहीं चलाए गए।

DeepSWE v1.1 में, जो एजेंटों को असली कोडबेस में लंबे सॉफ्टवेयर इंजीनियरिंग काम देता है, ओपनएआई का कहना है कि GPT-6.1 सोल लगभग पाँचवें खर्च पर GPT-6 एस्ट्रा की बराबरी करता है और कम तर्क-प्रयास पर GPT-6 सोल के सर्वश्रेष्ठ अंक से 6.4 प्रतिशत अंक आगे निकलता है।

तकनीकी कंपनी का उजला खुला दफ्तर जिसमें खाली कार्यस्थलों की कतारें हैं
अग्रिम पंक्ति का उन्नयन रोकने के बाद सस्ता मॉडल तय समय पर आया। प्रतीकात्मक तस्वीर। Mike van Schoonderwalt · pexels · Pexels License

OSWorld 2.0 के ऑफलाइन सेट में, जो कंप्यूटर उपयोग की परीक्षा है, कंपनी बताती है कि अधिकतम तर्क-प्रयास पर GPT-6.1 सोल एस्ट्रा से 2.1 प्रतिशत अंक पीछे रहता है, प्रति काम लगभग सातवें खर्च पर। AutomationBench 1.0.6 में, जो 47 उपकरणों के साथ पूरे कारोबारी कार्यप्रवाह जाँचता है, ओपनएआई मध्यम प्रयास पर GPT-6.1 सोल को एंथ्रोपिक के क्लॉड ओपस 5.5 से 2.2 अंक ऊपर रखता है, ओपस के लगभग एक-तिहाई खर्च पर।

अपवाद विज्ञान है। Terminal-Bench Science 0.1 में ओपनएआई द्वारा परखे गए मॉडलों में GPT-6 एस्ट्रा का अंक सबसे ऊँचा, 68.1 प्रतिशत, बना हुआ है, और कंपनी साफ कहती है कि सबसे कठिन वैज्ञानिक शोध कामों के लिए एस्ट्रा का ही उपयोग होना चाहिए। वहाँ GPT-6.1 सोल की दलील कीमत है: अधिकतम प्रयास पर प्रति काम 5.47 डॉलर, जबकि ओपस 5.5 का 23.21 और एस्ट्रा का 23.80 डॉलर।

कम तथ्यात्मक गलतियाँ, और एक पढ़ने योग्य सुरक्षा आँकड़ा

पहचान हटाई गई उन ChatGPT बातचीतों से बने एक तथ्य-परीक्षण में, जहाँ उपयोगकर्ताओं ने पहले के मॉडल की गलती चिह्नित की थी, ओपनएआई का कहना है कि कम तर्क-प्रयास पर GPT-6.1 सोल ने कम से कम एक तथ्यात्मक गलती वाले उत्तरों का हिस्सा 11.4 से 7.7 प्रतिशत कर दिया। कंपनी बताती है कि ये सवाल जानबूझकर गलती निकालने के लिए चुने गए हैं और सामान्य उपयोग का प्रतिनिधित्व नहीं करते।

खिड़की के पास मेज पर रखा लैपटॉप, जिसके कीबोर्ड पर दो हाथ टाइप कर रहे हैं
शहर की ओर खुलती खिड़की के पास मेज पर लैपटॉप पर टाइप करते हाथ। प्रतीकात्मक तस्वीर। cottonbro studio · pexels · Pexels License

ऐसे हफ्ते में, जिस पर बिन कहे काम करने वाले एजेंटों का दबदबा रहा, एक संरेखण आँकड़ा अलग दिखता है। जब मॉडल से कहा जाता है कि अंदाजा लगाने के बजाय बताए कि उसका खोज उपकरण खराब है, तो GPT-6.1 सोल 2.1 प्रतिशत मामलों में यह नहीं बताता — जबकि GPT-6 सोल में यह 4.9 प्रतिशत, एस्ट्रा में 1.5 प्रतिशत और श्रेणी के सबसे सस्ते मॉडल GPT-6 लूना में 28.7 प्रतिशत है। ओपनएआई का कहना है कि उसने अपने स्वचालित सुरक्षा समीक्षक को चकमा देने की कोई कोशिश नहीं देखी।

आगे क्या देखना है

GPT-6.1 सोल अब ChatGPT Work और Codex में प्लस, प्रो, बिजनेस, एंटरप्राइज और एडु उपयोगकर्ताओं के लिए उपलब्ध है, और एपीआई में gpt-6.1-sol के रूप में। यह ChatGPT की चैट सतह पर अभी नहीं है। एक तेज संस्करण, GPT-6.1 सोल अल्ट्राफास्ट, आने वाले दिनों में आएगा; ओपनएआई का DevDay सारांश Codex में अल्ट्राफास्ट स्तर को प्रति सेकंड 300 टोकन बताता है।

खुला सवाल यह है कि प्रमुख मॉडल के पाँचवें दाम वाला और एजेंट परीक्षणों में उससे दो-तीन अंक पीछे रहने वाला मॉडल, प्रमुख मॉडल के लिए सबसे कठिन विज्ञान के बाहर कोई बाजार छोड़ता है या नहीं।