पहले पाँच स्थान ओपनएआई के

मॉडल रैंकिंग चलाने वाली कंपनी अरीना ने 8 अक्टूबर को एक अलाइनमेंट इंडेक्स प्रकाशित किया, जो 27 मॉडलों को इस आधार पर क्रम देता है कि उनके एजेंट कितना बुरा बर्ताव करते हैं, न कि वे कितना अच्छा प्रदर्शन करते हैं।

पहले पाँच स्थान ओपनएआई के हैं। जीपीटी-6.1 सोल 87.9 के साथ आगे है, उसके बाद जीपीटी-6 एस्ट्रा और जीपीटी-6 लूना 87.8 पर, जीपीटी-6 सोल 87.6 पर और जीपीटी-5.6 सोल 84.2 पर। एंथ्रोपिक का क्लॉड ओपस 5.5 छठे स्थान पर 83.2 के साथ है, स्पेसएक्सएआई का ग्रोक 4.7 सातवें पर 82.7 और क्लॉड फ़ेबल 5.1 नौवें पर 80.1। गूगल का जेमिनी 4 आर्गन ग्यारहवें स्थान पर 79.4 पर है। मिनीमैक्स एम3 27 में अंतिम है, 69.2 पर।

अरीना तालिका को प्रारंभिक बताती है, और उसके पीछे का आँकड़ा 30 सितंबर का है।

एजेंट के विफल होने के तीन तरीके

सूचकांक तीन विफलता दरों को जोड़ता है, और तीनों में कम होना बेहतर है। अनधिकृत कार्रवाई का अर्थ है एजेंट का वह करना जिसकी उसे अनुमति नहीं थी। ग़लत श्रेय का अर्थ है किसी कथन या तथ्य को ग़लत स्रोत से जोड़ना। भ्रामक समापन का अर्थ है किसी अधूरे काम को पूरा बता देना।

भ्रामक समापन में ही मॉडलों के बीच फ़ासला दिखता है। जीपीटी-6.1 सोल अपने 2.34% सत्रों में चिह्नित होता है, क्लॉड ओपस 5.5 6.41% में, जेमिनी 4 आर्गन 12.86% में और मिनीमैक्स एम3 22.54% में — यानी अग्रणी मॉडल से लगभग दस गुना। अनधिकृत कार्रवाई हर जगह कहीं दुर्लभ है, जीपीटी-6 एस्ट्रा के 0.83% से जेमिनी 3.7 फ़्लैश के 3.45% तक। ग़लत श्रेय 1.56% से 15.61% तक फैला है।

लकड़ी की मेज़ पर रखे लैपटॉप के कीबोर्ड पर टाइप करते हाथ
अंक उन 72,509 सत्रों से आते हैं जिनमें आगंतुकों ने एजेंटों को असली काम दिया। प्रतीकात्मक चित्र। Lukas Blazek · pexels · Pexels License

उस काम पर मापा गया जो किसी ने सचमुच माँगा

अंक कंपनी के अपने एजेंट अरीना के 72,509 सत्रों से आते हैं, जहाँ आगंतुक एजेंटों को तय परीक्षण-सेट चलाने के बजाय असली काम देते हैं। ऐसा करने के पीछे अरीना का तर्क है कि “स्थिर मानक तभी टूट जाते हैं जब मॉडल पहचान लेते हैं कि उनकी परीक्षा ली जा रही है”।

यही रचना सूचकांक की सबसे बड़ी सीमा भी है। चूँकि काम वही है जो आगंतुकों ने माँगा, दो मॉडल ज़रूरी नहीं कि एक ही काम पर मापे जाएँ, और मिश्रण समय के साथ बदल सकता है। अरीना हर अंक और हर दर के साथ एक परास भी छापती है, और बताती है कि एक ही चिह्नित मामला एक से अधिक विफलता-प्रकार में गिना जा सकता है, इसलिए तीनों दरें विफलताओं को बाँटने के बजाय एक-दूसरे पर आ जाती हैं।

उसी दिन 20 करोड़ डॉलर की राउंड

अरीना ने यह सूचकांक 20 करोड़ डॉलर की सीरीज़ बी के साथ पेश किया, जिसमें कंपनी का मूल्यांकन 3.1 अरब डॉलर है। इसका नेतृत्व लाइटस्पीड वेंचर पार्टनर्स और खोसला वेंचर्स ने किया, और सेल्सफ़ोर्स वेंचर्स, 01 एडवाइज़र्स, डेल टेक्नोलॉजीज़ कैपिटल, एंडेवर कैटलिस्ट, एंड्रीसन होरोविट्ज़ तथा फ़ेलिसिस भी शामिल हुए। जनवरी में 15 करोड़ डॉलर की सीरीज़ ए पर मिले 1.7 अरब डॉलर के पोस्ट-मनी मूल्यांकन से यह लगभग दोगुना है।

टेकक्रंच के अनुसार जनवरी की राउंड के समय वार्षिकीकृत राजस्व 3 करोड़ डॉलर था और जून में 10 करोड़ डॉलर तक पहुँच गया, जो पिछले सितंबर में शुरू हुए एआई इवैल्यूएशन्स नामक व्यावसायिक उत्पाद से आता है। अरीना कहती है कि “दुनिया को एक तटस्थ तीसरे पक्ष की ज़रूरत है जो मापे कि एआई वास्तव में कितनी सुरक्षित और अलाइन्ड है”।

ऊपर से दिखतीं दौड़ पथ की खाली लेनें
अरीना तालिका को प्रारंभिक बताकर छापती है, हर अंक के साथ एक परास देती है। प्रतीकात्मक चित्र। KoolShooters · pexels · Pexels License

वह टकराव जो किसी ने नहीं सुलझाया

जो रैंकिंग उन्हीं प्रयोगशालाओं को मूल्यांकन सेवाएँ बेचती है जिन्हें वह क्रम देती है, वह निरपेक्ष निर्णायक नहीं है, और अरीना का अपना वाक्यांश — तटस्थ तीसरा पक्ष — ही सबसे अधिक परखने योग्य दावा है। ऊपर दिया कोई भी अंक स्वतंत्र रूप से दोहराया नहीं गया है, और सूचकांक सत्यापित नहीं, बल्कि चिह्नित विफलताएँ मापता है।

आगे देखने लायक बात यह है कि क्या प्रयोगशालाएँ इन तीन परिभाषाओं के विरुद्ध अपने आँकड़े छापना शुरू करती हैं, और क्या भ्रामक समापन में दस गुने का अंतर किसी तय, अलग रखे गए कार्य-समूह के सामने टिकता है। यदि टिकता है, तो उद्योग के सामने उन एजेंटों की एक मापी जा सकने वाली समस्या है जो कहते हैं कि काम हो गया।