दो परिणाम, मॉडलों का एक ही समूह

मर्कोर ने गुरुवार को सरलीकृत लेखांकन कार्यों के एक समूह के लिए मानव आधाररेखाएँ प्रकाशित कीं, और तुलना एकतरफ़ा है। बारह कनिष्ठ लेखाकारों — सभी लाइसेंसधारी, औसतन लगभग साढ़े पाँच वर्ष का अनुभव — ने चार मासिक समापन परिदृश्यों में औसतन 37 प्रतिशत पाया, जिसमें व्यक्तिगत परिणाम शून्य से लगभग 90 प्रतिशत तक फैले और प्रति कार्य 30 से 180 मिनट लगे। मर्कोर कहता है कि क्लॉड ओपस 5 ने अपने बीसों प्रयासों में 100 प्रतिशत पाया और हर एक दस मिनट से कम में पूरा किया।

अठारह महीने पहले, मर्कोर के अनुसार, मॉडल उन्हीं कार्यों में मानव औसत से नीचे रहते थे।

यह एक आंकड़ा है। दूसरा उस पूर्ण बेंचमार्क में है जिससे ये कार्य सरल किए गए, और वह काफ़ी कम चापलूस है।

कठिन संस्करण क्या कहता है

APEX-Accounting, जिसे मर्कोर ने वित्तीय सॉफ़्टवेयर कंपनी रैंप के साथ बनाया, दस नकली कंपनियों में फैले 160 कार्य हैं, प्रति कार्य औसतन 7.5 इनपुट फ़ाइलें और लेखांकन पेशेवरों द्वारा लिखे 2,186 मूल्यांकन मानदंड। उस सूट पर मर्कोर की तालिका क्लॉड ओपस 5.5 को 61.8 प्रतिशत, फ़ेबल 5.1 को 61.0 और जीपीटी-6 एस्ट्रा को 57.9 पर रखती है, हर एक के साथ लगभग चार अंक की त्रुटि सीमा।

दफ़्तर की अलमारियों पर फ़ाइल फ़ोल्डरों की कतारें
APEX-Accounting दस नकली कंपनियों में 160 कार्य रखता है। प्रतीकात्मक तस्वीर। Zulfugar Karimov · pexels · Pexels License

निरंतरता के आंकड़े अधिक कठोर पाठ हैं। हर मॉडल को प्रति कार्य आठ बार चलाया जाता है। सबसे निरंतर मॉडल ने आठों बार कोई कार्य सही किया केवल 2.6 प्रतिशत मौकों पर, और किसी भी मॉडल ने लगभग 60 प्रतिशत कार्य किसी भी बार में पूरी तरह हल नहीं किए। मर्कोर कहता है कि शीर्ष तीन मॉडलों की लगभग दस में सात विफलताएँ तर्क की विफलताएँ हैं, न कि फ़ाइल ढूँढ़ने या निर्देश मानने की।

दोनों आंकड़ों के बीच की खाई ही असली ख़बर क्यों है

सरलीकृत कार्य वही अलग कर देते हैं जिसमें आज के मॉडल निर्विवाद रूप से अच्छे हैं: बहुत सी फ़ाइलें ध्यान से पढ़ना, कोई संख्या न खोना, और वही करना जो निर्देश में था। ये असली लेखांकन कौशल हैं, और लगातार ग्यारहवें घंटे ये काम करने वाला इंसान उस मशीन से बुरा करता है जिसका कोई ग्यारहवाँ घंटा होता ही नहीं।

सरलीकृत कार्य जो हटा देते हैं वह सब है जो समापन को कठिन बनाता है: यह निर्णय कि कौन सी संख्या ग़लत है, उस व्यक्ति को फ़ोन जिसने उसे चढ़ाया, यह जानकारी कि यही ग्राहक हमेशा उपचय देर से दर्ज करता है। मर्कोर यह स्पष्ट कहता है: लेखक नोट करते हैं कि ये कार्य लेखांकन कौशल के केवल एक उपसमुच्चय को मापते हैं और ग्राहक संवाद तथा मौन संदर्भ को बाहर रखते हैं।

कॉफ़ी के प्यालों वाली कैफ़े मेज़ पर बातचीत करते दो लोग
बेंचमार्क ग्राहक संवाद और मौन संदर्भ को बाहर रखता है। प्रतीकात्मक तस्वीर। August de Richelieu · pexels · Pexels License

वह चेतावनी बहुत भार उठा रही है, और उसे उन 100 प्रतिशत से जुड़ा रखना चाहिए।

यह बेंचमार्क किसका है

दोनों में से कोई आंकड़ा स्वतंत्र नहीं है। मर्कोर एक बाज़ार है जो ठीक इसी तरह के डेटा के लिए एआई प्रयोगशालाओं को विशेषज्ञ मानव श्रम बेचता है, और रैंप वित्तीय सॉफ़्टवेयर बेचता है। ऐसा बेंचमार्क जो दिखाए कि मॉडल पास हैं पर पहुँचे नहीं, वह अधिक विशेषज्ञ डेटा के पक्ष में तर्क है — और वही मर्कोर का उत्पाद है। इससे मापें ग़लत नहीं हो जातीं — मूल्यांकन मानदंड बड़ी लेखा फ़र्मों के पेशेवरों ने लिखे, और अंक एक मॉडल-आधारित निर्णायक देता है जो कंपनी के अनुसार 97 प्रतिशत मामलों में मानव मूल्यांकनकर्ताओं से मेल खाता है — पर यह उस बाज़ार का विक्रेता का अपना मूल्यांकन है जिसमें वह बेचता है।

कार्य स्थिर और सार्वजनिक भी हैं, यानी प्रशिक्षण डेटा में पहुँचते ही उनका मूल्य घटता है। अक्टूबर 2026 में 61.8 प्रतिशत इसी महीने के बारे में एक कथन है।

देखने की बात शीर्षक वाले औसत से अधिक Pass^8 स्तंभ है। जो मॉडल आठ में छह बार बही सही बंद करता है, उसने बही बंद नहीं की। उसने कुछ ऐसा बनाया है जिसे किसी नियंत्रक को अब भी जाँचना है — और यही वह हिस्सा है जिसे 100 प्रतिशत नहीं ढकता।