दो परिणाम, मॉडलों का एक ही समूह
मर्कोर ने गुरुवार को सरलीकृत लेखांकन कार्यों के एक समूह के लिए मानव आधाररेखाएँ प्रकाशित कीं, और तुलना एकतरफ़ा है। बारह कनिष्ठ लेखाकारों — सभी लाइसेंसधारी, औसतन लगभग साढ़े पाँच वर्ष का अनुभव — ने चार मासिक समापन परिदृश्यों में औसतन 37 प्रतिशत पाया, जिसमें व्यक्तिगत परिणाम शून्य से लगभग 90 प्रतिशत तक फैले और प्रति कार्य 30 से 180 मिनट लगे। मर्कोर कहता है कि क्लॉड ओपस 5 ने अपने बीसों प्रयासों में 100 प्रतिशत पाया और हर एक दस मिनट से कम में पूरा किया।
अठारह महीने पहले, मर्कोर के अनुसार, मॉडल उन्हीं कार्यों में मानव औसत से नीचे रहते थे।
यह एक आंकड़ा है। दूसरा उस पूर्ण बेंचमार्क में है जिससे ये कार्य सरल किए गए, और वह काफ़ी कम चापलूस है।
कठिन संस्करण क्या कहता है
APEX-Accounting, जिसे मर्कोर ने वित्तीय सॉफ़्टवेयर कंपनी रैंप के साथ बनाया, दस नकली कंपनियों में फैले 160 कार्य हैं, प्रति कार्य औसतन 7.5 इनपुट फ़ाइलें और लेखांकन पेशेवरों द्वारा लिखे 2,186 मूल्यांकन मानदंड। उस सूट पर मर्कोर की तालिका क्लॉड ओपस 5.5 को 61.8 प्रतिशत, फ़ेबल 5.1 को 61.0 और जीपीटी-6 एस्ट्रा को 57.9 पर रखती है, हर एक के साथ लगभग चार अंक की त्रुटि सीमा।

निरंतरता के आंकड़े अधिक कठोर पाठ हैं। हर मॉडल को प्रति कार्य आठ बार चलाया जाता है। सबसे निरंतर मॉडल ने आठों बार कोई कार्य सही किया केवल 2.6 प्रतिशत मौकों पर, और किसी भी मॉडल ने लगभग 60 प्रतिशत कार्य किसी भी बार में पूरी तरह हल नहीं किए। मर्कोर कहता है कि शीर्ष तीन मॉडलों की लगभग दस में सात विफलताएँ तर्क की विफलताएँ हैं, न कि फ़ाइल ढूँढ़ने या निर्देश मानने की।
दोनों आंकड़ों के बीच की खाई ही असली ख़बर क्यों है
सरलीकृत कार्य वही अलग कर देते हैं जिसमें आज के मॉडल निर्विवाद रूप से अच्छे हैं: बहुत सी फ़ाइलें ध्यान से पढ़ना, कोई संख्या न खोना, और वही करना जो निर्देश में था। ये असली लेखांकन कौशल हैं, और लगातार ग्यारहवें घंटे ये काम करने वाला इंसान उस मशीन से बुरा करता है जिसका कोई ग्यारहवाँ घंटा होता ही नहीं।
सरलीकृत कार्य जो हटा देते हैं वह सब है जो समापन को कठिन बनाता है: यह निर्णय कि कौन सी संख्या ग़लत है, उस व्यक्ति को फ़ोन जिसने उसे चढ़ाया, यह जानकारी कि यही ग्राहक हमेशा उपचय देर से दर्ज करता है। मर्कोर यह स्पष्ट कहता है: लेखक नोट करते हैं कि ये कार्य लेखांकन कौशल के केवल एक उपसमुच्चय को मापते हैं और ग्राहक संवाद तथा मौन संदर्भ को बाहर रखते हैं।

वह चेतावनी बहुत भार उठा रही है, और उसे उन 100 प्रतिशत से जुड़ा रखना चाहिए।
यह बेंचमार्क किसका है
दोनों में से कोई आंकड़ा स्वतंत्र नहीं है। मर्कोर एक बाज़ार है जो ठीक इसी तरह के डेटा के लिए एआई प्रयोगशालाओं को विशेषज्ञ मानव श्रम बेचता है, और रैंप वित्तीय सॉफ़्टवेयर बेचता है। ऐसा बेंचमार्क जो दिखाए कि मॉडल पास हैं पर पहुँचे नहीं, वह अधिक विशेषज्ञ डेटा के पक्ष में तर्क है — और वही मर्कोर का उत्पाद है। इससे मापें ग़लत नहीं हो जातीं — मूल्यांकन मानदंड बड़ी लेखा फ़र्मों के पेशेवरों ने लिखे, और अंक एक मॉडल-आधारित निर्णायक देता है जो कंपनी के अनुसार 97 प्रतिशत मामलों में मानव मूल्यांकनकर्ताओं से मेल खाता है — पर यह उस बाज़ार का विक्रेता का अपना मूल्यांकन है जिसमें वह बेचता है।
कार्य स्थिर और सार्वजनिक भी हैं, यानी प्रशिक्षण डेटा में पहुँचते ही उनका मूल्य घटता है। अक्टूबर 2026 में 61.8 प्रतिशत इसी महीने के बारे में एक कथन है।
देखने की बात शीर्षक वाले औसत से अधिक Pass^8 स्तंभ है। जो मॉडल आठ में छह बार बही सही बंद करता है, उसने बही बंद नहीं की। उसने कुछ ऐसा बनाया है जिसे किसी नियंत्रक को अब भी जाँचना है — और यही वह हिस्सा है जिसे 100 प्रतिशत नहीं ढकता।