نتيجتان، ومجموعة نماذج واحدة

نشرت ميركور يوم الخميس خطوط أساس بشرية لمجموعة من مهام المحاسبة المبسَّطة، والمقارنة غير متكافئة. اثنا عشر محاسبًا مبتدئًا، جميعهم مرخَّصون وبخبرة متوسطها نحو خمس سنوات ونصف، بلغ متوسطهم سبعة وثلاثين بالمئة عبر أربعة سيناريوهات إقفال شهري، بنتائج فردية تراوحت بين الصفر ونحو تسعين بالمئة، وبوقت يتراوح بين ثلاثين ومئة وثمانين دقيقة للمهمة. وتقول ميركور إن كلود أوبس 5 أحرز مئة بالمئة في محاولاته العشرين جميعها، وأنهى كل واحدة في أقل من عشر دقائق.

وقبل ثمانية عشر شهرًا، تقول ميركور، كانت النماذج تسجل دون المتوسط البشري في المهام نفسها.

هذا رقم. أما الآخر فهو في الاختبار الكامل الذي بُسِّطت منه هذه المهام، وهو أقل إطراءً بكثير.

ماذا تقول النسخة الأصعب

اختبار APEX-Accounting، الذي بنته ميركور مع شركة البرمجيات المالية رامب، يضم مئة وستين مهمة موزعة على عشر شركات محاكاة، بمتوسط سبع ملفات ونصف لكل مهمة، وألفين ومئة وستة وثمانين معيار تصحيح كتبها محاسبون محترفون. وعلى هذه المجموعة، يضع جدول ميركور كلود أوبس 5.5 عند 61.8 بالمئة، وفيبل 5.1 عند 61.0، وجي بي تي-6 أسترا عند 57.9، ولكلٍّ هامش خطأ قريب من أربع نقاط.

صفوف من المصنفات على رفوف مكتبية
يضع اختبار APEX-Accounting 160 مهمة عبر عشر شركات محاكاة. صورة توضيحية. Zulfugar Karimov · pexels · Pexels License

أرقام الاتساق هي القراءة الأقسى. فكل نموذج يُشغَّل ثماني مرات لكل مهمة. والنموذج الأكثر اتساقًا أصاب مهمة في المرات الثماني كلها في 2.6 بالمئة فقط من الحالات، ولم يحل أي نموذج حلًا كاملًا ما يقارب ستين بالمئة من المهام في أي تشغيلة. وتقول ميركور إن نحو سبعة من كل عشرة إخفاقات لدى النماذج الثلاثة الأولى هي إخفاقات في الاستدلال، لا في العثور على ملف أو اتباع تعليمة.

لماذا الفجوة بين الرقمين هي الخبر

المهام المبسَّطة تعزل ما تبرع فيه النماذج الحالية بلا جدال: قراءة ملفات كثيرة بعناية، وعدم إضاعة رقم، وفعل ما قالته التعليمة. وهذه مهارات محاسبية حقيقية، والإنسان الذي يؤديها في الساعة الحادية عشرة على التوالي يؤديها أسوأ من آلة ليس لديها ساعة حادية عشرة أصلًا.

وما تزيله المهام المبسَّطة هو كل ما يجعل الإقفال صعبًا: الحكم على أي رقم خطأ، والاتصال بمن قيّده، ومعرفة أن هذا العميل بالذات يسجل الاستحقاق متأخرًا دائمًا. وتقول ميركور ذلك صراحة: يشير المؤلفون إلى أن المهام تقيس مجموعة جزئية فقط من المهارات المحاسبية، وتستبعد التواصل مع العملاء والسياق الضمني.

شخصان يتحادثان على طاولة مقهى عليها أكواب قهوة
يستبعد الاختبار التواصل مع العملاء والسياق الضمني. صورة توضيحية. August de Richelieu · pexels · Pexels License

هذا التحفظ يحمل عبئًا كبيرًا، ويستحق أن يبقى ملتصقًا برقم المئة بالمئة.

لمن هذا الاختبار

لا أحد من الرقمين مستقل. فميركور سوق تبيع عمالة بشرية خبيرة لمختبرات الذكاء الاصطناعي من أجل هذا النوع من البيانات تحديدًا، ورامب تبيع برمجيات مالية. واختبار يُظهر أن النماذج قريبة لكنها لم تصل هو اختبار يحاجّ لمزيد من بيانات الخبراء، وهو منتج ميركور. لا يجعل ذلك القياسات خاطئة — فمعايير التصحيح كتبها محترفون من شركات محاسبة كبرى، والتصحيح يجريه حَكَم نموذجي تقول الشركة إنه يطابق المصححين البشر في سبعة وتسعين بالمئة من الحالات — لكنه تقييم مورّد لسوق يبيع فيها.

كما أن المهام ثابتة وعلنية، ما يعني أن قيمتها تتآكل بدخولها بيانات التدريب. ورقم 61.8 بالمئة في أكتوبر 2026 عبارة عن هذا الشهر.

وما يستحق المتابعة هو عمود Pass^8 لا متوسط العنوان. فالنموذج الذي يُقفل الدفاتر بصواب ست مرات من ثماني لم يُقفل الدفاتر. بل أنتج شيئًا ما زال على المراقب المالي أن يفحصه، وهو الجزء الذي لا تغطيه المئة بالمئة.