نموذج في الصفّ الأول بلا طبقة انتباه كاملة واحدة

نشر مختبر «نيف إيه آي» في بكين، الذي تأسّس في فبراير ولم يُصدر أيّ نموذج قبل اليوم، النموذج Naive-N0.5-Flash برخصة إم آي تي. وهو نموذج من نوع خليط الخبراء بـ309 مليارات معامل إجمالاً و15.5 مليار معامل نشط، ويُعلن نافذة سياق أصلية من مليون رمز. غير المألوف فيه هو ما يغيب عنه: وفق بطاقة النموذج، لا توجد أيّ طبقة انتباه كاملة في الشبكة كلّها.

تُبقي المحوّلات عادةً بضع طبقات على الأقل تنظر إلى السياق بكامله. هذه الطبقات هي ما يحفظ المعلومة على المدى البعيد، وعند أطوال تبلغ مليون رمز تستهلك أيضاً معظم كلفة فكّ الترميز. يحذفها Naive-N0.5-Flash تماماً. توزّع طبقاته الـ48 على ثماني وحدات من ستّ طبقات: خمس طبقات انتباه بنافذة منزلقة تتبعها طبقة واحدة من انتباه ديب سيك المتناثر، مع استبدال الطبقة الأولى من الوحدة الأولى بطبقة متناثرة كذلك. فالنتيجة 39 طبقة بنافذة منزلقة وتسع طبقات متناثرة.

النافذة المنزلقة 128 رمزاً. أمّا الطبقات المتناثرة فتُشغّل مُفهرِساً خفيفاً بستة عشر رأساً على التاريخ كلّه، ثم تحسب الانتباه على الـ2048 رمزاً التي يختارها فقط. تُحفظ ذاكرة المفاتيح والقيم كاملةً ويظلّ المُفهرِس يقرأ كلّ شيء، فالتوفير يقع في حساب الانتباه وحركة الذاكرة لا في التخزين.

صفوف من خزائن الخوادم داخل قاعة بيانات
يحفظ النموذج ذاكرة المفاتيح والقيم كاملةً؛ التوفير في الحساب لا في التخزين. صورة من الأرشيف. ThisIsEngineering · pexels · Pexels License

مبنيّ على النموذج الأساسي المفتوح من شياومي

لم يُدرَّب Naive-N0.5-Flash من الصفر. فهو يقوم على النموذج الأساسي مفتوح الأوزان MiMo-V2.5 من شياومي، وهو ما يعترف به «نيف إيه آي» في شكره، إلى جانب ديب سيك على تصميم الانتباه المتناثر ومشروع SGLang على بنية الاستدلال. وتقول الشركة إنّ تكييف النموذج الأساسي مع بنية الانتباه الجديدة كان أحد أهداف التدريب المسبق المُستأنف: 3.25 تريليون رمز في ثلاث مراحل، منها 50 مليار رمز لتسخين المُفهرِس، و3 تريليونات للتدريب على الانتباه المتناثر، و200 مليار لتخفيف معدّل التعلّم.

هذا النسب مهمّ لقراءة الإصدار. فالأمر إعادة بناء معماريّة واسعة لنموذج أساسي يملكه غيرهم، نُشرت بشكل مفتوح، لا تدريب مسبق جديد من الأساس — وتُقدَّم دليلاً على أنّ البنى الهجينة التي تمزج التناثر بالنافذة المنزلقة قادرة على حفظ الجودة حتى مليون رمز.

كما نشر «نيف إيه آي» نظام الاستدلال الخاص به NaiveRT، الذي تقول الشركة إنّه يدمج دمج النوى الكبرى وProgrammatic Dependent Launch وفكّ الترميز التخميني ليمنح 50 رمزاً في الثانية لكلّ مستخدم في الوضع القياسي وحتى ألفي رمز في وضع «فائق السرعة». الأوزان وكود الاستدلال برخصة إم آي تي؛ وسعر الواجهة المستضافة 0.10 دولار لكلّ مليون رمز مُدخل، و0.40 دولار للمُخرج، و0.01 دولار لكلّ مليون قراءة من الذاكرة المؤقتة.

أرقام الاختبارات هي أرقام الشركة نفسها

تعرض بطاقة النموذج نتائج على مهامّ برمجة ووكلاء — SWE-Bench Pro وDeepSWE v1.1 وTerminal-Bench 2.1 وALE-CLI وProgramBench — وعلى مجموعة اختبارات للبحث والتطوير في الذكاء الاصطناعي منها PostTrainBench وMLE-bench-30 وPaperBench. هذه تقييمات الشركة نفسها وليست نتائج مستقلّة، وهي صريحة في وصف بيئة الاختبار: أجرت الاختبارات، ما لم يُذكر خلاف ذلك، عبر Claude Code 2.1.207 بسياق مليون رمز وحرارة 1.0 وtop-p 0.95، مع إتاحة أدوات ملفّات وباش أساسية فقط. أمّا نتائج المنافسين فمنقولة عن مدوّنات مصنّعين آخرين وبطاقات نماذجهم ولوحات النتائج العامّة بدل إعادة تشغيلها.

مهندسون يناقشون رسماً تخطيطياً أمام لوح أبيض
تقول «نيف إيه آي» إنّ نظام الاستدلال نفسه بُني ببحث محوره الذكاء الاصطناعي. صورة من الأرشيف. Godfrey Atima · pexels · Pexels License

مختبر قُوِّم قبل أن يكون له منتج

أسّس «نيف إيه آي» في فبراير 2026 داي جيفنغ، الأستاذ المشارك في جامعة تسينغهوا الذي عمل سابقاً في مايكروسوفت ريسرش آسيا وفي شركة الرؤية الحاسوبية سينس تايم. وبدعم من تنسنت جمع المختبر نحو 400 مليون دولار وبلغ تقويماً مُعلناً عند 1.42 مليار دولار تقريباً — رقم لفت الانتباه الأسبوع الماضي تحديداً لأنّ الشركة لم تكن قد أصدرت شيئاً.

أصدرت الآن، وحجّة بطاقة النموذج هي شعار الشركة لا نتيجة اختبار: «بناء ذكاء اصطناعي في الصفّ الأول بالذكاء الاصطناعي». وتقول «نيف إيه آي» إنّ NaiveRT نفسه بُني وحُسِّن عبر ما تسمّيه بحثاً وتطويراً محوره الذكاء الاصطناعي، وتحيل القارئ إلى دراسة حالة في مدوّنتها التقنية.

ما يستحقّ المتابعة هو صمود هذه المعماريّة أمام أحمال عمل الآخرين. فنموذج بلا أيّ طبقة انتباه كاملة اختبار حقيقي لما إذا كانت نافذة من 128 رمزاً مع 2048 رمزاً منتقاة بتناثر تكفي بديلاً عن الانتباه الشامل عند سياق من مليون رمز، ورخصة إم آي تي تعني أنّ جهات خارجية تستطيع إجراء هذا الاختبار بنفسها بدل الاكتفاء بأرقام الشركة. تتطلّب الأوزان عتاد إنفيديا الداعم لدقّة FP8 وتشغل نحو 315 غيغابايت، فالاختبار لن يكون رخيصاً.