نموذجان وواجهة Live واحدة

أصدرت غوغل يوم الثلاثاء Gemini 3.8 Live وGemini 3.8 Live Extended Thinking، وهما نموذجان أصليان من صوت إلى صوت مبنيان لوكلاء الصوت في بيئات التشغيل لا للدردشة. النموذجان متاحان الآن عبر واجهة Gemini Live وGoogle AI Studio. وتحصل Gemini Enterprise عليهما في معاينة خاصة، وتقول غوغل إنهما في طريقهما إلى Search Live وتطبيق Gemini Live.

يتوزع النموذجان بحسب الكلفة. فـGemini 3.8 Live هو النموذج الحواري الأرخص، الموجّه إلى الحوار السلس والإسناد البصري. أما Extended Thinking فهو النسخة التي تستدل في طلب أصعب دون أن توقف المحادثة لفعل ذلك، وهو الفارق بين وكيل صوتي يصمت وهو يعمل وآخر يواصل الحديث.

يتعامل النموذجان مع 97 لغة، ويكتشفان بحسب غوغل الانتقال بينها في منتصف المحادثة دون إخبارهما. كما يقبلان مدخلات بصرية شبه آنية، فيستطيع الوكيل أن يراقب بثًا من الكاميرا وهو يستمع، وينفذان استدعاءات الأدوات وواجهات البرمجة في الخلفية بدل التوقف عندها.

زميلتان تتحدثان إلى مكتب عليه حاسوب محمول مفتوح في مكتب مضاء
يأتي نموذجا Live مع تكاملات مع Pipecat وLiveKit وLangChain وAgora وFishjam وVercel. صورة أرشيفية. https://kaboompics.com/ · pexels · Pexels License

الأرقام التي تذكرها غوغل

تضع غوغل نموذج Extended Thinking في المركز الأول إجمالًا على مؤشر جودة الصوت إلى الصوت لدى Artificial Analysis بنتيجة 82.6. وفي الإعلان نفسه تذكر 68.6% في اختبار τ-Voice الوكيلي، و35.1% في نسخة τ-Voice-banking من Sierra، و97.7% في Big Bench Audio. أما Gemini 3.8 Live، النموذج الأرخص، فيأتي ثانيًا في Speech Agent Arena.

هذه أرقام غوغل نفسها، مأخوذة من قوائم طرف ثالث لكن نشرتها الشركة المصنّعة يوم الإطلاق. ولم تظهر بعد أي إعادة تشغيل مستقلة، ولم تكن القوائم ذاتها قد حُدّثت بالنماذج الجديدة حتى كتابة هذا الخبر.

سعر دون نموذج الصوت لدى OpenAI

تحدد تدوينة غوغل للمطورين سعر الصوت الداخل بـ0.005 دولار للدقيقة والصوت الخارج بـ0.018 دولار للدقيقة. وبذلك تكلف دقيقة محادثة فعلية في الاتجاهين نحو 0.023 دولار بسعر القائمة.

وهذا أقل من أقرب منتج مقارن. فقد وضعت OpenAI نموذجها كامل الازدواج GPT-Live-1 في الواجهة بسعر 0.05 دولار للدقيقة في 11 سبتمبر. وظل الصوت الوسيط الوحيد الذي يبقى فيه سعر الدقيقة مقروءًا للمشتري بدل أن يُدفن في حسابات الرموز، وقد سعّرت غوغل نفسها داخل هذه المقارنة عن قصد.

ميكروفون استوديو مثبّت على ذراع حامل
ترجيح المفردات في Gemini 3.5 Transcribe موجّه إلى مراكز الاتصال. صورة أرشيفية. Ludvig Hedenborg · pexels · Pexels License

نموذج تفريغ نصي إلى جانبهما

أصدرت غوغل كذلك Gemini 3.5 Transcribe، وهو نموذج من الصوت إلى النص يغطي أكثر من 85 لغة. وتذكر الشركة معدل خطأ في الكلمات يبلغ 4.0% في وضع البث المتواصل و2.6% خارجه، مع تبديل تلقائي بين اللغات وترجيح مفردات مخصصة يصل إلى 1000 مصطلح، وهي الميزة التي تهم مراكز الاتصال المليئة بأسماء منتجات لم يرها نموذج عام من قبل.

ويأتي نموذجا Live مع تكاملات مع Pipecat وLiveKit وLangChain وAgora وFishjam وVercel، وهي إشارة معقولة إلى من تعتبره غوغل المشتري: فرق تركّب أصلًا وكلاء صوتيين من قطع أطر العمل.

ما يستحق المتابعة

ما يستحق التحقق هو ادعاءات القوائم. فـArtificial Analysis وSpeech Agent Arena تجريان تقييماتهما الخاصة وفق جدولهما، وبقاء Extended Thinking عند 82.6 وفي الصدارة حين تفعلان ذلك هو اختبار رواية غوغل يوم الإطلاق. والثاني هو زمن الاستجابة تحت الحمل: نموذج يستدل في منتصف الجملة عليه أن يفعل ذلك بسرعة كافية حتى لا تصبح الوقفة هي المنتج.