दो मॉडल, एक Live API
गूगल ने मंगलवार को Gemini 3.8 Live और Gemini 3.8 Live Extended Thinking जारी किए — दो नेटिव वाक-से-वाक मॉडल, जो चैट के लिए नहीं बल्कि उत्पादन में चल रहे वॉइस एजेंटों के लिए बनाए गए हैं। दोनों अभी Gemini Live API और गूगल एआई स्टूडियो में उपलब्ध हैं। Gemini Enterprise को ये निजी पूर्वावलोकन में मिले हैं, और गूगल का कहना है कि वे Search Live तथा Gemini Live ऐप में भी आ रहे हैं।
दोनों के बीच बँटवारा लागत के आधार पर है। Gemini 3.8 Live सस्ता संवाद मॉडल है, जो सहज बातचीत और दृश्य आधार पर केंद्रित है। Extended Thinking वह संस्करण है जो कठिन अनुरोध पर तर्क करता है और उसके लिए बातचीत रोकता नहीं — यही अंतर है उस वॉइस एजेंट में जो काम करते समय चुप हो जाता है और उस एजेंट में जो बोलता रहता है।
दोनों मॉडल 97 भाषाएँ संभालते हैं और गूगल के अनुसार बातचीत के बीच भाषा बदलने का पता बिना बताए लगा लेते हैं। वे लगभग वास्तविक समय में दृश्य इनपुट भी लेते हैं, इसलिए एजेंट सुनते हुए कैमरा फ़ीड देख सकता है, और टूल तथा एपीआई कॉल पृष्ठभूमि में चलाते हैं, उन पर अटकते नहीं।

गूगल जो अंक बता रहा है
गूगल Extended Thinking को Artificial Analysis के Speech to Speech Quality Index में 82.6 अंकों के साथ कुल मिलाकर पहले स्थान पर रखता है। उसी घोषणा में कंपनी τ-Voice एजेंटिक परीक्षण में 68.6%, Sierra के τ-Voice-banking संस्करण में 35.1% और Big Bench Audio में 97.7% बताती है। सस्ता मॉडल Gemini 3.8 Live, Speech Agent Arena में दूसरे स्थान पर है।
ये गूगल के अपने आँकड़े हैं, जो तीसरे पक्ष की सूचियों से लिए गए हैं पर लॉन्च के दिन विक्रेता द्वारा ही प्रकाशित किए गए। कोई स्वतंत्र पुनर्परीक्षण अभी सामने नहीं आया है, और यह लिखे जाने तक सूचियाँ स्वयं नए मॉडलों के साथ अद्यतन नहीं हुई थीं।
ओपनएआई के वॉइस मॉडल से सस्ता
गूगल की डेवलपर पोस्ट ऑडियो इनपुट 0.005 डॉलर प्रति मिनट और ऑडियो आउटपुट 0.018 डॉलर प्रति मिनट रखती है। दोतरफ़ा बातचीत के एक मिनट की सूची कीमत इस तरह लगभग 0.023 डॉलर बैठती है।
यह सबसे तुलनीय उत्पाद से कम है। ओपनएआई ने 11 सितंबर को अपना फ़ुल-डुप्लेक्स GPT-Live-1 एपीआई में 0.05 डॉलर प्रति मिनट पर रखा था। वॉइस ही वह अकेली विधा रही है जहाँ प्रति मिनट कीमत खरीदार को साफ़ दिखती है, टोकन गणित में दबी नहीं रहती, और गूगल ने ठीक इसी तुलना को ध्यान में रखकर कीमत तय की है।

साथ में एक ट्रांसक्रिप्शन मॉडल
गूगल ने Gemini 3.5 Transcribe भी जारी किया, एक वाक-से-पाठ मॉडल जो 85 से अधिक भाषाएँ कवर करता है। कंपनी स्ट्रीमिंग मोड में 4.0% और गैर-स्ट्रीमिंग में 2.6% शब्द त्रुटि दर बताती है, साथ में स्वचालित भाषा परिवर्तन और 1,000 शब्दों तक कस्टम शब्दावली भार — वही सुविधा जो उन कॉल सेंटरों में मायने रखती है जहाँ ऐसे उत्पाद नाम भरे रहते हैं जिन्हें कोई सामान्य मॉडल कभी नहीं देखता।
Live मॉडल Pipecat, LiveKit, LangChain, Agora, Fishjam और Vercel के लिए एकीकरण के साथ आते हैं — इस बात का उचित संकेत कि गूगल खरीदार किसे मानता है: वे टीमें जो पहले से ही फ़्रेमवर्क के हिस्सों से वॉइस एजेंट जोड़ रही हैं।
आगे क्या देखना है
जाँचने लायक बातें सूची संबंधी दावे हैं। Artificial Analysis और Speech Agent Arena अपने कार्यक्रम के अनुसार अपनी स्वतंत्र जाँच करते हैं, और तब Extended Thinking 82.6 तथा शीर्ष स्थान बनाए रखता है या नहीं, यही गूगल की लॉन्च कथा की परीक्षा है। दूसरी बात भार के नीचे विलंबता है: वाक्य के बीच तर्क करने वाले मॉडल को इतनी तेज़ी से यह करना होगा कि ठहराव ही उत्पाद न बन जाए।