Google ने दो नए speech-to-speech मॉडल, Gemini 3.8 Live और Gemini 3.8 Live Extended Thinking जारी किए हैं, जो OpenAI के GPT-Live मॉडलों के आकार में समान हैं।
- इस रिलीज़ में Gemini 3.8 Live और Gemini 3.8 Live Extended Thinking शामिल हैं।
- एक web UI उपयोगकर्ताओं को एक मॉडल और voice preset चुनने, एक वैकल्पिक system prompt दर्ज करने और ब्राउज़र के माध्यम से voice conversation शुरू करने की अनुमति देता है।
- उपयोगकर्ता मॉडल के बोलते समय उसे रोक सकते हैं, जिसमें transcripts इन अंतरालों को कैप्चर करते हैं।
- इस implementation में एक WebSocket endpoint से कनेक्शन होता है और बाहरी libraries के बिना capture और playback के लिए Web Audio API का उपयोग किया जाता है।