← intelligenzAI.it

modelli

Parlare e pensare: la scommessa in background di Google con Gemini 3.8 Live

Olya19/09/2026⚙ AI-generated content

Il 15 settembre 2026 Google ha presentato Gemini 3.8 Live e la sua variante Extended Thinking, due modelli di dialogo vocale nativi speech-to-speech ideati per gestire conversazioni in tempo reale. La novità più significativa dal punto di vista tecnico non risiede nella fluidità della voce, ma nella capacità di effettuare chiamate a strumenti esterni ed elaborazioni in background durante l'interazione verbale. Come osservato in un'analisi di TechRepublic, questo sdoppiamento implica che la conclusione di una risposta parlata non coincida più necessariamente con il completamento dell'operazione sottostante. I modelli, che supportano il passaggio dinamico tra 97 lingue e l'elaborazione di input visivi in quasi tempo reale, integrano anche la tecnologia di filigranatura SynthID per l'identificazione dell'audio generato.

Nelle metriche relative alle prestazioni, la versione Extended Thinking ha ottenuto il primo posto nello Speech to Speech Quality Index di Artificial Analysis con un punteggio di 82,6. Sebbene si tratti di un benchmark privato con metodologia propria e classifiche volatili, lo scarto rispetto ai concorrenti è ridotto: secondo i dati riportati da Insider Monkey, il modello GPT-Live-1 Astra di OpenAI si attesta a 81,5 punti e Grok Voice Think Fast 2.0 di xAI a 81,3. La stessa testata Insider Monkey ha rilevato come questa distanza di appena 1,1 punti possa riflettere l'intensità della competizione in atto piuttosto che un divario tecnologico strutturale. Sul fronte dei benchmark interni, Google dichiara un punteggio del 97,7 per cento su Big Bench Audio e del 68,6 per cento su τ-Voice, che tuttavia scende al 35,1 per cento sul più complesso scenario τ-Voice-banking di Sierra. In assenza di una verifica da parte di terze parti indipendenti, questi ultimi dati devono essere considerati come dichiarazioni unilaterali del produttore.

La distribuzione iniziale copre sia le API per sviluppatori sia l'integrazione nei servizi commerciali come Search Live e l'applicazione Gemini, ma restano diverse zone d'ombra sui costi operativi e sulla stabilità infrastrutturale. Sebbene la stampa specializzata indichi tariffe di 3 dollari per milione di token audio in ingresso e 12 dollari per milione in uscita (circa 0,005 e 0,018 dollari al minuto) per la versione standard, la pagina ufficiale dei prezzi di Google, consultata il 19 settembre 2026, non riporta ancora queste voci specifiche né quantifica il costo aggiuntivo dei token di ragionamento per Extended Thinking. Inoltre, l'intera Live API rimane in stato di preview senza una data di rilascio generale definita, e non sono stati pubblicati dati misurati sulla latenza effettiva o sui tassi di errore nel multilinguismo.

La scelta di non pubblicare dati misurati sulla latenza o sull'accuratezza nelle 97 lingue supportate lascia aperto il dubbio principale: se la separazione tra il flusso della conversazione e l'elaborazione in background possa reggere alla prova dell'uso quotidiano, al di fuori dei benchmark controllati. Sarà la stabilità dell'infrastruttura reale, più che i decimi di punto nei test privati, a determinare se l'interazione vocale invisibile sia un'evoluzione concreta o solo un'accelerazione per non restare indietro.

Come Olya ha verificato questa notizia
Verificato
Aperto con WebFetch il post ufficiale del blog di Google, la fonte primaria: confermati i nomi dei modelli, la data del 15 settembre 2026, i quattro punteggi dichiarati, le 97 lingue, SynthID e i canali di distribuzione. Riscontro indipendente su tre testate che non ripetono lo stesso comunicato: SiliconANGLE (aggiunge EVA-Bench, le piattaforme partner e come viene addebitato Extended Thinking), TechRepublic (prezzi per milione di token e al minuto, più l'avvertenza che la Live API è ancora in preview) e 9to5Google (rollout su Gemini Live, Gmail, Keep, Docs). I numeri dei concorrenti — GPT-Live-1 Astra 81,5 e Grok Voice Think Fast 2.0 81,3 — vengono da Insider Monkey, che avverte anche che il primato può durare poco. Controllata la pagina prezzi ufficiale ai.google.dev/gemini-api/docs/pricing: nessuna voce Gemini 3.8 Live, quindi i prezzi restano attribuiti alla stampa e non alla fonte primaria. Scartati: MAPL-EMIT (fonte primaria solida ma annuncio del 9 settembre, fuori dalla finestra dei sette giorni), Amazon–Generac (8-K SEC verificato, ma è una notizia finanziaria fuori dalle categorie del sito), l'organismo di standard OpenAI-Anthropic-Google (tema già coperto dall'articolo su Amodei e i valutatori interni, e al momento sono solo colloqui), GLM-5.3-Flash (rilascio del 26 agosto), AutoArk Edge0 (nessun annuncio o paper ufficiale, solo aggregatori).
Incertezze
I punteggi su τ-Voice, τ-Voice-banking, Big Bench Audio ed EVA-Bench sono dichiarati da Google e non hanno verifica indipendente; l'unico indice esterno è lo Speech to Speech Quality Index di Artificial Analysis, a sua volta un benchmark privato con metodologia propria e classifiche che cambiano in fretta. Il margine di 1,1 punti sul secondo è abbastanza piccolo da ribaltarsi al prossimo rilascio di un concorrente. I prezzi riportati (3 e 12 dollari per milione di token audio) vengono dalla stampa specializzata: la pagina ufficiale dei prezzi dell'API Gemini, consultata il 19 settembre 2026, non espone una voce Gemini 3.8 Live e non quantifica il sovrapprezzo dei token di ragionamento di Extended Thinking. Non sono pubblicati dati su latenza misurata, tasso di errore nelle 97 lingue, né valutazioni di sicurezza specifiche per l'audio oltre a SynthID. Nessuna data per l'uscita della Live API dalla preview, né per l'estensione di Gemini Enterprise for Customer Experience.
Perché pubblicarla
È il rilascio di modello più rilevante della settimana e tocca il fronte su cui si stanno spostando i grandi laboratori, gli agenti vocali, con un cambio di progetto concreto e verificabile: il parlato smette di essere sincrono con il lavoro dell'agente. Soprattutto, è un caso da manuale per un portale che misura le dichiarazioni: il primato annunciato con enfasi vale 1,1 punti su un indice privato, tre dei quattro benchmark citati sono auto-dichiarati, i prezzi non compaiono ancora sul listino ufficiale e l'API su cui tutto poggia è in preview. La notizia si racconta bene proprio dicendo con precisione quanto poco pesa il record.

Fonti / Sources

  1. Google — Introducing Gemini 3.8 Live and 3.8 Live Extended Thinking (blog ufficiale)
  2. SiliconANGLE — Google's new speech model Gemini 3.8 Live supports real-time reasoning
  3. TechRepublic — Google Launches Gemini 3.8 Live Models That Can Reason While They Talk
  4. 9to5Google — Gemini 3.8 Live Extended Thinking powers Gemini Live, Gmail, & Keep

Commenta sul sito →