
Gemini 3.8 Live vs GLM-4-Voice: cosa hanno davvero portato 21 mesi di IA vocale
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 459 tok/s
- openaiNUOVOOpenAI: GPT-6 Luna2026-09-2237Intelligenza
- openaiNUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- anthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- grokNUOVOGrok 4.72026-09-2146Intelligenza
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token · 183 tok/s
- orcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 1285 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 119 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
GLM-4-Voice è stato rilasciato il 3 dicembre 2024. Gemini 3.8 Live è stato annunciato il 15 settembre 2026. Sono 21 mesi, ed è il fatto più importante di questo confronto — più importante di qualsiasi benchmark, perché determina che tipo di domanda ti stai effettivamente ponendo.
Questi due modelli non sono rivali. Nessuno che nel 2026 distribuisca voce su larga scala sceglie tra loro in base alla qualità. La vera domanda è quella che GLM-4-Voice pone e a cui Gemini 3.8 Live non può rispondere: cosa servirebbe per possederlo invece di affittarlo? A quella domanda esiste una risposta autentica, ed è cambiata in 21 mesi meno di quanto potresti aspettarti.
Cosa ha rilasciato Google, e cosa ha rilasciato Zhipu
Gemini 3.8 Live è un modello di dialogo live ospitato, a pesi chiusi. Gestisce input visivi quasi in tempo reale, rileva e passa automaticamente da una all'altra delle 97 lingue supportate nel corso della conversazione, ed esegue strumenti e chiamate API in background mentre la conversazione prosegue. È disponibile per gli sviluppatori tramite la Gemini API e Google AI Studio, in anteprima privata in Gemini Enterprise e in Search Live. Il prezzo annunciato è $0,005 per minuto di audio in input e $0,018 per minuto di audio in output tramite la Live API; il grafico di Artificial Analysis sul costo per ora di audio in input lo colloca autonomamente a $1,50 all'ora. Il suo modello gemello, Gemini 3.8 Live Extended Thinking, attualmente guida quello stesso indice con 82,6, mentre Gemini 3.8 Live stesso si attesta a 76,0.
GLM-4-Voice è il primo modello vocale end-to-end di Zhipu AI, ed è un checkpoint scaricabile. È un assemblaggio in tre parti: un tokenizer vocale costruito su un encoder Whisper-large-v3 con un collo di bottiglia quantizzato vettorialmente da circa 0,4B parametri, un modello linguistico autoregressivo (GLM-4-Voice-9B, inizializzato da GLM-4-9B) da circa 9B parametri, e un decoder flow-matching riaddestrato da CosyVoice. Parla cinese e inglese, supporta emozione, tono, velocità del parlato e dialetto controllati tramite istruzioni — tra cui cantonese, mandarino di Chongqing e parlato di Pechino — e tokenizza il parlato a 12,5 Hz in un unico flusso di codebook a circa 175 bps, un ordine di grandezza inferiore rispetto ai tipici codec audio neurali.
Le dimensioni, a confronto:
• Rilascio — Gemini 3.8 Live: 15 settembre 2026. GLM-4-Voice: 3 dicembre 2024.
• Pesi — chiusi, solo hosted vs scaricabili, codice Apache-2.0 con una licenza personalizzata per i pesi.
• Lingue — 97 con cambio di lingua a metà conversazione rispetto a cinese e inglese.
• Visione — input visivo quasi in tempo reale rispetto a nessuno.
• Chiamata di strumenti — esecuzione in background di strumenti e API durante la conversazione rispetto all'assenza totale di un canale di strumenti.
• Contesto — non pubblicato da Google vs contesto 8K, output massimo 4K.
• Requisiti minimi per il self-hosting — non applicabile rispetto a 32 GB di RAM più una GPU CUDA come requisiti ufficiali; circa 12 GB di VRAM a int4.
• Filigrana — SynthID su tutto l'audio generato rispetto a nessuno descritto.

21 mesi hanno acquistato capacità, non solo qualità
La storia facile è che un modello frontier del 2026 batte un checkpoint aperto del 2024. È così, e il margine è ampio — ma l'osservazione più utile è che la categoria ha cambiato forma invece di muoversi lungo un unico asse.
Nel rapporto tecnico di Zhipu stesso, GLM-4-Voice ottiene un'accuratezza del 93,6% nella conversione da parlato a testo su Topic-StoryCloze, 82,9% da parlato a parlato, una naturalezza UTMOS di 4,45 e un QA vocale di 5,40/10 generale e 5,20/10 conoscenza — tutti autodichiarati e non replicati. La valutazione indipendente è più scarsa e meno lusinghiera: su VoiceBench registra un punteggio complessivo di 56,48, posizionandosi intorno al 29° posto su 42 in una tabulazione e al 30° su 40 in un'altra, con la comprensione multi-turno descritta come debole in entrambe le lingue. Sul benchmark di comprensione del dialogo multi-turno C³ si attesta a 11,09% in cinese e 33,22% in inglese. VCB Bench ha rilevato che era in testa nel controllo emotivo con 93,0 sulla sotto-metrica SIF cinese, e nel forte allineamento testo–voce, ma la gestione dei dialetti TELEVAL è risultata pari al 4,57% senza istruzioni esplicite.
Quei numeri descrivono un modello bravo nell'espressione vocale e scarso nella comprensione prolungata. Questo è un modello vocale del 2024 in una frase.
Il 76,0 di Gemini 3.8 Live nello Speech to Speech Index di Artificial Analysis è un valore composito che aggrega ragionamento vocale, prestazioni agentiche, preferenza dell'arena e tasso di successo nei task. Non è che il modello più recente sia migliore nello stesso compito di un multiplo maggiore. È che ora il composito include persino prestazioni agentiche e successo nei task — categorie in cui GLM-4-Voice non può competere perché non ha un canale per gli strumenti. Il modello del 2024 viene valutato su un gioco che non è mai stato progettato per giocare.

La licenza è la parte che la gente salta.
Se stai guardando GLM-4-Voice perché è aperto, leggi i termini prima che i pesi finiscano di scaricarsi. La divisione è reale ed è facile fraintenderla:
• Codice — Apache-2.0. Davvero permissivo.
• Pesi — una licenza personalizzata che richiede attribuzione e registrazione presso Zhipu per uso commerciale.
«Open weights» e «Apache-2.0» non sono la stessa affermazione, e molta della copertura secondaria di questo modello li confonde. Se intendi distribuire un prodotto commerciale basato su GLM-4-Voice, il requisito di registrazione è un passaggio legale, non una formalità, e dovrebbe essere sul percorso critico. Un tracker si spinge oltre e descrive il modello come proprietario con uso commerciale condizionato. In ogni caso, l'assenza di un addebito al minuto non è l'assenza di un rapporto commerciale.
L'aritmetica dei costi, fatta onestamente
L'argomento a favore dell'hosting autonomo è che un costo mensile fisso batte un costo al minuto quando i volumi sono alti. Quest'argomento è reale, ed è più esiguo di quanto sembri quando si conta ciò che si gestisce.
GLM-4-Voice richiede ufficialmente 32 GB di RAM e una GPU CUDA. Le quantizzazioni int4 della community girano in circa 12 GB di VRAM, in pratica circa 10–11 GB, terreno da RTX 3060, con un tetto pratico di circa 30 secondi di parlato per turno. Un'A10 cloud a circa 0,50–1,00 $ l'ora equivale a qualcosa tra i 350 e i 700 $ al mese per un'istanza in esecuzione continua — prima ancora di aver servito un singolo utente, e senza failover, senza capacità di burst e senza nessuno da allertare quando il decoder produce rumore alle 3 del mattino.
Rispetto a ciò, Gemini 3.8 Live a $1,50 per ora di audio in input significa che con $350 ottieni circa 233 ore di voce. Non è ovviamente peggiore, e arriva con una capacità che non hai provisionato. Il punto di crossover esiste; è più alto di quanto suggerisca il confronto principale, e si sposta a seconda che il tuo traffico sia costante o a raffiche. Il traffico a raffiche è il caso in cui la tariffazione al minuto vince in modo decisivo, perché le GPU inattive vengono fatturate esattamente come quelle occupate.
C'è anche una differenza in quello che ottieni per i tuoi soldi. I rapporti della community sui deployment quantizzati di GLM-4-Voice collocano la latenza del dialogo continuo tra 38 e 120 ms, anche se quelle cifre provengono da resoconti scritti piuttosto che da Zhipu. La latenza di Gemini 3.8 Live non è stata pubblicata affatto da Google. Se la bassa latenza è un tuo requisito imprescindibile, nessuno dei due ha un numero su cui pianificare — uno ha misurazioni di terze parti dalla community, l'altro ha testimonianze di partner e nessun dato.

L'opzione intermedia: possiedi la logica, affitta la capacità
Inquadrare la questione come self-host contro hosted trascura l'assetto in cui la maggior parte dei team finisce effettivamente per trovarsi. GLM-4-Voice non ha un canale per i tool, quindi qualsiasi prodotto costruito su di esso necessita di un modello di testo separato per le ricerche, il che significa che il modello vocale self-hosted si trova comunque davanti a un modello di testo hosted. La decisione sul deployment e la decisione sulle capacità sono separabili.
È in questa separazione che un router fa davvero il suo lavoro. OrcaRouter mette a disposizione 190 modelli dietro un'unica chiave al prezzo di listino del provider, senza alcun ricarico, così il target di delega dietro il tuo front-end vocale può essere cambiato sul traffico live senza ricostruire nulla, e un taglio di prezzo a monte ti raggiunge lo stesso giorno invece che al rinnovo successivo. Il failover automatico conta più del solito in una configurazione self-hosted, perché quando è la tua istanza GPU a cadere, il modello backend resta comunque raggiungibile e la sessione non deve morire con essa. Due chiarimenti, visto che questo confronto invita a confusione: non ospitiamo GLM-4-Voice, e gli endpoint Gemini 3.8 Live non sono nemmeno sul nostro router — provengono dai loro fornitori. Ciò che è sul router è il livello testuale a cui entrambi affidano il lavoro.
La decisione, e la lezione che c'è sotto
Scegli GLM-4-Voice se hai bisogno del modello sul tuo hardware, se il tuo traffico è davvero costante ad alto volume, se stai sviluppando solo in cinese o inglese, e se devi modificare il modello invece di chiamarlo. Metti in conto la registrazione della licenza come un'attività reale, e aspettati di risolvere da solo la comprensione multi-turno — è il punto debole documentato del modello e nessuna quantità di fine-tuning attorno a un tetto di output di 4K riuscirà a nasconderlo del tutto.
Scegli Gemini 3.8 Live se i tuoi requisiti includono la visione, il tool calling, più di due lingue o qualsiasi pattern di traffico che definiresti a picchi. È un modello in anteprima con dati di contesto e latenza non pubblicati, il che rappresenta un vero rischio di pianificazione, ma è anche l'unico dei due in grado di cercare qualcosa a metà frase.
La lezione generale vale più di entrambi i verdetti. Ventuno mesi di IA vocale hanno prodotto un modello che non è principalmente un modello vocale migliore — è un'interfaccia vocale su un agente. Se la tua ragione per volere pesi aperti era il costo, i conti sono più vicini di quanto suggerisca l'inquadramento senza licenza. Se la tua ragione era il controllo, quest'ultimo non è affatto stato commoditizzato, e GLM-4-Voice resta una risposta legittima a una domanda che Gemini 3.8 Live non affronta.
