
Gemini 3.8 TTS vs VoxCPM2: Noleggiare una voce o eseguirla in proprio, in cifre reali
- openaiNUOVOOpenAI: GPT-6 Luna2026-09-2237Intelligenza
- openaiNUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- anthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- grokNUOVOGrok 4.72026-09-2146Intelligenza
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token
- orcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token
- deepseekNUOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenza76Codice
Non esiste una riga di classifica che metta Gemini 3.8 Flash TTS e VoxCPM2 fianco a fianco, e questa assenza è il dato più utile di questo confronto. Gemini 3.8 Flash TTS è un endpoint ospitato con un Elo di 1.260 al 2º posto nella Provider Voice Arena di Artificial Analysis e una tariffa pubblicata in token. VoxCPM2 è un checkpoint OpenBMB — 2 miliardi di parametri, Apache 2.0, rilasciato ad aprile 2026 — che nessun provider di inferenza ospita. Non puoi noleggiarlo. Lo esegui tu.
Quindi la domanda non è quale modello suoni meglio. È se per il tuo carico di lavoro sia meglio pagare al carattere per le GPU di qualcun altro oppure possedere le GPU e pagarle indipendentemente dal fatto che siano in funzione. Questa è una questione aritmetica e, a differenza della maggior parte dei confronti tra modelli, ha una risposta che puoi calcolare prima di impegnarti.

Uno di questi lo noleggi, l'altro lo gestisci
Parti da ciò che ognuno ti mette davvero in mano.
• Accesso — Gemini 3.8 Flash TTS è disponibile solo via API, richiamato tramite l'API Gemini e le superfici Google indicate nel suo annuncio del 23 settembre 2026. VoxCPM2 non ha alcun endpoint proprietario in uso produttivo né un provider di inferenza che lo serva; il checkpoint è il prodotto.
• Licenza — VoxCPM2 è distribuito con licenza Apache 2.0, che consente l'uso commerciale senza un accordo separato. Si tratta di una licenza davvero permissiva, e non è la norma per i pesi vocali aperti: diversi di essi sono distribuiti con termini limitati alla ricerca, che dirottano l'uso commerciale verso un'API ospitata.
• Dimensione — VoxCPM2 ha 2 miliardi di parametri e, a precisione ridotta, occupa circa 8 GB di VRAM per lo sviluppo, con un picco in fase di serving intorno ai 22 GB su una scheda da 24 GB. Google non ha pubblicato alcun numero di parametri per nessuno dei due modelli Gemini 3.8 TTS.
• Creazione vocale — Gemini 3.8 Flash TTS esegue il design vocale da una descrizione scritta, la replica vocale da un campione di 30 secondi e un dialogo a due voci in una sola chiamata. VoxCPM2 è un modello di sintesi vocale a voce singola; una conversazione è due esecuzioni unite.
• Punteggio indipendente — Flash TTS ne ha uno. VoxCPM2 non compare tra le righe in classifica nel Provider Voice Arena rilevato il 24 settembre 2026. L'assenza da una classifica non è un giudizio sulla qualità — di solito significa che nessuno ha inserito il modello — ma significa che non c'è un numero di preferenze di terze parti da soppesare.

Quel ultimo punto vale in entrambi i sensi e va detto chiaramente anziché sorvolare: se hai bisogno di un segnale di qualità indipendente prima di impegnarti, solo uno dei due ne fornisce uno.
Il numero che decide tutto: il fattore tempo reale
L'auto-hosting di un modello vocale converte una fattura per carattere in una fattura per ora di GPU, e il tasso di cambio tra queste due unità è il fattore tempo reale del modello — quanti secondi di calcolo sono necessari per produrre un secondo di audio.
Le cifre pubblicate di VoxCPM2 sono 0,30 in PyTorch puro e 0,13 con Nano-VLLM. Interpretale come throughput più che come latenza: a 0,13, un'ora GPU di tempo reale produce qualcosa nell'ordine di 7,7 ore di audio completato. A 0,30, la stessa ora GPU produce più vicino a 3,3 ore. Questi sono i numeri della scheda del modello stessa, misurati da OpenBMB, e rappresentano il singolo input più importante in qualsiasi decisione se costruire o acquistare in questo contesto.
Ne conseguono tre cose.
• Lo stack di serving conta più del modello. Passare da PyTorch puro a Nano-VLLM più che raddoppia il throughput su hardware identico. Qualsiasi modello di costo basato sul valore di 0,30 sovrastima il costo self-hosted di un fattore di circa 2,3.
• L'utilizzo è tutto. Una GPU a noleggio che resta inattiva il 90% del tempo non è più economica di un'API a qualsiasi prezzo. Il punto di pareggio compare solo quando tieni la scheda occupata.
• Il batching cambia di nuovo l'aritmetica. Il fattore tempo reale viene misurato per flusso; un server che gestisce richieste concorrenti ammortizza il costo fisso su di esse, che è esattamente il regime in cui il self-hosting inizia a vincere.
Quanto costa un'ora di audio, in entrambe le direzioni
Metti i due modelli di fatturazione sullo stesso asse. Un'ora di audio finito è 3.600 secondi di output.
Sul fronte dei modelli a noleggio, Google fattura in token anziché in caratteri: 0,50 $ per milione di token di testo in ingresso e 9,00 $ per milione di token audio in uscita fino al 31 dicembre 2026, poi 18,00 $; Flash-Lite TTS è 0,50 $ e 6,00 $, poi 12,00 $. Batch e Flex costano 0,25 $ e 4,50 $ per Flash TTS contro 0,25 $ e 3,00 $ per Flash-Lite TTS, e Priority costa 0,90 $ e 16,00 $. Artificial Analysis normalizza le tariffe standard a 16,50 $ e 11,00 $ per milione di caratteri, che è la conversione della classifica anziché una quotazione di Google, ed è il valore da usare quando si confronta con un modello che fattura in caratteri.
Dal lato dell'infrastruttura di proprietà non esiste alcuna tariffa per carattere. Il costo è l'ora GPU, moltiplicata per tutte le ore necessarie con il throughput sopra indicato, più lo stack di servizio, più le persone che lo mantengono in funzione. Il vantaggio di VoxCPM2 è che il costo marginale della millesima ora è lo stesso della prima — e il suo svantaggio è che il costo marginale della prima ora è una GPU.
Ecco perché la decisione è insolitamente netta:
• Al di sotto di una certa soglia di volume, l'API vince e non c'è gara. Stai pagando cifre a una sola cifra di dollari per ora di audio a fronte di un costo in conto capitale, e la tariffa promozionale di Google allarga ulteriormente quel divario fino al 1° gennaio 2027.
• Al di sopra di quel volume, su hardware che già possiedi e che puoi tenere occupato, il checkpoint Apache 2.0 vince in modo decisivo — e, a differenza di un checkpoint con licenza per la ricerca, nulla nella licenza ti impedisce di rilasciarlo.
• Nel mezzo, la risposta onesta è che stai comprando opzionalità, non risparmio. Il self-hosting ti dà la possibilità di fissare una versione, mantenere l'audio sulla tua infrastruttura e smettere di preoccuparti dei cambi di tariffa di un fornitore.
Dove ognuno è la risposta corretta
Scegli Gemini 3.8 Flash TTS quando vuoi il prodotto meglio documentato. Ha un punteggio indipendente, un prezzo pubblicato, dialogo a due voci in una singola chiamata, progettazione e replica della voce, e nessuna superficie operativa oltre a una chiave API. Il suo gemello Flash-Lite TTS ti offre un secondo punto di prezzo all'interno della stessa interfaccia, a un costo normalizzato di 11,00 $ per milione di caratteri. Quello che accetti in cambio è una tariffa che raddoppia il 1° gennaio 2027 e nessuna possibilità di eseguire il modello da nessuna parte.
Scegli VoxCPM2 quando è il lavoro operativo a contare. Apache 2.0 significa che l'uso commerciale è consentito senza riserve, la dimensione 2B significa che basta un singolo acceleratore, e il fattore real-time di 0,13 con Nano-VLLM significa che una scheda modesta produce diverse ore di audio per ogni ora di tempo effettivo. Quello che accetti è che nessun altro lo farà girare per te: nessun endpoint ospitato, nessuna riga in un'arena, nessun tariffario di fornitore, e ogni garanzia di qualità che ottieni è una che costruisci e misuri da solo.

Nessuno dei due modelli è ospitato da OrcaRouter, e vale la pena dirlo apertamente anziché lasciarlo intendere. Il posto giusto per chiamare Gemini 3.8 Flash TTS è l'API di Google stessa e le superfici indicate da Google; VoxCPM2 è un checkpoint che si distribuisce in autonomia. Ciò che OrcaRouter copre è il livello al di sopra di quella decisione — oltre 200 modelli dietro un'unica chiave al prezzo di listino del provider senza ricarichi, così una variazione di prezzo di un fornitore è attiva dalla nostra parte lo stesso giorno anziché al ciclo di fatturazione successivo, failover automatico così un modello in fase di valutazione non deve mai essere una dipendenza di produzione, e un DSL di routing che compone più modelli in un'unica chiamata quando una singola voce non copre l'intero lavoro.
Cosa guardare dopo
Due cose cambierebbero sostanzialmente questo confronto, e nessuna delle due si è ancora verificata.
Il primo è qualcuno che fa hosting di VoxCPM2. La sua assenza dal mercato dell'inferenza è il motivo principale per cui i due modelli vengono confrontati sul piano economico anziché sulla qualità — se un provider lo adotta, il calcolo tra affitto e possesso smette di essere il fattore decisivo e la riga mancante nell'arena diventa quella che vorresti fosse compilata.
Il secondo è il cambio di tariffa di gennaio da parte di Google. Alla tariffa promozionale l'API è abbastanza economica che la maggior parte dei carichi di lavoro non dovrebbe ospitare nulla in autonomia; alla tariffa post-promozionale il divario si restringe al punto che un team con capacità GPU già esistente e un volume costante dovrebbe rifare i conti invece di dare per scontato che l'API vinca ancora.
Finché uno di questi elementi non cambia, il fattore decisivo non è una classifica. È quante ore di audio produci al mese, e se la scheda è occupata.
