
GPT-Live-1 vs VoxCPM2: uno costa $0,05 al minuto, l'altro costa una GPU da 24 GB
- deepseekNUOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiNUOVOOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleNUOVOGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenNUOVOQwen: Qwen3.8 Max (0902)2026-09-0240Intelligenza72Codice
- anthropicNUOVOAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 per 1M di token
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligenza72Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligenza78Codice
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligenza69Codice
Il modo più pulito per confrontare GPT-Live-1 con VoxCPM2 è notare che sembrano concorrenti solo finché non metti un numero sull'hardware. GPT-Live-1 è il modello vocale full-duplex di OpenAI, presente nell'API dal 10 settembre 2026 a 0,05 $ al minuto di voce e senza nulla da installare. VoxCPM2 è il modello text-to-speech open-weight da 2 miliardi di parametri di OpenBMB, rilasciato con licenza Apache 2.0 ad aprile 2026, che gira su circa 8 GB di VRAM e non è distribuito da alcun provider di inferenza — quindi se lo vuoi, la macchina è tua. Uno è una conversazione che noleggi al secondo; l'altro è un sintetizzatore che gestisci. La domanda non è quale sia migliore, ma quale dei due il tuo carico di lavoro possa davvero assorbire.

Due modelli, due lavori, una riga di specifiche onesta ciascuno
• Funzione — GPT-Live-1 conduce una conversazione: ascolta e parla simultaneamente, rispetta i turni di parola, gestisce interruzioni e backchannel e restituisce le trascrizioni. VoxCPM2 trasforma il testo in parlato. Non sente mai nulla.
• Accesso — GPT-Live-1 è ospitato e chiuso, a un solo ID modello dall'endpoint Live Sessions, con l'esempio di integrazione pubblicato che gira su WebRTC. VoxCPM2 è un checkpoint scaricabile su Hugging Face e ModelScope, Apache 2.0, gratuito per uso commerciale.
• Prezzo — GPT-Live-1 costa 0,05 $ al minuto vocale, con fatturazione al secondo, mentre il backend di delega viene misurato separatamente. VoxCPM2 costa 0 $ per chiamata più una GPU, e l'hosting open-source costituisce l'intero modello di costo.
• Ingombro — GPT-Live-1 non richiede alcun hardware da parte tua. VoxCPM2 richiede circa 8 GB di VRAM (6–8 GB a Q4), Python 3.10+, PyTorch 2.5+ e CUDA 12+.
• Benchmark — ogni valore vocale di GPT-Live-1 è di OpenAI, non riprodotto; l'unica classifica indipendente lo colloca settimo su undici. I numeri pubblicati di VoxCPM2 sono di OpenBMB, e le misurazioni indipendenti esistenti sulle sue asserzioni multilingue indicano la direzione opposta.
La questione dei 24 GB, con prezzo
I numeri di serving di VoxCPM2 sono quelli che decidono se l'auto-hosting è un hobby o un'architettura. Su una singola RTX 4090, il modello gira a un fattore di tempo reale di circa 0,30 in PyTorch puro e di circa 0,13 con il percorso Nano-VLLM — il che significa all'incirca 7,7 ore di audio generato per ogni ora di tempo GPU nella configurazione più veloce. Quelli sono i dati della model card, non una misurazione esterna; una ricetta di serving indipendente convalidata su una 4090 con CUDA 12.9 riporta fattori di tempo reale a regime di circa 0,120 per la sintesi zero-shot e 0,139 per il cloning, con memoria GPU di picco vicina a 22 GB su 24 GB. Entrambi i set sono a regime, non a freddo — la prima richiesta in un processo nuovo è molto più lenta, ed è il numero che la gente cita quando dice che il modello è inutilizzabile.
Mettilo accanto all'API. GPT-Live-1 a 0,05 $ al minuto fa 3,00 $ per un'ora di conversazione continua. Una scheda da 24 GB noleggiata sul mercato aperto costa poche unità di dollari l'ora, e possederne una si ammortizza su una cifra simile una volta che si tiene conto dell'utilizzo. Quindi il confronto finisce dove di solito finiscono questi confronti, con un'asimmetria scomoda: la bolletta della GPU arriva che qualcuno parli o meno con il tuo prodotto, mentre la bolletta dell'API scende a zero in una giornata tranquilla e a cinque cifre in una intensa. La sintesi in batch di un catalogo fisso è perfetta per la GPU. Una linea telefonica sempre attiva è perfetta per il contatore.
Ciò che VoxCPM2 fa che nessun altro open fa
Il motivo per cui VoxCPM2 merita così tanta attenzione non è che vince i benchmark — per lo più non lo fa — ma che progetta una voce a partire da una descrizione testuale senza alcun audio di riferimento. Questa è una capacità davvero nuova nei pesi aperti, e cambia il flusso di lavoro per chiunque abbia bisogno di una voce che non esiste ancora: provarla descrivendola a parole, iterare a parole e solo dopo decidere se clonarla. Attorno a questo, mette insieme 30 lingue più nove dialetti cinesi, output a 48 kHz tramite uno stadio integrato di super-risoluzione e fine-tuning con appena 5–10 minuti di audio.
La base di prove è più esile dell'elenco delle funzionalità. Il rapporto stesso di OpenBMB indica un tasso di errore per parola in inglese dell'1,84% e un tasso di errore per carattere in cinese dello 0,97%, e un errore medio dell'1,68% su 30 lingue misurato sul proprio set di 500 enunciati per lingua e valutato dal modello di un altro fornitore. Laddove esiste un test indipendente, il divario è ampio: sul set di test multilingue di MiniMax valutato con Whisper-large-v3, l'hindi arriva a 19,70 e l'arabo a 13,05 — molte volte peggio delle cifre autodichiarate. OpenBMB avverte inoltre che progettazione della voce e controllo dello stile producono risultati variabili tra un'esecuzione e l'altra e suggerisce di generare da una a tre volte per ottenere l'output desiderato, il che è un modo discreto di dire che il costo per chiamata di un risultato utilizzabile non è quello di una sola chiamata.
La tassa di integrazione che nessuno mette nel confronto
Un dettaglio poco affascinante decide se VoxCPM2 è una settimana di lavoro o un mese. Il suo repository Hugging Face è taggato voxcpm anziché transformers, il che significa che la libreria con cui quasi tutto il resto su quel sito viene caricato non può caricare questo modello. La pull request per risolvere la cosa è stata aperta il 4 agosto 2026 e non era ancora stata unita quando abbiamo controllato l'ultima volta. Le pull request per aggiungerlo ad altri stack di serving sono state unite, e l'adozione non è in discussione: 393.079 download negli ultimi trenta giorni al momento di questa cattura, con 27 adattatori, 30 finetune, 12 quantizzazioni e 100 Space costruiti sopra il checkpoint.

La tassa equivalente di GPT-Live-1 è una riscrittura del trasporto. Le sue sessioni sono costruite attorno a una connessione live anziché a un endpoint audio richiesta-risposta, e la fatturazione a doppio contatore significa che ogni chiamata di ragionamento delegata, invocazione di strumenti e ricerca web viene addebitata alle tariffe proprie del modello backend, in aggiunta al minuto vocale. I team che migrano da un'integrazione realtime misurata in token dovrebbero preventivare il passaggio come un'attività di ingegneria, non come una semplice sostituzione di model-ID.
Dove un layer di routing è davvero utile
OrcaRouter non offre né GPT-Live-1 né VoxCPM2, e vale la pena dirlo chiaramente invece di lasciare che il resto di questa sezione lasci intendere il contrario. Il livello vocale di GPT-Live-1 è dietro l'endpoint proprietario di OpenAI; VoxCPM2 non ha alcun provider ospitato. Nessuno dei due è qualcosa che si possa chiamare con la nostra chiave.
Il motivo per cui la questione del routing continua a emergere è che entrambi i modelli si trovano al margine di una pipeline il cui centro è testo. Un deployment di VoxCPM2 di solito risponde a qualcosa — un generatore di script, uno step di traduzione, un normalizzatore di testo, un modello di dialogo che decide cosa viene pronunciato dopo — e quelle sono normali chiamate a un modello. Una sessione di GPT-Live-1 delega il proprio ragionamento a un modello backend indicato nella configurazione della sessione e, nella documentazione di OpeAI stessa, quel backend è GPT-5.6 Terra, disponibile tramite OrcaRouter al prezzo di listino di OpeAI. La delega lato client va persino oltre, consentendo alla tua applicazione di fornire il backend, il che significa che il modello dietro la voce può essere qualsiasi endpoint tu controlli. Circa 190 modelli provenienti da undici provider a monte stanno dietro a una sola chiave al prezzo di listino, con zero markup — così quando un provider taglia un prezzo, il taglio è attivo qui lo stesso giorno anziché al rinnovo — con failover automatico tra provider e un DSL di routing per comporre più modelli in un'unica chiamata. Un'assicurazione a buon mercato per la metà dello stack che cambia più spesso.
Un avvertimento merita di stare in questa sezione anziché esservi sepolto, perché è il dettaglio che rende la metà GPT-Live-1 di questo confronto meno assestata di quanto suggeriscano i benchmark del suo fornitore. Sul'Artificial Analysis Speech to Speech Index indipendente, GPT-Live-1 segna il 69,8% — settimo su undici, dietro a GPT-Realtime-2.1 al 73,9% e a Grok Voice Think Fast 2.0 al 79,0%. Il modello è la voce più economica di quella classifica per ora di audio in ingresso, a 4,42 $, e non è la migliore. Metti in conto la possibilità che il livello vocale su cui ti standardizzi non sia quello che poi terrai.

Quale, per cosa
Scegli VoxCPM2 se il testo esiste prima che esista l'audio. Narrazione, audiolibri, doppiaggio, accessibilità, battute vocali di gioco, un prodotto che ha bisogno di una voce che nessuno ha ancora registrato — e soprattutto qualsiasi carico di lavoro in cui il volume è elevato, prevedibile e tale da giustificare un costo di capitale fisso. Accetta che lo eseguirai tu stesso, che gli strumenti che lo circondano si stanno ancora assestando e che le dichiarazioni sulla qualità multilingue meritano un tuo test di ascolto prima che arrivino a un cliente.
Scegli GPT-Live-1 se all'altro capo c'è una persona. Agenti vocali, supporto telefonico, flussi di intake, qualsiasi cosa in cui il modello debba decidere in tempo reale se la persona ha finito di parlare. Paga la tariffa al minuto per il privilegio di non doverti fare carico del problema, e prevedi il backend delegato come voce separata nel budget, perché è lì che la chiamata diventa economica o costosa.
L'errore è considerarli alternative in una gara comparativa. Per la maggior parte dei team che hanno bisogno di entrambi, sono due livelli dello stesso prodotto, e l'unica risposta davvero sbagliata è scegliere la versione self-hosted perché la licenza dice che è gratuita senza mettere nel conto la GPU che rende vera quella gratuità.
