
GPT-Live-1 vs NVIDIA Nemotron VoiceChat 11B: una bolletta al minuto o una GPU da 80 GB
- deepseekNUOVODeepSeek: DeepSeek V4.1 Flash2026-09-10$0.15 / $0.60 per 1M di token
- openaiNUOVOOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleNUOVOGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenNUOVOQwen: Qwen3.8 Max (0902)2026-09-0240Intelligenza72Codice
- anthropicNUOVOAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 per 1M di token
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligenza72Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligenza78Codice
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligenza69Codice
La scelta tra GPT-Live-1 e NVIDIA Nemotron VoiceChat 11B non è una scelta tra due modelli vocali. È una scelta tra due modelli di business travestiti da modelli vocali. GPT-Live-1 è un'API ospitata che OpenAI ha reso accessibile agli sviluppatori il 10 settembre 2026, con fatturazione a 0,05 $ al minuto di audio e senza alcun hardware di tua proprietà coinvolto. NVIDIA Nemotron VoiceChat 11B — pubblicato come NVIDIA-NemotronLabs-VoiceChat-11B, con un container NGC datato 21 luglio 2026 e un checkpoint Hugging Face a corredo — è un modello vocale full-duplex open-weights da 11 miliardi di parametri che non girerà su nulla di meno di una GPU da 80 GB. Uno di questi ti costa denaro per ogni minuto di conversazione; l'altro ti costa denaro che qualcuno chiami o meno.
Il punto di pareggio è più semplice di quanto suggeriscano le presentazioni dei fornitori.
Parti dall'unico numero su cui entrambe le parti concordano. GPT-Live-1 a $0,05 al minuto costa $3,00 per un'ora di linea aperta continua. Questo è il prezzo di una conversazione vocale sempre attiva.
Ora, quantifichiamo il costo dell'alternativa. Nemotron VoiceChat 11B richiede una GPU con almeno 80 GB di VRAM — una A100, H100, H200, B100, B200 o una scheda di classe RTX 6000, su Linux. Noleggiarne una sul mercato aperto costa pochi dollari l'ora, e possederne una si ammortizza su una cifra simile una volta tenuto conto dell'utilizzo. Quindi una singola linea vocale sempre attiva è più o meno in pari: la GPU noleggiata costa all'incirca quanto l'API, prima ancora di aver pagato per far girare qualcosa su di essa.
Questo è il confronto sbagliato, ed è quello su cui si ferma la maggior parte degli articoli build-vs-buy. Il confronto giusto è per GPU, non per linea, e dipende da un numero che NVIDIA non ha pubblicato.
• GPT-Live-1 su un account Tier 1 — 25 sessioni simultanee, ovvero $1,25 al minuto, o $75 all'ora, quando tutte e 25 le linee sono attive
• Nemotron VoiceChat 11B su una singola GPU da 80 GB — tutte le sessioni concorrenti che un modello ibrido Mamba/Transformer da 11B riesce a far stare in 80 GB, a un costo di noleggio all'incirca pari a quello della scheda
Un modello 11B su un acceleratore da 80 GB è un bel margine, e 80 GB è un requisito che in pratica garantisce una notevole capacità di batching. Se una singola scheda gestisce anche solo sei conversazioni simultanee, il self-hosting è drasticamente più economico dell'API a pieno carico. Se ne gestisce una e mezza, non lo è. Finché qualcuno non esegue benchmark di concorrenza su traffico reale, la posizione onesta è che il punto di pareggio probabilmente favorirà il self-hosting ad alto volume e che nessuno dei due fornitori ti ha fornito il dato per dimostrarlo.

Dove il modello open è davvero migliore, non solo più economico
Il confronto sulla latenza merita maggiore attenzione di quello sul prezzo, perché su questo asse il modello aperto ha le prove migliori.
• Latenza di alternanza dei turni — Nemotron VoiceChat 11B riporta 448 ms per un'alternanza fluida dei turni su Full-Duplex-Bench 1.0, con una latenza di interruzione e cessione del turno di 480 ms e un tasso di subentro in caso di interruzione da parte dell'utente pari a 1,00. Il valore di GPT-Live-1 è di 0,8 secondi, in calo da 1,4, come riportato da OpenAI.
Leggi quei due numeri uno accanto all'altro con le fonti allegate e il quadro si capovolge. Le cifre di NVIDIA provengono da una suite di benchmark pubblicata e specificata pubblicamente. Quelle di OpenAI provengono da OpenAI, che confronta il suo nuovo modello con la propria generazione precedente, e non sono state riprodotte in modo indipendente. Sulla base delle prove disponibili, il modello a pesi aperti è misurabilmente più veloce in ciò che fa sembrare umano un agente vocale, e il modello ospitato è più veloce solo secondo i propri materiali stampa.
NVIDIA rivendica anche una primizia: Nemotron VoiceChat 11B è descritto come il primo modello open full-duplex che supporta il tool calling in tempo reale durante la conversazione, usando un canale di output separato e frasi di attesa preimpostate, così l'agente può continuare a parlare mentre aspetta un'API esterna. La model card include tre campioni audio che invitano ad ascoltare esattamente questo — alternanza naturale dei turni descritta come risposta in circa 450 ms, barge-in in cui il modello cede istantaneamente e tool chiamati in diretta nel mezzo della conversazione. Quei campioni sono del fornitore e corroborano il dato di 448 ms anziché verificarlo in modo indipendente, ma sono almeno prove udibili allegate a un checkpoint scaricabile, non un numero in un post di lancio. È lo stesso problema architetturale che GPT-Live-1 risolve con la delega, affrontato diversamente — il modello open tiene la linea da solo; il modello ospitato affida il compito a un modello di ragionamento separato e lascia che il livello vocale mantenga viva la conversazione.
Le somiglianze sono istruttive quanto le differenze. Entrambi funzionano in full duplex, il che significa che entrambi ascoltano mentre parlano invece di alternarsi. Entrambi supportano l'interruzione e il barge-in. Entrambi sono stati addestrati sul parlato a una scala che fa sembrare le vecchie pipeline a cascata ASR-poi-LLM-poi-TTS tre prodotti separati imbullonati insieme — il checkpoint di NVIDIA ha visto circa 550.000 ore di parlato.

Ciò a cui rinunci, e non è solo denaro
La prima cosa a cui si rinuncia con il modello aperto è la voce. Il checkpoint rilasciato usa un'unica voce fissa, chiamata Aria, e non supporta la clonazione vocale né una libreria di voci. GPT-Live-1 include dodici voci che spaziano tra accenti, dialetti e lingue diversi, e OpenAI le ha rimasterizzate appositamente per questo modello. Se la voce del tuo prodotto fa parte della sua identità, o se devi servire più mercati con agenti dalla voce diversa da un'unica distribuzione, questo è quasi sufficiente da solo a squalificarlo — ed è il limite meno visibile in un confronto tra specifiche, perché sembra un conteggio di funzionalità anziché una decisione di prodotto.
La seconda cosa a cui rinunci è il tetto del contesto. Il modello ha un limite di enunciato in fase di addestramento di circa 142 secondi e una limitazione pratica nel mantenere più di circa due minuti di contesto audio. Una chiamata telefonica che dura venti minuti non è un unico contesto continuo per questo checkpoint; è una sequenza di segmenti che il sistema circostante deve gestire. I modelli ospitati in genere assorbono quella gestione per te.
Il terzo è ciò che ti è consentito farne. La model card di Hugging Face riporta la licenza openmdw-1.1, mentre alcuni resoconti sul rilascio lo descrivevano come solo per uso di ricerca e la pagina del container NGC presenta i componenti come pronti per un uso commerciale o non commerciale. Tre fonti, tre interpretazioni diverse, e solo il testo della licenza è vincolante. Questo tipo di discrepanza è ciò che emerge in una revisione legale tre settimane prima del lancio. Risolvila prima di costruire, non dopo.
Il quarto è l'operatività. Una GPU da 80 GB non è una voce di costo che puoi spegnere in una domenica tranquilla: anche a traffico zero stai pagando la scheda, e hai la responsabilità della curva di scaling, degli aggiornamenti dei driver, della pianificazione della capacità e dei turni di reperibilità per un percorso audio in tempo reale in cui una connessione persa è un cliente perso. Inoltre non c'è alcun fallback hosted su cui appoggiarti mentre ci arrivi — la riga inference-provider della card di Hugging Face dichiara chiaramente che il modello non è deployato da alcun provider di inferenza, quindi non esiste una versione pay-per-minute di questo checkpoint con cui prototipare. O lo self-hosti, o non lo usi. Quel lavoro è invisibile nel confronto al minuto e molto visibile in un piano di assunzioni.
L'ibrido che la maggior parte dei team dovrebbe davvero considerare
L'impostazione che rende questa decisione gestibile è che i due modelli non devono per forza essere una scelta binaria. Un agente vocale ha in genere un livello vocale e un livello di ragionamento, ed è nel livello di ragionamento che risiede la flessibilità.
GPT-Live-1 è costruito così di proposito. Il suo livello vocale mantiene viva la conversazione mentre il pensiero viene delegato tramite la Responses API a un normale modello testuale: l'esempio WebRTC pubblicato da OpenAI collega quel backend a GPT-5.6 Terra. Quella metà del tuo stack è una normale chiamata API, con prezzo per token e una reale libertà di scelta tra fornitori. GPT-5.6 Terra è servito tramite OrcaRouter a 2,00 $ per milione di token in input e 12,00 $ per milione in output, con una finestra di contesto da 1M di token e con entrambi gli endpoint /v1/chat/completions e /v1/responses esposti, affiancato da circa altri 190 modelli raggiungibili con una singola chiave.
Questo è particolarmente importante per un progetto di self-hosting perché cambia il profilo di rischio. Se avvii Nemotron VoiceChat 11B e non regge il tuo traffico, la parte vocale è un costo GPU irrecuperabile — ma la parte di ragionamento può essere spostata, sottoposta a failover o suddivisa tra un modello economico per i turni di routine e uno potente per le escalation senza toccare affatto il percorso audio. Il failover automatico tra provider upstream è la differenza tra un pomeriggio no e un trimestre no quando una dipendenza da singola fonte va giù.
Nota chiaramente ciò che è e non è disponibile dove: né GPT-Live-1 né Nemotron VoiceChat 11B sono serviti da OrcaRouter. Entrambi provengono dalla propria origine — l'endpoint Live Sessions di OpenAI in un caso, la tua GPU nell'altro. La leva del routing è interamente a valle dell'audio.

Su quale basarsi
• Scegli GPT-Live-1 se vuoi rilasciare questo trimestre, se ti serve più di una voce, se le tue conversazioni durano abitualmente più di due minuti di contesto continuo, o se il volume non è ancora abbastanza alto da giustificare una GPU che comporta costi anche quando è inattiva.
• Scegli NVIDIA Nemotron VoiceChat 11B se utilizzi già GPU da 80 GB, se hai bisogno di un'alternanza di turno inferiore a 500 ms basata su prove anziché su asserzioni, se hai bisogno che l'audio rimanga all'interno della tua infrastruttura per motivi di residenza dei dati, o se hai un volume di chiamate tale per cui il contatore al minuto dell'API rappresenta la voce più consistente in fattura.
• Prototipa sull'API e fai benchmark del checkpoint. La decisione dipende da un unico numero non pubblicato — sessioni simultanee per scheda da 80 GB — e l'unico modo per averlo è misurarlo sul tuo specifico profilo di traffico. È una settimana di lavoro, ed è la differenza tra una decisione infrastrutturale difendibile e una supposizione travestita da tale.
