
GPT-Live-1 vs NVIDIA Nemotron VoiceChat 11B: Een rekening per minuut of een 80GB-GPU
- deepseekNIEUWDeepSeek: DeepSeek V4.1 Flash2026-09-10$0.15 / $0.60 per 1 mln tokens
- openaiNIEUWOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleNIEUWGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenNIEUWQwen: Qwen3.8 Max (0902)2026-09-0240Intelligentie72Coderen
- anthropicNIEUWAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 per 1 mln tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligentie72Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligentie78Coderen
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligentie69Coderen
De keuze tussen GPT-Live-1 en NVIDIA Nemotron VoiceChat 11B is geen keuze tussen twee spraakmodellen. Het is een keuze tussen twee bedrijfsmodellen die spraakmodellen als een kostuum dragen. GPT-Live-1 is een gehoste API die OpenAI op 10 september 2026 voor ontwikkelaars toegankelijk maakte, gefactureerd tegen $0,05 per minuut audio, zonder dat er hardware van u bij betrokken is. NVIDIA Nemotron VoiceChat 11B — gepubliceerd als NVIDIA-NemotronLabs-VoiceChat-11B, met een NGC-container van 21 juli 2026 en een Hugging Face-checkpoint ernaast — is een open-weights full-duplex spraakmodel met 11 miljard parameters dat niet zal draaien op minder dan een GPU van 80 GB. Een van deze kost u geld per gespreksminuut; de andere kost u geld of er nu iemand belt of niet.
Het break-evenpunt is eenvoudiger dan de leverancierspresentaties doen vermoeden.
Begin met het ene cijfer waarover beide partijen het eens zijn. GPT-Live-1 tegen $0,05 per minuut kost $3,00 voor een uur continu open lijn. Dat is de prijs van één altijd-aan spraakgesprek.
Bereken nu wat het alternatief kost. Nemotron VoiceChat 11B heeft een GPU met minstens 80 GB VRAM nodig — een A100, H100, H200, B100, B200 of een kaart uit de RTX 6000-klasse, op Linux. Zo'n kaart huren op de open markt kost enkele dollars per uur, aan de lage kant, en hem bezitten komt, rekening houdend met de benuttingsgraad, op een vergelijkbaar bedrag uit. Een enkele continu actieve spraaklijn is dus ongeveer kostenneutraal: de gehuurde GPU kost ongeveer hetzelfde als wat de API kost, nog voordat je hebt betaald voor iets dat erop draait.
Dat is de verkeerde vergelijking, en het is de vergelijking waarbij de meeste build-vs-buy-artikelen blijven steken. De juiste vergelijking is per GPU, niet per lijn, en ze draait om een getal dat NVIDIA niet heeft gepubliceerd.
• GPT-Live-1 op een Tier 1-account — 25 gelijktijdige sessies, wat $1,25 per minuut is, of $75 per uur, wanneer alle 25 lijnen live zijn
• Nemotron VoiceChat 11B op één GPU van 80 GB — zoveel gelijktijdige sessies als een 11B hybride Mamba/Transformer-model in 80 GB kwijt kan, tegen ongeveer de huurprijs van de kaart
Een 11B-model op een accelerator van 80 GB biedt heel wat speelruimte, en 80 GB is een vereiste die in de praktijk een hoop batchcapaciteit oplevert. Als één kaart zelfs zes gelijktijdige gesprekken aankan, is self-hosting bij volledige belasting dramatisch goedkoper dan de API. Als hij er anderhalve aankan, niet. Totdat iemand de gelijktijdigheid op echt verkeer heeft gebenchmarkt, is het eerlijke standpunt dat het break-evenpunt bij volume waarschijnlijk in het voordeel van self-hosting uitvalt en dat geen van beide leveranciers je het cijfer heeft gegeven om dat te bewijzen.

Waar het open model echt beter is, niet alleen maar goedkoper
De latentievergelijking verdient meer zorg dan de prijsvergelijking, omdat het open model op dit vlak het betere bewijs heeft.
• Latentie bij beurtwisseling — Nemotron VoiceChat 11B rapporteert 448 ms voor vlotte beurtwisseling op Full-Duplex-Bench 1.0, met 480 ms latentie voor onderbreken en beurt afstaan en een overnamepercentage van 1,00 bij onderbreking door de gebruiker. Het cijfer voor GPT-Live-1 is 0,8 seconde, een daling van 1,4, gerapporteerd door OpenAI.
Lees die twee cijfers naast elkaar, met de bronvermelding erbij, en het beeld keert om. De cijfers van NVIDIA komen uit een gepubliceerde, openbaar gespecificeerde benchmarksuite. Die van OpenAI komen van OpenAI, waarbij het nieuwe model tegen zijn eigen vorige generatie wordt afgezet, en zijn niet onafhankelijk gereproduceerd. Op basis van het beschikbare bewijs is het open-weightmodel meetbaar sneller op het punt dat een spraakagent menselijk laat aanvoelen, en het gehoste model is alleen volgens zijn eigen persmateriaal sneller.
NVIDIA claimt ook een primeur: Nemotron VoiceChat 11B wordt beschreven als het eerste open full-duplexmodel dat realtime tool-aanroepen tijdens een gesprek ondersteunt, met een afzonderlijk uitvoerkanaal en vooraf ingestelde wachtzinnen zodat de agent kan blijven praten terwijl hij op een externe API wacht. De modelkaart wordt geleverd met drie audiovoorbeelden die je uitnodigen om precies daarnaar te luisteren — natuurlijke beurtwisseling, beschreven als ongeveer 450 ms reactietijd, barge-in waarbij het model onmiddellijk wijkt, en tools die live midden in het gesprek worden aangeroepen. Die voorbeelden zijn van de leverancier en bevestigen het cijfer van 448 ms in plaats van het onafhankelijk te testen, maar het is tenminste hoorbaar bewijs dat aan een downloadbaar checkpoint is gekoppeld, in plaats van een getal in een lanceringsbericht. Dat is hetzelfde architectonische probleem dat GPT-Live-1 met delegatie oplost, maar dan anders beantwoord — het open model houdt zelf de lijn vast; het gehoste model geeft de taak aan een apart redeneermodel en laat de spraaklaag het gesprek gaande houden.
De overeenkomsten zijn even leerzaam als de verschillen. Beide werken full-duplex, wat betekent dat beide luisteren terwijl ze spreken in plaats van om de beurt. Beide ondersteunen onderbreking en barge-in. Beide zijn getraind op spraak op een schaal die de oudere cascadepijplijnen van ASR-dan-LLM-dan-TTS doet lijken op drie afzonderlijke producten die aan elkaar zijn vastgeschroefd — het checkpoint van NVIDIA omvatte ongeveer 550.000 uur spraak.

Wat je opgeeft, en het is niet alleen geld
Het eerste dat je opgeeft met het open model is de stem. De uitgebrachte checkpoint gebruikt één vaste stem, genaamd Aria, en ondersteunt geen stemklonen of een stemmenbibliotheek. GPT-Live-1 wordt geleverd met twaalf stemmen die verschillende accenten, dialecten en talen bestrijken, en OpenAI heeft ze speciaal voor dit model geremasterd. Als de stem van je product deel uitmaakt van zijn identiteit, of als je meerdere markten moet bedienen met verschillend klinkende agenten vanuit één deployment, dan is dit op zichzelf al bijna diskwalificerend — en het is de beperking die het minst zichtbaar is in een specificatievergelijking, omdat het lijkt op een aantal functies in plaats van een productbeslissing.
Het tweede dat je opgeeft, is de bovengrens aan context. Het model heeft een utterance-limiet uit de trainingsfase van ongeveer 142 seconden en een praktische beperking rond het vasthouden van meer dan ongeveer twee minuten audiocontext. Een telefoongesprek dat twintig minuten duurt, is voor deze checkpoint geen doorlopende context; het is een reeks segmenten die het omringende systeem moet beheren. Gehoste modellen vangen dat boekhoudwerk doorgaans voor je op.
Het derde is wat je ermee mag doen. De Hugging Face-modelkaart bevat de openmdw-1.1-licentie, terwijl sommige berichtgeving over de release het beschreef als alleen voor onderzoeksgebruik en de NGC-containerpagina de componenten positioneert als gereed voor commercieel of niet-commercieel gebruik. Drie bronnen, drie verschillende interpretaties, en alleen de licentietekst is bepalend. Dat soort discrepantie is typisch iets dat opduikt tijdens een juridische toets drie weken voor de lancering. Los het op voordat je bouwt, niet erna.
Het vierde is operations. Een GPU van 80 GB is geen kostenpost die je op een rustige zondag even uitzet: zelfs bij nul verkeer betaal je voor de kaart, en jij bent verantwoordelijk voor de opschalingscurve, de driver-upgrades, de capaciteitsplanning en het piketrooster voor een realtime-audiopad waarbij een weggevallen verbinding een weggelopen klant betekent. Er is ook geen gehoste fallback waarop je kunt terugvallen terwijl je daar naartoe werkt — de inferentieprovider-regel op de Hugging Face-kaart vermeldt duidelijk dat het model door geen enkele inferentieprovider is uitgerold, dus er is geen pay-per-minute-versie van deze checkpoint om mee te prototypen. Je host het zelf, of je gebruikt het niet. Dat werk is onzichtbaar in de vergelijking per minuut en zeer zichtbaar in een wervingsplan.
De hybride die de meeste teams eigenlijk zouden moeten overwegen
De insteek die deze beslissing hanteerbaar maakt, is dat de twee modellen niet binair hoeven te zijn. Een spraakagent heeft doorgaans een stemlaag en een redeneerlaag, en in de redeneerlaag zit de flexibiliteit.
GPT-Live-1 is met opzet zo gebouwd. De spraaklaag houdt het gesprek gaande, terwijl het denkwerk via de Responses API wordt gedelegeerd aan een gewoon tekstmodel — OpenAI's eigen gepubliceerde WebRTC-voorbeeld koppelt die backend aan GPT-5.6 Terra. Dat deel van je stack is een normale API-aanroep, geprijsd per token, met een echte keuze aan leveranciers. GPT-5.6 Terra wordt via OrcaRouter geleverd voor $2,00 per miljoen inputtokens en $12,00 per miljoen outputtokens, met een context van 1M tokens en zowel /v1/chat/completions als /v1/responses beschikbaar, naast ongeveer 190 andere modellen die met één sleutel bereikbaar zijn.
Dat is juist van belang voor een selfhostingproject, omdat het het risicoprofiel verandert. Als je Nemotron VoiceChat 11B opzet en het houdt geen stand onder je verkeer, dan zijn de kosten voor het spraakgedeelte verzonken GPU-kosten — maar het redeneergedeelte kan worden verplaatst, een failover ondergaan of worden opgesplitst tussen een goedkoop model voor routinebeurten en een sterk model voor escalaties, zonder het audiopad überhaupt aan te raken. Automatische failover tussen upstreamproviders is het verschil tussen een slechte middag en een slecht kwartaal wanneer een afhankelijkheid van één enkele bron uitvalt.
Geef duidelijk aan wat waar wel en niet beschikbaar is: noch GPT-Live-1 noch Nemotron VoiceChat 11B wordt door OrcaRouter geserveerd. Beide komen uit hun eigen oorsprong — in het ene geval het Live Sessions-endpoint van OpenAI, in het andere je eigen GPU. De routeringsinvloed ligt volledig stroomafwaarts van de audio.

Op welke bouwen we voort?
• Kies GPT-Live-1 als u dit kwartaal wilt uitbrengen, als u meer dan één stem nodig hebt, als uw gesprekken gewoonlijk langer dan twee minuten aan doorlopende context duren, of als het volume nog niet hoog genoeg is om een GPU te rechtvaardigen die kosten in rekening brengt terwijl hij inactief is.
• Kies NVIDIA Nemotron VoiceChat 11B als je al 80GB-GPU's draait, als je sub-500 ms beurtwisseling nodig hebt op basis van bewijs in plaats van bewering, als je de audio om redenen van dataresidentie binnen je eigen infrastructuur moet houden, of als je een gespreksvolume hebt waarbij de per-minuutmeter van de API de grootste post op de factuur is.
• Maak een prototype op de API en benchmark de checkpoint. De beslissing hangt af van één ongepubliceerd getal — gelijktijdige sessies per 80GB-kaart — en de enige manier om het te hebben is het te meten op je eigen verkeersprofiel. Dat is een week werk, en het is het verschil tussen een verdedigbare infrastructuurbeslissing en een gok die zich voordoet als een verdedigbare infrastructuurbeslissing.
