Hero-titelkaart voor 'GPT-Live-1 vs VoxCPM2', met als ondertitel 'Een gehuurd gesprek of een GPU die je bezit', met een badge met de tekst 'De ene is full-duplex, de andere is tekst-naar-spraak - verschillende taken' en drie kaarten: 'GPT-Live-1 — $0,05 per spraakminuut, alleen API, niets te installeren', 'VoxCPM2 — Apache-2.0, 2 miljard parameters, ~8 GB VRAM, geen enkele inferentieprovider implementeert het' en 'Doorvoer bij self-hosting — ongeveer 7,7 uur audio per GPU-uur bij RTF 0,13, 393.079 downloads in de afgelopen 30 dagen', boven een voetbalk met de tekst 'VoxCPM2-benchmarks gerapporteerd door OpenBMB; stemcijfers van GPT-Live-1 gerapporteerd door OpenAI en niet gereproduceerd.' Het OrcaRouter-logo is rechtsonder samengesteld.
Engineering & Research

GPT-Live-1 vs VoxCPM2: de een kost $0,05 per minuut, de ander een GPU van 24 GB

Auteur

Elias Hawthorne

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

De zuiverste manier om GPT-Live-1 met VoxCPM2 te vergelijken, is op te merken dat ze alleen maar op concurrenten lijken totdat je de hardware in cijfers vat. GPT-Live-1 is het full-duplex spraakmodel van Ope​nAI, sinds 10 september 2026 in de API voor $0,05 per minuut spraak, zonder iets te installeren. VoxCPM2 is het text-to-speechmodel van OpenBMB met 2 miljard parameters en open gewichten, uitgebracht onder Apache 2.0 in april 2026, dat op ongeveer 8 GB VRAM draait en niet door enige inferentieprovider wordt aangeboden — dus als je het wilt, bezit je de machine. De een is een gesprek dat je per seconde huurt; de ander is een synthesizer die je zelf bedient. De vraag is niet welke beter is, maar welke jouw werklast daadwerkelijk kan opvangen.

A two-column scoreboard titled 'GPT-Live-1 vs VoxCPM2 - the scoreboard'. Left column GPT-Live-1: 'Job: full-duplex conversation', 'Access: hosted API, no weights', 'Price: $0.05 per voice minute', 'Independent score: 69.8% on the AA Speech to Speech Index', 'Hardware you need: none', 'Catch: delegated reasoning bills separately'. Right column VoxCPM2: 'Job: text-to-speech', 'Access: Apache-2.0 weights, self-host only', 'Price: $0 per call plus a GPU', 'Independent score: none, OpenBMB benchmarks only and contested by third-party runs', 'Hardware you need: ~8 GB VRAM, 22 GB peak when serving', 'Catch: no inference provider deploys it'. Footer: 'GPT-Live-1 voice figures OpenAI-reported; VoxCPM2 figures are the model card's own.'

Twee modellen, twee taken, elk één eerlijke specregel

• Functie — GPT-Live-1 voert een gesprek: het luistert en spreekt tegelijkertijd, neemt beurten, gaat om met onderbrekingen en backchannels, en levert transcripties op. VoxCPM2 zet tekst om in spraak. Het hoort nooit iets.

• Toegang — GPT-Live-1 wordt gehost en is gesloten, één model-ID achter het Live Sessions-endpoint, waarbij het gepubliceerde integratievoorbeeld via WebRTC draait. VoxCPM2 is een downloadbaar checkpoint op Hugging Face en ModelScope, Apache 2.0, gratis voor commercieel gebruik.

• Prijs — GPT-Live-1 kost $0,05 per spraakminuut, per seconde gefactureerd, waarbij de delegatie-backend apart wordt gemeten. VoxCPM2 kost $0 per aanroep plus een GPU, en open-sourcehosting is het volledige kostenmodel.

• Voetafdruk — GPT-Live-1 heeft geen hardware van jou nodig. VoxCPM2 heeft ongeveer 8 GB VRAM nodig (6–8 GB bij Q4), Python 3.10+, PyTorch 2.5+ en CUDA 12+.

• Benchmarks — elk spraakcijfer voor GPT-Live-1 is van Ope​nAI, niet gereproduceerd; de enige onafhankelijke ranglijst zet het op de zevende plaats van elf. De gepubliceerde cijfers van VoxCPM2 zijn van OpenBMB, en de onafhankelijke metingen die bestaan over zijn meertalige claims wijzen de andere kant op.

De 24 GB-vraag, geprijsd

De serveercijfers van VoxCPM2 zijn bepalend voor de vraag of zelf hosten een hobby is of een architectuur. Op één RTX 4090 draait het model met een real-time factor van ongeveer 0,30 in gewone PyTorch en ongeveer 0,13 met het Nano-VLLM-pad — wat neerkomt op ruwweg 7,7 uur gegenereerde audio per uur GPU-tijd in de snellere configuratie. Dat zijn de cijfers van de modelkaart zelf, geen externe meting; een onafhankelijk serveerrecept dat is gevalideerd op een 4090 met CUDA 12.9 meldt steady-state real-time factors van ongeveer 0,120 voor zero-shot-synthese en 0,139 voor cloning, met een piekgeheugengebruik van de GPU van bijna 22 GB van de 24 GB. Beide sets zijn steady-state, niet cold-start — het eerste verzoek in een vers proces is veel trager, en dat is het cijfer dat mensen aanhalen wanneer ze zeggen dat het model onbruikbaar is.

Zet dat naast de API. GPT-Live-1 kost bij $0,05 per minuut $3,00 voor een uur continu gesprek. Een kaart van 24 GB die je op de open markt huurt, zit in de lage enkele dollars per uur, en er zelf een bezitten amortiseert naar iets vergelijkbaars zodra je de bezettingsgraad meerekent. De vergelijking komt dus uit waar dit soort vergelijkingen meestal uitkomen, met één ongemakkelijke asymmetrie: de GPU-rekening komt toch wel, of er nu iemand met je product praat of niet, en de API-rekening schaalt naar nul op een rustige dag en naar vijf cijfers op een drukke. Batchsynthese van een vaste catalogus past perfect bij de GPU. Een altijd actieve telefoonlijn past perfect bij de meter.

Wat VoxCPM2 doet wat geen enkele andere open source doet

De reden dat VoxCPM2 zoveel aandacht verdient, is niet dat het benchmarks wint — dat doet het meestal niet — maar dat het een stem ontwerpt op basis van een tekstbeschrijving, zonder enige referentie-audio. Dat is een werkelijk nieuwe capaciteit in open weights, en het verandert de workflow voor iedereen die een stem nodig heeft die nog niet bestaat: beoordeel hem in proza, itereer in proza, en beslis pas daarna of je wilt klonen. Daar bovenop stapelt het 30 talen plus negen Chinese dialecten, 48 kHz-uitvoer via een ingebouwde superresolutiestap, en fine-tuning met slechts 5–10 minuten audio.

De bewijsbasis is dunner dan de functielijst. OpenBMB's eigen rapport geeft een Engels woordfoutpercentage van 1,84% en een Chinees karakterfoutpercentage van 0,97%, en een gemiddelde fout van 1,68% over 30 talen, gemeten op zijn eigen set van 500 uitingen per taal en gescoord door het model van een andere leverancier. Waar een onafhankelijke test bestaat, is de kloof groot: op MiniM​ax' meertalige testset gescoord met Whisper-large-v3 komt Hindi uit op 19,70 en Arabisch op 13,05 — vele malen slechter dan de zelfgerapporteerde cijfers. OpenBMB waarschuwt ook dat stemontwerp en stijlbeheer variabele resultaten tussen runs opleveren en suggereert om één tot drie keer te genereren om de gewenste output te krijgen, wat een stille manier is om te zeggen dat de kosten per aanroep voor een bruikbaar resultaat niet één aanroep bedragen.

De integratiebelasting die niemand in de vergelijking meeneemt

Eén onglamoureus detail bepaalt of VoxCPM2 een week werk is of een maand. De Hugging Face-repository is getagd als voxcpm in plaats van transformers, wat betekent dat de bibliotheek waarmee bijna al het andere op die site wordt geladen, dit model niet kan laden. De pull request om dat op te lossen werd geopend op 4 augustus 2026 en was nog niet gemerged toen we voor het laatst keken. Pull requests om het aan andere serving-stacks toe te voegen zijn wel gemerged, en de adoptie staat niet ter discussie: 393.079 downloads in de afgelopen dertig dagen op het moment van deze vastlegging, met 27 adapters, 30 finetunes, 12 quantisaties en 100 Spaces die bovenop de checkpoint zijn gebouwd.

A screenshot of the Hugging Face model card for openbmb/VoxCPM2, captured September 2026: 'VoxCPM2 is a tokenizer-free, diffusion autoregressive Text-to-Speech model - 2B parameters, 30 languages, 48kHz audio output, trained on over 2 million hours of multilingual speech data', with 1.6k likes, 4.95k followers, 393,079 downloads last month, 2B params in BF16, 27 adapter models, 30 finetunes, 12 quantisations, and an Inference Providers panel reading 'This model isn't deployed by any Inference Provider.'

De equivalente kostenpost van GPT-Live-1 is een transport-rewrite. De sessies zijn gebouwd rond een live verbinding in plaats van een request-response-audio-endpoint, en de facturering met twee meters betekent dat elke gedelegeerde reasoning-aanroep, toolaanroep en webzoekopdracht wordt belast tegen de eigen tarieven van het backendmodel, bovenop de spraakminuut. Teams die migreren van een realtime-integratie met tokenmeting moeten de overstap begroten als een engineeringtaak, niet als een model-ID-wissel.

Waar een routeringslaag daadwerkelijk helpt

OrcaRouter ondersteunt noch GPT-Live-1 noch VoxCPM2, en het is de moeite waard dat ronduit te zeggen in plaats van de rest van deze sectie het tegendeel te laten impliceren. De spraaklaag van GPT-Live-1 zit achter Ope​nAI's eigen endpoint; VoxCPM2 heeft helemaal geen gehoste provider. Geen van beide kun je met onze sleutel aanroepen.

De reden dat de routeringsvraag nog steeds opduikt, is dat beide modellen zich aan de rand van een pipeline bevinden waarvan het midden tekst is. Een VoxCPM2-implementatie reageert meestal op iets — een scriptgenerator, een vertaalstap, een tekstnormalisator, een dialoogmodel dat bepaalt wat er hierna wordt uitgesproken — en dat zijn gewone modelaanroepen. Een GPT-Live-1-sessie delegeert zijn denkwerk aan een backendmodel dat in de sessieconfiguratie wordt genoemd, en in Ope​nAI's eigen documentatie is die backend GPT-5.6 Terra, dat beschikbaar is via OrcaRouter tegen de lijstprijs van Ope​nAI. Clientdelegatie gaat nog verder: je eigen applicatie mag de backend leveren, wat betekent dat het model achter de stem elk endpoint kan zijn dat jij beheert. Ongeveer 190 modellen van elf upstreamproviders zitten achter één sleutel tegen lijstprijs zonder markup — dus wanneer een provider een prijs verlaagt, is die verlaging hier dezelfde dag live in plaats van bij verlenging — met automatische failover tussen providers en een routerings-DSL om meerdere modellen in één aanroep samen te stellen. Goedkope verzekering voor de helft van de stack die het vaakst verandert.

Eén waarschuwing hoort in deze sectie thuis in plaats van erin begraven te worden, want het is het detail dat de GPT-Live-1-helft van deze vergelijking minder uitgekristalliseerd maakt dan de leveranciersbenchmarks doen vermoeden. Op de onafhankelijke Artificial Analysis Speech to Speech Index scoort GPT-Live-1 69,8% — de zevende van elf, achter GPT-Realtime-2.1 met 73,9% en Gr​ok Voice Think Fast 2.0 met 79,0%. Het model is het goedkoopste op die ranglijst per uur inputaudio, voor $4,42, en het is niet het beste. Houd rekening met de mogelijkheid dat de spraaklaag waarop je standaardiseert niet de laag is die je uiteindelijk houdt.

A screenshot of the Artificial Analysis Speech to Speech Index chart updated September 2026: Grok Voice Think Fast 2.0 79.0%, GPT-Realtime-2.1 73.9%, GPT-Realtime-2 73.6%, Grok Voice Think Fast 72.3%, Gemini 3.1 Flash Live 71.5%, GPT-Live-1 mini 70.3%, GPT-Live-1 69.8%, Qwen-Audio-Omni 66.8%, RealTime Omni 64.2%, Qwen 3.x Omni 63.9%, Gemini 2.5 Flash 52.6%, with a cost chart placing GPT-Live-1 at $4.42 and GPT-Realtime-2.1 at $10.75 per hour of input audio.

Welke, waarvoor?

Kies VoxCPM2 als de tekst er is voordat de audio er is. Vertelling, audioboeken, nasynchronisatie, toegankelijkheid, stemlijnen in games, een product dat een stem nodig heeft die nog niemand heeft ingesproken — en vooral elke werklast waarbij het volume hoog en voorspelbaar is en een vaste kapitaalkostenpost rechtvaardigt. Accepteer dat je het zelf zult draaien, dat de tooling eromheen nog niet is uitgekristalliseerd, en dat de meertalige kwaliteitsclaims je eigen luistertest verdienen voordat ze bij een klant terechtkomen.

Kies GPT-Live-1 als er een persoon aan de andere kant is. Spraakagenten, telefonische ondersteuning, intakeflows, alles waarbij het model in realtime moet beslissen of de mens klaar is met praten. Betaal het tarief per minuut voor het voorrecht niet zelf eigenaar van het probleem te zijn, en begroot de gedelegeerde backend als een aparte begrotingspost, want daar wordt het gesprek goedkoop of duur.

De fout is ze als alternatieven in een bake-off te behandelen. Het zijn twee lagen van hetzelfde product voor de meeste teams die beide nodig hebben, en het enige echt verkeerde antwoord is voor de zelfgehoste variant kiezen omdat de licentie gratis zegt, zonder de GPU te beprijzen die dat waar maakt.