Hjältetitelkort för "GPT-Live-1 vs VoxCPM2", med undertexten "Ett hyrt samtal eller en GPU du äger", med en badge där det står "En är full duplex, en är text-till-tal – olika uppgifter" och tre kort: "GPT-Live-1 — 0,05 USD per röstminut, endast API, inget att installera", "VoxCPM2 — Apache-2.0, 2B parametrar, ~8 GB VRAM, ingen inferensleverantör driftsätter den" och "Genomströmning vid egen hosting — cirka 7,7 timmars ljud per GPU-timme vid RTF 0,13, 393 079 nedladdningar de senaste 30 dagarna", ovanför en sidfotsremsa med texten "VoxCPM2-benchmarks OpenBMB-rapporterade; GPT-Live-1-röstsiffror OpenAI-rapporterade och ej reproducerade." OrcaRouter-logotypen är sammansatt nere till höger.
Engineering & Research

GPT-Live-1 vs VoxCPM2: Den ena kostar 0,05 dollar per minut, den andra kostar ett 24 GB-grafikkort

Författare

Elias Hawthorne

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Det renaste sättet att jämföra GPT-Live-1 med VoxCPM2 är att lägga märke till att de bara ser ut som konkurrenter tills man sätter en siffra på hårdvaran. GPT-Live-1 är OpenAI:s full-duplex-röstmodell, i API:et sedan den 10 september 2026 för $0.05 per minut röst, utan något att installera. VoxCPM2 är OpenBMB:s text-till-tal-modell med öppna vikter och 2 miljarder parametrar, släppt under Apache 2.0 i april 2026, som körs på cirka 8 GB VRAM och inte driftsätts av någon inferensleverantör – så om du vill ha den äger du maskinen. Den ena är ett samtal du hyr per sekund; den andra är en syntetiserare du sköter. Frågan är inte vilken som är bättre, utan vilken din arbetsbelastning faktiskt kan absorbera.

A two-column scoreboard titled 'GPT-Live-1 vs VoxCPM2 - the scoreboard'. Left column GPT-Live-1: 'Job: full-duplex conversation', 'Access: hosted API, no weights', 'Price: $0.05 per voice minute', 'Independent score: 69.8% on the AA Speech to Speech Index', 'Hardware you need: none', 'Catch: delegated reasoning bills separately'. Right column VoxCPM2: 'Job: text-to-speech', 'Access: Apache-2.0 weights, self-host only', 'Price: $0 per call plus a GPU', 'Independent score: none, OpenBMB benchmarks only and contested by third-party runs', 'Hardware you need: ~8 GB VRAM, 22 GB peak when serving', 'Catch: no inference provider deploys it'. Footer: 'GPT-Live-1 voice figures OpenAI-reported; VoxCPM2 figures are the model card's own.'

Två modeller, två jobb, en ärlig specifikationsrad var

• Funktion — GPT-Live-1 håller en konversation: den lyssnar och talar samtidigt, turas om, hanterar avbrott och backchannels samt returnerar transkriptioner. VoxCPM2 omvandlar text till tal. Den hör aldrig någonting.

• Åtkomst — GPT-Live-1 hostas och är sluten, ett modell-ID bakom Live Sessions-slutpunkten, med det publicerade integrationsexemplet som körs över WebRTC. VoxCPM2 är en nedladdningsbar checkpoint på Hugging Face och ModelScope, Apache 2.0, gratis för kommersiellt bruk.

• Pris — GPT-Live-1 kostar 0,05 USD per röstminut, debiteras per sekund, och delegeringsbackendens förbrukning mäts separat. VoxCPM2 kostar 0 USD per anrop plus en GPU, och hosting med öppen källkod är hela kostnadsmodellen.

• Fotavtryck — GPT-Live-1 behöver ingen hårdvara från dig. VoxCPM2 behöver ungefär 8 GB VRAM (6–8 GB vid Q4), Python 3.10+, PyTorch 2.5+ och CUDA 12+.

• Benchmarks — varje röstsiffra för GPT-Live-1 är OpenAI:s och har inte reproducerats; den enda oberoende resultattavlan placerar den som sjua av elva. VoxCPM2:s publicerade siffror är OpenBMB:s, och de oberoende mätningar som finns av dess flerspråkiga påståenden pekar i motsatt riktning.

24 GB-frågan, prissatt

VoxCPM2:s serving-siffror är de som avgör huruvida självhosting är en hobby eller en arkitektur. På en enda RTX 4090 kör modellen med en realtidsfaktor på omkring 0,30 i ren PyTorch och omkring 0,13 med Nano-VLLM-vägen – vilket innebär ungefär 7,7 timmars genererad ljud per timme GPU-tid i den snabbare konfigurationen. Det är modellkortets egna siffror snarare än en extern mätning; ett oberoende serving-recept validerat på en 4090 med CUDA 12.9 rapporterar stabila realtidsfaktorer på omkring 0,120 för zero-shot-syntes och 0,139 för kloning, med högsta GPU-minne nära 22 GB av 24 GB. Båda uppsättningarna är stabila tillstånd, inte kallstart – den första förfrågan i en ny process är mycket långsammare, och det är den siffran folk citerar när de säger att modellen är oanvändbar.

Sätt det bredvid API:et. GPT-Live-1 för 0,05 dollar per minut är 3,00 dollar för en timmes oavbruten konversation. Ett 24 GB-kort som hyrs på den öppna marknaden ligger på en låg ensiffrig dollarnivå per timme, och att äga ett skrivs av till ungefär samma sak när utnyttjandegraden räknas in. Så jämförelsen landar där sådana här jämförelser brukar landa, med en obekväm asymmetri: GPU-räkningen kommer oavsett om någon pratar med din produkt eller inte, och API-räkningen skalas till noll en lugn dag och till ett femsiffrigt belopp en hektisk dag. Batchsyntes av en fast katalog är en perfekt matchning för GPU:n. En ständigt påslagen telefonlinje är en perfekt matchning för mätaren.

Vad VoxCPM2 gör som inget annat öppet gör

Anledningen till att VoxCPM2 förtjänar så här mycket uppmärksamhet är inte att den vinner benchmarktester – det gör den mestadels inte – utan att den designar en röst utifrån en textbeskrivning helt utan referensljud. Det är en genuint ny förmåga inom öppna vikter, och det förändrar arbetsflödet för alla som behöver en röst som ännu inte finns: provlyssna på den i prosa, iterera i prosa och bestäm först därefter om den ska klonas. Runt detta staplar den 30 språk plus nio kinesiska dialekter, 48 kHz-utdata via ett inbyggt superupplösningssteg och finjustering med så lite som 5–10 minuters ljud.

Bevisunderlaget är tunnare än funktionslistan. OpenBMB:s egen rapport anger en ordfelsfrekvens på 1,84 % för engelska och en teckenfelsfrekvens på 0,97 % för kinesiska, samt ett genomsnittligt fel på 1,68 % över 30 språk, uppmätt på dess egen uppsättning med 500 yttranden per språk och poängsatt av en annan leverantörs modell. Där ett oberoende test finns är gapet stort: på MiniMaxs flerspråkiga testuppsättning, poängsatt med Whisper-large-v3, hamnar hindi på 19,70 och arabiska på 13,05 – mångdubbelt sämre än de självrapporterade siffrorna. OpenBMB varnar också för att röstdesign och stilkontroll ger varierande resultat mellan körningar och föreslår att man genererar en till tre gånger för att få det resultat man vill ha, vilket är ett tyst sätt att säga att kostnaden per anrop för ett användbart resultat inte är ett anrop.

Integrationsskatten som ingen tar med i jämförelsen

En oglamorös detalj avgör om VoxCPM2 är en veckas arbete eller en månad. Dess Hugging Face-repositorium är taggat voxcpm i stället för transformers, vilket innebär att biblioteket som nästan allt annat på den sajten laddas med inte kan ladda den här modellen. Pull-förfrågan för att åtgärda detta öppnades den 4 augusti 2026 och hade inte landat när vi senast kontrollerade. Pull-förfrågningar för att lägga till den i andra serving-stackar har landat, och användningen är inte ifrågasatt: 393 079 nedladdningar under de senaste trettio dagarna vid denna mätning, med 27 adaptrar, 30 finetunes, 12 kvantiseringar och 100 Spaces byggda ovanpå checkpointen.

A screenshot of the Hugging Face model card for openbmb/VoxCPM2, captured September 2026: 'VoxCPM2 is a tokenizer-free, diffusion autoregressive Text-to-Speech model - 2B parameters, 30 languages, 48kHz audio output, trained on over 2 million hours of multilingual speech data', with 1.6k likes, 4.95k followers, 393,079 downloads last month, 2B params in BF16, 27 adapter models, 30 finetunes, 12 quantisations, and an Inference Providers panel reading 'This model isn't deployed by any Inference Provider.'

GPT-Live-1:s motsvarande kostnad är en omskrivning av transporten. Dess sessioner är uppbyggda kring en liveanslutning i stället för en ljudändpunkt för förfrågan-svar, och faktureringen med två mätare innebär att varje delegerat resonemangsanrop, verktygsanrop och webbsökning debiteras enligt backendmodellens egna priser utöver röstminuten. Team som migrerar från en realtidsintegration med tokenmätning bör budgetera flytten som en ingenjörsuppgift, inte som ett byte av modell-ID.

När ett routinglager faktiskt hjälper

OrcaRouter har varken GPT-Live-1 eller VoxCPM2, och det är värt att säga det tydligt i stället för att låta resten av det här avsnittet antyda något annat. Röstlagret i GPT-Live-1 ligger bakom OpenAI:s egen endpoint; VoxCPM2 har ingen hostad leverantör alls. Inget av dem går att anropa med vår nyckel.

Anledningen till att routeringsfrågan fortfarande dyker upp är att båda modellerna sitter i kanten av en pipeline vars mitt är text. En VoxCPM2-distribution svarar vanligtvis mot något — en skriptgenerator, ett översättningssteg, en textnormaliserare, en dialogmodell som avgör vad som ska sägas härnäst — och det är vanliga modellanrop. En GPT-Live-1-session delegerar sitt tänkande till en backendmodell som anges i sessionskonfigurationen, och i Ope​nAI:s egen dokumentation är den backenden GPT-5.6 Terra, som är tillgänglig via OrcaRouter till Ope​nAI:s listpris. Klientdelegering går ännu längre och låter din egen applikation tillhandahålla backend, vilket innebär att modellen bakom rösten kan vara vilken slutpunkt du än kontrollerar. Ungefär 190 modeller från elva uppströmsleverantörer ligger bakom en nyckel till listpris utan påslag — så när en leverantör sänker ett pris är prissänkningen live här samma dag i stället för vid förnyelse — med automatisk failover mellan leverantörer och ett routing-DSL för att kombinera flera modeller till ett anrop. Billig försäkring för den halva av stacken som förändras oftast.

En varning hör hemma i det här avsnittet i stället för att begravas i det, eftersom det är detaljen som gör GPT-Live-1-halvan av den här jämförelsen mindre avgjord än vad leverantörens benchmarkresultat antyder. I det oberoende Artificial Analysis Speech to Speech Index får GPT-Live-1 69,8 % – sjunde plats av elva, efter GPT-Realtime-2.1 med 73,9 % och Grok Voice Think Fast 2.0 med 79,0 %. Modellen är det billigaste på den tavlan per timme inmatat ljud, för $4.42, och den är inte bäst. Ta höjd för möjligheten att det röstlager du standardiserar på inte är det du behåller.

A screenshot of the Artificial Analysis Speech to Speech Index chart updated September 2026: Grok Voice Think Fast 2.0 79.0%, GPT-Realtime-2.1 73.9%, GPT-Realtime-2 73.6%, Grok Voice Think Fast 72.3%, Gemini 3.1 Flash Live 71.5%, GPT-Live-1 mini 70.3%, GPT-Live-1 69.8%, Qwen-Audio-Omni 66.8%, RealTime Omni 64.2%, Qwen 3.x Omni 63.9%, Gemini 2.5 Flash 52.6%, with a cost chart placing GPT-Live-1 at $4.42 and GPT-Realtime-2.1 at $10.75 per hour of input audio.

Vilken, för vad?

Ta VoxCPM2 om texten finns innan ljudet gör det. Berättarröst, ljudböcker, dubbning, tillgänglighet, röstlinjer i spel, en produkt som behöver en röst som ingen har spelat in ännu – och särskilt alla arbetsbelastningar där volymen är hög, förutsägbar och värd en fast kapitalkostnad. Acceptera att du kommer att köra den själv, att verktygen runt omkring den fortfarande håller på att sätta sig och att påståendena om flerspråkig kvalitet förtjänar ditt eget lyssningstest innan de når en kund.

Välj GPT-Live-1 om det är en person i andra änden. Röstagenter, telefonsupport, intagsflöden, allt där modellen måste avgöra i realtid om människan har talat klart. Betala minutpriset för privilegiet att inte äga problemet, och budgetera den delegerade backend som en separat post, eftersom det är där samtalet blir billigt eller dyrt.

Misstaget är att behandla dem som alternativ i en direkt jämförelse. De är två lager av samma produkt för de flesta team som behöver båda, och det enda verkligt felaktiga svaret är att välja den självhostade eftersom licensen säger gratis utan att räkna in GPU:n som gör det sant.