
GPT-Live-1 vs VoxCPM2: Den ena kostar 0,05 dollar per minut, den andra kostar ett 24 GB-grafikkort
- deepseekNYDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- openaiNYOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- googleNYGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- qwenNYQwen: Qwen3.8 Max (0902)2026-09-0240Intelligens72Kodning
- anthropicNYAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 per 1M tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0540Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligens72Kodning
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligens69Kodning
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligens78Kodning
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligens69Kodning
Det renaste sättet att jämföra GPT-Live-1 med VoxCPM2 är att lägga märke till att de bara ser ut som konkurrenter tills man sätter en siffra på hårdvaran. GPT-Live-1 är OpenAI:s full-duplex-röstmodell, i API:et sedan den 10 september 2026 för $0.05 per minut röst, utan något att installera. VoxCPM2 är OpenBMB:s text-till-tal-modell med öppna vikter och 2 miljarder parametrar, släppt under Apache 2.0 i april 2026, som körs på cirka 8 GB VRAM och inte driftsätts av någon inferensleverantör – så om du vill ha den äger du maskinen. Den ena är ett samtal du hyr per sekund; den andra är en syntetiserare du sköter. Frågan är inte vilken som är bättre, utan vilken din arbetsbelastning faktiskt kan absorbera.

Två modeller, två jobb, en ärlig specifikationsrad var
• Funktion — GPT-Live-1 håller en konversation: den lyssnar och talar samtidigt, turas om, hanterar avbrott och backchannels samt returnerar transkriptioner. VoxCPM2 omvandlar text till tal. Den hör aldrig någonting.
• Åtkomst — GPT-Live-1 hostas och är sluten, ett modell-ID bakom Live Sessions-slutpunkten, med det publicerade integrationsexemplet som körs över WebRTC. VoxCPM2 är en nedladdningsbar checkpoint på Hugging Face och ModelScope, Apache 2.0, gratis för kommersiellt bruk.
• Pris — GPT-Live-1 kostar 0,05 USD per röstminut, debiteras per sekund, och delegeringsbackendens förbrukning mäts separat. VoxCPM2 kostar 0 USD per anrop plus en GPU, och hosting med öppen källkod är hela kostnadsmodellen.
• Fotavtryck — GPT-Live-1 behöver ingen hårdvara från dig. VoxCPM2 behöver ungefär 8 GB VRAM (6–8 GB vid Q4), Python 3.10+, PyTorch 2.5+ och CUDA 12+.
• Benchmarks — varje röstsiffra för GPT-Live-1 är OpenAI:s och har inte reproducerats; den enda oberoende resultattavlan placerar den som sjua av elva. VoxCPM2:s publicerade siffror är OpenBMB:s, och de oberoende mätningar som finns av dess flerspråkiga påståenden pekar i motsatt riktning.
24 GB-frågan, prissatt
VoxCPM2:s serving-siffror är de som avgör huruvida självhosting är en hobby eller en arkitektur. På en enda RTX 4090 kör modellen med en realtidsfaktor på omkring 0,30 i ren PyTorch och omkring 0,13 med Nano-VLLM-vägen – vilket innebär ungefär 7,7 timmars genererad ljud per timme GPU-tid i den snabbare konfigurationen. Det är modellkortets egna siffror snarare än en extern mätning; ett oberoende serving-recept validerat på en 4090 med CUDA 12.9 rapporterar stabila realtidsfaktorer på omkring 0,120 för zero-shot-syntes och 0,139 för kloning, med högsta GPU-minne nära 22 GB av 24 GB. Båda uppsättningarna är stabila tillstånd, inte kallstart – den första förfrågan i en ny process är mycket långsammare, och det är den siffran folk citerar när de säger att modellen är oanvändbar.
Sätt det bredvid API:et. GPT-Live-1 för 0,05 dollar per minut är 3,00 dollar för en timmes oavbruten konversation. Ett 24 GB-kort som hyrs på den öppna marknaden ligger på en låg ensiffrig dollarnivå per timme, och att äga ett skrivs av till ungefär samma sak när utnyttjandegraden räknas in. Så jämförelsen landar där sådana här jämförelser brukar landa, med en obekväm asymmetri: GPU-räkningen kommer oavsett om någon pratar med din produkt eller inte, och API-räkningen skalas till noll en lugn dag och till ett femsiffrigt belopp en hektisk dag. Batchsyntes av en fast katalog är en perfekt matchning för GPU:n. En ständigt påslagen telefonlinje är en perfekt matchning för mätaren.
Vad VoxCPM2 gör som inget annat öppet gör
Anledningen till att VoxCPM2 förtjänar så här mycket uppmärksamhet är inte att den vinner benchmarktester – det gör den mestadels inte – utan att den designar en röst utifrån en textbeskrivning helt utan referensljud. Det är en genuint ny förmåga inom öppna vikter, och det förändrar arbetsflödet för alla som behöver en röst som ännu inte finns: provlyssna på den i prosa, iterera i prosa och bestäm först därefter om den ska klonas. Runt detta staplar den 30 språk plus nio kinesiska dialekter, 48 kHz-utdata via ett inbyggt superupplösningssteg och finjustering med så lite som 5–10 minuters ljud.
Bevisunderlaget är tunnare än funktionslistan. OpenBMB:s egen rapport anger en ordfelsfrekvens på 1,84 % för engelska och en teckenfelsfrekvens på 0,97 % för kinesiska, samt ett genomsnittligt fel på 1,68 % över 30 språk, uppmätt på dess egen uppsättning med 500 yttranden per språk och poängsatt av en annan leverantörs modell. Där ett oberoende test finns är gapet stort: på MiniMaxs flerspråkiga testuppsättning, poängsatt med Whisper-large-v3, hamnar hindi på 19,70 och arabiska på 13,05 – mångdubbelt sämre än de självrapporterade siffrorna. OpenBMB varnar också för att röstdesign och stilkontroll ger varierande resultat mellan körningar och föreslår att man genererar en till tre gånger för att få det resultat man vill ha, vilket är ett tyst sätt att säga att kostnaden per anrop för ett användbart resultat inte är ett anrop.
Integrationsskatten som ingen tar med i jämförelsen
En oglamorös detalj avgör om VoxCPM2 är en veckas arbete eller en månad. Dess Hugging Face-repositorium är taggat voxcpm i stället för transformers, vilket innebär att biblioteket som nästan allt annat på den sajten laddas med inte kan ladda den här modellen. Pull-förfrågan för att åtgärda detta öppnades den 4 augusti 2026 och hade inte landat när vi senast kontrollerade. Pull-förfrågningar för att lägga till den i andra serving-stackar har landat, och användningen är inte ifrågasatt: 393 079 nedladdningar under de senaste trettio dagarna vid denna mätning, med 27 adaptrar, 30 finetunes, 12 kvantiseringar och 100 Spaces byggda ovanpå checkpointen.

GPT-Live-1:s motsvarande kostnad är en omskrivning av transporten. Dess sessioner är uppbyggda kring en liveanslutning i stället för en ljudändpunkt för förfrågan-svar, och faktureringen med två mätare innebär att varje delegerat resonemangsanrop, verktygsanrop och webbsökning debiteras enligt backendmodellens egna priser utöver röstminuten. Team som migrerar från en realtidsintegration med tokenmätning bör budgetera flytten som en ingenjörsuppgift, inte som ett byte av modell-ID.
När ett routinglager faktiskt hjälper
OrcaRouter har varken GPT-Live-1 eller VoxCPM2, och det är värt att säga det tydligt i stället för att låta resten av det här avsnittet antyda något annat. Röstlagret i GPT-Live-1 ligger bakom OpenAI:s egen endpoint; VoxCPM2 har ingen hostad leverantör alls. Inget av dem går att anropa med vår nyckel.
Anledningen till att routeringsfrågan fortfarande dyker upp är att båda modellerna sitter i kanten av en pipeline vars mitt är text. En VoxCPM2-distribution svarar vanligtvis mot något — en skriptgenerator, ett översättningssteg, en textnormaliserare, en dialogmodell som avgör vad som ska sägas härnäst — och det är vanliga modellanrop. En GPT-Live-1-session delegerar sitt tänkande till en backendmodell som anges i sessionskonfigurationen, och i OpenAI:s egen dokumentation är den backenden GPT-5.6 Terra, som är tillgänglig via OrcaRouter till OpenAI:s listpris. Klientdelegering går ännu längre och låter din egen applikation tillhandahålla backend, vilket innebär att modellen bakom rösten kan vara vilken slutpunkt du än kontrollerar. Ungefär 190 modeller från elva uppströmsleverantörer ligger bakom en nyckel till listpris utan påslag — så när en leverantör sänker ett pris är prissänkningen live här samma dag i stället för vid förnyelse — med automatisk failover mellan leverantörer och ett routing-DSL för att kombinera flera modeller till ett anrop. Billig försäkring för den halva av stacken som förändras oftast.
En varning hör hemma i det här avsnittet i stället för att begravas i det, eftersom det är detaljen som gör GPT-Live-1-halvan av den här jämförelsen mindre avgjord än vad leverantörens benchmarkresultat antyder. I det oberoende Artificial Analysis Speech to Speech Index får GPT-Live-1 69,8 % – sjunde plats av elva, efter GPT-Realtime-2.1 med 73,9 % och Grok Voice Think Fast 2.0 med 79,0 %. Modellen är det billigaste på den tavlan per timme inmatat ljud, för $4.42, och den är inte bäst. Ta höjd för möjligheten att det röstlager du standardiserar på inte är det du behåller.

Vilken, för vad?
Ta VoxCPM2 om texten finns innan ljudet gör det. Berättarröst, ljudböcker, dubbning, tillgänglighet, röstlinjer i spel, en produkt som behöver en röst som ingen har spelat in ännu – och särskilt alla arbetsbelastningar där volymen är hög, förutsägbar och värd en fast kapitalkostnad. Acceptera att du kommer att köra den själv, att verktygen runt omkring den fortfarande håller på att sätta sig och att påståendena om flerspråkig kvalitet förtjänar ditt eget lyssningstest innan de når en kund.
Välj GPT-Live-1 om det är en person i andra änden. Röstagenter, telefonsupport, intagsflöden, allt där modellen måste avgöra i realtid om människan har talat klart. Betala minutpriset för privilegiet att inte äga problemet, och budgetera den delegerade backend som en separat post, eftersom det är där samtalet blir billigt eller dyrt.
Misstaget är att behandla dem som alternativ i en direkt jämförelse. De är två lager av samma produkt för de flesta team som behöver båda, och det enda verkligt felaktiga svaret är att välja den självhostade eftersom licensen säger gratis utan att räkna in GPU:n som gör det sant.
