Ett genererat hero-kort för 'Gemini 3.8 TTS vs VoxCPM2' på en vit bakgrund med mjuka blå- och cyan-gradientaccenter. Det vänstra kortet 'Gemini 3.8 Flash TTS' listar en API-slutpunkt, Elo 1 260 på rank 2, och $16,50 per 1M normaliserade tecken; det högra kortet 'VoxCPM2' listar Apache 2.0, 2B parametrar, ungefär 8 GB VRAM för att köra, en realtidsfaktor på 0,30 i vanlig PyTorch och ingen hostad slutpunkt. En sidfotsrad lyder 'Elo enligt Artificial Analysis Provider Voice Arena, sept 2026; VoxCPM2-siffror enligt dess modellkort.' OrcaRouter-logotypen är kompositerad i det nedre högra hörnet.
Guides & Insights

Gemini 3.8 TTS vs VoxCPM2: Att hyra en röst eller köra en egen – i verkliga siffror

Författare

Alistair Wren

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Det finns ingen rad på resultattavlan som ställer Gemini 3.8 Flash TTS och VoxCPM2 sida vid sida, och den frånvaron är det mest användbara faktumet i den här jämförelsen. Gemini 3.8 Flash TTS är en hostad endpoint med ett Elo på 1 260 på plats 2 i Artificial Analysis Provider Voice Arena och en publicerad prislista i tokens. VoxCPM2 är en OpenBMB-checkpoint – 2 miljarder parametrar, Apache 2.0, släppt i april 2026 – som ingen inferensleverantör hostar. Du kan inte hyra den. Du kör den.

Frågan är alltså inte vilken modell som låter bättre. Den är om din arbetsbelastning gynnas mer av att betala per tecken för någon annans GPU:er eller av att äga GPU:erna och betala för dem oavsett om de arbetar eller inte. Det är en aritmetisk fråga, och till skillnad från de flesta modelljämförelser har den ett svar som du kan räkna ut innan du binder dig.

A generated comparison scoreboard for Gemini 3.8 Flash TTS and VoxCPM2, showing access (a hosted API against self-hosted only), size (undisclosed against 2B parameters), licence (vendor terms against Apache 2.0), price ($16.50 per 1M characters against a GPU-hour cost), throughput (not applicable against a real-time factor of 0.13 to 0.30) and independent Elo (1,260 against none).

En av dessa hyr du, den andra använder du.

Börja med vad var och en faktiskt ger dig.

• Åtkomst — Gemini 3.8 Flash TTS är endast via API, anropas genom Gemini API och de Google-ytor som nämns i dess tillkännagivande den 23 september 2026. VoxCPM2 har ingen förstaparts-endpoint i produktionsanvändning och ingen inferensleverantör som servar den; checkpointen är produkten.

• Licens — VoxCPM2 distribueras under Apache 2.0, vilket tillåter kommersiell användning utan separat avtal. Det är en genuint tillåtande licens, och den är inte standard för öppna talvikter, varav flera distribueras under forskningsvillkor som kanaliserar kommersiell användning tillbaka genom ett hostat API.

• Storlek — VoxCPM2 har 2B parametrar och ryms i ungefär 8 GB VRAM vid reducerad precision för utveckling, med en serveringstopp på omkring 22 GB på ett 24 GB-kort. Google har inte publicerat något parameterantal för någon av Gemini 3.8 TTS-modellerna.

• Röstskapande – Gemini 3.8 Flash TTS utför röstdesign från en skriven beskrivning, röstreplikering från ett 30-sekunders prov och dialog mellan två talare i ett enda anrop. VoxCPM2 är en text-till-tal-modell för en enda röst; en konversation är två körningar som fogats samman.

• Oberoende poäng – Flash TTS har en. VoxCPM2 finns inte bland de rankade raderna på Provider Voice Arena som registrerades den 24 september 2026. Att saknas på en resultattavla är inte en dom över kvaliteten – det betyder vanligtvis att ingen har anmält modellen – men det betyder att det inte finns någon preferenssiffra från tredje part att väga.

A screenshot of the Hugging Face model card for OpenBMB/VoxCPM2, showing the Apache 2.0 licence, the 2 billion parameter checkpoint size, the 30-language coverage, 48 kHz output and the 2 million hours of training audio recorded on the card.

Den sista punkten går åt båda hållen och förtjänar att sägas rakt ut i stället för att förskönas: om du behöver en oberoende kvalitetssignal innan du binder dig, är det bara en av dessa två som ger en sådan.

Siffran som avgör det: realtidsfaktor

Att självhosta en talmodell gör om en fakturering per tecken till en fakturering per GPU-timme, och växelkursen mellan dessa två enheter är modellens realtidsfaktor – hur många sekunder beräkning det tar att producera en sekund ljud.

VoxCPM2:s publicerade siffror är 0,30 i ren PyTorch och 0,13 med Nano-VLLM. Läs dem som genomströmning snarare än latens: vid 0,13 ger en GPU-timme väggklockstid ungefär 7,7 timmar färdigt ljud. Vid 0,30 ger samma GPU-timme närmare 3,3 timmar. Det är modellkortets egna siffror, uppmätta av OpenBMB, och de är den enskilt viktigaste indatan i alla beslut om att bygga eller köpa här.

Tre saker följer av dem.

• Serveringsstacken spelar större roll än modellen. Att gå från vanlig PyTorch till Nano-VLLM mer än fördubblar genomströmningen på identisk hårdvara. Varje kostnadsmodell som bygger på siffran 0,30 överskattar den egenhostade kostnaden med en faktor på omkring 2,3.

Utnyttjandegraden är allt. En hyrd GPU som står stilla 90 % av tiden är inte billigare än ett API oavsett pris. Brytpunkten nås bara när du håller kortet upptaget.

• Batchning förändrar kalkylen igen. Realtidsfaktorn mäts per ström; en server som hanterar samtidiga förfrågningar sprider ut den fasta kostnaden över dem, vilket är precis det läge där självhosting börjar vinna.

Vad en timmes ljud kostar, åt båda hållen

Sätt de två faktureringsmodellerna på samma axel. En timme färdigt ljud är 3 600 sekunder utdata.

På hyrsidan fakturerar Google i tokens i stället för tecken: 0,50 USD per miljon texttokens som indata och 9,00 USD per miljon ljudtokens som utdata till och med den 31 december 2026, därefter 18,00 USD; Flash-Lite TTS är 0,50 och 6,00 USD, därefter 12,00 USD. Batch och Flex ligger på 0,25 och 4,50 USD för Flash TTS mot 0,25 och 3,00 USD för Flash-Lite TTS, och Priority ligger på 0,90 och 16,00 USD. Artificial Analysis normaliserar standardpriserna till 16,50 och 11,00 USD per miljon tecken, vilket är boardens omräkning snarare än en prisuppgift från Google, och det är den siffra som ska användas när man jämför mot en modell som fakturerar i tecken.

På den egna sidan finns ingen kostnad per tecken alls. Kostnaden är GPU-timmen, multiplicerad med hur många timmar du än behöver vid genomströmningen ovan, plus serving-stacken, plus personerna som håller den igång. VoxCPM2:s fördel är att marginalkostnaden för den tusende timmen är densamma som för den första – och dess nackdel är att marginalkostnaden för den första timmen är en GPU.

Vilket är anledningen till att beslutet är ovanligt enkelt:

• Under en viss volym vinner API:et, och det är inte ens nära. Du betalar ensiffriga dollar per timme ljud mot en kapitalkostnad, och Googles kampanjpris gör att gapet blir ännu större fram till den 1 januari 2027.

• Över den volymen, på hårdvara du redan äger och kan hålla sysselsatt, vinner Apache 2.0-checkpointen avgjort — och till skillnad från en forskningslicensierad checkpoint hindrar inget i licensen dig från att släppa den.

• Däremellan är det ärliga svaret att du köper valfrihet snarare än besparingar. Självhosting ger möjligheten att låsa en version, behålla ljudet på din egen infrastruktur och sluta bry dig om en leverantörs prisförändring.

Där var och en är det rätta svaret

Välj Gemini 3.8 Flash TTS när du vill ha den bättre dokumenterade produkten. Den har ett oberoende betyg, ett publicerat pris, tvåtalardialog i ett enda anrop, röstdesign och replikering samt ingen operativ yta utöver en API-nyckel. Dess syskon Flash-Lite TTS ger dig en andra prisnivå i samma gränssnitt till ett normaliserat pris på $11.00 per miljon tecken. Vad du accepterar i utbyte är en taxa som fördubblas den 1 januari 2027 och ingen möjlighet att köra modellen någonstans.

Välj {{1}}VoxCPM2{{/1}} när det operativa arbetet är själva poängen. {{2}}Apache 2.0{{/2}} innebär att kommersiell användning tillåts rakt av, storleken {{3}}2B{{/3}} innebär att en enda accelerator räcker, och realtidsfaktorn {{4}}0.13{{/4}} under {{5}}Nano-VLLM{{/5}} innebär att ett blygsamt kort producerar flera timmar ljud per timme i verklig tid. Det du accepterar är att ingen annan kommer att köra det åt dig: ingen hostad slutpunkt, ingen arena-rad, ingen prisslista från leverantör, och varje kvalitetsgaranti du får är en du bygger och mäter själv.

A screenshot of the Artificial Analysis Provider Voice Arena leaderboard captured September 24, 2026, showing Google Gemini 3.8 Flash TTS at rank 2 with an Elo of 1,260 across 1,999 samples and 8 arena voices, with Gemini 3.8 Flash-Lite TTS at rank 6 and no VoxCPM2 row on the board.

Ingen av modellerna hostas av OrcaRouter, och det är värt att säga rakt ut i stället för att antyda något annat. Platsen för att anropa Gemini 3.8 Flash TTS är Googles eget API och de ytor som Google har namngivit; VoxCPM2 är en checkpoint som du driftsätter. Det OrcaRouter täcker är lagret ovanför det beslutet — över 200 modeller bakom en enda nyckel till leverantörens listpris utan påslag, så en ändring av leverantörspriset är live hos oss samma dag i stället för vid nästa faktureringscykel, automatisk failover så att en modell under utvärdering aldrig behöver vara ett produktionsberoende, och en routing-DSL som sätter samman flera modeller till ett anrop när en enda röst inte bär hela jobbet.

Vad du ska titta på härnäst

Två saker skulle förändra den här jämförelsen i grunden, och ingendera har inträffat ännu.

Det första är att någon hostar VoxCPM2. Dess frånvaro från inferensmarknaden är huvudskälet till att de två modellerna jämförs utifrån ekonomi snarare än kvalitet — om en leverantör plockar upp den upphör kalkylen hyra mot äga att vara den avgörande faktorn, och den saknade raden i arenan blir det man vill ska fyllas i.

Den andra är januariprisändringen på Googles sida. Till kampanjpriset är API:et tillräckligt billigt för att de flesta arbetsbelastningar inte bör självhosta något; vid priset efter kampanjen minskar gapet till den punkt där ett team med befintlig GPU-kapacitet och stabil volym bör se över kalkylen igen i stället för att anta att API:et fortfarande vinner.

Tills något av dessa drag inträffar är den avgörande indatan inte en topplista. Det är hur många timmar ljud du producerar per månad, och huruvida kortet är upptaget.