VoxCPM2-1
Engineering & Research

VoxCPM2: 900 000 nedladdningar i månaden, och Transformers kan fortfarande inte ladda den.

Författare

Jim Song

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Hugging Faces metadata för VoxCPM2 listar dess bibliotek som voxcpm — inte transformers. Detta enda fält förklarar en märklig lucka i open source-talvärlden just nu: OpenBMB:s 2B-parameter text-till-tal-modell drog 900 282 nedladdningar de senaste trettio dagarna, gav upphov till 25 publika finetunes, 10 kvantiseringar, 7 adaptrar och över 100 Spaces, och kan fortfarande inte laddas av det bibliotek som nästan varje annan modell på den sajten laddas med. Pull requesten för att fixa det öppnades den 4 augusti 2026 och är fortfarande öppen i dag.

Den klyftan är värd att förstå innan fixen landar, eftersom den avgör vad det kostar dig att integrera den här modellen den här veckan jämfört med nästa kvartal. Och den vilar på en mer intressant fråga, nämligen huruvida VoxCPM2 verkligen är så långt före som bevakningen antyder. Allt nedan är hämtat från tre primära källor: openbmb/VoxCPM2 modellkortet och repometadatan, OpenBMB/VoxCPM GitHub-README:n och VoxCPM2 Technical Report (arXiv:2606.06928, inlämnad 5 juni 2026). Varje benchmarksiffra i den här artikeln är OpenBMB:s egen, framtagen av OpenBMB, och – som artikeln själv anger för sin huvudsakliga jämförelsetabell – de konkurrerande siffrorna i den kopierades från andra uppsatser snarare än att köras om under matchade förhållanden. Såvitt vi kan se har inget oberoende labb publicerat en reproduktion av något av detta.

Specifikationsbladet, på en enda skärm.

VoxCPM2 släpptes i april 2026 (Hugging Face-repositoriet skapades 3 april, senast ändrat 16 april) som tredje generationen av VoxCPM-linjen. Jämfört med sin omedelbara föregångare:

Storlek — 2B parametrar jämfört med VoxCPM1.5:s 0.8B och VoxCPM-0.5B:s 0.6B ryggrad.

Språk — 30 plus 9 kinesiska dialekter, jämfört med endast kinesiska och engelska i båda tidigare versionerna.

Ljud — accepterar en referens på 16 kHz, avger 48 kHz, jämfört med VoxCPM1.5:s symmetriska 44,1 kHz in och ut.

Backbone — MiniCPM-4-1B (28 lager, bredd 2048) som den textsemantiska språkmodellen, upp från MiniCPM-4-0.5B (24 lager, bredd 1024).

Sekvensbudget — 8192 token med en tokenhastighet på 6,25 Hz på språkmodellsidan, vilket motsvarar ungefär 20 minuters ljud i en kontext.

Kostnad för en sekunds tal — realtidsfaktor 0.30 i ren PyTorch och 0.13 via Nano-vLLM på ett RTX 4090, med cirka 8 GB VRAM. VoxCPM1.5 klarade 0.15 vid 0.8B och 6 GB.

Licens — Apache-2.0 på vikterna, finjusteringskoden och inferensverktygen. Ingen grind, ingen klausul om acceptabel användning, kommersiell användning tillåten.

Träningsdata — "över 2 miljoner timmar" av flerspråkigt tal, utan namngiven korpus och utan ursprungsangivelse.

Läs RTF-raden två gånger, eftersom den går åt fel håll. VoxCPM2 är ungefär dubbelt så långsam per sekund av genererat ljud som 0.8B-modellen den ersätter, och behöver en tredjedel mer VRAM. 2B-modellen köpte inte genomströmning; den köpte språk och kontroll, och tog betalt i latens för dem. Om du kör en realtidsagent är den avvägningen det första du bör prissätta.

Vad PR #47756 faktiskt ändrar

Idag innebär att köra VoxCPM2 att installera OpenBMB:s eget paket — pip install voxcpm, Python 3.10 till 3.12, PyTorch 2.5 eller nyare, CUDA 12 eller nyare — och att ladda modellen genom ett VoxCPM.from_pretrained-anrop som inte har något att göra med Transformers API. Allt nedströms från det beslutet är skräddarsytt: din egen batchhantering, ditt eget servinglim, din egen hantering av de fem genereringslägena.

Det pågående arbetet skulle ändra på det. Issue #47695, "Add native support for OpenBMB VoxCPM2," skapades den 31 juli. PR #47756, "support for VoxCPM2," följde den 4 augusti och uppdaterades senast den 5 augusti. Den bär etiketten "New model" och lägger till en modulär konfiguration och modelleringsimplementation, en anpassad tokenizer och processor, AudioVAE-kodning och avkodning med streaming, referensröstkonditionering, fortsättning med promptljud, automatiska klassregistreringar och en text-till-vågforms-pipeline – med 64 modelltester rapporterade som godkända. Den är staplad ovanpå PR #47736, som lägger till MiniCPM4 själv; textryggraden måste landa innan talmodellen som omsluter den kan göra det.

VoxCPM2-2

Två detaljer förtjänar att vägas in, och båda talar emot optimismen. För det första: alla tre punkterna — ärendet och båda pull requests — öppnades av samma enskilda community-bidragsgivare, inte av OpenBMB och inte av en Hugging Face-underhållare. Det finns inget leverantörsåtagande bakom detta och därför ingen tidslinje att planera mot. För det andra: en stack med två PR:er och 203 commits som rör en ny modalitet är inte en snabb granskning. PR:er för nya modeller i Transformers tar rutinmässigt veckor av rundor med underhållare, och den här har fått fyra kommentarer hittills.

Den praktiska innebörden: om en inbyggd Transformers-klass är bärande för din arkitektur — eftersom du standardiserar på AutoModel, eller för att ditt serving-lager bara talar Transformers — så är VoxCPM2 inte redo för dig, och det finns inget datum. Om du kan hålla dig inom voxcpm-paketet, är modellen fullt användbar idag, och ekosystemet har tydligt röstat för att detta är acceptabelt: 900 282 nedladdningar gjordes utan att det fanns något inbyggt stöd alls. Det finns också en mellanväg som de flesta genomgångar missar. OpenBMB tillhandahåller en vLLM-Omni-integration som exponerar en OpenAI-kompatibel /v1/audio/speech-endpoint, samt ett llama.cpp-omni-bygge med GGUF-vikter som körs på CPU, Metal, CUDA eller Vulkan utan något Python-beroende alls. Om det du egentligen ville ha från Transformers var en standardiserad serving-yta snarare än själva klassen, så finns det redan.

"Tokenizer-free" betyder inte okvantiserad.

Frasen i varje rubrik om denna modell är den som oftast läses fel. VoxCPM2 har ingen extern diskret ljudcodec — det finns inget inlärt ordförråd av taltokens som sitter mellan språkmodellen och vågformen, så som det finns i CosyVoice- eller Moshi-linjerna. Det är påståendet, och det är sant.

Det finns fortfarande kvantisering inuti modellen. Ryggraden kör en differentierbar semidiskret flaskhals baserad på Finite Scalar Quantization, och pappret är tydligt med dess roll: den textsemantiska språkmodellen producerar dolda tillstånd, FSQ skalärkvantiserar dem per dimension till ett "semantiskt skelett", en residual akustisk språkmodell återhämtar den fina detalj som FSQ kasserade, och en lokal diffusionstransformator omvandlar båda konditioneringsströmmarna till nästa kontinuerliga latenta patch genom flow matching. De fyra stegen som du ser förkortade som LocEnc, TSLM, RALM och LocDiT är exakt den kedjan.

Den skillnad som är viktig i praktiken är inte "kvantiserad eller inte". Det är att flaskhalsen tränas end-to-end med allt runtomkring, snarare än att den fryses i förväg som en separat codec med egen förlust. Det är det som tar bort den vanliga felfunktionen där en språkmodell lär sig förutsäga token som en codec inte kan avkoda troget. VoxCPM2 breddade den FSQ-flaskhalsen från 256 till 512 dimensioner och ersatte den gamla elementvisa summeringen som matar residualmodellen med en inlärbar konkatenerings-projektion — små ändringar, och bland de få i rapporten som stöds av en angiven mekanism snarare än en benchmark-delta.

48 kHz-utgången är delvis påhittad, och det är designen.

"48 kHz studiokvalitet" är modellens mest citerade spec och dess mest missförstådda. AudioVAE V2 är asymmetrisk: kodaren arbetar vid 16 kHz, avkodaren rekonstruerar vid 48 kHz. Artikeln kallar detta "implicit superupplösning", vilket är ett ärligt namn på vad det är.

Följ konsekvensen. En 16 kHz-kodare har ett 8 kHz Nyquist-tak, så ingenting över 8 kHz i ditt referensljud når någonsin modellen. Varje bit energi i de två högsta oktaverna i utsignalen — luften i en röst, sibilans, glans i cymbal-kanterna — genereras av avkodaren från en rimlig prior, inte förs vidare från talaren du klonat. För det mesta av berättar- och agentarbete är detta omärkbart eller en förbättring, eftersom en bra inlärd prior slår en hård 8 kHz-hylla. För den vars jobb är trohet mot en specifik inspelad röst är det ett faktum att designa kring, och det är inget som ett lyssningstest på dina laptophögtalare kommer att avslöja.

Papprets motivering är det mest trovärdiga ingenjörsargumentet i rapporten, och värd att upprepa eftersom det inte är marknadsföring: att behålla enkodern på 16 kHz gör att OpenBMB kan återanvända det ursprungliga VoxCPM 16 kHz-träningsmaterialet i sin helhet, eliminerar latent diskrepans mellan källor inspelade vid olika samplingsfrekvenser, och undviker den sekvenslängdsexplosion som en högre ingångshastighet skulle tvinga på en autoregressiv slinga. Att enbart lyfta avkodaren köper utsignaltrohet utan att betala för det i modellens dyra del. Det är en bra avvägning, medvetet gjord. Det innebär också att VoxCPM1.5-användare går från en 44.1 kHz-enkoder till en 16 kHz sådan — en nedgradering på ingångssidan såld inuti en uppgradering på utgångssidan. OpenBMB:s egen rekonstruktionstabell visar formen på det: VoxCPM1.5:s codec uppvisar fortfarande det bästa fullbandsmelavståndet av de tre generationerna, 1.139 mot AudioVAE V2:s 1.335, eftersom den arbetar nativt med en hög samplingsfrekvens istället för att rekonstruera upp till en sådan.

Att läsa OpenBMB:s poängtavla på det sätt OpenBMB skrev den

Konkurrenskraftig, inte först

På Seed-TTS-Eval, standardriktmärket för zero-shot-röstkloning, rapporterar VoxCPM2 en ordfelsfrekvens på 1,84 % med en talarlikhet på 75,3 % på det engelska setet, en teckenfelsfrekvens på 0,97 % med 79,5 % likhet på kinesiska och en CER på 8,13 % med 75,3 % likhet på den svåra kinesiska delmängden. Papprets eget ord för detta är ”competitive”, och tabellen stöder det ordet snarare än de starkare ord som cirkulerar.

VoxCPM2-3

Bland de öppna källkodssystemen i samma tabell visar Fish Audio S2 bättre felprocent på alla tre delmängderna (0,99 / 0,54 / 5,99). Qwen3-TTS slår det på engelsk WER med 1,23. Och LongCat-Audio-DiT sopar banan med det på fem av sex celler — 1,50 WER och 78,6 likhet på engelska, 81,8 likhet på kinesiska, 6,04 CER och 79,7 likhet på svår kinesiska. Där VoxCPM2 verkligen utmärker sig är balansen: det är ett av mycket få system som samtidigt ligger nära toppen i likhet och är respektabelt vad gäller begriplighet, och det är det enda på listan som också klarar röstdesign på naturligt språk. Men ”state-of-the-art” är inte vad dess egen rubriktabell visar, och den ärliga beskrivningen är att detta är en stark generalist, inte en benchmarkledare.

3,3 gånger så många parametrar gav nästan ingen begriplighet.

Den mest användbara raden i den tabellen är den som ingen citerar. VoxCPM-0.5B, den första generationen på 0,6B från september 2025, uppnår en engelsk WER på 1,85 % och en kinesisk CER på 0,93 %. VoxCPM2, på 2B, uppnår 1,84 % och 0,97 %. Inom felmarginalen för engelska, och något sämre för kinesiska.

Vad de extra parametrarna faktiskt levererade syns i likhetsspalterna och ingen annanstans: det engelska SIM-värdet steg från 72,9 till 75,3 och det kinesiska från 77,2 till 79,5. Allt annat som 2B-modellen gav ligger helt utanför detta riktmärke — 28 fler språk, röstdesign från en textbeskrivning, stilkontrollerbar kloning, 48 kHz-utgång. Det är mycket, och det är det ärliga argumentet för uppgraderingen. Men om din arbetsbelastning är engelsk eller kinesisk kloning och du väljer utifrån felfrekvens, ger VoxCPM2 dig inget som 0.6B-modellen inte redan gav dig, med tre gånger så många vikter och dubbel latens. Märkligt nog är VoxCPM1.5 sämst av de tre på detta riktmärke (2,12 / 1,18), vilket får familjens progression att se mindre ut som en stege och mer som tre olika produkter.

En modell, två utvärderingar, en storleksordning isär

Här krävs försiktighet, eftersom de två flerspråkiga resultaten i denna rapport går kraftigt isär och båda citeras som om de avgör saken.

Rubriken är en genomsnittlig felfrekvens på 1,68 % över 30 språk. Det kommer från en testuppsättning som OpenBMB byggde själv — 500 yttranden per språk — och bedömdes med Gemini 3.1 Flash Lite som igenkännare. På den uppnår VoxCPM2 engelska 0,42, kinesiska 0,92, hindi 0,79, arabiska 1,23.

Rapporten kör även MiniMax-MLS-Test, en tredjepartsuppsättning med 24 språk som poängsätts med Whisper-large-v3. Samma modell. Där uppvisar VoxCPM2 hindi 19.70 och arabiska 13.05 — tjugofem respektive tio gånger sämre än vad dess eget riktmärke anger, på språk som den officiellt stöder. Även i den kolumnen: kantonesiska 38.58, tjeckiska 24.13, rumänska 21.58, ukrainska 6.32.

Tre saker får det mesta av detta att gå ihop, och de är värda att särskilja eftersom den allmänt spridda versionen av den här historien missförstår dem.

Tjeckiska, rumänska och ukrainska är inte stödda språk.Kontrollera repositoryts egna språktaggar: 30 koder, och ingen av dem är cs, ro eller uk. Att kritisera VoxCPM2 för 24 % tjeckisk WER är att kritisera det för ett språk som det aldrig påstått sig stödja. Kantonesiska faller troligen under de "9 kinesiska dialekterna", men varje system i den kolumnen ligger över 30 % på den, vilket pekar på igenkännaren snarare än någon av modellerna.

Arabiska och hindi stöds, och de är det verkliga fyndet.Dessa är de två språk där OpenBMB hävdar täckning och där dess två utvärderingar skiljer sig med en storleksordning. Artikelns egen förklaring är att dessa språk har "relativt begränsad datavolym" i träningskorpusen och att "en del av den högre WER:en kan härröra från igenkännarens begränsade noggrannhet." Det är en rimlig hypotes och en otestad sådan. Om du levererar tal på arabiska eller hindi, är det publicerade intervallet för denna modell 0,79 % till 19,70 %, och ingen av ändpunkterna är oberoende verifierad. Avsätt en dag för egna mätningar; budgetera inte utifrån något av dessa siffror.

Måtten är inte ens i samma enhet. Hindi bedöms med teckenfelsfrekvens på den interna uppsättningen och ordfelsfrekvens på MiniMax-MLS. Dessa är inte jämförbara storheter, vilket är ytterligare en anledning till att 25x-gapet inte är ett rent fördömande — och ytterligare en anledning till att genomsnittet på 1,68 % inte bör läsas som ett jämförbart resultat.

Samma försiktighet gäller för påståendet som bär upp den numeriska tyngden i rapporteringen om denna modell: att VoxCPM2 slår ElevenLabs i röstlikhet, 85.4 % mot 61.3 % på engelska, och vinner 22 av 24 språk. Det är verkligen vad tabellen säger. Det är också en tabell som artikeln delvis sammanställer från tidigare rapporterade resultat, och en där ElevenLabs begriplighetskolumn innehåller 73.94 % WER på thailändska, 73.42 % på vietnamesiska och 16.03 % på kinesiska. Det är inte siffror från en fungerande kommersiell produkt; de är tecken på en poängsättnings- eller konfigurationsmissmatchning. En tabell som är bristfällig i en kolumn blir inte tillförlitlig i en annan bara för att resultatet smickrar modellen du läser om.

Fem lägen från en enda stomme — och receptet som får dina siffror att röra sig.

{{1}}Den renaste idén i arkitekturen är att VoxCPM2 inte har separata modeller eller huvuden för sina förmågor. Alla fem lägena är samma parametrar med inmatningssekvensen arrangerad på olika sätt, vilket är varför en enda 2B-checkpoint täcker det som vanligtvis kräver en liten flotta:{{/1}}

Grundläggande TTS — text in, ljud ut.

Röstdesign — en beskrivning inom parentes läggs helt enkelt till i början av texten, så "(en trött medelålders man, hes, som talar långsamt)" och själva raden går genom samma språkmodell utan någon extra modul. Inget referensljud alls.

Referenskloning — ett isolerat referensklipp bestämmer talarens identitet, utan att något transkript krävs.

Controllable cloning — referensklipp plus en stilbeskrivning, så du kan klona en röst och sedan be den låta stressad eller road.

Fortsättningskloning — referensklipp parat med dess transkript, behandlat som ett ljudprefix som modellen fortsätter, vilket är det läge med högst återgivningstrohet.

Dold i rapporten finns en ratt som de flesta skribenter hoppar över – och det är just den som mest sannolikt förändrar dina resultat. De två conditioning-vägarna, isolerad referens och fortsättningsprefix, kan användas var för sig eller tillsammans, och de väger mot varandra. I OpenBMB:s egen ablation ger användningen av båda tillsammans bäst talarlikhet på varje delmängd. Om man släpper fortsättningsprefixet och endast matar in den isolerade referensen får man bäst förståelighet på svår kinesisk text – 6,85 % CER mot 7,44 % – samtidigt som man förlorar ungefär fem likhetspoäng. Artikelns förklaring är rimlig: utan ett tidsmässigt ljudprefix som låser prosodin har modellen större frihet att välja ett framförande som överlever svår text.

Så standardinställningen är ett val, inte ett tak. Röstmatchning kräver båda vägarna; svår eller ovanlig text kräver endast referens. Ett ärligt förbehåll: de absoluta siffrorna i den ablationstabellen stämmer inte överens med huvudtabellen för den metod som uppsatsen säger att den använde genomgående, vilket i en förhandsversion mer sannolikt är ett bokföringsfel än något ondskefullt – men det är ett tredje skäl att behandla varje siffra här som en riktning att testa snarare än ett värde att citera.

Röstdesign: mer lydig än naturlig

Röstdesign är den funktion som gör den här utgåvan intressant snarare än inkrementell, och det är den där leverantörens egna siffror är mest avslöjande om en verklig avvägning.

På InstructTTSEval får VoxCPM2 84,2 för akustisk parameterspecifikation, 83,2 för beskrivande stil-direktiv och 71,4 för rollspel på engelska – den sista siffran är bäst i tabellen, före Qwen3-TTS-1.7B-VD på 68,4 och Gemini-TTS-Pro på 67,2. På kinesiska är det svagare och ordningen vänder: 85,2 / 71,5 / 60,8, mot Gemini-TTS-Pro:s 89,0 / 90,1 / 75,5. Så det starkaste påståendet som finns är att VoxCPM2 leder på engelskt rollspel och ligger efter ett slutet frontsystem nästan överallt annars när det gäller instruktionsföljning.

Den mänskliga lyssningspanelen — 50 lyssnare, randomiserad och dubbelblind, enligt rapporten — skärper det. Vid kontrollerbar generering får VoxCPM2 4,50 i instruktionsföljning mot Qwen3-TTS-VD:s 4,41 och förlorar i naturlighet med 4,48 mot 4,61. Vid vanlig zero-shot-kloning vinner den i talarlikhet (4,74 mot 4,69) och är lika eller ligger efter i naturlighet (4,78 mot Qwen3-TTS:s 4,80, med överlappande konfidensintervall).

Mönstret är konsekvent nog att planera utifrån: VoxCPM2 gör vad du säger åt den och låter något mindre mänsklig när den gör det, medan Qwen3-TTS låter något bättre och följer instruktioner något mindre noggrant. Vilken som är rätt beror helt på om din produkts värde ligger i precis kontroll eller ansträngningslös leverans. OpenBMB påpekar själva den naturliga följden i sina begränsningar, och det är den typen av saker som leverantörer vanligtvis utelämnar: röstdesign och kontrollerbar kloning "kan ge varierande resultat mellan körningar," och att få den röst du vill ha kan kräva flera försök. Bygg in en retry i din pipeline och, om rösten spelar roll, en mänsklig lyssningsgrind.

Vad det kostar att driva, och när hyra är rätt val

Det finns inget hostat VoxCPM2 någonstans. Hugging Faces egen sidopanel säger det rakt ut — "Den här modellen är inte driftsatt av någon Inference Provider" — och det inkluderar oss: OrcaRouter erbjuder inte VoxCPM2, och hur mycket man än vill så ändrar det inte att en 2B TTS-modell utan inferenspartner är antingen vikter du hostar eller ingenting.

Vilket gör kostnadsfrågan till en GPU-fråga, och räkningen är enkel. Med Nano-vLLM:s realtidsfaktor på 0,13 på ett enda RTX 4090 producerar en GPU-timme ungefär 7,7 timmars ljud, så din kostnad per ljudtimme är din timkostnad för ett 24 GB-kort dividerat med ungefär 7,7. I ren PyTorch vid RTF 0,30 sjunker det till ungefär 3,3 timmars ljud per GPU-timme. Båda siffrorna är OpenBMB:s, uppmätta på deras hårdvara med deras text, och båda kommer att förändras hos dig – batchstorlek, textsvarighet och hur många försök din kvalitetsgrind tvingar fram är alla multiplikatorer som RTF-talet inte innehåller. Retryfrekvensen är den man glömmer: en modell som leverantören säger kan kräva flera försök för att träffa en målröst kostar inte vad dess RTF antyder.

VoxCPM2-4

Den jämförelse folk vill se i det här läget är mot ett hyrt API, och det ärliga svaret är att de två inte går att konvertera rakt av. openai/tts-1-hd debiteras $30,00 per miljon tokens in och ut — det är leverantörens listpris som går rakt igenom på OrcaRouter, eftersom vi tar 0 % påslag, så siffran på vår modellsida är samma som OpenAI debiterar. Men token är inte sekunder, och ingen publicerad kurs omvandlar det ena till det andra tillräckligt tillförlitligt för att ligga till grund för ett kalkylblad. Den som visar dig en ren jämförelse per timme mellan en självhostad TTS-modell med öppna vikter och ett API som debiteras per token har gjort ett antagande som de inte redovisat.

Det som är värt att säga är var gränsen går arkitektoniskt. Att self-hosta {{1}}VoxCPM2{{/1}} är vettigt när du behöver en specifik klonad röst, när ljudvolymen är tillräckligt jämn för att hålla en GPU sysselsatt, när data inte kan lämna din infrastruktur, eller när du tänker LoRA-finjustera den — och den stödjer det med 5 till 10 minuters målljud, vilket är genuint billigt. Att hyra är vettigt när volymen är spikig, när du inte kan bemanna en GPU, eller när rösten är utbytbar. De flesta verkliga röstprodukter är två system, inte ett: ett synteslager och en språkmodell som sköter tänkandet mellan öronen. Den resonerande halvan är den del som är värd att lägga bakom en enda nyckel med automatisk failover mellan leverantörer, så att ett modellbyte blir en strängändring i stället för en upphandlingscykel; det är den formen som {{2}}OrcaRouter{{/2}} är till för, över 200+ modeller. Synteshalvan, när det är en specifik röst du äger och finjusterar, hör hemma på din egen hårdvara. {{3}}VoxCPM2{{/3}} är helt klart i den andra kategorin, och det faktum att ingen tillhandahåller den är en följd av vad den är snarare än ett förbiseende.

Vad OpenBMB säger att du inte ska förvänta dig

Begränsningsavsnittet är ovanligt uppriktigt för en release med så mycket momentum, och det är tillräckligt kort för att tas på allvar:

Kloningskvalitet är en missbruksyta. Kortet säger det direkt: modellen producerar tal som är tillräckligt realistiskt för imitation och bedrägeri, och AI-genererat ljud bör märkas. Apache-2.0 sätter inga begränsningar alls på detta — till skillnad från licenserna på flera konkurrerande open-weight-röstmodeller finns det ingen klausul om tillåten användning att gömma sig bakom. Din policy för samtycke och offentliggörande är din egen att utforma.

Varians mellan körningar förväntas på de två kontrollfunktionerna, inte en bugg att rapportera.

De 30 språken är en verklig gräns. Allt utanför dem kan fungera och är otestat; räkna med att behöva finjustera.

Konsistensen i stilkontrollen beskrivs som fortfarande under utveckling av de personer som byggde den.

Och de luckor som kortet inte nämner: ingen redovisning av träningskorpus alls, så en Apache-2.0-licens på vikterna avgör kodfrågan och ingenting om datans ursprung. Ingen oberoende utvärdering av någon siffra i denna artikel. Ingen publicerad latens i millisekunder — RTF är en genomströmningskvot, och en röstagent lever eller dör på tiden till första ljud, vilket inte förekommer någonstans i rapporten.

Tre frågor som modellkortet inte besvarar

Bör jag sluta använda VoxCPM1.5 eller VoxCPM-0.5B?

Endast för de nya funktionerna, och endast efter mätning. Om du behöver språk utöver kinesiska och engelska, röstdesign eller stilkontrollerbar kloning, är uppgraderingen hela poängen och det finns inget alternativ inom familjen. Om du kör engelsk eller kinesisk kloning idag och är nöjd, är argumentet svagt vid första anblicken: samma benchmark visar att VoxCPM-0.5B matchar VoxCPM2 i felfrekvens, och du skulle betala dubbelt så mycket i latens och en tredjedel mer VRAM för cirka 2,4 poäng i talarlikhet. Det finns också en migrationsdetalj som är lätt att missa — om du matade VoxCPM1.5 med 44,1 kHz referensljud, tar VoxCPM2:s kodare 16 kHz, så din referenspipeline ändras och de övre frekvenserna i ditt källmaterial slutar spela roll.

Kan jag faktiskt lansera en kommersiell röstprodukt på detta?

Juridiskt sett är licensen ungefär så tillåtande som det går: Apache-2.0, ingen grind, inga användningsrestriktioner, kommersiell användning uttryckligen tillåten, både vikter och finjusteringskod omfattas. Den öppna frågan är inte licenstexten utan vad som saknas bakom den. OpenBMB anger ingen träningskorpus, vilket innebär att ingen kan tala om för dig vems röster som finns i de 2 miljoner timmarna. För en modell vars huvudfunktion är att återge en specifik persons röst är det en fråga för din egen jurist och inte för ett modellkort – och det är samma fråga som varje öppen vikt-röstmodell för närvarande undviker. Praktiskt sett är de svårare hindren operativa: ingen inbyggd Transformers-klass ännu, ingen värdbaserad slutpunkt någonstans, variation mellan körningar för kontrollfunktionerna och ingen tid-till-första-ljud-siffra om du bygger något konverserande.

Är den tillräckligt bra för att ersätta en betald TTS-leverantör?

För engelsk och kinesisk narration, förinspelat innehåll och alla arbetsbelastningar där du kontrollerar en specifik röst och kan batcha arbetet: ja, baserat på tillgängliga bevis, och licensen gör det nästan gratis att prova. För realtidskonversationsagenter: mät tiden till första ljudet själv innan du förbinder dig, eftersom ingen har publicerat den och RTF säger dig ingenting. För arabiska, hindi eller något språk i den långa svansen: leverantörens två egna utvärderingar skiljer sig med en storleksordning, så behandla modellen som obevisad där, oavsett vilken siffra du sett citerad. Och för allt där ett feluttal är en affärsincident snarare än en olägenhet, notera att VoxCPM2 inte är ledaren i förståelighet ens i sin egen tabell — Fish Audio S2 och LongCat-Audio-DiT ligger före den där, och de har också öppna vikter.

Vad du ska titta på

Två saker, på olika tidslinjer. Den som ligger närmast är PR #47756 och MiniCPM4-PR:n under den. Om de slås samman blir VoxCPM2 ett AutoModel-anrop och integrationskostnaden för alla som standardiserat på Transformers sjunker till nästan ingenting över en natt — och med tanke på att 900 282 nedladdningar i månaden redan sker den hårda vägen, är det en meningsfull upplåsning. Om de stannar upp förblir svaret för de teamen ”använd OpenBMB:s paket eller vLLM-Omni-slutpunkten”, och community-bidragsgivaren som driver båda PR:erna har ingen hävstång för att ändra på det.

Den långsammare är huruvida någon utanför OpenBMB någonsin publicerar en siffra. Fyra månader efter lanseringen, med 900 000 månatliga nedladdningar, 25 finjusterade modeller och mer än 100 Spaces byggda på den, går varje prestandasiffra i omlopp fortfarande tillbaka till en teknisk rapport skriven av dem som tränade modellen. Det är inte en kritik av OpenBMB, som dokumenterade sitt arbete mer grundligt och mer ärligt än de flesta — rapporten redovisar sina val av igenkännare, sina svagheter i datavolymen och sin egen instabilitet. Det är en kritik av resten av oss. Det enskilt mest värdefulla som någon i open source-gemenskapen för talteknologi skulle kunna publicera den här månaden är en Whisper-poängsatt körning av VoxCPM2, Qwen3-TTS, Fish Audio S2 och LongCat-Audio-DiT på Seed-TTS-Eval och MiniMax-MLS under identiska förhållanden. Tills det finns är den rättvisa sammanfattningen av VoxCPM2 att den är den mest kapabla open-weights-röstmodellen per checkpoint som någon har släppt, att den inte är den mest korrekta, och att båda hälfterna av den meningen vilar på leverantörens ord.

© 2026 OrcaRouter

För leverantörer

Driver du en inferensplattform? Få dina modeller på OrcaRouter.

Kontakta oss

Gå med i vår community

DiscordEmailXGitHubYouTube