Una hero card generata per ElevenLabs Eleven v4 vs VoxCPM2 con due pannelli: ElevenLabs Eleven v4 come endpoint ospitato a Elo 1.319, posizione 1 e $80,00 per 1M di caratteri; VoxCPM2 come checkpoint Apache-2.0 con 2 miliardi di parametri, output a 48 kHz e nessuna riga nell'arena. Footer: 'Posizione e prezzo di Eleven v4 secondo Artificial Analysis, settembre 2026; specifiche di VoxCPM2 secondo la model card di OpenBMB.' Il logo OrcaRouter si trova nell'angolo in basso a destra.
Guides & Insights

Eleven v4 vs VoxCPM2: un modello in classifica contro un checkpoint che non puoi noleggiare

Autore

Rowan Sterling

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Il fatto più utile in questo confronto è una riga che non esiste. ElevenLabs Eleven v4occupa la posizione 1 nella Provider Voice Arena di Artificial Analysis con un Elo di 1.319 su 1.674 apparizioni, a 80,00 $ per milione di caratteri. VoxCPM2, il checkpoint OpenBMB rilasciato nell'aprile 2026, non compare da nessuna parte in nessuna delle due classifiche vocali — non in classifica, non fuori classifica, non come voce in anteprima. Non è un verdetto sulla qualità. Significa che qualunque numero sperassi di confrontare con 1.319, nessuno l'ha prodotto, e il confronto va fatto su qualcosa di diverso dalla preferenza. Ciò che resta è la proprietà, il fine-tuning e una questione di licenza che un endpoint ospitato non ti permette di porre.

Cosa ti consegna davvero ciascuna parte

Queste sono classi di prodotto diverse, e la differenza non è cosmetica.

• Accesso — Eleven v4 è un endpoint ospitato raggiungibile tramite l'API di ElevenLabs stessa, con fatturazione per carattere. VoxCPM2 è un checkpoint su Hugging Face sotto openbmb/VoxCPM2; lo scarichi e lo esegui, e non esiste alcun endpoint proprietario da chiamare.

• Licenza — VoxCPM2 è distribuito con licenza Apache 2.0, esplicitamente libero per uso commerciale. Eleven v4 è un'API commerciale i cui termini sono quelli di ElevenLabs. Questa differenza conta se la tua revisione legale chiede se puoi fare fine-tuning, ridistribuire o rilasciare i pesi; con il checkpoint la risposta è messa per iscritto ed è statica.

Dimensione e hardware — VoxCPM2 ha 2 miliardi di parametri su una backbone MiniCPM-4 e la scheda riporta circa 8 GB di VRAM in bfloat16, con una lunghezza massima della sequenza di 8.192 token. ElevenLabs non pubblica alcun numero di parametri per Eleven v4, e l'impronta hardware di un modello ospitato non è qualcosa che gestisci.

• Catena di uscita — VoxCPM2 accetta audio di riferimento a 16 kHz ed emette 48 kHz tramite la super-risoluzione integrata di AudioVAE V2, senza alcun upsampler esterno nel percorso. Il TTS ospitato ti fornisce un flusso a qualunque frequenza abbia scelto il fornitore.

• Punteggio indipendente — Eleven v4 ne ha uno, ed è al primo posto. VoxCPM2 non ne ha nessuno. L'assenza non è un punteggio basso; è un modello non valutato, e non si dovrebbe mai parlare dei due nella stessa frase come se il secondo fosse un numero.

A generated scoreboard comparing ElevenLabs Eleven v4 and VoxCPM2 across six dimensions: arena rank (1, Elo 1,319 against not on the board), price ($80.00 per 1M characters against no per-character rate), licence (vendor API terms against Apache 2.0 for commercial use), voice creation (clone from 10 s of audio against voice design and cloning), languages (90-plus against 30) and operations (none, it is hosted, against your own GPU at about 8 GB). Footer: 'Eleven v4 figures per Artificial Analysis and vendor docs; VoxCPM2 figures per the OpenBMB model card.' The OrcaRouter logo sits in the bottom-right corner.

Il numero che sostituisce l'Elo mancante

Se non puoi confrontare la preferenza, confronta ciò che puoi calcolare e, per un modello self-hosted, questo è il throughput. La scheda di VoxCPM2 riporta un real-time factor di circa 0,30 in PyTorch standard su una RTX 4090, che scende a circa 0,13 con Nano-VLLM. Il real-time factor è il numero di secondi di calcolo per secondo di audio, quindi queste due cifre significano che un'ora di GPU produce all'incirca 3,3 ore di parlato finito nel primo caso e circa 7,7 ore nel secondo.

A screenshot of the Hugging Face model card for openbmb/VoxCPM2, tagged Text-to-Speech, VoxCPM, Safetensors, 30 languages, multilingual, voice-cloning, voice-design, diffusion and audio, with License: apache-2.0. The summary reads: 'VoxCPM2 is a tokenizer-free, diffusion autoregressive Text-to-Speech model - 2B parameters, 30 languages, 48kHz audio output, trained on over 2 million hours of multilingual speech data.' Highlights list 30-language multilingual input with no language tag, voice design from a natural-language description with no reference audio, controllable cloning from a short clip with optional style guidance, 48 kHz studio-quality output via AudioVAE V2's built-in super-resolution, context-aware synthesis, real-time streaming with an RTF as low as about 0.3 on an NVIDIA RTX 4090 and about 0.13 accelerated by Nano-VLLM, and an Apache-2.0 licence free for commercial use. The sidebar shows 341,299 downloads last month, 2B params, BF16, and a note under Inference Providers that the model is not deployed by any inference provider.

Ne derivano immediatamente due conseguenze. Lo stack di serving conta più del modello: lo stesso checkpoint sulla stessa scheda più che raddoppia il suo output quando si cambia il motore di inferenza, quindi qualsiasi modello di costo che usa il valore di 0,30 sovrastima il tuo costo self-hosted di un fattore pari a circa 2,3. E l'utilizzo è tutto: una scheda che resta inattiva non batte un'API a consumo per carattere a nessun prezzo, perché la fattura dell'API cresce in base a ciò che dici, mentre quella della scheda cresce in base a quando l'hai comprata.

Ecco perché la versione onesta di questa decisione non è "quale suona meglio". È "quante ore di audio produci al mese, e l'hardware è occupato". Al di sotto del volume in cui una scheda resta caricata, vince l'API, e non c'è partita. Al di sopra, su hardware che già possiedi, il costo marginale del checkpoint per millesimo di ora è identico al suo costo per la prima ora — e questo è un vantaggio strutturale che nessun listino prezzi può eguagliare.

La capacità che un endpoint ospitato non ti venderà

Qui è il punto in cui il confronto smette di essere un'immagine speculare, perché c'è una cosa che VoxCPM2 fa che Eleven v4 fondamentalmente non può fare: puoi riaddestrarlo. La model card documenta sia il fine-tuning SFT completo che quello LoRA su appena cinque o dieci minuti di audio, con uno script di addestramento e una configurazione forniti per ciascuno.

Questo cambia la forma di un programma vocale. Un'API ospitata ti offre un modello fisso più qualunque funzionalità di clonazione il fornitore esponga — dieci secondi di audio di riferimento, nel caso di Eleven v4, per cloni istantanei, con un livello professionale al di sopra. Un checkpoint ottimizzabile con LoRA ti dà un modello che non ha mai visto i dati di nessun altro e il cui comportamento puoi fissare per versione. Per una voce di marca, un dominio regolamentato o una lingua che il cast del fornitore gestisce male, si tratta di una categoria di soluzione diversa, non di una più economica.

Il compromesso è esplicito e vale la pena dichiararlo: con VoxCPM2 accetti che nessuna terza parte abbia mai valutato il modello, che le garanzie di qualità sono quelle che costruisci e misuri da solo, e che il limite di sequenza di 8.192 token e l'avvertenza della scheda stessa — che la progettazione della voce e il controllo dello stile variano tra un'esecuzione e l'altra e che sono consigliate da una a tre generazioni — sono ora un tuo problema di QA.

Cosa ti offre Eleven v4 che il checkpoint non può darti

Andando nella direzione opposta, i vantaggi del modello hosted sono quelli che compaiono su un calendario di rilascio piuttosto che su una scheda tecnica.

• Una graduatoria misurata — prima in una classifica con 1.674 campioni alla base della stima, e un intervallo di circa ±19 punti intorno ad essa. Qualunque cosa misuri quella classifica, è indipendente da entrambi i fornitori ed è l'unico segnale di qualità di terze parti in questo confronto.

• Direzione della performance nel testo — tag audio inline come [ride], [sussurra] e [detto con rabbia in accento francese], oltre a prompt di consegna in linguaggio naturale e supporto migliorato per l'Alfabeto Fonetico Internazionale. Ottenere un cambio di umore da un modello self-hosted richiede una rigenerazione o un fine-tuning; qui è un token nello script.

• Copertura che non devi verificare — oltre 90 lingue contro le 30 di VoxCPM2, con l'avvertenza che l'elenco del checkpoint è esplicito e con nomi specificati (compresi i dialetti cinesi), mentre il "90-plus" del fornitore è un numero senza un elenco.

• Nessuna superficie operativa — niente GPU, nessuno stack di serving, nessuna deriva di versione, e una tariffa promozionale di $0,022 per 1.000 caratteri fino al 12 ottobre, rispetto a un prezzo di listino di $0,08 dopo.

A screenshot of Artificial Analysis' Eleven v4 model page, titled Eleven v4 Quality Elo, Speed & Price Analysis, credited to ElevenLabs and the ElevenLabs family with an Elo of 1318.77. The page presents Quality, Pricing and 1M Throughput views over the Provider Voice Arena Preference Elo, and the model selector reads '27 of 96 models'.

Nessuno di questi è nostro, e questo è il punto di questa sezione

OrcaRouter non ospita nessuno dei due modelli. Nel nostro catalogo non esiste alcun endpoint ElevenLabs né alcun endpoint VoxCPM2, e la risposta onesta sul piano del routing è che a Eleven v4 si accede tramite l'API di ElevenLabs stessa, mentre VoxCPM2 è qualcosa che si distribuisce sul proprio hardware. Non intendiamo lasciar intendere il contrario solo per rendere un confronto più ordinato.

Dove una singola chiave aiuta davvero è nella decisione che precede la decisione. Il motivo per cui le conversazioni sul self-hosting si arenano è che l'alternativa non viene mai valutata: un'API è una singola chiamata e un checkpoint è uno stack di serving, quindi l'API vince per impostazione predefinita anziché per aritmetica. Il contributo di OrcaRouter è che la metà hosted di quel confronto è economica da testare — oltre 200 modelli dietro un'unica chiave API, con i prezzi di listino dei provider trasferiti a 0% di ricarico, così l'opzione hosted viene valutata alla sua tariffa reale anziché a una stimata, con failover automatico se metti un candidato dietro un percorso live prima di aver finito di decidere.

Come decidere, in un solo passaggio

Scegli Eleven v4 se la voce deve essere buona alla prima take e vuoi che sia pronto entro questa settimana. Ottieni la vetta di una classifica indipendente, una sintassi di regia documentata, il maggior numero documentato di lingue in questo confronto e zero infrastruttura. Paghi $0,08 per 1.000 caratteri dal 13 ottobre in poi, e accetti di non poterlo riaddestrare, bloccarne la versione o tenere l'audio sul tuo hardware.

Scegli VoxCPM2 se il modello deve essere tuo. Apache 2.0, 2 miliardi di parametri con circa 8 GB di VRAM, output a 48 kHz senza upsampler nella catena e un percorso di fine-tuning che richiede da cinque a dieci minuti di audio: sono capacità che un endpoint ospitato non offre a nessun prezzo, e l'assenza di una riga nell'arena è il prezzo da pagare per averle. Esegui i calcoli di throughput sulla tua scheda prima di impegnarti, perché i fattori di tempo reale di 0,30 e 0,13 sono misurazioni della model card stessa e il tuo stack di serving non li riprodurrà esattamente.

E se la risposta onesta è che non conosci il tuo volume audio mensile, quello è il numero che devi andare a trovare. È ciò che decide questo confronto. Nessuna delle due schede te lo dirà.