Kartu hero yang dihasilkan untuk ElevenLabs Eleven v4 vs VoxCPM2 dengan dua panel: ElevenLabs Eleven v4 sebagai endpoint yang dihosting pada Elo 1.319, peringkat 1 dan $80,00 per 1 juta karakter; VoxCPM2 sebagai checkpoint Apache-2.0 dengan 2B parameter, output 48 kHz dan tanpa baris arena. Footer: 'Peringkat dan harga Eleven v4 menurut Artificial Analysis, September 2026; spesifikasi VoxCPM2 menurut kartu model OpenBMB.' Logo OrcaRouter berada di sudut kanan bawah.
Guides & Insights

Eleven v4 vs VoxCPM2: Model Berperingkat Melawan Checkpoint yang Tidak Dapat Anda Sewa

Penulis

Rowan Sterling

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Fakta paling berguna dalam pertandingan ini adalah baris yang tidak ada. ElevenLabs Eleven v4 memegang peringkat 1 di Provider Voice Arena milik Artificial Analysis dengan Elo 1.319 dalam 1.674 kemunculan, dengan tarif $80,00 per juta karakter. VoxCPM2, checkpoint OpenBMB yang dirilis pada April 2026, tidak muncul di mana pun di kedua papan peringkat suara — bukan sebagai entri berperingkat, bukan entri tanpa peringkat, bukan sebagai entri pratinjau. Itu bukan penilaian atas kualitas. Artinya, angka apa pun yang ingin Anda bandingkan dengan 1.319, tidak ada yang menghasilkannya, dan perbandingan harus dilakukan berdasarkan sesuatu selain preferensi. Yang tersisa adalah kepemilikan, fine-tuning, dan pertanyaan lisensi yang tidak dapat Anda ajukan pada endpoint yang dihosting.

Apa yang sebenarnya masing-masing pihak berikan kepada Anda

Ini adalah kelas produk yang berbeda, dan perbedaannya bukan sekadar kosmetik.

• Akses — Eleven v4 adalah endpoint terkelola yang dijangkau melalui API milik ElevenLabs sendiri, ditagih per karakter. VoxCPM2 adalah checkpoint di Hugging Face dengan nama openbmb/VoxCPM2; Anda mengunduhnya lalu menjalankannya, dan tidak ada endpoint pihak pertama yang bisa dipanggil.

• Lisensi — VoxCPM2 hadir dengan Apache 2.0, secara eksplisit gratis untuk penggunaan komersial. Eleven v4 adalah API komersial yang ketentuannya milik ElevenLabs. Perbedaan itu penting jika tinjauan hukum Anda menanyakan apakah Anda boleh melakukan fine-tuning, mendistribusikan ulang, atau merilis bobotnya; dengan checkpoint, jawabannya tertulis dan statis.

• Ukuran dan perangkat keras — VoxCPM2 memiliki 2 miliar parameter pada backbone MiniCPM-4 dan kartu tersebut mencantumkan sekitar 8 GB VRAM pada bfloat16, dengan panjang urutan maksimum 8.192 token. ElevenLabs tidak mempublikasikan jumlah parameter untuk Eleven v4, dan jejak perangkat keras model yang dihosting bukanlah hal yang Anda kelola.

• Rantai keluaran — VoxCPM2 menerima audio referensi 16 kHz dan menghasilkan 48 kHz melalui super-resolusi bawaan AudioVAE V2, tanpa upsampler eksternal di jalurnya. Hosted TTS memberi Anda stream pada laju apa pun yang dipilih vendor.

• Skor independen — Eleven v4 memilikinya, dan itu peringkat pertama. VoxCPM2 tidak memilikinya. Ketidakadaan bukanlah skor rendah; itu adalah model yang belum diberi skor, dan keduanya tidak boleh dibicarakan dalam satu kalimat seolah-olah yang kedua adalah sebuah angka.

A generated scoreboard comparing ElevenLabs Eleven v4 and VoxCPM2 across six dimensions: arena rank (1, Elo 1,319 against not on the board), price ($80.00 per 1M characters against no per-character rate), licence (vendor API terms against Apache 2.0 for commercial use), voice creation (clone from 10 s of audio against voice design and cloning), languages (90-plus against 30) and operations (none, it is hosted, against your own GPU at about 8 GB). Footer: 'Eleven v4 figures per Artificial Analysis and vendor docs; VoxCPM2 figures per the OpenBMB model card.' The OrcaRouter logo sits in the bottom-right corner.

Angka yang menggantikan Elo yang hilang

Jika Anda tidak dapat membandingkan preferensi, bandingkanlah apa yang dapat Anda hitung, dan untuk model yang di-host sendiri, itu adalah throughput. Kartu VoxCPM2 mencantumkan faktor waktu nyata sekitar 0,30 dalam PyTorch standar pada RTX 4090, turun menjadi sekitar 0,13 di bawah Nano-VLLM. Faktor waktu nyata adalah detik komputasi per detik audio, jadi kedua angka tersebut berarti satu jam GPU menghasilkan sekitar 3,3 jam ucapan jadi pada kasus pertama dan sekitar 7,7 jam pada kasus kedua.

A screenshot of the Hugging Face model card for openbmb/VoxCPM2, tagged Text-to-Speech, VoxCPM, Safetensors, 30 languages, multilingual, voice-cloning, voice-design, diffusion and audio, with License: apache-2.0. The summary reads: 'VoxCPM2 is a tokenizer-free, diffusion autoregressive Text-to-Speech model - 2B parameters, 30 languages, 48kHz audio output, trained on over 2 million hours of multilingual speech data.' Highlights list 30-language multilingual input with no language tag, voice design from a natural-language description with no reference audio, controllable cloning from a short clip with optional style guidance, 48 kHz studio-quality output via AudioVAE V2's built-in super-resolution, context-aware synthesis, real-time streaming with an RTF as low as about 0.3 on an NVIDIA RTX 4090 and about 0.13 accelerated by Nano-VLLM, and an Apache-2.0 licence free for commercial use. The sidebar shows 341,299 downloads last month, 2B params, BF16, and a note under Inference Providers that the model is not deployed by any inference provider.

Dua konsekuensi langsung menyusul. Stack penyajian lebih penting daripada modelnya: checkpoint yang sama pada kartu yang sama lebih dari menggandakan outputnya ketika Anda menukar mesin inferensi, jadi model biaya apa pun yang menggunakan angka 0,30 melebih-lebihkan biaya self-hosted Anda sekitar 2,3 kali. Dan utilisasi adalah segalanya: kartu yang menganggur tidak mengalahkan API per karakter pada harga berapa pun, karena tagihan API bergantung pada apa yang Anda ucapkan, sedangkan tagihan kartu bergantung pada kapan Anda membelinya.

Itulah sebabnya versi jujur dari keputusan ini bukanlah "mana yang terdengar lebih baik". Melainkan "berapa jam audio yang Anda produksi per bulan, dan apakah perangkat kerasnya sibuk". Di bawah volume ketika sebuah kartu tetap termuat, API menang dan selisihnya tidak tipis. Di atasnya, pada perangkat keras yang sudah Anda miliki, biaya marginal checkpoint per seperseribu jam sama dengan biayanya untuk jam pertama — dan itu adalah keunggulan struktural yang tidak bisa ditandingi oleh daftar tarif mana pun.

Kemampuan yang tidak akan dijual oleh layanan hosted kepada Anda

Di sinilah perbandingan tidak lagi menjadi cerminan, karena ada satu hal yang VoxCPM2 lakukan yang secara fundamental tidak dapat dilakukan Eleven v4: Anda dapat melatih ulang model tersebut. Kartu model mendokumentasikan baik SFT penuh maupun fine-tuning LoRA pada audio sesingkat lima hingga sepuluh menit, dengan skrip pelatihan dan konfigurasi yang disediakan untuk masing-masing.

Itu mengubah bentuk sebuah program suara. API yang dihosting memberi Anda model tetap plus kemampuan kloning apa pun yang disediakan vendor — dalam kasus Eleven v4, sepuluh detik audio referensi untuk klon instan, dengan tier profesional di atasnya. Checkpoint yang dapat disetel LoRA memberi Anda model yang belum pernah melihat data siapa pun dan yang perilakunya dapat Anda kunci berdasarkan versi. Untuk suara merek, domain teregulasi, atau bahasa yang ditangani dengan buruk oleh koleksi suara vendor, itu adalah kategori solusi yang berbeda, bukan solusi yang lebih murah.

Trade-off ini eksplisit dan layak dinyatakan: dengan VoxCPM2, Anda menerima bahwa tidak ada pihak ketiga yang pernah menilai model ini, bahwa jaminan kualitas adalah sesuatu yang Anda bangun dan ukur sendiri, dan bahwa batas sekuens 8.192 token serta peringatan dari kartu itu sendiri — bahwa desain suara dan kontrol gaya bervariasi antar proses dan bahwa disarankan satu hingga tiga generasi — kini menjadi masalah QA Anda.

Apa yang diberikan Eleven v4 kepadamu yang tidak dapat diberikan checkpoint

Sebaliknya, keunggulan model hosted adalah keunggulan yang tampak di kalender rilis, bukan di lembar spesifikasi.

• Peringkat terukur — pertama di papan dengan 1.674 sampel yang mendasari estimasi, dan interval sekitar ±19 poin di sekitarnya. Apa pun yang diukur papan itu, papan tersebut independen dari kedua vendor dan merupakan satu-satunya sinyal kualitas pihak ketiga dalam perbandingan ini.

• Arahan performa di dalam teks — tag audio inline seperti [tertawa], [berbisik] dan [diucapkan dengan marah dalam aksen Prancis], ditambah prompt penyampaian dalam bahasa alami dan dukungan Alfabet Fonetik Internasional yang ditingkatkan. Mendapatkan perubahan suasana hati dari model yang dihosting sendiri berarti regenerasi atau fine-tuning; di sini, itu hanyalah token di dalam skrip.

• Cakupan yang tidak perlu Anda verifikasi — 90 lebih bahasa versus 30 milik VoxCPM2, dengan catatan bahwa daftar checkpoint tersebut eksplisit dan disebutkan namanya (termasuk dialek-dialek Tionghoa) sementara "90 lebih" dari vendor hanyalah jumlah tanpa daftar.

• Tanpa permukaan operasional — tidak ada GPU, tidak ada tumpukan penyajian, tidak ada pergeseran versi, dan tarif promosi $0.022 per 1.000 karakter hingga 12 Oktober, dibandingkan tarif daftar $0.08 setelahnya.

A screenshot of Artificial Analysis' Eleven v4 model page, titled Eleven v4 Quality Elo, Speed & Price Analysis, credited to ElevenLabs and the ElevenLabs family with an Elo of 1318.77. The page presents Quality, Pricing and 1M Throughput views over the Provider Voice Arena Preference Elo, and the model selector reads '27 of 96 models'.

Tidak satu pun dari ini milik kami, dan itulah inti dari bagian ini.

OrcaRouter tidak menghosting keduanya. Tidak ada endpoint ElevenLabs dan tidak ada endpoint VoxCPM2 di katalog kami, dan jawaban routing yang jujur adalah bahwa Eleven v4 diakses melalui API milik ElevenLabs sendiri, sedangkan VoxCPM2 adalah sesuatu yang Anda deploy di perangkat keras Anda sendiri. Kami tidak akan menyiratkan sebaliknya demi membuat perbandingan tampak lebih rapi.

Yang benar-benar membantu dari satu kunci adalah keputusan sebelum keputusan. Alasan percakapan swa-hosting terhenti adalah alternatifnya tidak pernah dievaluasi: API hanyalah satu panggilan dan checkpoint adalah tumpukan penyajian, jadi API menang secara default alih-alih berdasarkan hitungan. Kontribusi OrcaRouter adalah bahwa bagian hosted dari perbandingan itu murah untuk diuji — lebih dari 200 model di balik satu kunci API dengan harga daftar penyedia diteruskan pada markup 0%, sehingga opsi hosted dievaluasi pada tarif nyatanya, bukan tarif perkiraan, dengan failover otomatis jika Anda menempatkan kandidat di balik jalur aktif sebelum Anda selesai memutuskan.

Cara memutuskan sekali jalan

Pilih Eleven v4 jika suaranya harus bagus pada take pertama dan Anda ingin ini selesai minggu ini. Anda mendapatkan posisi teratas di papan independen, sintaks arahan yang terdokumentasi, jumlah bahasa terdokumentasi paling banyak dalam perbandingan ini, dan tanpa infrastruktur. Anda membayar $0,08 per 1.000 karakter mulai 13 Oktober dan seterusnya, serta menerima bahwa Anda tidak dapat melatihnya ulang, menyematkan versinya, atau menyimpan audio di perangkat keras Anda sendiri.

Pilih VoxCPM2 jika modelnya harus milik Anda. Apache 2.0, 2B parameter pada sekitar 8 GB VRAM, keluaran 48 kHz tanpa upsampler dalam rantai, dan jalur fine-tuning yang berjalan pada lima hingga sepuluh menit audio — itu adalah kemampuan yang tidak ditawarkan endpoint ter-hosting pada harga berapa pun, dan tidak adanya baris arena adalah harga yang harus dibayar untuk kemampuan tersebut. Jalankan angka throughput pada kartu grafis Anda sendiri sebelum Anda memutuskan, karena faktor real-time 0,30 dan 0,13 adalah pengukuran dari model card itu sendiri dan stack serving Anda tidak akan mereproduksinya secara persis.

Dan jika jawaban jujurnya adalah Anda tidak tahu volume audio bulanan Anda, itulah angka yang harus Anda cari. Itu yang menentukan perbandingan ini. Tidak ada board yang akan memberi tahu Anda.