ElevenLabs Eleven v4 対 VoxCPM2 の生成ヒーローカード。2つのパネルで構成:ElevenLabs Eleven v4 はホスト型エンドポイントで、Elo 1,319、ランク1、100万文字あたり$80.00。VoxCPM2 は Apache-2.0 チェックポイントで、2Bパラメータ、48 kHz出力、アリーナ行なし。フッター:「Eleven v4のランクと価格はArtificial Analysis(2026年9月)による。VoxCPM2の仕様はOpenBMBモデルカードによる。」OrcaRouterのロゴは右下隅に配置。
Guides & Insights

Eleven v4 対 VoxCPM2:レンタルできないチェックポイントに対するランク付けされたモデル

著者

Rowan Sterling

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

この対決で最も有用な事実は、存在しない行である。ElevenLabs Eleven v4は、Artificial AnalysisのProvider Voice Arenaにおいて、1,674回の登場を通じてElo 1,319で首位に立ち、価格は100万文字あたり80.00ドルである。VoxCPM2は、2026年4月に公開されたOpenBMBのチェックポイントだが、どちらの音声ボードにもどこにも現れない——ランク入りもしておらず、ランク外でもなく、プレビュー項目としても存在しない。それは品質に対する判定ではない。つまり、1,319と比較したいと考えていたその数値を、誰もまだ出していないということだ。そして比較は、好み以外の何かによって行わなければならない。残るのは、所有権、ファインチューニング、そしてホスト型エンドポイントでは問い合わせることさえできないライセンスの問題である。

それぞれの側が実際にあなたに手渡すもの

これらは製品の異なるクラスであり、その違いは表面的なものではない。

• アクセス — Eleven v4 は ElevenLabs 独自の API を通じてアクセスするホスト型エンドポイントで、文字単位で課金されます。VoxCPM2 は Hugging Face 上の openbmb/VoxCPM2 にあるチェックポイントです。ダウンロードして実行するもので、呼び出せるファーストパーティのエンドポイントはありません。

• ライセンス — VoxCPM2 は Apache 2.0 で提供され、商用利用が明示的に自由です。Eleven v4 は ElevenLabs の規約に従う商用 API です。この違いは、ファインチューニング、再配布、重みの配布が許されるかを法務レビューで問われる場合に重要になります。チェックポイントがあれば、答えは明文化されており、固定的です。

• サイズとハードウェア — VoxCPM2 は MiniCPM-4 をバックボーンとする 2B(20億)パラメータのモデルで、仕様表には bfloat16 で約 8 GB の VRAM、最大シーケンス長は 8,192 トークンと記載されています。ElevenLabs は Eleven v4 のパラメータ数を公開しておらず、ホスト型モデルのハードウェアフットプリントは自分で管理するものではありません。

• 出力チェーン — VoxCPM2 は 16 kHz の参照音声を受け取り、AudioVAE V2 内蔵の超解像によって 48 kHz を出力します。経路に外部アップサンプラーはありません。ホスト型 TTS は、ベンダーが選んだ任意のレートでストリームを渡してきます。

• 独立スコア — Eleven v4 にはそれが1つあり、しかも首位だ。VoxCPM2 にはない。不在は低スコアではない。それは未採点のモデルであり、後者が数値であるかのように、両者を同じ文の中で語るべきではない。

A generated scoreboard comparing ElevenLabs Eleven v4 and VoxCPM2 across six dimensions: arena rank (1, Elo 1,319 against not on the board), price ($80.00 per 1M characters against no per-character rate), licence (vendor API terms against Apache 2.0 for commercial use), voice creation (clone from 10 s of audio against voice design and cloning), languages (90-plus against 30) and operations (none, it is hosted, against your own GPU at about 8 GB). Footer: 'Eleven v4 figures per Artificial Analysis and vendor docs; VoxCPM2 figures per the OpenBMB model card.' The OrcaRouter logo sits in the bottom-right corner.

欠落したEloを置き換える数値

好みを比較できないなら、計算できるものを比較しよう。セルフホスト型モデルにとって、それはスループットだ。VoxCPM2のモデルカードには、RTX 4090上の標準PyTorchでリアルタイム係数が約0.30、Nano-VLLMでは約0.13まで下がると記載されている。リアルタイム係数とは音声1秒あたりに必要な計算秒数のことなので、この2つの数値は、1 GPU時間で最初のケースではおよそ3.3時間分の完成した音声が得られ、2番目のケースでは約7.7時間分が得られることを意味する。

A screenshot of the Hugging Face model card for openbmb/VoxCPM2, tagged Text-to-Speech, VoxCPM, Safetensors, 30 languages, multilingual, voice-cloning, voice-design, diffusion and audio, with License: apache-2.0. The summary reads: 'VoxCPM2 is a tokenizer-free, diffusion autoregressive Text-to-Speech model - 2B parameters, 30 languages, 48kHz audio output, trained on over 2 million hours of multilingual speech data.' Highlights list 30-language multilingual input with no language tag, voice design from a natural-language description with no reference audio, controllable cloning from a short clip with optional style guidance, 48 kHz studio-quality output via AudioVAE V2's built-in super-resolution, context-aware synthesis, real-time streaming with an RTF as low as about 0.3 on an NVIDIA RTX 4090 and about 0.13 accelerated by Nano-VLLM, and an Apache-2.0 licence free for commercial use. The sidebar shows 341,299 downloads last month, 2B params, BF16, and a note under Inference Providers that the model is not deployed by any inference provider.

2つの帰結が直ちに導かれる。モデルよりもサービングスタックの方が重要だ。同じカード上の同じチェックポイントでも、推論エンジンを差し替えるだけで出力が2倍以上になる。したがって、0.30という数字を使うコストモデルは、セルフホスト費用を約2.3倍過大評価している。そして稼働率がすべてだ。遊んでいるカードは、どんな価格でも文字単位課金のAPIには勝てない。APIの請求額は「何を話すか」に応じて増えるのに対し、カードの請求額は「いつ買ったか」に応じて増えるからだ。

だからこそ、この判断の正直な形は「どちらの音が良いか」ではない。「月に何時間の音声を制作するのか、そしてハードウェアは稼働中か」だ。カードがロードされたままになる量を下回るなら、APIの勝ちで、しかもその差は僅かではない。それを上回るなら、すでに自分が所有しているハードウェア上では、チェックポイントの1000分の1時間あたりの限界コストは最初の1時間あたりのコストと同じになる——そしてそれは、どんな料金表もかなわない構造的優位だ。

ホスト型エンドポイントが決して売ってくれない能力

ここで比較は鏡像ではなくなります。なぜなら、VoxCPM2にはできてEleven v4には根本的にできないことが1つあるからです。それは、再トレーニングできることです。モデルカードには、わずか5~10分の音声による完全SFTとLoRAファインチューニングの両方が記載されており、それぞれにトレーニングスクリプトと設定が提供されています。

それはボイスプログラムの形を変える。ホスト型APIでは、固定モデルに加えて、ベンダーが公開しているクローニング機能——Eleven v4の場合、インスタントクローン用に10秒の参照音声、その上にプロフェッショナルティア——が使える。LoRAでチューニング可能なチェックポイントなら、他人のデータを一切見ていないモデルが手に入り、その挙動をバージョンで固定できる。ブランドボイス、規制対象領域、あるいはベンダーのキャストが苦手とする言語にとって、それはより安価な解決策ではなく、別カテゴリの解決策だ。

このトレードオフは明白で、明言する価値がある。VoxCPM2を使うなら、第三者がこれまで一度もこのモデルを評価したことがないこと、品質保証は自分で構築して測定するものだということ、そして8,192トークンのシーケンス制限とカード自体の警告——音声デザインとスタイル制御は実行ごとに変動し、1~3回の生成が推奨される——が今や自分のQA問題になることを受け入れることになる。

Eleven v4が提供する、チェックポイントにはできないもの

逆に言えば、ホスト型モデルの利点は、スペックシートではなくリリースカレンダーに現れるものだ。

• 測定に基づくランキング — 推定を支える1,674件のサンプルがあるボードで第1位、その前後にはおよそ±19ポイントの区間がある。そのボードが何を測定していても、それは両ベンダーから独立しており、この比較における唯一の第三者による品質シグナルである。

• テキスト内での演技指示 — 次のようなインライン音声タグ:[笑い]、[ささやき]、[フランス語訛りで怒って言う]に加えて、自然言語による話し方プロンプトと、改善された国際音声記号サポート。セルフホスト型モデルで気分の変化を引き出すには、再生成かファインチューニングが必要だが、ここではスクリプト内のトークン1つで済む。

• 検証する必要のないカバレッジ — VoxCPM2の30に対して90以上の言語。ただし、チェックポイントのリストは明示的で名前も挙げられており(中国語の方言を含む)、一方でベンダーの「90以上」はリストのない単なる数である点には注意。

• 運用面は一切なし — GPU も、サービングスタックも、バージョンのずれもなく、10月12日までは1,000文字あたり0.022ドルのプロモーション料金、それ以降は通常料金0.08ドルです。

A screenshot of Artificial Analysis' Eleven v4 model page, titled Eleven v4 Quality Elo, Speed & Price Analysis, credited to ElevenLabs and the ElevenLabs family with an Elo of 1318.77. The page presents Quality, Pricing and 1M Throughput views over the Provider Voice Arena Preference Elo, and the model selector reads '27 of 96 models'.

これらのどちらも私たちのものではなく、それこそがこのセクションの要点です。

OrcaRouterはどちらのモデルもホストしていません。当社のカタログにはElevenLabsのエンドポイントもVoxCPM2のエンドポイントもありません。正直なルーティングの答えは、Eleven v4はElevenLabs自身のAPIを通じて利用され、VoxCPM2は自身のハードウェアにデプロイするものだというものです。比較をすっきり見せるために、そうでないかのように示唆するつもりはありません。

単一のキーが実際に役立つのは、決断の前の決断においてです。セルフホスティングの検討が行き詰まるのは、代替案が決して評価されないからです。APIは1回の呼び出しで済み、チェックポイントはサービングスタックを要するため、APIは算術的な比較ではなく既定値として選ばれてしまいます。OrcaRouterの貢献は、その比較におけるホスト型の側を安価に検証できるようにした点にあります — 200以上のモデルが1つのAPIキーの背後にあり、プロバイダーの定価が0%のマークアップでそのまま適用されるため、ホスト型の選択肢は推定レートではなく実際のレートで評価できます。さらに自動フェイルオーバーにより、判断を下し終える前に候補を稼働中のパスに配置することもできます。

一発で決める方法

音声が一発目で良い出来でなければならず、今週中に仕上げたいなら、Eleven v4 を選ぼう。独立系リーダーボードの首位、文書化されたディレクション構文、この比較で最も多い文書化済み言語数、そしてインフラ不要が手に入る。10月13日以降は1,000文字あたり$0.08を支払い、再トレーニングも、バージョン固定も、音声を自前のハードウェアに保持することもできないことを受け入れる。

モデルを自分たちのものにしなければならないなら、VoxCPM2を選んでください。Apache 2.0、約8 GBのVRAMで動く2Bパラメータ、チェーン内にアップサンプラーを挟まない48 kHz出力、そして5〜10分の音声で実行できるファインチューニング経路——これらはホスト型エンドポイントがいくら払っても提供しない能力であり、アリーナの行が存在しないことはその代償です。導入を決める前に、自分のカードでスループットの数値を測ってください。0.30と0.13というリアルタイム係数はモデルカード自身の測定値であり、あなたのサービングスタックがそれらを正確に再現することはないからです。

そして、もし正直な答えが、自分の月間オーディオボリュームを知らないというものであるなら、それが探しに行くべき数字です。この比較を決めるのはその数字です。どちらのボードも、そのことは教えてくれません。