「GPT-Live-1 vs VoxCPM2」のヒーロータイトルカード。サブタイトルは「借りる会話か、自分が持つGPUか」、バッジの文言は「片方は全二重、片方はテキスト読み上げ — 役割が違う」、3枚のカード:「GPT-Live-1 — 音声1分あたり$0.05、APIのみ、インストール不要」「VoxCPM2 — Apache-2.0、2Bパラメータ、約8 GB VRAM、これをデプロイする推論プロバイダーはなし」「セルフホストのスループット — RTF 0.13でGPU1時間あたり約7.7時間分の音声、過去30日間で393,079ダウンロード」。その下のフッター帯の文言は「VoxCPM2のベンチマークはOpenBMBの報告値、GPT-Live-1の音声数値はOpenAIの報告値であり未再現」。OrcaRouterのロゴが右下に合成されている。
Engineering & Research

GPT-Live-1 対 VoxCPM2:一方は1分0.05ドル、もう一方は24 GB GPUが必要

著者

Elias Hawthorne

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

GPT-Live-1 と VoxCPM2 を比較する最も明快な方法は、ハードウェアに数字を当てはめるまでは、両者が競合相手に見えるだけだと気づくことだ。GPT-Live-1 は Ope​nAI の全二重音声モデルで、2026年9月10日から API で提供され、音声1分あたり $0.05、インストールは不要。VoxCPM2 は OpenBMB の20億パラメータのオープンウェイト音声合成モデルで、2026年4月に Apache 2.0 の下で公開され、約8 GB の VRAM で動作し、どの推論プロバイダーにもデプロイされていない——つまり使いたければ、マシンは自分で所有することになる。一方は秒単位で借りる会話で、もう一方は自分で操作する音声合成器だ。問題はどちらが優れているかではなく、自分のワークロードが実際にどちらを吸収できるかだ。

A two-column scoreboard titled 'GPT-Live-1 vs VoxCPM2 - the scoreboard'. Left column GPT-Live-1: 'Job: full-duplex conversation', 'Access: hosted API, no weights', 'Price: $0.05 per voice minute', 'Independent score: 69.8% on the AA Speech to Speech Index', 'Hardware you need: none', 'Catch: delegated reasoning bills separately'. Right column VoxCPM2: 'Job: text-to-speech', 'Access: Apache-2.0 weights, self-host only', 'Price: $0 per call plus a GPU', 'Independent score: none, OpenBMB benchmarks only and contested by third-party runs', 'Hardware you need: ~8 GB VRAM, 22 GB peak when serving', 'Catch: no inference provider deploys it'. Footer: 'GPT-Live-1 voice figures OpenAI-reported; VoxCPM2 figures are the model card's own.'

2つのモデル、2つの役割、それぞれに誠実なスペック1行

• 機能 — GPT-Live-1 は会話を成立させる。同時に聞きながら話し、ターンを取り、割り込みやあいづちを処理し、文字起こしを返す。VoxCPM2 はテキストを音声に変換する。音を聞くことは決してない。

• アクセス — GPT-Live-1 はホスト型かつクローズドで、Live Sessions エンドポイントの背後にモデル ID が 1 つあり、公開されている統合例は WebRTC 上で動作します。VoxCPM2 は Hugging Face と ModelScope でダウンロード可能なチェックポイントで、Apache 2.0、商用利用無料です。

• 料金 — GPT-Live-1は音声1分あたり0.05ドルで、秒単位で課金され、委譲バックエンドは別途従量課金されます。VoxCPM2は1回の呼び出しあたり0ドルに加えてGPUが必要で、オープンソースのホスティングがコストモデルのすべてです。

• フットプリント — GPT-Live-1 はあなたのハードウェアを必要としません。VoxCPM2 には約 8 GB の VRAM(Q4 で 6~8 GB)、Python 3.10 以上、PyTorch 2.5 以上、CUDA 12 以上が必要です。

• ベンチマーク — GPT-Live-1 の音声に関する数値はすべて OpenAI のもので、再現されていない。唯一の独立系ボードでは、11 件中 7 位とされている。VoxCPM2 の公表数値は OpenBMB のものであり、その多言語に関する主張について存在する独立測定は逆の方向を示している。

24GBの問い、価格がつく

VoxCPM2のサービング数値は、セルフホスティングが趣味なのかアーキテクチャなのかを決めるものだ。単一のRTX 4090上で、このモデルは素のPyTorchでリアルタイムファクター約0.30、Nano-VLLM経路で約0.13で動作する。つまり高速な構成では、GPU時間1時間あたり約7.7時間分の音声を生成できる。これらは外部測定ではなく、モデルカード自身の数値である。CUDA 12.9を搭載した4090で検証された独立したサービングレシピでは、ゼロショット合成で定常状態のリアルタイムファクターが約0.120、クローニングで約0.139、ピークGPUメモリは24 GB中約22 GBと報告されている。どちらの数値も定常状態であり、コールドスタートではない。新しいプロセスでの最初のリクエストははるかに遅く、モデルは使えないと言う人々が引用するのはその数値だ。

それをAPIと並べてみよう。GPT-Live-1は1分$0.05で、1時間連続で会話すると$3.00になる。24 GBカードを公開市場で借りると1時間あたり1桁台前半のドルに収まり、1枚を所有する場合も、稼働率を考慮に入れれば同程度に償却される。つまり比較は、こうした比較がたいてい落ち着くところに落ち着く。ただし、1つ不快な非対称性がある。GPUの請求は、誰かがあなたの製品に話しかけようと話しかけまいと発生し、APIの請求は、静かな日にはゼロまで、忙しい日には5桁までスケールする。固定カタログのバッチ合成はGPUにうってつけだ。常時接続の電話回線は従量メーターにうってつけだ。

VoxCPM2が、他のどのオープンなものにもできないこと

VoxCPM2がこれほど注目に値する理由は、ベンチマークで勝っているからではない——ほとんどの場合、勝ってはいない——が、参照音声をまったく使わずにテキスト記述から声を設計するからだ。これはオープンウェイトにおいて真に新しい能力であり、まだ存在しない声を必要とするすべての人にとってワークフローを変える。文章で試聴し、文章で反復し、それからクローンすべきかどうかを決めればよい。その周辺には、30言語と9つの中国語方言、内蔵の超解像ステージによる48 kHz出力、そしてわずか5–10分の音声でのファインチューニングが積み重なっている。

根拠となるデータは、機能リストよりも薄い。OpenBMB自身の報告では、英語の単語誤り率が1.84%、中国語の文字誤り率が0.97%で、自社の言語あたり500発話のセットで測定し、別ベンダーのモデルで採点した30言語の平均誤り率は1.68%だとしている。独立したテストがある場合、その差は大きい。MiniMaxの多言語テストセットをWhisper-large-v3で採点すると、ヒンディー語は19.70、アラビア語は13.05となり、自己申告の数値より何倍も悪い。OpenBMBはまた、音声設計とスタイル制御は実行ごとに結果が変動すると警告し、望む出力を得るには1~3回生成することを提案している。これは、使える結果を得るための呼び出しあたりのコストが1回では済まない、という遠回しな言い方である。

誰も比較に入れない「統合税」

VoxCPM2 が1週間の作業で済むか1か月かかるかを決める、地味な細部が1つある。その Hugging Face リポジトリは voxcpmではなくtransformersとタグ付けされている。つまり、あのサイト上のほぼすべての他のものが読み込みに使っているライブラリでは、このモデルを読み込めない。それを修正するプルリクエストは2026年8月4日に開かれ、最後に確認した時点ではまだマージされていなかった。他のサービングスタックに追加するプルリクエストはマージ済みで、採用状況に疑問の余地はない。このキャプチャ時点で過去30日間に393,079回ダウンロードされており、27個のアダプター、30個のファインチューン、12個の量子化、そして100個の Spaces がこのチェックポイントの上に構築されている。

A screenshot of the Hugging Face model card for openbmb/VoxCPM2, captured September 2026: 'VoxCPM2 is a tokenizer-free, diffusion autoregressive Text-to-Speech model - 2B parameters, 30 languages, 48kHz audio output, trained on over 2 million hours of multilingual speech data', with 1.6k likes, 4.95k followers, 393,079 downloads last month, 2B params in BF16, 27 adapter models, 30 finetunes, 12 quantisations, and an Inference Providers panel reading 'This model isn't deployed by any Inference Provider.'

GPT-Live-1における同等の負担は、トランスポートの書き換えです。そのセッションは、リクエスト/レスポンス型の音声エンドポイントではなく、ライブ接続を中心に構築されており、二重メーター課金では、委任された推論呼び出し、ツール呼び出し、Web検索のたびに、音声の分単位料金に加えてバックエンドモデル自身の料金で課金されます。トークン計量制のリアルタイム統合から移行するチームは、この移行をモデルIDの差し替えではなく、エンジニアリング作業として予算に組み込むべきです。

ルーティング層が実際に役立つ場面

OrcaRouterはGPT-Live-1もVoxCPM2も取り扱っていません。そして、このセクションの残りがそうでないかのように示唆してしまう前に、そのことをはっきり言っておく価値があります。GPT-Live-1の音声レイヤーはOpenAI自身のエンドポイントの背後にあり、VoxCPM2にはホスト型プロバイダーがまったくありません。どちらも、当社のキーで呼び出せるものではありません。

ルーティングの話が今も出てくるのは、どちらのモデルも、中間がテキストであるパイプラインの端に位置しているからだ。VoxCPM2 のデプロイは通常、何かに対して応答している — スクリプト生成器、翻訳ステップ、テキストノーマライザー、次に何を話すかを決める対話モデル — そしてそれらはごく普通のモデル呼び出しだ。GPT-Live-1 のセッションは、その思考をセッション設定で指定されたバックエンドモデルに委譲しており、Ope​nAI 自身のドキュメントではそのバックエンドは GPT-5.6 Terra で、OrcaRouter を通じて Ope​nAI の定価で利用できる。クライアント委譲はさらに踏み込み、自社アプリケーションがバックエンドを提供できるようにする。つまり、音声の背後にあるモデルは、あなたが管理する任意のエンドポイントでかまわない。11 の上流プロバイダーからの約 190 のモデルが 定価でマークアップゼロの 1 つのキー の背後に並んでいる — だからプロバイダーが値下げすれば、その値下げは更新時ではなく同じ日にここで反映される — さらにプロバイダー間の自動フェイルオーバーと、複数のモデルを 1 回の呼び出しに組み合わせるためのルーティング DSL も備わっている。最も頻繁に変わるスタックの半分に対する、安価な保険だ。

このセクションには、埋もれさせるのではなく、ひとつの注意書きを置くべきです。なぜなら、それがこの比較の GPT-Live-1 側を、ベンダーのベンチマークが示すよりも不確かにしている細部だからです。独立系の Artificial Analysis Speech to Speech Index では、GPT-Live-1 は 69.8% で、11 件中 7 位であり、73.9% の GPT-Realtime-2.1 と 79.0% の Gr​ok Voice Think Fast 2.0 に後れを取っています。このモデルは、入力音声 1 時間あたり $4.42 でそのランキング上最も安価ですが、最良ではありません。標準化する音声レイヤーが、その後も使い続けるものになるとは限らない可能性を織り込んでおいてください。

A screenshot of the Artificial Analysis Speech to Speech Index chart updated September 2026: Grok Voice Think Fast 2.0 79.0%, GPT-Realtime-2.1 73.9%, GPT-Realtime-2 73.6%, Grok Voice Think Fast 72.3%, Gemini 3.1 Flash Live 71.5%, GPT-Live-1 mini 70.3%, GPT-Live-1 69.8%, Qwen-Audio-Omni 66.8%, RealTime Omni 64.2%, Qwen 3.x Omni 63.9%, Gemini 2.5 Flash 52.6%, with a cost chart placing GPT-Live-1 at $4.42 and GPT-Realtime-2.1 at $10.75 per hour of input audio.

どちらが、何のために?

テキストが音声より先に存在するなら、VoxCPM2を選ぼう。ナレーション、オーディオブック、吹き替え、アクセシビリティ、ゲームのボイスライン、まだ誰も録音していない声を必要とする製品——そして特に、量が多く、予測可能で、固定の資本コストに見合うあらゆる業務。自分で運用すること、周辺ツールがまだ固まっていないこと、多言語品質の主張は顧客に届く前に自分の耳でテストする価値があることを受け入れよう。

相手が人間なら、GPT-Live-1を使う。音声エージェント、電話サポート、受付フロー、その他モデルが人間が話し終えたかどうかをリアルタイムで判断しなければならないものすべて。問題を抱え込まないという特権のために分単位の料金を払い、委任したバックエンドは別項目として予算計上する。通話が安くも高くもなるのは、そこだからだ。

間違いは、それらを比較検討の場における代替案として扱うことだ。両方を必要とするほとんどのチームにとって、それらは同じ製品の2つの層であり、唯一本当に誤った答えは、ライセンスが無料だと言っているという理由だけで、それを実現可能にするGPUのコストを見積もらずにセルフホスト版を選ぶことだ。