
Gemini 3.8 TTS vs VoxCPM2:音声を借りるか、それとも自分で動かすか、実際の数字で比較
- openaiNEWOpenAI: GPT-6 Luna2026-09-2237知能
- openaiNEWOpenAI: GPT-6 Sol2026-09-2248知能
- anthropicNEWAnthropic: Claude Opus 5.52026-09-2258知能
- grokNEWGrok 4.72026-09-2146知能
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100万トークンあたり
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- openaiOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- googleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- anthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1244知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0540知能72コーディング
- qwenQwen: Qwen3.8 Max2026-08-0345知能76コーディング
{{2}}Gemini 3.8 Flash TTS{{/2}}{{3}}と{{/3}}{{4}}VoxCPM2{{/4}}を並べて表示するリーダーボードの行は存在せず、Gemini 3.8 Flash TTSとVoxCPM2その不在こそがこの比較において最も有用な事実である。Gemini 3.8 Flash TTS は、Artificial Analysis Provider Voice Arena で Elo 1,260・ランク2のホスト型エンドポイントであり、トークン単位の料金表が公開されている。VoxCPM2 は OpenBMB のチェックポイントで、20億パラメータ、Apache 2.0、2026年4月リリースだが、これをホストする推論プロバイダーは一つもない。レンタルはできない。自分で動かすのだ。
つまり問題は、どのモデルの音声が優れているかではない。あなたのワークロードにとって、他人のGPUを文字数単位で支払って使う方が適しているのか、それともGPUを所有し、稼働していようとしていまいと費用を払う方が適しているのか、ということだ。これは算数の問題であり、ほとんどのモデル比較とは違い、契約する前に計算できる答えがある。

これらのうち、片方はレンタルし、もう片方は操作します。
まず、それぞれが実際にあなたに手渡してくれるものから始めましょう。
• アクセス — Gemini 3.8 Flash TTS は API 専用であり、Gemini API および 2026年9月23日の発表で挙げられた Google の各サーフェスを通じて呼び出されます。VoxCPM2 には本番環境で使用されているファーストパーティのエンドポイントがなく、それを提供する推論プロバイダーも存在しません。チェックポイントそのものが製品です。
• ライセンス — VoxCPM2 は Apache 2.0 の下で提供されており、別途契約を結ぶことなく商用利用が認められています。これは真に寛容なライセンスであり、オープンな音声ウェイトにとって既定の選択肢ではありません。そうしたウェイトのいくつかは研究目的限定の条件で提供されており、商用利用はホスト型 API を経由する仕組みに回されています。
• サイズ — VoxCPM2は20億パラメータで、開発用途では精度を下げれば約8 GBのVRAMに収まり、サービング時のピークは24 GBのカードで約22 GBとなります。GoogleはGemini 3.8 TTSのどちらのモデルについてもパラメータ数を公表していません。
• 音声作成 — Gemini 3.8 Flash TTS は、書かれた説明から音声をデザインし、30秒のサンプルから音声を複製し、1回の呼び出しで2話者の対話を行います。VoxCPM2 は単一話者のテキスト読み上げモデルであり、会話は2回の実行をつなぎ合わせたものです。
• 独立したスコア — Flash TTS にはある。VoxCPM2 は、2026年9月24日に取得された Provider Voice Arena の順位付けされた行の中には見当たらない。ボードに掲載されていないことは品質に対する評価ではありません — 通常は誰もそのモデルをエントリーしていないという意味にすぎません — ただし、比較考量できる第三者の選好スコアが存在しないということは意味します。

その最後の点はどちらにも当てはまり、ごまかすよりも率直に述べておく価値がある。つまり、コミットする前に独立した品質のシグナルが必要なら、この二つのうちそれを提供するのは片方だけだ。
それを決める数字:リアルタイム係数
音声モデルをセルフホスティングすると、文字単位の請求がGPU時間単位の請求に変わり、これら2つの単位の為替レートはモデルのリアルタイム係数、つまり1秒の音声を生成するのに何秒の計算を要するかである。
VoxCPM2の公表値は、通常のPyTorchで0.30、Nano-VLLM環境下で0.13です。これらはレイテンシーではなくスループットとして読むべきです。0.13では、実時間のGPU 1時間あたり約7.7時間分の完成した音声が得られます。0.30では、同じGPU 1時間で3.3時間に近い量になります。これらはOpenBMBが測定したモデルカード自体の数値であり、ここで内製か購入かを判断するうえで、最も重要な判断材料となります。
そこから三つのことが導かれる。
• モデルよりもサービングスタックのほうが重要である。素のPyTorchからNano-VLLMへ移行すると、同一ハードウェア上でスループットが2倍以上になる。0.30という数値に基づいて構築されたコストモデルは、セルフホストのコストを約2.3倍過大評価することになる。
利用率こそがすべてだ。90%の時間アイドル状態にあるレンタルGPUは、どんな価格であれAPIより安くなることはない。カードを稼働させ続けて初めて、損益分岐点が現れる。
• バッチ処理はその計算の前提を再び変える。リアルタイム係数はストリーム単位で測定されるが、並行リクエストを処理するサーバーは固定コストをそれら全体で償却する。これはまさに、セルフホスティングが優位に立ち始める領域だ。
音声1時間のコスト、双方向とも
2つの課金モデルを同じ軸に載せて考えましょう。完成した音声の1時間とは、3,600秒分の出力です。
レンタル側では、Google は文字ではなくトークン単位で課金する。テキスト入力は100万トークンあたり $0.50、音声出力は100万トークンあたり $9.00(2026年12月31日まで)で、その後は $18.00 となる。Flash-Lite TTS は $0.50 と $6.00、その後は $12.00。Batch と Flex は、Flash TTS が $0.25 と $4.50、Flash-Lite TTS が $0.25 と $3.00、Priority は $0.90 と $16.00 です。Artificial Analysis は標準料金を100万文字あたり $16.50 と $11.00 に換算しているが、これは Google の提示額ではなくボードによる換算であり、文字単位で課金するモデルと比較する際に使うべき数値である。
自前運用側では、文字単位の課金はそもそも存在しない。コストはGPU時間であり、上記のスループットで必要となる時間数を掛けたものに、サービングスタック、さらにそれを動かし続ける人件費が加わる。VoxCPM2の利点は、1000時間目の限界費用が1時間目と同じであること――そして欠点は、1時間目の限界費用がGPU1台分であることだ。
だからこそ、この決定は異例なほど明確なのだ:
• 一定の処理量を下回ると、API の圧勝で、しかも大差だ。音声1時間あたり1桁台のドルを支払うのに対し、資本コストがかかる。そして Google のプロモーション料金が、2027年1月1日までその差をさらに広げる。
• その量を超えると、すでに所有していて常時稼働させておけるハードウェア上では、Apache 2.0 チェックポイントが決定的に優位に立つ — そして研究ライセンスのチェックポイントとは異なり、ライセンスのいかなる点もそれを出荷する妨げにはならない。
• その中間の場合、正直な答えとしては、あなたが買っているのは節約ではなく選択肢です。セルフホスティングは、バージョンを固定し、音声を自社インフラに保持し、ベンダーの料金変更を気にしなくなる能力を買うことになります。
それぞれが正解となる場合
よりドキュメントが充実した製品を求めるなら、Gemini 3.8 Flash TTS を選びましょう。独立したスコア、公開された価格、1回の呼び出しでの2話者ダイアログ、音声の設計と複製を備え、APIキー以外に運用面はありません。その兄弟的存在である Flash-Lite TTS は、同じインターフェース内で2つ目の価格帯を提供し、正規化した価格は100万文字あたり$11.00です。その代わりに受け入れることになるのは、2027年1月1日に倍になる料金と、モデルをどこでも実行できないことです。
運用面での作業そのものが目的なら、VoxCPM2を選ぼう。Apache 2.0なので商用利用はそのまま認められており、2Bという規模ならアクセラレータ1基で足り、Nano-VLLM下でのリアルタイム係数0.13は、控えめなカードでも実時間1時間あたり数時間分の音声を生成できることを意味する。その代わりに受け入れることになるのは、誰も代わりに動かしてはくれないという点だ。ホスト型エンドポイントも、アリーナの順位表も、ベンダーの料金表もなく、得られる品質保証はすべて自分で構築し、自分で測定するものになる。

どちらのモデルも OrcaRouter がホストしているわけではありません。これは、そうでないかのようにほのめかすのではなく、はっきりと言っておくべきことです。Gemini 3.8 Flash TTS を呼び出すべき場所は Google 自身の API と、Google が名指ししたサーフェスです。VoxCPM2 は、あなたがデプロイするチェックポイントです。OrcaRouter が担うのは、その判断の上のレイヤーです — 200 以上のモデルを 1 つのキーの背後にプロバイダー定価で、マークアップなしで利用できます。そのためベンダーが価格を変更しても、次の請求サイクルを待たずに当日のうちに当社側へ反映されます。自動フェイルオーバーにより、評価中のモデルを本番環境の依存対象にせずに済みます。また、1 つの音声だけでは仕事全体を担いきれないときに、複数のモデルを 1 回の呼び出しに組み合わせるルーティング DSL も備えています。
次に見るもの
二つのことがこの比較を大きく変えるだろうが、そのどちらもまだ起きていない。
一つ目は、誰かがVoxCPM2をホストしている場合です。推論市場にそれが存在しないことが、この二つのモデルが品質ではなく経済性で比較されている主な理由であり、もしプロバイダーがそれを採用すれば、レンタルか自前かの計算は決め手ではなくなり、欠けているアリーナの行こそが、埋まってほしいものになります。
第二の点は、Google側の1月の料金改定です。プロモーション料金では、APIはほとんどのワークロードにとって何かを自前でホスティングする必要がないほど安価です。プロモーション終了後の料金では、その差は、既存のGPUキャパシティと安定した処理量を持つチームが、APIが依然として有利だと決めつけるのではなく、もう一度試算すべきところまで縮まります。
それらのどれかが動くまでは、決め手となる入力はリーダーボードではない。それは、あなたが月に何時間の音声を制作するか、そしてカードがビジーかどうかだ。
