
GPT-Live-1 対 NVIDIA Nemotron VoiceChat 11B:分単位の課金か、それとも 80 GB GPU か
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-10$0.15 / $0.60 100万トークンあたり
- openaiNEWOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- googleNEWGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- qwenNEWQwen: Qwen3.8 Max (0902)2026-09-0240知能72コーディング
- anthropicNEWAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 100万トークンあたり
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1244知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0540知能72コーディング
- qwenQwen: Qwen3.8 Max2026-08-0340知能72コーディング
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135知能69コーディング
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100万トークンあたり
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451知能78コーディング
- googleGoogle: Gemini 3.6 Flash2026-07-2134知能69コーディング
GPT-Live-1 と NVIDIA Nemotron VoiceChat 11B のどちらを選ぶかは、2 つの音声モデル間の選択ではない。それは、音声モデルを衣装としてまとった 2 つのビジネスモデル間の選択である。GPT-Live-1 はホスト型 API であり、OpenAI が 2026 年 9 月 10 日に開発者向けアクセスへと移行したもので、音声 1 分あたり 0.05 ドルで課金され、あなたのハードウェアは一切関与しない。NVIDIA Nemotron VoiceChat 11B——NVIDIA-NemotronLabs-VoiceChat-11B として公開され、2026 年 7 月 21 日付の NGC コンテナと、それに並ぶ Hugging Face チェックポイントを伴う——は、110 億パラメータのオープンウェイト全二重音声モデルであり、80 GB 未満の GPU では動かない。一方は会話の 1 分ごとにお金がかかり、もう一方は誰も通話をしようがしまいがお金がかかる。
損益分岐点は、ベンダーの資料が示唆するよりもシンプルだ
まず、双方が一致するその一つの数字から始めましょう。GPT-Live-1 は 1分 $0.05 で、連続したオープン回線 1時間なら $3.00 です。それが、常時接続の音声会話1回分の価格です。
では、代替案のコストを見積もってみよう。Nemotron VoiceChat 11Bには、少なくとも80 GBのVRAMを備えたGPUが必要だ——A100、H100、H200、B100、B200、またはRTX 6000クラスのカードで、Linux上で動作する。そうしたものを公開市場でレンタルすると、1時間あたり1桁台前半のドルになる。所有した場合も、稼働率を考慮すれば、同程度の金額に償却される。つまり、常時オンの音声回線1本はほぼトントンだ。レンタルGPUのコストは、その上で何かを動かすために支払う前の時点で、APIのコストとほぼ同じになる。
それは誤った比較であり、ほとんどの内製か購入かの記事がそこで止まってしまう比較だ。正しい比較は行単位ではなくGPU単位であり、NVIDIAがまだ公表していないある数字にかかっている。
• Tier 1アカウントでのGPT-Live-1 — 25同時セッション、これは25回線すべてが稼働している場合で、1分あたり$1.25、つまり1時間あたり$75
• 1枚の80 GB GPU上のNemotron VoiceChat 11B — 11BのハイブリッドMamba/Transformerモデルが80 GBに収まるだけの同時セッション数を、カードのレンタル費用とほぼ同程度で
80GBのアクセラレータ上で動く11Bモデルにはかなりの余裕があり、80GBという要件は実運用において非常に大きなバッチ処理能力をもたらす。1枚のカードが同時に6件の会話を処理できるだけでも、フル負荷時にはセルフホスティングはAPIより劇的に安くなる。1.5件しか処理できなければ、そうはならない。実トラフィックで同時実行性をベンチマークするまでは、正直なところ、損益分岐点は大量利用時のセルフホスティングに有利である可能性が高く、それを証明する数字をどちらのベンダーも示していない、という立場になる。

オープンモデルが単に安いだけでなく、本当に優れている場合
レイテンシーの比較は、価格の比較よりも慎重に扱うに値する。この軸では、オープンモデルの方がより良い証拠を持っているからだ。
• 発話交代レイテンシ — Nemotron VoiceChat 11B は Full-Duplex-Bench 1.0 において、スムーズな発話交代で 448 ms、割り込み・譲渡レイテンシで 480 ms、ユーザー割り込み時の主導権取得率 1.00 を報告している。GPT-Live-1 の数値は 0.8 秒で、OpenAI の報告によれば 1.4 秒から減少した。
その2つの数字を、出典が付いた状態で並べて読むと、見え方が反転する。NVIDIAの数値は、公開され、公的に仕様が定められたベンチマークスイートから出ている。OpenAIの数値はOpenAI自身から出ており、新モデルを自社の前世代と比較したもので、独立に再現されたものではない。入手できる証拠に基づけば、オープンウェイトモデルは、音声エージェントを人間らしく感じさせる要素において計測可能なほど高速であり、ホスト型モデルが高速だと言えるのは自社の広報資料においてのみだ。
NVIDIAはまた、ある初の取り組みも主張している。Nemotron VoiceChat 11Bは、会話中のリアルタイムなツール呼び出しをサポートする初のオープンな全二重モデルと説明されており、別個の出力チャネルと事前設定された保留フレーズを使うことで、エージェントが外部APIを待つ間も話し続けられるようにする。モデルカードには3つの音声サンプルが同梱され、まさにその点——約450 msの応答とされる自然なターンテイキング、モデルが即座に譲る割り込み発話(barge-in)、会話の途中でライブに呼び出されるツール——に耳を傾けるよう促している。これらのサンプルはベンダーのものであり、448 msという数値を独立に検証するものではなく裏付けるものにすぎないが、少なくとも発表記事の中の数字ではなく、ダウンロード可能なチェックポイントに付随する可聴の証拠ではある。これはGPT-Live-1が委任によって解決しているのと同じアーキテクチャ上の問題であり、答え方は異なる——オープンモデルは自ら回線を維持し、ホスト型モデルはタスクを別の推論モデルに引き渡し、音声レイヤーに会話を継続させる。
相違点と同じくらい、類似点も示唆に富む。どちらも全二重方式で、つまり交代で話すのではなく、話しながら聞く。どちらも割り込みとバージインに対応している。どちらも、旧来のカスケード型ASR→LLM→TTSパイプラインが、互いにボルトで留め合わせた3つの別々の製品のように見えてしまうほどの規模の音声で訓練されており、NVIDIAのチェックポイントは約55万時間分の音声を学習している。

あなたが犠牲にするもの、それはお金だけではない
オープンモデルで最初に諦めることになるのは音声です。公開されているチェックポイントは Aria という単一の固定音声を使用しており、ボイスクローニングや音声ライブラリには対応していません。GPT-Live-1 には、異なるアクセント、方言、言語にわたる12種類の音声が搭載されており、OpenAI はそれらをこのモデル専用にリマスターしました。あなたの製品の音声がそのアイデンティティの一部である場合、あるいは1回のデプロイから異なる声のエージェントで複数の市場にサービスを提供する必要がある場合、これだけでほぼ失格です。しかもこれは、スペック比較で最も見えにくい制約です。機能数のように見えて、製品上の判断のようには見えないからです。
2つ目に諦めることになるのは、コンテキストの上限です。このモデルには、学習時の発話制限である約142秒という上限と、約2分を超える音声コンテキストを保持するうえでの実用上の制約があります。20分続く電話通話は、このチェックポイントにとって1つの連続したコンテキストではありません。それは、周囲のシステムが管理しなければならない一連のセグメントです。ホスト型モデルは通常、そうした管理作業を代わりに引き受けてくれます。
三つ目は、それを使って何が許されるかです。Hugging Faceのモデルカードにはopenmdw-1.1ライセンスが記載されている一方、リリースに関する一部の報道は研究用途限定と表現し、NGCコンテナのページはコンポーネントを商用または非商用利用に使えるものとして位置づけています。三つの情報源、三つの異なる解釈、そして拘束力を持つのはライセンス本文だけです。このような不一致は、ローンチの3週間前に法務レビューで表面化する類のものです。作る前に解決してください、後ではなく。
4つ目は運用です。80 GBのGPUは、静かな日曜日に電源を切れるような費目ではありません。トラフィックがゼロでもカード代は払い続けますし、スケーリング曲線、ドライバーのアップグレード、容量計画、そして接続が切れれば顧客を失うことになるリアルタイム音声経路のオンコールローテーションまで、すべて自分で背負うことになります。そこへ至るまで頼れるホスト型のフォールバックもありません — Hugging Faceのモデルカードの推論プロバイダー欄には、このモデルがいかなる推論プロバイダーによってもデプロイされていないと明記されているため、このチェックポイントをプロトタイプ用に試せる分単位課金の版は存在しません。セルフホストするか、使わないかのどちらかです。その作業は分単位の比較では見えず、採用計画では非常にはっきりと見えます。
ほとんどのチームが実際に検討すべきハイブリッド
この決定を扱いやすくする枠組みは、2つのモデルが二者択一である必要はないという点にある。音声エージェントは通常、音声レイヤーと推論レイヤーを持ち、柔軟性があるのは推論レイヤーである。
GPT-Live-1は、設計上そもそもこうした作りになっています。その音声レイヤーが会話を途切れさせずに保つ一方で、思考の部分はResponses APIを通じて通常のテキストモデルに委譲されます。OpenAI自身が公開しているWebRTCのサンプルでは、そのバックエンドをGPT-5.6 Terraに接続しています。スタックのこの半分はごく普通のAPI呼び出しで、トークン単位の課金となり、ベンダーを実際に選べます。GPT-5.6 TerraはOrcaRouter経由で提供され、入力100万トークンあたり$2.00、出力100万トークンあたり$12.00、コンテキストは100万トークンで、/v1/chat/completionsと/v1/responsesの両方が公開されており、1つのキーで到達できるおよそ190の他のモデルと並んでいます。
これは特にセルフホスティングプロジェクトにとって重要です。リスクプロファイルが変わるからです。Nemotron VoiceChat 11B を立ち上げても、自分のトラフィックで耐えられない場合、音声側は回収不能な GPU コストになります。しかし推論側は、オーディオ経路に一切触れることなく、移設したり、フェイルオーバーしたり、通常のやり取りには安価なモデル、エスカレーションには強力なモデルという形で分割したりできます。上流プロバイダー間の自動フェイルオーバーは、単一ソースの依存先が落ちたときに、午後が台無しになるか、四半期が台無しになるかの違いです。
何がどこで利用可能で、何が利用可能でないかを率直に述べてください。GPT-Live-1 も Nemotron VoiceChat 11B も OrcaRouter によって提供されていません。どちらもそれぞれ独自のオリジンから来ています — 一方は OpenAI の Live Sessions エンドポイント、もう一方はあなた自身の GPU です。ルーティングのレバレッジは完全にオーディオの下流にあります。

どれを基に構築するか
• 今四半期に出荷したい場合、複数の音声が必要な場合、会話が継続的なコンテキストで2分を超えることが常態化している場合、またはアイドル中も課金されるGPUを正当化するほどまだ量が多くない場合は、GPT-Live-1を選択してください。
• すでに 80 GB GPU を運用しているなら、主張ではなく証拠に基づいた 500 ms 未満のターンテイキングが必要なら、データレジデンシーの理由から音声を自社インフラ内に留めておく必要があるなら、あるいは API の分単位の課金が請求書の中で最も大きな項目になるほどの通話量を抱えているなら、NVIDIA Nemotron VoiceChat 11B を選びましょう。
• API上でプロトタイプを作り、チェックポイントをベンチマークする。判断を左右するのは、未公開の数値が1つ——80 GBカードあたりの同時セッション数——であり、それを知る唯一の方法は、自社のトラフィック形状で測定することだ。それには1週間の作業が必要で、それが、防御可能なインフラ判断と、推測を判断の体をなすように飾っただけのものとの差になる。
