Gemini 3.8 Live vs GLM-4-Voice のヒーロータイトルカード。キッカーは「OrcaRouter · モデルレーダー — 真っ向対決」、サブタイトルは「音声AIの21か月が実際にもたらしたもの」。2枚のカードには「Gemini 3.8 Live — 2026年9月、ホスト型、ツール、97言語」と「GLM-4-Voice — 2024年12月、オープンウェイト、9B、中国語と英語」と表示され、チップは「21か月の隔たり」「Apache-2.0コード」「カスタムウェイトライセンス」。OrcaRouterのロゴは右下隅に合成されている。
Guides & Insights

Gemini 3.8 Live vs GLM-4-Voice:音声AIの21か月で実際に手に入れたもの

著者

Gideon Frost

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

GLM-4-Voiceは2024年12月3日にリリースされました。Gemini 3.8 Liveは2026年9月15日に発表されました。それは21か月であり、この比較で最も重要な事実です — あらゆるベンチマークよりも重要です。なぜなら、それはあなたが実際にどのような問いを立てているのかを決めるからです。

この2つのモデルはライバルではない。2026年に音声を大規模展開している者で、品質を基準にこの2つを選び分けている者はいない。本当の問いは、GLM-4-Voiceが投げかけ、Gemini 3.8 Liveが答えられないものだ。これを借りるのではなく所有するには、何が必要なのか?その問いには確かな答えがあり、21か月でそれは、あなたが思うほどには変わっていない。

Googleが出荷したもの、そしてZhipuが出荷したもの

Gemini 3.8 Liveは、ホスト型のクローズドウェイトなライブ対話モデルです。ほぼリアルタイムの視覚入力を処理し、会話の途中で対応する 97 言語を自動検出して切り替え、会話が続く間もバックグラウンドでツールや API 呼び出しを実行します。開発者は Gemini API と Google AI Studio を通じて利用でき、Gemini Enterprise ではプライベート プレビューで、Search Live でも利用できます。発表されている価格は音声入力 1 分あたり $0.005、音声出力 1 分あたり $0.018で、Live API 経由です。Artificial Analysis の入力音声 1 時間あたりのコストチャートでは、独自に算出しており、その額は1 時間あたり $1.50。同系列の Gemini 3.8 Live Extended Thinking は現在、同じ指標で 82.6 で首位に立ち、Gemini 3.8 Live 自体は 76.0 です。

GLM-4-Voiceは智譜AI初のエンドツーエンド音声モデルであり、ダウンロード可能なチェックポイントです。これは3つの部分からなる構成です。Whisper-large-v3エンコーダーをベースにベクトル量子化ボトルネックを備えた約0.4Bパラメータの音声トークナイザー、GLM-4-9Bから初期化された約9Bパラメータの自己回帰言語モデル(GLM-4-Voice-9B)、そしてCosyVoiceから再トレーニングされたフローマッチングデコーダーです。中国語と英語を話し、指示による感情、トーン、話速、方言——広東語、重慶官話、北京語など——の制御に対応し、音声を12.5 Hzで単一のコードブックストリームに約175 bpsでトークン化します。これは一般的なニューラル音声コーデックより一桁低い値です。

寸法を並べて表示:

• リリース — Gemini 3.8 Live:2026年9月15日。GLM-4-Voice:2024年12月3日。

• ウェイト — クローズド(ホスト型のみ)かダウンロード可能か、Apache-2.0 のコードに独自のウェイトライセンス。

• 言語 — 中国語と英語と比べて、会話途中での切り替えに対応する97.

• Vision — ほぼリアルタイムの視覚入力あり/なし。

• ツール呼び出し — 会話の途中でバックグラウンドのツールやAPIを実行する場合と、ツールチャネルがまったくない場合の比較。

• コンテキスト — Google非公表 vs 8Kコンテキスト、最大4K出力

• セルフホストの最低要件 — 該当なし(公式には 32 GB RAM と CUDA GPU が必要)。int4 ではおよそ 12 GB の VRAM。

• 電子透かし — 生成されたすべての音声にSynthIDを付与するのに対し、説明はなし。

A two-column scoreboard comparing Gemini 3.8 Live and GLM-4-Voice. Released Sep 15 2026 vs Dec 3 2024; weights closed and hosted vs open with a custom licence; languages 97 vs Chinese and English; tool calling background execution vs none; self-host floor not applicable vs 32 GB RAM plus a GPU or about 12 GB VRAM at int4; cost $1.50 per hour of input audio vs no per-minute bill. Footer reads 'GLM-4-Voice VoiceBench and UTMOS figures self-reported or third-party, unreproduced.' The OrcaRouter logo is composited in the bottom-right corner.

21か月で得たのは、品質だけでなく能力だった

分かりやすい話は、2026年のフロンティアモデルが2024年のオープンなチェックポイントを上回る、というものだ。実際に上回っており、その差は大きい——しかし、より有用な見方は、このカテゴリーが一つの軸に沿って動いたのではなく、形を変えたということだ。

Zhipu自身の技術レポートでは、GLM-4-VoiceはTopic-StoryClozeで音声テキスト変換精度93.6%、音声対音声で82.9%、UTMOS自然性4.45、音声QAは一般5.40/10、知識5.20/10を記録しており、いずれも自己申告で再現されていない。独立した評価はより少なく、より好意的でもない。VoiceBenchでは総合56.48を記録し、ある集計では42中29位あたり、別の集計では40中30位に位置し、マルチターン理解は両言語で弱いと述べられている。C³マルチターン対話理解ベンチマークでは、中国語で11.09%、英語で33.22%となっている。VCB Benchでは、中国語SIFサブ指標で93.0を記録して感情制御で首位に立ち、テキストと音声のアラインメントも強いことが分かったが、TELEVALの方言処理は明示的な指示なしでは4.57%だった。

それらの数字は、声の表現は得意だが持続的な理解は苦手なモデルを表している。それは2024年の音声モデルを一文で言い表したものだ。

Gemini 3.8 LiveのArtificial AnalysisのSpeech to Speech Indexにおける76.0は、音声推論、エージェント性能、アリーナ選好、タスク成功率を合成した複合指標です。新しいモデルが同じタスクをより大きな倍数で得意としているわけではありません。複合指標にエージェント性能とタスク成功が含まれるようになったのです。GLM-4-Voiceはツールチャネルを持たないため、これらのカテゴリーでは競争できません。2024年のモデルは、本来プレイするように作られていないゲームで採点されているのです。

Screenshot of the OrcaRouter models catalogue, showing hosted models listed with provider names and per-million-token pricing behind a single API key.

ライセンスは、みんなが飛ばしてしまう部分だ

GLM-4-Voiceをオープンだからという理由で見ているなら、重みのダウンロードが終わる前に規約を読んでください。この分断は現実にあり、誤解しやすいものです:

• コード — Apache-2.0。真に寛容なライセンスです。

• 重み — 商用利用には帰属表示とZhipuへの登録を必要とするカスタムライセンスです。

「オープンウェイト」と「Apache-2.0」は同じ主張ではなく、このモデルに関する多くの二次報道は両者を混同している。GLM-4-Voice で商用製品をリリースするつもりなら、登録要件は形式的なものではなく法的なステップであり、クリティカルパスに入れておくべきだ。あるトラッカーはさらに踏み込み、このモデルを条件付き商用利用が可能なプロプライエタリ製品だと説明している。いずれにせよ、分単位の請求がないことは、商用関係がないことを意味しない。

コスト計算、正直にやるなら

セルフホスティングを支持する根拠は、固定の月額費用が、利用量が増えれば分単位の費用に勝るという点にある。その根拠は確かに存在するが、自分が運用しているものまで数えれば、見た目ほど大きくはない。

GLM-4-Voiceは公式には32 GBのRAMとCUDA GPUを要求します。コミュニティによるint4量子化はおよそ12 GBのVRAMで動作し、実際には約10~11 GB、つまりRTX 3060の領域で、1ターンあたり約30秒の音声という実用的な上限があります。クラウドのA10を1時間あたりおよそ$0.50~$1.00で使うと、常時稼働インスタンスでは月額$350~$700程度に相当します——まだ1人もユーザーにサービスを提供していないうちから、しかもフェイルオーバーもバースト容量もなく、午前3時にデコーダがノイズを生成しても呼び出せる担当者もいません。

それに対して、Gemini 3.8 Live は入力音声1時間あたり$1.50なので、$350でおよそ233時間分の音声が買える。それは明らかに劣るわけではなく、しかも自分でプロビジョニングしていないキャパシティが付いてくる。分岐点は存在する。それは見出しの比較が示唆するよりも高く、トラフィックが定常的かバースト的かによって動く。バースト的トラフィックでは、分単位の課金が決定的に有利になる。なぜなら、アイドル状態のGPUも稼働中のGPUとまったく同じ請求になるからだ。

また、同じ金額で得られるものにも違いがある。量子化されたGLM-4-Voiceデプロイメントに関するコミュニティの報告では、連続対話のレイテンシーは38~120 msとされているが、これらの数値はZhipuによるものではなく記事に基づくものだ。Gemini 3.8 Liveのレイテンシーは、Googleによって一切公表されていない。低レイテンシーが絶対要件なら、どちらも計画の根拠にできる数値を持っていない。一方には第三者コミュニティの測定値があり、もう一方にはパートナーの証言だけで数値がない。

Screenshot of Google's official blog post titled 'Introducing Gemini 3.8 Live and 3.8 Live Extended Thinking', dated Sep 15, 2026 and credited to Tom Ouyang and Malini Jaganathan of the Gemini Audio Team, with the summary describing the models as Google's most advanced live dialogue models with major upgrades in intelligence and parallel reasoning.

中間の選択肢:ロジックは自社で持ち、ケイパビリティは借りる

これをセルフホスト対ホステッドとして捉えると、ほとんどのチームが実際に行き着く構成を見落としてしまう。GLM-4-Voiceにはツールチャネルがないため、それの上に構築された製品は検索を行うための別個のテキストモデルを必要とする。つまり、どちらにせよセルフホストの音声モデルがホステッドのテキストモデルの前段に位置することになる。デプロイの決定と能力の決定は分離できる。

その分離こそ、ルーターが実際に力を発揮する場面だ。OrcaRouterは190のモデルを単一のキーの背後で、プロバイダーの定価のまま、マークアップなしで提供している。だからこそ、音声フロントエンドの背後にある委譲先は、何も作り直すことなくライブトラフィック上で差し替えられ、上流の値下げは次回の更新時ではなく当日に反映される。自動フェイルオーバーは、セルフホスト環境ではいつも以上に重要になる。倒れたのが自分のGPUインスタンスだった場合でも、バックエンドモデルには依然として到達でき、セッションがそれとともに死ぬ必要はないからだ。この比較は混乱を招きやすいので、2点だけ補足しておく。当社はGLM-4-Voiceをホストしていないし、Gemini 3.8 Liveのエンドポイントも当社のルーター上にはない — それらは各ベンダーから提供されるものだ。ルーター上にあるのは、両者が処理を委ねるテキストレイヤーである。

その決断、そしてその底にある教訓

選ぶべきはGLM-4-Voiceです、次の場合:自分のハードウェア上でモデルが必要な場合、トラフィックが本当に高ボリュームで安定している場合、中国語か英語だけで構築する場合、そしてモデルを呼び出すのではなく改変する必要がある場合。ライセンス登録を実際の作業として見積もりに含め、マルチターンの理解は自分で解決することを想定してください — これはこのモデルの文書化された弱点であり、4Kの出力上限を前提にどれだけファインチューニングしても、それを完全に隠し切ることはできません。

次のいずれかが要件に含まれる場合はGemini 3.8 Liveを選んでください:ビジョン、ツール呼び出し、3つ以上の言語、またはスパイク状と表現されるようなトラフィックパターン。これはプレビューモデルで、コンテキストとレイテンシの数値が非公開であり、実際の計画上のリスクがありますが、文の途中で何かを調べられる2つのうち唯一のモデルでもあります。

一般的な教訓は、どちらの判断よりも価値がある。21か月にわたる音声AIは、主により優れた音声モデルであるわけではないモデルを生み出した——それはエージェントへの音声インターフェースだ。オープンウェイトを求める理由がコストだったなら、その計算はライセンスフリーという枠組みが示唆するよりも拮抗している。理由が制御だったなら、それはまったくコモディティ化されておらず、GLM-4-VoiceはGemini 3.8 Liveが扱わない問いに対する正当な答えであり続ける。