「Qwen3.8-LiveTranslate vs Gemini 3.5 Live Translate」と表示されたタイトルカード、サブタイトルは「一方は数字を出し、もう一方は地図を出す」。
Guides & Insights

Qwen3.8-LiveTranslate 対 Gemini 3.5 Live Translate:一方は数値を出荷し、もう一方は地図を出荷する

著者

Rowan Sterling

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

リアルタイム音声翻訳の2大モデルは、何を測定されることを許容するかについて見解を異にしており、その不一致こそが、どんなスペック比較よりも有用である。Qwen3.8-LiveTranslateは2026年9月19日に公開され、ただ一つの明確な数値を前面に押し出す。平均遅延は2.3秒で、前世代の2.8秒から短縮された。Gemini 3.5 Live Translateは、2026年6月に発表され、今なおプレビューモデルIDを冠するベンダーの音声対音声モデルであり、その売りは対応範囲にある——70以上の言語、自動検出、会話途中での切り替え、そしてベンダーのTranslateアプリとMeetアプリへの統合だ。一方の企業は、責任を問われ得る遅延の数値を公表した。もう一方は、言語数を公表した。この2つを選ぶのであれば、なぜそれらが異なる種類の約束なのかを理解することのほうが、どちらのリストが長いかよりも重要である。

目標についてだけ一致し、それ以外は何も一致しない2つのアーキテクチャ

どちらのモデルも、同じ挙動を殺すために存在している。すなわち、何か言う前にあなたが文を言い終えるのを待つ、ターン制の翻訳機だ。その間が、機械通訳を機械通訳らしく感じさせるのだ。

Qwen3.8-LiveTranslateは、Hybrid MoEバックボーン上のInterleaveアーキテクチャによってそれを実現する。このアーキテクチャは、音声、映像、原文テキスト、翻訳を1つの因果シーケンスに折り込むThinkerモジュールと、翻訳を元話者の声質で再合成するTalkerモジュールに分かれる。主張は、認識、翻訳、合成を単一のシーケンスに集約することで、3段階パイプラインが各モジュール境界で支払うレイテンシと意味的損失を取り除けるというものだ。

Gemini 3.5 Live Translate は、反対方向から同じエンドツーエンドの立場を取る。これは Gemini 3 Pro をベースにしたネイティブな音声対音声モデルであり、個別の ASR → MT → TTS カスケードを実行するのではなく、Gemini Live API を通じて継続的にストリーミングする。実際には、永続的な双方向 WebSocket を保持し、100 ms の音声チャンクを上に送り、翻訳された音声チャンクを下に受信する。どちらのモデルも従来のやり方はしていない。今ではどちらも新しいやり方をしている。違いはすべて二次的な細部にある。

レイテンシの比較は、見た目ほど互角ではない

GoogleはGemini 3.5 Live Translateについて、話者より「数秒遅れる」と説明している。同モデルについてLAALの数値や、その他の名称が付され再現可能なレイテンシ指標は公表していない。Qwenは2.3秒を公表し、その意味を定義している。

この非対称性は、たいてい「どちらもおよそ2〜3秒だ」と平板化されてしまう。そうした読み方は、どちらの企業が述べたことによっても裏付けられていない。Googleの表現は2秒とも整合し、4秒とも整合する。同社はただ、明確な数字を示すことを避けているだけだ。今日実際にできる比較は、次のとおりである。

公開されている遅延指標 — Qwen3.8-LiveTranslate: LAAL 2.3秒(ベンダー報告)。Gemini 3.5 Live Translate: 公開なし。

独立したレイテンシ測定 — どちらのモデルについても、いずれもありません。第三者による直接比較は公開されていません。

正直な結論は、レイテンシについて、Qwen は反証可能な主張をしており、Google は曖昧な主張をしているということだ。それは透明性の点では Qwen に有利な1点であり、誰かが両方を測定するまでは、性能の点では Qwen に有利な点は厳密にゼロである。レイテンシがあなたのデプロイにとって決め手なら、現時点の証拠状況は、どちらの方向への購入判断も支持しない。

Two-column comparison scoreboard. Qwen3.8-LiveTranslate column: latency LAAL 2.3s, languages 60 source and 29 spoken, speaker ID real-time diarization, input audio plus image, status generally available, watermark none stated. Gemini 3.5 Live Translate column: latency not published, languages 70-plus supported, speaker ID weak turn-taking, input audio only, status preview, watermark SynthID on all audio. Footer reads 'Qwen figures vendor-reported; Gemini per Google docs. No independent head-to-head.'

60言語対70超という比較は、間違った物差しだ

言語の数はたびたび引用されるが、それは両方向に誤解を招く。

Qwen3.8-LiveTranslateは60のソース言語を認識し、そのうち29言語で音声出力を生成します。Gemini 3.5 Live Translateは自動検出に対応して70以上の言語をサポートし、Google Meetではそれが2,000以上の言語の組み合わせにまで広がります。従来の上限は、5言語にわたる英語ベースの翻訳でした。

2番目の数字をよく読んでから、それを3倍の勝利と見なしてください。Googleの2,000以上という数字は順序対——あらゆるソース言語とあらゆるターゲット言語を掛け合わせたもの——を数えており、これは正当で genuinely 有用なカバレッジの尺度ですが、単一言語の数とは比較できません。そしてGoogleのリストは、より広範ではあるものの、話者人口の多い言語に大きく偏っています。アフリカーンス語、アラビア語、ベンガル語、オランダ語、英語、フランス語、ドイツ語、ヒンディー語、インドネシア語、イタリア語、日本語、韓国語、マレー語、ペルシア語、ポーランド語、ポルトガル語、ロシア語、スペイン語、スワヒリ語、タミル語、テルグ語、タイ語、トルコ語、ウクライナ語、ウルドゥー語、ベトナム語、ズールー語。Qwenの29の音声出力言語はさらに狭く、どちらのベンダーのリストもロングテール——通訳ツールが歴史的に最も苦戦してきた地域方言や低資源言語——に対する本格的な答えではありません。両社とも取り組んでいると言っています。どちらもそれをリリースしていません。

両者が実際に分かれるところ:人でいっぱいの部屋

モデルが真に異なる約束をする唯一の点はマルチスピーカー処理であり、それは実際の導入を決める可能性が最も高い違いです。

Qwen3.8-LiveTranslateはリアルタイムの話者ダイアリゼーションを搭載しています。文が届くたびに各文が話者に帰属され、音声複製はターンが切り替わっても安定していると説明されています。Qwenは自社の長尺な複数話者テストセットにおいて、ダイアリゼーション誤り率9.7%を自己報告しており、これはSeed LiveInterpret 2.0の30.6%に対する数値です。ただしベンダーが実施した評価におけるベンダー間比較であるため、結果としてではなく、数値が添えられた主張として扱うべきです。またこのモデルは原文テキストと翻訳を同じタイムライン上に出力するため、別途アラインメント処理を行わなくても同期したバイリンガル字幕を作成できます。

Gemini 3.5 Live Translateは逆の重点を置いています。その記載されている強みは韻律の保持です — 話者のピッチ、ペース、イントネーション、感情的レジスターを維持し、翻訳された音声が元の感じを伝えます。その記載されている弱点は、まさにダイアライゼーションが役立つところです:長い休止の後にずれたり、間違った性別になったりする可能性がある不安定な音声クローニング、明確な文末信号のない弱いターンテイキング、強いアクセントやスペイン語とポルトガル語のような密接に関連する言語ペアの扱いの困難さ、そして背景ノイズの不完全な処理です。Googleはまた、延長しない限り純粋なオーディオセッションを15分に制限し、生成されたすべてのオーディオストリームに、現在削除できないSynthIDウォーターマークを刻印します。

複数話者の帰属 — Qwen:リアルタイム話者分離、DER 9.7%を主張。Gemini:ターンテイキングの弱さが文書化されており、話者分離の主張はなし。

音声の忠実度 — Qwen: Talkerモジュールによる元の声質の再現。Gemini: 韻律、ピッチ、話速の保持。クローニングのドリフトが確認されている。

バイリンガル出力 — Qwen: 原文と翻訳を同じタイムライン上に出力。Gemini: セッションごとに設定可能な、任意の入力・出力の文字起こし。

電子透かし — Qwen:明記なし。Gemini:生成されたすべての音声にSynthIDを適用、削除する手段なし。

セッションの長さ — Qwen:明記なし。Gemini:純粋な音声セッションには15分の上限あり。

入力タイプ — Qwen:音声と画像。Gemini:音声のみ、テキスト入力なし。

Screenshot of Google's own Gemini Live API documentation for live translation, showing the speech-to-speech streaming setup, the supported-language list, and the documented session constraints for the preview model.

それぞれを実際に運用するのにかかるコスト

Qwen3.8-LiveTranslateは、WebSocket Realtime APIにおいて100万トークン単位で課金されます。シンガポールリージョンでは、音声入力$7.50、画像入力$0.55、テキスト出力$20.00、音声出力$30.00です。北京では100万トークンあたり¥40 / ¥3.3 / ¥100 / ¥160 — およそ$5.65 / $0.47 / $14.13 / $22.61です。コンテキスト長は53,248トークンで、レート制限は両リージョンとも毎分10リクエスト、毎分100,000トークンです。

その10 RPMという上限は、料金表の中で最も影響の大きい数字です。Gemini 3.5 Live Translateの商用条件は同じようには公表されていません。このこと自体が成熟度に関するシグナルです。Googleはこれを、パブリックプレビューのLive APIとAI Studio、選択されたWorkspace顧客向けのプライベートプレビューのGoogle Meet、そしてAndroidとiOSのTranslateアプリを通じて提供しています。プレビュー価格とプレビューのレート制限は予告なく変更される可能性があり、GoogleはGA日を約束していません。

つまり、現時点でのコスト比較は、公表価格と厳格な同時実行数の上限があるモデルと、公表価格がなく上限も明示されていないモデルの間のものだ。この四半期にユニットエコノミクスをモデル化する必要があるなら、そのうち予算に計上できるのは一方だけだ。

Screenshot of Alibaba Cloud Model Studio documentation for the qwen3.8-livetranslate-flash-realtime model, showing the WebSocket Realtime API endpoint and the published per-million-token pricing for audio input, image input, text output and audio output.

独立したテストが示さなければならないこと

上記はすべて、両ベンダー自身の発表に基づいて構成されている。なぜなら、これらのモデルを互いに競わせて実行した人は誰もいないからだ。この対決に実際に決着をつけるような結果には4つの要素が必要だが、そのどれもまだ存在しない:

• LAALは両方のモデルで、同じ音声、同じ言語ペアにおいて同じ方法で測定された——Qwenの2.3秒という数値は、Googleが明言を避けているものと比較することはできない。

• 共有の多話者コーパスにおけるダイアライゼーション誤り率であり、Qwen 自身の Omnilingua-MSpeaker セットにおけるものではありません。

• 長時間セッションにわたる音声クローニングの安定性。これは、Gemini 自身のドキュメントがドリフトを指摘し、Qwen が最も強い主張を行っている領域です。

• 同時実行数の上限における挙動 — Qwenの10 RPMが実際の会議負荷の下で持ちこたえるか、そしてGeminiのプレビュー枠が本番環境との接触に耐えられるか。

そのテストが存在するまでは、擁護できる立場は狭い。Qwen はより多くを公表し、より具体的なことを約束してきた。Google はより広範な言語カバレッジと、API のみのモデルには及ばない流通基盤を持っている。

どちらを選ぶべきですか

スコアボードではなく、自分の問題の形に目を向けなさい。スコアボードはまだ信頼できるものではないのだから。

ワークロードが複数当事者によるもので、誰の発言かを特定することが重要な場合——会議の文字起こし、パネルディスカッション、法廷、その他が翻訳された文を言ったかを知ること自体が価値の一部となるあらゆる場面——において、この2つのうちその能力を謳っているのは Qwen3.8-LiveTranslate だけであり、Gemini に文書化されているターンテイキングの弱さも同じ方向を指している。ワークロードが幅広い言語を対象とし、消費者向けで、すでに Google のエコシステム内にあるなら、Gemini 3.5 Live Translate の70以上の言語と、Translate アプリおよび Meet での存在感は、API 専業の競合他社が流通面では到底かなわない強みである。

デモを買うのではなく製品を構築するのであれば、どちらも狭い領域の専門特化型である点に留意してください。どちらもエージェントループを実行せず、要約も行いません。また Qwen3.8-LiveTranslate は、関数呼び出し、構造化出力、コンテキストキャッシュ、ファインチューニングを明示的にサポートしていません。通訳はパイプラインの先頭部分であり、全体ではありません。OrcaRouter は、今日どちらかの翻訳モデルを呼び出す場所ではありません。どちらも当社のカタログには載っておらず、そうではないかのように示唆するよりは、はっきりとそう申し上げるほうがよいと考えています。当社が提供するのは、文字起こしを消費する側のスタックの半分です。200 以上のモデルにわたって、プロバイダーの定価のままマークアップを一切上乗せせずに 1 つのキーで利用でき、その文字起こしを読む要約ツール、用語集適用ツール、下流のエージェントを、2 つ目のベンダー契約に触れることなく差し替えたりフェイルオーバーさせたりできます。

その底

Qwen3.8-LiveTranslate と Gemini 3.5 Live Translate は、基本性能の面では十分に接近しており、その結果、マーケティングが差別化要因になっている。一方はレイテンシの数値と料金表を公表し、もう一方は言語マップとエコシステムを公表した。どちらも独立したテストを受けていない。この対決で読む価値があるのは、誰かが同じ音声で両方を走らせた後に書かれるものだ——そして、このカテゴリーがこれほど速く動いていることを考えれば、それはそう遠くないかもしれない。

この記事で比較したモデル3

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新