Gemini 3.5 Transcribe Live vs Gemini 3.5 Transcribe — アプリが呼び出すべきエンドポイント。再生成されたイラスト。
Guides & Insights

Gemini 3.5 Transcribe Live と Gemini 3.5 Transcribe: アプリが呼び出すべきエンドポイントはどちらか

著者

Rowan Sterling

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

2026年8月26日にGo​ogleがGe​mini 3.5 Transcribeファミリーを発表したとき、同じ名前と使命を共有しながらも、会話の異なる段階向けに構築された2つのモデルがリリースされました。Live APIを通じて提供されるストリーミングエンドポイントのGe​mini 3.5 Transcribe Liveと、Interactions APIを通じて提供される録音済みエンドポイントのGe​mini 3.5 Transcribeです。多くのチームが最初の1週間で犯す間違いは、これを1つのモデルに2つのボタンがあるだけだと見なすことです。実際には2つのSKUであり、APIも価格もハードリミットも異なります。また、両者の精度比較は公正な戦いではありません。それぞれ異なるルールで測定されているからです。この記事では、この2つを並べて比較し、リーダーボードではなく、お客様のワークロードに基づいて判断できるようにします。

一目でわかる2つ

• API — Gemini 3.5 Transcribe Live は Live API(WebSocket、双方向ストリーミング)上で動作し、Gemini 3.5 Transcribe は Interactions API(ファイル入力、文字起こし出力)上で動作します。

• ジョブ — ライブ会話、字幕付け、音声エージェント vs 会議、通話ログ、アーカイブ音声。

• 精度 — ストリーミングで WER 4.0%、ノンストリーミングで WER 2.6%(Artificial Analysis 調べ、Go​ogle が引用)。測定方法が異なるため、直接比較はできません。

• レイテンシー — 発話終了後0.40秒での最終的な文字起こし vs ファイル全体のバッチ処理

• セッション — ライブセッションは1回10分の上限、ファイルは最大60分(話者分離とタイムスタンプを有効にした場合は30分)。

• 話者 — ストリーミング側ではなし、事前録音側では単語レベルのタイムスタンプ付きで最大3人まで対応。

• 価格 — 約0.009ドル/分(加重平均)対 約0.005ドル/分(加重平均)。

A generated two-column scoreboard titled 'Gemini 3.5 Transcribe Live vs Gemini 3.5 Transcribe - the scoreboard'. Left column Gemini 3.5 Transcribe Live: API Live API streaming, WER 4.0% streaming, Final latency 0.40s after speech, Session 10-minute cap, Speaker ID not supported, Timestamps none. Right column Gemini 3.5 Transcribe: API Interactions API files, WER 2.6% non-streaming, Final latency batch async, Session 60-minute files (30 with diarization), Speaker ID up to 3 speakers, Timestamps word-level. Footer reads 'WER per Artificial Analysis, cited by Google; limits per Google launch materials.'

アーキテクチャの決定:Interactions API または Live API

{{1}}両モデルはGoogleGemini Audioファミリーに属し、どちらもパブリックプレビュー段階にあります。{{/1}} {{2}}違いはトランスポートから始まります。{{/2}} gemini-3-5-transcribe-liveはWebSocketを開き、その接続を開いたまま維持します。生のオーディオが連続的にストリーミングされ(一般的なフレーミングは16kHzまたは24kHzの16ビットPCMチャンク)、モデルは話している間は部分的なトランスクリプトを返し、発話が終了すると各発話の最終トランスクリプトを返します。gemini-3-5-transcribeは完全なファイルを受け取り、それを処理して、話者属性と単語レベルのタイムスタンプ付きの完成したトランスクリプトを返します。

伝送方式の決定が、他のすべてを左右します。製品が話された言葉をそのまま表示する場合——ライブキャプション、発話途中で意図を読み取る音声エージェント、通話中に行動する通話アシスタント——それはLiveパスです。製品が記録を生成する場合——会議メモ、通話ログ、アーカイブ——それはInteractionsパスです。混乱の原因は、どちらもテキストを生成することです。違いは、そのテキストがリアルタイムの状態なのか、最終的な成果物なのかという点です。

正確性:ストリーミング税は実在する

Go{{1}}​{{/1}}ogleが発表記事で数値を引用している独立系ベンチマーク機関であるArtificial Analysisは、ストリーミングエンドポイントの平均単語誤り率を4.0%、非ストリーミングエンドポイントを2.6%と測定しています。FLEURS多言語ベンチマークでは、Go{{2}}​{{/2}}ogleはストリーミング5.50%に対し、非ストリーミング5.04%と報告しています。この2.6%という数値により、Ge{{3}}​{{/3}}mini 3.5 Transcribeは発表時点でAA{{4}}{{/4}}のWERリーダーボードの5位となり、ElevenLabs Scribe v2(2.2%)とMicrosoftのMAI-Transcribe-1.5(2.4%)に次ぐ結果となっています。なお、これらの数値はAAの測定結果であり、Go{{5}}​{{/5}}ogleの主張ではありません。

ストリーミングの数値は、同じテストの劣化版ではありません。それは別の動作モードです。モデルは文の末尾を聞き終える前に単語を確定し、その代償を払います。精度だけでこの2つを選んではいけません。ワークロードによっては、その差が逆転する可能性があるからです。選択は制約に基づいて行ってください。ストリーミングエンドポイントはセッション上限10分、話者分離なし、タイムスタンプなしです。録音済みエンドポイントは1時間のファイルを処理でき、最大3話者を識別し、ワードレベルのタイムスタンプを返します。アプリで話者ラベルが必要な場合、ストリーミングモデルはWERがどうであれ、その役割を果たせません。

A screenshot of the Artificial Analysis speech-to-text leaderboard page showing the WER Index (Non-streaming) view with model rows including an entry for Gemini 3.5 Transcribe alongside ElevenLabs and Deepgram, plus AA-WER Index dataset filters, captured August 27 2026.

彼らが共有するもの

2つのエンドポイントは「intelligent transcription」エンジンを共有しており、共有機能に関しては、両者間の選択は中立的です:

• 85以上の言語を自動検出、ライブパスでの配信途中の言語切り替えにも対応。

• 言い淀みのクリーンアップ — フィラー(つなぎ言葉)を削除し、言い直しを解決(「火曜日 — いや、水曜日」は修正後の曜日として記録される)。

• 自動整形 — 出力に適用される句読点、大文字小文字、段落構造。

• カスタム語彙 — 専門用語や製品名を最大1,000語まで登録可能。Googleのドキュメントでは、最良の結果を得るには約100語が推奨されています。

両方に当てはまる注意点が1つあります。出力を読みやすくする「スマート」なクリーンアップは、設計上の判断として逐語的な忠実性と引き換えになります。ぎこちない言い回しは滑らかに整えられ、テキストはモデルが意図を読み取ったものであり、法廷記録ではありません。正確な文字起こしが必要な場合は、逐語オプションが提供されている場所ではそれを利用し、いずれにしても自分の音声で動作を確認することをお勧めします。

1分あたりのコスト:ライブプレミアム

Googleは音声を1秒あたり25オーディオトークンで価格設定しており、出力は文字起こし1分あたり約175テキストトークンです。リスト価格では、音声1分あたりの混成コストはgemini-3-5-transcribeで約$0.005、gemini-3-5-transcribe-liveで約$0.009です。入力は100万トークンあたり$2対$3.50、出力は100万トークンあたり$12対$21です。どちらも現在無料枠があります。

プレミアムが購入するのはリアルタイムのパスであり、より高い精度ではありません。ストリーミングエンドポイントでは1分あたり約80%多く支払うことになり、しかもその転写はWERが高くなります。それが正直な枠組みです。録音済みモデルの方が安くて精度も高い。ストリーミングモデルが存在するのは、ファイルの完了を待てない製品があるからです。

どのエンドポイント上に構築すべきか

• ライブキャプションと字幕 — Gemini 3.5 Transcribe Live。時間同期された出力が必要な場合は、タイムスタンプなしの制限を確認してください。

• 音声エージェント — Gemini 3.5 Transcribe Live を使用して文の途中の意図を把握。長時間セッションでは10分の上限を考慮して計画する。

• 会議、インタビュー、アーカイブ — Ge​mini 3.5 Transcribeは、2.6%のWER、話者属性、単語レベルのタイムスタンプを実現します。

通話後分析 — {{1}}Ge​mini 3.5 Transcribe{{/1}} は完了した記録用に使用し、{{2}}Ge​mini 3.5 Transcribe Live{{/2}} は分析を通話中に実行する必要がある場合のみ使用します。

• 長時間の連続音声 — Ge​mini 3.5 Transcribeなら、60分のファイル1つで、10分ごとのライブセッションを手動でつなぎ合わせる手間が省けます。

A generated decision card titled 'Which endpoint - by workload' with a left column headed 'Pick Transcribe Live if' listing live captions, voice agents reading intent mid-sentence, and in-call analytics, and a right column headed 'Pick Transcribe if' listing meetings and interviews, call logs needing speaker labels, word-level timestamps for alignment, and long continuous audio, a footer reading 'Both are Google APIs in public preview since Aug 26 2026', and the OrcaRouter logo in the bottom-right corner.

トランスクリプトの上のレイヤー

どちらのモデルもOrcaRouterがホストするものではありません。現在、音声認識のルーティングは行っておらず、どちらのエンドポイントについても、直接GoogleのAPIを呼び出すことになります。音声パイプラインにおけるルーティング層の役割は、トランスクリプトの上に位置し、要約者、エンティティ抽出器、ストリームを意思決定へと変換するアクションアイテムモデルを機能させることです。この層こそ、OrcaRouterが価値を発揮する場面です。200以上のモデルに対して、プロバイダー定価のままマークアップなしで単一のAPIを提供し、プロバイダー間の自動フェイルオーバー、そして複数のモデルを1回の呼び出しに合成するルーティングDSLを備えています。ワークロードに応じて文字起こしエンドポイントを選び、その後、単一のキーでトランスクリプトを読み取るモデルを実行します。

結論

Gemini 3.5 Transcribe Live と Gemini 3.5 Transcribe は同じファミリーでありながら、異なる製品です。会話終了前に文字起こしが必要であり、10分間のセッション、話者ラベルなし、タイムスタンプなしを受け入れられる場合は、Live を選択してください。出力が記録であり、速度よりも正確さと発言者の特定が重要である場合は、Transcribe を選択してください。Transcribe はより安価で、より正確で、制約もはるかに少ないです。唯一の間違いは、1つのエンドポイントが両方の機能を備えていると想定することです。