「Gemini 3.5 Transcribeによるインテリジェント文字起こし」のヒーロータイトルカード。音声波形が整形済みテキストへと変わる様子、85以上の言語と記された地球儀、話者ラベルチップ、ノンストリーミング時のWER 2.6%と約$0.005/分のブレンド料金という主要な数字、そして右下隅にOrcaRouterのロゴが配置されている。
Engineering & Research

Gemini 3.5 Transcribe によるインテリジェント文字起こし

著者

Gideon Frost

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

Gemini 3.​5 Transcribe は2026年8月26日にパブリックプレビューに移行し、真にG​eminiモデルとして販売される最初のGo​ogle音声認識モデルです。モデルIDを指定してG​emini APIから呼び出し、音声はトークン単位で価格設定され、Go​ogleは価格ページで音声1分あたりのコストを示しています。この最後の点は、一般向けの報道が見逃している点です。発売日の記事は、Gboardでのフィラーワード除去や音声編集に関するものですが、開発者にとって実際に変わったのは、文字起こしが他のG​eminiシリーズと同じAPIサーフェス上に置かれたことであり、話者識別や単語レベルのタイムスタンプが別売のアドオンではなくベースモデルに含まれるようになったことです。この記事はAPIリファレンスのように読めます。というのも、最初の報道の波が残したギャップがそこにあるからです。

前置きとして、以下の数値に惑わされないよう、2つの注意点があります。GoogleGemini 3.5 Transcribeを「当社が持つ最も正確な音声テキスト変換モデル」とは呼んでいません。実際の主張は「インテリジェントな音声対話に最も精密なモデル」であり、これは別の主張です。そして、その違いはWER(単語誤り率)の数値を読む際に重要です。また、ここに記載されているすべてはパブリックプレビューに関するものであり、2つのモデルID、価格、ベンチマーク数値は、すべてGoogleが現在提供しているものです。そのすべてがGA(一般提供)前に変更される可能性があります。

2つのAPIパス、そして覚えておくべきモデルID

Gemini 3.​5 Transcribe は2つのエンドポイントとして提供され、どちらを選ぶかはチームが下す最初のアーキテクチャ上の決定です:

• gemini-3-5-transcribe — Interactions API による録音済み音声のパスです。ファイルを送信すると、話者属性(最大3話者まで。3話者を超えると実験的)と単語レベルのタイムスタンプが付いたトランスクリプトが返されます。これはバッチ処理と非同期処理の主力です。

• gemini-3-5-transcribe-live — Live API 経由のリアルタイムパス。サブ秒レイテンシの双方向ストリーミングで、ライブ会話、キャプション生成、音声駆動インターフェースを目的としています。

この分割は、残りのG​emini Audioファミリーの構成を反映しており、「live」が独自の価格を持つ別個のSKUであるため重要です。この発売に関する初期の解釈のいくつかは、1つのモデルが両方の機能を備えていると想定していますが、実際はそうではありません。

A generated two-card infographic titled 'Gemini 3.5 Transcribe - two API paths' showing the pre-recorded Interactions API path on the left labeled gemini-3-5-transcribe with a file-in transcript-out flow and speaker attribution, and the streaming Live API path on the right labeled gemini-3-5-transcribe-live with bidirectional streaming and sub-second latency, a footer reading 'Public preview, August 2026', and the OrcaRouter logo in the bottom-right corner.

「インテリジェント文字起こし」の実際の意味

Googleの発表記事は、これを音声的正確さを超えて理解へ向かうものと位置づけている。その枠組みから導かれる機能を評価すべきであり、枠組み自体を評価するのではない:

• 言い淀みの処理 — 「えー」や「あー」は削除され、言い直しも解決されます。「火曜日に会いましょう——いや、水曜日」は、誤った言い出しの書き起こしではなく、修正後の曜日として書き起こされます。これはモデルが下す判断であり、Googleがそれを「インテリジェント」と呼ぶ意味合いです。

• 自動フォーマット — 出力は洗練されたテキストとして返されます:句読点、大文字小文字、段落構造が適用され、生のトークンストリームではありません。

• マルチスピーカー識別 — 事前録音された音声において、最大3人の話者を単語レベルのタイムスタンプ付きで特定可能。3人以上は実験的機能。これは別個のダイアライゼーションサービスではなく、ベースモデルに組み込まれている。

• カスタム語彙 — 語彙を指定することで、専門用語、製品名、珍しい綴りへの認識を偏らせることができます。これは垂直領域向けの仕組みです。

• 85以上の言語 — 自動検出、地域のアクセントや方言も明示的に識別されます。

• 関数呼び出し — モデルは画像生成やファイル分析などの作業を他のGeminiモデルに委任でき、これにより文字起こしは最終ステップではなく、より大きなエージェントのコンポーネントになります。

• エンティティのキャプチャ — Go​ogleは、ノイズの多い実世界の音声や、郵便番号や注文IDなどの英数字エンティティに対して、優れたパフォーマンスを発揮すると主張しています。

プレス報道では、96,000トークンのコンテキストウィンドウ(分割なしで約1時間分の会議音声)と感情検出についても報じられている。どちらも発表時の枠組みと整合しているが、Googleが公開したモデルカードではこれらが前面に押し出されていないため、GAの仕様書が出るまでは確定事項ではなく報道ベースの情報として扱うのが適切だ。

A generated single-column scoreboard titled 'Gemini 3.5 Transcribe - the scoreboard' with rows Release Aug 26 2026 public preview, Languages 85+ auto-detect, WER 2.6% non-streaming / 4.0% streaming, Price ~$0.005 per minute blended, APIs transcribe plus transcribe-live, and Context ~96K tokens reported, a footer reading 'WER per Artificial Analysis, cited by Google; context window press-reported', and the OrcaRouter logo in the bottom-right corner.

ラベル付けされた精度数値

Googleが引用するWER数値はArtificial Analysisによるものです。ストリーミングでの平均単語誤り率は4.0%、非ストリーミングでの文字起こしでは2.6%です。多言語ベンチマークFLEURSでは、Googleはストリーミングで5.50%、非ストリーミングで5.04%のWERを報告しています。またGoogleは、前身であるChirp 3と比較して、最終文字起こしまでの時間が70%改善したと主張しています。

正直に読むなら、これらは独立した計測値である。Artificial Analysis は Google ではないという意味では独立だが、Google が自社の発表の中で選んで掲載した計測値であり、そのモデルが呼び出し可能になってからまだ1日しか経っていない。Google の外部では、多くのチームが比較対象とするオープンウェイトモデルに対するアドバーサリアルな直接対決をまだ誰も実行しておらず、発表資料には Whisper ファミリーや NVIDIA の Parakeet ラインとの直接比較も含まれていない。Chirp-3 より70%高速という数字は、あくまでベンダーによる主張である。2.6% と 4.0% は強力な初期シグナルとして扱うべきであり、確定した事実ではない。

料金

Googleの料金ページでは、各モデルをトークンと音声の推定分数で表記しています。gemini-3-5-transcribeの場合、リスト価格でのブレンド推定値は音声1分あたり約$0.005 — 入力は約$0.003/分、出力は約$0.002/分です。gemini-3-5-transcribe-liveの場合、ブレンド推定値は1分あたり約$0.009です。どちらも現在無料枠があります。

1分あたりの数値は、想定トークン率(入力:音声トークン毎秒25、出力:テキストトークン毎分175)から導き出された推定値であり、Googleがトークンの計算方法を変更すれば変動します。確かなのは原則です。リスト価格が価格である、ということです。これはまさに、OrcaRouterのようなパススルールーターが動作する原則です —— マークアップ0%で、プロバイダーのリスト価格をそのまま通す —— したがって、GoogleがプレビューからGAへの移行期間中に文字起こし価格を引き下げた場合、その値下げはリセラーがレートカードを更新した後ではなく、即日当社側でも有効になります。

展開中の場所

開発者にとって、今日のパブリックプレビューは2つのサーフェスを意味します。Go​ogle AI StudioのG​emini APIと、エンタープライズワークロード向けのG​emini Enterprise Agent Platformです。コンシューマー側では、G​emini 3.​5 Transcribeは、AndroidのGboardにおけるRamblerディクテーション機能と、macOSのG​eminiアプリをすでに実現しています。次はChromeです。あらゆるWebフィールドでの音声入力が可能になり、その後にはSearch Live、G​emini Live、Docs、Keep、Gmailが続きます。導入を検討中のチームにとって、実際的な答えはもっとシンプルです。G​emini APIが利用可能な地域では、今日から英語でコードから呼び出せます。

A screenshot of the Google blog announcement page for Gemini 3.5 Transcribe, titled 'Intelligent transcription with Gemini 3.5 Transcribe', showing the August 26 2026 date and the authors Diego Melendo Casado and Luke Leonhard, captured August 27 2026.

これがあなたのパイプラインにとって何を意味するか

真に新しいのはWERの数値ではない。Go​ogleが、関数呼び出しに対応したG​emini API上で、これまでチームが自前で組み合わせていた2つの機能——話者ラベルと単語レベルのタイムスタンプ——をベースモデルに備えた文字起こしを販売し始めたことだ。単純な文字起こしツール、別個の話者分離ツール、そして整形処理から議事録パイプラインを構築していたなら、これはそれらのステップをひとつに統合した最初のGo​ogleモデルだ。未解決の問いは、2.6%という非ストリーミングWERが自分の音声でどこまで保たれるかだ。そして独立した再現実験が現れるまでは、本番チームの責任ある対応は、Go​ogleが選んだベンチマークで予算を組むのではなく、実際のサンプルをAPIに通してみることだ。文字起こしの上で動くLLM処理——要約、構造化抽出、アクション項目——こそが、ルーティングが真価を発揮する層であり、OrcaRouterがカバーする層でもある。すなわち、200以上のモデルをひとつのAPIで扱い、プロバイダー間の自動フェイルオーバーを備え、複数のモデルをひとつの呼び出しに合成するルーティングDSLだ。文字起こしのステップ自体は、誰かが発表した数字を鵜呑みにする前に、自分の音声でテストすべきだ。

© 2026 OrcaRouter

プロバイダー向け

推論プラットフォームを運営していますか?OrcaRouter にモデルを掲載しましょう。

providers@orcarouter.ai

コミュニティに参加

Discordsupport@orcarouter.aiXGitHubYouTube