
VibeVoice-ASR-Streaming-1.5B vs Gemini 3.5 Transcribe: Microsoftの静かなストリーミングASRとGoogleの新しいAPI
- AlibabaNEWQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり
- z-aiNEWZ.ai: GLM 5.3 Flash2026-08-2658知能72コーディング
- DeepSeekNEWDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 100万トークンあたり
- z-aiZ.ai: GLM 5.32026-08-1860知能75コーディング
- obsidianQwen3.8 27B2026-08-1552知能68コーディング
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1261知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0557知能72コーディング
- qwenQwen: Qwen3.8 Max2026-08-0358知能72コーディング
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152知能69コーディング
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100万トークンあたり
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463知能78コーディング
- googleGoogle: Gemini 3.6 Flash2026-07-2152知能69コーディング
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137知能49コーディング
- metaMeta: Muse Spark 1.12026-07-1653知能71コーディング
- kimiMoonshotAI: Kimi K32026-07-1560知能76コーディング
- openaiOpenAI: GPT-5.6 Luna2026-07-0952知能71コーディング
2026年8月26日と2026年9月2日。わずか7日間と、一つの哲学的断絶が、最新の2つのストリーミング音声認識システムを隔てている。2026年8月26日、GoogleはGemini 3.5 Transcribeをパブリックプレビューとして公開した。これはホスト型のクローズドな音声認識APIで、音声トークン単位で課金され、リアルタイムセッション用に別途Liveエンドポイントが用意されている。2026年9月2日、Microsoft ResearchはVibeVoice-ASR-Streaming-1.5BをHugging Faceのmicrosoft名前空間にアップロードした。MITライセンスのウェイト、プレスリリースなし、ローンチ告知なし、そして本稿執筆時点ではサードパーティによる報道もどこにもない。両者はどちらも、音声が到着している最中に文字起こしを行う。しかし、それ以外のほぼすべて——誰が実行を許されるのか、コストはいくらか、機能するという証拠が存在するかどうか——は異なっている。
このページでは、現在実際に存在する形で両者を比較しています。つまり、両者のエビデンスは対称ではありません。Gemini 3.5 Transcribe は、公開されたトークン価格と、Artificial Analysis による第三者評価の精度数値を備えた稼働中の Google 製品であり、以下で AA と表示されている数値がそれにあたります。VibeVoice-ASR-Streaming-1.5B はチェックポイントであり、そのモデルカードには単語誤り率もレイテンシーの数値も、テキストでは一切公開されていません。カードの評価は画像のみで、ストリーミングファミリーに関するこれまでの唯一の発表は、Microsoft の VibeVoice GitHub リポジトリに9月3日付で記載されたニュース1行のみです。以下に示した Microsoft 側の内容はすべて、リポジトリから把握できるもの、すなわち設定ファイル、モデルカード、Microsoft 自身のストリーミングドキュメントです。このモデルについては、まだ独立したベンチマークは行われていません。
2つのモデルの概要
• 概要 — VibeVoice-ASR-Streaming-1.5B:オープンチェックポイント、MITライセンス、セルフホスト型 vs Gemini 3.5 Transcribe:ホスト型API、クローズドウェイト
• リリース — 2026年9月2日にウェイト、9月3日にリポジトリのニュースライン。一方、完全なローンチ資料を備えた2026年8月26日のパブリックプレビューと比較。
• ストリーミング方式 — 約2.9秒のチャンクでテキストを出力し、約0.5秒の先読みを備える。セッション状態はプレフィックスキャッシュに保持される。一方、WebSocketライブセッションは音声トークン単位で課金され、1セッションあたりの音声は最大10分に制限される。
• 公表されている精度 — プリレコード済みエンドポイントでの AA 測定による WER 2.6% と Live エンドポイントでの 4.0% とは対照的に、テキストとして公表された WER やレイテンシーの数値はない。
• 話者出力 — ストリーミングで誰が何を言ったかの帰属を謳っている(未検証)。一方、Liveエンドポイントでは話者ダイアライゼーションがなく、単語レベルのタイムスタンプもない。
• ホットワード — バッチVibeVoice-ASRと同様のコンテキストプロンプト経由でサポートされていますが、Liveエンドポイントの機能一覧には記載されていません。
• コスト — ウェイトは$0、セルフホストには約5.6 GB。一方、Googleの公表トークン価格によると、プリレコード済みエンドポイントでは混成レートで音声1時間あたり約$0.30、Liveでは約$0.54。

ホストされたAPIと静かなアップロード、7日間の間隔を置いて
Gemini 3.5 Transcribe は、Google の代替グレードの文字起こしモデルであり、2つのプロダクトとして提供されます。Interactions API 経由で提供されるプリレコードエンドポイントは、音声ファイル全体を受け取り、期待される付加情報付きの文字起こしを返します。Live エンドポイント(gemini-3.5-transcribe-live)は双方向 WebSocket 上で動作し、セッションをリアルタイムで文字起こしするという点で VibeVoice-ASR-Streaming-1.5B と競合するものです。Google はこれを通常の発表プロセスで発表しました。8月26日のパブリックプレビュー開始、モデルページでの価格公開、そして数日以内にサードパーティのリーダーボードが対応する、という流れです。
Microsoftのストリーミングリリースには、そうしたものは何もなかった。9月2日、microsoftのHugging Faceアカウントは、同じ1分間にVibeVoice-ASR-Streaming-7BとVibeVoice-ASR-Streaming-1.5Bという2つのチェックポイントを作成した。GitHubリポジトリのモデルテーブルには、VibeVoice-ASR-Streamingがファミリーの一員として掲載され、Newsセクションには9月3日付けで「音声が届くたびに誰が何を言ったかを継続的に文字起こしし、カスタマイズされたホットワードと10言語に対応した統合ストリーミングASRモデル」を発表する一文が載っている。しかし、その発表が名前を挙げているのは7Bだけで、1.5Bは一緒にリリースされた小型の兄弟モデルでありながら、言及されなかった。アップロードの翌日に確認したところ、両チェックポイントともダウンロード数はまだゼロだった。

「ストリーミング」がそれぞれの側で何を意味するか
「ストリーミング」という言葉は、実際の設計上の違いを隠している。Microsoftのプリプロセッサ構成によって、VibeVoiceのリズムが具体的になる。音声は24kHzで到着し、約7.5Hz(トークン1個あたり約133ms)の音声トークンのストリームに3,200倍に圧縮される。次にこの構成は、22フレームのチャンクと4フレームの先読みを宣言する。これはチャンクあたり約2.9秒の音声に相当し、現在のセグメントを確定させるために約0.5秒先の音声を使用する。モデルは確定したチャンクごとに1回テキストを出力する。Microsoftのドキュメントによると、以前のチャンクのコンテキストはKVキャッシュを通じて保持されるため、長時間のセッションでも最初から再計算されることはない。その計算は構成の中に組み込まれており、実際的な結果として、文字起こしは単語ごとの部分的な出力ではなく、約3秒単位で増えていく。
GoogleのLiveエンドポイントは、異なるストリーミング形態をとる。すなわち、双方向WebSocketセッションであり、音声は毎秒25オーディオトークンで課金され、インタラクティブ用途向けに設計されているが、セッションあたりの音声は10分間に制限され、さらにLiveエンドポイント固有の制約として、話者分離(スピーカーダイアライゼーション)や単語レベルのタイムスタンプには対応していない。両者をライブ文字起こしエンジンとして比較する場合に重要な違いは、セッション上限(GoogleのLive側は10分、Microsoft側は自身のGPUとメモリのみが上限)、出力の間隔(約3秒のチャンク対WebSocketセッションが配信する内容)、そして出力の追加機能(Microsoftのカードでは話者属性とホットワードが謳われているが、GoogleのLiveの機能リストには含まれていない)である。
正確さ:一方には数字があり、もう一方には絵があります。
This is the widest gap in the matchup, and it is a gap in evidence, not necessarily in quality. Artificial Analysis measures Gemini 3.5 Transcribe at a 2.6% word error rate on the pre-recorded endpoint and 4.0% on the Live endpoint — the premium you pay for real-time delivery shows up in the error rate, which is a common and honest trade-off for streaming systems. Those are third-party numbers on a neutral leaderboard, published days after launch. --- この対戦カードの中で最も大きな差であり、それは品質というよりもエビデンスの差です。Artificial Analysis は、Gemini 3.5 Transcribe について、録音済みエンドポイントでは単語誤り率2.6%、Live エンドポイントでは4.0%と計測しています — リアルタイム配信に支払うプレミアムは誤り率に現れますが、これはストリーミングシステムにとって一般的で正直なトレードオフです。これらは第三者によるニュートラルなリーダーボード上の数値であり、ローンチから数日後に公開されたものです。
{{1}}VibeVoice-ASR-Streaming-1.5B には、どこにも比較できる数値が存在しない。{{/1}}{{2}}モデルカードには評価結果の図が画像として付属しているが、WER・RTF・レイテンシの数値を文章で示した記述はなく、引用できるものも独立に検証できるものも存在しない。{{/2}}{{3}}Microsoft は、7B と 1.5B のいずれについても、ストリーミング精度の数値をテキストで公表していない。{{/3}}{{4}}このモデルファミリー全体で唯一の数値的なよりどころは、バッチ用 VibeVoice-ASR モデルカードであり、そこではベンダー実施による平均 WER が、8つの英語テストセットで 7.77%、LibriSpeech clean で 2.20% と報告されている。ただし、これは非ストリーミングモデルを対象とした値であり、ストリーミングモデルは通常、低遅延という利点と引き換えに精度を多少犠牲にする。{{/4}}{{5}}誰かがストリーミングチェックポイントを公開の評価ハーネスで実行するまでは、率直な立場として、Google のモデルは計測され、Microsoft のモデルは計測されていないと言わざるを得ない。{{/5}}
コスト:音声時間あたり vs GPU時間あたり
Google は Gemini 3.5 Transcribe をトークン単位の従量課金で提供しており、料金体系は2つのエンドポイントで明確に分かれています。プリレコードエンドポイントでは、音声入力トークン100万件あたり2ドル、テキスト出力トークン100万件あたり12ドルで、音声1時間あたりの総合コストは約0.30ドルになります。ライブエンドポイントでは、音声トークン100万件あたり3.50ドル、テキストトークン100万件あたり21ドルで、音声1時間あたりの総合コストは約0.54ドル、プリレコードエンドポイントより約80%高く、この上乗せ分がリアルタイム配信の料金です。Google は音声を毎秒25トークンとして課金するため、無音は、クライアントがその無音をストリーミングしない場合に限り無料になります。再接続、重複音声、ロギングは、すべて実際の請求額を膨らませる可能性があります。無料枠も存在しますが、無料枠のコンテンツは Google 製品の改善に使用される可能性があるという注意点があります。

マイクロソフトのモデルは、その代わりにGPU時間単位で課金されます。1.5Bチェックポイントは、bf16の重みでおよそ5.6GBです(1.5BクラスのQwen言語バックボーンに音声トークナイザーと拡散ヘッドを加えたもので、safetensorsのメタデータ上では約3Bパラメータに相当します)。実行方法として文書化されているのはセルフホストのみで、microsoft/VibeVoiceリポジトリ内のPythonデモか、OpenAI互換エンドポイントとWebSocketエンドポイントの提供用にマイクロソフトが解説しているvLLMプラグインを使用します。どの推論プロバイダーもまだこのモデルを掲載していないため、ホスト型サービスの価格はまだ存在しません。コストの問題は、自前のGPU時間がGoogleの時間あたりレートより安いかどうかだけにかかっており、継続的な文字起こし量であればほぼ間違いなく安くなります。ライセンスの論点はコストの論点とは別物で、MITライセンスのウェイトは、どのAPIサブスクリプションでもそうはならないかたちで、自分のものとして保持し続けられます。
この2つは本番スタックにおいて相互排他的ではありません。今日のライブ文字起こしを必要とするチームにとっての現実的なパターンは、ASR層を単一のエンドポイントの背後に置き、選択を元に戻せる状態に保つことです。200以上のモデルをプロバイダーのリスト価格のまま提供し(マークアップなし、したがってベンダーの価格変更は即日反映)、自動フェイルオーバーを備えたルーティングAPIこそが、Googleの測定済みAPIをデフォルトとしながら、実トラフィックの一部で、プロバイダーがホストした瞬間にVibeVoice-ASR-Streaming-1.5Bをテストできるレイヤーです。それがOrcaRouterのモデルであり、精度をまだ誰も検証していないチェックポイントを採用するための低リスクな方法です。
誰がどれを選ぶべきか
今日すぐ使える文字起こしAPI、公表されている精度、予測可能な1時間単位の料金、そして面倒を見るGPUが不要なものを望むなら、Gemini 3.5 Transcribe を選んでください。特に、音声がMicrosoftの挙げる10言語に含まれていない場合や、ファイルの文字起こしにプリレコード済みエンドポイントの話者分離と単語単位のタイムスタンプが必要な場合は、なおさらです。10分間のLiveセッション上限は、ライブセッション用に採用を決める前に、あなたのユースケースでテストすべき実際の制約です。
セルフホストする場合、MITライセンスが提供するウェイトとデータ管理を求める場合、無制限のセッション長が必要な場合、または誰が何を言ったかを示すストリーミング出力やホットワードを特に評価したい場合は、VibeVoice-ASR-Streaming-1.5Bを選択してください。ソースからのインストール、NVIDIA GPU上で約5.6GBのウェイト、そして独自の評価ゲートの予算を確保してください。頼れるベンチマークが存在しないため、精度については、ご自身の音声で評価して判断するしかありません。
1週間の総評:Googleが送り出したのは測定済みの製品で、Microsoftが送り出したのは興味深い賭けだ。Gemini 3.5 Transcribeは安全側のデフォルトであり、第三者による数値の裏付けがある。VibeVoice-ASR-Streaming-1.5Bはオープンでセルフホスト可能な、完全に未検証の代替案だ。この選択が安価で済むのは、永続的である必要がないからだ。ASRエンドポイントを差し替え可能に保っておけば、ベンチマークをひとつも伴わずに出荷されたチェックポイントでも、自社のトランスクリプトという証拠に基づいてトラフィックを獲得したり失ったりできる。
