
VibeVoice-ASR-Streaming-7B 対 Gemini 3.5 Transcribe Live:1週間、2種類のストリーミング音声文字起こし
- AlibabaNEWQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり
- z-aiNEWZ.ai: GLM 5.3 Flash2026-08-2658知能72コーディング
- DeepSeekNEWDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 100万トークンあたり
- z-aiZ.ai: GLM 5.32026-08-1860知能75コーディング
- obsidianQwen3.8 27B2026-08-1552知能68コーディング
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1261知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0557知能72コーディング
- qwenQwen: Qwen3.8 Max2026-08-0358知能72コーディング
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152知能69コーディング
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100万トークンあたり
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463知能78コーディング
- googleGoogle: Gemini 3.6 Flash2026-07-2152知能69コーディング
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137知能49コーディング
- metaMeta: Muse Spark 1.12026-07-1653知能71コーディング
- kimiMoonshotAI: Kimi K32026-07-1560知能76コーディング
- openaiOpenAI: GPT-5.6 Luna2026-07-0952知能71コーディング
2026年8月最後の週から9月最初の数日にかけて、2つのストリーミング音声認識システムが登場した。両者は競合に見えて、実際には同じ問いに対する異なる答えである。8月26日、GoogleはGemini 3.5 Transcribe Liveをパブリックプレビューとして公開した。ホスト型のクローズドな音声認識エンドポイントで、話者が話し終えてから0.40秒で完成された文字起こしを返し、Artificial Analysisによる測定ではストリーミング語誤り率4.0%という数値と完全な発表資料が添えられていた。9月2日、Microsoft ResearchはVibeVoice-ASR-Streaming-7Bをmicrosoft名前空間の下でHugging Faceにアップロードした。MITライセンスのオープンウェイトであり、プレスリリースも発表ページもなく、モデルカードには語誤り率もレイテンシー数値も可読テキストとして一切記載されていない。両者とも音声がまだ届いている最中に処理を受け付ける。それ以外に共通点はほとんどない。
両側の根拠は対称ではないため、この比較は「これまでに判明していること」として書かれています。{{1}}Gemini 3.5 Transcribe Live は Google の製品であり、公開されたトークン価格とサードパーティによる測定値が存在します。それらは以下に明記されています。{{/1}}{{2}}VibeVoice-ASR-Streaming-7B はチェックポイントであり、その主張はすべてリポジトリ自体——設定ファイル、モデルカード、VibeVoice GitHub リポジトリ内の Microsoft のストリーミングドキュメント——から読み取られたものです。{{/2}}{{3}}Microsoft 側についてはまだ独立したベンチマークが実施されておらず、数値があたかも裏付けを持っているかのように見える箇所では、その旨を明記しています。{{/3}}
リリースの軌跡:APIローンチと静かなアップロード
GoogleはGemini 3.5 Transcribe Liveを通常どおりリリースした。このモデルは、姉妹モデルであるGemini 3.5 Transcribe(録音済み音声向けのInteractions APIパス)とともにGemini Audioの名称の下に位置づけられており、価格はモデルページに掲載されている。また、独立系リーダーボードは数日以内にLiveエンドポイントを採用しており、4.0%のストリーミングWERと0.40秒の最終レイテンシーはそこから得られた数値だ。無料ティアも存在するが、通常の注意事項として、無料ティアのコンテンツはGoogle製品の改善に使用される可能性がある。
Microsoftのストリーミング版リリースには、そのような仕組みは一切なかった。Hugging Faceリポジトリmicrosoft/VibeVoice-ASR-Streaming-7Bは、2026年9月2日15:46 UTCに作成され、その3分後に最後に更新された。このリポジトリには、MITライセンスの下で、8つのsafetensorsシャード、トークナイザー、前処理設定が含まれている。正式な記録は、microsoft/VibeVoiceリポジトリ内の9月3日付のニュースログの1行であり、「音声が届くにつれて誰が何を話したかを継続的に文字起こしし、カスタムホットワードと10言語に対応した統合型ストリーミングASRモデル」を発表し、aka.ms/vibeasrのデモとストリーミング技術レポートへのリンクを添えている。アップロードの翌日に確認した時点では、チェックポイントのダウンロード数はまだゼロであり、ホスト型推論プロバイダーのリストにも載っていない。モデルカードには発表以上の内容が記載されており、以下のほぼすべての情報はこのリポジトリが出典である。

仕様を並べて比較
• 概要 — VibeVoice-ASR-Streaming-7B:オープンウェイトのストリーミングASR、セルフホスト型 vs Gemini 3.5 Transcribe Live:ホスト型ストリーミングAPI、クローズドウェイト。
• ストリーミングの形態 — 約2.9秒ごとのチャンクでテキストを出力し、約0.5秒の先読みを持つ(チェックポイント設定から導出)。一方、双方向WebSocketセッションでは暫定文字起こしが継続的に届き、話者が発話を終えてから0.40秒後に最終結果が得られる。
• 公表された精度 — Artificial Analysisによると、テキストとして公開されたWERやレイテンシー数値は存在せず、ストリーミングWERは4.0%、プリレコードモデルでは2.6%である。
• Speakers — ストリーミングで誰が何を言ったかの帰属を主張しているが、未検証である。一方、Liveエンドポイントでは話者ダイアリゼーションはない(プリレコード済みモデルでは最大3話者まで利用可能)。
• 言語 — 10(en, zh, es, pt, de, ja, ko, fr, ru, it) vs 85以上の自動検出、途中切り替え対応
• セッション時間 — GPUとメモリによってのみ制限される vs Liveセッションごとの10分間というハードな上限。
• コスト — ウェイト自体は$0で、セルフホストにはbf16で約18GB。一方Liveでは、テキスト出力トークンを数えるとオーディオ1時間あたり約$0.54。

「ストリーミング」がそれぞれの側で何を意味するか
その言葉は実際の設計上の違いを隠している。2つのシステムは同じリズムを生み出そうとすらしていないため、正確に述べる価値がある。Microsoft のプリプロセッサ設定は、VibeVoice のリズムを具体化している。すなわち、音声は24kHzで到着し、毎秒約7.5フレームのトークンストリームへ3,200倍に圧縮される。そして設定は、22フレームのチャンクと4フレームのルックアヘッドを指定する。これはチャンクあたり約2.9秒の音声に相当し、処理を確定させるために約0.5秒の将来の音声が付加される。モデルは、確定したチャンクごとに1回テキストを出力し、それ以前のチャンクのコンテキストはKVキャッシュを通じて保持される。そのため、長時間のセッションでもゼロから再計算することはない。実際のトランスクリプトは、およそ3秒単位で増えていく。
GoogleのLiveエンドポイントは、より高速でインタラクティブなループ向けに設計されています。音声はWebSocketを介して16kHzまたは24kHzのPCMチャンクでストリーミングされ、話者が話している間は部分的な文字起こしが継続的に返され、最終的な整形済み文字起こしは発話終了から0.40秒後に届きます。この数値は、Googleが引用するArtificial Analysisの測定値です。トレードオフは、セッション上限(音声10分間で、それを超えるとアプリケーションが再接続して結合する必要がある)と、欠落している追加機能です。Liveパスには話者分離と単語レベルのタイムスタンプがなく、これらはどちらも事前録音用のGemini 3.5 Transcribeには存在します。したがって、正直な要約は次のとおりです。Googleのストリーミングモデルは発話ごとに高速ですが、Microsoftのストリーミングチェックポイントはチャンクごとに低速な一方、Googleのライブ経路が落としている話者属性を提供し、しかもGoogleが提供しないセッション長で実現しています。
精度:空白スペースと比較して測定
この対決における最大の隔たりは、品質というよりは証拠の隔たりである。Artificial Analysis は、Gemini 3.5 Transcribe Live について、ストリーミングで平均単語誤り率4.0%、非ストリーミングモデルで2.6%と測定しており、後者は発表時のWERリーダーボードで5位だった。Google は別途、多言語データセット FLEURS において、ストリーミング5.50%、非ストリーミング5.04%としている。それらはラベルに従って読むべきだ。Artificial Analysis は Google から独立しているが、公開から1日のAPIの数値はまだ初期段階であり、バッチモデルに対するストリーミングの割増 — 4.0% 対 2.6% — は、リアルタイム配信に通常かかるコストである。
VibeVoice-ASR-Streaming-7B には、どこにも比較できる数値がない。モデルカードは評価図を画像として同梱しており、Microsoft のテクニカルレポートは PDF だが、いずれも引用や独立検証が可能なプレーンテキストのストリーミング WER やレイテンシー数値は提供していない。このファミリー全体で唯一の数値的根拠は、バッチ向け VibeVoice-ASR モデルカードに記載された、ベンダー実施による8つの英語テストセットの平均 WER 7.77% と LibriSpeech clean の 2.20% である。これらは非ストリーミングモデルの数値であり、本モデルのものではない。ストリーミングモデルは通常、レイテンシー面の利点を得る代わりに精度をわずかに犠牲にする。誰かがこのストリーミングチェックポイントを公開ハーネスで評価するまでは、公平な表現として、この比較の一方は実測されており、もう一方は実測されていない、と言うのが妥当である。
コスト: 従量課金APIと、すでに予算計上済みのGPU
GoogleはGemini 3.5 Transcribe Liveをトークン単位で課金し、音声を毎秒25トークンとして請求する。公表されているLive料金(音声トークン100万件あたり3.50ドル、テキスト出力トークン100万件あたり21ドル)では、音声1時間あたりの複合コストはおよそ0.54ドル、音声1,000分あたり約9ドルとなる。プリレコード型モデルはさらに安く、1時間あたり約0.30ドルだ。無音が無料なのは、クライアントが無音をストリーミングしない場合のみである。再接続、重複音声、ロギングはすべて、実際の請求額に従量トークンを上乗せする。
Microsoftのチェックポイントは代わりにGPU時間で価格設定されています。bf16ウェイトだけでもKVキャッシュの前に約18GBになります。文書化されたパスは、microsoft/VibeVoiceリポジトリ内のPythonデモと、WebSocketおよびOpenAI互換エンドポイントを提供するvLLMプラグインです。また、ホスト型の価格は存在しません。なぜなら、まだどのプロバイダーもこのモデルをホストしていないからです。バッチ処理のVibeVoice-ASRが3月以降Azure AI Foundryで提供されているようには、このモデルはそこにありません。7Bクラスの音声LLMをセルフホスティングするということは、24GBクラスのGPUとご自身の運用時間を予算化することを意味します。その代わりに、無制限のセッション長と、保持できるウェイトが得られます。この2つのモデルは相互排他的ではありません。それが最後のセクションの要点です。

選択肢を安価に保つこと
どちらを選ぶかは、番号が必要なのか、コードが必要なのかによって決まります。Gemini 3.5 Transcribe Live は、今日すぐに使えて、精度が公表されており、実行にGPUを必要としない文字起こしを求める場合に選んでください。また、音声が10言語に制限されていない場合や、Live エンドポイントが提供しない話者ラベリングを自分で構築する準備ができている場合も、Gemini 3.5 Transcribe Live を選んでください。VibeVoice-ASR-Streaming-7B は、セルフホストする場合、無制限のセッション長や、謳われている話者属性付きストリーミング出力が重要な場合、そして頼れるベンチマークがないため独自の評価ゲートを実行する用意がある場合に選んでください。
どちらの選択肢も永続的である必要はありません。ルーティング層の存在価値が発揮されるのは、まさにこの点です。ただし、それは文字起こしそのもののためではなく、文字起こしの周辺で機能するモデル群のためです。OrcaRouterは現時点ではスピーチ・トゥ・テキスト(音声の文字起こし)のルーティングは行なっておらず、このページにあるモデルはいずれもOrcaRouterのカタログには含まれていません。OrcaRouterが提供するのは、ライブの文字起こしを入力として利用する200以上の言語モデル(要約モデル、アクション項目抽出モデル、音声エージェントのプランナーなど)へ、単一のAPIでアクセスできるようにすることです。料金はプロバイダーのリスト価格をそのままパススルーし、マークアップはありません。加えて、プロバイダー間の自動フェイルオーバーにも対応します。このスタック内のモデルについてベンダーが値下げした場合も、リスト価格はマークアップされずにパススルーされるため、即日反映されます。文字起こしのステップは、ユーザーが配置した場所にそのまま残ります。文字起こしを処理するスタックこそ、単一のキーとフォールバックルートによって、1週間前に作成されたベンチマーク未実施のチェックポイントを、賭けからテスト可能なオプションへと変える層なのです。
この記事で比較したモデル1
この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新
