
VibeVoice-ASR-Streaming-1.5B vs Whisper Large v3 Turbo:99言語対応の実力派モデルに挑むネイティブストリーミング
- AlibabaNEWQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり
- z-aiNEWZ.ai: GLM 5.3 Flash2026-08-2658知能72コーディング
- DeepSeekNEWDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 100万トークンあたり
- z-aiZ.ai: GLM 5.32026-08-1860知能75コーディング
- obsidianQwen3.8 27B2026-08-1552知能68コーディング
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1261知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0557知能72コーディング
- qwenQwen: Qwen3.8 Max2026-08-0358知能72コーディング
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152知能69コーディング
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100万トークンあたり
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463知能78コーディング
- googleGoogle: Gemini 3.6 Flash2026-07-2152知能69コーディング
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137知能49コーディング
- metaMeta: Muse Spark 1.12026-07-1653知能71コーディング
- kimiMoonshotAI: Kimi K32026-07-1560知能76コーディング
- openaiOpenAI: GPT-5.6 Luna2026-07-0952知能71コーディング
今日実行している音声認識モデルがWhisper Large v3 Turboである可能性は高く、そして、それがそうあるべきかどうかを問う新しいモデルが登場しています。OpenAIのWhisper Large v3 Turbo — 2024年10月にリリースされた蒸留版の809Mパラメータチェックポイント — は、オープンウェイトの主力モデルです。99言語に対応し、元のlarge-v3よりも約4〜8倍高速で、ノートパソコンでも動作するほど小型であり、MITライセンスで提供され、存在する中で最大の文字起こしエコシステムに支えられています。VibeVoice-ASR-Streaming-1.5Bは、2026年9月2日にMicrosoft Researchによってアップロードされたもので、Whisperがネイティブに行わない1つのことのために作られた挑戦者です。それは「ストリーミング」です。固定されたウィンドウを丸ごと処理するのではなく、音声が到着するたびにチャンク単位で文字起こしを行い、話者属性付きの出力を主張し、さらに10の言語に対応していますが、公開されたベンチマークは一切ありません。
その最後の条項が、このページを直接対決ではなく移行をめぐる問いを軸に構成している理由です。Whisper Large v3 Turbo の数値は測定され公開されています。LibriSpeech、Open ASR composite、Common Voice などです。一方、VibeVoice-ASR-Streaming-1.5B のモデルカードには、WER やレイテンシーの数値がテキストとして一切公開されておらず、本稿執筆時点で独立したベンチマークも存在しません。以下で述べる Microsoft 側の内容はすべて、そのリポジトリから知り得ること、つまり設定ファイル、モデルカード、Microsoft のストリーミングドキュメントに基づいています。Whisper 側の内容はすべて、確定した公開記録です。この二つは直接比較されたわけではなく、比較されているのは、証明されているものと約束されているものの間です。
あなたがおそらくすでに実行しているモデル
Whisper Large v3 Turboは、華々しくない形でその地位を確立しました。高速で、軽量で、多言語対応、そして本番運用のチームが好む「退屈さ」——すなわち予測可能で信頼できる——を備えているのです。1.55BパラメータのWhisper large-v3から809Mパラメータへと蒸留されたこのモデルは、99言語のカバレッジとlarge-v3の約95%の精度を維持しています。LibriSpeech cleanでは約2.1%のWER、Open ASR複合では約7.7〜7.8%のWERを記録し、最も精度が低下するのは低リソース言語と声調言語です。その一方で、処理速度は数倍高速で、FP16では約1.6GBのVRAMに収まります。MITライセンスで提供され、faster-whisper、whisper.cpp、そして3年間にわたるインテグレーションを通じて動作します。Hugging Faceのページでは、1ヶ月で700万回以上のダウンロードを記録しています。文字起こしをセルフホストしているなら、その処理を行っているのは間違いなくこのモデルでしょう。
Whisper Large v3 Turboがそうでないもの、そしてこれまで決してそう主張してこなかったもの、それはストリーミングモデルです。これは音声を固定された30秒のウィンドウで取り込み、ウィンドウごとに文字起こしを返します。ネイティブな音声活動検出も、エンドポインティングも、話者ダイアリゼーションも、ホットワード機構も備えていません。Whisperでのライブ文字起こしは常に、あなたが構築する後付けの改造です。そして、その改造こそがレイテンシとエンジニアリングコストが発生する場所なのです。
実際に切り替えると何が変わるのか
• レイテンシモデル — VibeVoice-ASR-Streaming-1.5B は、設計上、約2.9秒分の確定チャンクごとにテキストを1回出力し、約0.5秒の先読みを備える。これは、30秒ウィンドウのバッチモデルであり、ライブ出力に近づけるためにチャンキングとステッチングのレイヤーを必要とする Whisper Large v3 Turbo とは対照的である。
• セッション形状 — 無制限のライブセッションではプレフィックスキャッシュ内でチャンク間のコンテキストが保持される一方、個別の30秒ウィンドウにはウィンドウ間の会話状態がありません。
• 言語 — 10(中国語、英語、フランス語、ドイツ語、イタリア語、日本語、韓国語、ポルトガル語、ロシア語、スペイン語) 対 99
• 印刷物に記載の精度 — 公表されたものはなし。一方、LibriSpeech clean では約2.1%、Open ASR composite では約7.7〜7.8%。すべて実測値で公開済み。
• 出力の追加機能 — ストリーミングでの誰が何を言ったかの帰属付けと、ホットワード対単語タイムスタンプが利用可能だと主張しているが、ダイアライゼーションもネイティブのホットワードもない。
• ハードウェア — NVIDIA GPU上で約5.6GBのbf16重み(ソースからインストール)に対し、約1.6GBのFP16はwhisper.cppおよびfaster-whisperによりラップトップやCPUでも動作します。
• ライセンス — MIT(両方とも)

ストリーミングのレトロフィット問題
このマッチアップについて正直に考えるなら、Whisper Large v3 Turboには、すでに支払ったか、いまだに支払い続けているストリーミングの問題があるということだ。Whisperでライブパイプラインを組むには、音声を見つけるボイスアクティビティ検出器、音声をWhisperサイズのウィンドウに切り分けるチャンカー、境界で単語が失われないようにするためのオーバーラップウィンドウ、そして部分的な文字起こしを統合するスティッチャーが必要になる。そのスタックのコミュニティ実装は、エンドツーエンドのレイテンシがおおむね1秒から5秒に落ち着く。会議メモには実用的だが、電話エージェントやライブキャプションの水準には届かない。
VibeVoice-ASR-Streaming-1.5B は、設計上、後付けの仕組みを不要としています。そのプリプロセッサ構成は、約7.5Hzの音声トークンストリームに対し、22フレームのチャンクと4フレームの先読み(ルックアヘッド)を固定します。つまり、出力されるセグメントごとに約2.9秒分の音声と、0.5秒分の未来コンテキストが含まれます。また、Microsoftのドキュメントによれば、以前のチャンクからのコンテキストはKVキャッシュを通じて保持されるため、ライブセッションで最初から再計算されることはありません。ただし、この比較の両者について、「ストリーミング」という単語を注意深く読む必要があります。どちらのモデルも、最も低遅延の商用APIが提供するような、単語単位で部分結果を出すエンジンではありません。VibeVoiceの文字起こしは、設計上、約3秒単位で伸びていきます。これは、単語単位とは異なる、会議では通常許容できるテンポですが、サブ秒ではありません。もし要件が1秒以内に画面上へ単語を表示することなら、構築を始める前に、このチャンク構造をその予算に対して評価すべきです。
精度:ネイティブストリーミングに移行するために失うもの
ここに、この決定を左右すべきギャップがあります。Whisper Large v3 Turboには、監査可能な公開精度記録があり、その録音が対応する99言語の範囲内にあれば、その記録は強力です。一方、VibeVoice-ASR-Streaming-1.5Bにはそのような記録がありません。モデルカードの評価は画像であり、MicrosoftはストリーミングWERをテキストで公開しておらず、ファミリー内で唯一の数値的根拠は、バッチ版VibeVoice-ASRカードのベンダー報告値である8つの英語テストセットにおける平均WER 7.77%のみで、これは別の非ストリーミングモデルを説明したものです。正直な表現をすれば、今日VibeVoice-ASR-Streaming-1.5Bに文字起こしを移行することは、自社オーディオに対する未知の精度レベルを受け入れることを意味します。だからこそ、本番トラフィックを獲得する前に、最も困難な実録音に対して、あらゆる評価をあなた自身が実行しなければならないのです。

言語と話者帰属:機能ギャップは双方向に作用する
機能比較は一方的ではなく、それこそがこの選択を本当に興味深いものにしている。オーディオが多言語にわたる場合、判断はすぐに決着する:Whisper Large v3 Turboの99言語は、VibeVoice-ASR-Streaming-1.5Bの10言語がカバーしない範囲を網羅しており、10言語という上限は、多様な音声を扱うあらゆるパイプラインにとって失格となる。しかし、ワークロードがその10言語の範囲内であり、実際に必要なのがライブ会議で誰が何を言ったかを知ることなら、矢印は逆方向を指す:Whisperはネイティブの話者分離(ダイアリゼーション)もホットワードも提供しないのに対し、VibeVoice-ASR-Streaming-1.5Bはその両方を主張している——ストリーミングでの話者属性付き出力と、コンテキストプロンプトとして渡されるドメイン用語のホットワードだ。その主張は未検証であり、チャンク境界をまたぐストリーミング話者分離は十分に困難で懐疑の目に値するが、これはWhisperにいくらエンジニアリングを施してもそのままでは得られない具体的な機能である。
移行の計算
コストと労力は既存製品に有利です。Whisper Large v3 Turboは、すでにあなたが所有するハードウェア(ラップトップ、CPU、それなりのGPU)上のスタックで動作しています。一方、VibeVoice-ASR-Streaming-1.5Bへの移行は、約5.6GBの重みを持つNVIDIA GPU上でソースからの研究用インストールを立ち上げ、そのアーキテクチャクラスがまだ公開のTransformersドキュメントに記載されていないロードパスを検証し、意思決定の判断材料となるベンチマークをゼロから構築することを意味します。これは本格的なプロジェクトであり、その見返りは、未検証の機能があなたにとって重要であることを前提としています。

そのプロジェクトを安く運用する方法は、それを交換として扱わないことです。Whisper Large v3 Turbo をデフォルトのまま維持し、ライブ音声の一部を1つのAPI経由で VibeVoice-ASR-Streaming-1.5B にルーティングします。これこそルーティングレイヤーが存在するためのパターンです。すなわち、マークアップなしのプロバイダー定価で単一エンドポイントの背後に200以上のモデルを置き、新しいモデルがつまずいたときの自動フェイルオーバー、そして1回の呼び出しで異なるワークロードが異なる文字起こしエンジンを選べるルーティングDSLを備えるというものです。それがOrcaRouterのモデルであり、2日前のチェックポイントに本番パイプラインを賭けることと、そのチェックポイントに、自社のトランスクリプト上で主力モデルと肩を並べてその地位を勝ち取らせることの違いです。
よくある質問
Whisper Large v3 Turboはそもそもライブストリーミングに対応できますか?
{{1}}後付けとしてのみです。{{/1}}{{2}}Whisper Large v3 Turbo は、固定された30秒ウィンドウを処理するバッチモデルであるため、ライブ文字起こしを行うには、その上に音声アクティビティ検出器、チャンカー、オーバーラップ戦略、ステッチャーを構築する必要があります。{{/2}}{{3}}実用的な実装は存在しており、遅延はおよそ1〜5秒に収まります。これは会議メモには適していますが、電話エージェントやライブキャプションに求められるサブ秒の基準には達していません。{{/3}}{{4}}VibeVoice-ASR-Streaming-1.5B はストリーミングネイティブであり、約2.9秒のチャンクごとにテキストを出力し、約0.5秒の先読みを行います。ただし、これはチャンク単位のストリーミングであり、単語ごとの部分出力ではありません。そのため、その出力ペースが自社のレイテンシ予算に合うかどうかも確認してください。{{/4}}
VibeVoice-ASR-Streaming-1.5BはWhisper Large v3 Turboよりも正確ですか?
その質問には今のところ誰も答えられません。マイクロソフトでさえもです。Whisper Large v3 Turboの精度は測定済みであり公開されています — LibriSpeech cleanでおよそ2.1%のWER、Open ASR複合セットで7.7〜7.8%です。VibeVoice-ASR-Streaming-1.5Bには、本稿執筆時点で、テキストで公開されたストリーミングWER数値も独立したベンチマークもありません。この質問に答える唯一の方法は、お手持ちの音声でチェックポイントを実行し、既存システムと文字起こし結果を比較することです — これはまさに、このページが移行前に推奨するテストそのものです。
その2つはどの言語をサポートしていますか?
Whisper Large v3 Turboは、1つの重みセットで99言語をサポートしています。VibeVoice-ASR-Streaming-1.5Bは、中国語、英語、フランス語、ドイツ語、イタリア語、日本語、韓国語、ポルトガル語、ロシア語、スペイン語の10言語に対応しています。この10言語のセットに含まれない音声の場合、この組み合わせではWhisperが唯一の選択肢であり、多言語対応のギャップは、ほとんどのチームが現状に留まる最も明確な理由です。
Whisper Large v3 Turbo は、ほとんどのチームにとってほとんどの場合において適切なモデルです。そして、ベンチマークすらない2日前のチェックポイントは、プラットフォームを乗り換える理由にはなりません。それは実験を実施する理由です。もしあなたの音声がその10言語に含まれ、ライブの話者帰属があなたの製品を変えるなら、VibeVoice-ASR-Streaming-1.5B をルーターの背後に立て、実際のトラフィックの一部をそこに向け、トランスクリプトに判断させてください — どちら側にもベンチマークがないからという理由ではなく。
