
VibeVoice-ASR-Streaming-1.5B vs NVIDIA Parakeet TDT 0.6B:実証されていないMITライセンスの挑戦者が、Open ASRチャンピオンに挑む
- AlibabaNEWQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり
- z-aiNEWZ.ai: GLM 5.3 Flash2026-08-2658知能72コーディング
- DeepSeekNEWDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 100万トークンあたり
- z-aiZ.ai: GLM 5.32026-08-1860知能75コーディング
- obsidianQwen3.8 27B2026-08-1552知能68コーディング
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1261知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0557知能72コーディング
- qwenQwen: Qwen3.8 Max2026-08-0358知能72コーディング
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152知能69コーディング
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100万トークンあたり
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463知能78コーディング
- googleGoogle: Gemini 3.6 Flash2026-07-2152知能69コーディング
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137知能49コーディング
- metaMeta: Muse Spark 1.12026-07-1653知能71コーディング
- kimiMoonshotAI: Kimi K32026-07-1560知能76コーディング
- openaiOpenAI: GPT-5.6 Luna2026-07-0952知能71コーディング
本番環境でオープンウェイトの音声テキスト変換(STT)が必要なら、今日ではデフォルトの選択肢があり、その名はNVIDIA Parakeet TDT 0.6Bです。2025年5月以降、6億パラメータのParakeet TDT 0.6B v2は、Hugging Face Open ASRリーダーボードで平均単語誤り率6.05%を記録して首位を維持しており、その順位は第三者によって1年以上再現されています。最新の挑戦者候補はVibeVoice-ASR-Streaming-1.5Bです。これはMicrosoft Researchが2026年9月2日、Parakeetから16か月後にMITライセンスの下でアップロードしたもので、ストリーミング話者帰属という売り文句を持つ一方、これまでのところ公表された精度数値はまったくありません。このページでは、王者と挑戦者を、エビデンス、アーキテクチャ、そして各製品が標準で実際に提供する内容について比較します。
スペックよりも先に、2つのラベルが重要だ。それがこのマッチアップ全体の形を決定づける。Parakeetの数値は確定している。「約1秒で1時間分の音声」という主張の背後にある平均WER 6.05%と約3,386 RTFxのスループット数値は、公開リーダーボードとNVIDIAの資料に1年以上載り続けている。VibeVoice-ASR-Streaming-1.5B側の欄は、そのリポジトリから知り得ることだけだ。モデルカード、設定ファイル、そしてMicrosoftのストリーミングドキュメントである。マイクロソフトはWER、遅延、スループットを文書で一切公開しておらず、この執筆時点で、そのチェックポイントの独立したベンチマークも存在しないからだ。以下の比較のすべての表で、片方の列は実戦で試されているが、もう片方はスペックシートにすぎない。
16か月と、ひとつのリーダーボード支配を挟んで
Parakeet TDT 0.6B v2 は、2025年5月5日に、ストリーミングASR問題に対するNVIDIAの回答として登場しました。FastConformerエンコーダと、各トークンとその持続時間を単一ステップで予測するトークン・アンド・デュレーション・トランスデューサ(TDT)デコーダを組み合わせたもので、従来型トランスデューサのブランクトークン overhead を排除する効率化の工夫です。CC-BY-4.0ライセンスで商用利用にも適しており、平均語誤り率6.05%という強みでOpen ASRリーダーボードの首位を獲得しました。また、リーダーボードでは評価されない本番運用向け機能——句読点、大文字化、単語レベルのタイムスタンプ——と、最大24分の音声を1回のパスで処理できるフルアテンションエンコーダも備えており、積極的なチャンク分割なしで長時間の会議やポッドキャストに有用です。
VibeVoice-ASR-Streaming-1.5Bは、最も純粋な意味での挑戦者である。それは存在し、文書化されているが、その性能については何も実証されていない。9月3日付けのMicrosoftのGitHubニュースは、音声が届くと同時に誰が何を話したかを継続的に書き起こす統合ストリーミングASRモデルを発表しており、ホットワードと10言語に対応している。そして、チェックポイントの設定は、まったく異なる工学的伝統を物語っている。すなわち、畳み込みオーディオトークナイザーによって供給されるQwen2系言語モデルデコーダーであり、拡散ヘッドが約2.9秒のチャンクと約0.5秒の先読みで出力を生成する。Parakeetが1年にわたる実際の展開で磨かれた専用設計の音声モデルであるのに対し、VibeVoice-ASR-Streaming-1.5Bは誕生から2日目の研究系チェックポイントである。
エビデンスの非対称性こそが核心だ
このページの残りを読むにあたり、ひとつの事実を頭に入れておいてほしい。この比較では、数値が示されているのは片側だけである。Parakeet TDT 0.6B側には、1年間にわたるリーダーボード防衛の実績がある。すなわち、Open ASR公開英語ショートフォームセットにおける平均WER 6.05%、NVIDIAハードウェア上のバッチ128における約3,386 RTFx、そして本番環境で実績のあるNeMoデプロイメントツール群、TensorRTアクセラレーション、FP8量子化のエコシステムである。一方、VibeVoice-ASR-Streaming-1.5B側にあるのは、モデルカードに記載された評価図——テキストではなく画像として掲載されている——と、バッチ用VibeVoice-ASRカードにベンダーが報告した平均WER 7.77%(英語テストセット8件)だけである。この数値は非ストリーミングモデルを説明するものであり、このチェックポイントにそのまま当てはめることはできない。挑戦者が優れている可能性は十分にある。重要なのは、「可能性は十分にある」という言葉こそが、エビデンスのすべてだということだ。
仕様確認
• パラメータ — NVIDIA Parakeet TDT 0.6B: 600M、FastConformerエンコーダ+TDTデコーダ vs VibeVoice-ASR-Streaming-1.5B: 合計約3B(1.5BクラスのQwenバックボーン+トークナイザーおよび拡散ヘッド)
• リリース日 — 2025年5月5日 vs 2026年9月2日
• 精度 — 平均WER 6.05%、2025年5月以降Open ASRで第1位、第三者による再現実績あり(他に公開されたものなし)
• 速度 — NVIDIAハードウェア上、バッチ128で約3,386 RTFx、つまり毎秒約1時間分の音声。一方、公表されたスループット数値はなし。
• ストリーミング — フルアテンションコンテキストで1パスあたり最大24分のストリーミング対応 vs チャンク型ストリーミング、約2.9秒のチャンクと約0.5秒の先読み。
• 出力の追加要素 — 句読点、大文字・小文字、ワードレベルのタイムスタンプ vs ストリーミング時の発言者属性(未検証)およびホットワード;10言語。
• ライセンス — CC-BY-4.0 vs MIT。
• エコシステム — TensorRT と FP8 に対応した NVIDIA NeMo と、microsoft/VibeVoice リポジトリのデモおよび vLLM プラグインとの比較


舞台裏: 音声モデルの役割をめぐる2つの考え方
これらのアーキテクチャは、このタスクに対する2つの異なる考え方を体現しています。Parakeet TDT 0.6B は、文字起こしを効率的に解く信号処理問題として扱います。FastConformer エンコーダーが音響を抽出し、TDT デコーダーがテキストトークンと継続時間を同時に出力するため、リアルタイムの数千倍の速度で動作し、NVIDIA のデプロイスタック上でも快適に動作します。一方、VibeVoice-ASR-Streaming-1.5B は、文字起こしを言語問題として扱います。つまり、音声をトークンストリームに圧縮し、トランスクリプト相当のコンテキストを読み込んだ言語モデルに渡し、誰が何を言ったのか、会話がどのように結びつくのかを LM が理解していることを作業に活かします。LLM バックボーンであることも、チェックポイントが 600M ではなく約 3B パラメータである理由であり、Microsoft がエッジ展開をうたっていない理由でもあります。つまり、これは GPU を必要とし、コンテキストを保持するためにメモリを使うモデルです。
ライブ文字起こしにとって、実務上の帰結はレイテンシの形状にある。Parakeetのフルアテンションエンコーダは長いウィンドウを1回のパスで処理できるが、これはVibeVoice-ASR-Streaming-1.5Bが採用する、出力セグメントごとに約2.9秒の音声を固定長チャンク+先読みで処理するというストリーミング設計思想とは異なる。どちらも、最速クラスの商用APIのように単語単位の部分結果をストリーム配信するものではなく、チャンク処理方式である。どちらが適切かは、入力音声が有限のファイルとして届くのか、それとも終了のないライブセッションとして流れ続けるのかによって決まる。
特集記事と展開地域
そのまま使える状態で、Parakeet TDT 0.6B はより完成度の高い文字起こし製品です。句読点と大文字化がトランスクリプトに含まれ、単語レベルのタイムスタンプがアライメント用に備わり、24分間のシングルパスウィンドウにより、長い録音でのチャンク分割エラーが抑えられます。一方 VibeVoice-ASR-Streaming-1.5B は、Parakeet が掲げていない機能、すなわち10言語対応の話者属性付き出力とホットワードで対抗します。ストリーミング話者ダイアライゼーションの主張は、まさに独立した検証が必要な類のものです。チャンク境界では話者帰属がずれやすいからです。しかし、ライブ会議で誰が何を言ったかを把握する必要があるなら、NVIDIA のモデルではなく Microsoft のモデルに目を向ける理由となるのです。

この2つのモデルの置かれた環境も、モデル自体と同じくらい異なります。Parakeet TDT 0.6BはNVIDIA NeMoの一員で、TensorRT、FP8、NVIDIA GPU向けにチューニングされたデプロイツール群を備えており、すでにNVIDIAインフラを利用しているなら非常に優れた選択肢です。一方、VibeVoice-ASR-Streaming-1.5Bは研究用リポジトリの中にあります。文書化された利用経路はMicrosoftのPythonデモとvLLMプラグインのみで、そのアーキテクチャクラスはまだ公開のTransformersドキュメントに記載されておらず、立ち上げるにはソースからのインストールと、ロードパスが機能することの自己検証が必要です。堅実で文書化が整ったデプロイを重視するチームにとっては、この違いだけでベンチマークの差を上回るほどの意味を持つこともあります。
現職を支持する論拠、挑戦者を支持する論拠
NVIDIA Parakeet TDT 0.6Bを選ぶ論拠は、実績が明確に知られた選択肢を選ぶ論拠と同じである。1年間にわたるリーダーボード防衛、第三者による再現性の確認、商用ライセンス、本番運用機能、そして実トラフィックをさばいてきたデプロイエコシステムがその根拠だ。今四半期に英語の文字起こし機能をリリースする予定で、オープンウェイトのモデルを求めるなら、これが正当化できるデフォルトの選択であり、これを置き換えると主張する側にこそ立証責任がある。
VibeVoice-ASR-Streaming-1.5Bの採用ケースは、より限定的かつ具体的です。すなわち、ストリーミング話者帰属またはホットワードが必要な場合、英語以外の言語にも対応する必要がある場合、あるいは、音声認識は言語モデル・アプローチが主流になると信じていち早くそこに加わりたい場合です。これは決断ではなく、賭けです。本番トラフィックを移すことを正当化できる数字はまだなく、Microsoft自身も研究優先の姿勢です。現在、どちらのモデルもOrcaRouter経由では提供されていません。したがって、この賭けを低コストで試す方法は、新しいオープンモデル全般に当てはまるパターン、すなわち、200以上のモデルをプロバイダー提示価格のままマークアップなしで束ね、自動フェイルオーバーを備えた単一のルーティングAPIの背後にASRレイヤーを置いたままにし、プロバイダーがVibeVoice-ASR-Streaming-1.5Bをホストし始めた瞬間に実音声の一部をそこへルーティングし、そして、自社トラフィックから得られた文字起こしに、その挑戦者がParakeetが16か月間かぶり続けてきた王冠に値するかどうかを判断させる、というものです。
