
VibeVoice-ASR-Streaming-7B 対 GPT-Transcribe: OpenAIのファイルエンドポイントに対するライブセッションチェックポイント
- AlibabaNEWQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり
- z-aiNEWZ.ai: GLM 5.3 Flash2026-08-2658知能72コーディング
- DeepSeekNEWDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 100万トークンあたり
- z-aiZ.ai: GLM 5.32026-08-1860知能75コーディング
- obsidianQwen3.8 27B2026-08-1552知能68コーディング
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1261知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0557知能72コーディング
- qwenQwen: Qwen3.8 Max2026-08-0358知能72コーディング
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152知能69コーディング
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100万トークンあたり
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463知能78コーディング
- googleGoogle: Gemini 3.6 Flash2026-07-2152知能69コーディング
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137知能49コーディング
- metaMeta: Muse Spark 1.12026-07-1653知能71コーディング
- kimiMoonshotAI: Kimi K32026-07-1560知能76コーディング
- openaiOpenAI: GPT-5.6 Luna2026-07-0952知能71コーディング
このページに掲載されている2つのモデルは、その名前が示唆するような競合関係にはありません。両者は音声録音のライフサイクルにおける異なる局面のために作られており、正直な比較とは、あなたのプロダクトがどの局面に位置づくのかという問いです。GPT TranscribeはOpenAIの非同期文字起こしエンドポイントです。完成したファイルをアップロードすると、実時間の約34倍の速度で処理され、文字起こしが返されます。価格は音声1分あたり0.0045ドルで、Artificial AnalysisのAA-WERベンチマークでは、独立に測定された単語誤り率3.31%を記録しています。VibeVoice-ASR-Streaming-7Bはその正反対の形態を持ちます。Microsoft Researchのストリーミング用チェックポイントであり、2026年9月2日にMITライセンスのもとでひっそりとHugging Faceにアップロードされたこのモデルは、音声がまだ届き続けている最中に文字起こしを行うよう設計されています。つまり、録音が伸びていくのに合わせてテキストをチャンク単位で出力するWebSocketセッションです。両者を精度だけで比較することは無意味です。一方は監査済みの数値を有しているのに対し、もう一方はテキストとして一切の数値を公表していないからです。
以下に示す数値は、すべて出所が明記されています。GPT Transcribeの数値は、OpenAIが公表した価格と、Artificial Analysisによる独立した測定結果であり、いずれも同モデルが2026年7月28日にリリースされて以降、公開記録として存在しています。VibeVoice-ASR-Streaming-7B側は、リポジトリから把握できる情報——チェックポイント構成、モデルカード、Microsoftのストリーミング関連ドキュメント——の範囲にとどまります。これは、第三者がベンチマーク評価を行っておらず、Microsoftもストリーミング時の単語誤り率をテキストとして公開していないためです。
オーディオの人生における二つの異なる瞬間
GPT Transcribeは、すでに行われた録音のために設計されています。OpenAIのエンドポイントは、通常のフォーマット(mp3、mp4、mpeg、mpga、m4a、wav、webm)で最大25MBの音声ファイルを受け付け、処理後に完全な文字起こしを返します。処理速度は実時間の約34倍なので、1時間の録音は数分で完了します。これはバッチ処理用のレーンであり、OpenAIもそれに見合った価格設定をしています:音声1分あたり$0.0045、音声1時間あたり約$0.27です。もし本当にリアルタイムでの文字起こしが必要なら、OpenAIはそのための別モデルを販売しています — GPT Live Transcribeは1分あたり$0.017で、バッチ価格のほぼ4倍です — これはOpenAI側でVibeVoice-ASR-Streaming-7Bが行うことに最も近いものです。
VibeVoice-ASR-Streaming-7Bは、その区別を逆方向に崩す。ストリーミングチェックポイントでありながら、ファイル全体も処理できるのだ。プリプロセッサ設定にはライブ処理の契約が示されている。すなわち、24 kHzのオーディオを入力し、3,200倍に圧縮して7.5 Hzのトークンストリームに変換し、その後、4フレームの先読みを持つ22フレームのチャンクで処理する。1チャンクは約2.9秒のオーディオに相当し、約0.5秒の将来コンテキストを含む。各チャンクが解決されるたびにテキストが出力される。セッションコンテキストはKVキャッシュを通じて引き継がれるため、長時間のセッションでもゼロから再計算することはない。ドキュメント化されたサービングパス(vLLMプラグイン)は、ライブセッション用のWebSocketストリームエンドポイントと、ファイル全体の文字起こしエンドポイントを公開している。つまり、同じ重みで両方の形態に対応する。しかし、このモデルの存在理由はライブ側にあり、ホスト型APIがないため分単位の課金もない。GPUは自分で用意する。

証拠台帳は一方的だ
GPT Transcribe は、本番環境で用いられている書き起こしAPIの中でも、特に徹底的に測定されたものの一つです。Artificial Analysis は、AA-WER において語誤り率 3.31% と評価しており、追跡対象の約50システム中9位です。ただし、サブスコアには既知の弱点が潜んでいます。意図的に音響が困難な Earnings22 セットでは、誤り率が 6.10% に悪化します。これらは中立なリーダーボードによる監査済みで再現可能な数値であり、その限界も文書化されています。このモデルは、前世代の GPT-4o Transcribe より25%安く、同じベンチマークで約0.7ポイント優れた数値でローンチされました。
VibeVoice-ASR-Streaming-7Bには、どこにも比較可能な指標が存在しません。そのモデルカードには評価指標が画像として同梱されており、MicrosoftのテクニカルレポートはPDFですが、散文として引用可能なストリーミングWERやレイテンシの数値はなく、独立に検証できるものもありません。VibeVoiceファミリーにおける唯一の数値的根拠は、バッチ処理用VibeVoice-ASRモデルカードにベンダーが記載した表——8つの英語テストセットでの平均WER 7.77%、LibriSpeech cleanで2.20%——であり、これは非ストリーミングモデルを説明するもので、このチェックポイントの精度として読んではなりません。購入判断に同僚を納得させられる数値が必要なら、この比較でそれを持つのは片側だけです。
それぞれがプレーンなトランスクリプトに加えて何を返すのか
2つのモデルはコンテキストに対する賭け方が異なり、そこが機能比較の面白いところだ。GPT Transcribeの売りはコンテキストヒンティングである。録音の自由形式の説明や、キーワードと固有名詞のリスト、想定言語のリストを渡すことができ、OpenAIは、同社のContext-Aware ASRベンチマークにおいて意味的精度がコンテキストなしの41.6%からコンテキストありの45.2%に向上したと報告している。また、検出された言語も返される。一方、話者ダイアリゼーションや単語レベルのタイムスタンプには対応しておらず、OpenAIはこうした機能には別のモデルを案内している。そのため、会議の文字起こしは、自分で話者レイヤーを構築しない限り、誰の発言か区別されない単一のテキストの壁として返ってくる。
VibeVoice-ASR-Streaming-7B は逆の賭けに出ている。そのモデルカードは、ストリーミング形式の話者属性付き出力、つまりチャンクが確定するたびに「誰が何を言ったか」を出力することに加え、コンテキストプロンプトによるカスタマイズ済みホットワード(CLIフラグは --context_info)を主張している。これは GPT Transcribe が明確に省いている機能であり、そのためこの2つのモデルはマルチスピーカーのライブ音声用途では互換性がない。その一方で、裏付けとなるのは検証である。GPT Transcribe にない機能は文書化された製品上の決定であり、一方 VibeVoice が主張する話者属性は、独立したテストで確認されていないモデルカード上の記述にすぎない。また、タイムスタンプに関しても両者は異なる。比較対象となる経路ではどちらも単語レベルのタイムスタンプを提供しないが、VibeVoice ファミリーのバッチモデルはそれを提供する。

価格の形状と所有権の問題
この2つのコスト構造はこれ以上ないほどかけ離れており、どちらが厳密に優れているわけでもない。GPT Transcribe は従量課金制のAPIだ。音声1時間あたり0.27ドル、インフラ不要、GPU不要、1リクエストあたり25MB、さらにOpenAIの運用保証が付いてくる。これが、自前で音声モデルを動かさないことの代償である。一方、VibeVoice-ASR-Streaming-7B は重みが無料だが、KVキャッシュを加える前のbf16で約18GBあり、24GBクラスのGPU、microsoft/VibeVoice のデモコードか vLLM プラグイン、そして自前の監視とスケーリングが必要だ。分単位の価格には決して表れない違い、それがMITライセンスである。重みは保持もファインチューニングも、自分が管理するハードウェアでの実行も自由で、シート単位の従量計測も25MBの上限もない。
言語カバレッジは、両社とも購入者が望む以上に曖昧な点である。VibeVoice-ASR-Streaming-7B のモデルカードには10言語(英語、中国語、スペイン語、ポルトガル語、ドイツ語、日本語、韓国語、フランス語、ロシア語、イタリア語)が記載されているのに対し、バッチ処理用の VibeVoice-ASR は50以上を掲載している。OpenAI は GPT Transcribe について同等の検証済み言語リストを公開しておらず、発表資料では Common Voice の22言語で優れた結果を報告している。しかし、Earnings22 で監査された音響上の弱点は、「対応している」ことと「その言語のノイズの多い音声を処理できる」ことは別の主張であることを思い出させる。カバレッジのニーズが広範囲に及ぶ場合、どちらのリストも決め手にはならない。実際の方言でテストすべきである。

結論:スコアではなく、レーンで選ぶこと。
GPT Transcribeを選択するのは、音声が完成したファイルである場合、既知の制限を伴う文書化された精度の数値が必要な場合、または独自の音声インフラを運用しないことが1時間あたり0.27ドルに見合う場合です。そして、リアルタイム配信が約4倍の価格を正当化する場合にのみ、GPT Live Transcribeと組み合わせてください。VibeVoice-ASR-Streaming-7Bを選択するのは、ジョブがライブかつ複数話者である場合、会話がまだ進行中に文字起こしが届くことを望む場合、話者属性付きストリーミング出力を評価したい機能とする場合、またはオープンウェイトとデータ管理が測定されたベンチマークよりも重要である場合です。
どちらかで構築するチームへの構造上の注意点がひとつあります。文字起こしレイヤーは、現在OrcaRouterがルーティングする対象ではありません。このページにある音声認識モデルはどれもカタログに含まれていないため、ASRの選択は完全にあなた次第です。ルーティングがもたらすのは、文字起こしの上のレイヤーです。ライブ文字起こしフィードは、何かがそれに作用して初めて有用になります。つまり、要約器、アラートルール、音声エージェントのプランナーなどです。そして、OrcaRouterが単一のAPIで200以上のモデルにわたって前面に立つのが、まさにそのスタックです。プロバイダーのリスト価格をマークアップなしでそのままパススルーし、自動フェイルオーバーも備えています。VibeVoice-ASR-Streaming-7Bのような実績のないチェックポイントを試しやすくするパターンは、まさに次の通りです。文字起こしを消費するエンドポイントを交換可能に保つこと。そうすれば、まだベンチマークのないモデルでも、発表時の主張ではなく、あなた自身の音声の証拠に基づいてトラフィックを獲得したり失ったりすることができます。
