「VibeVoice-ASR-Streaming-1.5B vs Granite Speech 5.0 470M TurboCTC:ひっそりとした2つのオープンウェイト・ストリーミング候補」と題した生成ヒーロータイトルカード。サブタイトルは「8日違いで登場した2つのオープンウェイト・ストリーミングASRモデル」。VibeVoice-ASR-Streaming-1.5B(Microsoft Research・2026年9月2日・MIT・合計約3B・音声LLM)とGranite Speech 5.0 470M TurboCTC(IBM・2026年8月25日・Apache-2.0・470M・純CTCエンコーダ)の2枚のモデルカードを備え、「エッジクラスの速度(IBM)」「英語のみ(IBM)」「10言語での誰が何を言ったか(Microsoft、未検証)」と読めるタグが付いている。OrcaRouterのロゴは右下隅に合成されている。
Guides & Insights

VibeVoice-ASR-Streaming-1.5B vs Granite Speech 5.0 470M TurboCTC:オープンウェイト・ストリーミングへの静かな2つの賭け

著者

Elias Hawthorne

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

2026年8月下旬に公開された、最も興味深いオープンウェイトのストリーミング音声文字起こしモデル2件は、いずれも発表イベントなしでリリースされた。8月25日、IBMはGranite Speech 5.0 470M TurboCTCをHugging Faceに公開した。ウェイト、モデルカード、ブログ記事だけで、それ以外は何もなかった。そして9月2日には、Microsoft ResearchがVibeVoice-ASR-Streaming-1.5Bをmicrosoft名前空間にアップロードした。VibeVoiceのGitHubリポジトリにニュース1行があった以外、発表はまったくなかった。この2つは同種のものだが、工学的には正反対の賭けである。IBMのモデルは4億7000万パラメータの純粋CTCエンコーダーで、ノートPC上でエッジ速度で動作するよう設計されている。一方、Microsoftのモデルはオーディオトークナイザーと拡散ヘッドで包まれた1.5Bクラスの音声音語モデルで、総パラメータ数は約30億。文字起こしをしながら音声を言語として理解するよう構築されている。

数字の前に、この比較を正直に保つ情報源のラベルを示す。IBM報告と明記されたものはすべて、Granite Speech 5.0 470M TurboCTCモデルカードとそのOpen ASRリーダーボードのエントリに由来し、IBMがリリース当日に公式ハーネスで実行したものであり、まだ独立に再現されていない。VibeVoice-ASR-Streaming-1.5Bに関するすべては、リポジトリを読むことから得たものである——設定ファイル、モデルカード、そしてMicrosoftのストリーミングドキュメントだ。なぜなら、Microsoftは正確性や遅延の数値をテキストで公開しておらず、Microsoft外部の誰もそのチェックポイントをベンチマークしていないからである。この2つは共通のハーネスで実行されたわけではない。この比較は、両方を同じ公開された証拠に照らして評価するものであり、それが両社がこれまでに提示したすべてである。

8日違いの静かな2つのリリース

両モデルは同じようにひっそりと登場した。それ以降、どちらの企業もほとんど発言していないため、この点は率直に述べておく価値がある。IBMのGranite Speech 5.0 470M TurboCTCは、2種類のバリエーションで発表されたうちのApache-2.0版である(IBMは、主要な数値がわずかに優れた非商用の-NC版も公開している)。そのモデルカードにはリリース日として2026年8月25日が記載され、ネイティブのTransformersサポートと、同日付のOpen ASRリーダーボードへの提出が含まれている。Microsoftのストリーミング向け2モデル、VibeVoice-ASR-Streaming-7BとVibeVoice-ASR-Streaming-1.5Bは、9月2日にHugging Face上で同じ分の間に作成された。GitHubのニュースで「音声が届くにつれて、誰が何を話したかを継続的に文字起こしする統合ストリーミングASRモデル」と発表されたのは9月3日付で、7Bに言及している。今回取り上げる1.5Bは、その陰で静かにリリースされた小型の兄弟モデルとして残されている。

興味深いのは、2つのチームが「ストリーミング」という言葉に辿り着きながら、正反対のものを構築したことだ。Granite Speech 5.0 470M TurboCTCは、CTCで学習され、非自己回帰の1パスでデコードされるコンフォーマーエンコーダである。テキストのトークンを1つずつ生成するデコーダが存在しないため、このモデルは構造的に軽量で、構造的に高速である。VibeVoice-ASR-Streaming-1.5Bは音声LLMである。2つの畳み込みトークナイザーが24kHzの音声を約7.5Hzの音声トークンストリームに変換し、Qwen2系のデコーダ(28層、1,536個の隠れユニット、すなわち1.5Bクラス)がそれを読み取り、拡散ヘッドが約2.9秒のチャンク単位で、約0.5秒の先読みを伴って書き起こしを生成する。一方はレースカーであり、もう一方はたまたま聞くことを備えた小さな言語モデルである。

仕様確認

• パラメータ — Granite Speech 5.0 470M TurboCTC: 470M、エンコーダーのみ vs VibeVoice-ASR-Streaming-1.5B: 合計約3B(1.5BクラスのLMバックボーンに加え、トークナイザーとディフュージョンヘッドを含む)

• アーキテクチャ — ブロック自己注意と自己条件付けを備えたコンフォーマエンコーダ、CTCトレーニング済み、グリーディ非自己回帰デコード vs デュアル音響/セマンティックトークナイザーがQwen2系の因果デコーダ(DDPM拡散ヘッド付き)に入力する構成。

出力ケイデンス — 毎秒約12.5出力フレーム、チャンク単位のストリーミング。音声トークンは約7.5Hzであるのに対し、約0.5秒の先読みを伴う約2.9秒のチャンクごとにテキストを出力。

言語 — 英語のみ vs 10言語: 中国語、英語、フランス語、ドイツ語、イタリア語、日本語、韓国語、ポルトガル語、ロシア語、スペイン語。

• 重み — エッジクラスは約0.5Bパラメータ/1GB未満、NVIDIA GPUクラスはbf16で約5.6GB

• 印刷物における精度 — IBMが報告したOpen ASRショートフォームセットの平均WERは約5.00%だが、テキストにはWERの数値は一切掲載されていない。

• ライセンス — Apache-2.0 vs MIT.

• リリース — 2026年8月25日 vs 2026年9月2日

A two-column comparison scoreboard titled 'VibeVoice-ASR-Streaming-1.5B vs Granite Speech 5.0 470M TurboCTC — the scoreboard'. Left column VibeVoice-ASR-Streaming-1.5B: Released Sept 2 2026, Params ~3B total / 1.5B-class LM, Architecture speech LLM + diffusion, Languages 10, Streaming ~2.9 s chunks + ~0.5 s lookahead, WER none published, License MIT. Right column Granite Speech 5.0 470M TurboCTC: Released Aug 25 2026, Params 470M, Architecture conformer CTC, Languages English only, Streaming chunkwise ~12.5 frames/s, WER ~5.00% (IBM-reported), License Apache-2.0. Footer reads 'Granite figures IBM-reported, unverified; VibeVoice specs read from the HF repo; no independent benchmark of either exists yet.' The OrcaRouter logo is composited in the bottom-right corner.

速度:一方は小型であるように作られ、もう一方は言語モデルとして作られています。

アーキテクチャ上の違いは、まず速度とハードウェアに現れる。Granite Speech 5.0 470M TurboCTCは、ラップトップ、スマートフォン、その他のエッジデバイスを対象としている。純粋なCTCエンコーダーはサンプリングを行わないため(出力は16,384ユニットのBPEヘッドに対する単一の貪欲パス)、実行コストは極めて低い。IBMのモデルカードによると、単一のH200で測定したOpen ASRスループットは、TurboCTCラインで数万RTFxに達し、ブラウザタブでリアルタイムに文字起こしするWebGPUデモも併せて示されている。これらの数値はIBMによる測定であり再現されていないが、構造上の要点はそれ自体で成立する。自己回帰デコーダーを持たない470Mエンコーダーは、スマートフォンに標準搭載されているハードウェアで実行できるモデルなのである。

VibeVoice-ASR-Streaming-1.5Bは、逆のトレードオフを選択している。そのデコーダは因果言語モデルであり、テキスト生成がCTCのargmaxよりも重いループで行われることを意味する。また、文書化された実行方法は、NVIDIA GPU上でのセルフホスティング——microsoft/VibeVoiceリポジトリのPythonデモ、またはそのvLLMプラグイン——であり、KVキャッシュを加える前の段階で約5.6GBのbf16重みが必要になる。マイクロソフトはスループットやリアルタイムファクター(RTF)に関する公表値を出していないため、IBMの数値に対置できるベンダー数値は存在しない。このLLMアーキテクチャが代わりに手に入れるのはコンテキストである。つまり、モデルは言語モデルと同じように、トランスクリプト全体にわたって話者と内容に関する理解を持続させる。それが、音を書き起こすことと会話を追うことの違いなのである。

精度:一方のベンダーは数値を印刷し、他方は画像を印刷した。

証拠に基づけば、Granite Speech 5.0 470M TurboCTC は VibeVoice-ASR-Streaming-1.5B より、公表可能なベンチマーク全体に相当する差で先行している。IBM はリリース当日に公式 Open ASR リーダーボードのハーネスで自社モデルを実行し、公開された英語のショートフォームテストセット群で平均単語誤り率が約 5.00% だったと報告している。これはベンダー自身による測定値であり、第三者による検証はなく、Microsoft 側のこの比較にはまったく存在しない数字である。VibeVoice-ASR-Streaming-1.5B のモデルカードには、評価結果の図が画像として添付されているが、数値の WER・RTF・レイテンシーは文章として記載されていない。VibeVoice ファミリーで唯一の数値的よりどころは、バッチモデル VibeVoice-ASR のカードにベンダーが報告した平均 WER 7.77%(英語のテストセット8件)であり、これは非ストリーミングモデルを説明するもので、ストリーミングモデルには転用できない。最終的に独立した評価がどう出ようとも、今日の正直な要約は、IBM が数値を公開し、Microsoft が画像を公開した、ということだ。

A screenshot of the Hugging Face model card for microsoft/VibeVoice-ASR-Streaming-1.5B, showing the model title, the 'License: mit' tag, a '10 languages' tag, the automatic-speech-recognition pipeline tags, the '3B params' model-size line, and the card's description of streaming speaker-attributed transcription with customized hotwords.

「言語と出力:英語のみ対誰が何を言ったか(10で)」

Granite Speech 5.0 470M TurboCTCは英語のみ対応で、生の文字起こしテキストを返します。それは、IBMが狙っているワークロード(エッジハードウェアでの企業向け英語文字起こし)にとっては欠点ではありません。しかし、音声が英語でない時点で、その比較は終わってしまいます。VibeVoice-ASR-Streaming-1.5Bは10言語に対応し、ストリーミングで話者属性付き出力を提供すると主張しています。モデルカードには、音声が届くにつれて「誰が何を言ったかを継続的に文字起こしする」とあり、ドメイン用語のホットワードがコンテキストプロンプトとして渡されます。この2つの追加機能は懐疑的に見るべきです。チャンク境界をまたぐストリーミング話者分離は本当に難しく、その主張は未検証だからです。しかし、それこそが、多言語でのライブ会議を抱えるチームがマイクロソフトのモデルを検討する理由なのです。

ライセンスとエコシステム:Apache-2.0 対 MIT、Transformers 対 研究用リポジトリ

どちらのライセンスも商用利用を認めており、この点だけで、この2つは同じアーキテクチャを採用したIBM自身の-NC変種からはすでに一線を画しています。Granite Speech 5.0 470M TurboCTC はApache-2.0で通常の特許付与条項を備え、Hugging Face Transformers(transformers >= 5.16 のAutoModelForCTC)にネイティブ対応し、さらにApple Silicon向けのmlx-audioにも対応しています。つまり、このエコシステムで最大の導入コミュニティが動作する場所ならどこでも、あらゆるベンダーのハードウェア上で動作するということです。VibeVoice-ASR-Streaming-1.5B はMITで、こちらはさらにシンプルです。ただし、そのサービング経路はソースからビルドする研究用セットアップです。チェックポイントのアーキテクチャクラス VibeVoiceForASRStreamingTraining は公開されているTransformersドキュメントには記載されておらず、Microsoft自身のストリーミングドキュメントも、標準ライブラリでのロードではなく、リポジトリのデモコードとvLLMプラグインを指し示しています。本番運用チームにとって、この違いは現実のものです。一方のモデルは今日すぐに既存のTransformersパイプラインに組み込めますが、もう一方は研究用リポジトリを立ち上げ、ロード経路を自分で検証することを求められます。

A screenshot of the Hugging Face model card for ibm-granite/granite-speech-5.0-470m-turboctc, showing the model title Granite-Speech-5.0-470M-TurboCTC, the Apache-2.0 license tag, the English-language tag, the automatic-speech-recognition pipeline tag, and the model summary describing a compact 470 million parameter English ASR model for edge deployment.

どのクワイエットリリースを評価すべきでしょうか?

Granite Speech 5.0 470M TurboCTC は、ワークロードが英語で、ハードウェアがエッジクラスまたはCPUバウンドであり、Transformersにそのまま組み込めてモデルカードの数値で検証できるモデルを必要とする場合に、まず評価すべきです。これは、ひとつの点を除いてあらゆる面でリスクが低い選択肢ですが、第二言語や、誰が話しているかを把握する必要があるライブ会議の文字起こしには対応できません。

多言語ストリーミングが必要な場合、誰が何を言ったかの出力やホットワードを試してみたい場合、あるいは純粋なエンコーダーよりも言語モデル方式の音声認識に賭けたい場合は、VibeVoice-ASR-Streaming-1.5B を評価してみてください。NVIDIA GPU、ソースからのインストール、約 5.6 GB の重み、そしてご自身で設計する評価のための予算を組んでください。Microsoft を含め、誰もまだ信頼できる数値を公開していないからです。

「静かなリリース」のどちらも変えないのは、どの賭けが報われるかを見極めている間、ASRレイヤーを交換可能なまま維持する価値だ。両モデルは新しく、本稿執筆時点ではどちらもOrcaRouter経由では提供されていない。プロバイダーがいずれかをホストした場合、低リスクで試すには、200以上のモデルをプロバイダーリスト価格で提供するルーティングレイヤーの背後に置くのが良い。マークアップは0%なので価格変更は即日反映され、すでに信頼しているものへの自動フェイルオーバーも備わる。実際の音声の一部を新しいモデルにルーティングし、文字起こしを読み、リリース当日のベンチマークシートではなく、自分自身のトラフィックに、どの静かな賭けが正しかったかを判断させるのだ。

© 2026 OrcaRouter

プロバイダー向け

推論プラットフォームを運営していますか?OrcaRouter にモデルを掲載しましょう。

providers@orcarouter.ai

コミュニティに参加

Discordsupport@orcarouter.aiXGitHubYouTube