
Grok Voice Transcribe 2.0 vs Granite Speech 5.0 470M TurboCTC:12,600倍のリアルタイムが0.5秒と出会う
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100万トークンあたり
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- openaiOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- googleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- anthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1244知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0540知能72コーディング
- qwenQwen: Qwen3.8 Max2026-08-0345知能76コーディング
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135知能69コーディング
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100万トークンあたり
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Granite Speech 5.0 470M TurboCTCは、単一のH200上で毎秒約3.5時間分の音声を文字起こしし、Grok Voice Transcribe 2.0は、話し終えてから0.49秒後に最初の部分文字起こしを返す。これらの2つの数値は、比較記事で同じ種類の測定値であるかのように並べられるが、まったく同じ種類の測定値ではない——一方はレイテンシが付随しないバッチ処理されたデータセンターのスループット値であり、他方はスループットを誰も公表していないモデルのレイテンシ値である。IBMは2026年8月25日にGranite Speech 5.0 470M TurboCTCをApache 2.0の下でリリースし、言語モデルデコーダーを完全に排除して、単一の非自己回帰CTCパスで復号した。SpaceXAIは2026年9月18日にGrok Voice Transcribe 2.0をマネージドAPIとして提供開始した。バッチでは音声1時間あたり$0.10、ストリーミングでは1時間あたり$0.20である。どちらも同じ問題の反対側の半分を解決する優れた文字起こしモデルであり、数値を直接比較するのをやめれば、どちらを選ぶかはより簡単になる。
実時間の12,600倍、そしてそれを修飾する言葉
Graniteの数値は、バッチ推論を用いて単一のNVIDIA H200上で測定された12,600 RTFxである——IBMの数値であり、発表時に報告され、その後独立に再現されていない。RTFxは音声の長さと処理時間の比率なので、12,600は実時間1秒あたりおよそ3.5時間分の音声を意味する。IBM自身の説明では、これは以前のGranite Speechリリースのスループットの20倍以上であり、ここで実際に重要なのはこの主張だ。つまり、高速化はハードウェアを追加したことではなく、作業を取り除いたことによってもたらされた。
それが何ではないかと言えば、レイテンシの数値ではない。毎秒3.5時間分の音声を処理し終えるバッチジョブであっても、個々のファイルの最初のトークンを返すまでには依然として長い時間がかかりうる。それはバッチがどのように構成されるか、また処理を開始する前にどれだけの音声を投入するかによって決まる。IBMはTurboCTCについてレイテンシの数値を一切公表していない。ファーフィールドのリーダーボードでは、その2つのチェックポイントが最速の2エントリだが、そこでのスループットは単一のNVIDIA L4で測定されたものであり、これはデータセンター隣接型のアクセラレータであって、スマートフォンではない。
これが重要なのは、このモデルがラップトップ、スマートフォン、エッジデバイス向けだと — IBM自身の位置づけとして — 明確に位置づけられており、しかもそれらのいずれについてもシングルストリーム性能を公表した人は誰もいないからだ。誰かが公表するまでは、「12,600×」は、レンタルGPU上でバックフィルをどれだけ安く処理し切れるかについての主張として扱うべきであり、それは真に価値があり、十分に裏付けられた主張であって、一人のユーザーが一文の応答をどれだけ速く受け取れるかについての主張ではない。
IBMが削除したもの、そしてそれがあなたに負わせるコスト
TurboCTC はエンコーダのみで構成される設計です。16 層の Conformer 音響エンコーダを CTC で学習し、非自己回帰の 1 回のパスで貪欲法によりデコードし、16,384 ユニットのサブワード出力層を備えています。ループ内に言語モデルはありません。そこから速度が得られ、同時に、そこから機能の削減も生じています。しかも、その削減は小さなものではありません。以前の Granite Speech モデルと比較すると、TurboCTC は音声翻訳を削除し、キーワードバイアスを削除し、タイムスタンプや句読点のツールも搭載していません。
それを、マネージドモデルが定価に含めている内容と突き合わせてみると、この取引の輪郭が具体的になってくる:
• キーターム・バイアス — Granite Speech 5.0 470M TurboCTC にはなく、Grok Voice Transcribe 2.0 ではリクエストごとに最大100個のキータームに対応
• 単語レベルのタイムスタンプ — TurboCTC には非搭載 vs 信頼度スコア付きで含まれる
• 音声翻訳 — 以前の Granite Speech モデルには搭載されていたが、ここでは削除されている vs どちらでも提供されていない
• 言語カバレッジ — 英語のみ vs 幅広く多言語にわたる入力セット全体での自動検出、25言語の書式設定サポート付き
• ダイアライゼーション — 自分で解決する別個の問題か、リクエスト価格に含まれるか
• チャンネル — パスごとに1ストリーム vs 1回のリクエストで最大8オーディオチャンネル
• テキスト正規化 — なし vs 逆テキスト正規化:話された日付、通貨、電話番号を書き言葉の形式に変換すること
• デプロイメント — ダウンロードして実行する重み vs us-east-1 のマネージドエンドポイント
そのリストは、成績表ではなく、2つの異なる製品の説明として読んでほしい。ダイアライゼーション、バイアシング、正規化を削り落としたことが、スループットを手に入れた理由だ。4万件の通話録音を検索インデックスへ一括でバックフィルするのに、タイムスタンプや話者交替は要らない。必要なのは安く済むこと、そしてとにかく終わることだ。そしてその仕事において、欠けている機能は欠けているのではなく、削ぎ落とされた重りなのだ。
リアルタイムのものについては逆が当てはまります。音声エージェントを構築しているなら、キータームリストこそが「Kubernetes」「Granola」、そして顧客名を正しく表記する方法であり、バイアス機構のない文字起こしツールは毎回それらを間違え、ファインチューニング以外に修正する術がありません。そしてファインチューニングは、別のプロジェクトであり、別の予算の話です。そのたった一つの欠落機能が、TurboCTC を一部のワークロードでは失格にし、他のワークロードでは無関係にします。だからこそ、モデル比較はワークロード比較ほど有用ではないのです。

きれいに行うことのできない精度比較
IBMは、Open ASR Leaderboard上で、Apache 2.0チェックポイントについて総合ワードエラー率5.00%、非商用の同系モデルについて4.85%を報告している。対象は公開英語の短尺セットだ。これらは、AMIやEarnings22、長尺会話セットを含む評価を行うボード上のバッチ数値であり、ベンダー報告値である——リーダーボードのツールを通してはいるが、非公開テストセットも含む公式テーブルにはまだ取り込まれていない。モデルカードに公開されているセット別内訳は読む価値がある。平均は多くを隠してしまうからだ。LS Clean 1.42%、LS Other 2.66%、SPGISpeech 3.18%、Voxpopuli-Cleaned-AA 4.88%、Earnings22-Cleaned-AA-chunked 6.69%、AMI-Cleaned 7.52%、Gigaspeech-Cleaned 8.67%で、平均するとちょうど5.00%になる。同じカードは、1台のH200で測定された平均RTFx 13,042.98も引用している——IBMのローンチ記事が使った12,600という数値より高く、両方の数値は同じ会社による、同じ週の、同じハードウェア上のものだ。
Grok Voice Transcribe 2.0 の最終文字起こしにおける 2.7% という数値は、比較可能な測定値ではありません。これは Artificial Analysis の AA-WER Streaming ボードから得られたもので、AA-AgentTalk を 50%、VoxPopuli を 25%、Earnings22 を 25% で重み付けした合成指標です。つまり、およそ 8 時間のエージェント重み付けされた英語会話音声を、ストリーミングインターフェース経由で測定したものです。異なるデータセット、異なる重み付け、異なる動作モードです。2.7% を 5.00% と並べて、マネージドモデルの方がおよそ 2 倍正確だと結論づけるのは、この比較で起こりうる最もよくある誤りです。
正直に言えることは、より狭い範囲にとどまるが、それでもなお有用である。両モデルは、それぞれ測定対象となった音声については強い。Grok Voice Transcribe 2.0 は、他のモデルも同じく測定されている独立運営のストリーミングリーダーボードで首位に立っており、そのため、正確な値がそのまま他に当てはめられなくても、その順位は検証可能である。Granite Speech 5.0 470M TurboCTC には、標準的なオープン ASR セットにおける総合 WER があり、さらに別途、非商用チェックポイントが精度で5位、Apache のものが9位となる遠距離場の結果がある——騒音と残響のある音声で測定されたもので、これはセット内で最も難しい条件であり、おそらくどちらのモデルの数値の中でも最も正直なものだ。
音声がクリーンな英語の朗読音声であれば、これら2つの精度差は、リーダーボードの順位が示唆するよりも小さい可能性が高い。雑音が多い、なまりがある、電話音声、または英語以外であれば、どちらのリーダーボードも大して参考にはならず、それを教えてくれる唯一の手段は自分自身のテストセットだけです。
フリーウェイト対時給1.67ドル
コスト比較は、これら2つのモデルを本当に容易に区別できる唯一の場面であり、一般に引用される数字はどちらの方向にも間違っている。
• バッチ文字起こし — Grok Voice Transcribe 2.0 は音声1時間あたり$0.10、つまり1,000分あたり約$1.67。これに対し Granite Speech 5.0 470M TurboCTC はライセンス費用ゼロ、加えてGPU時間が必要
• ストリーミング — 音声1時間あたり0.20ドル、1,000分あたり約3.33ドル。一方、IBMはホスト型ストリーミングパスを公開していない
• ライセンス — 重みが非公開の商用APIに対し、メインのチェックポイントはApache 2.0、より高精度な非商用版はCC-BY-NC-SA-4.0
「Free」はあの最初の行でかなりの働きをしている。470Mのencoder-onlyモデルは控えめなハードウェアで動かせるほど小さく、それがこの設計の狙いであり、IBMが8台のH100で10日間で学習し、WebGPUデモ付きで`transformers>=5.16.0`向けに出荷した理由でもある——それでも、GPU、サービングスタック、オートスケーリング、リトライ、オンコールローテーションの費用は誰かが払っている。小規模な利用量では、マネージドの価格は通常エンジニアリング時間より安い。大規模で安定した利用量ではレンタルハードウェアの道が勝り、その分岐点は音声の量ではなく利用率の関数だ。常に忙しくしているGPUは1時間あたり安く、ピークトラフィックのために温めておくGPUはそうではない。
ライセンスに関する一点は、誰かがそれを前提に設計を進める前に指摘しておく価値がある。2つのチェックポイントのうちより高精度な方、WER 4.85% のものは、CC-BY-NC-SA-4.0 の下での非商用版だ。Apache 2.0 のチェックポイントは 5.00% の方で、製品に同梱して出荷できるのはこちらである。これは 0.15 ポイントの精度差を、モデルをそもそも使用できる権利と引き換えにしたものであり、また、「Granite Speech 5.0」について 4.85% を引用しながら商用展開を論じる比較は、誤ったチェックポイントを引用していることになる。

決定規則
3つの質問は、どんなベンチマーク表よりも速く、この2つのモデルを区別する。
文字起こしは、話者がまだ話している間にライブで消費されますか? もしはいなら、TurboCTCは候補ではありません——遅いからではなく、ストリーミングインターフェースも部分出力も持たず、部分的な文字起こしは高速なバッチデコードとは異なるアーキテクチャ上のコミットメントだからです。もしいいえなら、スループットの優位性がすべてになり、処理した音声1時間あたりのコストではIBMのモデルを打ち負かすのは非常に困難です。
その作業にドメイン語彙は必要ですか?必要なら、バイアス機能を備えたモデルが既定で勝ちます。そしてTurboCTCにキーターム・バイアスがないことは、単に不便というより失格要因です。必要ないなら、マネージド側では使わない機能にお金を払っていることになります。
その音声は、まともなハードウェアで収録された英語の朗読音声ですか? はいなら、どちらも強力で、選択は運用面の問題です。いいえなら、どちらのボードも有益な情報を提供せず、あなた自身の評価だけが重要です。
どちらに転んでも、この判断を安上がりにしてくれるのは運用レイヤーだ。OrcaRouterは、プロバイダー間の自動フェイルオーバーを備えた単一のOpenAI互換キーの背後に200以上のモデルを配置しているので、単一リージョンのマネージド音声エンドポイントが午後に不調になったところで、それがあなたの障害になることはなくなる。さらにプロバイダーの定価は0%のマークアップでそのまま通るため、ベンダーの価格変更や新しいチェックポイントは当社側で当日中に反映される。正解が本当に不明なワークロードにとって、これは「間違えるコスト」を取り除いてくれる。単一のエンドポイントの背後であなた自身の音声に対して両方をベンチマークし、勝った方を残し、次が出たらモデル文字列を変更すればよい。

手短に言うと、Granite Speech 5.0 470M TurboCTC は「これまで録音してきたすべてを、安価に、自分たちが管理するハードウェア上で文字起こしする」に対するより良い答えであり、Grok Voice Transcribe 2.0 は「これをリアルタイムで、正確に、自分たちがサービングスタックを運用せずに文字起こしする」に対するより良い答えだ。12,600× という見出しも 0.49 秒という見出しもどちらも真であり、どちらも他方の証拠にはならない。
