
Grok Voice Transcribe 2.0 対 NVIDIA Parakeet TDT 0.6B:2つのリーダーボード、1つの誤解を招く比較
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100万トークンあたり
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- openaiOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- googleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- anthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1244知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0540知能72コーディング
- qwenQwen: Qwen3.8 Max2026-08-0345知能76コーディング
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135知能69コーディング
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100万トークンあたり
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
NVIDIA Parakeet TDT 0.6B は、2025年8月14日に CC-BY-4.0 で公開された6億パラメータの FastConformer-TDT トランスデューサーで、自分で文字起こしを実行したい人にとって1年以上にわたり既定の推奨であり続けている。Grok Voice Transcribe 2.0 は SpaceXAI のマネージド音声テキスト化モデルで、2026年9月18日に提供が開始され、バッチは音声1時間あたり0.10ドル、ストリーミングは1時間あたり0.20ドル、Artificial Analysis のストリーミングボードでは最終単語誤り率2.7%となっている。この2つを比較しようと検索すると、Parakeet が WER 13.7%、Grok Voice Transcribe 2.0 が 2.7% と引用されているのを見つけるだろう。これはマネージドモデルのほうが5倍正確に見えるが、読んでいて本当に誤解を招く。これら2つの数値は、異なる Artificial Analysis のインデックスに由来し、異なるデータセットに基づいて構築され、数年離れて公開されたもので、しかも一方はベンダー自身のより新しい測定値によって更新されている。本当の比較はもっと興味深く、600メガバイトの重みが、APIでは得られない何をもたらすかという話だ。
13.7%という数字、そしてそれを使うべきでない理由
Artificial Analysisの2025年第3四半期「State of AI」レポートは、NVIDIA Parakeet TDTをAA-WER指数で13.7%の3位に位置づけ、GoogleのChirp 2(11.6%)とNVIDIA自身のCanary Qwen(13.2%)に次ぐ結果とした。この指数は、VoxPopuli、Earnings-22、AMI-SDMのそれぞれ約2時間分を音声時間で重み付けした平均だった。多様なアクセント、専門分野の語彙、厳しいチャネル条件を伴う実世界の音声であり、だからこそこの指数上のどの数値も高くなる。残響のある部屋で録音された遠距離会議音声であるAMI-SDMでの13.7%のWERは、悪い結果ではない。それは難しいテストなのだ。
その指数はもはやその形では存在しない。Artificial Analysis はそれを AA-WER v2 として再構築し、AA-AgentTalk を50%、VoxPopuli-Cleaned-AA と Earnings22-Cleaned-AA をそれぞれ25%で重み付けした。約8時間の音声で、クリーニングと再重み付けによってすべてのモデルの数値は大幅に動いた。現在の非ストリーミングボードでは、Parakeet TDT 0.6B V3 は低い一桁台に位置しており — 他のオープンウェイト首位級と同じ帯域で — 13.7% の近くにはまったくない。そしてボードの最上位は約2%まで下がっている。Parakeet について今なお13.7%を引用している人は、廃止された測定値を引用している。また、それを2026年のストリーミング数値と比較しているなら、二つの異なるボードをまたいで比較していることになる。
公平に横並びにできる範囲は、もっと限られている。NVIDIA自身によるOpen ASR Leaderboardでの評価——標準的な公開英語ショートフォーム音声セットを、同ボードのツールで実行したもの——では、Parakeet TDT 0.6B V3の平均WERは6.32%、RTFxは3,332.74と報告され、英語専用v2の平均は6.05%だ。Grok Voice Transcribe 2.0の2.7%は、ストリーミングボードにおける最終文字起こしの数値であり、発話終了後に測定された、エージェント重み付けされた英語会話音声でのものだ。データセットもボードもモードも異なる。マネージドモデルは、2つのボードが共有する音声では、かなり高い確度でより正確だろう。ただし、その優位性の大きさが5倍なのではない。そして、それを決着させる測定値を公表した者はいない。
2つのモデルが実際にはどのような形をしているのか
アーキテクチャの違いが、実用上の違いの大部分を説明する。Parakeet TDT 0.6Bは、トークン・アンド・デュレーション・トランスデューサ・デコーダを備えたFastConformerエンコーダであり、トークンと進めるフレーム数の両方を予測する。これにより、空白を出力するのではなくスキップできるため、これが効率性の主な源となっている。25のヨーロッパ言語にわたる自動言語検出、単語レベルおよびセグメントレベルのタイムスタンプ、句読点と大文字小文字の区別を備えており、長い音声も処理できる——フルアテンションでは最大24分、ローカルアテンションでは約3時間まで対応する。NeMo 2.2を通じて提供され、Apple Silicon向けのMLXパスがあり、通常のCPUで動作するONNX INT8ビルドも存在する。
Grok Voice Transcribe 2.0 はマネージドサービスであるため、比較はモデルと製品の間のものになります。この製品が定価に含む内容は次のとおりです。
• ストリーミング — Grok Voice Transcribe 2.0 は WebSocket 上でネイティブに動作し、最初の部分結果は0.49秒で、ファーストクラスの部分トランスクリプトインターフェースを持たない Parakeet TDT 0.6B のチャンクまたはバッファリング方式とは対照的です。
• キータームバイアス — 1リクエストあたり最大100個のキータームに対し、Parakeetにはこの機能がない
• 話者分離 — リクエスト価格に含まれる vs 自分で追加する別システム
• チャンネル — 1回のリクエストで最大8つのオーディオチャンネルに対し、1パスにつき1ストリーム
• 逆テキスト正規化 — 句読点と大文字化のみとは対照的に、25言語にわたって含まれます
• デプロイ — us-east-1 のマネージドエンドポイント vs ダウンロードしてどこでも実行・運用できる重み
• ライセンス — 商用API条件 vs 帰属表示付きCC-BY-4.0
• モデルサイズ — 非公開 対 約6億パラメータ、fp32で約2.4GB、fp16で約1.2GB
最後の行は、多くのデプロイを左右する行だ。Parakeet TDT 0.6B は数ギガバイトに収まり、INT8 ONNX パスを通せばノートPCのCPUでも許容できる速度で動作し、あらゆるコンシューマー向けGPUにも余裕で載る。これはAPIがやっていることの小型版ではない——オフラインで、デバイス上で、ネットワークも時間課金もなしに動く文字起こし機能と、そうでないものとの違いなのだから、別の能力なのだ。

誰もきちんと行わないコスト計算
公開される比較は「1時間あたり0.10ドル対無料」だが、これは双方向に間違っている——APIは支払う唯一のものではないし、重みは節約できる唯一のものでもない。
バッチ文字起こし — Grok Voice Transcribe 2.0 は音声1時間あたり $0.10、1,000分あたり約 $1.67 であるのに対し、Parakeet TDT 0.6B はライセンス料無料+GPU または CPU 時間
• ストリーミング — 音声1時間あたり0.20ドル、1,000分あたり約3.33ドル(セルフホストの場合と比較)。セルフホストでは、制約となるのは公開された料金ではなく、自身の同時実行数の上限です
• サービスの上限 — 毎秒10リクエスト、チームごとに100の同時ストリーミングセッション に対して、お使いのハードウェアが許容する範囲では、レート制限も同時実行の上限もなし
• どちらの帳票にも載っていないコスト——エンジニアリングも、サービングスタックも、オートスケーリングとオンコール当番のせめぎ合いも、リトライロジックも、モデルの更新も、ピーク時に備えて温め続けるGPUも
小規模では、マネージド側の方がほぼ常に安上がりだ。セルフホスト経路の固定費は人件費だからだ。大規模で安定した処理量では、セルフホスト側が決定的に有利になり、分岐点は音声量ではなく稼働率の関数である。稼働し続けているGPUは音声1時間あたり非常に安く、ピークトラフィックのために温め続けるGPUはそうではない。月20,000時間を処理するチームは、マネージドのバッチ経路に$2,000を支払い、セルフホスト側では中位GPU1台月程度に加えてエンジニアリング時間を要する。これは比べ物にならない。
計算がひどく行われるのは、セルフホスト側は通常ゼロで、マネージド側は通常定価で比較されるからだ。どちらも実際の数値ではない。実際なのは、Parakeet TDT 0.6B の 3,332 RTFx —— NVIDIA の数値であり、バッチ処理され、データセンター ハードウェア上で得られたもので、約束ではなく上限として扱うべきもの —— が意味するのは、控えめな GPU 1 台で、ほとんどの組織が生成するより多くの音声を処理できるということだ。
Parakeetが正解でなくなるのはどこか
チームをオープンモデルからマネージドモデルへと押しやる要因は3つあり、そのどれもが精度ではありません。
第一に挙げられるのはキーターム・バイアシングです。文字起こしに製品名、姓、ティッカーシンボル、業界専門用語が頻出するなら、バイアシング機構を持たないモデルはそれらを誤って認識し、ファインチューニング以外に矯正手段はありません。Grok Voice Transcribe 2.0 は1リクエストにつき最大100件のキータームを指定できます。Parakeet TDT 0.6B にはこの機能がありません。コンタクトセンター、医療、法務の業務では、どのリーダーボードが何と言おうと、この一点の欠落だけで失格です。
2つ目はダイアライゼーションです。Parakeetはタイムスタンプ付きの単語を返しますが、それを誰が話したかまでは教えてくれません。複数話者の文字起こしとなると、別途ダイアライゼーションモデルを実行して出力を整列させる必要があり、これは設定オプションというより一つのプロジェクトです。マネージドモデルなら、同じリクエストで話者を紐付けたテキストが返ります。
第三は、ストリーミングインターフェースそのものです。Parakeet は十分に高速なため、人々はそれを基盤にリアルタイムシステムを構築します — 音声をチャンクに分割し、各チャンクでモデルを実行し、出力をつなぎ合わせる — しかし、部分文字起こしの挙動、ターン終了の検出、コミットメントのセマンティクスは、すべて自分で書いて保守するものです。Grok Voice Transcribe 2.0 は、製品機能として、話し終えてから 0.49 秒後に最初の部分文字起こしを返します。
また、チームを時折驚かせるライセンス上の細かい点もあります。Parakeet TDT 0.6B V3 は CC-BY-4.0 であり、商用利用は許可されていますが表示義務があります。また、一部の NVIDIA 音声モデルはその後、ベンダー独自の Open Model License に移行しています。もし表示があなたの製品にとって問題になる場合は、モデルファミリーの条件が適用されると決めつけずに、その特定のチェックポイントのカードを読んでください。

なぜ結局APIが通常は勝つのか、そしてそうすべきでない時
過去1年間のパターンは一貫している。チームはまず、無料で制御可能だからという理由で Parakeet TDT 0.6B のようなオープンモデルから始め、機能をリリースする。その後、継続的なコストは GPU ではなく保守にあると気づき、マネージドエンドポイントへ移行する。逆方向の移行も起こる。たいていは、時間単位の料金が、自分で所有できるはずのものに払う賃料のように見え始める閾値を利用量が超えたときだ。
モデルをアプリケーションに直接組み込むと、どちらの方向も実行コストが高くつく。だからこそ、呼び出し側は退屈なままにしておくべきだ。OrcaRouter は、単一の OpenAI 互換キーの背後に 200 以上のモデルを公開し、プロバイダー間の自動フェイルオーバーと、プロバイダー定価への 0% の上乗せを提供する。そのため、セルフホストのデプロイとマネージドのデプロイを同じインターフェースの背後に置き、モデル文字列ひとつで入れ替えられる。これは音声ではいつも以上に重要だ。リーダーボードは数週間ごとに首位が入れ替わり、単一リージョンのマネージドサービスは単一リージョンの障害そのものだからだ。フェイルオーバー経路こそが、文字起こし機能を文字起こし障害にしない鍵である。
オープンモデルのスループットを、サービングスタックなしで求めるチームにとって、それは意思決定の形でもあります。つまり、自分の音声で Parakeet TDT 0.6B をベンチマークし、同じ音声で Grok Voice Transcribe 2.0 をベンチマークし、勝った方にトラフィックを任せて、自分はそれがどこのベンダーのロゴを載せているかを気にしなくなるのです。

一行で言うなら、Parakeet TDT 0.6B は今でも「どんなものでも、どこでも、時間あたりのコストをかけずに、すでに持っているハードウェアで文字起こしする」という問いへの最良の答えであり、Grok Voice Transcribe 2.0 は「話者ラベルと自分専用の語彙で、何も実行せずに正確に文字起こしする」という問いへの答えだ。ギャップを膨大に見せる 13.7% という数字は廃止された測定値であり、正直なギャップ — 重なった音声における WER の 1〜3 ポイント程度 — は、運用上の問いで決めるべきほど小さい。
