Grok Voice Transcribe 2.0と表示された記事ヒーローカード。バッジは「ニュース」、サブタイトルは「ストリーミング精度第1位、価格は変わらず」。チップには、2.7% WER 最終トランスクリプト、3.4% 最初の部分結果、発話終了後0.49秒、ストリーミング1時間あたり$0.20と表示され、白から青へのグラデーション上に、右下にOrcaRouterのロゴがある。
Engineering & Research

Grok Voice Transcribe 2.0が価格据え置きでストリーミング精度第1位の座を獲得

著者

Alistair Wren

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

Grok Voice Transcribe 2.0は、SpaceXAIが2026年9月18日に投入した音声テキスト化モデルであり、これについて重要な唯一の数字は、ローンチ記事が冒頭で打ち出している数字ではない。それはこれだ。最初の部分トランスクリプト――発信者がまだ話している間に、音声エージェントが実際に行動に移せるテキスト――の単語誤り率が、Grok Voice Transcribe 1.0の18.3%から3.4%になった。これはArtificial AnalysisのAA-WER Streamingボードでの測定値であり、新モデルは現在、Final Transcriptランキング(WER 2.7%、発話終了後0.49秒)とFirst Partial Transcriptランキング(3.4%、0.49秒)の両方で首位に立っている。最終トランスクリプトの精度も3.9%から2.7%へと向上したが、これは確かなものの小幅な改善だ。何を作れるかを変えるのは、部分トランスクリプトのこの跳躍である。

1.0と2.0の間で実際に何が変わったのか

この2つのバージョンは同じAPIにおける同じ製品であり、SpaceXAI はインターフェースに何も変更を加えていない。Grok Voice Transcribe 2.0 は、grok-voice-transcribe-2.0/v1/stt の代わりに grok-voice-transcribe-1.0 に渡すことで選択される。あるいは、ストリーミング用の WebSocket 接続を確立する際にこれを選ぶこともできる。モデルパラメータを省略している既存の統合は、SpaceXAI がデフォルトを切り替えるまで引き続き 1.0 を利用する。同社によれば、切り替えは今後数週間のうちに、旧バージョンの非推奨化と併せて行われる予定だ。それまでは 2.0 はオプトインであり、1.0 を意図的に固定しておくこともできる。この種の変更としてはこれが正しい形だ。本番環境のデフォルトになる前に、望むと望まざるとにかかわらず、自分の音声で A/B テストできるのだから。

Artificial Analysisの数値を並べて読むと、「2倍の精度」よりも、より具体的なことを物語っている:

• 最終文字起こし精度 — AA-WER Streaming において、Grok Voice Transcribe 2.0 は WER 2.7%、Grok Voice Transcribe 1.0 は WER 3.9%、いずれも発話終了後に測定

• 最初の部分トランスクリプト精度 — 3.4% WER 対 18.3%、2つのバージョン間で最大の単一差

• 最終トランスクリプトまでの時間 — 0.49秒 対 0.37秒。つまり、新しいモデルは、置き換えるモデルよりも確定が遅い

• 最初の部分結果までの時間 — 0.49秒 対 0.25秒、同様に遅い

• バッチ(非ストリーミング)精度 — Artificial Analysisの非ストリーミングボードにおいてAA-WER 2.3%、Whisper Large v3の4.07%、GPT Transcribeの3.31%に対して

• バッチスループット — 同じボード上でおよそ実時間の162倍。MAI-Transcribe-2の333倍には及ばないが、Gemini 3.5 Transcribeの88倍を上回る

その4行目と5行目は、このリリースにおける正直な但し書きだ。SpaceXAIはレイテンシと引き換えに精度を手に入れた。新しいモデルは、最初の部分結果と最終的な文字起こしを返すまで、1.0より約0.3秒遅い。Deepgram Fluxが0.02秒で部分結果を返し、Soniox v5が0.05秒で返すようなランキングでは、Grok Voice Transcribe 2.0は速度で競っているわけではまったくなく、正確さで競っており、そのトレードオフでは大差で勝っている。それが正しいトレードオフかどうかは、アプリケーションが、応答を話し始める必要があるライブ音声エージェントなのか、0.5秒が目に見えない文字起こしパイプラインなのかに、完全に依存する。

A two-column scoreboard titled 'Grok Voice Transcribe 2.0 vs Grok Voice Transcribe 1.0 — the numbers': the left column gives Grok Voice Transcribe 2.0 a 2.7% final transcript WER, 3.4% first partial WER, 0.49s to final transcript, $1.67 per 1,000 minutes batch, $3.33 per 1,000 minutes streaming and 162x real time throughput; the right column gives Grok Voice Transcribe 1.0 3.9%, 18.3%, 0.37s and the same two prices, with throughput not measured; the footer credits both columns to Artificial Analysis.

「2倍正確」という主張を検証する

SpaceXAIの見出しは、2.0が同じ価格で1.0の2倍正確だというもので、同社自身の評価表が、自ら選んだセットにおいてそれを裏付けている。8 kHzの英語カスタマーサポート通話では、単語誤り率が10.6%から7.1%に低下した。Grokとの会話では、8.7%から3.3%に。話し言葉による認証情報——アカウントコード、電話番号、メールアドレス——では、7.2%から3.2%に。19言語にわたる短いコマンドでは、20.6%から6.8%へと、誤りがおよそ3分の2減少した。これら4つのセットはSpaceXAIの本番トラフィックから抽出されたもので、比較はSpaceXAI自身によるものであり、社外で再現した者はいない。この表は、モデルがどこでチューニングされたかの地図として扱うべきであり、一般的な精度保証として扱うべきではない。

Artificial Analysis の結果は、ベンダーによる自己申告ではない部分だ。約8時間の音声に対して実行された独立系のハーネスによるもので、非公開の AA-AgentTalk セットに50%、VoxPopuli と Earnings22 にそれぞれ25%の重み付けをしている。これは「2倍正確」よりも狭く、より有用な主張を裏付ける。すなわち、その特定の混合において、このモデルが測定された中で最も正確なストリーミング文字起こしであるということだ。指摘すべき小さなひっかかりが一つある。SpaceXAI の投稿は「32のストリーミングモデルの中で」1位だと述べているが、リーダーボードのページ自体には33モデル中27モデルがプロットされている。順位は本物だ。マーケティングコピー内の母数は同社のカウントであり、リーダーボードのものではない。

AA-WER Streamingでの首位が何をカバーし、何をカバーしないのかについても、正確に理解しておく価値があります。このリーダーボードは英語重視で、エージェントの発話が多いものです。あなたのアクセント、コーデック、ドメイン語彙、8チャンネルのコールセンター音声を測定するものではありません。そこで首位に立つモデルでも、あなたの録音では大きく負けることがあり、まさにそのためにオプトイン期間が重要なのです。

Screenshot of the Artificial Analysis AA-WER Streaming leaderboard, showing Grok Voice Transcribe 2.0 first on both the Final Transcription ranking at 2.728% word error rate and 0.490s and the First Partial Transcription ranking at 3.359% and 0.489s, with Grok Voice Transcribe 1.0 further down at 18.275% on partials.

価格は据え置きで、それがここで2番目に大きな事実です

Grok Voice Transcribe 2.0 の料金は 1.0 と同じです。REST エンドポイント経由のバッチおよび録音ファイルは音声 1 時間あたり 0.10 ドル、WebSocket 経由のストリーミングは音声 1 時間あたり 0.20 ドルです。Artificial Analysis の価格ボードでは、ストリーミング SKU は 1,000 分あたり 3.33 ドル、バッチ SKU は 1.67 ドルで、これは Microsoft が MAI-Transcribe-2 に課しているバッチ料金と同じであり、ElevenLabs Scribe v2 Realtime のストリーミング 1 分あたりの料金のおよそ 3 分の 1 です。

話者分離、信頼スコア付きの単語レベルのタイムスタンプ、キータームのバイアス調整はすべてその料金に含まれており、別途従量課金されることはありません。これはこの市場では一般的ではありません。Gemini 3.5 Transcribe Live は音声入力とテキスト出力の両方でトークン単位の課金を行うため、コストは音声の長さだけでなく、モデルがどれだけ出力するかによって変動します。時間単位の定額料金は予測しやすく、ベンダー間での比較も容易です。また、OrcaRouter はプロバイダーの定価を 0% のマークアップでそのまま提供しているため、ベンダー側でのその料金の変更は、再価格設定サイクルを待つことなく、当社側にも当日に反映されます。

APIが実際に提供してくれるもの

機能リストは幅広いものの、そのほとんどは新規ではなく受け継がれたものであり、機能だけを見てアップグレードを評価しようとしているなら知っておく価値がある:

• 単一モデルでバッチ処理とストリーミング処理を両立 — 最大500 MBの録音済みファイルにはREST、WebSocketはwss://api.x.ai/v1/sttで、約500ミリ秒ごとに中間結果を出力

• 話者ダイアライゼーション対応、さらに最大8つの独立チャンネルのマルチチャンネル文字起こしにも対応

• 単語レベルのタイムスタンプに信頼度スコアが付いているので、文字起こし全体を同じように信頼するのではなく、信頼度の低い範囲をしきい値で除外できます

• リクエストごとに最大100個のドメイン用語を対象としたキータームのバイアス、各用語は最大50文字

• 数字、日付、通貨、電話番号、メールアドレスの逆テキスト正規化。25言語で書き言葉形式のフォーマットに対応

• 音声エージェントに的を絞った、フィラーワード除去とSmart Turnによるターン終了検出

・自動言語検出(1回のパスで録音中の言語切り替えに対応)、12種類の音声フォーマット、8 kHz~48 kHzのサンプルレートに対応

• REST とストリーミングの両方で 1 秒あたり 10 リクエスト、およびチームあたり 100 の同時ストリーミングセッションというサービス制限があり、ホスト先は us-east-1

機能リストには載っていない、本番運用上の注意点が1つあります。サービスは単一リージョンで稼働しています。音声が米国外を発信元とする場合、ネットワーク区間がレイテンシ予算の一部となり、AA-WER Streaming はネットワーク遅延をタイミングに明示的に織り込みます。SpaceXAI はゼロデータ保持の条件を提供し、SOC 2 Type II、BAAs、EU データレジデンシーのオプションを挙げているため、コンプライアンス面の説明は地理面のそれよりも充実しています。

Screenshot of the SpaceXAI docs.x.ai Speech-to-Text page listing the Grok Voice Transcribe 2.0 REST and WebSocket endpoints, the grok-voice-transcribe-2.0 model parameter, the 500 MB file limit, key-term biasing and the published rate limits.

誰が動くべきか、そして何に注目すべきか

すでに Grok Voice Transcribe 1.0 を使っていて、アプリケーションが部分トランスクリプトに基づいて動作している場合——ターン検出、バージイン、ライブエージェント応答など——18.3% から 3.4% への部分精度の差は十分に大きく、2.0 をテストしないという選択肢はありません。その数値が「たいてい間違っている」から「たいてい正しい」になることは、ルーティングに使える部分トランスクリプトと、表示しかできない部分トランスクリプトの違いです。アプリケーションが録音ファイルの最終トランスクリプトを待つ場合、改善は確かにありますがより小さいもので、追加される 0.12 秒のコミットレイテンシがその代償です。

まったく別のベンダーを使っているのであれば、このリリースに目を向けるべき理由はリーダーボードの順位ではない。フロンティアラボが価格を上げることなく文字起こしモデルを大幅に改善したということであり、それは精度が課金対象ではなくなったときの市場の姿だ。アップグレードの道筋も最も安価な部類で、パラメータは1つ、コード変更なし、新しい契約もなし、そして不具合が起きたときのためにピン留めも用意されている。

次に注目すべきは、デフォルトの切り替えです。SpaceXAIが2.0をデフォルトにし、1.0を非推奨にし始めると、モデルパラメータを一度も渡したことのないすべての統合が、レイテンシの変化も含めて、一斉に新しいモデルへ移行します。古い0.25秒の部分タイミングに依存しているチームは、本番環境で変化に気づくのではなく、今すぐピン留めすべきです。2つ目に注目すべきは、独立した再現です。Artificial Analysisのエントリは実際の測定ですが、それは1つの音声ミックスに対する1つのボードにすぎず、第三者による、本番音声での1.0対2.0の同一条件での実行はまだ公開されていません。