
Grok Voice Transcribe 2.0 vs GPT Transcribe:ストリーミング料金は同じ、精度は異なる
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100万トークンあたり
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- openaiOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- googleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- anthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1244知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0540知能72コーディング
- qwenQwen: Qwen3.8 Max2026-08-0345知能76コーディング
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135知能69コーディング
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100万トークンあたり
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
この偶然はほとんど出来すぎている。Artificial AnalysisのAA-WER Streamingボードでは、Grok Voice Transcribe 2.0とGPT Live Transcribe — ストリーミング文字起こしエンドポイント — の両方が、音声1,000分あたりちょうど$3.33と表示されている。2026年9月18日にリリースされたSpaceXAIのGrok Voice Transcribe 2.0は、単語誤り率2.7%、発話終了から0.49秒後に最終文字起こしを返し、最初の部分結果は3.4%で返す。2026年7月28日にGPT Transcribeと同時に提供開始されたGPT Live Transcribeは、最終文字起こしを3.9%、最初の部分結果を6.3%で返す。同じ価格で、最終文字起こしの精度で約1.2ポイント、部分文字起こしの精度で2.9ポイント、SpaceXAIが有利だ。同じ対決のバッチ側は、まったく偶然ではない。GPT Transcribeは1,000分あたり$4.50で、Grok Voice Transcribe 2.0の$1.67に対して、録音ファイル経路では63%の差がある。
文字起こしの改善をめぐる2つの異なる賭け
OpenAIの精度に対する答えはコンテキストです。GPT TranscribeとGPT Live Transcribeはどちらも自由形式のプロンプト、キーワードリスト、想定言語リストを受け付け、Realtimeセッションでは、以前に文字起こしされたターンが後続のターンのコンテキストとしてフィードバックされます。OpenAI自身のContext Aware ASRベンチマークでは、その条件付けによってGPT Live Transcribeの意味精度が38.5%から44.6%に向上しました — これはベンダーが報告した数値であり、単語が正しかったかどうかではなく、意味が保たれたかどうかを測定するものです。OpenAIが提示しているトレードオフは明示的です。モデルに、これから聞く内容に関する情報を与えれば、同じ生の精度を持つ汎用モデルよりも、あなたのドメインをよりよく文字起こしします。
SpaceXAIの答えは、モデルそのものだ。Grok Voice Transcribe 2.0には確かにバイアス機構がある——1リクエストにつき最大100個のキーターム、それぞれ最大50文字——だが、それは語彙リストであってプロンプトではない。「OrcaRouter」や「Kubernetes」が実在する語だと教えることはできるが、これが返金に関するサポート通話であると説明する段落を渡すことはできない。2.0での精度向上はむしろ再トレーニングによるもので、SpaceXAI自身の本番由来の評価セットでは、単語誤り率が会話音声で8.7%から3.3%へ、8 kHzテレフォニーで10.6%から7.1%へ、読み上げられた認証情報で7.2%から3.2%へ、19言語にわたる短いコマンドで20.6%から6.8%へ下がった。これらは同社の音声に関する同社の数値であり、外部の誰によっても再現されておらず、何を期待すべきか教えられるのがうまくなったモデルではなく、音響的な問題を解くのがうまくなったモデルを表している。
実用的な違いは、作業の2時間目に現れる。コンテキスト条件付けされたモデルは、その生のベンチマークが示唆するよりも劇的に優れていることがある。なぜなら、あなたが語彙とドメインを提供したからだ。また、提供したキーワードを幻覚することもある。プロンプトに「OrcaRouter」を入れると、その単語をはっきりと聞き取れないモデルでも、とにかくそれを生成してしまうかもしれない。キータームバイアスをかけたモデルはより穏やかに劣化する。なぜなら、バイアスはその用語が存在すると主張するのではなく、用語の確率をずらすからだ。どちらの失敗モードもリーダーボードには現れないが、どちらもあなたのログには現れる。
数字を横に並べて
• 最終的な文字起こし精度(ストリーミング)— AA-WER Streaming において、Grok Voice Transcribe 2.0 は WER 2.7%、GPT Live Transcribe は WER 3.9%。いずれも Artificial Analysis による
• 最初の部分的正確度(ストリーミング)— 3.4% 対 6.3%、比較の中で最大の差であり、音声エージェントの挙動を左右するもの
• 最終トランスクリプトまでの時間 — 発話終了後 0.49 秒 対 0.81 秒。つまり、より正確なモデルのほうが確定するのも速い
• 初回部分応答までの時間 — 0.49秒 対 0.26秒、OpenAI が完全に勝利している唯一のレイテンシー列
• ストリーミング価格 — 両方とも1,000分あたり$3.33(Artificial AnalysisがGrokの$0.20/時間とOpenAIの$0.017/分から正規化)
• バッチ精度(非ストリーミング) — Grok Voice Transcribe 2.0 の AA-WER 2.3% 対 GPT Transcribe の 3.31%
• バッチ価格 — 1,000分あたり$1.67 対 1,000分あたり$4.50、$0.10/時間から $0.0045/分に対して
• バッチスループット — 実時間比で約162倍(同じボードでの約41倍に対して)
そのリストは、一つの判定としてではなく、二つの列として読んでください。OpenAI は初回部分結果のレイテンシで明確な差をつけて勝っており、Grok にはないコンテキスト機構を提供しています。SpaceXAI は両モードでの最終精度、ストリーミングでの部分精度、スループット、そしてバッチ価格で大差をつけて勝っています。GPT Live Transcribe が Grok Voice Transcribe 2.0 よりも高速かつ高精度である列は存在しません。高速である列は一つだけあり、それは最も早い段階の列です。

実際にどのバッチパスにいるのか
$1.67対$4.50の差は、ここで最も曖昧さの少ない数字であり、それがなぜ存在するのかを正確に述べる価値がある。OpenAIは、GPT-4o Transcribe時代からGPT Transcribeを投入した際に、この製品ラインを25%値下げし、その結果が1分あたり$0.0045だった。SpaceXAIは、バージョン1.0から2.0に移行した際、バッチ料金を1時間あたり$0.10のまま据え置いた——モデルを改善しながら同じ料金を請求するのは、より難しいことであると同時に、市場がどこへ向かっているかを示すより良いシグナルだ。MicrosoftのMAI-Transcribe-2は、期間限定オファーとして同一の1時間あたり$0.10で登場した。そのため、1,000分あたり$1.67という水準は、特定ベンダーの販促価格ではなく、バッチ文字起こしにおけるフロンティアラボの下限となった。
月1万時間の音声では、その差はおよそ2,830ドル対450ドルです。ポッドキャストのアーカイブ、通話録音の未処理分、あるいは遡って文字起こしされるメディアライブラリにとっては、WER 2.3%と3.31%の精度差など問題にならないほど、価格差のほうがはるかに大きくなります。ストリーミングエージェントでは、両製品のコストが同じであるため、議論の余地として残るのは精度とレイテンシだけです。
それらの料金の背後には、指摘しておく価値のある構造的な違いがあります。Grok Voice Transcribe 2.0 は音声1時間あたりの定額で請求し、GPT Live Transcribe は分単位で請求しますが、Gemini 3.5 Transcribe Live は音声入力とテキスト出力の両方でトークン単位に請求します。この3つのうち、請求額がモデルの発話内容によって変わるのは1つだけです。予測が重要になるほど利用量が多いなら、定額料金のほうが、請求書に署名する人に対して説明しやすいです。また、OrcaRouter はプロバイダーの定価を0%のマークアップでそのまま通しているため、OpenAI の25%のようなベンダー側の値下げは、次回の更新時ではなく、発表されたその日に当社側でも反映されます。

どちらのモデルでもないもの
GPT Transcribe と GPT Live Transcribe は2つの製品であり、切り替えのある1つの製品ではない。バッチモデルは、完了したファイル、ストリーミングされたファイルの文字起こし、Realtimeセッションで確定したターンを処理し、OpenAI自身の公表値ではリアルタイムの約34倍の速さで音声を処理する — Artificial Analysisはそのハーネス上で41倍と測定している。ストリーミングモデルのほうが高価で、1分あたり0.017ドルであり、部分結果におけるエラー率が10倍大きいほうでもある。OpenAIを選ぶことは、その2つの問題のどちらを抱えるかを選ぶことを意味する。なぜなら、安いほうのエンドポイントはもう一方の仕事をできないからだ。
Grok Voice Transcribe 2.0は1つのモデルで2つの転送方式を提供します。同じ重みが/v1/sttではREST経由で最大500 MBのファイルに対応し、wss://api.x.ai/v1/sttではWebSocket経由でライブ音声に対応し、中間結果は約500ミリ秒ごとに出力されます。ストリーミングのレートはバッチのレートのちょうど2倍で、別々に設計された製品ではありません。つまり、アーカイブ済みの音声で測定した精度が、ライブでもそのまま期待できる精度だということです。また、評価すべき第2のモデルは存在しないということでもあります — プロンプトも1セット、キータームも1セット、期待値も1セットだけです。
機能の同等性は近いですが、完全に同一ではありません。どちらも単語レベルのタイムスタンプを返しますが、Grok Voice Transcribe 2.0 は各単語に信頼度スコアを付与するため、文字起こし全体を等しく信頼するのではなく、低信頼度の区間をしきい値で処理できます。どちらも話者ダイアリゼーションを行い、Grok のものは追加コストなしで含まれています。どちらも数値、日付、通貨、連絡先詳細の逆テキスト正規化を処理します。Grok Voice Transcribe 2.0 は最大8つの独立チャネルにわたるマルチチャネル文字起こし、フィラーワード除去、Smart Turn による発話終了検出を追加しています。GPT Transcribe の特徴的な追加は、プロンプトレベルのコンテキスト条件付けと、Realtime 側での以前のターンの自動引き継ぎです。OpenAI はどちらのモデルについてもサポート言語数を公表していません。Grok Voice Transcribe 2.0 は数十の言語を文書化しており、録音中の切り替えと25言語にわたる書き言葉形式のフォーマットに対応しています。

どう判断するか、そしてどうテストするか
発信者が話し終える前に応答しなければならない音声エージェントを構築しているなら、途中経過の文字起こしの列があなたの意思決定変数であり、それが2つのモデルをきれいに分かつ。Grok Voice Transcribe 2.0 は途中経過の精度で2.9ポイント上回るが、それを生成するのに0.23秒遅い。誤った途中経過が遅れたものより悪い場合——ルーティング、エスカレーション、コンプライアンスに起因する応答——にはSpaceXAIを選べ。遅れた途中経過が誤ったものより悪い場合、そして精度の差が縮まるようにコンテキスト機構に供給できるドメイン語彙を持っている場合にはOpenAIを選べ。そのうえで両方を測定せよ。8時間分の英語エージェント会話における途中経過の文字起こしの挙動は、どちらのベンダーについても、あなたのアクセント、あなたのコーデック、あなたの専門用語に対してどちらがどう振る舞うかを予測しないのだから。
ファイルを文字起こしするのであれば、判断はずっと簡単です。1,000分あたり$1.67対$4.50、WERは2.3%対3.31%で、どちらも同じ方向を指しています。バッチ処理でGPT Transcribeを使い続ける唯一の理由は、コンテキスト条件付けの仕組みが、生の精度差では埋め合わせられない何かをあなたの音声に対して行っている場合です。これは高度にドメイン固有の録音では十分あり得る話であり、検証も可能です。
現時点で、どちらの文字起こしモデルもOrcaRouterのカタログにはないため、呼び出し自体はベンダー独自のAPIに送られます。一つのOrcaRouterキーの背後にあるのは、文字起こしが供給するすべてです。エージェントモデル、要約器、分類器、そのテキストをどう扱うかを決めるコード。ここで通常、二つ目の契約が現れます——音声用に一つのベンダー、それを推論するモデル用に別のベンダー——しかし、そうする必要はありません。200以上のモデルにまたがる一つのキー、プロバイダーが劣化した場合の自動フェイルオーバー、そしてコミットする前に複数のモデルを通してリクエストを送り比較したい場合のルーティングDSL。これは「文字起こしをルーティングします」という主張よりも小さな主張ですが、真実の主張です。
注目すべきは、OpenAIがコンテキストではなく精度で対抗してくるかどうかだ。同社はこの1年で文字起こしの世代を2つ投入し、価格を一度引き下げた。コンテキストの仕組みは確かに差別化要因になっているが、生の文字起こしを測るリーダーボードでは、現在SpaceXAIとMicrosoftの両方に後れを取っている。もしGPT Transcribe 2が、コンテキストの仕組みをそのままに、エラー率を2%台まで下げて登場すれば、この比較はバッチ側で一夜にして逆転する——そして、すでに同一であるストリーミング価格が、それを注目に値する競争にする。
この記事で比較したモデル2
この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新
