「Daily AI Brief — 9月19日」と表示される記事ヒーローカード。バッジは「NEWS」、サブタイトルは「Grok Voice Transcribe 2.0が提供開始、MetaがMuseを公開」。チップには「バッチ1時間あたり$0.10」「ストリーミングWER 2.7%」「初回部分結果3.4%」「Museコネクタ稼働中」と表示され、白から青へのグラデーション上、右下にOrcaRouterのロゴ。
Engineering & Research

日刊AIブリーフ、9月19日:Grok Voice Transcribe 2.0が提供開始、MetaがMuseを開発者向けに公開

著者

Alistair Wren

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

Grok Voice Transcribe 2.0は、2026年9月18日よりGrok Voice APIで提供開始され、録音文字起こしは音声1時間あたり0.10ドル、ストリーミングは1時間あたり0.20ドル——SpaceXAIがバージョン1.0に対して請求していたのと同じ料金だ。同じ週、MetaはMuseコネクタプラットフォームを外部開発者に開放し、あらゆるサービスが自社の既存APIを公開して、MetaのMuseエージェントにユーザーに代わってそれを呼び出させられるようにした。これらは、2つの異なる企業による2つの異なる製品に関する無関係な見出しに見えるし、過去2年間の大半では実際そうだっただろう。しかし並べて読むと、それらは同じ物語だ。文字起こしは入力へと変わりつつあり、争いは、それを消費する呼び出しを誰が所有するかに移ったのだ。

まず価格から。読者が今日すぐ行動に移せるのはそこだからだ。次に精度。確かに重要だが、ローンチ時の枠組みが示唆するより範囲は狭い。最後にMetaの部分。これが6か月後に重要になるものだ。

定額料金、そしてすでに文字起こしにお金を払っている場合にそれが何を意味するか

Grok Voice Transcribe 2.0 の価格は 1.0 と同じです。「同じ価格から始まります」ではなく、期限切れになるプロモーション料金でもなく、完全に同一で、バッチ処理では音声 1 時間あたり $0.10、ストリーミングでは 1 時間あたり $0.20 です。これは 1,000 分あたり $1.67 と $3.33 に相当します。話者ダイアリゼーション、信頼度スコア付きの単語レベルタイムスタンプ、逆テキスト正規化、フィラーワード除去、キータームバイアスはすべてその価格に含まれており、このカテゴリでは一般的ではない形でアドオンとして別売りされていません。

実用的な効果は劇的というより算数的だ。月に5,000時間のコンタクトセンター音声を文字起こしするチームは、どちらの場合でもバッチ経路に500ドルを支払い、新しいモデルは同じ処理量を大幅に低いエラー率で返す。移行によって支払額が変わることは何もない。まさにそれが、この移行を正当化しやすい理由だ。下すべきコスト判断はなく、あるのは品質判断だけであり、そして品質は上がった。

既存の統合は、/v1/stt で model パラメータとして grok-voice-transcribe-2.0 を渡すか、ストリーミング用に WebSocket セッションを開くときにそれを選択することで移行できます。スキーマ変更も、新しいエンドポイントも、音声パイプラインの再エンコードも不要です。SpaceXAI は今のところ 1.0 をデフォルトのままにしているため、model パラメータに一切触れない統合は、同社が切り替えるまで旧バージョンを取得し続けます。同社によれば、それは今後数週間のうちに、1.0 の非推奨化とともに行われる予定です。この期間は意図的に活用する価値があります。本番音声のシャドウコピーを 2.0 に向けて、文字起こしを現在出荷しているものと差分比較してください。デフォルトが切り替われば、テストしたかどうかにかかわらず 2.0 を実行することになるからです。

スペックシートの残りの部分は構成としては変わっておらず、単に精度を評価するだけでなくデプロイの規模を見積もるのであれば知っておく価値があります。8 kHzの電話音声から48 kHzまでの12種類の入力音声フォーマット、1回のリクエストで最大8つの独立した音声チャンネル、ドメイン語彙用に1リクエストあたり100個のキー用語、録音中に切り替えられる自動言語検出、そして25言語にわたる逆テキスト正規化により、話された日付、通貨、電話番号、メールアドレスが人間が書くように表記されて返ってきます。サービスの上限は、1秒あたり10リクエストと、チームあたり100の同時ストリーミングセッションで、サービスは単一リージョン — us-east-1 — で動作します。これは、本番運用チームが立ち止まって考えるべきスペックシート上の一行です。なぜなら、単一リージョンの音声APIは単一リージョンの障害だからです。

精度が実際にどこで動いたか

発表時の主張は「正確さは2倍」だが、その根拠となる数値はそのフレーズよりも具体的で、より不均一だ。ここでの独立した測定であるArtificial AnalysisのAA-WER Streaming boardでは、2つのバージョンは次のように分かれる:

• 最終的な文字起こし精度 — Grok Voice Transcribe 2.0 の単語誤り率は 2.7%、Grok Voice Transcribe 1.0 は 3.9% で、いずれも話者が話し終えた後に測定

• 最初の部分文字起こしの精度 — 18.3% に対して 3.4% の WER。これは2つのバージョン間の単一の差としては、大差で最大である

• 最終トランスクリプトまでの時間 — 0.49秒 対 0.37秒。したがって、この指標では2.0は速くなるどころか遅くなっています。

• 最初の部分約定までの時間 — 0.49秒 対 0.25秒、逆方向の同じトレード

その最後のペアが、このシートで最も興味深いものだ。Grok Voice Transcribe 2.0 は、双方向でおよそ0.25秒のレイテンシと引き換えに精度を手に入れた。音声エージェントにとってそれは実際のコストだ——自然な間と、発信者が気づく間の違いであり——バッチパイプラインにとっては見えない。最初の部分結果の改善こそが、何を作れるかを変える。なぜなら部分文字起こしは、発信者がまだ話している間にエージェントが推論できるテキストだからだ。その数値が18.3%から3.4%になることは、部分結果が粗い手がかりであることと、部分結果が使えるものであることの違いだ。最終文字起こしが3.9%から2.7%になるのは、どのユーザーも気づかないだろう良い改善だ。

Screenshot of the SpaceXAI Speech to Text API documentation page showing the 'Speech to Text' heading, the line 'Transcribe audio files into text with a single API call, or stream audio in real time over WebSocket', and a Python quick-start code block that posts an audio file to https://api.x.ai/v1/stt with the model parameter set to grok-voice-transcribe-2.0 alongside a keyterm parameter.

SpaceXAIはまた4件の内部評価も公開しており、これらはラベル付きで読む価値がある——これは同社自身の音声に関する同社自身の数値であり、独立に再現されたものではない:

• 8 kHzのカスタマーサポート通話 — WERは1.0で10.6%から2.0で7.1%に低下

• Grokとの会話 — 8.7%から3.3%に減少

• 読み上げられた認証情報、つまり名前、メールアドレス、アカウント情報を音読したもの — 7.2%から3.2%に減少

• 19言語にわたる短いフレーズ — 20.6%から6.8%に低下

8 kHz の行こそ注目すべきです。電話音声はこのカテゴリーで最も難しい一般的な入力であり、コンタクトセンターの購買担当者の大半が実際に扱っている入力でもあり、それが 10.6% から 7.1% へ低下したことは、そうした購買担当者にとって、ヘッドラインのボード数値よりも大きな意味を持ちます。

リーダーボードの主張を率直に読むと

SpaceXAIは、このモデルが精度で32のストリーミングモデル中1位だと述べている。Artificial Analysisのボードでは、最終トランスクリプトと初回部分結果の両方のランキングで確かに1位に置かれている。しかし、そのボードページには33モデル中27モデルしかプロットされていない。したがって「32」は同社自身の数え方であり、このランキングは読者がその母集団の形を理解しておくべき集合を対象としている。AA-WER Streamingは、3つの英語データセットによる加重合成だ。AA-AgentTalkが50%、VoxPopuliが25%、Earnings22が25%で、合計およそ8時間の音声であり、エージェント形式の会話音声に大きく重み付けされている。アクセント、電話コーデック、ドメイン語彙、多チャンネルのコールセンター音声を、何らかの構造化された方法で測定しているわけではない。

そんなことはどれも、その数値を間違いにはしない。それは数値を特定のものにするだけだ。エージェントトークで重み付けされた英語リーダーボードを首位に立つモデルは、エージェントトークの形をした英語音声にとって正しい選択であり、8 kHz の結果を信じるなら、その誠実な理由は、それが公開リーダーボードではなくベンダーの内部評価であることだ。異なる音声プロファイルを持つ購入者は、ランキングを一般的な判定として読むのではなく、自分たちの音声でテストすべきだ。これは今回のリリース前も真実であり、次のリリース後も真実であり続ける。

A generated infographic titled 'Grok Voice Transcribe 2.0 — what changed from 1.0', showing two columns of four rows: final transcript 3.9% to 2.7% WER, first partial 18.3% to 3.4% WER, time to first partial 0.25s to 0.49s, and streaming price $0.20 per hour unchanged, with a footer reading 'Board figures per Artificial Analysis AA-WER Streaming; internal evaluations vendor-reported.'

Meta、Museコネクタを開発者に開放

今週2番目の話題はMetaのものだ。Metaが9月8日にiOS、Android、muse.ai、WhatsAppで提供開始したパーソナルエージェントMuseは、現在サードパーティのコネクタを受け入れる。サービスがAPIを公開し、Museがエージェント、ブラウザ、ユーザーコンテキストを提供することで、そのAPIを人が頼めば呼び出せるものに変える。Metaがそれに与えた枠組みは分業だ — あなたがAPIを持ち込み、我々が意図とユーザーを持ち込む。最初に名前が挙がったコネクタはNotionと議事録ツールGranolaで、Meta自身が提供したものに加えてだった。

これが何であり、何でないかについて正確であることは価値がある。これはオープンなクロスエージェントプロトコルではない。コネクタを構築すると、Muse自身のユーザーベース内での配布が得られ、他のどこでも得られない。オープンプロトコルに対して構築すると、互換性のあるすべてのエージェントにリーチが得られ、特定のユーザーベースは得られない。Metaはまた、開発者が計画を立てるために必要となる部分を公開していない — コネクタレビュープロセス、技術的統合面、Museが重複する2つのコネクタのどちらを選ぶか、または開発者がコネクタが実際に利用を促進したかどうかをどう測定するか。

疑いようがないのは、その方向性だ。Museは各ユーザーのエージェントを、専用ブラウザを備えた個別の仮想マシン内で実行し、外向きアクションの手前に独立したレビュー層を置き、実際のAPIキーではなく代理トークンを保持する。そのアーキテクチャは、エージェントに大量のものを呼び出させる計画でなければ意味をなさない。文字起こしAPIはエージェントが呼び出す対象の一つであり、Metaには自前のものがある——Muse Voice Transcribe、Metaが9月上旬に音声1時間あたり0.18ドルで投入したリアルタイムモデルだ。エージェントと音声モデルの両方を抱えるプラットフォームには、自社トラフィックを自社モデルにルーティングする明白な理由があり、コネクタ上で開発する開発者は、何かがそれをデフォルトでなくしない限り、それがデフォルトだと想定すべきだ。

Screenshot of the Artificial Analysis Speech to Text AI Model and Provider Leaderboard with the Streaming filter selected, showing the WER Index - Final Transcription, Latency and Price highlight cards, the 'See Non-streaming Benchmarks' toggle, and the AA-WER Streaming Index versus Time to Final Transcription chart.

今月ボイスを出荷するチームが実際にすべきこと

どちらの話も同じ方向を指している。音声認識精度は収束しつつあり、同一のリーダーボード上で3つのモデルが3週間のうちに互いに1.5ポイント以内にひしめいている。そして残る差別化要因は、価格、レイテンシ、ライセンス、そしてルーティングを誰が制御するかだ。そのため、文字起こしの呼び出しをどこへ送るかという選択は、どのモデルが応答するかという選択よりも重大になる。なぜなら、今後1年の間にその答えを何度も変えたくなるからだ。

これはOrcaRouterが位置するレイヤーです。1つのAPIキーで、OpenAI互換エンドポイントの背後にある200以上のモデルをカバーし、プロバイダー間の自動フェイルオーバーを備えているため、単一リージョンの音声サービスがたまたま不調になっても、それがあなたの障害になることはありません。当社はプロバイダーの定価を0%のマークアップでそのまま通しており、つまりベンダーの値下げや新しいモデルバージョンは、再価格設定を待つことなく当社側で当日に反映されます。そして、すべてのモデルが1つの契約の背後にあるため、文字起こしワークロードをあるモデルから別のモデルへ移すのは、2度目の調達ではなく、モデル文字列の変更で済みます。

今週の具体的なアクションは3つ。Grok Voice Transcribe 1.0を使っているなら、今すぐ自分の音声で2.0をシャドーテストすること。1.0がまだデフォルトで、切り替えを自分で制御できるうちに。エージェント向けのストリーミング音声を評価しているなら、誰かのベンチマークを信用するのではなく、自分のレイテンシ予算でtime-to-first-partialを測定すること — このモデルが精度を得るために費やした4分の1秒は、エージェントがそのテキストで何をするかによって、無意味にも致命的にもなる。そして、個人エージェントがいずれ呼び出すかもしれないものを作っているなら、Museコネクタプログラムを注意深く見ておくこと。なぜなら、それが示す流通の主張は、それが一緒に出荷された技術的詳細よりも強いからだ。