
Grok Voice Think Fast 2.0:xAIの最速かつ最高額の音声エージェントを解説
- qwenNEWQwen: Qwen3.8 Max2026-08-03$2.00 / $6.00 100万トークンあたり · 56 tok/s
- deepseekNEWDeepSeek: DeepSeek V4 Flash 07312026-07-3150知能69コーディング
- qwenNEWQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100万トークンあたり · 201 tok/s
- orcaNEWOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicNEWAnthropic: Claude Opus 52026-07-2461知能78コーディング
- googleGoogle: Gemini 3.6 Flash2026-07-2150知能69コーディング
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137知能49コーディング
- metaMeta: Muse Spark 1.12026-07-1651知能71コーディング
- kimiMoonshotAI: Kimi K32026-07-1557知能76コーディング
- openaiOpenAI: GPT-5.6 Luna2026-07-0951知能71コーディング
- openaiOpenAI: GPT-5.6 Terra2026-07-0955知能77コーディング
- openaiOpenAI: GPT-5.6 Sol2026-07-0959知能77コーディング
- grokxAI: Grok 4.52026-07-0854知能72コーディング
- tencentTencent: Hy32026-07-0641知能59コーディング
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232知能42コーディング
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226知能39コーディング
- anthropicAnthropic: Claude Sonnet 52026-06-3053知能72コーディング
- klingKling: Kling 3.0 Turbo2026-06-1757知能52コーディング57数学
- z-aiZ.ai: GLM 5.22026-06-1651知能69コーディング60数学
- kimiMoonshotAI: Kimi K2.7 Code2026-06-1242知能61コーディング61数学
xAIがリリースしたGrok Voice Think Fast 2.0は、2026年7月29日に発表された製品であり、xAI自身が「最も高性能な音声対音声モデル」と称する、音声エージェント製品ラインの新しいフラッグシップです。トップ5のどの競合よりも速く応答し(最初の音声出力まで0.70秒)、エージェント型音声ベンチマークで首位に立ち、前世代よりも正確に文字起こしします。また、置き換えるモデルより1分あたり60%高価で、分単位のメーター制により気づかないうちに請求額が上がり、1週間後に自動的に切り替わるバージョンエイリアススイッチも付属します。このガイドでは、Think Fast 2.0が実際に何なのか、xAIが内部で何を変えたのか、ベンチマークの評価が独立したスコアとベンダー申告の主張にどう分かれるのか、計算したうえでの実際のコスト、そして呼び出し方を説明します。さらに、本番の通話フローを経由させる前に読んでおくべき注意点も紹介します。
正確性に関する注記:発表の詳細、価格、見出しの正確性、およびビジネス上の主張は、xAIの発表とドキュメント(2026-07-29)に基づいています。Artificial Analysisの複合スコアは、独立した第三者機関による測定値です。xAIが報告した主張(Starlink A/Bテストの結果、文字起こしの倍率、「推論トークンが60%減少」、「ほぼ5倍高速」という表現)には、裏付けとなるデータが公開されていません。これらはベンダーによる方向性を示す数値として扱い、ご自身で評価を行ってください。仕様、価格、およびエイリアスの動作は変更される可能性があります。構築する前に確認してください。
TL;DR。Grok Voice Think Fast 2.0 は、xAI の音声エージェント向けエンドツーエンド音声対音声モデルです。WebSocket 経由で音声を入力し、音声を出力するため、ASR→LLM→TTS という個別のパイプラインは不要です。実際に高速で(初回音声出力までの時間は 0.70 秒、上位5モデルの中で1秒を切るのは唯一)、エージェンティックな音声タスクにも非常に強い性能を発揮します。Artificial Analysis の τ-Voice エージェントベンチマークでは首位(56.5%)、音声対音声品質指数では総合2位(82.9%)で、1位は Qwen Audio 3.0 Realtime Plus(84.1%)です。話しながら推論するため、推論トークンの中央値使用量は旧モデルの約40%に削減されます。コストは毎分0.08ドルで、従来の0.05ドルから上昇しました。落とし穴は課金方式です。音声は実時間(ウォールクロック)のオーディオ1分ごとに課金されるため、提供コストがより低いモデルでの60%の値上げが、そのまま請求書に跳ね返ってきます。さらに8月5日以降、grok-voice-latest エイリアスは自動的に 2.0 へのルーティングを開始するため、旧バージョンを使っているチームはそれまでに意図的にバージョンを固定(ピン留め)しておく必要があります。
重要なポイント
• ネイティブな音声対音声:マイクからスピーカーまで単一モデル、ASR→LLM→TTSのチェーンは不要。— だから最初の音声は0.70秒で届くのです。
• エージェント型リーダー: Artificial Analysis の τ-Voice エージェントベンチマークで #1 (56.5%)、GPT-Realtime-2.1 (45.7%) や Gemini 3.1 Flash (37.7%) を大きく引き離しています。
• 総合リーダーではない:音声対音声品質指数では第2位(82.9%)、Qwen Audio 3.0 Realtime Plus(84.1%)に次ぐ。会話ダイナミクスではOpenAIが依然として勝っている(95.7% vs 95.1%)。
60%割高:$0.08/分(1時間あたり約$4.80)に対して、Think Fast 1.0 は$0.05/分 — モデルが報告上約60%少ない推論トークンを使用しているにもかかわらず
• 8月5日のエイリアス切り替え: grok-voice-latest は自動的に2.0へルーティングされます。それまでに grok-voice-think-fast-1.0 を固定しておけば、より安いバージョンのまま使い続けられます。
• すべての主張にラベルを付けること:Artificial Analysisのスコアは独立した評価であり、Starlink A/B、文字起こし倍率、速度のフレーミングはxAIの報告による未公開のものである。
Grok Voice Think Fast 2.0とは何か
Grok Voiceは、xAIのリアルタイム・音声間(speech-to-speech)モデルのファミリーです。「Think Fast」は高速応答を実現するラインで、2026年4月にVoice Agent Builderとともに最初にリリースされました。Think Fast 2.0はそのラインの第2世代にあたり、2026年7月29日に公開されました。このモデルはエンドツーエンドであり、音声認識モデルがテキストLLMに渡し、さらにテキスト音声合成モデルへとつなぐパイプライン構成ではなく、生の音声を取り込んで推論し、音声を直接出力します。このアーキテクチャ上の選択がレイテンシー優位性の根源であり、直列的なホップも中間テキストも存在しないため、モデルは聞きながら応答を開始できます。
xAIは、これを明示的に音声AIエージェント向けに位置付けている。カスタマーサポートの電話回線、電話販売、受付、テレフォニー、そしてシステムが人とリアルタイムで話し、実際に物事を成し遂げる必要があるアプリケーション——通話の予約、リードの審査、レコードの更新、ウェブ検索——単なるチャットではなく、そういった用途向けだ。この発表が狙っているのは、単なる文字起こしや音声合成ではなく、エージェントとしての機能重視という戦場である。
Think Fast 1.0 と比べて新しくなった点
1.0からのアップグレードは、単なる数字の更新以上のものです。xAIは3つの構造的変更を挙げています:
並列音声推論。モデルは、最初に考えてから話すのではなく、話しながらクエリについて推論します。実際には、エージェントが最初の文を言い終える前にツール呼び出しが実行される可能性があり、これはレイテンシーに敏感な音声フローにとって大きな利点です。
推論トークンが大幅に減少。xAIによると、推論トークンの使用量の中央値は前世代の約0.4倍(約60%減)にまで低下した。これは、価格が上昇したにもかかわらず、モデルのサービス提供コストがより安いと同社が述べる理由の一部である。
• 強化学習された会話スタイル。{{1}}RLはその話し方を変えた。短文で、一度に一つの質問、無駄な言葉なし{{/1}}{{2}}——より簡潔で、より「人間的」な通話スタイル{{/2}}{{3}}であり、長話が数分(そして分単位のメーターでは金額)を消費する電話業務に適している。{{/3}}
測定可能な速度に関しては、初回音声までの時間が1.0では1.25秒から、2.0では0.70秒に短縮されました。文字起こしについては、xAIは24言語にわたって約1.4倍の改善を報告しています(ベンダー報告値、以下参照)。

ベンチマークを、ベンチマークごとに
ローンチは独立系サードパーティーのベンチマーク機関であるArtificial Analysisを基盤としている。それが重要なのだ。発表内の他の数値の大半とは異なり、これらは中立的な主体によって測定されたものであり、同等に比較する価値があるのはこれらの数値なのだ。複合的な全体像は、単一の見出し数字よりも優れている。
音声から音声への品質指数: 82.9%(2位)。これは音声から音声の総合複合スコアで、Think Fast 1.0の75.7%から上昇しています。GPT-Realtime-2.1(79.1%)やGemini 3.1 Flash(69.5%)を上回りますが、1位ではありません。Qwen Audio 3.0 Realtime Plusが84.1%でトップです。したがって「最高の総合音声モデル」というのはデータが裏付けない誇張であり、「トップ層で最速のエージェント型音声モデル」というのが正確です。
τ-Voiceエージェントベンチマーク: 56.5%(首位)。これはxAIが最も重視する指標であり、ランキングは本物です。56.5%はThink Fast 1.0(52.1%)、GPT-Realtime-2.1(45.7%)、Gemini 3.1 Flash(37.7%)を上回っています。τ-Voiceはエージェント型音声性能、すなわちモデルが音声チャネルを通じてタスクをどれだけうまく完了できるか(会話中のツール使用も含む)を測定します。「仕事をこなせるか」という狭い軸では、Grokがリードしています。マスクはまさにこのランキングを宣伝しました。
Big Bench Audio: 97.2%. 音声推論のベンチマーク;強力だが、Qwenは記録的な99.2%を記録した。
Full Duplex Bench:95.1%。会話のダイナミクス — 割り込み処理、ターンテイキング、バージイン。これは1.0の77.8%からの大きな飛躍ですが、OpenAIは依然として95.7%でわずかに上回り、Qwenは98.4%でリードしています。
最初の音声までの時間: 0.70秒。 これは実際の音声製品にとって最も重要な数値です。1.25秒から改善され、上位5モデルの中で唯一の1秒未満の数値です。独立したテストでも広く1秒未満の応答が裏付けられています。ストリーミングTTSのファーストトークン遅延は約285msです。電話やリアルタイム利用では、遅延はユーザーが毎ターン感じる指標であり、この点で2.0は決定的に優れています。
行を横に読むと、その特徴は明確だ。発話は最速、タスク完了は最良、総合では2番目、会話の巧みさでは3番目。それは優れた音声エージェントモデルであり、「最高のチャットボット音声」という主張としては平凡だ。最上行が合致する仕事のためにそれを選べ。
文字起こしの精度
会話の枠を超えて、xAIははるかに優れた文字起こし性能を主張している。社内評価では、24言語・数千のフレーズにわたって、Think Fast 1.0の約1.4倍、Deepgram Nova 3やElevenLabs Scribe v2といった専用文字起こしモデルの1.5~2倍の精度を示したとされている。騒音のある実環境(背景ノイズ、電話回線の圧縮、低帯域の通話)では、専用STTモデルに対する精度の差は約10倍に広がると報告されている。
これらはまさに注意して扱うべき主張です。これらはxAIによる報告であり、評価ハーネス、フレーズセット、ノイズプロファイルは公開されていません。2.0のノイズの多い電話音声の文字起こしをDeepgramやElevenLabsと比較する独立したテストは価値があるでしょうが、本稿執筆時点ではまだ公開されていません。方向性として、エンドツーエンドモデルがトレーニングでより多くの電話音声を取り込むことは、現実的な改善として妥当です。ただし「10x」は検証されるべきであり、事実として繰り返されるべきではありません。
料金: 1分あたり0.08ドル、そして60%の質問
ここが、このローンチが物議を醸す点です。Think Fast 2.0 は音声1分あたり0.08ドル(1時間あたり約4.80ドル)に加えて、テキスト入力メッセージ1件あたり0.004ドルかかります。Think Fast 1.0 は1分あたり0.05ドル(1時間あたり3.00ドル)でした。これは60%の値上げであり、しかも OpenAI が GPT-5.6 Luna の価格を80%、Terra の価格を20%引き下げたのと同じ月に実施されました。OpenAI はその際、xAI がこのモデルについて主張しているのと同じ、サービス提供コストの低下を理由に挙げています。
メーターがすべてを物語る。テキストモデルはトークン単位で課金されるため、モデルが効率的になれば、顧客の請求額は自動的に減る。一方、音声モデルは実時間の音声の分数単位で課金され、会話の長さはモデルではなく話す人が決める。分数単位の製品における効率化の利益は、購入者ではなく提供事業者に帰属する。だからこそ、推論トークンを約60%削減すると報じられているモデルは、xAIにとっては提供コストが安くなるにもかかわらず、レンタル料金は60%高いのだ。
実際の通話フローで計算してみましょう。1.0での4分間の通話は0.20ドル、同じ通話が2.0では0.32ドルかかります。月に1万回の通話は40,000分に相当し、1.0では月2,000ドル、2.0では月3,200ドル。その差は月1,200ドル、年間約14,400ドルにもなり、これは通話量ではなくルーティング変更だけによるものです。たとえ大幅な速度向上があっても、その差はほとんど埋まりません。各通話からまるまる10秒短縮しても約0.013ドルの節約になる一方、価格上昇は0.12ドル増えるため、増加分のおよそ9分の1しか回収できません。2.0をより安いモデルとして売り込むビジネスケースは、「速い」と「安い」を混同しています。
参考までに、2.0はGPT-Realtime-2.1 Highよりも約2.2倍安く、1時間あたり約10.75ドルです。つまり、絶対的な金額では高くありませんが、前身モデルや、その月に他のモデルベンダーが進んでいた方向性と比べると割高です。
8月5日の移行の罠
期限が設定されています。2026年8月5日に、grok-voice-latest エイリアスは自動的に Think Fast 2.0 へのルーティングを開始します。そのエイリアス経由で Think Fast 1.0 を使用している場合、「何もしない」と、その日付で新しいバージョンにアップグレードされ、請求もそれに伴います。1.0 を使い続けるには、8月5日より前に grok-voice-think-fast-1.0 モデル ID を明示的に固定する必要があります。
The two defensible positions both require action before the deadline: either pin **1.0** deliberately because your scripted flows worked fine at **$3.00/hour**, or move to **2.0** deliberately and reforecast at **$4.80/hour**, justified on quality rather than savings. What's indefensible is discovering the change in a September invoice. A good rule: treat any alias ending in "latest" as a standing instruction to accept whatever the vendor ships next — including its price.
アクセス方法と使い方
Think Fast 2.0 は、xAI の Speech-to-Speech API を通じて利用できます。モデル ID は grok-voice-think-fast-2.0 で、grok-voice-latest がローリングエイリアスとして使用できます。これは WebSocket 上で動作するリアルタイム・全二重モデルです: wss://api.x.ai/v1/realtime?model=grok-voice-think-fast-2.0 に接続し、ハンドシェイク時に Authorization: Bearer ヘッダーで認証されます。ブラウザアプリの場合は、realtime sessions エンドポイント経由でサーバーサイドに一時トークンを発行し、親 API キーがクライアントに渡らないようにしてください。
このAPIは{{1}}OpenAI Realtime互換{{/1}}であるため、既存のリアルタイム音声コードは通常、ベースURLとキーの交換だけで済みます。セッションのセットアップはsession.updateイベントを通じて行われます。プリセット音声({{2}}eve、ara、rex、sal、leo{{/2}})を選択し、入力および出力オーディオ形式({{3}}デフォルトでは24kHzのPCM16、テレフォニーではμ-law{{/3}})を設定し、{{4}}サーバーサイドの音声アクティビティ検出{{/4}}を有効にして、エージェントが会話の途中で行動できるようにツール(組み込みの{{5}}ウェブ検索ツール{{/5}}を含む)を登録します。イベントフローは標準パターンに従います。クライアントが{{6}}オーディオバッファフレーム{{/6}}を追加し、サーバーが{{7}}レスポンス音声デルタ{{/7}}をストリーミングし、モデルが行動を決定するとツール呼び出しの引数イベントが発生し、結果は{{8}}関数呼び出し出力{{/8}}としてプッシュバックされます。このモデルは{{9}}25以上の言語{{/9}}と、約1分の音声からの{{10}}カスタム音声クローニング{{/10}}をサポートしています。
これが何でないかを明確にしておきます。これは音声対音声(speech-to-speech)のエージェントモデルであり、一般的な文字起こしサービスや翻訳サービスではありません。製品の中心的な役割が音声を安価にテキストへ変換することであるなら、専用のSTTモデルという別のツールが適しています。しかも分単位の課金では会話全体に対して支払うことになるため、文字起こしのみのワークロードではすぐにコストがかさみます。

ボイスエージェントスタックへの組み込み方
Think Fast 2.0 は、モデルルーターがホストする汎用 LLM ではなく、xAI の専用 API を通じてアクセスされる特化型リアルタイム音声モデルです。音声レーンは xAI の WebSocket 上で直接動作します。そこにサブ秒のレイテンシが存在しており、中間ホップを経由すると失われてしまいます。
音声プロダクトの周辺にあるその他すべて — 時間的にクリティカルではない自然言語ロジック、会話がスクリプトから外れたときのフォールバック推論、要約、分析、エージェントが通話後にトリガーするメールフォローアップ — は、汎用のテキストおよびマルチモーダル処理です。その部分には、OrcaRouterのようなベンダーニュートラルなエンドポイントを使えば、複数のLLMにわたってOpenAI互換のAPIが1つで済むため、リアルタイムの音声レーンを必要としないスタックの部分で単一ベンダーに縛られることはありません。明確な分離: ストリーミング音声そのものにはxAIの専用API、その周囲のテキストおよびマルチモーダル推論にはOrcaRouter(または類似のもの)を使用します。
競争:エージェントのスピード vs 生の知能
Think Fast 2.0は、現在のAI市場で最も競争が激しい分野であるリアルタイム音声エージェントの真っ只中に登場し、そのベンチマーク表はトレードオフを異例なほど明確に示している。
Qwen Audio 3.0 Realtime Plusは、インテリジェンスのリーダーです:音声対音声品質指標で84.1%(首位)、Big Bench Audioで記録的な99.2%、全二重で98.4%を達成しています。しかし、初回音声までの平均時間は約4.02秒で、Grokの0.70秒よりおよそ5.7倍遅いです。車載、ウェアラブル、電話での会話において、この違いは「速いか遅いか」ではなく、「使えるか使えないか」の問題です。Qwenはまた、異なるシナリオに応じて、Plusティア(高品質)とFlashティア(最初のパケット約300ms)に分かれており、これは同じジレンマに対する思慮深い回答です。
GPT-Realtime-2.1は、ほとんどの指標で中間に位置し(品質 79.1%、エージェント性 45.7%)、会話ダイナミクス(95.7%)で最も優れています。High ティアの時間あたり価格は Grok の約 2.2 倍です。OpenAI エコシステムにすでに深く関わっているチームにとっては、最も導入障壁の低いデフォルトであり続けます。
Gemini 3.1 Flashは、品質とエージェンティック複合スコア(69.5%、37.7%)では劣りますが、より広範なGemini音声スタックとGoogleエコシステムの一部であり、多くのチームが他の理由で好んでいます。
実用的な読み方:ワークロード次第で選ぶ。音声エージェントが即時性を求められ、ツールを活用したタスク(サポート、リード判定、予約)を確実に完了する必要があるなら、Think Fast 2.0 が現時点で測定上最強の選択肢だ。最優先が深い推論能力で、数秒レベルのレイテンシーを許容できるなら、Qwen Plus が勝る。会話の洗練度とエコシステムへの適合性を最も重視するなら、GPT-Realtime-2.1 が依然として打倒すべき既存王者である。

それが当てはまる3つのシナリオ
1. 電話サポートとテレフォニー
最も重要な組み合わせ:1秒未満の初回音声、ノイズの多い電話音声での堅牢な文字起こし(ベンダー報告)、そして全二重割り込み処理です。エージェントがほぼ即座に話し始め、会話の途中でアカウント情報を引き出せるサポートラインこそ、2.0が調整されてきた用途そのものです。その短く、一度に一つの質問をするRLの話し方は、分単位が課金単位となるテレフォニーにもよく適合しています——どちらのベンダーのメーターでも同じです。
2. リードの選別とコール後のフォローアップ
エージェンティック音声は、2.0が真に先駆者となる分野であり、リードクオリフィケーションはその代表的なエージェンティック音声タスクです。インテントが新鮮なうちに、リードを選別し、ルーティングし、フォローアップをトリガーします。ツール呼び出しは最初の文が終わる前に発火できるため、エージェントは見込み客と話しながらCRMレコードを作成できます。セッションレベルのアトリビューションと厳格なツール権限を計画してください — 音声エージェントはリアルタイムで誤る可能性があり、その後の修正はあなたの責任です。
3. 活発に開発中のボイスエージェント製品
独自の音声エージェントを提供するビルダーにとって、xAIが引用するTradecraftおよびGrokTermの統合はまさにこの形です。2.0の速度とOpenAI互換APIにより、GPT-Realtimeコードへの摩擦の少ないドロップインが実現します。バージョンを固定し、明確な成功条件(例:「価格ページの訪問者の適格性を判断してルーティングする」)を設定した小規模なパイロットを実行し、1分あたりのコストではなく、完了した成果あたりのコストを測定してください。
制限事項と注意事項
これを書いている時点でThink Fast 2.0は登場から5日しか経っておらず、それが注意点に表れている。StarlinkのA/Bテスト結果(コンバージョン率の向上とサポート対応の抑制)はxAIによる報告であり、数値は公表されていない。文字起こしの倍率や「ほぼ5倍高速」という表現も同様にベンダー側の主張であり、独立したベンチマークではない。「パフォーマンス低下と捏造されたテストレポート」を主張する記事があれば、それもこの同じ検証不可能性を指している。xAIが公表した数値は第三者によって再現されておらず、信頼性を重視する音声コミュニティが非公開のベンダーメトリクスに疑念を抱くのは当然だ。また、ベンチマークは最悪のケースを測ることもできない。エージェントがリードを誤ったチームに自信を持って振り分けるなら、0.70秒の応答は無価値だ。音声の課金は分単位で、値上げがすでに織り込まれているため、コスト負担のリスクは現実のものだ。そして、どんな新しいリアルタイムモデルにも言えることだが、APIの仕様変更が起こると予想しておくべきだ。精度の主張は自社の音声で検証し、本番環境ではバージョンを固定し、最初のライブ通話の前にエスカレーションと録音の仕組みを整えておくこと。
よくある質問
Grok Voice Think Fast 2.0とは何ですか?
2026年7月29日にリリースされた、xAIの音声エージェント向けフラッグシップ音声間(speech-to-speech)モデル。WebSocket上でネイティブなエンドツーエンドの音声間(audio-to-audio)処理を実現し、初回音声出力までの時間(time-to-first-audio)は0.70秒、τ-Voiceエージェントベンチマークで第1位を獲得。
Grok Voice Think Fast 2.0の価格はいくらですか?
音声1分あたり0.08ドル(1時間あたり約4.80ドル)に加え、テキスト入力メッセージ1件あたり0.004ドル——Think Fast 1.0の1分あたり0.05ドルから60%の値上げ
「Think Fast 2.0 は最高の音声モデルですか?」
エージェントタスクでは最速かつ最高性能(56.5% τ-Voice、第1位)で、音声対音声の品質指数では総合2位(82.9%)で、Qwen Audio 3.0 Realtime Plus(84.1%)に次ぐ結果です。「最高」はワークロードに依存します。
Think Fast 1.0から何が変わりましたか?
並列音声推論(話しながら考える)、推論トークンが約60%削減、RL調整による短い会話スタイル、文字起こしの1.4倍の改善(ベンダー報告値)、そして最初の音声出力までの時間が1.25秒から0.70秒に短縮。
私の Think Fast 1.0 トラフィックスイッチは自動的に切り替わりますか?
はい、2026年8月5日以降、grok-voice-latest エイリアスを使用する場合です。それまでに grok-voice-think-fast-1.0 をピン留めして 1.0 を維持するか、意図的に 2.0 を採用してコストを再見積もりしてください。
Grok Voice Think Fast 2.0 はどうやって呼び出しますか?
xAIのSpeech-to-Speech APIを通じて — OpenAI Realtime APIと互換性のあるリアルタイムWebSocket(wss://api.x.ai/v1/realtime?model=grok-voice-think-fast-2.0)で、プリセット音声、サーバーVAD、ツール呼び出しを備えています。
どの音声モデルと競合しますか?
Qwen Audio 3.0 Realtime Plus(よりインテリジェント、ただし最初の音声出力まで4.02秒と大幅に遅い)、GPT-Realtime-2.1(会話のダイナミクスが向上、Highティアで約2.2倍高価)、およびGemini 3.1 Flash。
ベンチマークの主張は信頼できるでしょうか?
「Artificial Analysisのスコアは独立しており、信頼性があります。StarlinkのA/Bテスト結果、文字起こし倍率、速度のフレーミングはxAIが報告したもので、公開データはありません。これらは方向性を示すものとして捉え、ご自身の音声で検証してください。」
Grok Voiceは文字起こしに適していますか?
それは会話内での文字起こしを行い、xAIはノイズ環境において専用のSTTモデルよりも大幅な改善を主張しています。しかし、会話の分数ごとに課金されるため、専用の文字起こしワークロードには専用のSTTモデルを使う方が適しています。
結論
Grok Voice Think Fast 2.0は、これまで測定された中で最強のエージェント型音声モデルであり、トップ層の中でも圧倒的な差で最速です——初回音声出力までの0.70秒は、真に独立した、ユーザーにとって実際の成果であり、τ-Voiceでの1位も実際のランキングです。正直な要約は具体的です。つまり、リアルタイムでツール連携する音声エージェント向けとしては、このクラスで最良のツールですが、すべての項目で最高の音声モデルというわけではありません——知性ではQwenが、会話の巧みさではOpenAIがリードしています。論争は速度についてではありません。価格設定についてです:xAIが運用コストが安いと主張するモデルで60%の値上げ、厳しい期限付きの自動エイリアス移行、そして未公開のベンダー数値に依存した見出しレベルの主張です。エージェント型の速度のために使用し、バージョンを固定し、ベンダーの主張には注釈を付け、自社の通話で正確性を検証してください——また、音声製品の周りの汎用テキストと推論は、OrcaRouterのようなベンダー中立のエンドポイントに置いてください。
この記事で比較したモデル1
この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新
