
Realtime-Venus vs Grok Voice Think Fast 2.0:このうち価格があるのは1つだけ
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100万トークンあたり
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- openaiNEWOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- googleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- anthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1244知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0540知能72コーディング
- qwenQwen: Qwen3.8 Max2026-08-0345知能76コーディング
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135知能69コーディング
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100万トークンあたり
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Realtime-Venus と Grok Voice Think Fast 2.0 を並べると、最初の違いはベンチマークではなく、発注書である。Grok Voice Think Fast 2.0 はホスト型の音声対音声モデルで、2026年7月29日に音声1分あたり0.08ドルで発売され、初回音声出力までの時間は0.70秒と公表されており、第三者によるベンチマークスコアもある。Realtime-Venus は Ant Group の Venus Team と清華大学による9Bの全二重システムで、Apache-2.0 の重み、2026年9月12日付の技術報告書として存在するが、呼び出せるものは何もない。このうち一方は、今週末までに電話回線に接続できる。もう一方は、読むことができる。この非対称性は、スコアボードによる比較よりもはるかに有用な比較であることがわかる。なぜなら、2つのモデルはほぼ同じアーキテクチャ上の賭けをし、その後、それをどう扱うかで完全に分岐したからだ。
手短に言えば
今すぐ本番環境で動く音声エージェントが必要で、予算に組み込める料金表とテストできるレイテンシ保証が欲しいなら、Grok Voice Think Fast 2.0 を選んでください。スタックを自分で所有する必要があるなら——データを自社インフラの外に出せない、フロントエンドをファインチューニングしたい、あるいは製品を出荷するのではなくアーキテクチャを評価している——なら、Realtime-Venus を選んでください。両者が競合する第三のケースは存在しません。一方には API があり、もう一方にはないからです。
彼らは難しい問題について意見が一致している
興味深いのは、診断がいかに似ているかだ。どちらのモデルも同じ矛盾のために存在している。会話制御はサブ秒の粒度で実行されなければならず、推論には数秒かかる。立ち止まって考えるモデルは、その場にいる感じを失う。
Grok Voice Think Fast 2.0 は、話しながら推論することでこれを解決します。Think Fast シリーズは、モデルがまず推論してから音声を生成するのではなく、音声をストリーミングしながら並行して思考するという考えに基づいて構築されました。そのため、エージェントが最初の文を言い終える前にツール呼び出しを発火させることができます。xAI の報告によると、バージョン 2.0 は前身の約 0.4 倍の推論トークンを使用しており、これは品質の改善ではなく、コストとレイテンシの改善として提示されています。
Realtime-Venusは、それをフロントエンドでまったく解決しないことで解決する。そのデュアルループランタイムは、1秒のインタラクションループ——知覚、ターン制御、音声生成——を走らせ続け、高コストな処理はすべて、モデル自身の隠れシーケンス内で発行される非同期委譲マーカーを通じて、Realtime-Venus-Harnessと呼ばれる別コンポーネントに引き渡す。フォアグラウンドの会話は決して停止しない。バックグラウンドの結果は、届き次第再統合される。
それらは同じ問いに対する異なる工学的解答であり、異なる失敗モードを持つ。話しながら推論することは、両方のスレッドの一貫性を保つという負担をモデルに負わせる。委譲は、二つのループが互いを破壊しないようにするという負担をランタイムに負わせる——だからこそ、Realtime-Venus論文の因果的タスクキャプチャ、委譲されたタスクごとの分離された状態スナップショットが、この設計を支える細部なのだ。
両方ともそれで測定できるただ一つの指標
全二重ベンチマークは、この2つが重なる唯一の領域であり、しかもきれいに重なるわけではない。
• 割り込み処理 — Realtime-Venusは、Full-Duplex-Bench v1.5において、ユーザーの割り込みの75%に応答したと報告しています。Grok Voice Think Fast 2.0は、Artificial AnalysisによるFull Duplex Benchで95.1%を記録し、バージョン1.0の77.8%から向上しています。
• オーバーラップ下での継続 — Realtime-Venus は、あいづちで97%、他者指向発話で88%、背景音声で86%の継続率を報告し、3つすべてで Gemini 3.1 Live と GPT-4o を上回ると述べている。
• 異なる測定器、異なる著者——Realtime-Venusの数値は、外部による再現がなされていない独自の技術報告書に由来する。Grokの数値は、モデルを実行した第三者に由来する。自己申告の数値と独立に測定された数値を比較することは比較とは言えず、上記の差は実際の差であるのと同じくらい方法論上の差である可能性が高い。
率直な見解:入手可能な証拠に基づけば、Grok Voice Think Fast 2.0 は、二者のうち全二重動作が結果に利害関係のない人物によって測定された唯一のものである。
独立した数値が示すGrok Voice Think Fast 2.0の立ち位置
現在時点で最も明瞭な指標はArtificial AnalysisのSpeech Agent Arenaから得られる。これは、歯科予約やテイクアウトの注文といったタスクにおけるライブ音声会話を通じて、盲検の選好に基づいてモデルを採点するものだ。2026年9月18日時点で、Grok Voice Think Fast 2.0 Highは20を超えるエントリのうち7位、552サンプルでElo 1,011となっており、GoogleのGemini 3.1 Flash Live Minimal(1,096)、Gemini 3.8 Live(1,083)、GPT-Live-1(1,053)に後れを取る一方、自身の前身であるGrok Voice Think Fast 1.0(908)は大きく上回っている。
Elo の隣の列のほうが興味深い。タスク成功率では、Grok Voice Think Fast 2.0 が 94.6% を記録し、可視トップ20のどこよりも高い数字だ — Gemini 3.8 Live の 93.2%、GPT-Realtime-2.1 High の 91.5%、GPT-Live-1 の 90.9% を上回る。選好では7位、タスク完了では1位というのは、珍しくかなり特異なプロファイルだ。聴き手はその声を愛さないが、仕事はやり遂げる。あなたの製品が雑談ではなく物事を行うなら、結果を予測するのはその列であり、これはこれら2つのモデルのどちらについても最強の独立した証拠である。

xAIがローンチ時に公表した数値は別の指標であり、切り離して読むべきです。Artificial Analysisの音声対音声品質指数で82.9%、τ-Voiceエージェントベンチマークでは56.5%で1位、Big Bench Audioで97.2%、Full Duplex Benchで95.1%。これらはモデルが2026年7月下旬に出荷された時点での順位であり、このカテゴリーのボードは毎月動きます——だからこそ、上記のアリーナ表を今日読むことには、ローンチ時の数値以上の価値があるのです。

請求書、およびそのうち請求書に記載されていない部分
Grok Voice Think Fast 2.0は音声1分あたり0.08ドル、1時間あたりおよそ4.80ドル、さらにテキスト入力メッセージ1件ごとに0.004ドルかかります。これは、1.0版が提供開始時に請求していた1分あたり0.05ドルからの60%の値上げであり、xAIはローリングgrok-voice-latestエイリアスを2026年8月5日に自動的に2.0へ移行したため、旧価格のままでいたいチームはその日付より前に明示的なバージョンを固定しなければなりませんでした。分単位課金モデルはまた、効率改善の利益がベンダーに帰属することを意味します。モデルが通話をより速く終了できるようになれば、通話あたりの請求額は下がりますが、1分あたりのコストは下がりません。
Realtime-Venusには請求書がない。なぜならサービスがないからだ。代わりにあるのはハードウェアの下限だ。BF16の9Bチェックポイント2つは、活性化メモリを別にすれば、それぞれ約18ギガバイトの重みになる。そしてカードには、継続的に実行し続けなければならない毎秒ストリーミングループの記載がある。それを可能にするGPUノードには月額コストがかかり、しかもそれは固定費だ。誰かが呼び出そうと呼び出さまいと支払う。安定したトラフィックのある製品なら、それは1時間あたり4.80ドルより安い。断続的なトラフィックのある製品なら、それは劇的に高くつき、そして分岐点こそがここで重要となる唯一の財務上の問いだ。
重み、コントロール、そしてそれぞれで変更できるもの
ここが、2つのモデルがまったく比較にならなくなるポイントです。
• ファインチューニング — Realtime-Venus は重みを提供します。それらをファインチューニングし、量子化し、エアギャップ環境で実行し、すべての層を検査できます。Grok Voice Think Fast 2.0 はクローズドなホスト型モデルです。変更できるのは、プロンプト、音声の選択、登録するツールです。
• 音声 — Grok Voice Think Fast 2.0 はプリセット音声を搭載し、約1分の音声からカスタム音声クローニングに対応しています。Realtime-Venus は参照音声と同梱のトークンから波形へのデコーダーを搭載しており、それ以上はご自身で対処していただく必要があります。
• Reach — Grok Voice Think Fast 2.0 は25以上の言語をサポートし、OpenAI Realtime互換のWebSocketセッション上で、デフォルトでは24 kHzのPCM16、テレフォニー向けにはμ-lawで音声を出力します。この互換性は実際の移行資産です。既存のリアルタイム音声コードのほとんどは、ベースURLとキーの変更だけで済みます。Realtime-Venusは英語と中国語をドキュメント化しています。
• 動画 — Realtime-Venus-Omni は、SigLIP2 エンコーダーを介してストリーミング動画と画像を取り込み、継続的な視覚認識を行います。Grok Voice Think Fast 2.0 は音声とテキストのみで、カメラ経路はありません。
• 長いコンテキスト — Realtime-Venus は 40,960 トークンのコンテキストと、40 分のウィンドウで有効化できるトレーニング不要の長時間動画メモリを備えています。Grok Voice Think Fast 2.0 はセッションモデルであり、比較可能な公開メモリ機能はありません。

それぞれがどこで壊れるか
備えておくべき障害は正反対だ。Grok Voice Think Fast 2.0 のリスクは、ベンダーの集中と検証不能なマーケティングにある。xAI の Starlink A/B 結果、文字起こし精度の倍率、速度の表現はすべて同社の自己申告で、根拠となるデータは公開されていない。しかも、バージョン間で価格が 60% 変わる分単位課金モデルは、価格を変えることをすでに示している。バージョンを固定し、自分の音声で独自の評価を実行しよう。
Realtime-Venusの弱点は、誰もそれを動かしたことがないという点にある。そのベンチマークは自己申告であり、その重要性の割にハーネスは文書化されておらず、実際のデプロイにおけるレイテンシは不明である——報告書が述べているのは1秒の対話ケイデンスであり、これは設計パラメータであって、測定された初回音声までの時間ではない。APIも再現もないモデルには実績がなく、仕様しかない。
平明に述べておく価値のある中間的な道があります。なぜなら、それがほとんどのチームが実際に取る道だからです。委任ベースのシステムを構築しているなら——フロントエンドは自分で選び、高コストな作業はテキストモデルに任せる——フロントエンドと推論レッグは同じ場所から来る必要はありません。OrcaRouter は Realtime-Venus も Grok Voice Think Fast 2.0 も取り扱っていません。どちらの音声レイヤーも当社が提供する範囲の外にあり、そうでないかのようにほのめかすのではなく、私たちはそう明言します。委任されるレッグはまた別の話です。ほぼ200のテキストモデルが、プロバイダーの定価・マークアップなしで1つのキーの背後に並び、上流の障害で通話が途切れないよう自動フェイルオーバーを備え、複数のモデルを1つの通話に組み合わせるためのルーティングDSL、そして複数の意見に値する意思決定のためのモデルフュージョンを提供しています。それが、交換可能であることに恩恵を受ける音声エージェントの半分であり、会話を保持しているモデルに触れることなく変更できる半分です。
どちらを選ぶべきですか
今四半期は Grok Voice Think Fast 2.0 を選びましょう。これは利用可能で、独立したベンチマーク評価を受けており、あなたのエージェントが何か役立つことを実行できるかどうかを予測するエージェント型評価で首位に立っています。また、最初の音声までの0.70秒は、ユーザー体験を設計する際の拠り所にできる数値です。1.0からの60%の価格上昇を見込んで予算を確保し、モデルバージョンを固定してください。
Realtime-Venus を選ぶのは、制約が所有権である場合だけにしてください。デプロイ環境が外部 API を呼び出せない場合、会話フロントエンドをファインチューニングする必要がある場合、またはカメラが必要な場合 — この3つのケースがすべてであり、当てはまるなら強い理由になります。
それを決めるべきではないのはベンチマーク表だ。なぜなら、その両側は異なる人々によって異なる条件のもとで作られたからだ。Grok Voice Think Fast 2.0 の数値は別の誰かによって測定された。Realtime-Venus のものはそうではなかった。それが変わるまでは、実際に可能な比較は製品と論文の間のものでしかない。
この記事で比較したモデル2
この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新
