「Realtime-Venus vs Grok Voice Think Fast 2.0」のヒーロータイトルカード。サブタイトルは「片方は今日の午後に買える。片方はダウンロードだ。」。3枚のカードにはそれぞれ「Grok Voice Think Fast 2.0:音声1分あたり$0.08、最初の音声まで0.70秒」「Realtime-Venus:Apache-2.0の重み、APIなし、料金表なし」「共通の賭け:話す前に考えるのではなく、話しながら考える」と記され、その下のフッター帯には「Grokの数値はArtificial AnalysisおよびxAIのドキュメントによる。Realtime-Venusの数値は同技術レポートによるもので、未再現。」とある。OrcaRouterのロゴが右下隅に合成されている。
Guides & Insights

Realtime-Venus vs Grok Voice Think Fast 2.0:このうち価格があるのは1つだけ

著者

Alistair Wren

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

Realtime-Venus と Grok Voice Think Fast 2.0 を並べると、最初の違いはベンチマークではなく、発注書である。Grok Voice Think Fast 2.0 はホスト型の音声対音声モデルで、2026年7月29日に音声1分あたり0.08ドルで発売され、初回音声出力までの時間は0.70秒と公表されており、第三者によるベンチマークスコアもある。Realtime-Venus は Ant Group の Venus Team と清華大学による9Bの全二重システムで、Apache-2.0 の重み、2026年9月12日付の技術報告書として存在するが、呼び出せるものは何もない。このうち一方は、今週末までに電話回線に接続できる。もう一方は、読むことができる。この非対称性は、スコアボードによる比較よりもはるかに有用な比較であることがわかる。なぜなら、2つのモデルはほぼ同じアーキテクチャ上の賭けをし、その後、それをどう扱うかで完全に分岐したからだ。

手短に言えば

今すぐ本番環境で動く音声エージェントが必要で、予算に組み込める料金表とテストできるレイテンシ保証が欲しいなら、Grok Voice Think Fast 2.0 を選んでください。スタックを自分で所有する必要があるなら——データを自社インフラの外に出せない、フロントエンドをファインチューニングしたい、あるいは製品を出荷するのではなくアーキテクチャを評価している——なら、Realtime-Venus を選んでください。両者が競合する第三のケースは存在しません。一方には API があり、もう一方にはないからです。

彼らは難しい問題について意見が一致している

興味深いのは、診断がいかに似ているかだ。どちらのモデルも同じ矛盾のために存在している。会話制御はサブ秒の粒度で実行されなければならず、推論には数秒かかる。立ち止まって考えるモデルは、その場にいる感じを失う。

Grok Voice Think Fast 2.0 は、話しながら推論することでこれを解決します。Think Fast シリーズは、モデルがまず推論してから音声を生成するのではなく、音声をストリーミングしながら並行して思考するという考えに基づいて構築されました。そのため、エージェントが最初の文を言い終える前にツール呼び出しを発火させることができます。xAI の報告によると、バージョン 2.0 は前身の約 0.4 倍の推論トークンを使用しており、これは品質の改善ではなく、コストとレイテンシの改善として提示されています。

Realtime-Venusは、それをフロントエンドでまったく解決しないことで解決する。そのデュアルループランタイムは、1秒のインタラクションループ——知覚、ターン制御、音声生成——を走らせ続け、高コストな処理はすべて、モデル自身の隠れシーケンス内で発行される非同期委譲マーカーを通じて、Realtime-Venus-Harnessと呼ばれる別コンポーネントに引き渡す。フォアグラウンドの会話は決して停止しない。バックグラウンドの結果は、届き次第再統合される。

それらは同じ問いに対する異なる工学的解答であり、異なる失敗モードを持つ。話しながら推論することは、両方のスレッドの一貫性を保つという負担をモデルに負わせる。委譲は、二つのループが互いを破壊しないようにするという負担をランタイムに負わせる——だからこそ、Realtime-Venus論文の因果的タスクキャプチャ、委譲されたタスクごとの分離された状態スナップショットが、この設計を支える細部なのだ。

両方ともそれで測定できるただ一つの指標

全二重ベンチマークは、この2つが重なる唯一の領域であり、しかもきれいに重なるわけではない。

• 割り込み処理 — Realtime-Venusは、Full-Duplex-Bench v1.5において、ユーザーの割り込みの75%に応答したと報告しています。Grok Voice Think Fast 2.0は、Artificial AnalysisによるFull Duplex Benchで95.1%を記録し、バージョン1.0の77.8%から向上しています。

• オーバーラップ下での継続 — Realtime-Venus は、あいづちで97%、他者指向発話で88%、背景音声で86%の継続率を報告し、3つすべてで Gemini 3.1 Live と GPT-4o を上回ると述べている。

• 異なる測定器、異なる著者——Realtime-Venusの数値は、外部による再現がなされていない独自の技術報告書に由来する。Grokの数値は、モデルを実行した第三者に由来する。自己申告の数値と独立に測定された数値を比較することは比較とは言えず、上記の差は実際の差であるのと同じくらい方法論上の差である可能性が高い。

率直な見解:入手可能な証拠に基づけば、Grok Voice Think Fast 2.0 は、二者のうち全二重動作が結果に利害関係のない人物によって測定された唯一のものである。

独立した数値が示すGrok Voice Think Fast 2.0の立ち位置

現在時点で最も明瞭な指標はArtificial AnalysisのSpeech Agent Arenaから得られる。これは、歯科予約やテイクアウトの注文といったタスクにおけるライブ音声会話を通じて、盲検の選好に基づいてモデルを採点するものだ。2026年9月18日時点で、Grok Voice Think Fast 2.0 Highは20を超えるエントリのうち7位、552サンプルでElo 1,011となっており、GoogleのGemini 3.1 Flash Live Minimal(1,096)、Gemini 3.8 Live(1,083)、GPT-Live-1(1,053)に後れを取る一方、自身の前身であるGrok Voice Think Fast 1.0(908)は大きく上回っている。

Elo の隣の列のほうが興味深い。タスク成功率では、Grok Voice Think Fast 2.0 が 94.6% を記録し、可視トップ20のどこよりも高い数字だ — Gemini 3.8 Live の 93.2%、GPT-Realtime-2.1 High の 91.5%、GPT-Live-1 の 90.9% を上回る。選好では7位、タスク完了では1位というのは、珍しくかなり特異なプロファイルだ。聴き手はその声を愛さないが、仕事はやり遂げる。あなたの製品が雑談ではなく物事を行うなら、結果を予測するのはその列であり、これはこれら2つのモデルのどちらについても最強の独立した証拠である。

A screenshot of the Artificial Analysis Speech Agent Arena Leaderboard captured 18 September 2026. The table reads, in rank order: Gemini 3.1 Flash Live Minimal Elo 1,096 with a 74.6% task success rate; Gemini 3.8 Live Elo 1,083 and 93.2%; Gemini 3.1 Flash Live High Elo 1,063 and 71.8%; GPT-Live-1 (Sol, low) Elo 1,053 and 90.9%; GPT-Live-1 (Astra, medium) Elo 1,048 and 87.4%; Cartesia Line Elo 1,027 and 77.5%; Grok Voice Think Fast 2.0 High Elo 1,011, 552 samples and 94.6%; GPT-Realtime-1.5 Elo 1,000 and 85.1%; and further down Grok Voice Think Fast 1.0 at Elo 908 with 80.7%.

xAIがローンチ時に公表した数値は別の指標であり、切り離して読むべきです。Artificial Analysisの音声対音声品質指数で82.9%、τ-Voiceエージェントベンチマークでは56.5%で1位、Big Bench Audioで97.2%、Full Duplex Benchで95.1%。これらはモデルが2026年7月下旬に出荷された時点での順位であり、このカテゴリーのボードは毎月動きます——だからこそ、上記のアリーナ表を今日読むことには、ローンチ時の数値以上の価値があるのです。

A two-column comparison scoreboard titled 'Realtime-Venus vs Grok Voice Think Fast 2.0 — the scoreboard'. The left column, labelled Realtime-Venus, reads 'Availability: Apache-2.0 weights, no API', 'Price: none published', 'Modality: audio, video and text', 'Interruption response: 75% reported', 'Continuation under overlap: 97 / 88 / 86% reported', 'Independent scores: none'. The right column, labelled Grok Voice Think Fast 2.0, reads 'Availability: hosted API since 29 July 2026', 'Price: $0.08 per audio minute', 'Modality: audio and text', 'Interruption handling: 95.1% Full Duplex Bench at launch', 'Time to first audio: 0.70 s', 'Independent scores: Elo 1,011 and 94.6% task success on the Speech Agent Arena'. The footer reads 'Realtime-Venus figures from its technical report, unreproduced; Grok figures per Artificial Analysis and xAI documentation.'

請求書、およびそのうち請求書に記載されていない部分

Grok Voice Think Fast 2.0は音声1分あたり0.08ドル、1時間あたりおよそ4.80ドル、さらにテキスト入力メッセージ1件ごとに0.004ドルかかります。これは、1.0版が提供開始時に請求していた1分あたり0.05ドルからの60%の値上げであり、xAIはローリングgrok-voice-latestエイリアスを2026年8月5日に自動的に2.0へ移行したため、旧価格のままでいたいチームはその日付より前に明示的なバージョンを固定しなければなりませんでした。分単位課金モデルはまた、効率改善の利益がベンダーに帰属することを意味します。モデルが通話をより速く終了できるようになれば、通話あたりの請求額は下がりますが、1分あたりのコストは下がりません。

Realtime-Venusには請求書がない。なぜならサービスがないからだ。代わりにあるのはハードウェアの下限だ。BF16の9Bチェックポイント2つは、活性化メモリを別にすれば、それぞれ約18ギガバイトの重みになる。そしてカードには、継続的に実行し続けなければならない毎秒ストリーミングループの記載がある。それを可能にするGPUノードには月額コストがかかり、しかもそれは固定費だ。誰かが呼び出そうと呼び出さまいと支払う。安定したトラフィックのある製品なら、それは1時間あたり4.80ドルより安い。断続的なトラフィックのある製品なら、それは劇的に高くつき、そして分岐点こそがここで重要となる唯一の財務上の問いだ。

重み、コントロール、そしてそれぞれで変更できるもの

ここが、2つのモデルがまったく比較にならなくなるポイントです。

• ファインチューニング — Realtime-Venus は重みを提供します。それらをファインチューニングし、量子化し、エアギャップ環境で実行し、すべての層を検査できます。Grok Voice Think Fast 2.0 はクローズドなホスト型モデルです。変更できるのは、プロンプト、音声の選択、登録するツールです。

• 音声 — Grok Voice Think Fast 2.0 はプリセット音声を搭載し、約1分の音声からカスタム音声クローニングに対応しています。Realtime-Venus は参照音声と同梱のトークンから波形へのデコーダーを搭載しており、それ以上はご自身で対処していただく必要があります。

• Reach — Grok Voice Think Fast 2.0 は25以上の言語をサポートし、OpenAI Realtime互換のWebSocketセッション上で、デフォルトでは24 kHzのPCM16、テレフォニー向けにはμ-lawで音声を出力します。この互換性は実際の移行資産です。既存のリアルタイム音声コードのほとんどは、ベースURLとキーの変更だけで済みます。Realtime-Venusは英語と中国語をドキュメント化しています。

• 動画 — Realtime-Venus-Omni は、SigLIP2 エンコーダーを介してストリーミング動画と画像を取り込み、継続的な視覚認識を行います。Grok Voice Think Fast 2.0 は音声とテキストのみで、カメラ経路はありません。

• 長いコンテキスト — Realtime-Venus は 40,960 トークンのコンテキストと、40 分のウィンドウで有効化できるトレーニング不要の長時間動画メモリを備えています。Grok Voice Think Fast 2.0 はセッションモデルであり、比較可能な公開メモリ機能はありません。

A screenshot of the Hugging Face model page for inclusionAI/Realtime-Venus, captured 18 September 2026, showing the Any-to-Any, Transformers, Safetensors, audio, video, speech, streaming and full-duplex tags, an Apache-2.0 licence badge, an arXiv 2609.13814 badge, and a side panel reading 'Downloads last month: -' and 'This model isn't deployed by any Inference Provider.'

それぞれがどこで壊れるか

備えておくべき障害は正反対だ。Grok Voice Think Fast 2.0 のリスクは、ベンダーの集中と検証不能なマーケティングにある。xAI の Starlink A/B 結果、文字起こし精度の倍率、速度の表現はすべて同社の自己申告で、根拠となるデータは公開されていない。しかも、バージョン間で価格が 60% 変わる分単位課金モデルは、価格を変えることをすでに示している。バージョンを固定し、自分の音声で独自の評価を実行しよう。

Realtime-Venusの弱点は、誰もそれを動かしたことがないという点にある。そのベンチマークは自己申告であり、その重要性の割にハーネスは文書化されておらず、実際のデプロイにおけるレイテンシは不明である——報告書が述べているのは1秒の対話ケイデンスであり、これは設計パラメータであって、測定された初回音声までの時間ではない。APIも再現もないモデルには実績がなく、仕様しかない。

平明に述べておく価値のある中間的な道があります。なぜなら、それがほとんどのチームが実際に取る道だからです。委任ベースのシステムを構築しているなら——フロントエンドは自分で選び、高コストな作業はテキストモデルに任せる——フロントエンドと推論レッグは同じ場所から来る必要はありません。OrcaRouter は Realtime-Venus も Grok Voice Think Fast 2.0 も取り扱っていません。どちらの音声レイヤーも当社が提供する範囲の外にあり、そうでないかのようにほのめかすのではなく、私たちはそう明言します。委任されるレッグはまた別の話です。ほぼ200のテキストモデルが、プロバイダーの定価・マークアップなしで1つのキーの背後に並び上流の障害で通話が途切れないよう自動フェイルオーバーを備え、複数のモデルを1つの通話に組み合わせるためのルーティングDSL、そして複数の意見に値する意思決定のためのモデルフュージョンを提供しています。それが、交換可能であることに恩恵を受ける音声エージェントの半分であり、会話を保持しているモデルに触れることなく変更できる半分です。

どちらを選ぶべきですか

今四半期は Grok Voice Think Fast 2.0 を選びましょう。これは利用可能で、独立したベンチマーク評価を受けており、あなたのエージェントが何か役立つことを実行できるかどうかを予測するエージェント型評価で首位に立っています。また、最初の音声までの0.70秒は、ユーザー体験を設計する際の拠り所にできる数値です。1.0からの60%の価格上昇を見込んで予算を確保し、モデルバージョンを固定してください。

Realtime-Venus を選ぶのは、制約が所有権である場合だけにしてください。デプロイ環境が外部 API を呼び出せない場合、会話フロントエンドをファインチューニングする必要がある場合、またはカメラが必要な場合 — この3つのケースがすべてであり、当てはまるなら強い理由になります。

それを決めるべきではないのはベンチマーク表だ。なぜなら、その両側は異なる人々によって異なる条件のもとで作られたからだ。Grok Voice Think Fast 2.0 の数値は別の誰かによって測定された。Realtime-Venus のものはそうではなかった。それが変わるまでは、実際に可能な比較は製品と論文の間のものでしかない。

この記事で比較したモデル2

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新