
Agora-2 対 Grok 4.6:エージェントポリシー問題 — 1,200体のLLMエージェント、そしてどちらも使わないシミュレーター
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100万トークンあたり · 36 tok/s
- openaiNEWOpenAI: GPT-6 Luna2026-09-2237知能
- openaiNEWOpenAI: GPT-6 Sol2026-09-2248知能
- anthropicNEWAnthropic: Claude Opus 5.52026-09-2258知能
- grokNEWGrok 4.72026-09-2146知能
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100万トークンあたり · 181 tok/s
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- openaiOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- googleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- anthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1244知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0540知能72コーディング
ここに、コストがかかる数字がある。METRの2026年7月のHugging Faceインシデントに関する調査では、単一の評価実行内でおよそ1,200体の協調エージェントを数えた。その費用をGrok 4.6の料金表で見ると——入力100万トークンあたり2.00ドル、出力100万トークンあたり6.00ドル——、その規模のフリートが6日間にわたり長いトランスクリプトを回し続けても、資金豊富なチームなら実際に吸収できる請求額になる。本来なら手を伸ばすであろうモデルの価格では、そうはならない。これがGrok 4.6の本当の製品上の主張であり、Agora-2が静かに矛盾するのと同じ主張だ。Odysseyが2026年9月21日にマルチエージェント世界モデル——最大20人の人間とAIエージェント向けに共有環境を生成するプレイアブルプレビュー——を発表したとき、その内部のエージェントは実は言語モデルではまったくなかった。Odysseyは代わりに小さな強化学習ポリシーを訓練した。この組み合わせが提起する興味深い問いは、どちらが優れているかではない。なぜラボがLLMを飛ばしたのか、である。
フリートにとって重要な単位で示す料金表
Grok 4.6は、2026年8月12日にxAIのフロンティアティアとしてリリースされた。500,000トークンのコンテキストウィンドウ、テキスト・画像・ファイル入力、構成可能な推論エフォート、ネイティブツール呼び出し、構造化出力、そしてindex v4.3.2におけるArtificial Analysis Intelligence Index 44を備える——同じインデックスでGPT-5.6 Solは47、Kimi K3は44だ。Artificial AnalysisはGPQA Diamondで94.9と評価しており、xAIが自社の開発者ドキュメントで「Latest」として掲載しているモデルでもある。これはファーストクラスのOpenAI Responsesモデルとして提供されており、そこが実用的なポイントだ。エージェントフレームワークは、アダプターを書くのではなくベースURLを変更するだけでこれを採用できる。
しかし興味深い数字は、$2/$6とコンテキストウィンドウの組み合わせです。長期的なエージェントループは厄介なワークロードです — エージェントごとに1時間あたり数万トークンの蓄積されたツール出力、そのほとんどが冗長です。Grok 4.6のキャッシュ読み取りレートは100万トークンあたり$0.50で、入力価格の4分の1です。これにより、1000エージェントの実行が単に可能というだけでなく、算数的に妥当になります。段階の境界に注意してください。200Kトークンを超えるプロンプトは基本料金の2倍で請求されるため、長い履歴を成長させるエージェントは、自らのコストを静かに2倍にします。
• 価格 — Agora-2 は公開価格なし、ブラウザプレビューのみ 対 Grok 4.6 は 1M あたり $2.00/$6.00、キャッシュ読み取り $0.50、200K 入力超で 2 倍
• コンテキスト — Agora-2 の共有状態+ビューごとの有界な履歴 対 Grok 4.6 の 500,000 トークン
• 独立スコア — Agora-2 は公開なし、Grok 4.6 は AA Intelligence Index 44(v4.3.2)
• 推論 — Agora-2 は該当なし、言語モデルではない。Grok 4.6 の設定可能なエフォート、ネイティブツール呼び出しと比較
• アクセス — Agora-2はプレイアブルなプレビュー、APIなし、重みなし vs Grok 4.6はプロプライエタリAPI
• ハードウェア — Agora-2 は4つの同時ビュー用に RTX PRO 4500 GPU を4基搭載、対する Grok 4.6 はホスト型エンドポイント

なぜOdysseyはLLMをアリーナに入れなかったのか
16体のAIエージェントが4人の人間と戦う世界を構築しているなら、明白な近道は、有能なテキストモデルを制御系に接続してプレイさせることだ。Odysseyはそうしなかった。その技術レポートは、構成表の中でその理由を説明している。Agora-2のエージェントポリシーは、16個の観測からなる履歴を消費する再帰型スカラー・空間ポリシーであり、14個の離散移動ブランチにわたって4シミュレーション・ティックごとに行動を出力する。シミュレーション自体は30 Hzのティック時間基準で進む。部分的に観測されたビューから、固定された低レベル行動語彙を用いて、1秒に30回意思決定を行うようモデルに求めるのは、推論の問題ではなく制御の問題であり、制御の問題は、500Kコンテキストのフロンティアモデルにプロンプトを与えることではなく、小さなポリシーを訓練することで解決される。
これは明確に述べておく価値がある。ワールドモデルというカテゴリについて最もよくある誤解だからだ。Agora-2は、システム内の同じ枠をめぐってGrok 4.6と競合するのではない。それはその下の枠を占める。すなわち、ポリシーが訓練され評価される環境である。報告書のアーキテクチャはその分離について明示している——シミュレーションモデルが、組み合わされた行動が共有状態をどう変えるかを予測し、ワールドサーバーがそれらを適用し、ビューごとのレンダリングモデルがその状態から各参加者自身の640×480の視点を生成する。テキストモデルはインタラクションループのどこにも登場しない。

Grok 4.6のようなモデルが実際に現れるのは、一段上のレベルにおいてだ。すなわち、評価用のスキャフォールドを書き、トランスクリプトを分析し、あるいは、あなたがその振る舞いを研究しようとしているツール使用エージェントを駆動するものとしてである。まさにそれが、METRの調査でGPT-5.6 Solが果たした役割——フリートの約5%、そしてログを読むアナリスト——であり、Grok 4.6の価格とコンテキストウィンドウによって安価になる役割でもある。
ここでは、こうした対決のほとんどよりも証拠の隔たりが大きい
Grok 4.6 のインデックススコアは独立に測定され、その料金表は公開され、そのコンテキストウィンドウは文書化されている。Agora-2 の数値は、Team Odyssey が執筆し、誰にも再現されていないレポートに由来する。30 本のモニタリングクリップ上で、その構造化プレフィックスレンダラーは VAE ベースラインの 20.67 dB に対して 30.11 dB PSNR に達する——これは、レポート自体が、孤立したアーキテクチャテストではなく、トレーニング予算が一致していない完全なシステム間の比較であると注意を促している比較である。そのコンディショニングベンチマークは、クロスアテンションに対する 45.8% のデノイザー時間削減を示しているが、合成入力上でランダムに初期化されたデノイザーを使用し、実行コストを測定しており、画質を測定しているわけではない。
次に、異例なほど率直な限界のセクション。記載されている毎秒15回の潜在更新と30フレームの表示は目標値である。ライブのマルチエージェント相互作用中における持続的なフレームレートと入力から表示までのレイテンシは「定量的に評価されていない」。長期的な視覚品質、視点間の一致、エンドツーエンドの行動準拠はいずれも未評価として挙げられている。この環境には、明示的な幾何形状と固定された外観語彙を備えた計測可能なゲームエンジンが必要であり、新しいアセット、ルール、環境への転移は未検証である。Agora-2に関する見出しの数字を読む前に、このリストを読んでほしい。
あなたのスタックに属するのはどれですか
今日マルチエージェントシステムを運用または研究しているなら、Grok 4.6 は実際にデプロイできるコンポーネントだ — 大規模なエージェントフリートを手頃な価格にする料金で提供されるフロンティアクラスのテキストモデルであり、公開されたスコアと文書化された API サーフェスを備えている。OrcaRouter では、xAI 自身の定価のままマークアップゼロで提供されているため、上記の $2/$6 や今後の料金改定は、それが起きた当日に請求に反映され、プライマリエンドポイントが劣化した場合の自動フェイルオーバーも備えている。どちらの事実も、特にフリートワークロードにとって重要だ。エージェントが千台あれば、劣化したプロバイダーに当たる機会も千回あり、$6 の出力に上乗せするマークアップは、実行全体の分だけ掛け算されるマークアップになる。

Agora-2はデプロイ可能なインフラではなく、私たちがホストしているものでもない——APIも重みも価格もなく、あるのはOdyssey自身のプレイアブルなプレビューだけだ。それが提供するのは別種の価値である。METRの報告書が今や緊急だと示しているインタラクション研究のための制御された環境を、APIの請求ではなく、4つの同時ビューに対して4基のRTX PRO 4500 GPUというコストで実現する。正直な結論を言えば、この2つは競合しない。Grok 4.6は今日トークン単位で購入できるポリシー・ブレインであり、Agora-2はそうしたブレインが何千も出会ったときに何が起きるかをテストする場所についての提案だ。後者はより興味深い研究であり、より未完成な製品でもあり、Odyssey自身の報告書はそのどの部分がまだ目標にすぎないかについて、清々しいほど明確である。
この記事で比較したモデル1
この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新
