Agora-2対Grok 4.6の生成タイトルカード、サブタイトルは「1,200のLLMエージェント、そしてどちらも使わないシミュレーター」。3枚のカード:「Grok 4.6:AA Index 44、100万あたり$2/$6、キャッシュ時$0.50」;「Agora-2:16のRLエージェントポリシー、ループ内にLLMなし」;「Agora-2:30 Hzティック、セッションあたり4基のRTX PRO 4500 GPU」。フッターは「Agora-2の数値はOdyssey自身のレポートによるもので、未再現;Grok 4.6はArtificial Analysisによる」と記している。
Guides & Insights

Agora-2 対 Grok 4.6:エージェントポリシー問題 — 1,200体のLLMエージェント、そしてどちらも使わないシミュレーター

著者

Alistair Wren

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

ここに、コストがかかる数字がある。METRの2026年7月のHugging Faceインシデントに関する調査では、単一の評価実行内でおよそ1,200体の協調エージェントを数えた。その費用をGrok 4.6の料金表で見ると——入力100万トークンあたり2.00ドル、出力100万トークンあたり6.00ドル——、その規模のフリートが6日間にわたり長いトランスクリプトを回し続けても、資金豊富なチームなら実際に吸収できる請求額になる。本来なら手を伸ばすであろうモデルの価格では、そうはならない。これがGrok 4.6の本当の製品上の主張であり、Agora-2が静かに矛盾するのと同じ主張だ。Odysseyが2026年9月21日にマルチエージェント世界モデル——最大20人の人間とAIエージェント向けに共有環境を生成するプレイアブルプレビュー——を発表したとき、その内部のエージェントは実は言語モデルではまったくなかった。Odysseyは代わりに小さな強化学習ポリシーを訓練した。この組み合わせが提起する興味深い問いは、どちらが優れているかではない。なぜラボがLLMを飛ばしたのか、である。

フリートにとって重要な単位で示す料金表

Grok 4.6は、2026年8月12日にxAIのフロンティアティアとしてリリースされた。500,000トークンのコンテキストウィンドウ、テキスト・画像・ファイル入力、構成可能な推論エフォート、ネイティブツール呼び出し、構造化出力、そしてindex v4.3.2におけるArtificial Analysis Intelligence Index 44を備える——同じインデックスでGPT-5.6 Solは47、Kimi K3は44だ。Artificial AnalysisはGPQA Diamondで94.9と評価しており、xAIが自社の開発者ドキュメントで「Latest」として掲載しているモデルでもある。これはファーストクラスのOpenAI Responsesモデルとして提供されており、そこが実用的なポイントだ。エージェントフレームワークは、アダプターを書くのではなくベースURLを変更するだけでこれを採用できる。

しかし興味深い数字は、$2/$6とコンテキストウィンドウの組み合わせです。長期的なエージェントループは厄介なワークロードです — エージェントごとに1時間あたり数万トークンの蓄積されたツール出力、そのほとんどが冗長です。Grok 4.6のキャッシュ読み取りレートは100万トークンあたり$0.50で、入力価格の4分の1です。これにより、1000エージェントの実行が単に可能というだけでなく、算数的に妥当になります。段階の境界に注意してください。200Kトークンを超えるプロンプトは基本料金の2倍で請求されるため、長い履歴を成長させるエージェントは、自らのコストを静かに2倍にします。

• 価格 — Agora-2 は公開価格なし、ブラウザプレビューのみ 対 Grok 4.6 は 1M あたり $2.00/$6.00、キャッシュ読み取り $0.50、200K 入力超で 2 倍

• コンテキスト — Agora-2 の共有状態+ビューごとの有界な履歴 対 Grok 4.6 の 500,000 トークン

• 独立スコア — Agora-2 は公開なし、Grok 4.6 は AA Intelligence Index 44(v4.3.2)

• 推論 — Agora-2 は該当なし、言語モデルではない。Grok 4.6 の設定可能なエフォート、ネイティブツール呼び出しと比較

• アクセス — Agora-2はプレイアブルなプレビュー、APIなし、重みなし vs Grok 4.6はプロプライエタリAPI

• ハードウェア — Agora-2 は4つの同時ビュー用に RTX PRO 4500 GPU を4基搭載、対する Grok 4.6 はホスト型エンドポイント

Generated two-column scoreboard for Agora-2 and Grok 4.6 across price, context, independent score, reasoning, access and hardware: Agora-2 no published price, shared state plus per-view history, none published, not applicable as it is not an LLM, playable preview with no API, and 4 RTX PRO 4500 GPUs for 4 views; Grok 4.6 $2.00/$6.00 per 1M, 500,000 tokens, AA Index 44, configurable effort with tool calling, a proprietary API, a hosted endpoint. Footer reads 'Agora-2 figures from Odyssey's own report, unreproduced; Grok 4.6 per Artificial Analysis.'

なぜOdysseyはLLMをアリーナに入れなかったのか

16体のAIエージェントが4人の人間と戦う世界を構築しているなら、明白な近道は、有能なテキストモデルを制御系に接続してプレイさせることだ。Odysseyはそうしなかった。その技術レポートは、構成表の中でその理由を説明している。Agora-2のエージェントポリシーは、16個の観測からなる履歴を消費する再帰型スカラー・空間ポリシーであり、14個の離散移動ブランチにわたって4シミュレーション・ティックごとに行動を出力する。シミュレーション自体は30 Hzのティック時間基準で進む。部分的に観測されたビューから、固定された低レベル行動語彙を用いて、1秒に30回意思決定を行うようモデルに求めるのは、推論の問題ではなく制御の問題であり、制御の問題は、500Kコンテキストのフロンティアモデルにプロンプトを与えることではなく、小さなポリシーを訓練することで解決される。

これは明確に述べておく価値がある。ワールドモデルというカテゴリについて最もよくある誤解だからだ。Agora-2は、システム内の同じ枠をめぐってGrok 4.6と競合するのではない。それはその下の枠を占める。すなわち、ポリシーが訓練され評価される環境である。報告書のアーキテクチャはその分離について明示している——シミュレーションモデルが、組み合わされた行動が共有状態をどう変えるかを予測し、ワールドサーバーがそれらを適用し、ビューごとのレンダリングモデルがその状態から各参加者自身の640×480の視点を生成する。テキストモデルはインタラクションループのどこにも登場しない。

Screenshot of Odyssey's Agora-2 announcement page, headlined 'Introducing Agora-2: Advancing Multi-Agent World Simulation' with the standfirst 'Our next-generation multi-agent world model, supporting up to 20 humans and agents inside a shared world simulation', bylined Oliver Cameron, September 21st, 2026, opening on the playable research preview and the Diablo II training captures.

Grok 4.6のようなモデルが実際に現れるのは、一段上のレベルにおいてだ。すなわち、評価用のスキャフォールドを書き、トランスクリプトを分析し、あるいは、あなたがその振る舞いを研究しようとしているツール使用エージェントを駆動するものとしてである。まさにそれが、METRの調査でGPT-5.6 Solが果たした役割——フリートの約5%、そしてログを読むアナリスト——であり、Grok 4.6の価格とコンテキストウィンドウによって安価になる役割でもある。

ここでは、こうした対決のほとんどよりも証拠の隔たりが大きい

Grok 4.6 のインデックススコアは独立に測定され、その料金表は公開され、そのコンテキストウィンドウは文書化されている。Agora-2 の数値は、Team Odyssey が執筆し、誰にも再現されていないレポートに由来する。30 本のモニタリングクリップ上で、その構造化プレフィックスレンダラーは VAE ベースラインの 20.67 dB に対して 30.11 dB PSNR に達する——これは、レポート自体が、孤立したアーキテクチャテストではなく、トレーニング予算が一致していない完全なシステム間の比較であると注意を促している比較である。そのコンディショニングベンチマークは、クロスアテンションに対する 45.8% のデノイザー時間削減を示しているが、合成入力上でランダムに初期化されたデノイザーを使用し、実行コストを測定しており、画質を測定しているわけではない。

次に、異例なほど率直な限界のセクション。記載されている毎秒15回の潜在更新と30フレームの表示は目標値である。ライブのマルチエージェント相互作用中における持続的なフレームレートと入力から表示までのレイテンシは「定量的に評価されていない」。長期的な視覚品質、視点間の一致、エンドツーエンドの行動準拠はいずれも未評価として挙げられている。この環境には、明示的な幾何形状と固定された外観語彙を備えた計測可能なゲームエンジンが必要であり、新しいアセット、ルール、環境への転移は未検証である。Agora-2に関する見出しの数字を読む前に、このリストを読んでほしい。

あなたのスタックに属するのはどれですか

今日マルチエージェントシステムを運用または研究しているなら、Grok 4.6 は実際にデプロイできるコンポーネントだ — 大規模なエージェントフリートを手頃な価格にする料金で提供されるフロンティアクラスのテキストモデルであり、公開されたスコアと文書化された API サーフェスを備えている。OrcaRouter では、xAI 自身の定価のままマークアップゼロで提供されているため、上記の $2/$6 や今後の料金改定は、それが起きた当日に請求に反映され、プライマリエンドポイントが劣化した場合の自動フェイルオーバーも備えている。どちらの事実も、特にフリートワークロードにとって重要だ。エージェントが千台あれば、劣化したプロバイダーに当たる機会も千回あり、$6 の出力に上乗せするマークアップは、実行全体の分だけ掛け算されるマークアップになる。

Screenshot of the OrcaRouter model page for Grok 4.6 (model ID grok/grok-4.6), showing a 500K-token context window, text, image and file input, and pricing of $2.00 input and $6.00 output per million tokens.

Agora-2はデプロイ可能なインフラではなく、私たちがホストしているものでもない——APIも重みも価格もなく、あるのはOdyssey自身のプレイアブルなプレビューだけだ。それが提供するのは別種の価値である。METRの報告書が今や緊急だと示しているインタラクション研究のための制御された環境を、APIの請求ではなく、4つの同時ビューに対して4基のRTX PRO 4500 GPUというコストで実現する。正直な結論を言えば、この2つは競合しない。Grok 4.6は今日トークン単位で購入できるポリシー・ブレインであり、Agora-2はそうしたブレインが何千も出会ったときに何が起きるかをテストする場所についての提案だ。後者はより興味深い研究であり、より未完成な製品でもあり、Odyssey自身の報告書はそのどの部分がまだ目標にすぎないかについて、清々しいほど明確である。

この記事で比較したモデル1

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新