Agora-2 対 MiniMax M3 の生成タイトルカード。サブタイトルは「参加者ごとに GPU 1 台、または 100 万トークンあたり 13 セント」。カードは 3 枚:「MiniMax M3:100 万トークンあたり $0.30/$1.20、キャッシュ済み $0.06」、「MiniMax M3:AA Index 29、1M コンテキスト、オープンウェイト」、「Agora-2:ビューごとに RTX PRO 4500 1 台、公開価格なし」。フッターには「MiniMax M3 は Artificial Analysis によるもの、Agora-2 はベンダー報告であり未再現」とある。
Guides & Insights

Agora-2 対 MiniMax M3:参加者1人につきGPU 1基、それとも100万トークンあたり13セント

著者

Magnus Corvin

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

エージェントの群れを動かす2つの方法、それぞれ異なる通貨で値付けされている。MiniMax M3は、入力トークン100万あたり$0.30、出力100万あたり$1.20かかる — この料金なら、1000エージェントの実験は資金調達ラウンドではなく、経費の一行になる。Agora-2、すなわちマルチエージェント世界モデルOdysseyが2026年9月21日に予告したものは、参加者ビュー1つにつきNVIDIA RTX PRO 4500を1台消費する:4人プレイヤーのセッションは4台のGPUで動作し、カードごとに1つのレンダリングモデルがそのプレイヤーの640×480の視点を生成し、その4枚のうち1枚は共有シミュレーションと16の自律エージェントポリシーも担う。MiniMax M3の数値はトークンあたりで、エージェントがどれだけ考えるかに応じてスケールする。Agora-2の数値は視聴者1人あたりで、世界に同時に入れる参加者の数に応じてスケールする。これらを比較することは、推論予算とレンダリング予算を比較することであり、2026年にマルチエージェント研究を計画している人にとって、それは結局のところ有用なことだ。

台帳のトークン側

MiniMax M3は、MiniMaxのオープンウェイトのフラッグシップモデルで、2026年5月31日にリリースされた。4280億パラメータのスパースなMixture-of-Expertsであり、トークンあたり約230億パラメータがアクティブとなる。コンテキストウィンドウは1,048,576トークンで、うちMiniMaxが保証するのは512Kの使用可能分。入力はテキスト、画像、動画に対応し、Artificial Analysis Intelligence Index v4.3.2では29のスコアを記録している。ベンダー公表値ではBrowseCompで83.5、BankerToolBenchで76.1を報告している——これらはMiniMax自身の数値であり、本記事では再現していない——またArtificial Analysisは毎秒145出力トークンと測定しており、同ボードでは10番目に速いモデルである。

ただし、エージェントフリートにとって重要な数値はキャッシュ読み取りレートだ。キャッシュされたトークン100万個あたり0.06ドルで、入力価格の5分の1にあたる。エージェントループはプレフィックスが支配的である——同じシステムプロンプト、同じツールスキーマ、同じ蓄積される履歴が毎ターン再送される——ため、ループの実効コストは、そのトークンの大半について、0.30ドルよりも0.06ドルにはるかに近い。この算術が、METRがOpenAIの2026年7月のExploitGym評価内で記録したような1,200エージェントの実行を、研究グループが単に読むだけでなく実際に再現できるものにするのである。

台帳のGPU側

Agora-2のコスト構造は、それ自体の実装付録で開示されており、清々しいほど具体的だ。ビュー1つにつきRTX PRO 4500 Blackwell Server Editionを1枚。4人プレイのセッションには4枚。これらのカードは各参加者のビューを、640×480で毎秒15回の潜在更新と毎秒30フレームの表示という目標で生成し、シミュレーションは30 Hzのティックで進む。報告書はまた、周辺作業の学習規模も示している。32基のB200 GPUにまたがる実効グローバルバッチは128だ。

MiniMax M3 と同じ単位に換算すると、それは同時参加者1人につきデータセンターGPU 1基、加えて共有シミュレーションがそのうちの1基に相乗りして動くということだ。これは固定費であり、エージェントがどれだけ長く熟考しても影響を受けず、沈黙しても下がらない。そこから二つの帰結が導かれ、それらは逆方向を指している。参加者数が少なく、エージェントごとの推論が重い場合、トークンモデルの方が明らかに安い——思考に数セントを払い、部屋にいる2人目のエージェントには何も払わない。参加者数が多く、相互作用が密な場合、算術は逆転する。共有世界に同時参加者が20人いればGPUは20基であり、この数は各参加者が費やすトークン数に応じて増えるものではない。

• コスト単位 — Agora-2 は参加者ビューあたり RTX PRO 4500 1台、MiniMax M3 は 100万トークンあたり $0.30/$1.20

• キャッシュ読み取り — Agora-2 は該当なし、トークン課金なし(MiniMax M3 のキャッシュ1Mあたり $0.06 に対して)

• 独立系スコア — Agora-2 は未公開 vs MiniMax M3 AA Intelligence Index 29(v4.3.2)

• コンテキスト — Agora-2 の共有状態 + ビュー単位で上限付きの履歴 対 MiniMax M3 の 1,048,576 トークン、512K 保証

• 出力 — Agora-2 の 640×480 ビデオ(目標 30 fps)対 MiniMax M3 テキスト

• アクセス — Agora-2 ブラウザプレビュー、API なし、重みなし 対 MiniMax M3 オープンウェイト、コミュニティライセンス、API

Generated two-column scoreboard for Agora-2 and MiniMax M3 on unit of cost, cache reads, independent score, context, output and access: Agora-2 one RTX PRO 4500 per view, cache reads not applicable, none published, shared state plus bounded history, 640x480 video at a 30 fps target, browser preview with no API or weights; MiniMax M3 $0.30/$1.20 per 1M tokens, $0.06 per 1M cached, AA Index 29, 1,048,576 tokens with 512K guaranteed, text output, open weights under a community licence with an API. Footer reads 'MiniMax M3 per Artificial Analysis; Agora-2 figures vendor-reported and unreproduced.'Screenshot of Odyssey's Agora-2 announcement page, headlined 'Introducing Agora-2: Advancing Multi-Agent World Simulation' with the standfirst 'Our next-generation multi-agent world model, supporting up to 20 humans and agents inside a shared world simulation', bylined Oliver Cameron, September 21st, 2026, opening on the playable research preview and the Diablo II training captures.

なぜ2つのコストは代替にならないのか

これを二者択一として読むのは誘惑に駆られるが、そうではない。MiniMax M3はポリシー脳だ。部分的に観測された状況を読み、推論し、ツールを呼び出し、行動を出力する。Agora-2は、行動が他の参加者に見える結果をもたらす環境である——行動の組み合わせが共有状態をどう変えるかを予測するシミュレーションモデル、それを適用するワールドサーバー、そして各参加者が同じ世界をそれぞれの視点から見られるようにするビューごとのレンダラーからなる。Odysseyの16の自律エンティティは、いかなる言語モデルにも駆動されていない。それらは強化学習で訓練された再帰的スカラーおよび空間ポリシーであり、16観測の履歴を消費し、4シミュレーションティックごとに行動する。その設計上の選択が、その証拠である。毎秒30ティックでは、何をすべきかの決定は制御問題であり、制御問題はAPIを呼び出すことではなく、小さなポリシーを訓練することによって解かれる。

マルチエージェント作業を計画しているチームにとって正直な整理は、これらは異なるレイヤーに存在し、それぞれに予算が必要だということだ。推論レイヤーは安価で伸縮自在であり、選定の対象にできる。環境レイヤーは、ゲームエンジン以外を求めるなら、現時点では研究プレビューであり、GPUを前提としたリソース規模を持ち、公開APIはない。どちらの事実も新しすぎる — M3は5月以来、Agora-2は9月以来 — そのため、この組み合わせのコストモデルをまだほとんど誰も持っていない。

何が検証済みで、何がターゲットなのか

MiniMax M3 の独立スコア、コンテキストウィンドウ、モダリティ、価格は公表された事実であり、今日確認できます。BrowseComp と BankerToolBench の数値はベンダーによる報告であり、引用する際は常にその旨を明記すべきです。

Agora-2の数値は完全にTeam Odysseyの技術報告書に由来し、社外の誰によっても再現されていない。そのレンダリング結果——30本の監視クリップにおいて、構造化プレフィックスレンダラーが30.11 dB PSNR、VAEベースラインが20.67 dB——は、報告書自体が指摘するように、学習予算が揃っていない完全なシステム同士の比較である。クロスアテンションに対するデノイザー時間の45.8%削減は、合成入力上のランダムに初期化されたデノイザーによるもので、画質ではなく実行コストを測定している。そして限界セクションは、毎秒15更新および毎秒30フレームのレートが目標であること、ライブのマルチエージェント相互作用中の持続フレームレートと入力から表示までの遅延が「定量的に評価されていない」こと、長期的な視覚品質、クロスビュー一致、エンドツーエンドの行動遵守が未評価のままであること、環境には明示的な幾何学と固定された外観語彙を備えた計装エンジンが必要であること、学習ドメインを超えた転移が未検証であることを明記している。ビューあたり1 GPUでコストモデルを構築する人は、まずそのセクションを読むべきである。GPUあたりのスループットこそが、まさに測定されていないものだからである。

その電話

エージェントフリート——多数のモデル、長いループ、ツール呼び出し、レンダリングなし——を構築しているなら、MiniMax M3 はそれを大規模に実行するための最も安価で信頼できる方法であり、請求額を決めるのはキャッシュ読み取りレートです。OrcaRouter 上では MiniMax 自身の定価で、マークアップゼロでルーティングされるため、0.06ドルのキャッシュ済みレートがそのまま支払額となり、実行中にエンドポイントが劣化した場合のプロバイダー間フェイルオーバーも利用できます。特にフリートでは、パススルーがいつも以上に重要です:キャッシュ済みトークンに対する再販業者のマージンは、すべてのエージェントの各ターンごとに掛け算されるマージンだからです。

Screenshot of the OrcaRouter model page for MiniMax M3 (model ID minimax/minimax-m3), showing a 1,048,576-token context window, 512K maximum output, text, image and video input, and pricing of $0.30 input and $1.20 output per million tokens.

Agora-2はルーティングして使えるものではない — APIも価格も重みもなく、あるのはOdysseyのブラウザプレビューだけで、当社はそれをホストしていない。それが何かというと、多くの参加者——人間と合成の両方——が制御された条件下で相互作用する様子を観察できるように、専用に設計された初の共有世界シミュレーターであり、その基盤にあるレポートは、現時点で製品からどれほど遠いかについて異例なほど率直だ。大量の推論が課題なら、MiniMax M3は今すぐ利用でき、しかも安価だ。一千体のそうした推論エージェントが1つの世界を共有したら何が起きるかが課題なら、Odysseyはアリーナを建て、難しい測定は誰か他の者が実行するために残した。