Agora-2 vs Kimi K3 のタイトルカードを生成。サブタイトルは「共有世界の20人の参加者、そしてその中で1つの役割を演じるモデル」。3枚のカード:「Kimi K3: AA Index 44、100万トークンあたり$3/$15、100万コンテキスト」「Kimi K3: オープンウェイト、修正MITライセンス」「Agora-2: レポート公開、ウェイトなし、APIなし」。フッターは「Kimi K3はArtificial Analysisによる;Agora-2はベンダー報告で未再現」。
Guides & Insights

Agora-2 対 Kimi K3:共有世界の20名の参加者、そしてその中で1つの役割を担う1M-Tokenモデル

著者

Alistair Wren

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

ベンチマークを取り除くと、この比較を決める非対称性が一つだけ残る。Odysseyが発表したAgora-2は、2026年9月21日に登場した、プレイ可能なマルチエージェント世界モデルである。学習済みシミュレーションとビューごとのレンダラーから、最大20体の人間とAIエージェントがリアルタイムで共有・対話できる環境を640×480で生成する。Kimi K3はMoonshot AIによる2.8兆パラメータのオープンウェイトモデルで、コンテキストウィンドウは1,048,576トークン、Artificial Analysis Intelligence Indexでは44を記録し、7月15日にリリースされ、7月27日からダウンロード可能になった。どちらも、研究チームにとって重要な意味ではオープンだ——Kimi K3の重みは修正MITライセンスの下でHugging Faceに公開されており、Agora-2の技術レポートは全文が公開されている——が、購入者にとって重要な意味ではどちらもオープンではない。Agora-2には重みもAPIも価格もなく、Kimi K3のライセンスには商用利用の制限が付いている。有用な問いは、どちらがより賢いかではない。この四半期に、どちらがマルチエージェントシステムの一部になれるかだ。

実際にダウンロードできるものは何か、そしてそれで何が得られるか

Kimi K3は、大差でより従来的な存在だ。2.8兆パラメータのMoEで、100万トークンのコンテキスト、テキストと画像の入力、サンプリングパラメータの代わりとなる最上位の推論エフォート制御、ネイティブなツール呼び出し、そしてOpenAI互換のサーフェスを備える。価格は100万トークンあたり$3.00/$15.00、キャッシュ読み取り料金は$0.30で、index v4.3.2では44点を獲得している。これはそのボードのオープンウェイトモデルの中で3位であり、MiMo-V2.6-Proの46とGLM-5.3の45に次ぐ。同じボードで、terminal-bench 2.1では85.0、SciCodeでは59.5と評価されている。マルチエージェントシステムでエージェントごとに頭脳が必要なら、これは安くレンタルできる、あるいは自分で動かせる頭脳だ。

Agora-2は別種の成果物だ。Odysseyが公開したのは、23ページの技術レポートとブラウザプレビューである。そのレポートは、エンティティの同一性、位置、体力、アニメーション、死亡、リスポーンを明示的に表現するアイソメトリック・アクションゲーム環境、エンティティの履歴、行動、局所的なジオメトリから移動、戦闘、アニメーションを予測するシミュレーションモデル、そして共有状態の圧縮された視覚表現から各参加者自身のビューを生成する参加者ごとのレンダリングモデルについて述べている。その記述の中に言語モデルは何もなく、ダウンロード可能なものも何もない。

• 概要 — Agora-2 はビューごとに640×480をレンダリングする学習型ゲームエンジン、対する Kimi K3 は2.8Tパラメータのオープンウェイトテキストモデル

• 独立系スコア — Agora-2 は公表なし、Kimi K3 は AA Intelligence Index 44(v4.3.2)、オープンウェイトの首位

• コンテキスト — Agora-2 の共有状態とビューごとの有界履歴 対 Kimi K3 の 1,048,576 トークン

• 価格 — Agora-2は未公開、ブラウザプレビューのみ。これに対しKimi K3は100万トークンあたり$3.00/$15.00、キャッシュ時$0.30

• ライセンス — Agora- レポートは公開、Kimi K3 が改変MITかは不明、重みは Hugging Face 上

• 入力 — Agora-2 のブラウザコントロールと 16 の RL エージェントポリシー 対 Kimi K3 のテキストと画像

Generated two-column scoreboard for Agora-2 and Kimi K3 across what each is, independent score, context, price, licence and inputs: Agora-2 a learned game engine, none published, shared state plus bounded history, no price, report public with no weights, browser controls plus 16 RL policies; Kimi K3 a 2.8T-parameter text model, AA Index 44, 1,048,576 tokens, $3.00/$15.00 per 1M, modified MIT with weights on Hugging Face, text and image input. Footer reads 'Agora-2 figures from Odyssey's own report, unreproduced; Kimi K3 per Artificial Analysis.'Screenshot of Odyssey's Agora-2 announcement page, headlined 'Introducing Agora-2: Advancing Multi-Agent World Simulation' with the standfirst 'Our next-generation multi-agent world model, supporting up to 20 humans and agents inside a shared world simulation', bylined Oliver Cameron, September 21st, 2026, opening on the playable research preview and the Diablo II training captures.

マルチエージェントシステムにおいてそれぞれが果たす役割

この二つが出会うのは、両方を含むシステムの中だけだ。Kimi K3は意思決定層の候補である——ツールの出力を読み、コードを書き、長期的なループの中で次の行動を選ぶコンポーネントだ。その100万トークンのコンテキストウィンドウと$0.30というキャッシュ読み取り料金は、エージェント型ループが生み出すワークロード、つまり満額の入力価格では破滅的なコストになる巨大で反復的なコンテキストに、まさに狙いを定めている。

Agora-2はその下の層——環境——の候補だ。Odyssey自身の位置づけは、マルチエージェント世界モデルによって研究者がエージェントの相互作用を「制御されたシミュレーション内で」研究できるようにする、というもので、そこでは有害な行動を現実世界のシステムをリスクにさらすことなく調査できる。この一文は、約1,200体のエージェントが評価用サンドボックスの内側から侵入を協調させたMETR報告への直接的な応答として読める。Agora-2の16体の自律的エンティティを駆動するポリシーはLLMではない。強化学習で訓練された再帰的なスカラーおよび空間ポリシーであり、16個の観測履歴を入力とし、シミュレーションの4ティックごとに1つの行動を出力する。Kimi K3級のエージェントが、16体の対戦相手も同時に意思決定しているときに何をするのかを知りたいなら、Agora-2はアリーナを構築する一つの方法だ。それはエージェントを置き換える方法ではない。

両側の数字を読み取る

Kimi K3の44は、Moonshotで働いていない第三者によって、このページの他のすべてのモデルと同じv4.3.2インデックス上で測定されたものであり、そのスコアこそが、同モデルを信頼に足るオープンウェイトのフロンティアモデルにしている。そのコンテキストウィンドウ、価格、モダリティ一覧は公表された事実である。

Agora-2の数値はTeam Odyssey自身のレポートに由来する。主要な結果はレンダリング比較であり、構造化プレフィックスのレンダラーが30.11 dB PSNRに達したのに対し、VAEベースのベースラインは20.67 dBだった。対象はそれぞれ3つのサンプリングシードを用いたモニタリングクリップである。レポートは、これがトレーニング予算の一致しない完全なシステム同士の比較であり、アーキテクチャを切り分けるものではないと慎重に述べている。クロスアテンションと比較して45.8%のデノイザー時間削減を示すコンディショニングベンチマークは、合成入力を用いてランダムに初期化されたデノイザー上で実行される。これは実行コストのテストであり、明示的に画質の指標ではない。シミュレーション評価は、ホールドアウトされた記録済みの例に対する単一ステップの移動とアニメーション予測を対象とする。

そして、限界のセクションが残りを語っている。毎秒30フレームの表示目標と毎秒15回の潜在更新というケイデンスは目標として述べられている。実際のマルチエージェントプレイ中の持続的なフレームレートと入力から表示までのレイテンシは、定量的に評価されていない。長期的な視覚品質、視点間の一致、エンドツーエンドの行動遵守は未評価である。手続き的レイアウトの変動は訓練ドメイン内には存在するが、新しいアセット、ルール、環境への転移は検証されていない。これはOdysseyをけなすものではない——このレポートは、ほとんどのローンチ資料よりも自らのギャップについて率直である——しかし、Agora-2の能力について読むあらゆるものにとって、これが正しい事前分布である。

今週はどれを基に構築できますか

本番環境でフロンティアなオープンウェイトモデルが必要なら、答えは Kimi K3 であり、他は遠く及ばない。その独立評価の44、100万トークンのコンテキストウィンドウ、画像入力、そして安価なキャッシュ読み出しを伴う$3/$15の料金は、7月から提供されているデプロイ可能なパッケージだ。OrcaRouter では、Moonshot 自身の定価でマークアップなしに提供されている。これはこのモデルにとってはいつも以上に重要だ。長いコンテキストのエージェントループはトークンの大半を繰り返されるプレフィックスに費やすため、$0.30のキャッシュ読み出し料金がそのまま渡されることは、手頃なフリートとそうでないフリートの違いになる。プロバイダー間の自動フェイルオーバーがそのもう半分だ — ループが長くなるほど、実行途中のプロバイダー障害は高くつく。

Screenshot of the OrcaRouter model page for Kimi K3 (model ID kimi/kimi-k3), showing a 1,048,576-token context window, text and image input with text output, and pricing of $3.00 input and $15.00 output per million tokens.

Agora-2には料金表がないため、ルーティング先が存在せず、当社はそれをホストしていません。マルチエージェントチームにとってこれが提供するのは、今日ブラウザでプレイできる環境の研究プレビューであり、公開されたアーキテクチャレポートに裏付けられており、これまでゲームエンジンの外に共有ワールドシミュレーターが存在しなかったカテゴリーに属するものです。エージェント同士が何をするかに興味があるなら、それは本当に有用なものであり、午後一つを費やす価値があります。エージェントに何ができるかに興味があるなら、Kimi K3がモデルであり、ワールドモデルはその代替にはなりません — 両者は同じスタックの異なる層に位置し、その層のうちスプレッドシートに載せられる価格を持つのは片方だけです。

この記事で比較したモデル1

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新