
Agora-2 対 Qwen 3.8 Max:一方のモデルは動画を視聴し、もう一方は動画を生成する
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100万トークンあたり · 36 tok/s
- openaiNEWOpenAI: GPT-6 Luna2026-09-2237知能
- openaiNEWOpenAI: GPT-6 Sol2026-09-2248知能
- anthropicNEWAnthropic: Claude Opus 5.52026-09-2258知能
- grokNEWGrok 4.72026-09-2146知能
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100万トークンあたり · 181 tok/s
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- openaiOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- googleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- anthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1244知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0540知能72コーディング
この組み合わせの中心には、見事な反転がある。Qwen3.8-Max — 同社のフラッグシップモデルで、2026年8月3日に投入され9月2日に更新、価格は100万トークンあたり$2.00/$6.00 — テキストや画像と並んで動画をネイティブに読み取り、100万トークンのコンテキストウィンドウに対応する。Agora-2、マルチエージェント世界モデルOdysseyは2026年9月21日にプレビューされ、動画を生成する。参加者ごとに640×480のストリームを生成し、毎秒15回の潜在更新を行い、最大20人の人間とエージェントが1つのシミュレーション世界を共有できる。一方はフレームを取り込んで説明するために作られ、もう一方はフレームを出力し、参加者がその中で行動できるようにするために作られている。この2つを組み合わせれば、どちらのベンダーも意図していなかったものが得られる — 実際にそれを観ることのできる言語モデルで、マルチエージェントシミュレーションを分析する方法だ。
フレームの両側
Qwen3.8-MaxはAlibabaの最高能力層であり、その最もオーソドックスな存在でもある。テキスト、画像、動画を受け入れるネイティブマルチモーダルモデルで、100万トークンのコンテキスト、131,072トークンの出力、ネイティブなツール使用、そしてindex v4.3.2におけるArtificial Analysis Intelligence Index 45を備える。8月の発表に関する以前の報道では40が引用されていたが、この数字は前のインデックス改訂によるもので、今回の数字と並べて比較すべきではない。Artificial Analysisによる測定では、terminal-bench 2.1で88.8、GPQA Diamondで92.8となっている。Alibabaは自社の移行ガイドで、これをGPT-5.5、Claude Opus 4.7、Gemini 3.1 Proに直接対抗するものとして位置づけ、利用可能な中で最も強力な推論を必要とするタスクには常にこれを推奨している。
Agora-2の仕様は、それとはほとんどまったく異なる。4つのレンダラーコンポーネントがあり、ビューごとに1つで、それぞれが幅2,048の16ブロックモデルであり、単一参加者の視点を生成する。4層・幅256のシミュレーションモデルは、4ステップのエンティティ履歴から、14個の離散的な移動分岐にわたって移動、戦闘、アニメーションを予測する。共有ワールド状態は、アイデンティティ、位置、体力、アニメーション、死亡、リスポーンを保持するため、エンティティのプロパティは特定のカメラから独立して持続する——フレーム外のエンティティは、再び現れたときに再構築されるのではなく、その位置を保つ。言語が存在しないため、コンテキストウィンドウは存在しない。これに相当する制約は、ビューごとの有界な視覚履歴であり、死亡時、リスポーン時、カメラの不連続時にリセットされる。
• 出力 — 参加者ごとに Agora-2 640×480 映像、目標 30 fps 対 Qwen3.8-Max テキスト、応答あたり最大 131,072 トークン
• 入力 — Agora-2 のブラウザコントロールと 16 の RL エージェントポリシー 対 Qwen3.8-Max のテキスト、画像、動画
• 独立系スコア — Agora-2 は未公開、Qwen3.8-Max は AA Intelligence Index 45(v4.3.2)
• 価格 — Agora-2 は未公開、プレビューのみ 対 Qwen3.8-Max は 100万あたり $2.00/$6.00、キャッシュ読み取り $0.25
• メモリ — Agora-2 の共有状態とビューごとの有界履歴 対 Qwen3.8-Max の 1,000,000 トークンコンテキスト
• アクセス — Agora-2:APIなし、重み非公開 対 Qwen3.8-Max:独自API、100万トークンのコンテキスト


動画読解モデルが共有世界シミュレータにもたらすもの
OdysseyがAgora-2を構築する根拠は、マルチエージェントの相互作用が制御された条件下で研究する価値のあるものになったという点にあり、同社は2026年7月のインシデント——評価用サンドボックス内の約1,200体のエージェントが複数日にわたる侵入を組織した——を、その理由を示す証拠として挙げている。この種の研究の難しいところは、相互作用を生成することではなく、それを解釈することにある。20人の参加者が相互作用する様子を数千フレーム出力するワールドモデルは、人間のチームには到底見切れない量の映像を生み出す。
そこが、ネイティブ動画入力を持つモデルがカテゴリーの不一致ではなくなり、コンポーネントになる地点だ。Agora-2 のセッションは、外から見れば、Qwen3.8-Max が取り込めると主張しているものそのものだ。すなわち動画であり、レポートが処理可能と確認している解像度で、エンティティの同一性、ヘルス、アニメーション状態を、モデルが明示的な共有スキーマからレンダリングしている。フレームストリームと状態ログを組み合わせれば — レポートは両方を公開しており、その図6は4つの連続するティックにおけるプレイヤーと敵の状態を、レンダリングされたフレームと並べて示している — 動画対応の推論モデルに、何が起きたのか、誰がそれを開始したのか、そして視覚的描写が記録された状態と実際に一致するのかを尋ねられるコーパスが得られる。その最後の問いは、レポートが未評価として挙げているものだ。独立に生成されたビュー間の一致と、エンドツーエンドの行動遵守は、どちらも明示的に未解決のままにされている。
100万トークンのコンテキストがもう半分だ。長時間セッションの状態ログ、ツール出力、文字起こしされた注釈がその中に収まる。これが、1回のエンカウントを分析するのと、午後いっぱいのプレイを分析するのとの実用的な違いである。
検証済みの数値が止まるところ
Qwen3.8-Maxのインデックススコア、コンテキストウィンドウ、モダリティ、料金表は公表されている事実であり、注記されている箇所は独立して測定されたものである。9月2日のアップデートは、Alibabaがこのティアの反復改善を続けていることを示唆している。
Agora-2の数値はTeam Odysseyの技術レポートに載っているもので、社外での再現はない。レポートは、30本のモニタリングクリップにおいて、構造化プレフィックスレンダラーがPSNR 30.11 dBを達成し、VAEベースラインの20.67 dBを上回ると主張している。また、クロスアテンションと比較して、構造化自己アテンション条件付けによりデノイザー時間が45.8%削減されると主張している。後者は合成入力を用いてランダムに初期化されたデノイザーで測定されたもので、レポートはこれが実行コストのベンチマークであり、画質のベンチマークではないと述べている。同レポートの限界セクションこそ、二度読むべき部分だ。15潜在更新と毎秒30フレームというレートは目標値であり、ライブのマルチエージェントプレイ中の持続的なフレームレートと入力から表示までのレイテンシは定量的に評価されていない。長期的な視覚品質とクロスビュー間の一致は未評価であり、この環境には、明示的なジオメトリと固定された外観語彙を備えた計測機構入りのエンジンが必要で、新しいアセット、ルール、環境への転移は未検証である。
そうした留保事項のうち2つは、上記で提案された組み合わせに直接かかわる。ライブプレイ中のフレームレートが測定されていないなら、動画モデルに投入することになるフレームストリームには、まだスループットの保証がない。そして、視点間の一致が評価されていないなら、興味深い分析——同じ事象が4つの視点から一貫して見えたか——こそがまさに未解決の問いであり、確定した入力ではない。この組み合わせは有望であり、まったく検証されていない。
今日使えるのはどちらですか
Qwen3.8-Maxが今すぐ導入可能です。100万トークンのコンテキストウィンドウ、ネイティブなツール利用、そして独立測定によるインデックス45を備えた、フロンティア級のマルチモーダルモデルを$2/$6で。動画やドキュメント中心の分析を行う人にとって、この価格帯でそもそもフレームを入力できる数少ないモデルのひとつであり、キャッシュ読み取り$0.25という料金が、長く反復の多いコンテキストを手頃なものにします。OrcaRouterを通せば、Alibabaの定価のままマークアップゼロで提供されます。そのためこのレートはそのまま反映され、将来の価格変更も同日に請求へ反映されます。またプライマリエンドポイントが劣化した場合の自動フェイルオーバー — 再起動にコストがかかる長いコンテキストこそが価値のすべてであるワークロードなら、備えておく価値があります。

Agora-2はOrcaRouter上にはありません。当社はそれをホストしておらず、APIも重みも存在せず、唯一の入口はOdyssey自身のブラウザプレビューです。それが提供するのは、ほとんど存在しないカテゴリの研究用成果物です。人間とRLポリシーが同じ状態に作用し、各参加者がそれぞれ生成されたビューを受け取る共有世界です。マルチエージェントシステムを構築しているなら、午後を費やす価値のある組み合わせは明白です — プレビューをプレイし、フレームと状態ログを取得し、その両方を100万トークンのマルチモーダルモデルに渡して、実際に何が起きたのかを尋ねるのです。Agora-2はあなたにアリーナを与え、難所をまだ測定していないことを認めています。Qwen3.8-Maxはそれを測定できる計器であり、アリーナがまだプレビューであるうちに$2/$6で利用できます。
