
Agora-2: Model Dunia yang Dapat Dimainkan Milik Odyssey Menjalankan 20 Peserta di Empat GPU
- typesafeBARUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 36 tok/s
- openaiBARUOpenAI: GPT-6 Luna2026-09-2237Kecerdasan
- openaiBARUOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- anthropicBARUAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- grokBARUGrok 4.72026-09-2146Kecerdasan
- OrcaBARUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 juta token · 181 tok/s
- orcaBARUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
Agora-2 menempatkan dua puluh partisipan dalam satu simulasi dan menyebutnya pratinjau riset yang dapat dimainkan. Odyssey menerbitkannya pada 21 September 2026 dalam sebuah tulisan berjudul "Memperkenalkan Agora-2: Memajukan Simulasi Dunia Multi-Agen", ditandatangani oleh Oliver Cameron, dan angka yang beredar adalah dua puluh itu. Angka yang penting adalah pembagian di dalamnya. Satu sesi mendukung hingga empat pengendali manusia yang beroperasi serentak bersama enam belas entitas otonom, dan mereka bukan jenis partisipan yang sama — empat orang yang mengetikkan perintah gerakan, enam belas kebijakan yang menjalankannya. Odyssey melatih kebijakan itu sendiri, pada tahap-tahap sebuah permainan yang juga menjadi bahan pelatihannya: makalah tersebut menyatakan bahwa dunia dipelajari dari rekaman Diablo II.
Perbedaan antara peserta yang dikendalikan dan yang disimulasikan adalah tempat di mana hampir semua hal menarik tentang Agora-2 berada. Di sinilah juga sebagian besar liputan akan mengabur, karena "20 pemain" adalah kalimat yang lebih rapi daripada "empat pemain dan enam belas agen yang telah dilatih berbagi status yang bertahan di luar layar." Yang diluncurkan Odyssey bukanlah generator video dengan multiplayer yang ditempelkan begitu saja. Ini lebih mirip server game yang fisika, animasi, dan renderingnya semuanya digantikan oleh komponen yang telah dilatih, dan yang satu-satunya sumber konten aslinya adalah kumpulan data rekaman permainan.
Dua puluh peserta adalah empat orang dan enam belas kebijakan.
Odyssey secara eksplisit menyatakan bahwa Agora-2 mendukung lima kali lebih banyak peserta daripada Agora-1 dan bahwa ia beralih dari menyimulasikan satu lingkungan menjadi menyimulasikan beberapa lingkungan dengan perilaku berhorizon lebih panjang. Bentuk per sesi terlihat seperti ini:
• Pengendali manusia — hingga 4 secara bersamaan, masing-masing memberikan input gerakan dan aksi
• Entitas otonom — {{1}}16 per sesi,{{/1}} {{2}}digerakkan oleh kebijakan monster dan pendamping yang dipelajari{{/2}} {{3}}bukan oleh pemain{{/3}}
• Total peserta — 20 dalam satu status dunia bersama, angka yang diunggulkan Odyssey
• Lingkungan — beberapa, naik dari satu lingkungan yang dapat disimulasikan Agora-1
• Dasar konten — tangkapan Diablo II, jadi dunia, aset, dan aturannya semuanya diwarisi dari satu korpus yang direkam
• Bentuk rilis — pratinjau riset yang dapat dimainkan, bukan produk, tanpa bobot, tanpa lisensi, dan tanpa harga
Enam belas otonom itu bukan sekadar hiasan. Laporan Odyssey menjelaskan pelatihan kebijakan monster dan pendamping secara terpisah, dan angka evaluasinya sangat spesifik: 23.771 contoh kebijakan monster tahap akhir yang diambil dari guru dasar ditambah data pemulihan dan retensi, serta 128.005 contoh untuk kebijakan pendamping, yang dinilai terhadap 252 episode evaluasi dan 24 kasus evaluasi secara berturut-turut. Kebijakan-kebijakan itulah yang membuat sesi empat orang terasa hidup. Itu juga alasan jumlah peserta menjadi pilihan desain, bukan klaim kapasitas — enam belas adalah jumlah agen yang dilatih untuk ditanggung server dunia bersama empat manusia, bukan jumlah yang secara teoretis dapat ditampungnya.
Arsitekturnya adalah satu model kecil dan satu model besar.
Agora-2 memisahkan hal yang menentukan apa yang terjadi dari hal yang menentukan bagaimana tampilannya, dan selisih ukuran di antara keduanya adalah angka paling mencolok dalam makalah ini. Model simulasi memiliki 4.457.777 parameter — kira-kira 4,46 juta, empat lapis, lebar 256, empat head, jendela riwayat empat langkah, empat belas cabang pergerakan, dan head terpisah untuk arah hadap. Renderer-nya adalah transformer flow-matching dengan sekitar satu miliar parameter, enam belas blok pada lebar 2.048, lima di antaranya membawa attention temporal kausal, dijalankan selama lima langkah solver per pembaruan.
Renderer ini dikondisikan pada prefiks 342 token, bukan pada dunia mentahnya:
• Peta — 144 token, kisi ubin lokal 12×12 di sekitar titik pandang
• Entitas — 36 token, empat untuk peserta yang dikendalikan pengguna dan 32 untuk slot entitas lainnya
• Efek transien — 160 token untuk efek yang bukan peta maupun entitas
• Lihat dan daftar — satu token masing-masing untuk aksi kamera dan daftar peserta sesi
• Per pembaruan — 300 token gambar yang melakukan atensi terhadap 342 token pengondisian tersebut
• Codec — laten berbasis RAE pada 2 frame menjadi 15×20×32, lalu x264 CRF 18 atau NVENC QP 18 saat keluar
Odyssey menyebutkan alasan pengondisian disusun seperti ini: dunia yang dipelajari perlu mempertahankan properti entitas dalam keadaan yang bertahan lebih lama daripada kamera tertentu mana pun. Postingan itu mengungkapkannya secara gamblang — karena properti entitas dipertahankan secara independen dari tampilan tertentu mana pun, properti itu tetap tersedia saat entitas berada di luar bingkai. Itulah kalimat yang membedakan Agora-2 dari model video. Generator yang hanya dikondisikan pada frame-frame terkini kehilangan monster itu begitu Anda berpaling darinya; model dunia yang mempertahankan keadaan eksplisit tidak demikian.

Empat GPU membeli empat pemain
Rencana serving dalam laporan adalah bagian Agora-2 yang paling sedikit dipublikasikan dan paling berguna bagi siapa pun yang memperkirakan berapa biaya dunia seperti ini. Konfigurasi Odyssey untuk sesi empat pemain adalah empat kartu NVIDIA RTX PRO 4500: satu renderer per GPU, dengan salah satu GPU tersebut juga menjalankan model simulasi dan kebijakan agen. Target yang dinyatakan adalah lima belas pembaruan laten per detik dengan tiga puluh frame yang ditampilkan per detik.
Dua angka di lampiran membuat konfigurasi itu konkret. Pada 165 watt, tim mengukur pengurangan inferensi sebesar 9,9% dari perubahan pada renderer — 62,92 milidetik turun menjadi 56,69 milidetik selama 3.200 panggilan per implementasi. Dan pelatihan renderer itu sama spesifiknya: enam puluh ribu pembaruan pada 4.232.000 segmen diikuti oleh enam puluh ribu pembaruan lagi pada 4.332.800 segmen, AdamW dengan learning rate 1e-4, batch 128, EMA 0,9999, dijalankan pada 32 GPU B200. Korpus itu dirinci — 1.200.000 segmen pertempuran roster penuh, 2.016.000 segmen kemampuan khusus terstratifikasi, 504.000 segmen penelusuran jasad, 512.000 segmen pergerakan tanpa entitas otonom, dan 100.800 segmen siklus hidup portal bos.
Bacalah kedua paragraf itu bersama-sama dan bentuk produknya menjadi jelas. Renderer adalah bagian yang mahal, tiga orde magnitudo lebih besar dalam hal parameter, satu GPU per penonton bersamaan dalam penyajian, dan tiga puluh dua B200s dalam pelatihan. Model simulasi — bagian yang sebenarnya menentukan apa yang terjadi di dunia — berukuran empat setengah juta parameter, yang lebih kecil daripada sebagian besar tabel penyematan. Agora-2 adalah masalah rendering yang mengenakan kostum mesin gim.
Angka-angka yang dipublikasikan, dan satu hal yang tidak ditunjukkannya
Hasil kuantitatif laporan itu, berdasarkan pembingkaian Odyssey sendiri, merupakan ablasi atas pilihan desainnya sendiri, bukan skor tolok ukur kompetitif, dan harus dibaca seperti itu:
• Prefiks terstruktur vs baseline VAE — kesalahan kuadrat rata-rata 0,001279 dan PSNR 30,11 dB dibandingkan 0,010272 dan 20,67 dB, peningkatan sebesar 9,44 dB, dari 90 evaluasi berpasangan dari 30 klip dan 3 seed
• Atensi renderer — 20,09 milidetik per pembaruan denoiser dua bingkai dengan prefiks terstruktur dibandingkan dengan 37,06 dengan atensi silang dan 18,82 dengan pooled AdaLN, pengurangan denoiser sebesar 45,8% dan 34,1% pada inti
• Dropout riwayat sebesar 50% — galat streaming 0,05695 dan cold-start 0,19535 dibandingkan dengan 0,06041 dan 0,21082 pada kondisi tanpa dropout, dengan fidelitas perturbasi peta yang sedikit lebih buruk
• Akurasi simulasi — 85,17% pada prediksi cabang gerakan, 68,17% pada subset contoh terblokir yang lebih sulit, dan 95,84% pada mode animasi, dengan peralihan mode yang diprediksi sebesar 7,49% dibandingkan 3,54% yang tercatat
Setiap angka tersebut diukur terhadap konfigurasi Agora-2 yang lain. Tidak satu pun merupakan perbandingan dengan sistem yang sudah dirilis, dan tidak satu pun menjelaskan permainan secara langsung. Bagian 8 dari laporan itu jujur tentang kesenjangan ini. Transfer ke aset, aturan, atau lingkungan baru masih belum diuji. Kesalahan menumpuk. Gambar yang dihasilkan secara independen tetap dapat berbeda dalam tampilan, visibilitas, atau waktu kejadian. Dan kalimat yang layak dikutip secara utuh: laju bingkai berkelanjutan dan latensi dari masukan ke tampilan selama interaksi langsung multi-agen belum dievaluasi secara kuantitatif. Lima belas pembaruan per detik dan tiga puluh bingkai per detik di atas adalah target, bukan hasil pengukuran.

Di mana pratinjau berada, dan apa yang tidak termasuk di dalamnya
Pratinjau yang dapat dimainkan ada di situs Odyssey sendiri, diakses melalui alamat demo agora.odyssey.ml, yang mengalihkan ke .odyssey.systems. Laporan teknis adalah PDF yang ditautkan dari pengumuman yang sama. Apa yang tidak dipublikasikan sama pentingnya dengan apa yang dipublikasikan: tidak ada bobot model, tidak ada repositori, tidak ada lisensi, tidak ada API inferensi, dan tidak ada harga. Odyssey menggambarkan rilis ini sebagai pratinjau penelitian dan menganggap lintasan menuju interaksi multi-agen di dalam model fondasionalnya sebagai pekerjaan masa depan, dengan PROWL tercatat sebagai jalur penelitian yang sedang dikembangkannya dan Odyssey-3 disebut sebagai tujuan akhirnya.
Itu penting bagi siapa pun yang berencana membangun di atas Agora-2, karena jawaban praktis saat ini adalah Anda tidak bisa — bukan melalui kami dan bukan melalui endpoint terhosting pihak lain mana pun. OrcaRouter tidak menyediakan Agora-2, Agora-1, atau Odyssey-3; rute model tersebut tidak ada dalam katalog kami. Yang memang tersedia di platform kami adalah bagian lain dari sebuah build yang mungkin berada di sekitar dunia yang dipelajari: satu endpoint yang mencakup 200+ model, dengan harga pada tarif daftar setiap penyedia tanpa markup, jadi saat vendor menurunkan harga, perubahannya berlaku langsung di sini pada hari yang sama, dan lapisan routing yang otomatis mengalihkan permintaan ketika penyedia mengalami penurunan kinerja. Jika pada akhirnya Anda menggunakan model untuk menghasilkan tata letak level, menulis kode kebijakan, atau memberi takarir pada rekaman permainan, itulah bagian yang benar-benar bisa kami bantu.
Apa yang harus ditonton
Agora-2 adalah hasil nyata dengan catatan penting yang nyata, dan keduanya mudah tertukar. Hasilnya adalah bahwa dunia bersama, persisten, multi-lingkungan dapat disimulasikan dan dirender untuk dua puluh peserta dari korpus permainan yang direkam, dan bahwa Odyssey dapat menunjuk pada keputusan desain spesifik — state eksplisit, prefiks pengondisian terstruktur, model simulasi mungil — yang membuatnya berhasil. Catatan pentingnya adalah bahwa bagian 8 makalah itu sendiri mencantumkan latensi langsung, frame rate berkelanjutan, transfer lintas lingkungan, dan akumulasi galat sebagai belum dievaluasi. Sampai seseorang menerbitkan jejak frame rate dari sesi empat pemain sungguhan, ringkasan yang jujur adalah bahwa Agora-2 membuktikan arsitekturnya dan membiarkan pengalamannya belum terukur.
Hal kedua yang perlu diperhatikan adalah arah perjalanannya. Framing Odyssey sendiri menempatkan Agora-2 sebagai satu langkah dalam perjalanan menuju penempatan interaksi multi-agen di dalam sebuah model dunia fondasional, dengan PROWL sebagai perluasan riset dan Odyssey-3 sebagai target yang disebutkan namanya. Jika itu terjadi, pertanyaan yang menarik bukan lagi apakah sebuah model dunia dapat menampung dua puluh peserta, melainkan apakah sebuah model dunia dapat membawa mereka ke dunia yang tidak pernah menjadi data pelatihannya — yang justru merupakan pertanyaan transfer yang saat ini tidak dijawab oleh laporan tersebut.

