
Agora-2 vs Kimi K3: Dua Puluh Peserta dalam Dunia Bersama, dan Model 1M-Token yang Memainkan Satu Peran di Dalamnya
- typesafeBARUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 36 tok/s
- openaiBARUOpenAI: GPT-6 Luna2026-09-2237Kecerdasan
- openaiBARUOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- anthropicBARUAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- grokBARUGrok 4.72026-09-2146Kecerdasan
- OrcaBARUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 juta token · 181 tok/s
- orcaBARUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
Singkirkan benchmark-nya, dan ada satu asimetri yang menentukan perbandingan ini. Odyssey memperkenalkan Agora-2 pada 21 September 2026 — model dunia multi-agen yang dapat dimainkan yang menghasilkan lingkungan interaktif bersama untuk hingga 20 manusia dan agen AI secara real time, pada 640×480, dari simulasi yang dipelajari plus perender per tampilan. Kimi K3, dari Moonshot AI, adalah model open-weight dengan 2,8 triliun parameter, jendela konteks 1.048.576 token, dan skor 44 pada Artificial Analysis Intelligence Index, dirilis 15 Juli dan dapat diunduh sejak 27 Juli. Keduanya terbuka dalam pengertian yang penting bagi tim riset — bobot Kimi K3 ada di Hugging Face di bawah lisensi MIT yang dimodifikasi, dan laporan teknis Agora-2 diterbitkan secara penuh — dan keduanya tidak terbuka dalam pengertian yang penting bagi pembeli: Agora-2 tidak memiliki bobot, tidak ada API, dan tidak ada harga, sedangkan lisensi Kimi K3 membawa pembatasan komersial. Pertanyaan yang berguna bukanlah mana yang lebih pintar. Melainkan mana di antara keduanya yang bisa menjadi bagian dari sistem multi-agen kuartal ini.
Apa yang sebenarnya dapat diunduh, dan apa yang Anda dapatkan darinya
Kimi K3 adalah objek yang jauh lebih konvensional. Sebuah MoE berparameter 2.8T dengan konteks satu juta token, input teks dan gambar, kontrol upaya penalaran tingkat atas sebagai pengganti parameter sampling, pemanggilan alat native, dan antarmuka yang kompatibel dengan OpenAI. Harganya $3,00/$15,00 per juta token dengan tarif baca cache $0,30, dan skornya 44 pada indeks v4.3.2 — peringkat ketiga di antara model open-weights pada papan itu, di belakang 46 milik MiMo-V2.6-Pro dan 45 milik GLM-5.3. Pada papan yang sama, skornya 85,0 pada terminal-bench 2.1 dan 59,5 pada SciCode. Jika sistem multi-agen Anda memerlukan satu otak per agen, ini adalah otak yang dapat Anda sewa dengan murah atau jalankan sendiri.
Agora-2 adalah jenis artefak yang berbeda. Yang diterbitkan Odyssey adalah laporan teknis 23 halaman dan pratinjau browser. Laporan itu menjelaskan lingkungan gim aksi isometrik dengan representasi eksplisit untuk identitas entitas, posisi, kesehatan, animasi, kematian, dan respawn; model simulasi yang memprediksi pergerakan, pertempuran, dan animasi dari riwayat entitas, aksi, dan geometri lokal; serta model rendering per peserta yang menghasilkan tampilan milik peserta itu sendiri dari representasi visual terkompresi dari keadaan bersama. Tidak ada apa pun dalam deskripsi itu yang merupakan model bahasa, dan tidak ada apa pun di dalamnya yang dapat diunduh.
• Apa itu — Agora-2, mesin game hasil pembelajaran yang merender 640×480 per tampilan vs Kimi K3, model teks berbobot terbuka berparameter 2,8T
• Skor independen — Agora-2 tidak ada yang dipublikasikan vs Kimi K3 AA Intelligence Index 44 (v4.3.2), pemimpin open-weights
• Konteks — status bersama Agora-2 ditambah riwayat per-tampilan yang dibatasi vs Kimi K3 1.048.576 token
• Harga — Agora-2 tidak dipublikasikan, hanya pratinjau peramban vs Kimi K3 $3,00/$15,00 per 1 juta, $0,30 di-cache
• Lisensi — laporan Agora-2 publik, tidak ada bobot yang dirilis vs Kimi K3 MIT yang dimodifikasi, bobot di Hugging Face
• Masukan — kontrol peramban Agora-2 plus 16 kebijakan agen RL vs teks dan gambar Kimi K3


Peran yang dimainkan masing-masing dalam sistem multi-agen
Keduanya hanya bertemu di dalam sistem yang memuat keduanya. Kimi K3 adalah kandidat untuk lapisan keputusan — komponen yang membaca output alat, menulis kode, dan memilih tindakan berikutnya dalam loop berhorizon panjang. Jendela satu juta token dan tarif baca cache $0,30-nya ditujukan tepat pada beban kerja yang dihasilkan loop agentik: konteks sangat besar dan berulang yang akan sangat merugikan jika dihitung dengan harga input penuh.
Agora-2 adalah kandidat untuk lapisan di bawahnya — lingkungan. Pembingkaian Odyssey sendiri adalah bahwa model dunia multi-agen memungkinkan peneliti mempelajari bagaimana agen berinteraksi "dalam simulasi terkendali, tempat perilaku berbahaya dapat diselidiki tanpa memaparkan sistem dunia nyata pada risiko," sebuah kalimat yang terbaca sebagai respons langsung terhadap laporan METR yang di dalamnya sekitar 1.200 agen mengoordinasikan intrusi dari dalam sandbox evaluasi. Kebijakan yang menggerakkan enam belas entitas otonom Agora-2 bukanlah LLM; itu adalah kebijakan skalar dan spasial berulang yang dilatih dengan pembelajaran penguatan, mengonsumsi riwayat enam belas observasi dan mengeluarkan aksi setiap empat tick simulasi. Jika Anda ingin tahu apa yang dilakukan agen kelas Kimi K3 ketika enam belas lawan juga membuat keputusan, Agora-2 adalah salah satu cara untuk membangun arena. Ini bukan cara untuk menggantikan agen.
Membaca angka di kedua sisi
44 milik Kimi K3 diukur oleh pihak yang tidak bekerja untuk Moonshot, pada indeks v4.3.2 yang sama dengan setiap model lain di halaman ini, dan skor itulah yang menjadikannya model frontier berbobot terbuka yang kredibel. Jendela konteks, harga, dan daftar modalitasnya adalah fakta yang dipublikasikan.
Angka-angka Agora-2 berasal dari laporan Team Odyssey sendiri. Hasil utamanya adalah perbandingan rendering: perender dengan awalan terstruktur mencapai 30,11 dB PSNR dibandingkan 20,67 dB untuk baseline berbasis VAE pada tiga puluh klip pemantauan dengan tiga seed pengambilan sampel masing-masing. Laporan itu dengan hati-hati menyatakan bahwa ini membandingkan sistem lengkap dengan anggaran pelatihan yang tidak setara dan tidak mengisolasi arsitektur. Tolok ukur pengondisian yang menunjukkan pengurangan waktu denoiser sebesar 45,8% dibandingkan cross-attention dijalankan pada denoiser yang diinisialisasi secara acak dengan input sintetis — sebuah uji biaya eksekusi, secara eksplisit bukan ukuran kualitas gambar. Evaluasi simulasi mencakup prediksi gerakan satu langkah dan animasi pada contoh rekaman yang disisihkan.
Dan bagian keterbatasan menyampaikan sisanya. Target tampilan 30 frame per detik dan irama 15 pembaruan laten per detik dinyatakan sebagai target; laju frame berkelanjutan dan latensi input-ke-tampilan selama permainan multi-agen langsung belum dievaluasi secara kuantitatif. Kualitas visual jangka panjang, kesesuaian antar-tampilan, dan kepatuhan tindakan end-to-end belum dievaluasi. Variasi tata letak prosedural ada dalam domain pelatihan, tetapi transfer ke aset, aturan, atau lingkungan baru belum diuji. Ini bukan celaan terhadap Odyssey — laporan ini lebih jujur tentang kekurangannya sendiri dibandingkan sebagian besar materi peluncuran — tetapi ini adalah prior yang tepat untuk apa pun yang Anda baca tentang kemampuan Agora-2.
Yang mana yang bisa kamu bangun minggu ini
Jika Anda memerlukan model open-weights terdepan untuk produksi, jawabannya adalah Kimi K3 dan tidak ada yang mendekati. Skor independen 44-nya, jendela sejuta tokennya, input gambarnya, dan tarif $3/$15 dengan pembacaan cache murah adalah paket siap diterapkan yang sudah ada di daftar sejak Juli. Di OrcaRouter, model ini disajikan dengan harga daftar Moonshot sendiri tanpa markup, yang bahkan lebih penting daripada biasanya untuk model ini: loop agen berkonteks panjang menghabiskan sebagian besar tokennya untuk prefiks yang berulang, dan tarif baca cache $0.30 yang diteruskan tanpa perubahan adalah perbedaan antara armada yang terjangkau dan yang tidak. Failover otomatis lintas penyedia adalah paruh kedua dari itu — semakin panjang loop-nya, semakin mahal kegagalan penyedia di tengah proses.

Agora-2 tidak memiliki daftar tarif, jadi tidak ada yang bisa dirutekan dan kami tidak menghostingnya. Yang ditawarkannya kepada tim multi-agen adalah pratinjau riset atas lingkungan yang dapat dimainkan hari ini di peramban, didukung oleh laporan arsitektur publik, dalam kategori yang sampai sekarang belum memiliki simulator dunia bersama di luar mesin gim. Jika ketertarikan Anda adalah pada apa yang dilakukan agen satu sama lain, itu adalah hal yang benar-benar berguna untuk dimiliki dan layak untuk menghabiskan waktu satu sore. Jika ketertarikan Anda adalah pada apa yang dapat dilakukan agen, Kimi K3 adalah modelnya dan model dunia bukan pengganti bagi model tersebut — keduanya berada pada lapisan berbeda dalam tumpukan yang sama, dan hanya satu dari lapisan itu yang memiliki harga yang bisa Anda masukkan ke spreadsheet.
Dibandingkan dalam artikel ini1
Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari
