
Agora-2 vs MiniMax M3: Satu GPU per Peserta, atau Tiga Belas Sen per Juta Token
- typesafeBARUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 36 tok/s
- openaiBARUOpenAI: GPT-6 Luna2026-09-2237Kecerdasan
- openaiBARUOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- anthropicBARUAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- grokBARUGrok 4.72026-09-2146Kecerdasan
- OrcaBARUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 juta token · 181 tok/s
- orcaBARUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
Dua cara untuk menjalankan sekumpulan agen, dengan harga dalam dua mata uang yang berbeda. MiniMax M3berbiaya $0.30 per juta token masukan dan $1.20 per juta token keluaran — tarif yang membuat eksperimen seribu agen menjadi satu pos anggaran alih-alih satu putaran pendanaan. Agora-2, model dunia multi-agen Odyssey yang dipratinjau pada 21 September 2026, berbiaya satu NVIDIA RTX PRO 4500 per tampilan peserta: sesi empat pemain berjalan di empat GPU, dengan satu model rendering per kartu yang menghasilkan perspektif 640×480 pemain tersebut, dan salah satu dari empat kartu itu juga menanggung simulasi bersama serta enam belas kebijakan agen otonom. Angka MiniMax M3 dihitung per token dan berskala dengan seberapa banyak agen Anda berpikir. Angka Agora-2 dihitung per mata dan berskala dengan berapa banyak peserta simultan yang Anda tempatkan di dunia itu. Membandingkan keduanya berarti membandingkan anggaran penalaran dengan anggaran rendering, dan bagi siapa pun yang merencanakan studi multi-agen pada 2026, itulah hal yang berguna untuk dilakukan.
Sisi token dari buku besar
MiniMax M3 adalah produk unggulan berbobot terbuka milik MiniMax, dirilis pada 31 Mei 2026: sparse mixture-of-experts berparameter 428 miliar dengan sekitar 23 miliar parameter aktif per token, jendela konteks 1.048.576 token yang mana MiniMax menjamin 512K dapat digunakan, masukan teks, gambar, dan video, serta skor 29 pada Artificial Analysis Intelligence Index v4.3.2. Dalam angka vendor, model ini dilaporkan meraih 83,5 pada BrowseComp dan 76,1 pada BankerToolBench — angka MiniMax sendiri, tidak direproduksi di sini — dan Artificial Analysis mengukurnya pada 145 token keluaran per detik, model tercepat kesepuluh di papan tersebut.
Namun, angka yang relevan untuk armada agen adalah tarif baca cache: $0,06 per juta token yang di-cache, seperlima dari harga input. Loop agen didominasi prefiks — prompt sistem yang sama, skema alat yang sama, riwayat yang sama yang terus bertambah, semuanya dikirim ulang setiap giliran — sehingga biaya efektif sebuah loop jauh lebih mendekati $0,06 daripada $0,30 untuk sebagian besar tokennya. Itulah aritmetika yang membuat uji coba 1.200 agen, seperti yang didokumentasikan METR dalam evaluasi ExploitGym OpenAI Juli 2026, menjadi sesuatu yang benar-benar dapat direproduksi oleh kelompok riset, bukan sekadar dibaca.
Sisi GPU dari buku besar
Struktur biaya Agora-2 diungkapkan dalam lampiran implementasinya sendiri, dan sangat konkret. Satu RTX PRO 4500 Blackwell Server Edition per tampilan. Empat untuk sesi empat pemain. Kartu-kartu tersebut menghasilkan tampilan setiap peserta pada target lima belas pembaruan laten dan tiga puluh frame yang ditampilkan per detik pada 640×480, dan simulasi berjalan pada tick 30 Hz. Laporan tersebut juga memberikan skala pelatihan untuk pekerjaan di sekitarnya: batch global efektif sebesar 128 di seluruh 32 B200 GPU.
Diterjemahkan ke unit yang sama dengan MiniMax M3, yaitu satu GPU pusat data per peserta bersamaan, ditambah simulasi bersama yang ikut menumpang di salah satunya. Ini adalah biaya tetap yang tidak peduli berapa lama agen Anda berpikir dan tidak turun ketika mereka diam. Dua konsekuensi menyusul, dan keduanya menunjuk ke arah yang berlawanan. Pada jumlah peserta rendah dengan penalaran berat per agen, model token jelas lebih murah — Anda membayar beberapa sen untuk berpikir dan tidak membayar apa pun untuk agen kedua di ruangan itu. Pada jumlah peserta tinggi dengan interaksi padat, aritmetikanya berbalik: dua puluh peserta bersamaan dalam dunia bersama berarti dua puluh GPU, angka yang tidak bertambah seiring jumlah token yang dihabiskan masing-masing.
• Satuan biaya — Agora-2 satu RTX PRO 4500 per tampilan peserta vs MiniMax M3 $0.30/$1.20 per 1 juta token
• Pembacaan cache — Agora-2 tidak berlaku, tidak ada penagihan token vs MiniMax M3 $0.06 per 1 juta yang di-cache
• Skor independen — Agora-2 tidak ada yang dipublikasikan vs MiniMax M3 AA Intelligence Index 29 (v4.3.2)
• Konteks — status bersama Agora-2 plus riwayat per-tampilan yang dibatasi vs MiniMax M3 1,048,576 token, 512K dijamin
• Keluaran — video Agora-2 640×480 pada target 30 fps vs teks MiniMax M3
• Akses — pratinjau browser Agora-2, tanpa API, tanpa bobot vs MiniMax M3 dengan bobot terbuka, lisensi komunitas, API


Mengapa kedua biaya tersebut bukan substitusi
Ada godaan untuk membacanya sebagai pilihan salah satu atau yang lain, dan ini bukan itu. MiniMax M3 adalah otak kebijakan: ia membaca situasi yang teramati sebagian, bernalar, memanggil alat, dan mengeluarkan tindakan. Agora-2 adalah lingkungan di mana tindakan memiliki konsekuensi yang terlihat oleh peserta lain — model simulasi yang memprediksi bagaimana tindakan gabungan mengubah keadaan bersama, server dunia yang menerapkannya, dan perender per tampilan sehingga setiap peserta melihat dunia yang sama dari perspektifnya sendiri. Enam belas entitas otonom Odyssey tidak digerakkan oleh model bahasa apa pun; entitas-entitas itu adalah kebijakan skalar dan spasial berulang yang dilatih dengan pembelajaran penguatan, mengonsumsi riwayat enam belas observasi dan bertindak setiap empat tik simulasi. Pilihan desain itulah petunjuknya. Pada tiga puluh tik per detik, memutuskan apa yang harus dilakukan adalah masalah kendali, dan masalah kendali diselesaikan dengan melatih kebijakan kecil alih-alih dengan memanggil API.
Jadi, kerangka yang jujur bagi tim yang merencanakan pekerjaan multi-agen adalah bahwa hal-hal ini berada di lapisan yang berbeda dan Anda memerlukan anggaran untuk masing-masing. Lapisan penalaran itu murah dan elastis, dan Anda bisa memilihnya dari berbagai opsi. Lapisan lingkungan, jika Anda menginginkan sesuatu selain mesin game, saat ini merupakan pratinjau riset dengan jejak yang menyerupai GPU dan tanpa API yang dipublikasikan. Kedua fakta ini cukup baru — M3 sejak Mei, Agora-2 sejak September — sehingga hampir belum ada yang memiliki model biaya untuk kombinasi tersebut.
Apa yang terverifikasi dan apa yang menjadi target?
Skor independen, jendela konteks, modalitas, dan harga MiniMax M3 adalah fakta yang dipublikasikan dan dapat diverifikasi hari ini. Angka BrowseComp dan BankerToolBench-nya dilaporkan oleh vendor dan harus diberi label demikian setiap kali Anda mengutipnya.
Angka-angka Agora-2 sepenuhnya berasal dari laporan teknis Team Odyssey dan belum pernah direproduksi oleh siapa pun di luar perusahaan. Hasil renderingnya — 30,11 dB PSNR untuk perender prefiks terstruktur dibandingkan dengan 20,67 dB untuk baseline VAE pada tiga puluh klip pemantauan — merupakan perbandingan sistem lengkap dengan anggaran pelatihan yang tidak setara, seperti yang dicatat laporan itu sendiri. Penurunan waktu denoiser sebesar 45,8% dibandingkan dengan cross-attention berasal dari denoiser yang diinisialisasi secara acak pada input sintetis dan mengukur biaya eksekusi, bukan kualitas gambar. Dan bagian keterbatasannya menyatakan dengan jelas bahwa laju lima belas pembaruan per detik dan tiga puluh frame per detik adalah target; bahwa laju frame berkelanjutan dan latensi input-ke-tampilan selama interaksi multi-agen langsung "belum dievaluasi secara kuantitatif"; bahwa kualitas visual jangka panjang, kesesuaian antartampilan, dan kepatuhan aksi end-to-end masih belum dievaluasi; bahwa lingkungan tersebut memerlukan mesin terinstrumentasi dengan geometri eksplisit dan kosakata penampilan yang tetap; dan bahwa transfer di luar domain pelatihan belum diuji. Siapa pun yang membangun model biaya pada satu GPU per tampilan harus membaca bagian itu terlebih dahulu, karena throughput per GPU justru yang belum diukur.
Panggilan
Jika Anda sedang membangun armada agen — banyak model, loop panjang, pemanggilan alat, tanpa rendering — MiniMax M3 adalah cara kredibel termurah untuk melakukannya dalam skala besar, dan tarif baca cache adalah angka yang menentukan tagihan Anda. Ini dirutekan di OrcaRouter pada harga resmi MiniMax sendiri tanpa markup, jadi tarif cache $0,06 adalah yang Anda bayar, dengan failover antar penyedia jika endpoint menurun di tengah proses. Khusus untuk armada, pass-through lebih penting daripada biasanya: margin reseller pada token cache adalah margin yang dikalikan dengan setiap giliran setiap agen.

Agora-2 bukanlah sesuatu yang bisa Anda rutekan ke sana — tidak ada API, tidak ada harga, dan tidak ada bobot, hanya pratinjau peramban Odyssey — dan kami tidak menghostingnya. Yang dimaksud dengan itu adalah simulator dunia bersama pertama yang dirancang khusus agar banyak peserta, manusia dan sintetis, dapat diamati berinteraksi dalam kondisi terkendali, dan laporan di baliknya luar biasa terus terang tentang seberapa jauh saat ini dari sebuah produk. Jika masalah Anda adalah penalaran dalam skala besar, MiniMax M3 tersedia sekarang dan murah. Jika masalah Anda adalah apa yang terjadi ketika seribu penalar semacam itu berbagi satu dunia, Odyssey telah membangun arena dan menyerahkan pengukuran sulitnya untuk dijalankan oleh orang lain.
