
Agora-2 vs Grok 4.6: Pertanyaan Kebijakan Agen — 1.200 Agen LLM, dan Simulator yang Tidak Menggunakan Keduanya
- typesafeBARUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 36 tok/s
- openaiBARUOpenAI: GPT-6 Luna2026-09-2237Kecerdasan
- openaiBARUOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- anthropicBARUAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- grokBARUGrok 4.72026-09-2146Kecerdasan
- OrcaBARUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 juta token · 181 tok/s
- orcaBARUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
Inilah angka yang memakan biaya. Investigasi METR terhadap insiden Hugging Face Juli 2026 menghitung sekitar 1.200 agen terkoordinasi dalam satu proses evaluasi. Untuk Grok 4.6, kartu tarifnya — $2,00 per juta token masukan, $6,00 per juta keluaran — armada sebesar itu, yang mengolah transkrip panjang selama enam hari, adalah tagihan yang benar-benar mampu ditanggung tim berpendanaan kuat. Pada harga model yang biasanya Anda pilih, itu tidak. Itulah klaim produk sebenarnya dari Grok 4.6, dan itulah klaim yang sama Agora-2 diam-diam membantah: ketika Odyssey memperkenalkan model dunia multi-agennya pada 21 September 2026 — pratinjau yang dapat dimainkan yang menghasilkan lingkungan bersama bagi hingga 20 manusia dan agen AI — agen-agen di dalamnya ternyata bukan model bahasa sama sekali. Odyssey justru melatih kebijakan pembelajaran penguatan kecil. Pertanyaan menarik yang diajukan oleh pasangan ini bukanlah mana yang lebih baik. Melainkan mengapa laboratorium itu melewati LLM.
Kartu tarif, dalam satuan yang penting bagi armada
Grok 4.6 dirilis pada 12 Agustus 2026 sebagai tier terdepan xAI: jendela konteks 500.000 token, input teks, gambar, dan file, upaya penalaran yang dapat dikonfigurasi, pemanggilan alat native, output terstruktur, dan Artificial Analysis Intelligence Index 44 pada index v4.3.2 — indeks yang sama yang menempatkan GPT-5.6 Sol di 47 dan Kimi K3 di 44. Artificial Analysis memberinya skor 94,9 pada GPQA Diamond, dan ini adalah model yang dicantumkan xAI sebagai "Latest" di dokumentasi pengembangnya sendiri. Model ini disajikan sebagai model OpenAI Responses kelas satu, yang merupakan poin praktisnya: kerangka kerja agen mengadopsinya dengan mengubah base URL, bukan dengan menulis adaptor.
Tetapi angka yang menarik adalah pemasangan $2/$6 dengan jendela konteks. Loop agen berhorizon panjang adalah beban kerja yang buruk — puluhan ribu token keluaran alat yang terakumulasi per agen per jam, sebagian besar redundan. Tarif baca cache Grok 4.6 adalah $0.50 per juta, seperempat dari harga inputnya, yang membuat jalannya seribu agen masuk akal secara aritmetika, bukan sekadar mungkin. Perhatikan batas tingkat: prompt di atas 200K token ditagih dua kali tarif dasar, sehingga agen yang menumbuhkan riwayat panjang diam-diam menggandakan biayanya sendiri.
• Harga — Agora-2 tidak ada harga yang dipublikasikan, hanya pratinjau peramban vs Grok 4.6 $2.00/$6.00 per 1 juta, $0.50 pembacaan cache, dua kali lipat di atas input 200K
• Konteks — status bersama Agora-2 ditambah riwayat per-tampilan yang dibatasi vs Grok 4.6 500.000 token
• Skor independen — Agora-2 tidak ada yang dipublikasikan vs Grok 4.6 AA Intelligence Index 44 (v4.3.2)
• Penalaran — Agora-2 tidak berlaku, bukan model bahasa vs Grok 4.6 upaya yang dapat dikonfigurasi, pemanggilan alat bawaan
• Akses — pratinjau yang dapat dimainkan Agora-2, tanpa API, tanpa bobot vs API proprieter Grok 4.6
• Perangkat Keras — Agora-2 empat GPU RTX PRO 4500 untuk empat tampilan bersamaan vs Grok 4.6 endpoint yang dihosting

Mengapa Odyssey tidak menempatkan LLM di arena
Jalan pintas yang jelas, jika Anda membangun dunia di mana enam belas agen AI bertarung melawan empat manusia, adalah menghubungkan model teks yang cakap ke kontrol dan membiarkannya bermain. Odyssey tidak melakukan itu, dan laporan teknisnya menjelaskan alasannya di tabel konfigurasi. Kebijakan agen di Agora-2 adalah kebijakan skalar dan spasial berulang yang mengonsumsi riwayat enam belas observasi, memancarkan aksi setiap empat tick simulasi di empat belas cabang gerakan diskret. Simulasi itu sendiri berjalan pada basis waktu tick 30 Hz. Model yang diminta membuat keputusan tiga puluh kali per detik, dari pandangan yang teramati sebagian, dengan kosakata aksi tingkat rendah yang tetap, bukanlah masalah penalaran — ini adalah masalah kontrol, dan masalah kontrol diselesaikan dengan melatih kebijakan kecil, bukan dengan memberikan prompt ke model frontier berkonteks 500K.
Ini layak dinyatakan dengan jelas karena ini adalah kesalahpahaman paling umum tentang kategori model dunia. Agora-2 tidak bersaing dengan Grok 4.6 untuk slot yang sama dalam sebuah sistem. Ia menempati slot di bawahnya: lingkungan tempat kebijakan dilatih dan dievaluasi. Arsitektur laporan itu menjelaskan secara eksplisit pemisahan tersebut — model simulasi memprediksi bagaimana tindakan gabungan mengubah keadaan bersama, server dunia menerapkannya, dan model perenderan per-tampilan menghasilkan perspektif 640×480 milik setiap peserta dari keadaan tersebut. Tidak ada model teks yang muncul di mana pun dalam loop interaksi.

Di mana model seperti Grok 4.6 memang muncul adalah satu tingkat di atas: sebagai entitas yang menulis perancah evaluasi, menganalisis transkrip, atau menjalankan agen yang menggunakan alat yang perilakunya sedang Anda coba pelajari. Itulah tepatnya peran yang dimainkan GPT-5.6 Sol dalam investigasi METR — sekitar 5% dari armada, dan sebagai analis yang membaca log — dan itulah peran yang dibuat murah oleh harga dan jendela konteks Grok 4.6.
Kesenjangan bukti di sini lebih lebar daripada di sebagian besar pertandingan ini
Skor indeks Grok 4.6 diukur secara independen, kartu tarifnya dipublikasikan, dan jendela konteksnya didokumentasikan. Angka-angka Agora-2 berasal dari laporan yang ditulis oleh Team Odyssey dan tidak direproduksi oleh siapa pun. Pada tiga puluh klip pemantauan, perender prefiks terstruktur miliknya mencapai 30,11 dB PSNR dibandingkan dengan 20,67 dB untuk baseline VAE — sebuah perbandingan yang laporan itu sendiri memperingatkan bahwa itu adalah antara sistem lengkap dengan anggaran pelatihan yang tidak setara, bukan uji arsitektur yang terisolasi. Tolok ukur pengondisiannya, yang menunjukkan pengurangan waktu denoiser sebesar 45,8% dibandingkan cross-attention, menggunakan denoiser yang diinisialisasi secara acak pada input sintetis dan mengukur biaya eksekusi, bukan kualitas gambar.
Lalu bagian keterbatasan, yang luar biasa blak-blakan. Angka 15 pembaruan laten dan 30 frame yang ditampilkan per detik yang disebutkan adalah target. Laju frame berkelanjutan dan latensi dari input ke tampilan selama interaksi multi-agen langsung "belum dievaluasi secara kuantitatif." Kualitas visual jangka panjang, kesesuaian antartampilan, dan kepatuhan tindakan end-to-end semuanya tercantum sebagai belum dievaluasi. Lingkungan ini memerlukan mesin game terinstrumentasi dengan geometri eksplisit dan kosakata tampilan yang tetap, dan transfer ke aset, aturan, atau lingkungan baru belum diuji. Bacalah daftar itu sebelum Anda membaca angka utama apa pun tentang Agora-2.
Yang mana yang cocok untuk stack Anda?
Jika Anda menjalankan atau mempelajari sistem multi-agen saat ini, Grok 4.6 adalah komponen yang benar-benar dapat Anda terapkan — model teks kelas terdepan dengan tarif yang membuat armada agen besar terjangkau, dengan skor yang dipublikasikan dan permukaan API yang terdokumentasi. Di OrcaRouter, ini dilayani dengan harga daftar milik xAI sendiri tanpa markup, sehingga $2/$6 di atas dan setiap perubahan tarif di masa mendatang mencapai tagihan Anda pada hari terjadinya, dengan failover otomatis jika endpoint utama menurun. Kedua fakta ini penting khususnya untuk beban kerja armada: seribu agen adalah seribu peluang untuk mendapatkan penyedia yang menurun, dan markup di atas output $6 adalah markup yang dikalikan dengan seluruh eksekusi Anda.

Agora-2 bukan infrastruktur yang dapat diterapkan dan kami tidak menghostingnya — tidak ada API, tidak ada bobot, dan tidak ada harga, hanya pratinjau yang dapat dimainkan milik Odyssey sendiri. Yang ditawarkannya adalah jenis nilai yang berbeda: lingkungan terkendali untuk penelitian interaksi yang menurut laporan METR kini mendesak, dengan biaya empat GPU RTX PRO 4500 untuk empat tampilan bersamaan, bukan tagihan API. Putusan jujurnya adalah bahwa keduanya tidak bersaing. Grok 4.6 adalah otak kebijakan yang bisa Anda beli per token hari ini; Agora-2 adalah proposal tentang di mana menguji apa yang terjadi ketika ribuan otak semacam itu bertemu. Yang kedua adalah penelitian yang lebih menarik dan produk yang kurang jadi, dan laporan Odyssey sendiri sangat jelas tentang bagian mana darinya yang masih berupa target.
Dibandingkan dalam artikel ini1
Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari
