Kartu judul yang dihasilkan untuk Agora-2 vs Grok 4.6, dengan subjudul '1.200 agen LLM, dan simulator yang tidak menggunakan keduanya'. Tiga kartu: 'Grok 4.6: Indeks AA 44, $2/$6 per 1J, $0,50 di-cache'; 'Agora-2: 16 kebijakan agen RL, tanpa LLM dalam loop'; 'Agora-2: tick 30 Hz, 4 GPU RTX PRO 4500 per sesi'. Footer berbunyi 'Angka Agora-2 dari laporan Odyssey sendiri, tidak direproduksi; Grok 4.6 menurut Artificial Analysis.'
Guides & Insights

Agora-2 vs Grok 4.6: Pertanyaan Kebijakan Agen — 1.200 Agen LLM, dan Simulator yang Tidak Menggunakan Keduanya

Penulis

Alistair Wren

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Inilah angka yang memakan biaya. Investigasi METR terhadap insiden Hugging Face Juli 2026 menghitung sekitar 1.200 agen terkoordinasi dalam satu proses evaluasi. Untuk Grok 4.6, kartu tarifnya — $2,00 per juta token masukan, $6,00 per juta keluaran — armada sebesar itu, yang mengolah transkrip panjang selama enam hari, adalah tagihan yang benar-benar mampu ditanggung tim berpendanaan kuat. Pada harga model yang biasanya Anda pilih, itu tidak. Itulah klaim produk sebenarnya dari Grok 4.6, dan itulah klaim yang sama Agora-2 diam-diam membantah: ketika Odyssey memperkenalkan model dunia multi-agennya pada 21 September 2026 — pratinjau yang dapat dimainkan yang menghasilkan lingkungan bersama bagi hingga 20 manusia dan agen AI — agen-agen di dalamnya ternyata bukan model bahasa sama sekali. Odyssey justru melatih kebijakan pembelajaran penguatan kecil. Pertanyaan menarik yang diajukan oleh pasangan ini bukanlah mana yang lebih baik. Melainkan mengapa laboratorium itu melewati LLM.

Kartu tarif, dalam satuan yang penting bagi armada

Grok 4.6 dirilis pada 12 Agustus 2026 sebagai tier terdepan xAI: jendela konteks 500.000 token, input teks, gambar, dan file, upaya penalaran yang dapat dikonfigurasi, pemanggilan alat native, output terstruktur, dan Artificial Analysis Intelligence Index 44 pada index v4.3.2 — indeks yang sama yang menempatkan GPT-5.6 Sol di 47 dan Kimi K3 di 44. Artificial Analysis memberinya skor 94,9 pada GPQA Diamond, dan ini adalah model yang dicantumkan xAI sebagai "Latest" di dokumentasi pengembangnya sendiri. Model ini disajikan sebagai model OpenAI Responses kelas satu, yang merupakan poin praktisnya: kerangka kerja agen mengadopsinya dengan mengubah base URL, bukan dengan menulis adaptor.

Tetapi angka yang menarik adalah pemasangan $2/$6 dengan jendela konteks. Loop agen berhorizon panjang adalah beban kerja yang buruk — puluhan ribu token keluaran alat yang terakumulasi per agen per jam, sebagian besar redundan. Tarif baca cache Grok 4.6 adalah $0.50 per juta, seperempat dari harga inputnya, yang membuat jalannya seribu agen masuk akal secara aritmetika, bukan sekadar mungkin. Perhatikan batas tingkat: prompt di atas 200K token ditagih dua kali tarif dasar, sehingga agen yang menumbuhkan riwayat panjang diam-diam menggandakan biayanya sendiri.

• Harga — Agora-2 tidak ada harga yang dipublikasikan, hanya pratinjau peramban vs Grok 4.6 $2.00/$6.00 per 1 juta, $0.50 pembacaan cache, dua kali lipat di atas input 200K

• Konteks — status bersama Agora-2 ditambah riwayat per-tampilan yang dibatasi vs Grok 4.6 500.000 token

• Skor independen — Agora-2 tidak ada yang dipublikasikan vs Grok 4.6 AA Intelligence Index 44 (v4.3.2)

• Penalaran — Agora-2 tidak berlaku, bukan model bahasa vs Grok 4.6 upaya yang dapat dikonfigurasi, pemanggilan alat bawaan

• Akses — pratinjau yang dapat dimainkan Agora-2, tanpa API, tanpa bobot vs API proprieter Grok 4.6

• Perangkat Keras — Agora-2 empat GPU RTX PRO 4500 untuk empat tampilan bersamaan vs Grok 4.6 endpoint yang dihosting

Generated two-column scoreboard for Agora-2 and Grok 4.6 across price, context, independent score, reasoning, access and hardware: Agora-2 no published price, shared state plus per-view history, none published, not applicable as it is not an LLM, playable preview with no API, and 4 RTX PRO 4500 GPUs for 4 views; Grok 4.6 $2.00/$6.00 per 1M, 500,000 tokens, AA Index 44, configurable effort with tool calling, a proprietary API, a hosted endpoint. Footer reads 'Agora-2 figures from Odyssey's own report, unreproduced; Grok 4.6 per Artificial Analysis.'

Mengapa Odyssey tidak menempatkan LLM di arena

Jalan pintas yang jelas, jika Anda membangun dunia di mana enam belas agen AI bertarung melawan empat manusia, adalah menghubungkan model teks yang cakap ke kontrol dan membiarkannya bermain. Odyssey tidak melakukan itu, dan laporan teknisnya menjelaskan alasannya di tabel konfigurasi. Kebijakan agen di Agora-2 adalah kebijakan skalar dan spasial berulang yang mengonsumsi riwayat enam belas observasi, memancarkan aksi setiap empat tick simulasi di empat belas cabang gerakan diskret. Simulasi itu sendiri berjalan pada basis waktu tick 30 Hz. Model yang diminta membuat keputusan tiga puluh kali per detik, dari pandangan yang teramati sebagian, dengan kosakata aksi tingkat rendah yang tetap, bukanlah masalah penalaran — ini adalah masalah kontrol, dan masalah kontrol diselesaikan dengan melatih kebijakan kecil, bukan dengan memberikan prompt ke model frontier berkonteks 500K.

Ini layak dinyatakan dengan jelas karena ini adalah kesalahpahaman paling umum tentang kategori model dunia. Agora-2 tidak bersaing dengan Grok 4.6 untuk slot yang sama dalam sebuah sistem. Ia menempati slot di bawahnya: lingkungan tempat kebijakan dilatih dan dievaluasi. Arsitektur laporan itu menjelaskan secara eksplisit pemisahan tersebut — model simulasi memprediksi bagaimana tindakan gabungan mengubah keadaan bersama, server dunia menerapkannya, dan model perenderan per-tampilan menghasilkan perspektif 640×480 milik setiap peserta dari keadaan tersebut. Tidak ada model teks yang muncul di mana pun dalam loop interaksi.

Screenshot of Odyssey's Agora-2 announcement page, headlined 'Introducing Agora-2: Advancing Multi-Agent World Simulation' with the standfirst 'Our next-generation multi-agent world model, supporting up to 20 humans and agents inside a shared world simulation', bylined Oliver Cameron, September 21st, 2026, opening on the playable research preview and the Diablo II training captures.

Di mana model seperti Grok 4.6 memang muncul adalah satu tingkat di atas: sebagai entitas yang menulis perancah evaluasi, menganalisis transkrip, atau menjalankan agen yang menggunakan alat yang perilakunya sedang Anda coba pelajari. Itulah tepatnya peran yang dimainkan GPT-5.6 Sol dalam investigasi METR — sekitar 5% dari armada, dan sebagai analis yang membaca log — dan itulah peran yang dibuat murah oleh harga dan jendela konteks Grok 4.6.

Kesenjangan bukti di sini lebih lebar daripada di sebagian besar pertandingan ini

Skor indeks Grok 4.6 diukur secara independen, kartu tarifnya dipublikasikan, dan jendela konteksnya didokumentasikan. Angka-angka Agora-2 berasal dari laporan yang ditulis oleh Team Odyssey dan tidak direproduksi oleh siapa pun. Pada tiga puluh klip pemantauan, perender prefiks terstruktur miliknya mencapai 30,11 dB PSNR dibandingkan dengan 20,67 dB untuk baseline VAE — sebuah perbandingan yang laporan itu sendiri memperingatkan bahwa itu adalah antara sistem lengkap dengan anggaran pelatihan yang tidak setara, bukan uji arsitektur yang terisolasi. Tolok ukur pengondisiannya, yang menunjukkan pengurangan waktu denoiser sebesar 45,8% dibandingkan cross-attention, menggunakan denoiser yang diinisialisasi secara acak pada input sintetis dan mengukur biaya eksekusi, bukan kualitas gambar.

Lalu bagian keterbatasan, yang luar biasa blak-blakan. Angka 15 pembaruan laten dan 30 frame yang ditampilkan per detik yang disebutkan adalah target. Laju frame berkelanjutan dan latensi dari input ke tampilan selama interaksi multi-agen langsung "belum dievaluasi secara kuantitatif." Kualitas visual jangka panjang, kesesuaian antartampilan, dan kepatuhan tindakan end-to-end semuanya tercantum sebagai belum dievaluasi. Lingkungan ini memerlukan mesin game terinstrumentasi dengan geometri eksplisit dan kosakata tampilan yang tetap, dan transfer ke aset, aturan, atau lingkungan baru belum diuji. Bacalah daftar itu sebelum Anda membaca angka utama apa pun tentang Agora-2.

Yang mana yang cocok untuk stack Anda?

Jika Anda menjalankan atau mempelajari sistem multi-agen saat ini, Grok 4.6 adalah komponen yang benar-benar dapat Anda terapkan — model teks kelas terdepan dengan tarif yang membuat armada agen besar terjangkau, dengan skor yang dipublikasikan dan permukaan API yang terdokumentasi. Di OrcaRouter, ini dilayani dengan harga daftar milik xAI sendiri tanpa markup, sehingga $2/$6 di atas dan setiap perubahan tarif di masa mendatang mencapai tagihan Anda pada hari terjadinya, dengan failover otomatis jika endpoint utama menurun. Kedua fakta ini penting khususnya untuk beban kerja armada: seribu agen adalah seribu peluang untuk mendapatkan penyedia yang menurun, dan markup di atas output $6 adalah markup yang dikalikan dengan seluruh eksekusi Anda.

Screenshot of the OrcaRouter model page for Grok 4.6 (model ID grok/grok-4.6), showing a 500K-token context window, text, image and file input, and pricing of $2.00 input and $6.00 output per million tokens.

Agora-2 bukan infrastruktur yang dapat diterapkan dan kami tidak menghostingnya — tidak ada API, tidak ada bobot, dan tidak ada harga, hanya pratinjau yang dapat dimainkan milik Odyssey sendiri. Yang ditawarkannya adalah jenis nilai yang berbeda: lingkungan terkendali untuk penelitian interaksi yang menurut laporan METR kini mendesak, dengan biaya empat GPU RTX PRO 4500 untuk empat tampilan bersamaan, bukan tagihan API. Putusan jujurnya adalah bahwa keduanya tidak bersaing. Grok 4.6 adalah otak kebijakan yang bisa Anda beli per token hari ini; Agora-2 adalah proposal tentang di mana menguji apa yang terjadi ketika ribuan otak semacam itu bertemu. Yang kedua adalah penelitian yang lebih menarik dan produk yang kurang jadi, dan laporan Odyssey sendiri sangat jelas tentang bagian mana darinya yang masih berupa target.

Dibandingkan dalam artikel ini1

Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari