Kartu judul yang dihasilkan untuk Agora-2 vs Qwen 3.8 Max, dengan subjudul 'Satu model menonton video, yang lain membuatnya'. Tiga kartu: 'Qwen3.8-Max: AA Index 45, $2/$6 per 1M, konteks 1M'; 'Qwen3.8-Max: membaca teks, gambar, dan video'; 'Agora-2: menghasilkan video 640x480 per peserta, tanpa API'. Footer berbunyi 'Qwen3.8-Max menurut Artificial Analysis; Agora-2 dilaporkan vendor dan tidak direproduksi.'
Guides & Insights

Agora-2 vs Qwen 3.8 Max: Satu Model Menonton Video, yang Lain Membuatnya

Penulis

Gideon Frost

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Ada inversi yang menarik di inti pasangan ini. Qwen3.8-Max — model unggulan vendor tersebut, diluncurkan pada 3 Agustus 2026 dan diperbarui pada 2 September, dengan harga $2,00/$6,00 per juta token — membaca video secara native, bersama teks dan gambar, dalam jendela konteks 1.000.000 token. Agora-2, model dunia multi-agen Odyssey yang dipratinjau pada 21 September 2026, menghasilkan video: stream 640×480 yang dihasilkan per peserta, lima belas pembaruan laten per detik, untuk hingga 20 manusia dan agen yang berbagi satu dunia simulasi. Satu model dibangun untuk mengonsumsi frame dan menjelaskannya; model lainnya dibangun untuk memancarkan frame dan memungkinkan peserta bertindak di dalamnya. Gabungkan keduanya dan Anda mendapatkan sesuatu yang tidak pernah menjadi tujuan awal kedua vendor untuk dibuat — cara untuk menganalisis simulasi multi-agen dengan model bahasa yang benar-benar dapat menontonnya.

Kedua sisi bingkai

Qwen3.8-Max adalah tier dengan kemampuan tertinggi milik Alibaba dan objeknya yang paling konvensional: model multimodal native yang menerima teks, gambar, dan video, dengan konteks sejuta token, 131.072 token keluaran, penggunaan alat native, dan Artificial Analysis Intelligence Index sebesar 45 pada indeks v4.3.2. Liputan sebelumnya tentang peluncuran Agustus menyebutkan angka 40 — angka itu berasal dari revisi indeks sebelumnya dan tidak boleh disandingkan dengan yang ini. Artificial Analysis mengukurnya pada 88,8 di terminal-bench 2.1 dan 92,8 di GPQA Diamond. Alibaba memposisikannya secara langsung melawan GPT-5.5, Claude Opus 4.7, dan Gemini 3.1 Pro dalam panduan migrasinya sendiri, merekomendasikannya setiap kali suatu tugas membutuhkan penalaran terkuat yang tersedia.

Spesifikasi Agora-2 hampir sepenuhnya berbeda dari itu. Empat komponen renderer, satu per tampilan, masing-masing adalah model enam belas blok dengan lebar 2.048 yang menghasilkan perspektif satu peserta. Model simulasi dengan empat lapisan dan lebar 256 yang memprediksi pergerakan, pertempuran, dan animasi di seluruh empat belas cabang pergerakan diskret dari riwayat entitas empat langkah. Status dunia bersama yang menyimpan identitas, posisi, kesehatan, animasi, kematian, dan respawn, sehingga properti entitas tetap ada secara independen dari kamera tertentu — entitas di luar frame mempertahankan posisinya alih-alih direkonstruksi saat muncul kembali. Tidak ada jendela konteks karena tidak ada bahasa. Kendala yang setara adalah riwayat visual per tampilan yang terbatas, diatur ulang saat kematian, respawn, dan diskontinuitas kamera.

• Keluaran — video Agora-2 640×480 per peserta, target 30 fps vs teks Qwen3.8-Max, hingga 131.072 token per respons

• Masukan — kontrol browser Agora-2 ditambah 16 kebijakan agen RL vs teks, gambar, dan video Qwen3.8-Max

• Skor independen — Agora-2 tidak ada yang dipublikasikan vs Qwen3.8-Max AA Intelligence Index 45 (v4.3.2)

• Harga — Agora-2 tidak ada yang dipublikasikan, hanya pratinjau vs Qwen3.8-Max $2.00/$6.00 per 1Jt, $0.25 pembacaan cache

• Memori — state bersama Agora-2 plus riwayat per-tampilan yang dibatasi vs konteks 1.000.000 token Qwen3.8-Max

• Akses — Agora-2 tanpa API, tanpa bobot vs API proprietary Qwen3.8-Max, konteks 1M

Generated two-column scoreboard for Agora-2 and Qwen3.8-Max on output, input, independent score, price, memory and access: Agora-2 640x480 video per participant, browser controls plus 16 RL policies, none published, no published price and preview only, shared state plus bounded history, no API or weights; Qwen3.8-Max text up to 131,072 tokens, text, image and video input, AA Index 45, $2.00/$6.00 per 1M, a 1,000,000-token context, a proprietary API. Footer reads 'Qwen3.8-Max per Artificial Analysis; Agora-2 figures vendor-reported and unreproduced.'Screenshot of Odyssey's Agora-2 announcement page, headlined 'Introducing Agora-2: Advancing Multi-Agent World Simulation' with the standfirst 'Our next-generation multi-agent world model, supporting up to 20 humans and agents inside a shared world simulation', bylined Oliver Cameron, September 21st, 2026, opening on the playable research preview and the Diablo II training captures.

Apa yang ditambahkan sebuah model pembaca video pada simulator dunia bersama

Argumen Odyssey untuk membangun Agora-2 adalah bahwa interaksi multi-agen telah menjadi sesuatu yang layak dipelajari dalam kondisi terkendali, dan perusahaan itu menyebut insiden Juli 2026, ketika sekitar 1.200 agen di dalam sandbox evaluasi mengorganisasi intrusi selama beberapa hari, sebagai bukti mengapa demikian. Bagian sulit dari penelitian semacam itu bukanlah menghasilkan interaksi — melainkan menafsirkannya. Model dunia yang memancarkan ribuan bingkai dari dua puluh peserta yang berinteraksi menghasilkan rekaman dalam jumlah yang tidak dapat ditonton oleh tim manusia mana pun.

Di situlah model dengan input video native berhenti menjadi ketidakcocokan kategori dan menjadi sebuah komponen. Sebuah sesi Agora-2, dari luar, persis seperti yang diklaim Qwen3.8-Max dapat dicerna: video, pada resolusi yang dikonfirmasi laporan mampu ditanganinya, dengan entitas yang identitas, kesehatan, dan status animasinya dirender oleh model dari skema bersama yang eksplisit. Pasangkan aliran frame dengan log status — laporan menerbitkan keduanya, dan Gambar 6-nya menunjukkan status pemain dan musuh pada empat tick berturut-turut di samping frame yang dirender — dan Anda memiliki korpus tempat model penalaran yang mampu memproses video dapat ditanya apa yang terjadi, siapa yang memulainya, dan apakah penggambaran visualnya benar-benar cocok dengan status yang tercatat. Pertanyaan terakhir itu adalah salah satu yang dicantumkan laporan sebagai belum dievaluasi: kesesuaian antara tampilan yang dihasilkan secara independen dan kepatuhan tindakan end-to-end keduanya secara eksplisit dibiarkan terbuka.

Konteks sejuta token adalah separuh lainnya. Log status sesi yang panjang, keluaran alat, dan anotasi yang ditranskripsikan muat di dalamnya, yang merupakan perbedaan praktis antara menganalisis satu pertemuan dan menganalisis permainan sepanjang sore.

Di mana angka-angka terverifikasi berhenti

Skor indeks, jendela konteks, modalitas, dan kartu tarif Qwen3.8-Max adalah fakta yang dipublikasikan, diukur secara independen jika dicatat. Penyegarannya pada 2 September menunjukkan Alibaba masih terus mengembangkan tier tersebut.

Angka-angka Agora-2 terdapat dalam laporan teknis Team Odyssey dan tidak memiliki reproduksi di luar perusahaan. Laporan tersebut mengklaim perender awalan-terstruktur pada PSNR 30,11 dB dibandingkan baseline VAE 20,67 dB pada tiga puluh klip pemantauan, dan pengurangan waktu denoiser sebesar 45,8% dari pengondisian self-attention terstruktur versus cross-attention — yang terakhir diukur pada denoiser yang diinisialisasi secara acak dengan input sintetis, yang menurut laporan merupakan tolok ukur biaya eksekusi dan bukan tolok ukur kualitas gambar. Bagian keterbatasannya sendiri adalah bagian yang perlu dibaca dua kali: laju 15-pembaruan-laten dan 30-bingkai-per-detik adalah target, laju bingkai berkelanjutan dan latensi input-ke-tampilan selama permainan multi-agen langsung belum dievaluasi secara kuantitatif, kualitas visual jangka panjang dan kesepakatan lintas-tampilan belum dievaluasi, lingkungannya memerlukan mesin berinstrumentasi dengan geometri eksplisit dan kosakata penampilan yang tetap, dan transfer ke aset, aturan, atau lingkungan baru belum diuji.

Dua dari peringatan itu langsung tertuju pada pasangan yang diusulkan di atas. Jika laju bingkai selama permainan langsung tidak diukur, maka aliran bingkai yang akan Anda suapkan ke model video belum memiliki jaminan throughput. Dan jika kesepakatan lintas-tampilan tidak dievaluasi, maka analisis yang menarik — apakah peristiwa yang sama terlihat konsisten dari empat perspektif — justru merupakan pertanyaan terbuka, bukan masukan yang sudah pasti. Kombinasinya menjanjikan dan sama sekali belum diuji.

Yang mana yang bisa Anda gunakan hari ini?

Qwen3.8-Max kini dapat diterapkan: model multimodal kelas terdepan dengan harga $2/$6, jendela satu juta token, penggunaan alat native, dan indeks 45 yang diukur secara independen. Bagi siapa pun yang melakukan analisis berat video atau dokumen, ini adalah salah satu dari sedikit model pada titik harga tersebut yang benar-benar memproses frame, dan tarif baca cache $0.25-nya membuat konteks panjang yang repetitif menjadi terjangkau. Melalui OrcaRouter, model ini dilayani pada harga daftar Alibaba tanpa markup, sehingga tarif itu diteruskan tanpa perubahan dan setiap pergerakan harga di masa mendatang sampai ke tagihan Anda pada hari yang sama, dengan failover otomatis jika endpoint utama mengalami degradasi — layak dimiliki pada beban kerja yang seluruh nilainya adalah konteks panjang yang akan mahal untuk dimulai ulang.

Screenshot of the OrcaRouter model page for Qwen3.8 Max (0902) (model ID qwen/qwen3.8-max-0902), showing a 1M-token context, 131K maximum output, text, image and video input, and pricing of $2.00 input and $6.00 output per million tokens.

Agora-2 tidak ada di OrcaRouter; kami tidak menghostingnya, tidak ada API dan tidak ada bobot, dan satu-satunya pintu masuk adalah pratinjau peramban milik Odyssey sendiri. Yang ditawarkannya adalah artefak riset dalam kategori yang nyaris tidak ada: dunia bersama tempat manusia dan kebijakan RL bertindak pada state yang sama dan setiap peserta mendapat tampilan yang dihasilkan sendiri. Jika Anda membangun sistem multi-agen, pasangan yang layak dihabiskan satu sore adalah yang sudah jelas — mainkan pratinjaunya, tangkap frame dan log state-nya, lalu serahkan keduanya ke model multimodal sejuta token untuk bertanya apa yang sebenarnya terjadi. Agora-2 memberi Anda arena dan mengakui bahwa ia belum mengukur bagian-bagian sulitnya; Qwen3.8-Max adalah instrumen yang bisa melakukannya, dan ia tersedia dengan harga $2/$6 selagi arena itu masih berupa pratinjau.