
Agora-2 vs Qwen 3.8 Max: Satu Model Menonton Video, yang Lain Membuatnya
- typesafeBARUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 36 tok/s
- openaiBARUOpenAI: GPT-6 Luna2026-09-2237Kecerdasan
- openaiBARUOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- anthropicBARUAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- grokBARUGrok 4.72026-09-2146Kecerdasan
- OrcaBARUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 juta token · 181 tok/s
- orcaBARUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
Ada inversi yang menarik di inti pasangan ini. Qwen3.8-Max — model unggulan vendor tersebut, diluncurkan pada 3 Agustus 2026 dan diperbarui pada 2 September, dengan harga $2,00/$6,00 per juta token — membaca video secara native, bersama teks dan gambar, dalam jendela konteks 1.000.000 token. Agora-2, model dunia multi-agen Odyssey yang dipratinjau pada 21 September 2026, menghasilkan video: stream 640×480 yang dihasilkan per peserta, lima belas pembaruan laten per detik, untuk hingga 20 manusia dan agen yang berbagi satu dunia simulasi. Satu model dibangun untuk mengonsumsi frame dan menjelaskannya; model lainnya dibangun untuk memancarkan frame dan memungkinkan peserta bertindak di dalamnya. Gabungkan keduanya dan Anda mendapatkan sesuatu yang tidak pernah menjadi tujuan awal kedua vendor untuk dibuat — cara untuk menganalisis simulasi multi-agen dengan model bahasa yang benar-benar dapat menontonnya.
Kedua sisi bingkai
Qwen3.8-Max adalah tier dengan kemampuan tertinggi milik Alibaba dan objeknya yang paling konvensional: model multimodal native yang menerima teks, gambar, dan video, dengan konteks sejuta token, 131.072 token keluaran, penggunaan alat native, dan Artificial Analysis Intelligence Index sebesar 45 pada indeks v4.3.2. Liputan sebelumnya tentang peluncuran Agustus menyebutkan angka 40 — angka itu berasal dari revisi indeks sebelumnya dan tidak boleh disandingkan dengan yang ini. Artificial Analysis mengukurnya pada 88,8 di terminal-bench 2.1 dan 92,8 di GPQA Diamond. Alibaba memposisikannya secara langsung melawan GPT-5.5, Claude Opus 4.7, dan Gemini 3.1 Pro dalam panduan migrasinya sendiri, merekomendasikannya setiap kali suatu tugas membutuhkan penalaran terkuat yang tersedia.
Spesifikasi Agora-2 hampir sepenuhnya berbeda dari itu. Empat komponen renderer, satu per tampilan, masing-masing adalah model enam belas blok dengan lebar 2.048 yang menghasilkan perspektif satu peserta. Model simulasi dengan empat lapisan dan lebar 256 yang memprediksi pergerakan, pertempuran, dan animasi di seluruh empat belas cabang pergerakan diskret dari riwayat entitas empat langkah. Status dunia bersama yang menyimpan identitas, posisi, kesehatan, animasi, kematian, dan respawn, sehingga properti entitas tetap ada secara independen dari kamera tertentu — entitas di luar frame mempertahankan posisinya alih-alih direkonstruksi saat muncul kembali. Tidak ada jendela konteks karena tidak ada bahasa. Kendala yang setara adalah riwayat visual per tampilan yang terbatas, diatur ulang saat kematian, respawn, dan diskontinuitas kamera.
• Keluaran — video Agora-2 640×480 per peserta, target 30 fps vs teks Qwen3.8-Max, hingga 131.072 token per respons
• Masukan — kontrol browser Agora-2 ditambah 16 kebijakan agen RL vs teks, gambar, dan video Qwen3.8-Max
• Skor independen — Agora-2 tidak ada yang dipublikasikan vs Qwen3.8-Max AA Intelligence Index 45 (v4.3.2)
• Harga — Agora-2 tidak ada yang dipublikasikan, hanya pratinjau vs Qwen3.8-Max $2.00/$6.00 per 1Jt, $0.25 pembacaan cache
• Memori — state bersama Agora-2 plus riwayat per-tampilan yang dibatasi vs konteks 1.000.000 token Qwen3.8-Max
• Akses — Agora-2 tanpa API, tanpa bobot vs API proprietary Qwen3.8-Max, konteks 1M


Apa yang ditambahkan sebuah model pembaca video pada simulator dunia bersama
Argumen Odyssey untuk membangun Agora-2 adalah bahwa interaksi multi-agen telah menjadi sesuatu yang layak dipelajari dalam kondisi terkendali, dan perusahaan itu menyebut insiden Juli 2026, ketika sekitar 1.200 agen di dalam sandbox evaluasi mengorganisasi intrusi selama beberapa hari, sebagai bukti mengapa demikian. Bagian sulit dari penelitian semacam itu bukanlah menghasilkan interaksi — melainkan menafsirkannya. Model dunia yang memancarkan ribuan bingkai dari dua puluh peserta yang berinteraksi menghasilkan rekaman dalam jumlah yang tidak dapat ditonton oleh tim manusia mana pun.
Di situlah model dengan input video native berhenti menjadi ketidakcocokan kategori dan menjadi sebuah komponen. Sebuah sesi Agora-2, dari luar, persis seperti yang diklaim Qwen3.8-Max dapat dicerna: video, pada resolusi yang dikonfirmasi laporan mampu ditanganinya, dengan entitas yang identitas, kesehatan, dan status animasinya dirender oleh model dari skema bersama yang eksplisit. Pasangkan aliran frame dengan log status — laporan menerbitkan keduanya, dan Gambar 6-nya menunjukkan status pemain dan musuh pada empat tick berturut-turut di samping frame yang dirender — dan Anda memiliki korpus tempat model penalaran yang mampu memproses video dapat ditanya apa yang terjadi, siapa yang memulainya, dan apakah penggambaran visualnya benar-benar cocok dengan status yang tercatat. Pertanyaan terakhir itu adalah salah satu yang dicantumkan laporan sebagai belum dievaluasi: kesesuaian antara tampilan yang dihasilkan secara independen dan kepatuhan tindakan end-to-end keduanya secara eksplisit dibiarkan terbuka.
Konteks sejuta token adalah separuh lainnya. Log status sesi yang panjang, keluaran alat, dan anotasi yang ditranskripsikan muat di dalamnya, yang merupakan perbedaan praktis antara menganalisis satu pertemuan dan menganalisis permainan sepanjang sore.
Di mana angka-angka terverifikasi berhenti
Skor indeks, jendela konteks, modalitas, dan kartu tarif Qwen3.8-Max adalah fakta yang dipublikasikan, diukur secara independen jika dicatat. Penyegarannya pada 2 September menunjukkan Alibaba masih terus mengembangkan tier tersebut.
Angka-angka Agora-2 terdapat dalam laporan teknis Team Odyssey dan tidak memiliki reproduksi di luar perusahaan. Laporan tersebut mengklaim perender awalan-terstruktur pada PSNR 30,11 dB dibandingkan baseline VAE 20,67 dB pada tiga puluh klip pemantauan, dan pengurangan waktu denoiser sebesar 45,8% dari pengondisian self-attention terstruktur versus cross-attention — yang terakhir diukur pada denoiser yang diinisialisasi secara acak dengan input sintetis, yang menurut laporan merupakan tolok ukur biaya eksekusi dan bukan tolok ukur kualitas gambar. Bagian keterbatasannya sendiri adalah bagian yang perlu dibaca dua kali: laju 15-pembaruan-laten dan 30-bingkai-per-detik adalah target, laju bingkai berkelanjutan dan latensi input-ke-tampilan selama permainan multi-agen langsung belum dievaluasi secara kuantitatif, kualitas visual jangka panjang dan kesepakatan lintas-tampilan belum dievaluasi, lingkungannya memerlukan mesin berinstrumentasi dengan geometri eksplisit dan kosakata penampilan yang tetap, dan transfer ke aset, aturan, atau lingkungan baru belum diuji.
Dua dari peringatan itu langsung tertuju pada pasangan yang diusulkan di atas. Jika laju bingkai selama permainan langsung tidak diukur, maka aliran bingkai yang akan Anda suapkan ke model video belum memiliki jaminan throughput. Dan jika kesepakatan lintas-tampilan tidak dievaluasi, maka analisis yang menarik — apakah peristiwa yang sama terlihat konsisten dari empat perspektif — justru merupakan pertanyaan terbuka, bukan masukan yang sudah pasti. Kombinasinya menjanjikan dan sama sekali belum diuji.
Yang mana yang bisa Anda gunakan hari ini?
Qwen3.8-Max kini dapat diterapkan: model multimodal kelas terdepan dengan harga $2/$6, jendela satu juta token, penggunaan alat native, dan indeks 45 yang diukur secara independen. Bagi siapa pun yang melakukan analisis berat video atau dokumen, ini adalah salah satu dari sedikit model pada titik harga tersebut yang benar-benar memproses frame, dan tarif baca cache $0.25-nya membuat konteks panjang yang repetitif menjadi terjangkau. Melalui OrcaRouter, model ini dilayani pada harga daftar Alibaba tanpa markup, sehingga tarif itu diteruskan tanpa perubahan dan setiap pergerakan harga di masa mendatang sampai ke tagihan Anda pada hari yang sama, dengan failover otomatis jika endpoint utama mengalami degradasi — layak dimiliki pada beban kerja yang seluruh nilainya adalah konteks panjang yang akan mahal untuk dimulai ulang.

Agora-2 tidak ada di OrcaRouter; kami tidak menghostingnya, tidak ada API dan tidak ada bobot, dan satu-satunya pintu masuk adalah pratinjau peramban milik Odyssey sendiri. Yang ditawarkannya adalah artefak riset dalam kategori yang nyaris tidak ada: dunia bersama tempat manusia dan kebijakan RL bertindak pada state yang sama dan setiap peserta mendapat tampilan yang dihasilkan sendiri. Jika Anda membangun sistem multi-agen, pasangan yang layak dihabiskan satu sore adalah yang sudah jelas — mainkan pratinjaunya, tangkap frame dan log state-nya, lalu serahkan keduanya ke model multimodal sejuta token untuk bertanya apa yang sebenarnya terjadi. Agora-2 memberi Anda arena dan mengakui bahwa ia belum mengukur bagian-bagian sulitnya; Qwen3.8-Max adalah instrumen yang bisa melakukannya, dan ia tersedia dengan harga $2/$6 selagi arena itu masih berupa pratinjau.
