
AREX-2 vs Qwen 3.8: Yang Satu Adalah Substrat, yang Satunya Lagi Mungkin Dibangun di Atasnya
- typesafeBARUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 507 tok/s
- OpenAIBARUOpenAI: GPT-6 Luna2026-09-2237Kecerdasan
- OpenAIBARUOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- AnthropicBARUAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- xAIBARUGrok 4.72026-09-2146Kecerdasan
- OrcaBARUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 juta token · 194 tok/s
- OrcaBARUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 1143 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 juta token · 55 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 106 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- xAISpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
Pertandingan antara AREX-2 dan Qwen3.8-Max tampak seperti pertarungan langsung antara sistem unggulan dua laboratorium Tiongkok, dan bukanlah demikian — bukan karena AREX-2 belum terbukti, meskipun memang begitu, tetapi karena keduanya berada di lapisan yang berbeda dari stack yang sama. Qwen3.8-Max telah aktif sejak 3 Agustus 2026, dengan $2 per juta token masukan dan $6 per juta token keluaran dengan jendela konteks 1 juta token; saudara-saudaranya dengan bobot terbuka, Qwen3.8-27B dan Qwen3.8-Flash, dirilis pada 13 Agustus dan 26 Agustus dengan tolok ukur dan harga yang dipublikasikan. AREX-2 adalah repositori yang dibuat BAAI di Hugging Face pada 29 September 2026 pukul 17:56 UTC, yang berisi .gitattributes dan tidak ada yang lain. Dan alasan keduanya bukan rival terletak pada fakta mendasar yang tidak diiklankan secara lantang oleh vendor mana pun: setiap model AREX yang sejauh ini dirilis BAAI dibangun di atas tulang punggung Qwen.
Itu bukan spekulasi tentang AREX-2. Itu terdokumentasi untuk generasi yang sudah ada. AREX-Base adalah mixture-of-experts 122 miliar parameter dengan 10 miliar parameter aktif yang dibangun di atas Qwen3.5-122B-A10B, dan AREX-Turbo adalah 4B padat yang dibangun di atas Qwen3.5-4B; keduanya dirilis pada 23 Juli 2026 di bawah Apache 2.0. Jadi bentuk jujur dari perbandingan ini bukanlah agen versus model unggulan. Melainkan: apa manfaat substrat Alibaba bagi Anda hari ini, apa yang ditambahkan lapisan agen BAAI di atasnya, dan berapa banyak dari pertanyaan kedua yang dapat dijawab sebelum BAAI mengunggah sebuah berkas?
Apa yang sudah aktif di sisi Qwen, dan berapa biayanya
Generasi Qwen3.8 luar biasa mudah dinalar karena spesifikasinya lengkap dan harganya dipublikasikan secara terbuka, pada tiga tingkatan yang berbeda.
• Qwen3.8-Max — dirilis 3 Agustus 2026. Jendela konteks 1M token, input teks, gambar, dan video native, mode berpikir, pemanggilan fungsi dan output terstruktur, serta tiga format wire (kompatibel OpenAI, kompatibel Anthropic, dan DashScope native) di lima wilayah. $2,00 per juta token input dan $6,00 per juta output, dengan pembacaan cache sebesar $0,25.
• Qwen3.8-27B — dirilis 13 Agustus 2026. Dense, 27B parameter, konteks 256K (262.144 posisi), masukan teks, gambar, dan video, bobot Apache 2.0. Dipublikasikan di kartu milik Qwen sendiri pada 90,3 di LiveCodeBench v6, 89,2 di GPQA Diamond, 84,3 di OSWorld-Verified, dan 79,0 di QwenSWEBench — dilaporkan oleh vendor, tidak direproduksi secara independen. Pengukuran independen menempatkannya pada Artificial Analysis Intelligence Index 33,7 dan 68,1 pada indeks AA Coding.
• Qwen3.8-Flash — dirilis 26 Agustus 2026. Jendela 1 juta token yang sama dan input multimodal yang sama, dengan $0,15 per juta token input dan $0,47 output. Tingkat murah dari keluarga ini, dan yang membuat lalu lintas agentik bervolume tinggi terjangkau.
Ada juga Qwen3.8 entri yang belum diberi tag: model unggulan dengan 2,4 triliun parameter yang bobotnya menurut Alibaba akan segera hadir, dan yang belum bisa dipanggil di mana pun. Jika Anda mencari "Qwen 3.8" dan mengharapkan satu model, itulah sebabnya jawabannya adalah keluarga yang terdiri dari empat model, bukan satu.

Berbeda dengan semua itu, spesifikasi AREX-2 hanya sepanjang satu baris: sebuah repositori, sebuah stempel waktu, dan sebuah nama yang menyiratkan generasi kedua dari sesuatu yang pernah dibangun BAAI sekali.
Detail yang membingkai ulang seluruh perbandingan
AREX bukan pesaing bagi Qwen; AREX adalah konsumennya. Kedua model AREX generasi pertama dilatih lanjutan pada backbone Qwen3.5 lalu dibungkus dalam kerangka kerja yang menjadikannya agen, bukan model obrolan: loop dalam yang mencari, menjelajah, dan mengintegrasikan bukti ke dalam jawaban kandidat yang membawa angka keyakinan, serta loop luar yang memeriksa jawaban itu terhadap batasan awal dan entah menerimanya, menyempurnakannya, atau membuang lintasan tersebut lalu memulai lagi. Rekayasa menarik dalam AREX bukanlah jaringannya. Melainkan loop, mekanisme pembaruan konteks yang menjaga temuan terverifikasi, kandidat terbuka, dan batasan yang belum terselesaikan tetap tertata sepanjang horizon panjang, serta antarmuka alat yang memaparkan pencarian dan penjelajahan kepada model sebagai tindakan kelas satu.
Itulah sebabnya angka-angka yang diterbitkan sendiri oleh keluarga ini — 82,5 pada BrowseComp, 85,4 pada GAIA, 71,0 pada xbench-2510, 89,9 pada DeepSearch QA dan 82,0 pada WideSearch-en untuk 122B Base, dengan 70,7 / 81,6 / 57,0 / 78,5 / 68,5 untuk 4B Turbo — tidak dapat dibandingkan dengan skor pengodean dan agentik Qwen3.8-27B, meskipun keduanya berbagi garis keturunan arsitektural. Keduanya mengukur hal yang berbeda. QwenSWEBench menanyakan apakah sebuah model dapat menyelesaikan masalah repositori. BrowseComp menanyakan apakah sebuah agen dapat menemukan fakta yang sengaja dibuat sulit ditemukan, melalui banyak pencarian, tanpa kehilangan pertanyaannya. Checkpoint Qwen3.5 mentah mendapat skor buruk pada yang kedua dan baik pada yang pertama, yang justru merupakan kesenjangan yang ingin ditutup oleh pasca-pelatihan dan harness BAAI.

Apa yang paling masuk akal menjadi generasi kedua
Jika AREX-2 melanjutkan pola tersebut, tafsiran yang paling mungkin — inferensi, bukan fakta — adalah agen riset generasi kedua yang menjalani pasca-pelatihan pada backbone Qwen yang lebih baru daripada generasi 3.5 yang digunakan model AREX saat ini. Qwen3.8-27B bersifat dense, multimodal, dan Apache 2.0, yang menjadikannya kandidat alami untuk agen tingkat kualitas; Qwen3.8-Flash murah per token, yang sangat penting ketika agen Anda melakukan puluhan panggilan per kueri dan membaca ulang konteks yang terus bertambah pada setiap langkah.
Tak satu pun dari itu yang terkonfirmasi. Nama itu tidak membawa ukuran, tidak ada tulang punggung, dan tidak ada tanggal, dan angka "2" dalam lini produk lebih merupakan konvensi penamaan ketimbang spesifikasi. Yang terkonfirmasi jauh lebih sempit dan seharusnya dinyatakan seperti itu: BAAI membuat repositori tersebut pada 29 September 2026, tidak menaruh apa pun di dalamnya, dan tidak mengumumkan apa pun. Tidak ada bobot, tidak ada kartu, tidak ada jumlah parameter, tidak ada tag lisensi, tidak ada tolok ukur, tidak ada penyedia yang menyajikannya. Jika Anda melihat angka AREX-2 dikutip di mana pun minggu ini, itu bukan hasil pengukuran.
Apa yang sebenarnya bisa Anda beli sore ini
Asimetri praktis antara keduanya bukanlah kualitas, melainkan bahwa satu pihak memiliki daftar tarif dan pihak lainnya memiliki entri direktori.
Jika pekerjaan Anda bersifat agentik dan Anda menginginkan substrat tempat keluarga AREX dibangun, backbone persisnya dapat dipanggil: Qwen3.5-122B-A10B ada di katalog OrcaRouter dengan harga $0.115 per juta token input dan $0.917 per juta output hingga 128K token, naik menjadi $0.287 / $2.294 di luar itu, dengan visi, penggunaan alat, dan penalaran yang diaktifkan. Itulah model yang di-post-train oleh AREX-Base, tersedia tanpa menunggu apa pun.
Jika Anda menginginkan generasi saat ini, kedua tier Qwen3.8 terbuka ada di katalog: Qwen3.8-27B dengan $0.33 per juta input dan $2.40 output, berjalan di infrastruktur kami sendiri karena bobotnya terbuka dan tidak ada biaya per token vendor yang harus diteruskan, dan Qwen3.8-Flash dengan $0.15 / $0.47 untuk tier volume. Satu API mencakup keduanya, harga daftar penyedia diteruskan tanpa tambahan per token, jadi ketika Alibaba mengubah harga, angka di sini berubah pada hari yang sama.
Dan ketika AREX-2 benar-benar dirilis, alasan ia berada di belakang lapisan yang sama bersifat struktural, bukan promosional. Loop agen yang melakukan dua puluh panggilan per kueri mengalikan tingkat kegagalan setiap penyedia dengan dua puluh; aturan perutean dengan failover otomatis yang memutuskan saat runtime adalah perbedaan antara timeout yang menjadi percobaan ulang dan timeout yang menjadi jawaban yang salah dengan penuh keyakinan. Argumen itu berlaku untuk agen riset apa pun, dan akan berlaku untuk AREX-2 kapan pun ada AREX-2 untuk dirutekan.
Siapa yang harus bertindak, dan atas apa
Jika Anda membutuhkan agen riset hari ini, AREX-Base adalah model AREX yang ada, dirilis pada Juli di bawah Apache 2.0, dan benchmark agennya milik vendor sendiri tetapi setidaknya terlampir pada model yang dapat diunduh. Jika Anda membutuhkan penalaran multimodal terdepan atau trafik agentik bervolume tinggi hari ini, tier Qwen3.8 sudah aktif, sudah diberi harga dan sebagian dinilai secara independen, dan tidak ada apa pun tentang keberadaan AREX-2 yang mengubah keputusan itu.
Satu-satunya skenario di mana AREX-2 penting bagi keputusan yang Anda buat minggu ini adalah saat Anda memilih backbone untuk fine-tune. Dan di situ jawabannya sudah terlihat di katalog: backbone 3.5 yang digunakan AREX masih murah dan tersedia, generasi 3.8 lebih baik dan juga tersedia, dan AREX generasi kedua — kapan pun ia hadir — hampir pasti akan menjadi bukti tentang basis Qwen mana yang menurut BAAI layak untuk dibangun di atasnya, bukan pengganti bagi basis itu.
Tiga hal akan menyelesaikan sisanya: berkas di dalam tree, sebuah kartu dengan jumlah parameter dan kolom model dasar, serta tag lisensi. Yang pertama dari hal-hal itu adalah yang penting, karena sampai itu terwujud, perbandingan ini adalah antara keluarga yang sudah dipatok harganya dan sebuah placeholder.
