
Qwen 3.8 vs GLM-5.2: Tolok Ukur Pertama di Mana Keduanya Benar-Benar Tumpang Tindih
- openaiBARUOpenAI: GPT-6 Luna2026-09-2237Kecerdasan
- openaiBARUOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- anthropicBARUAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- grokBARUGrok 4.72026-09-2146Kecerdasan
- OrcaBARUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 juta token
- orcaBARUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token
- deepseekBARUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0345Kecerdasan76Koding
Kedua model ini adalah ekspresi paling jelas dari taruhan yang berlawanan dalam AI open-weight asal China. Zhipu GLM-5.2 ramping dan terbukti: total 753B parameter dengan hanya 40B aktif, indeks Artificial Analysis Intelligence 51 yang telah diaudit, bobot yang dapat diunduh sejak Juni 2026, dan harga yang dipublikasikan sebesar $0,95 / $3,00. Alibaba Qwen3.8-Max adalah taruhan maksimalis: ~2,4T parameter, jumlah aktif yang tidak diungkapkan, dan — hingga baru-baru ini — tidak ada angka sama sekali.
Ketersediaan umum pada 3 Agustus 2026 memberikan pertandingan ini sesuatu yang tidak dimiliki artikel lain dalam seri ini: sebuah tolok ukur yang memiliki skor untuk kedua model. Alibaba melaporkan Terminal-Bench 2.1 sebesar 86.6; Artificial Analysis mencatat GLM-5.2 yang diaudit sebesar 82.7 pada tes yang sama. Untuk pertama kalinya, klaim Qwen dapat disejajarkan dengan angka kompetitor yang diukur secara independen di landasan yang sama — dengan catatan penting bahwa hanya satu dari keduanya yang dihasilkan oleh wasit.
Catatan untuk para pengembang — cara tercepat untuk menyelesaikan ini adalah dengan menjalankan keduanya pada prompt Anda sendiri. OrcaRouter menampilkan 200+ model melalui satu endpoint yang kompatibel dengan OpenAI, sehingga Anda dapat mempertemukan Qwen 3.8 Max melawan GLM-5.2 pada tugas yang sama tanpa harus merangkai dua SDK.
TL;DR: Kesimpulan. Pada satu tolok ukur bersama, Qwen mengklaim keunggulan 3.9 poin di Terminal-Bench 2.1 (86.6 vs 82.7) — hasil nyata jika terulang, meskipun angka Qwen dilaporkan sendiri dan angka GLM diaudit. Di semua hal lain, GLM-5.2 memiliki keunggulan praktis: yaitu ~2× lebih murah dengan harga $0.95 / $3.00 dibandingkan $2 / $6 milik Qwen, bobotnya dapat diunduh hari ini, parameter aktifnya yang 40B membuatnya benar-benar dapat digunakan, dan ia membawa skor indeks independen 51 yang tidak dimiliki Qwen. Qwen menjawab dengan konteks 1M-token dengan tarif datar, multimodalitas bawaan yang tidak dimiliki GLM, dan batas potensi yang lebih tinggi. Ramping dan teruji masih mengungguli besar dan belum terverifikasi untuk produksi — tetapi kesenjangan menyempit pada 3 Agustus.
Poin-poin penting
• Perbandingan tolok ukur langsung pertama dalam seri ini: Terminal-Bench 2.1 — Qwen3.8-Max 86.6 (dilaporkan Alibaba) melawan GLM-5.2 82.7 (Artificial Analysis, diaudit). Qwen unggul 3,9 poin, tetapi kedua angka tersebut tidak sama kredibelnya.
• GLM-5.2 harganya kira-kira setengahnya: $0.95 / $3.00 per 1M (AA blended ~$0.90) dibandingkan Qwen3.8-Max $2 / $6.
• Parameter aktif adalah cerita arsitektur yang sebenarnya: GLM-5.2 menggunakan 40B aktif dari total 753B. Alibaba masih belum mengungkapkan jumlah aktif Qwen, yang membuat biaya penyajiannya tidak dapat dimodelkan.
• Bobot GLM dapat diunduh hari ini; Bobot Qwen dijanjikan dalam minggu ini, tetapi belum ada lisensi atau repositorinya.
• GLM-5.2 memiliki indeks teraudit 51. Qwen3.8-Max masih belum diberi skor — meskipun pendahulunya Qwen3.7-Max mendapat skor 46, di bawah GLM.
• Penawaran unik Qwen: jendela 1M-token dengan tarif flat tanpa biaya tambahan untuk prompt panjang, plus input teks/gambar/video asli dan OmniDocBench 1.5 92.1. GLM-5.2 berfokus pada teks.
Catatan akurasi: semua angka kualitas Qwen3.8-Max dilaporkan oleh Alibaba dan belum diverifikasi pihak ketiga. Angka GLM-5.2 berasal dari Artificial Analysis. Membandingkan skor laporan sendiri dengan skor yang diaudit pada tolok ukur yang sama bersifat informatif tetapi tidak konklusif — kerangka kerja vendor dan kerangka kerja evaluator berbeda. Harga Qwen adalah kartu tarif GA dan menggantikan diskon pratinjau bulan Juli.
Spesifikasi dan harga, berdampingan
Berikut adalah data konkret, setiap angka diatribusikan pada sumbernya.
• Pembuat / status — Qwen3.8-Max: Alibaba; GA (3 Agustus 2026); GLM-5.2: Zhipu; dirilis Juni 2026
• Arsitektur — Qwen3.8-Max: ~2.4T total, sparse MoE; GLM-5.2: 753B total, sparse MoE (Artificial Analysis)
• Parameter aktif — Qwen3.8-Max: Masih dirahasiakan oleh Alibaba; GLM-5.2: 40B aktif (Artificial Analysis)
• Jendela konteks — Qwen3.8-Max: 1M token, tarif tetap (983.616 dengan berpikir; keluaran maksimal 131.072); GLM-5.2: 1M token (Artificial Analysis)
• Terminal-Bench 2.1 — Qwen3.8-Max: 86.6 (dilaporkan Alibaba); GLM-5.2: 82.7 (Artificial Analysis, diaudit)
• AA Intelligence Index — Qwen3.8-Max: Belum diberi skor; GLM-5.2: 51 (Artificial Analysis)
• Skor lain yang dilaporkan vendor — Qwen3.8-Max: GPQA Diamond 92.6, OSWorld-Verified 86.1, FrontierSWE 73.5 (dilaporkan Alibaba); GLM-5.2: statusnya diukur oleh pihak ketiga
• Modalitas — Qwen3.8-Max: Teks, gambar, video masuk → teks keluar; GLM-5.2: Berfokus pada teks
• Harga (input/output) — Qwen3.8-Max: $2.00 / $6.00 per 1M, flat; input yang di-cache $0.25; GLM-5.2: $0.95 / $3.00 per 1M (AA gabungan ~$0.90)
• Bobot terbuka — Qwen3.8-Max: Dijanjikan dalam minggu ini (belum ada lisensi); GLM-5.2: Ya — dapat diunduh hari ini
Dua hal membingkai perbandingan ini, dan yang pertama adalah titik data paling berguna di seluruh rangkaian ini.
Pertama, tumpang tindih Terminal-Bench benar-benar informatif. Terminal-Bench 2.1 mengukur apakah sebuah model dapat mengoperasikan shell nyata hingga tuntas — menjalankan perintah, membaca keluaran, memulihkan diri dari kesalahan. Ini adalah proksi terdekat yang tersedia untuk "dapatkah ini berfungsi sebagai agen pengodean, bukan sekadar pemberi saran kode," dan ini adalah tolok ukur yang dipilih kedua vendor untuk dilaporkan. Skor 86,6 milik Qwen melawan 82,7 milik GLM yang telah diaudit adalah keunggulan 3,9 poin bagi Qwen.
Peringatan ini penting tetapi tidak boleh dilebih-lebihkan. Harness vendor dan harness evaluator berbeda dalam hal scaffolding, kebijakan retry, dan konstruksi prompt, dan pilihan-pilihan tersebut dapat menggeser skor Terminal-Bench lebih dari empat poin. Jadi, ini bukan bukti bahwa Qwen adalah model agentik yang lebih baik. Yang benar-benar ditetapkan adalah bahwa klaim yang dilaporkan sendiri oleh Qwen berada pada kisaran kompetitif yang sama dengan model frontier open-weight yang telah diaudit, bukan pada wilayah yang tidak masuk akal. Itu adalah posisi yang secara bermakna lebih kuat daripada "tanpa skor".
Kedua, perbandingan arsitektur adalah tempat GLM diam-diam menang. GLM-5.2 mengaktifkan 40B parameter dari 753B. Angka tunggal itu memberi tahu Anda biaya penyajiannya, profil latensinya, dan bahwa tim yang diperlengkapi dengan baik sebenarnya dapat menjalankannya. Alibaba masih belum memublikasikan jumlah aktif Qwen — yang berarti bahwa untuk semua hal yang disampaikan oleh judul 2.4T, tidak ada seorang pun di luar Alibaba yang dapat memperkirakan biaya untuk menyajikan Qwen3.8-Max atau bagaimana perilakunya jika di-host sendiri. Dalam perbandingan Mixture-of-Experts, itu bukan catatan kaki; itu adalah angka yang paling penting yang hilang.

Ramping dan terbukti vs besar dan belum terverifikasi
Argumen GLM-5.2 dibangun di atas posisi rekayasa yang koheren: lakukan lebih banyak dengan lebih sedikit, publikasikan angkanya, kirimkan bobotnya. Model dengan 40B parameter aktif murah untuk disajikan, cepat secara desain, dan dapat di-deploy oleh tim dengan anggaran GPU yang serius tetapi tidak absurd. Indeks terauditnya sebesar 51 dan Terminal-Bench teraudit sebesar 82.7 berarti pembeli tidak menerima sesuatu begitu saja. Dan pada harga $0.95 / $3.00, harganya kira-kira setengah harga Qwen.
Argumen Qwen3.8-Max adalah taruhan yang berlawanan: bangun model terbesar yang Anda bisa dan biarkan kapabilitas membenarkan biayanya. GA membuat argumen itu jauh lebih kuat daripada sebelumnya, karena akhirnya ada angka-angka yang menyertainya — GPQA Diamond 92.6 pada sains pascasarjana, OSWorld-Verified 86.1 pada operasi GUI, FrontierSWE 73.5 dibandingkan dengan 40.7 milik pendahulunya, dan Terminal-Bench 86.6 yang dibahas di atas. Angka-angka itu berbentuk frontier, dan peningkatan yang hampir dua kali lipat pada FrontierSWE adalah jenis lompatan generasional yang sulit untuk dipalsukan sepenuhnya.
Namun dua kesenjangan tetap ada, dan keduanya adalah dua hal yang sama yang penting pada bulan Juli, yaitu tidak ada skor independen — Artificial Analysis dan LMArena tetap tidak diberi skor pada Qwen3.8-Max, jadi setiap klaim kualitas adalah milik Alibaba sendiri. Dan juga tidak ada lisensi, sehingga janji bobot terbuka belum dapat dievaluasi secara komersial.
Jangkar historis lebih merugikan Qwen di sini daripada di kebanyakan pertandingan: pendahulunya, Qwen3.7-Max, mencetak 46 pada indeks AA, di bawah GLM-5.2 yang mencapai 51. Jadi klaim implisit Alibaba bukan sekadar bahwa Qwen3.8-Max bagus, tetapi bahwa ia melonjak dari di bawah GLM menjadi jauh di atasnya dalam satu generasi. Peningkatan FrontierSWE memberi kredibilitas pada klaim tersebut. Skor independen akan menyelesaikannya.

Biaya dalam praktik: di mana 2× berakhir
Ambil pipeline pengkodean agen: 180,000 token konteks repositori, 10,000 token keluaran per proses.
• GLM-5.2: 0.18M × $0.95 = $0.171, ditambah 0.01M × $3.00 = $0.03. ≈ $0.20 per run.
• Qwen3.8-Max: 0.18M × $2 = $0.36, ditambah 0.01M × $6 = $0.06. ≈ $0.42 per proses.
• Pada 3.000 run/hari: GLM ≈ $603/hari; Qwen ≈ $1.260/hari — terpaut sekitar $20.000/bulan.
• Dengan input cache Qwen sebesar $0,25/1M pada repositori yang stabil, biayanya turun menjadi ≈ $0,11, yang sebenarnya lebih murah daripada biaya GLM tanpa cache.
Baris terakhir itu adalah hal yang paling berguna secara praktis dalam perbandingan ini. Harga utama Qwen dua kali lipat GLM, tetapi tingkat cache-hit-nya sebesar $0,25 per 1M cukup agresif sehingga pipeline yang ter-cache dengan baik dapat membalikkan peringkat. Jika agen Anda membaca ulang konteks yang sebagian besar tidak berubah di setiap giliran — yang menggambarkan sebagian besar agen coding — Qwen mungkin menjadi opsi yang lebih murah dalam praktiknya meskipun kartu tarifnya lebih buruk. Tim yang tidak mengonfigurasi caching akan membayar dua kali lipat tanpa mendapatkan apa pun.
Kedua model menagih token pemikiran sebagai output, sehingga konfigurasi yang intensif penalaran membutuhkan biaya lebih besar daripada perkiraan ini di kedua sisi.
Kemampuan deploy: sumbu yang dimiliki GLM
Keduanya adalah model MoE open-weight Tiongkok dengan klaim konteks 1M-token, yang menjadikan deployabilitas sebagai pembeda praktis paling tajam.
Bobot GLM-5.2 telah dapat diunduh sejak Juni, dan pada 40B aktif, ini adalah target self-hosting yang realistis — dapat dikuantisasi, dapat dilayani pada jumlah GPU yang wajar, dan sudah banyak digunakan oleh komunitas.
Bobot Qwen3.8-Max dijanjikan dalam minggu ini, tetapi model unggulan tersebut bukan target yang realistis bagi siapa pun: kira-kira 1.2TB pada 4-bit dibandingkan sekitar 141GB per H200 berarti delapan atau lebih akselerator kelas atas, dan jumlah parameter aktif yang tidak diungkapkan membuat throughput yang dihasilkan tidak mungkin diprediksi. Tambahkan lisensi yang hilang dan menghosting sendiri model unggulan tersebut, untuk saat ini, bukanlah sebuah rencana.
Yang diumumkan secara bersamaan Qwen3.8-27B adalah jawaban otentik Alibaba pada sumbu ini. Juga membuka bobotnya dan dilaporkan berjalan di sekitar 17GB VRAM — sebuah kartu kelas atas tunggal, jauh di bawah jejak GLM-5.2 — ini bersaing langsung dalam hal keterpakaian. Jika minat Anda pada salah satu model adalah menjalankannya sendiri, perbandingan Qwen 27B versus GLM-5.2 adalah yang sebenarnya akan penting, dan ini pertarungan yang jauh lebih ketat daripada 2.4T versus 753B.
FAQ
Apakah Qwen 3.8 lebih baik daripada GLM-5.2?
Pada satu benchmark yang mereka sama-sama jalani, Qwen mengklaim keunggulan — Terminal-Bench 2.1 86.6 dibandingkan dengan 82.7 milik GLM yang telah diaudit. Namun angka Qwen dilaporkan sendiri, sedangkan GLM diukur oleh Artificial Analysis, dan perbedaan harness dapat melebihi selisih empat poin. GLM-5.2 juga memiliki indeks teraudit sebesar 51, sementara Qwen tidak memiliki skor independen sama sekali. GLM adalah pilihan yang lebih aman; Qwen memiliki batas atas yang lebih tinggi namun belum terverifikasi.
Bagaimana perbandingan mereka pada Terminal-Bench 2.1?
Qwen3.8-Max melaporkan 86.6; Artificial Analysis mengukur GLM-5.2 pada 82.7. Itu adalah keunggulan nominal 3,9 poin untuk Qwen dan tumpang tindih tolok ukur yang sama pertama di antara keduanya. Anggaplah itu sebagai bukti bahwa Qwen kompetitif di kisaran tersebut, bukan bukti bahwa ia unggul, karena hanya angka GLM yang diproduksi secara independen.
Yang mana yang lebih murah?
GLM-5.2 pada kartu tarif — $0.95 / $3.00 per 1M (blended AA sekitar $0.90) versus Qwen yang $2 / $6, kira-kira setengahnya. Namun input cache Qwen sebesar $0.25 per 1M cukup agresif sehingga pipeline dengan cache berat bisa menjadi lebih murah di Qwen daripada GLM yang tanpa cache.
Berapa banyak parameter aktif yang digunakan Qwen 3.8 Max?
Alibaba belum pernah memublikasikan angka tersebut, bahkan saat ketersediaan umum. Angka itulah yang menentukan biaya penyajian dan latensi dalam model Mixture-of-Experts, sehingga ketiadaannya merupakan kesenjangan yang nyata. GLM-5.2, sebaliknya, terdokumentasi dengan 40B aktif dari total 753B.
Mana yang sebenarnya bisa saya self-host?
GLM-5.2 hari ini — bobotnya sudah rilis dan 40B aktif membuatnya mudah digunakan. Bobot Qwen3.8-Max dijanjikan dalam minggu ini, tetapi model andalannya membutuhkan delapan GPU atau lebih kelas H200 dengan ~1.2TB dalam 4-bit, dan lisensinya belum diterbitkan. Qwen3.8-27B yang diumumkan bersamaan, dilaporkan membutuhkan ~17GB VRAM, adalah opsi Qwen yang dapat diterapkan dan lebih cocok dengan ceruk pasar GLM.
Apakah Qwen 3.8 Max sudah keluar dari pratinjau?
Ya, pada 3 Agustus 2026, dengan kartu tarif yang dipublikasikan dan endpoint yang kompatibel dengan OpenAI dan DashScope. Kampanye kredit Qoder dengan diskon 90% bulan Juli tidak lagi menggambarkan cara penjualannya.
Apa yang ditawarkan Qwen yang tidak ditawarkan GLM-5.2?
Multimodalitas asli — masukan gambar dan video, dengan skor OmniDocBench 92.1 yang dilaporkan sendiri untuk penguraian dokumen — dan konteks 1M-token yang ditagih dengan tarif tetap tanpa biaya tambahan untuk prompt panjang. GLM-5.2 berfokus pada teks, jadi untuk pipeline dokumen, tangkapan layar, atau video, Qwen tidak terlalu bersaing dengannya melainkan melakukan hal lain.
Intinya
Qwen 3.8 vs GLM-5.2 adalah pertarungan di mana ketersediaan umum memberikan informasi yang paling benar-benar baru. Untuk pertama kalinya, Qwen memiliki skor pada tolok ukur yang juga telah dijalankan oleh evaluator independen, dan skornya berada di atas GLM: Terminal-Bench 2.1 86.6 berbanding 82.7. Hal ini menggerakkan Qwen dari "belum dinilai" menjadi "secara terukur layak bersaing," yang merupakan kemajuan nyata bahkan dengan memperhitungkan catatan yang dilaporkan sendiri.
Tetapi GLM-5.2 mempertahankan mahkota praktis, dan ia melakukannya dengan kekuatan yang tidak mencolok: setengah harga, indeks teraudit sebesar 51, 40B parameter aktif yang membuat ekonominya dapat diprediksi dan penerapannya dapat dicapai, serta bobot yang dapat Anda unduh sekarang juga. Jawaban Qwen — konteks sejuta token dengan tarif tetap, multimodalitas bawaan, dan plafon yang lebih tinggi — bermakna tetapi bersyarat, dan dua celah Juli-nya tidak berubah: tidak ada skor independen dan tidak ada lisensi. Perhatikan tiga hal: skor Intelligence Index independen pertama untuk Qwen3.8-Max, apakah seorang evaluator mereproduksi angka 86.6 Terminal-Bench tersebut, dan rilis Qwen3.8-27B, yang merupakan tempat kedua filosofi ini benar-benar akan berbenturan. Sampai saat itu, GLM-5.2 adalah yang Anda rilis dan Qwen3.8-Max adalah yang Anda evaluasi — dengan caching diaktifkan.

Dibandingkan dalam artikel ini3
Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari
