
Qwen 3.8 vs GPT-5.6: Kini Keduanya Punya Label Harga, Mana yang Menang?
- OrcaBARUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 juta token
- orcaBARUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token
- deepseekBARUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0345Kecerdasan76Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Ketika Alibaba mempratinjau Qwen3.8-Max di Shanghai pada 19 Juli 2026, reaksi komunitas langsung muncul: model dengan 2,4 triliun parameter ini "disebut-sebut lebih unggul dari GPT-5.6 dan hanya sedikit di belakang Fable 5." GPT-5.6 OpenAI dalam varian unggulannya Sol konfigurasi menempati peringkat #2 pada Artificial Analysis Intelligence Index independen, satu poin di bawah Fable 5, jadi itu adalah klaim besar tanpa angka yang dipublikasikan di baliknya.
Dua hal telah berubah sejak saat itu. Qwen3.8-Max tersedia secara umum pada 3 Agustus 2026 dengan daftar tarif nyata dan tabel tolok ukur yang nyata. Dan pada 31 Juli, OpenAI memangkas harga di seluruh keluarga GPT-5.6 — Terra menjadi $2 / $12, Luna menjadi $0,20 / $1,20, dengan Sol tidak berubah di tingkat premium. Jadi perbandingan ini bukan lagi klaim melawan papan peringkat; ini adalah dua model berbayar dan terdokumentasi yang benar-benar dapat dibandingkan.
Catatan untuk para pengembang — cara tercepat untuk menyelesaikan klaim seperti ini adalah dengan menjalankan keduanya pada prompt Anda sendiri. OrcaRouter menempatkan 200+ model di belakang satu endpoint yang kompatibel dengan OpenAI, sehingga Anda dapat mempertandingkan Qwen 3.8 Max melawan GPT-5.6 pada tugas yang sama tanpa harus menyiapkan dua SDK.
Kesimpulan TL;DR. Qwen3.8-Max pada GA dibanderol dengan harga agresif — $2 / $6 per 1M, tetap untuk 1M token — yang menempatkannya pada harga input yang sama dengan GPT-5.6 Terra tetapi setengah biaya output Terra, dan jauh di bawah Sol. Angka yang dilaporkan sendiri kuat (GPQA Diamond 92.6, Terminal-Bench 2.1 86.6). Tetapi GPT-5.6 Sol masih memenangkan dua hal yang menentukan penggunaan produksi: ia adalah #2 yang diaudit pada Artificial Analysis Intelligence Index (~59) dan ia adalah cepat — hingga 750 token/detik pada perangkat keras Cerebras. Qwen3.8-Max tetap belum dinilai oleh evaluator independen mana pun. Jadi Qwen mungkin saja menyamai GPT-5.6 dalam kualitas one-shot dan jelas mengungguli Terra dalam harga output; GPT-5.6 menang dalam bukti yang ditinjau dan dalam throughput, yang sering menjadi penentu utama.
Poin-poin penting
• Qwen3.8-Max telah GA sejak 3 Agustus 2026 dengan harga yang dipublikasikan sebesar $2 / $6 per 1 juta token, tetap di seluruh konteks 1 juta token.
• Dibandingkan dengan GPT-5.6 Terra ($2 / $12 setelah pemotongan OpenAI pada 31 Juli), Qwen menyamai harga input dan membagi dua tarif output. Dibandingkan dengan Sol, Qwen jauh lebih murah.
• GPT-5.6 Sol diaudit #2 pada AA Intelligence Index (~59), dan Artificial Analysis mencatat bahwa ia unggul dalam masalah STEM yang paling sulit. Qwen3.8-Max adalah belum dinilai oleh AA dan LMArena.
• Kecepatan adalah perbedaan yang paling mencolok. GPT-5.6 mencapai hingga 750 token/detik di Cerebras. Qwen adalah model paling lambat dalam pengujian langsung pada pratinjau — temuan yang mendahului layanan GA dan perlu diuji ulang.
• Tabel vendor Qwen kredibel tetapi belum melalui peer review: GPQA Diamond 92.6, PaperBench 93.0, Terminal-Bench 2.1 86.6, OSWorld-Verified 86.1, FrontierSWE 73.5 (naik dari 40.7 milik pendahulunya).
• Keterbukaan memisahkan mereka selamanya: Qwen menjanjikan bobot terbuka dalam minggu ini serta Qwen3.8-27B dengan VRAM ~17GB; GPT-5.6 tertutup dan hanya API.
Catatan akurasi: semua angka kualitas Qwen3.8-Max dilaporkan oleh Alibaba dan belum diverifikasi oleh pihak ketiga. Angka GPT-5.6 berasal dari Artificial Analysis dan mungkin berbeda dari laporan OpenAI sendiri. Harga keluarga GPT-5.6 mencerminkan penurunan harga OpenAI pada 31 Juli 2026. Harga Qwen adalah kartu tarif GA dan menggantikan diskon pratinjau bulan Juli.
Spesifikasi dan harga, berdampingan
Berikut adalah data konkret, setiap angka diatribusikan pada sumbernya.
• Pembuat / status — Qwen3.8-Max: Alibaba; GA (3 Agustus 2026); GPT-5.6 Sol: OpenAI; flagship tertutup (varian Sol / Terra / Luna)
• Arsitektur — Qwen3.8-Max: ~2.4T total, sparse MoE (parameter aktif masih belum diungkapkan); GPT-5.6 Sol: Tertutup; arsitektur tidak diungkapkan
• Jendela konteks — Qwen3.8-Max: 1 juta token (983.616 dengan mode berpikir; output maksimal 131.072); GPT-5.6 Sol: Unggulan konteks panjang
• AA Intelligence Index — Qwen3.8-Max: Belum diberi skor; GPT-5.6 Sol: ~59 — #2 (Artificial Analysis)
• Kekuatan teraudit — Qwen3.8-Max: Tidak ada pihak ketiga; GPT-5.6 Sol: Memimpin dalam masalah STEM tersulit (Artificial Analysis)
• Kekuatan yang dilaporkan vendor — Qwen3.8-Max: GPQA Diamond 92.6, Terminal-Bench 2.1 86.6, OSWorld-Verified 86.1 (dilaporkan Alibaba); GPT-5.6 Sol: n/a
• Kecepatan — Qwen3.8-Max: p50 TTFT 1.64s (telemetri OrcaRouter 7 hari); model paling lambat dalam uji langsung pratinjau; GPT-5.6 Sol: Hingga 750 tok/s di Cerebras (Artificial Analysis)
• Harga (input / output) — Qwen3.8-Max: $2.00 / $6.00 per 1M, flat; input cache $0.25; GPT-5.6: Terra $2 / $12, Luna $0.20 / $1.20, Sol premium (~1/3 dari biaya Fable per AA)
• Bobot terbuka — Qwen3.8-Max: Dijanjikan dalam minggu ini (belum ada lisensi); GPT-5.6: Tidak — tertutup / hanya API
Dua hal membingkai perbandingan ini, dan keduanya baru sejak bulan Juli.
Pertama, kisah harga menjadi benar-benar menarik, bukan sekadar murah. Pada bulan Juli, keunggulan Qwen adalah diskon yang tidak bisa dianggarkan. Sekarang perbandingannya konkret dan terbagi berdasarkan jenjang. Dibandingkan dengan Terra dengan harga $2 / $12, Qwen menyamai tarif input persis dan membagi dua tarif output — keuntungan nyata pada pekerjaan yang sarat penalaran di mana output mendominasi pengeluaran. Dibandingkan dengan Luna dengan harga $0.20 / $1.20, Qwen 10× lebih mahal, dan Luna adalah pilihan yang lebih baik untuk tugas sederhana bervolume tinggi. Dibandingkan dengan Sol, Qwen jauh lebih murah. Jadi "mana yang lebih murah" sekarang memiliki tiga jawaban berbeda tergantung pada GPT-5.6 mana yang Anda maksud — dan cara pandang yang jujur adalah bahwa pemotongan OpenAI pada 31 Juli mempersempit kesenjangan secara signifikan.
Kedua, baris kecepatan masih menjadi titik di mana keduanya paling tajam berbeda, dan masih berpihak pada OpenAI. Artificial Analysis mencatat GPT-5.6 Sol mencapai hingga 750 token/detik pada silicon Cerebras. Tidak ada apa pun dalam materi GA Alibaba yang mengindikasikan Qwen3.8-Max dirancang untuk throughput semacam itu, dan pengulas era pratinjau yang menyebutnya sebagai model paling lambat yang pernah ia gunakan sedang mengukur tepat pada rangkaian agen yang panjang di mana throughput terus bertambah. Jika beban kerja Anda interaktif, agen, atau bervolume tinggi, kesenjangan itu dapat menentukan hasil sebelum kualitas masuk ke dalam percakapan.

Bukti: apa yang tabel tolok ukur GA pastikan dan tidak pastikan
Keputusan Alibaba untuk memublikasikan angka-angka di GA adalah peningkatan nyata dibandingkan pratinjau, di mana pernyataan komunitas "ahead of GPT-5.6" tidak didasari pada apa pun yang dipublikasikan sama sekali. Tabelnya kuat: GPQA Diamond 92.6 pada sains tingkat pascasarjana, PaperBench 93.0 pada mereproduksi hasil penelitian, Terminal-Bench 2.1 86.6 pada mengoperasikan shell sungguhan, OSWorld-Verified 86.1 pada menggerakkan GUI desktop. Lompatan generasional dalam pengodean adalah yang paling menonjol — FrontierSWE 73.5 dibandingkan dengan 40.7 milik pendahulunya, dan DeepSWE 1.1 56.6 dibandingkan dengan 21.6.
Yang tidak dilakukan tabel ini adalah menyelesaikan perbandingan GPT-5.6, karena dua alasan.
Yang pertama adalah asal-usul. Setiap angka dihasilkan oleh Alibaba pada kerangka ujinya sendiri. Tabel-tabel vendor dipilih, bukan diambil sampelnya — sebuah lab memublikasikan tolok ukur yang terlihat bagus dan mengabaikan sisanya. Peringkat #2 Intelligence Index OpenAI, sebaliknya, diberikan oleh evaluator yang tidak memiliki kepentingan terhadap hasilnya. Secara khusus, Artificial Analysis menyebut GPT-5.6 Sol sebagai pemimpin pada tantangan tersulit, yaitu masalah-masalah STEM, yang justru merupakan wilayah yang hendak diklaim oleh GPQA Diamond 92.6 milik Qwen. Salah satu dari klaim tersebut telah diperiksa.
Hal kedua adalah bahwa angka terlemah Alibaba sendiri sangat mengungkapkan. IFBench 82.8 — mengikuti instruksi dalam keterbatasan — adalah skor terendah dalam tabelnya, dan ini sejalan persis dengan kritik era pratinjau yang paling konsisten: modelnya memberikan hasil melebihi permintaan, melampaui ruang lingkup, dan menambahkan hal-hal yang tidak diminta siapa pun. Itu memikat dalam demo, tetapi mahal ketika output ditagih $6 per juta token dan Anda memerlukan format yang tepat. Untuk pipeline agen dengan langkah-langkah hilir yang mengurai output, disiplin mengikuti instruksi lebih penting daripada satu poin GPQA.
Sebagai acuan: pendahulunya, Qwen3.7-Max, mencetak 46 pada Indeks Intelijen AA dibandingkan dengan ~59 milik GPT-5.6 Sol. Menutup selisih tiga belas poin dalam satu generasi akan menjadi lompatan yang luar biasa. Mungkin saja — nyaris dua kali lipatnya FrontierSWE milik Alibaba sendiri menunjukkan kemajuan nyata — tetapi sampai ada wasit yang memublikasikan angka, "unggul dari GPT-5.6" tetap merupakan klaim yang belum terbukti, bukan sebuah hasil.

Biaya dalam praktik: contoh perhitungan di seluruh tingkatan
Ambil agen penalaran yang mengirim 100.000 token konteks dan menghasilkan 10.000 token keluaran per panggilan — bentuk yang khas untuk analisis dokumen atau perencanaan multi-langkah.
• Qwen3.8-Max: 0.1M × $2 = $0.20, ditambah 0.01M × $6 = $0.06. ≈ $0.26 per panggilan.
• GPT-5.6 Terra: 0,1 juta × $2 = $0,20, ditambah 0,01 juta × $12 = $0,12. ≈ $0,32 per panggilan.
• GPT-5.6 Luna: 0,1M × $0,20 = $0,02, ditambah 0,01M × $1,20 = $0,012. ≈ $0,03 per panggilan.
• Pada 5.000 panggilan/hari: Qwen ≈ $1.300, Terra ≈ $1.600, Luna ≈ $160.
Dua pelajaran bisa ditarik. Melawan Terra, penghematan Qwen nyata tetapi sederhana — sekitar 19% pada bentuk ini — dan jauh dari keunggulan orde besaran yang dinikmati Qwen terhadap model premium seperti Fable 5 atau Sol. Siapa pun yang mengira OpenAI secara struktural mahal harus memperbarui asumsinya: pemotongan harga 31 Juli sebagian besar telah menetralkan narasi harga Qwen di tingkat menengah.
Di mana Qwen unggul tajam adalah konteks panjang dan caching. Karena tarif $2/$6 datar di seluruh jendela 1M-token, prompt 900.000 token memakan biaya yang sama per token dengan prompt pendek, sementara banyak pesaing mengenakan biaya tambahan untuk input panjang. Dan input yang di-cache sebesar $0.25 per 1M memangkas sisi input hingga 8× pada beban kerja konteks berulang: panggilan di atas turun dari $0.26 menjadi sekitar $0.09 setelah konteksnya di-cache. Jika agen Anda membaca ulang konteks yang sebagian besar stabil setiap giliran, di situlah keunggulan yang bertahan lama — bukan pada tarif utama.
Keterbukaan dan saudara 27B
GPT-5.6 tidak akan pernah dapat dihosting sendiri. Qwen3.8-Max mungkin bisa — Alibaba kini mengatakan bobotnya tiba dalam minggu ini — tetapi produk andalan tersebut bukan target yang praktis: sekitar 1,2TB pada 4-bit dibandingkan sekitar 141GB per H200 berarti delapan atau lebih akselerator kelas atas, dan dengan jumlah parameter aktif yang masih tidak diungkapkan, Anda bahkan tidak dapat memodelkan throughput yang didapatkannya. Juga masih belum ada teks lisensi, yang berarti kegunaan komersialnya secara formal belum ditentukan.
yang diumumkan secara bersamaanQwen3.8-27Badalah rilis yang lebih penting bagi siapa pun yang tertarik pada Qwen karena kontrol, bukan kemampuan mentah. Juga dirilis dengan open-weights, model ini dilaporkan berjalan dalam sekitar 17GB VRAM — satu kartu konsumen kelas atas — yang menjadikannya opsi on-premise yang sesungguhnya, suatu hal yang tidak akan pernah bisa dilakukan oleh flagship 2.4T. Jika Anda membandingkan Qwen dengan GPT-5.6 karena membutuhkan residensi data, 27B adalah model yang harus dievaluasi.
FAQ
Apakah Qwen 3.8 lebih baik dari GPT-5.6?
Bukan berdasarkan bukti yang ada. Tabel GA Alibaba memang kuat (GPQA Diamond 92.6, Terminal-Bench 2.1 86.6) tetapi sepenuhnya dilaporkan sendiri, dan tidak ada evaluator independen yang menilai model tersebut. GPT-5.6 Sol memegang peringkat #2 yang diaudit di Intelligence Index (~59), memimpin masalah STEM tersulit menurut Artificial Analysis, dan berjalan hingga 750 token/detik. GPT-5.6 menang dalam hal pembuktian dan kecepatan.
Apakah klaim bahwa "Qwen 3.8 lebih unggul dari GPT-5.6" benar?
Ini bermula sebagai sentimen komunitas dan masih belum terverifikasi. GA membawa tabel benchmark milik Alibaba sendiri tetapi tanpa skor pihak ketiga — Artificial Analysis dan LMArena tetap tanpa skor. Pendahulunya, Qwen3.7-Max, mencetak 46 dibandingkan sekitar 59 milik Sol, jadi klaim tersebut membutuhkan lompatan satu generasi yang sangat besar agar dapat dipertahankan secara harfiah.
Mana yang lebih murah, Qwen 3.8 atau GPT-5.6?
Tergantung pada tingkatan, dan jawabannya berubah pada 31 Juli ketika OpenAI memangkas harga. Qwen3.8-Max adalah $2 / $6 per 1M. GPT-5.6 Terra adalah $2 / $12 — input sama, output dua kali lipat, jadi Qwen menang di situ. Luna adalah $0.20 / $1.20, menjadikannya sekitar 10× lebih murah daripada Qwen. Sol adalah premium, jadi Qwen jauh lebih murah daripada Sol.
Mana yang lebih cepat?
GPT-5.6, dengan tegas unggul dalam hal throughput. Artificial Analysis melaporkan hingga 750 token/detik pada perangkat keras Cerebras. Qwen3.8-Max menunjukkan p50 time-to-first-token sebesar 1,64 detik dalam telemetri 7 hari OrcaRouter, tetapi pengulas era pratinjau menemukannya sangat lambat pada build agen yang panjang — temuan itu mendahului pelayanan GA dan layak untuk diuji ulang.
Apakah Qwen 3.8 Max sudah keluar dari pratinjau?
Ya, pada 3 Agustus 2026. Sekarang sudah memiliki kartu tarif yang dipublikasikan dan endpoint yang kompatibel dengan OpenAI dan DashScope, sehingga framing Juli tentang kampanye kredit Qoder dengan diskon 90% tidak lagi menggambarkan cara penjualannya.
Apakah saya bisa self-host Qwen 3.8 untuk menghindari biaya OpenAI?
Bukan model unggulan, secara realistis. Bobot dijanjikan dalam minggu ini tetapi belum ada lisensi yang diterbitkan, dan pada ~1,2TB dalam 4-bit Anda memerlukan delapan atau lebih GPU kelas H200. Qwen3.8-27B yang diumumkan secara bersamaan, dilaporkan ~17GB VRAM, adalah opsi yang praktis.
Yang mana yang harus saya gunakan hari ini?
GPT-5.6 Sol untuk apa pun yang sensitif terhadap latensi, interaktif, atau kritis terhadap penalaran yang kualitas terauditnya penting. Luna untuk tugas sederhana bervolume tinggi, yang termurah dengan selisih besar. Qwen3.8-Max ketika konteks panjang dan caching prompt mendominasi tagihan Anda — tarif flat 1M-token dan input cache $0,25 adalah bagian terkuat dari penawarannya.
Intinya
Qwen 3.8 vs GPT-5.6 adalah pertarungan yang lebih adil daripada di bulan Juli, dan sedikit lebih seimbang dalam hal harga daripada yang diharapkan penggemar Qwen. Qwen3.8-Max tiba di GA dengan harga nyata, tabel benchmark kredibel yang dilaporkan sendiri, serta tarif 1M-token datar dan caching murah yang membuatnya benar-benar menarik untuk pekerjaan konteks panjang. Itu adalah keunggulan struktural, bukan keunggulan promosi.
Tetapi pemotongan harga OpenAI pada 31 Juli telah melemahkan argumen biaya di kelas menengah — Terra kini menyamai Qwen pada input — dan GPT-5.6 masih memiliki dua sifat penentu: peringkat #2 yang diaudit dari evaluator yang tidak berkepentingan atas hasilnya, serta throughput hingga 750 token/detik yang Qwen belum menunjukkan bukti mendekatinya. Perhatikan dua peristiwa: skor Intelligence Index independen pertama untuk Qwen3.8-Max, dan rilis weights dengan lisensi. Sampai saat itu, tentukan rute berdasarkan bentuk — GPT-5.6 saat kecepatan dan bukti menjadi prioritas, Qwen saat panjang konteks dan cache hits mendominasi biaya — dan verifikasi pada prompt Anda sendiri.

Dibandingkan dalam artikel ini3
Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari
