
GPT-6 Sol vs Qwen3.8-Max: Satu Baris di Mana Model Tertutup Tidak Dapat Bersaing
- OrcaBARUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 juta token
- orcaBARUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token
- deepseekBARUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0345Kecerdasan76Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Hampir setiap perbandingan antara GPT-6 Sol dan Qwen3.8-Max akan diputuskan berdasarkan biaya, dan hampir semuanya akan salah menghitung biaya itu ke arah yang sama. Qwen3.8-Max, model andalan yang dihosting vendor, telah dibanderol $2,00 per juta token input dan $6,00 per juta token output sejak ketersediaan umumnya pada 3 Agustus 2026, dengan snapshot bertanggal Qwen3.8-Max-0902 yang dirilis pada 2 September. GPT-6 Solmencapai ketersediaan umum pada 22 September 2026 dengan harga $2,00 untuk input dan $10,00 untuk output. Harga input identik, dan output 40% lebih murah pada kartu tarif Qwen3.8-Max — namun, pada harness independen, biayanya sekitar lima kali lipat untuk menyelesaikan satu tugas.
Tapi ada perbedaan kedua yang lebih jernih yang terus terkubur oleh argumen biaya, dan itulah yang sebenarnya menentukan sebagian beban kerja. Qwen3.8-Max menerima video. GPT-6 Sol tidak. Itu bukan soal harga atau tolok ukur; itu adalah kemampuan yang dimiliki salah satu model ini dan tidak dapat didekati oleh model lainnya, dan itulah satu-satunya bagian dari pertarungan ini yang tidak akan bisa diperbaiki oleh seberapa besar pun upaya efisiensi token.

Dua produk unggulan, dua bentuk yang berbeda
Qwen3.8-Max adalah model sparse mixture-of-experts berparameter 2,4 triliun dengan sekitar 95 miliar parameter yang aktif per kueri — model hosted terbesar kedua di produksi setelah Kimi K3. Jendela konteksnya mencapai satu juta token dengan batas keluaran 131.072 token, modalitas inputnya adalah teks, gambar, dan video, serta mendukung reasoning effort pada tingkat low, medium, dan extra-high dengan structured outputs dan tool calling. Model unggulan yang di-host ini bukan open weights; artefak yang dapat diunduh dari generasi yang sama adalah rilis terpisah dengan keterbatasannya sendiri.
GPT-6 Sol menerima input teks dan gambar, serta menghasilkan teks. Jendelanya berukuran 1.050.000 token dengan input maksimum 922.000 token dan batas output 128.000 token, dengan harga tetap $2,00 dan $10,00, biaya baca cache $0,20 dan tulis cache $2,50, serta penetapan ulang harga untuk seluruh permintaan di atas 272.000 token input menjadi $4,00 dan $15,00. Model ini tertutup, pengenal tunggal, dan OpenAI menyebut tarif tersebut sebagai permanen, bukan promosi.
Angka jendela berada dalam kisaran sekitar 7% satu sama lain, dan plafon keluaran berada dalam pita yang sama. Daftar modalitas adalah satu-satunya celah struktural — dan itu hanya berlaku satu arah.
Baris demi baris
• Masukan — GPT-6 Sol $2,00 per juta token vs Qwen3.8-Max $2,00 per juta token; angka utamanya identik
• Output — GPT-6 Sol $10,00 per juta token vs Qwen3.8-Max $6,00 per juta token; tarif Alibaba 40% lebih rendah
• Input yang di-cache — GPT-6 Sol $0,20 per juta token vs Qwen3.8-Max $0,25 per juta token untuk pembacaan cache implisit, dengan pembacaan cache eksplisit sebesar $0,17 dan penulisan cache eksplisit sebesar $2,50
• Jendela konteks — GPT-6 Sol 1.050.000 token vs Qwen3.8-Max 1.000.000 token
• Output maksimum — GPT-6 Sol 128.000 token vs Qwen3.8-Max 131.072 token
• Modalitas masukan — teks dan gambar GPT-6 Sol vs teks, gambar, dan video Qwen3.8-Max
• Penanganan konteks panjang — GPT-6 Sol menetapkan harga ulang untuk seluruh permintaan di atas 272.000 token masukan pada 2× tarif masukan dan cache serta 1,5× keluaran, sedangkan Qwen3.8-Max menerapkan tarif datar di sepanjang jendela penuh; inilah satu-satunya tempat kartu tarif Qwen secara struktural lebih baik, bukan sekadar lebih murah secara marginal
• Upaya penalaran — GPT-6 Sol tidak ada, rendah, sedang (bawaan), tinggi, xhigh, maks vs Qwen3.8-Max rendah, sedang, dan ekstra tinggi
• Batas pengetahuan — GPT-6 Sol 20 April 2026 vs Qwen3.8-Max tidak dipublikasikan sebagai satu tanggal
• Snapshot bertanggal — GPT-6 Sol adalah satu pengenal bergulir, sedangkan Qwen3.8-Max-0902 tersedia sebagai revisi yang dipin 2 September 2026 dengan harga yang sama
Lini konteks panjang pantas mendapat lebih banyak perhatian daripada yang biasanya ia terima. Biaya tambahan GPT-6 Sol adalah kenaikan tarif yang dikenakan pada seluruh permintaan, sehingga eksekusi agen 900.000 token ditagih $4,00 dan $15,00 untuk setiap token. Qwen3.8-Max mengenakan satu tingkat tarif di seluruh jendela. Untuk beban kerja yang berada di atas 272.000 token, kedua daftar tarif itu sama sekali tidak lagi bisa dibandingkan — model yang tampak lebih murah di headline justru jauh lebih mahal, dan arah selisihnya sepenuhnya bergantung pada di mana konteks Anda berada.

Kartu tarif mengatakan 40% lebih murah. Harness mengatakan tagihannya lima kali lipat.
Artificial Analysis mengukur Qwen3.8-Max-0902 pada skor Intelligence Index 45, dengan biaya $5.41 per tugas indeks yang diselesaikan, setelah menghasilkan 190 juta token keluaran sepanjang pengujian. Ringkasannya menggambarkan model tersebut sebagai "lambat secara mencolok dan sangat bertele-tele." GPT-6 Sol memperoleh skor 48 dengan biaya $1.06 per tugas pada 77 juta token keluaran.
Bacalah ketiga pasangan itu bersama-sama dan bentuk pertandingannya pun terlihat. Qwen tertinggal tiga poin indeks, menghasilkan dua setengah kali lipat token, dan biayanya sekitar lima kali lebih besar per tugas yang diselesaikan — pada kartu tarif yang outputnya 40% lebih murah. Mekanismenya tidak samar. Pada $6.00 per juta token output, 190 juta token memakan biaya $1.14 per eksekusi indeks hanya untuk output sebelum input dihitung; pada $10.00 per juta, 77 juta milik Sol memakan biaya $0.77. Tarif yang lebih murah itu membeli lebih banyak token, bukan tagihan yang lebih kecil.
Ini adalah pola yang sama yang muncul di seluruh kancah September, dan ada baiknya menyatakannya sebagai aturan, bukan sebagai fakta tentang kedua model ini: pada kartu tarif per token, diskon output 40% tidak bernilai apa-apa jika model mengeluarkan token dua setengah kali lebih banyak. Biaya per tugas yang diselesaikan adalah satu-satunya angka yang bertahan.
Apa yang dipublikasikan Alibaba, dan masalah penetapan upaya
Tabel tolok ukur milik Alibaba sendiri adalah yang terpanjang dalam perbandingan ini dan yang paling sulit dibandingkan. Angka yang dilaporkan vendor menempatkan Qwen3.8-Max unggul pada PaperBench dan IFBench, tetapi tertinggal pada SWE-bench Pro dan Humanity's Last Exam, dengan skala upaya penalaran — rendah, sedang, ekstra-tinggi — yang tidak memiliki pemetaan langsung ke skala enam tingkat OpenAI. Skor yang dipublikasikan pada ekstra-tinggi bukanlah produk yang sama dengan skor yang dipublikasikan pada sedang, dan tidak ada vendor yang melabeli mana yang menghasilkan angka tertentu pada bagan perbandingan.
Itu adalah alasan jujur untuk tidak bersandar pada tabel salah satu vendor di sini. Angka Alibaba dijalankan pada harness Alibaba dengan setelan effort Alibaba; angka OpenAI dijalankan pada harness OpenAI. Angka Artificial Analysis ada justru karena keduanya tidak dapat digunakan sebagai perbandingan langsung, dan angka itulah yang digunakan di atas.
Reprodusibilitas adalah fitur nyata, dan harganya nol
Snapshot bertanggal adalah baris yang paling diremehkan dalam perbandingan ini. Qwen3.8-Max-0902 adalah revisi yang dipin pada 2 September 2026 yang menurut Alibaba memiliki kemampuan dan harga yang sama dengan model dasar. Menyematkannya berarti model di balik endpoint Anda tidak berubah tanpa Anda sadari antara hari Selasa dan hari Kamis.
GPT-6 Sol tidak memiliki padanan. Ini adalah satu pengenal bergulir — halaman model yang sama memuat snapshot default dan tidak memiliki varian bertanggal — yang berarti hal yang Anda uji kinerjanya pada September belum tentu hal yang Anda panggil pada November. Bagi sebagian besar tim, itu tidak masalah. Bagi pipeline teregulasi yang harus menunjukkan apa yang menghasilkan suatu output, ini adalah perbedaan nyata, dan ini adalah salah satu hal yang Alibaba berikan secara gratis sementara OpenAI tidak menawarkannya sama sekali.
Lini video itulah yang menentukan
Semua di atas adalah perbandingan. Bagian ini bukan. Jika input Anda mencakup video — rekaman layar, footage inspeksi, rekaman kuliah, apa pun yang informasinya bergerak, bukan dalam bingkai diam — Qwen3.8-Max menerimanya secara native dan GPT-6 Sol tidak memiliki jalur untuk itu. Anda tidak bisa mengakali modalitas hanya dengan prompt. Anda tidak bisa memproses terlebih dahulu video menjadi gambar-gambar lalu mendapatkan hal yang sama, karena informasi temporal adalah intinya, dan berapa pun titik indeks pada tolok ukur teks tidak dapat menggantikan input yang sebenarnya dibutuhkan tugas Anda.
Kasus sebaliknya juga layak disebutkan, karena di sinilah perbandingan tidak lagi berat sebelah. Jika input Anda berupa teks dan gambar, Sol lebih murah per tugas, unggul empat poin di papan netral, dan lebih murah untuk pembacaan cache. Kemampuan video bukanlah pemecah kebuntuan yang menguntungkan Anda; itu hanya tidak digunakan.
Merutekan keputusan yang memiliki dua jawaban terpisah

Ini adalah perbandingan di mana arsitektur yang tepat benar-benar terdiri dari dua model, bukan satu, dan alasannya adalah pemisahannya berdasarkan modalitas input, bukan berdasarkan tingkat kesulitan. Pipeline yang menyerap video dan menalar atas teks membutuhkan keduanya, dan aturan peruteannya adalah properti dari permintaan, bukan keputusan berdasarkan penilaian.
Qwen3.8-Max ada di katalog OrcaRouter — snapshot qwen/qwen3.8-max-0902 bertanggal itu dapat dirutekan dengan harga daftar Alibaba di bawah model pass-through, yang berarti perubahan tarif Alibaba langsung berlaku di sisi kami pada hari yang sama alih-alih setelah reseller melakukan negosiasi ulang. GPT-6 Sol belum ada di katalog kami pada saat tulisan ini dibuat dan dapat diakses melalui API milik OpenAI sendiri. DSL perutean adalah komponen yang cocok untuk kasus khusus ini: aturan yang mengirim permintaan yang membawa video ke satu jalur dan semua sisanya ke jalur lain memang tepat untuk itu, dan failover otomatis berarti cabang modalitas tidak menjadi satu-satunya titik kegagalan.
Di mana masing-masing unggul
• Video masuk, teks keluar — Qwen3.8-Max, dan tidak ada tandingan yang perlu dijelaskan.
• Input teks dan gambar, biaya per tugas yang diselesaikan sebagai metrik — GPT-6 Sol, sekitar lima kali lipat pada harness independen.
• Pekerjaan cached-prefix — GPT-6 Sol. Pembacaan cache-nya sedikit lebih murah dan volume tokennya kurang dari setengah.
• Permintaan di atas 272.000 token input — Qwen3.8-Max. Penetapan harga ulang seluruh permintaan oleh Sol adalah perbedaan biaya paling besar dalam perbandingan ini, dan hal itu tidak terlihat pada tarif utama.
• Penyematan yang dapat direproduksi — Qwen3.8-Max-0902, yang tidak memerlukan biaya tambahan dan merupakan satu-satunya revisi yang disematkan dari keduanya.
• Jika Anda ditunjukkan sebuah bagan dengan Qwen berada di depan pada SWE-bench Pro — periksa harness siapa yang menghasilkannya dan pada pengaturan effort yang mana. Papan independen menempatkan Qwen tertinggal tiga poin pada komposit, dan tabel vendor tidak berada pada skala yang sama satu dengan yang lain.
Dibandingkan dalam artikel ini3
Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari
