
GPT-6 Luna vs Qwen3.8-Max: Model Termurah dalam Perbandingan Ini Juga Satu-satunya yang Menonton Video
- OrcaBARUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 juta token
- orcaBARUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token
- deepseekBARUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0345Kecerdasan76Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Pembingkaian yang tampak jelas untuk pasangan ini justru keliru. Qwen3.8-Max mencantumkan harga $2,00 per juta token masukan dan $6,00 per juta keluaran dengan pembacaan cache sebesar $0,25. GPT-6 Luna mencantumkan harga $0,10 dan $0,50 dengan pembacaan cache sebesar satu sen. Dua puluh kali lipat untuk masukan, dua belas kali lipat untuk keluaran, lima puluh kali lipat untuk masukan yang di-cache — celah harga yang begitu lebar sehingga perbandingannya tampak sudah selesai sebelum dimulai.
Tidak dapat disimpulkan, karena kedua model tidak bersaing untuk permintaan yang sama. Qwen3.8-Max menerima teks, gambar, dan video, dan plafon keluaran 131.072 token-nya sedikit di atas 128.000 milik GPT-6 Luna. GPT-6 Luna hanya menerima teks dan gambar. Model Alibaba itu mencetak skor 58 pada Intelligence Index independen — peringkat pertama di kelasnya pada papan agentik — dan GPT-6 Luna mencetak skor 37 pada upaya maksimum, 29 pada pengaturan defaultnya. Yang satu adalah model unggulan dengan garis keturunan open-weight dan modalitas masukan video. Yang lain adalah tier volume dengan angka kecepatan dan tarif cache satu sen. Selisih harga bukanlah diskon untuk hal yang sama; itu adalah deskripsi dari dua hal yang berbeda.
Apa masing-masing dari dua ini
Qwen3.8-Max adalah produk unggulan Alibaba dari generasi 3.8, sebuah checkpoint kelas Max yang model dasarnya — Qwen3.8-2.4T-A95B — dirilis secara publik di bawah lisensi khusus pada 12 Agustus 2026, menjadikannya Qwen kelas Max pertama yang memiliki bobot terbuka. Produk unggulan yang dihosting itu sendiri masih terdaftar oleh dewan independen sebagai model berpemilik. Model ini memiliki jendela konteks 1.000.000 token, batas keluaran 131.072 token, masukan teks, gambar, dan video, serta upaya penalaran yang dapat dipilih pada tingkat rendah, sedang, dan ekstra tinggi. Revisi Qwen3.8-Max-0902 yang dipatok tersedia dengan harga yang sama, sebuah detail kecil dengan nilai operasional nyata.
GPT-6 Luna adalah tier efisiensi OpenAI dari 22 September 2026, berada di bawah GPT-6 Sol pada $2,00/$10,00 dan GPT-6 Astra sebagai unggulan pada $10,00/$50,00. Masukan teks dan gambar, keluaran teks, jendela 1.050.000 token dengan maksimum masukan 922.000, batas keluaran 128.000 token, dan effort dari none hingga low, medium, high, xhigh, dan max dengan medium sebagai default. Tertutup, pengenal tunggal, tersedia bagi siapa pun yang memiliki kunci API.
Satu menerima video dan dapat diunduh dalam bentuk dasarnya. Satu menerima gambar dan cepat. Keduanya dibanderol untuk digunakan dalam volume besar. Tumpang tindih antara kedua pernyataan itu lebih kecil daripada yang disiratkan oleh rasio harganya.
Kartu-kartunya, baris demi baris
Satu baris per dimensi, kedua sisi pada masing-masing:
• Input per 1 juta — GPT-6 Luna $0.10 vs Qwen3.8-Max $2.00
• Keluaran per 1J — GPT-6 Luna $0.50 vs Qwen3.8-Max $6.00
• Input cache per 1 juta — GPT-6 Luna $0.01 vs Qwen3.8-Max $0.25 untuk pembacaan cache implisit, dengan pembacaan cache eksplisit sebesar $0.17 dan penulisan cache eksplisit sebesar $2.50
• Klausul konteks panjang — GPT-6 Luna menggandakan input dan cache serta menaikkan output 1,5× di atas 272.000 token input, diterapkan pada keseluruhan permintaan vs Qwen3.8-Max dengan tarif tetap di sepanjang jendela penuh, yang merupakan satu-satunya tempat kartu Qwen secara struktural lebih baik, bukan sekadar lebih murah secara marginal
• Jendela konteks — GPT-6 Luna 1.050.000 token vs Qwen3.8-Max 1.000.000 token
• Output maksimum — GPT-6 Luna 128.000 token vs Qwen3.8-Max 131.072 token
• Modalitas masukan — teks dan gambar GPT-6 Luna vs teks, gambar, dan video Qwen3.8-Max
• Tingkat penalaran — GPT-6 Luna tidak ada, rendah, sedang (default), tinggi, xhigh, maks vs Qwen3.8-Max rendah, sedang, dan ekstra-tinggi
• Indeks Kecerdasan, independen — GPT-6 Luna 37 pada upaya maksimal vs Qwen3.8-Max 58
• Agentic Index, independen — Qwen3.8-Max 58, pertama di kelasnya; tidak ada angka GPT-6 Luna yang sebanding yang dipublikasikan
• Skor upaya default — GPT-6 Luna 29 pada medium defaultnya vs Qwen3.8-Max yang diukur pada pengaturan maksimumnya
• Biaya per tugas Index, independen — GPT-6 Luna sekitar $0,07 vs Qwen3.8-Max $5,41
• GDPval, independen — Qwen3.8-Max 1.739 Elo pada 64 giliran per tugas, yang berarti kira-kira $1,14 per tugas yang diselesaikan pada evaluasi tersebut; tidak ada hasil GPT-6 Luna yang sebanding yang dipublikasikan
• Tingkat halusinasi pada AA-Omniscience — Qwen3.8-Max 40%, sebuah regresi dari 23% pada generasi sebelumnya; GPT-6 Luna 77%, turun dari 93%
• Snapshot bertanggal — GPT-6 Luna sebuah pengenal bergulir tunggal vs Qwen3.8-Max-0902 tersedia sebagai revisi yang dipin 2 September 2026 dengan harga yang sama
• Bobot — GPT-6 Luna tertutup, hanya API vs Qwen3.8-Max; checkpoint dasar Qwen3.8-2.4T-A95B bersifat publik di bawah lisensi khusus sejak 12 Agustus 2026, sementara produk unggulan yang dihosting terdaftar sebagai proprietary
• Di OrcaRouter — GPT-6 Luna tidak ada di katalog kami vs Qwen3.8-Max dapat dirutekan pada harga daftar Alibaba

Video bukanlah lini fitur, melainkan beban kerja yang berbeda
Baris modalitas adalah baris yang menentukan lebih banyak perbandingan nyata daripada baris harga, dan biasanya dibaca sebagai kotak centang.
Qwen3.8-Max menerima video. GPT-6 Luna tidak. Jika pipeline Anda perlu bernalar tentang rekaman layar, demo produk, rekaman kuliah, segmen kamera keamanan, atau panduan UI, perbandingannya berakhir di baris itu dan perbedaan harga dua puluh kali lipat menjadi tidak relevan — Anda tidak sedang memilih antara opsi mahal dan opsi murah, melainkan antara ada opsi dan tidak ada opsi. Mengekstrak frame lalu meneruskannya sebagai gambar hanyalah solusi sementara, bukan padanan yang setara, dan siapa pun yang pernah membangunnya tahu perbedaannya, baik dari segi biaya maupun kualitas.
Jika pipeline Anda adalah teks dan gambar, lini modalitasnya diam dan lini harganya berbicara. Itulah pemisahan yang jujur, dan ada baiknya bersikap blak-blakan tentang di sisi mana Anda berada sebelum membaca apa pun yang lain di halaman ini.
Kesenjangan agentic itu nyata dan itulah separuh yang mahal dari selisih harga
Qwen3.8-Max mendapat skor 58 pada Indeks Kecerdasan independen. GPT-6 Luna mendapat skor 37 pada upaya maksimum dan 29 pada setelan menengah bawaannya. Dua puluh satu poin pada setelan yang disamakan, dua puluh sembilan pada setelan bawaan — pada komposit yang mana satu poin saja berada di dalam derau pengujian ulang, selisih sebesar itu bukanlah derau.
Posisi Qwen3.8-Max terkonsentrasi pada pekerjaan agentik. Model ini mencetak 58 pada Agentic Index independen, peringkat pertama di kelasnya, dan 1.739 Elo pada GDPval dengan 64 giliran per tugas. Angka terakhir itulah yang informatif, karena itu adalah pengukuran atas sebuah model yang menjaga suatu tugas tetap utuh di sepanjang enam puluh empat keputusan berurutan, dan angka itu disertai label harga: sekitar $1,14 per tugas yang diselesaikan pada evaluasi tersebut. Bandingkan dengan biaya per tugas indeks GPT-6 Luna sekitar $0,07, dan pernyataan yang jujur bukanlah bahwa Qwen mahal. Melainkan bahwa Qwen diminta melakukan hal yang jauh lebih sulit, dan melakukannya.
Akibat logisnya adalah defisit dua puluh satu poin GPT-6 Luna juga tidak terdistribusi secara merata di seluruh beban kerja Anda. Pada tugas yang singkat, terspesifikasi dengan baik, dan dikonsumsi oleh program — ekstrak bidang ini, klasifikasikan tiket ini, rutekan permintaan ini — kedua model akan menghasilkan jawaban sama-sama dapat digunakan hampir sepanjang waktu, dan selisih indeksnya akan tak terlihat dalam eval Anda. Pada tugas yang membutuhkan enam puluh empat tindakan berurutan dengan checkpoint di akhir, selisih itu adalah perbedaan antara menyelesaikan dan diam-diam berhenti di tengah jalan, dan itulah tugas yang dirancang untuk Qwen3.8-Max dan bukan untuk GPT-6 Luna.
Satu angka bergerak ke arah sebaliknya dan patut disebutkan, bukan dikubur. Tingkat halusinasi Qwen3.8-Max pada papan omniscience adalah 40%, naik dari 23% pada generasi sebelumnya — regresi yang cukup besar, dan jenis yang muncul sebagai jawaban salah yang penuh keyakinan di produksi, bukan sebagai satu baris benchmark. Angka GPT-6 Luna adalah 77%, turun dari 93%. Kedua angka itu tinggi secara absolut, dan model yang lebih murah tetap yang lebih buruk di antara keduanya untuk ukuran ini. Tidak ada satu pun angka itu yang menjadi alasan untuk memilih salah satu model; keduanya adalah alasan untuk tetap melibatkan manusia atau verifier dalam proses pada hal apa pun di mana fakta yang dikarang berbiaya mahal.
Klausa konteks panjang adalah satu-satunya baris di mana Qwen unggul dalam struktur
GPT-6 Luna memiliki klausul yang tidak dimiliki Qwen3.8-Max: permintaan di atas 272.000 token masukan ditagih dengan tarif dua kali lipat untuk masukan dan cache serta 1,5× tarif keluaran, yang dikenakan pada seluruh permintaan, bukan hanya bagian yang melewati batas. Panggilan 300.000 token pada GPT-6 Luna ditagih $0,20 per juta token masukan untuk seluruh 300.000 token karena melewati batas sebesar 28.000. Bagi dokumen yang sama menjadi dua panggilan dan biayanya menjadi separuh tanpa perubahan pada prompt.
Qwen3.8-Max tetap datar di sepanjang jendela 1.000.000 token penuhnya. Untuk permintaan tunggal yang benar-benar sangat besar, hal itu membuat selisih harga output dua belas kali lipat tampak lebih kecil daripada kelihatannya dan bahkan dapat membalikkannya: di atas 272.000 token input, tarif input efektif GPT-6 Luna menjadi dua kali lipat menjadi $0.20, dan tarif outputnya naik menjadi $0.75, dibandingkan tarif tetap Qwen sebesar $2.00 dan $6.00. Selisihnya menyempit dari dua puluh kali menjadi sepuluh untuk input dan dari dua belas menjadi delapan untuk output. Masih lebar — tetapi beban kerja yang paling mungkin memiliki konteks kerja 300.000 token justru merupakan beban kerja agentic yang menjadi sasaran penjualan kedua vendor, dan tim yang menjalankannya adalah tim yang akan menyadarinya.
Baris struktural lainnya adalah revisi yang dipatok. Qwen3.8-Max-0902 tersedia dengan harga yang sama dengan pengenal bergulir, yang berarti tim yang membutuhkan perilaku yang dapat direproduksi di seluruh pembaruan model dapat memperolehnya tanpa membayar premi. GPT-6 Luna tidak menawarkan padanannya. Itu adalah baris kecil pada kartu tarif dan baris besar dalam post-mortem.
Menjalankan salah satunya, atau keduanya
Qwen3.8-Max tersedia di OrcaRouter dengan harga daftar Alibaba, di bawah penetapan harga pass-through yang berarti perubahan tarif vendor langsung berlaku di sisi kami pada hari yang sama. Dua hal tentang lapisan routing kami membuktikan kegunaannya untuk model khusus ini: failover otomatis, karena model unggulan yang dihosting dengan basis bobot terbuka yang dipublikasikan memiliki lebih banyak upstream daripada model tertutup dari satu vendor dan lebih banyak cara bagi salah satunya untuk mengalami degradasi; dan penanganan revisi yang dipatok, yang memungkinkan sebuah rute mempertahankan Qwen3.8-Max-0902 secara eksplisit alih-alih mewarisi apa pun yang dihasilkan pengenal bergulir itu minggu depan.
GPT-6 Luna tidak ada dalam katalog kami pada saat penulisan ini dan diakses melalui API milik OpenAI sendiri, jadi tim yang menginginkan keduanya menjalankan satu kunci untuk Qwen3.8-Max bersama apa pun yang sudah digunakannya untuk OpenAI. Ini juga pasangan di mana DSL routing lebih bernilai daripada pembagian statis, karena batas antara kedua model adalah pemeriksaan modalitas dan pemeriksaan panjang, bukan preferensi: permintaan yang membawa video dialihkan ke Qwen3.8-Max karena tidak ada model lain yang bisa melayaninya, permintaan di atas 272.000 token masukan dialihkan ke Qwen3.8-Max karena tebing model lain membuatnya lebih mahal di sana, dan segala hal lainnya dialihkan ke model yang harganya seperdua puluh. Itu adalah aturan, dan tempatnya di konfigurasi, bukan di cabang aplikasi.

Yang mana, dan kapan
Pilih Qwen3.8-Max jika salah satu dari hal berikut ini benar. Pipeline Anda membutuhkan input video. Permintaan Anda secara rutin melampaui 272.000 token input, di mana tier tetapnya mengalahkan penetapan harga ulang GPT-6 Luna. Output Anda melampaui 128.000 token. Pekerjaan Anda adalah eksekusi agentik berhorizon panjang dengan endpoint yang dapat diverifikasi, di mana skor 58-nya di papan agentik dan 1.739 Elo pada GDPval dengan 64 giliran per tugas adalah bukti yang penting. Atau Anda memerlukan revisi yang dipin untuk reproduktibilitas dan bersedia membayarnya — yang, pada harga yang sama dengan identifier bergulir, berarti Anda tidak bersedia.
Ambil GPT-6 Luna jika tidak ada satu pun dari itu yang berlaku dan beban kerja Anda bervolume tinggi, dikonsumsi program, teks dan gambar, serta pendek. Klasifikasi, ekstraksi, perutean, peringkasan massal, loop dalam agen yang membutuhkan jawaban cepat alih-alih jawaban yang cermat. Dengan $0.10/$0.50 dengan pembacaan cache satu sen dan biaya per tugas yang diselesaikan sekitar seperlima belas dari Qwen3.8-Max, perhitungannya tidak dekat. Tetapkan parameter effort secara eksplisit — default-nya medium dan angka utama 37 adalah angka effort maksimum — dan jaga panggilan panjang di sisi yang benar dari batas 272.000 token.
Kesalahan yang diundang oleh perbandingan ini adalah membaca harga input dua puluh kali lipat sebagai sebuah putusan. Itu adalah putusan atas satu bentuk beban kerja, dan ia bungkam tentang tiga hal yang menentukan bentuk lainnya: apakah permintaan itu membawa video, apakah ia melewati 272,000 token, dan apakah jawabannya harus bertahan melewati enam puluh empat langkah berurutan.

Dibandingkan dalam artikel ini3
Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari
