
GPT-6 vs Qwen 3.8 Max: Satu Mengambil Video, Satu Menulis Lebih Panjang
- openaiBARUOpenAI: GPT-6.1 Sol2026-09-2952Kecerdasan
- anthropicBARUAnthropic: Claude Sonnet 5.52026-09-2856Kecerdasan
- typesafeBARUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Kecerdasan
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- xAIGrok 4.72026-09-2146Kecerdasan
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 juta token · 67 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 juta token · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 360 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
GPT-6 Sol dan Qwen3.8 Max mengenakan tarif input yang sama — $2,00 per juta token, keduanya — lalu berbeda pada dua sumbu yang tidak akan terlihat hanya dari tabel harga. Qwen3.8 Max, yang tersedia secara umum sejak 3 Agustus 2026, adalah satu-satunya dari kedua model itu yang menerima video: modalitas inputnya adalah teks, gambar, dan video, sedangkan GPT-6 Sol menerima teks, gambar, dan file. GPT-6 Sol, yang dirilis vendor pada 22 September 2026, adalah satu-satunya dari keduanya dengan batas output yang dipublikasikan, 128.000 token, dan satu-satunya dengan antarmuka konsumen di belakangnya — peluncuran ChatGPT 7 Oktober yang menempatkan model itu di hadapan lebih dari 1,2 miliar pengguna mingguan.
Jadi, pertanyaan penyortirannya bukanlah mana yang lebih kuat. Melainkan apakah input Anda adalah video, dan apakah output Anda panjang.
Video adalah percabangan pertama
Sebagian besar perbandingan model pada akhirnya hanya soal harga dan benchmark, dan yang ini memiliki perbedaan struktural yang tegas yang membuat keduanya menjadi sekunder. Jika pipeline Anda mengonsumsi video — rekaman pengawasan, rapat yang direkam, materi olahraga atau perkuliahan, reel demo produk — Qwen3.8 Max dapat menerima klip tersebut di dalam permintaan. Kartunya mencantumkan video sebagai modalitas masukan bersama teks dan gambar, hingga jendela sejuta token, yang untuk video berarti pengambilan sampel frame ditambah transkrip dalam satu panggilan, bukan tahap ekstraksi terpisah. GPT-6 Sol tidak bisa. Modalitasnya adalah teks, gambar, dan file; tidak ada masukan video pada kartunya, dan sebanyak apa pun rekayasa prompt tidak dapat menggantikannya.
Baris tunggal itu menentukan daftar pendek untuk pipeline video, dan hal itu tidak terlihat pada kartu tarif. Di mana kedua model benar-benar dapat saling menggantikan adalah dalam pekerjaan teks dan gambar, dan di situlah perbandingan harga dan tolok ukur di bawah ini berlaku.
Satu catatan kejujuran tentang klaim video: modalitasnya terdokumentasi, tetapi skemanya tidak. Entri katalog kedua vendor tidak merinci resolusi, laju bingkai, atau batas durasi klip, jadi "mendukung video" berarti jenis masukannya ada, bukan bahwa klip tertentu akan diproses pada kualitas yang Anda butuhkan. Ujilah dengan rekaman Anda sendiri sebelum Anda membangun di atasnya.
Sisi keluaran berjalan ke arah sebaliknya
Balikkan permintaannya, dan keunggulannya pun terbalik. GPT-6 Sol mencantumkan output maksimum 128.000 token per respons. Kartu Qwen3.8 Max mencantumkan jendela konteks tetapi tidak mencantumkan angka output maksimum, sehingga sistem yang menyusun anggaran berdasarkan batas output yang ketat tidak dapat membacanya dari data vendor — celah yang sama yang muncul pada beberapa kartu platform hosting dan sebaiknya diperlakukan sebagai tidak diketahui, bukan tanpa batas.
Yang dipublikasikan adalah asimetri harga di sisi output, dan itu kebalikan dari kisah video. Qwen3.8 Max menagih $6.00 per juta token output dibandingkan $10.00 milik GPT-6 Sol — diskon 40% untuk setiap token yang ditulis model. Beban kerja yang berat output, seperti pembuatan teks panjang atau serialisasi artefak terstruktur yang besar, jauh lebih murah pada Qwen3.8 Max per unit pekerjaan, dan itu tetap benar terlepas dari harga input yang identik.
Perhatikan juga bahwa kartu Qwen3.8 Max mencantumkan satu tarif input tunggal tanpa tier konteks panjang yang terdokumentasi, sedangkan GPT-6 Sol menetapkan ulang harga untuk keseluruhan permintaan di atas 272.000 token input menjadi $4,00 untuk input dan $15,00 untuk output. Halaman model OpenAI menyatakan aturan ini secara eksplisit: prompt di atas ambang tersebut dikenai tarif input dan cache 2x serta output 1,5x untuk keseluruhan permintaan. Pada prompt yang melewati 272.000 token, tarif input efektif GPT-6 Sol berlipat ganda menjadi $4,00, sementara Qwen3.8 Max tetap $2,00 — sekali lagi membalikkan kesetaraan input yang tampak.
Apa kata dewan independen
Artificial Analysis mencakup kedua model, dan indeks komposit menempatkan GPT-6 Sol unggul, sementara beberapa tes individual menunjukkan hasil sebaliknya. Setiap angka di bawah ini berasal dari evaluator, bukan dari vendor.
• Indeks Kecerdasan: GPT-6 Sol 47,6, Qwen3.8 Max 45,4 — GPT-6 Sol unggul sekitar dua poin
• Indeks pengodean: Qwen3.8 Max 76,2 dengan peringkat sepuluh besar; profil pengodean GPT-6 Sol sebanding, tetapi entri Qwen membawa peringkat yang lebih kuat
• GPQA Diamond: Qwen3.8 Max 92,8%, angka GPT-6 Sol lebih tinggi di antara keduanya pada keluarga tes yang sama
• Humanity's Last Exam: Qwen3.8 Max 43,1%, GPT-6 Sol 47,9%
• Recall Konteks Panjang: Qwen3.8 Max 80,3%, GPT-6 Sol 83,7%
• SciCode: Qwen3.8 Max 52,1%, GPT-6 Sol 57,6%
• Penggunaan alat agentik: Qwen3.8 Max 88,8% pada terminal-bench v2.1 dan 47,8% pada tau-banking, keduanya kuat
Polanya adalah GPT-6 Sol memenangkan komposit penalaran umum dan tes sains-dan-recall, sementara Qwen3.8 Max adalah model pengodean dan penggunaan alat yang lebih tajam. Ada dua catatan yang berlaku dan keduanya bukan sekadar pemanis. Pertama, nilai indeks ini dievaluasi pada tanggal yang berbeda, jadi selisih dua poin antarrevisi masih berada dalam variasi yang dihasilkan oleh pengujian ulang, bukan celah yang sudah pasti. Kedua, angka yang dipublikasikan Qwen3.8 Max adalah hasil pengujian evaluator terhadap model sebagaimana dilayani oleh endpoint Alibaba, dan vendor juga merilis snapshot bertanggal, Qwen3.8 Max (0902), pada 2 September 2026 dengan tarif yang sama $2.00 / $6.00 — jika Anda menyematkan snapshot, pastikan versi mana yang Anda panggil sebelum Anda mengutip skor.

Apa yang ditambahkan dalam peluncuran OpenAI pada 7 Oktober
Rilis ChatGPT adalah fakta distribusi, bukan fakta kemampuan, tetapi itu mengubah apa yang dimaksud pembaca dengan "GPT-6". Pada 7 Oktober 2026, OpenAI mulai menggulirkan GPT-6 ke ChatGPT di bawah kapabilitas Intelligent UI, dengan tab Chat tiba lebih dulu di Plus, Pro, Business, dan Enterprise, sedangkan Free dan Go menyusul mulai 8 Oktober; ketersediaan untuk enterprise bergantung pada pengaturan admin tempat kerja. Model yang menjalankan Work dan Codex tidak diubah.
Dua detail penting untuk perbandingan ini. Pengalaman ChatGPT ditenagai oleh GPT-6 Sol untuk tier konsumen berbayar — jadi GPT-6 yang ditemui lebih dari satu miliar orang adalah model yang sama dengan yang Anda panggil melalui API, bukan checkpoint terpisah. Dan GPT-6 adalah sebuah keluarga, bukan model tunggal: GPT-6 Astra berada di atas Sol pada $10.00 / $50.00 dan GPT-6 Luna di bawahnya pada $0.10 / $0.50. Ketika sebuah perbandingan menyebut "GPT-6" terhadap Qwen3.8 Max tanpa menyebut tier mana, biasanya perbandingan itu secara default membandingkannya dengan Sol, dan dengan Astra ketika ingin menyajikan kasus terkuat. Menyebut tier adalah perbedaan antara perbandingan yang adil dan perbandingan yang retoris.
Biaya, diukur berdasarkan bentuk alih-alih tarif
Karena tarif input imbang dan tarif output berbeda, pemenangnya sepenuhnya bergantung pada rasio token masuk terhadap token keluar. Dihitung terhadap tarif yang dipublikasikan masing-masing vendor, tidak termasuk caching:
• Analisis video dan transkrip (input 500K, output 6K): Qwen3.8 Max ≈ $1,04, GPT-6 Sol tidak berlaku — tidak ada input video
• Analisis dokumen (input 250K, output 5K): Qwen3.8 Max ≈ $0,53, GPT-6 Sol ≈ $0,55 sebelum ambang batas 272K-nya berlaku, dan lebih tinggi setelah seluruh permintaan dihitung ulang biayanya
• Generasi teks panjang (input 40K, output 80K): Qwen3.8 Max ≈ $0,56, GPT-6 Sol ≈ $0,88
• Loop agentik yang seimbang (input 60K, output 20K): Qwen3.8 Max ≈ $0,24, GPT-6 Sol ≈ $0,32
Bentuk hasilnya stabil: Qwen3.8 Max adalah model yang lebih murah untuk campuran token yang sama, karena tarif inputnya setara dan tarif outputnya lebih rendah. Argumen kontra GPT-6 Sol sama sekali bukan soal harga — melainkan komposit penalaran, validasi permukaan konsumen, dan batas output yang terdokumentasi sehingga penyusunan anggaran menjadi mudah.
Satu catatan operasional yang perlu disampaikan karena kartu-kartunya tidak menyebutkannya. Diukur di playground OrcaRouter selama minggu pertama Oktober 2026, rute Qwen3.8 Max menunjukkan median latensi token pertama sekitar 5.809 ms dan sekitar 50 token keluaran per detik, dengan tingkat kesalahan rendah; rute GPT-6 Sol pada periode yang sama mengukur throughput yang lebih cepat tetapi tingkat kesalahan yang jauh lebih tinggi. Ini adalah observasi rute bersama, bukan SLA vendor, dan berubah dari minggu ke minggu — itulah argumen untuk mengukur lalu lintas Anda sendiri daripada memercayai kartu model mana pun.
Menjalankan keduanya di bawah satu kunci
Jawaban realistis bagi tim yang memiliki pekerjaan video di satu sisi dan pekerjaan berat penalaran di sisi lain adalah bahwa tidak ada model yang menang secara mutlak dan keduanya termasuk dalam stack. Itulah kasus yang membutuhkan gateway. Di OrcaRouter, baik qwen/qwen3.8-max maupun GPT-6 Sol adalah rute aktif dalam katalog yang sama di balik satu API yang kompatibel dengan OpenAI, pada harga daftar penyedia dengan markup 0% — sehingga perubahan harga Alibaba atau OpenAI sampai kepada Anda pada hari yang sama, bukan pada rekonsiliasi tagihan berikutnya, dan tidak ada kumpulan kredensial atau jalur SDK terpisah per vendor.
Dua fitur melakukan pekerjaan spesifik di sini. Failover otomatis menjaga pipeline tetap hidup saat rute salah satu penyedia mengalami degradasi, yang berpengaruh langsung mengingat betapa berbedanya perilaku kedua rute tersebut dalam jendela pengukuran yang sama. Dan DSL perutean membiarkan permintaan menentukan: kirim apa pun yang membawa input video ke Qwen3.8 Max, kirim pekerjaan penalaran konteks panjang ke GPT-6 Sol, dan biarkan predikat pada modalitas input dan ukuran permintaan membuat pilihan alih-alih ID model yang di-hardcode yang harus diubah secara manual saat lalu lintas bergeser.

Versi singkatnya: jika input Anda mencakup video, Qwen3.8 Max adalah satu-satunya dari kedua model itu yang dapat menerimanya, dan model ini lebih murah pada setiap komposisi token begitu Anda memiliki permintaannya. Jika pekerjaan Anda adalah penalaran teks dan gambar dengan kebutuhan akan output panjang yang berbatas dan default kelas konsumen yang tervalidasi, GPT-6 Sol adalah pilihan yang lebih kuat pada indeks komposit dan satu-satunya dengan batas output yang terdokumentasi. Jika Anda membutuhkan keduanya, lakukan perutean — dan biarkan modalitas permintaan menjadi kunci perutean, bukan siklus rilis.

Dibandingkan dalam artikel ini1
Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari
