
Qwen 4 Max vs Gemini 3.1 Pro: flagship yang belum diumumkan melawan pratinjau yang tak pernah berakhir
- OrcaBARUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 juta token
- orcaBARUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token
- deepseekBARUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0345Kecerdasan76Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Sebagian besar perbandingan mempertemukan produk yang sudah dirilis dengan produk yang sudah dirilis. Yang ini tidak biasa: Qwen 4 Max dipratinjau di konferensi Yunqi di Hangzhou pada 22 September 2026 tanpa tanggal rilis, tanpa harga, dan tanpa bobot, dan Gemini 3.1 Pro telah dalam pratinjau sejak 19 Februari 2026 dan masih dalam pratinjau — tujuh bulan kemudian, tanpa tanggal ketersediaan umum yang diumumkan dan tanpa tanggal penghentian pada tabel deprekasinya. Tidak ada satu pun model dalam perbandingan ini yang merupakan produk yang sudah mapan. Itu bukan alasan untuk melewati perbandingan ini. Itu adalah perbandingan itu sendiri, dan itulah satu hal yang benar-benar informatif tentangnya.
Tujuh bulan pratinjau
Label pratinjau seharusnya menjadi status yang berumur pendek. Gemini 3.1 Pro kini menyandangnya selama tiga rilis Flash dari laboratorium yang sama, termasuk Gemini 3.8 Flash pada 2 September 2026, yang menurut Google merupakan model Flash paling cerdasnya. Pada komposit independen, model itu sekarang mencetak skor di atas 3.1 Pro. Lini Pro Google tidak memiliki anggota yang lebih baru: tidak ada Gemini 3.8 Pro, dan generasi 3.5 Pro tertunda serta dilaporkan dikesampingkan. Efek praktisnya adalah model yang menyandang nama Pro bukan lagi model dengan skor tertinggi dari vendornya sendiri.
Teks batasan Google sendiri pada entri katalog menyarankan untuk merencanakan depresiasi pratinjau, yang merupakan cara jujur untuk membaca status tersebut. Pratinjau tanpa tanggal GA dan tanpa tanggal penghentian adalah model yang dapat Anda bangun di atasnya dan tidak dapat Anda jadwalkan seputarnya.
Sisi Qwen adalah citra cermin dengan tandanya dibalik. Qwen 4 Max tidak berada dalam pratinjau panjang; ia pra-pratinjau, tanpa ada yang diterbitkan sama sekali. Dua mode kegagalan itu berlawanan: Gemini 3.1 Pro adalah endpoint nyata yang keberadaan jangka panjangnya tidak ditentukan, dan Qwen 4 Max adalah item peta jalan yang ditentukan tanpa endpoint.

Perbandingan, dan angka konteks panjang yang menentukan hasilnya
Spesifikasi Gemini 3.1 Pro bersifat publik dan spesifik. Spesifikasi Qwen 4 Max kosong. Yang layak direnungkan adalah satu baris di kolom Gemini, karena itu jenis angka yang sering dikutip dan seharusnya tidak:
• Status — Gemini 3.1 Pro dalam pratinjau sejak 19 Februari 2026, dibandingkan dengan Qwen 4 Max yang diumumkan pada 22 September 2026 tanpa tanggal
• Harga input — Gemini 3.1 Pro $2,00 per 1 juta token hingga prompt 200K dan $4,00 di atasnya, versus Qwen 4 Max tidak dipublikasikan
• Harga output — Gemini 3.1 Pro $12,00 per 1 juta hingga 200K dan $18,00 di atasnya, dibandingkan Qwen 4 Max yang tidak dipublikasikan
• Input cache — Gemini 3.1 Pro $0.20 per 1 juta untuk pembacaan cache, sedangkan Qwen 4 Max tidak dipublikasikan
• Konteks — Gemini 3.1 Pro 1.048.576 token, versus Qwen 4 Max tidak dipublikasikan
• Batas output — Gemini 3.1 Pro 65.536 token, versus Qwen 4 Max yang batas outputnya tidak dipublikasikan
• Modalitas — input teks, gambar, video, audio, dan PDF Gemini 3.1 Pro dengan output teks, versus Qwen 4 Max yang tidak dipublikasikan
• Kontrol penalaran — tingkat pemikiran rendah, sedang, dan tinggi Gemini 3.1 Pro, versus Qwen 4 Max yang tidak dipublikasikan
• Pengambilan konteks panjang — MRCR v2 Gemini 3.1 Pro yang dilaporkan vendor sebesar 84,9 persen jika dirata-ratakan di delapan needle pada 128K, tetapi 26,3 persen pada pengaturan pointwise satu juta token, sedangkan Qwen 4 Max tidak dilaporkan apa pun
• Skor yang dilaporkan vendor — Gemini 3.1 Pro SWE-bench Verified 80,6 persen, GPQA Diamond 94,3 persen, ARC-AGI-2 77,1 persen, Humanity's Last Exam 44,4 persen tanpa alat, dibandingkan Qwen 4 Max tidak ada yang dilaporkan
• Skor independen — Gemini 3.1 Pro 30 pada Artificial Analysis Intelligence Index v4.3.2, dibandingkan Qwen 4 Max tidak ada evaluasi independen
Baris konteks panjang itulah yang perlu diingat. Jendela konteks 1.048.576 token hanyalah angka pemasaran; tingkat pengambilan 26,3 persen pada setelan satu juta token adalah yang dilaporkan vendor yang sama saat mengukur ujung jauh jendela tersebut. Kedua angka itu berasal dari Google, yang menjadikan selisih tersebut sebagai pernyataan tentang modelnya, bukan tentang penilainya. Jika beban kerja Anda bergantung pada menemukan fakta yang terkubur di dekat akhir prompt satu juta token, angka konteks yang menonjol tidak memberi tahu Anda apa pun yang berguna, dan baris ini memberi tahu Anda hampir segalanya.
Indeksnya bergerak, modelnya tidak
Gemini 3.1 Pro diluncurkan pada 19 Februari 2026 dengan nilai 57 pada Artificial Analysis Intelligence Index, peringkat pertama di bidangnya. Dalam revisi indeks v4.3.2, yang diterbitkan pada 19 September 2026, skornya terbaca 30. Tidak ada yang berubah dari model tersebut antara kedua tanggal itu. Alat ukurnya dibangun ulang, dan dibangun ulang empat hari sebelum pengumuman Qwen 4 dari Alibaba.
Kebetulan itu lebih bernilai daripada angka-angkanya sendiri. Tiga dari empat model dalam kumpulan perbandingan ini — Gemini 3.1 Pro, Claude Opus 5, dan model unggulan Qwen 3.8 — memiliki skor independen yang berubah pada revisi yang sama, dan dalam setiap kasus perubahannya cukup besar untuk membalik peringkat. Perbandingan apa pun yang ditulis bulan ini yang mengutip satu nilai indeks tanpa menyebutkan revisinya sedang membandingkan skor yang diambil dengan penggaris yang berbeda, dan kesalahan itu tidak akan terlihat oleh pembaca.
Bagi Qwen 4 Max, konsekuensinya adalah targetnya terus bergerak. Ketika Alibaba akhirnya menerbitkan, skor yang harus dilampaui pada indeks ini akan menjadi apa pun yang dikatakan revisi terkini pada hari itu, dan revisi tersebut telah berubah setidaknya sekali dalam sepekan terakhir.

Apa yang dikatakan angka-angka operasional, termasuk yang tidak nyaman.
Gemini 3.1 Pro dapat dirutekan di OrcaRouter sebagai google/gemini-3.1-pro-preview, membawa lencana Flagship dan Featured tanpa banner pra-rilis, pada harga daftar Google sebesar $2,00 dan $12,00 per juta token dengan markup 0%. Perutean itu sendiri jujur — tarif di halaman adalah tarif yang diterbitkan Google. Angka operasional selama tujuh hari hingga 22 September juga layak dicantumkan, bukan dilewatkan: p50 time-to-first-token sebesar 10,00 detik, kecepatan keluaran sekitar 632 token per detik, dan tingkat galat 77,5 persen sepanjang jendela waktu tersebut. Tingkat galat itu bukan catatan kaki. Untuk model tingkat pratinjau tanpa tanggal GA, itu adalah angka paling relevan untuk keputusan di halaman tersebut, dan perbandingan yang mengutip harga tanpa angka itu sedang menjual, bukan memberi informasi.
Katalog yang sama memuat hampir 200 model pada satu endpoint yang kompatibel dengan OpenAI dengan failover otomatis dan DSL perutean, yang merupakan mekanisme yang membuat tingkat kesalahan seperti itu dapat ditanggung alih-alih fatal: jalur penyedia yang menurun dapat dialihkan alih-alih dimatikan. Keluarga Qwen 3.8 — Qwen3.8-Max, Qwen3.8-Flash, dan Qwen3.8-27B — berada di endpoint yang sama dengan Gemini 3.1 Pro Preview, jadi substitusi yang sebenarnya dibahas dalam artikel ini, yang dapat Anda lakukan hari ini, adalah perubahan kebijakan perutean alih-alih proyek migrasi. Qwen 4 Max tidak ada di katalog, dan tidak ada tier Qwen 4 yang ada; ketika salah satunya dirilis, di situlah ia akan muncul.
Keputusan itu, kalau memang bisa disebut begitu.
Tidak ada model di sini yang merupakan produk yang bisa Anda jadikan pilihan tetap, dan saran jujurnya adalah memperlakukan keduanya sesuai dengan itu. Gemini 3.1 Pro dapat dipanggil hari ini dengan harga yang dipublikasikan, jendela konteks yang dipublikasikan, dan jejak evaluasi publik, termasuk kelemahan retrieval di ujung jauh jendela tersebut; model ini juga merupakan pratinjau yang vendornya memberi tahu Anda untuk merencanakan penghentian (deprecation), berjalan pada tingkat kesalahan yang tidak dapat diterima untuk dependensi produksi. Qwen 4 Max tidak memiliki masalah-masalah itu karena tidak memiliki properti-properti itu.
Jika Anda membutuhkan model sekarang, pilihannya bukan di antara keduanya. Pilihannya adalah antara Gemini 3.1 Pro dan Qwen unggulan yang sudah dirilis, dan berdasarkan bukti yang tersedia, itu adalah keputusan tentang kualitas pengambilan konteks panjang versus tarif input $2.00 dengan bobot yang dipublikasikan. Jika Anda bisa menunggu, perhatikan dua hal, bukan satu: kartu model Qwen 4 Max, dan tanggal ketersediaan umum untuk Gemini 3.1 Pro. Mana pun yang datang lebih dulu memberi tahu Anda peta jalan mana di antara keduanya yang sebenarnya diprioritaskan oleh Alibaba dan Google.

Dibandingkan dalam artikel ini1
Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari
