Kartu judul hero yang dihasilkan untuk artikel berjudul 'Grok 4.7 vs Qwen 3.8 Max — lempar koin di atas kertas', dengan subjudul 'Harga identik, selisih satu poin indeks, bentuk berlawanan' dan chip statistik bertuliskan AA Index 46 vs 45, harga $2/$6 pada keduanya, dan konteks 500K vs 984K.
Guides & Insights

Grok 4.7 vs Qwen 3.8 Max: Harga Identik, Terpaut Satu Poin, Bentuk Bertolak Belakang

Penulis

Elias Hawthorne

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Dua model andalan tertutup, keduanya dengan harga $2 per juta token masukan dan $6 per juta token keluaran, keduanya mencetak skor yang hanya berselisih satu poin pada tolok ukur independen yang sama, dirilis dengan selisih sembilan belas hari. Grok 4.7 hadir pada 21 September 2026 dari SpaceXAI; Qwen 3.8 Max dirilis oleh vendor pada 3 Agustus 2026 dan diperbarui pada 2 September 2026. Pada Artificial Analysis Intelligence Index saat ini, versi v4.3.2, Grok 4.7 mencetak skor 46 dan Qwen 3.8 Max mencetak skor 45. Dari segi harga dan kemampuan terukur, kedua model ini adalah pembelian yang sama. Dalam semua hal lainnya — konteks, modalitas, kecepatan penyajian, keterbukaan, dan apa yang dipilih masing-masing vendor untuk dioptimalkan — keduanya tidak bisa lebih berbeda lagi, dan itulah yang membuat perbandingan ini layak dijalankan alih-alih dilewatkan.

Pertama, soal linimasa, karena Qwen 3.8 Max memiliki dua tanggal.

Ini membingungkan banyak liputan, jadi layak diluruskan sejak awal. Qwen 3.8 Max diluncurkan pada 3 Agustus 2026 sebagai model terbesar dan paling cakap milik Alibaba, dibangun dari arsitektur visi-bahasa Qwen 3.5 dengan desain sparse mixture-of-experts yang dilaporkan memiliki total 2,4 triliun parameter dengan 95 miliar parameter aktif per token. Pada 2 September 2026, Alibaba merilis build yang diperbarui — revisi 0902, yang merupakan versi yang membawa ID model terkini dan versi yang dipakai Artificial Analysis untuk memberi tanggal pada halamannya. Jika Anda pernah melihat tanggal Agustus sekaligus September untuk Qwen 3.8 Max, itulah sebabnya: satu adalah peluncuran, yang lain adalah revisi yang sebenarnya banyak disebut orang saat ini.

Grok 4.7 memiliki riwayat yang lebih bersih dan riwayat yang lebih berantakan di belakangnya. SpaceXAI merilisnya pada 21 September 2026 setelah peluncuran yang berulang kali mundur — Musk telah menyebut jendela waktu pada akhir Agustus, awal September, dan pertengahan September sebelum model itu benar-benar dirilis. Perilisannya sendiri terbatas: model dasar yang lebih besar daripada Grok 4.6, proses reinforcement learning yang lebih panjang yang ditujukan untuk tugas-tugas berdurasi berjam-jam, dan tidak ada perubahan pada kartu tarif $2/$6 yang telah dibawa Grok 4.6 sejak 12 Agustus.

Apa yang dioptimalkan oleh masing-masing vendor

Bacalah dua pengumuman peluncuran itu sebagai pasangan, dan taruhan desainnya hampir sepenuhnya saling berlawanan.

SpaceXAI dioptimalkan untuk eksekusi agentic. Angka yang dilaporkan vendor untuk Grok 4.7 terkonsentrasi pada pekerjaan terminal dan repositori: Terminal-Bench 4.0 sebesar 38,0% dibandingkan 20,3% milik Grok 4.6, CursorBench 4.0 sebesar 46,3%, DeepSWE v1.1 sebesar 71,0% pada upaya penalaran tinggi, EEBench sebesar 64,0%. Deskripsi perusahaan sendiri tentang rilis tersebut menyebut verifikasi mandiri dan penanganan konteks panjang di dalam lingkungan Grok Bot sebagai target. Grok 4.7 menyediakan jendela 500.000 token, menerima teks dan gambar, mengembalikan teks, dan mengekspos upaya penalaran dari low hingga xhigh. Ini adalah model yang dibangun untuk menyelesaikan pekerjaan.

Alibaba mengoptimalkannya untuk jangkauan. Qwen 3.8 Max menyediakan jendela konteks sekitar 984.000 token — efektifnya satu juta — dan kekuatan yang dipublikasikan terletak pada keluasannya, bukan kedalaman di satu bidang: skor Terminal Bench 2.1 sebesar 86,6, SWE-bench Pro 67,7, PaperBench 93,0, GPQA Diamond 92,6, MMMU-Pro 82,3, OSWorld-Verified 86,1. Model ini menerima input teks, gambar, dan video serta mengembalikan teks, mendukung tingkat upaya penalaran dengan xhigh sebagai default, dan titik terlemahnya yang dipublikasikan adalah Humanity's Last Exam pada 43,6. Ini adalah model yang dibangun untuk menangani apa pun yang Anda berikan.

Setiap angka dalam paragraf itu dilaporkan oleh vendor. Tidak ada satu pun dari kedua kumpulan tersebut yang telah direproduksi secara independen, dan lagipula kedua kumpulan itu memang tidak dapat dibandingkan secara langsung — Terminal-Bench 2.1 dan Terminal-Bench 4.0 adalah benchmark yang berbeda, jadi angka 86,6 milik Qwen dan 38,0 milik Grok tidak boleh pernah diletakkan berdampingan.

• Komposit independen — {{1}}Grok 4.7{{/1}} {{2}}46{{/2}} pada AA Intelligence Index v4.3.2 vs {{3}}Qwen 3.8 Max{{/3}} {{4}}45{{/4}} pada versi yang sama. Hasil imbang secara statistik.

• Harga per juta token — $2,00 untuk input / $6,00 untuk output pada keduanya. Diskon cache Qwen tercantum sebesar 88%, menghasilkan tarif campuran $1,18 per juta; ketentuan cache Grok 4.7 tidak dipublikasikan dengan dasar yang sama.

• Jendela konteks — Grok 4.7 500.000 token vs Qwen 3.8 Max sekitar 984.000. Qwen menang hampir dua kali lipat, dan ini adalah perbedaan spesifikasi tunggal terbesar di antara keduanya.

• Modalitas input — Grok 4.7 teks dan gambar vs Qwen 3.8 Max teks, gambar, dan video.

• Bobot — keduanya proprietary. Tidak satu pun dari model tersebut dapat diunduh, yang sepenuhnya menghilangkan argumen open-weights yang biasa dari perbandingan ini.

• Parameter — Grok 4.7 tidak diungkapkan pada lembar spesifikasi SpaceXAI mana pun (angka ~2.1T adalah klaim Musk) vs Qwen 3.8 Max dilaporkan pada total 2.4T dengan 95B aktif, yang juga belum dikonfirmasi Alibaba pada lembar spesifikasi.

• Kecepatan penyajian — Qwen 3.8 Max pada 38,8 token keluaran per detik dengan 3,08 detik ke token pertama, menurut Artificial Analysis; Grok 4.7 diposisikan oleh SpaceXAI sebagai sekitar dua kali lebih cepat daripada model yang sebanding, dilaporkan vendor, tanpa angka throughput independen yang dipublikasikan sejauh ini.

A generated two-column comparison scoreboard for Grok 4.7 and Qwen 3.8 Max with six rows: AA Intelligence Index 46 vs 45, price $2.00/$6.00 on both, context 500K vs 984K tokens, modalities text and image vs text, image and video, weights proprietary on both, and speed vendor-claimed twice as fast vs 38.8 tokens per second measured, with a footer noting index scores are per Artificial Analysis v4.3.2 and all benchmark figures are vendor-reported.

Perbedaan konteks adalah keputusan yang sesungguhnya.

Ketika harga dan kemampuan identik, keputusan jatuh pada hal lain yang berbeda, dan di sini yang berbeda adalah konteks. Menggandakan jendela dari 500.000 menjadi sekitar 984.000 token bukan sekadar keunggulan di lembar spesifikasi — ini adalah perbedaan antara memotong-motong repositori dan menampungnya secara utuh.

Jendela yang lebih panjang dari Qwen 3.8 Max disertai catatan yang didokumentasikan dan penting bagi pembeli: versi open-weights yang diumumkan Alibaba untuk pekan 10 Agustus 2026 hanya berbasis teks dan tidak menyertakan konteks penuh satu juta token. Hal ini tidak memengaruhi endpoint yang dihosting yang menjadi fokus perbandingan ini, tetapi perlu diketahui jika Anda merencanakan berdasarkan rilis terbuka tersebut.

Ada pertimbangan kedua di sisi Grok. Lini Grok secara historis menerapkan tebing harga pada 200.000 token masukan, di mana permintaan yang melewati ambang tersebut akan menetapkan ulang harga seluruh permintaan pada dua kali tarif — $4 masuk dan $12 keluar. Dengan jendela 500.000 token, ambang itu berada jauh di dalam rentang kerja model. Sebelum mengarahkan pekerjaan konteks panjang ke Grok 4.7, pastikan daftar tarif terkini untuk model yang digunakan, karena interaksi antara jendela besar dan tebing penetapan ulang harga adalah titik di mana tagihan konteks panjang bisa keliru.

Berapa biaya kerja sebulan untuk masing-masing

Karena tarif utamanya identik, perbandingan biaya harus dibangun dari perilaku token alih-alih dari kartu tarif, dan di sanalah kedua model berbeda dengan cara yang dapat diukur.

Artificial Analysis mengukur Grok 4.7 menghasilkan 240 juta token keluaran saat menjalankan Intelligence Index-nya, dibandingkan dengan median 92 juta di antara model-model di papan peringkat — model ini adalah penalar yang bertele-tele. Qwen 3.8 Max menghasilkan 190 juta token keluaran pada indeks yang sama, dengan total biaya evaluasi $4,934.79 dan kecepatan terukur 38.8 token per detik. Keduanya jauh di atas median verbositas, dan Grok 4.7 adalah yang lebih bertele-tele di antara keduanya.

Jadi, pada harga output yang sama, $6 per juta, model yang mengeluarkan lebih banyak token per tugas akan lebih mahal per tugas. Angka verbositas yang dipublikasikan menunjukkan Grok 4.7 akan mengonsumsi lebih banyak token output untuk pekerjaan indeks yang setara, yang berarti hasil imbang pada harga sebenarnya adalah kemenangan kecil bagi Qwen 3.8 Max dalam biaya per tugas — diimbangi oleh klaim keunggulan kecepatan Grok 4.7, yang mempersingkat waktu aktual dan karena itu biaya manusia untuk menunggu proses agen berjalan. Tidak satu pun dari kedua kompensasi itu yang terlihat pada daftar harga, dan keduanya layak diukur pada trafik Anda sendiri daripada diasumsikan.

Satu asimetri yang tidak diperdebatkan adalah caching. Qwen 3.8 Max mengumumkan diskon cache sebesar 88% dan tarif gabungan $1,18 pada komposisi cache-hit/input/output 7:2:1. Untuk beban kerja dengan prefiks stabil yang besar — prompt sistem, tajuk basis kode, kumpulan dokumen — diskon itulah tempat penghematan sesungguhnya berada, dan ada baiknya memeriksa bagaimana ketentuan cache Grok 4.7 dibandingkan sebelum Anda berkomitmen pada volume besar.

Screenshot of the Artificial Analysis model page for Qwen3.8 Max showing an Intelligence Index of 45 on index version v4.3.2, a context window of approximately 984k tokens, text and image input, listed pricing of $2.00 input and $6.00 output per million tokens, and an output speed of 38.8 tokens per second.

Memilih, ketika angka-angka menolak memilih untukmu

Skor 46 dan 45 pada indeks yang sama, dengan harga yang sama, adalah yang paling mendekati seri sungguhan yang mungkin dipublikasikan blog ini. Itu berarti keputusan harus dibuat berdasarkan sumbu tempat kedua model benar-benar berbeda, dan ada empat di antaranya.

Pilih Grok 4.7 jika pekerjaan Anda adalah pengodean agentik dan eksekusi terminal, jika kecepatan waktu nyata pada proses yang berjalan lama lebih penting daripada ruang konteks, dan jika Anda menginginkan pengaturan tingkat penalaran per permintaan untuk menjaga lalu lintas yang sederhana tetap murah. Pilih Qwen 3.8 Max jika Anda rutin menangani input yang lebih besar dari setengah juta token, jika input video ada dalam peta jalan Anda, jika Anda menginginkan diskon cache 88% untuk beban kerja yang didominasi prefiks, atau jika Anda menginginkan model yang vendornya menerbitkan matriks evaluasi yang luas, bukan yang hanya terkonsentrasi pada satu jalur.

Jika jawaban jujurnya adalah "sedikit dari keduanya", itu adalah jawaban yang normal, dan itulah kasus yang dirancang untuk pasangan ini. Qwen 3.8 Max tersedia di OrcaRouter dengan harga daftar Alibaba, dan OrcaRouter meneruskan harga daftar penyedia apa adanya dengan markup 0%, jadi $2/$6 di atas adalah yang sebenarnya Anda bayar dan perubahan tarif vendor langsung berlaku di sini pada hari yang sama, bukan saat perpanjangan. Satu kunci API mencakup Qwen 3.8 Max plus lebih dari 200 model lainnya, yang berarti keputusan konteks menjadi aturan routing per permintaan alih-alih komitmen platform: kirim input yang berukuran berlebihan ke jendela 984k dan pertahankan sisanya di endpoint mana pun yang tercepat dan termurah untuk tugas itu, dengan failover otomatis jika kualitas penyedia menurun. Ketika suatu tugas benar-benar membutuhkan kedua bentuk — pembacaan konteks panjang yang diikuti tahap eksekusi agentik — DSL routing menyusun model menjadi satu panggilan alih-alih memaksa Anda memilih satu sisi.

Satu klarifikasi yang perlu disampaikan: karena tidak ada satu pun model yang bersifat terbuka, tidak ada bagian dari perbandingan ini yang melibatkan bobot yang dapat diunduh. Keduanya adalah endpoint yang dihosting, dan hosting mandiri bukan pilihan bagi keduanya.

Satu angka yang perlu diingat

Empat puluh enam berbanding empat puluh lima bukanlah alasan untuk memilih sebuah model, dan seharusnya tidak begitu. Yang menentukan perbandingan ini adalah jendela konteks — 500.000 token berbanding sekitar 984.000 — dan bentuk yang dipilih masing-masing vendor: Grok 4.7 dioptimalkan untuk menyelesaikan pekerjaan agentik yang sulit dengan cepat, Qwen 3.8 Max dioptimalkan untuk menangani apa pun yang Anda berikan. Harga sama, kemampuan terukur sama, pekerjaan berbeda. Itu adalah keputusan perutean, dan itu jenis keputusan yang seharusnya cukup memakan waktu satu sore untuk diuji alih-alih satu kuartal untuk diadakan.

Screenshot of the OrcaRouter model page for Qwen3.8 Max (model ID qwen/qwen3.8-max), showing Alibaba's list pricing of $2.00 per million input tokens and $6.00 per million output tokens, a 1M token context window, and the vision, tools, JSON and reasoning capability tags.

Dibandingkan dalam artikel ini3

Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari