Kartu judul hero untuk "Qwen 4 Max vs Claude Opus 5" dengan subjudul "Benchmark yang berubah di bawah keduanya", tiga lencana pil bertuliskan "Revisi indeks v4.3.2", "51 vs 53" dan "$5,00 dan $25,00", serta logo OrcaRouter di sudut kanan bawah.
Engineering & Research

Qwen 4 Max vs Claude Opus 5: tolok ukur yang bergeser di bawah keduanya

Penulis

Gideon Frost

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Qwen 4 Max dipratinjau di konferensi Yunqi di Hangzhou pada 22 September 2026 — tier unggulan dari lini Qwen 4 yang terdiri dari empat model yang telah diumumkan tetapi belum dirilis, tanpa harga, tanpa jendela konteks, dan tanpa skor yang dipublikasikan. Claude Opus 5 telah tersedia secara umum sejak 24 Juli 2026 dengan harga $5,00 per juta token masukan dan $25,00 per juta token keluaran, dan model ini telah menjadi sasaran yang dituju setiap model unggulan sejak rilis Qwen3.8-Max. Cara yang jelas untuk menulis perbandingan ini adalah lembar spesifikasi dengan satu kolom kosong. Cara yang berguna adalah menyadari bahwa pada 19 September 2026, tiga hari sebelum pengumuman, Artificial Analysis menilai ulang Intelligence Index-nya dan Claude Opus 5 tidak lagi menjadi model di puncaknya. Perubahan tunggal itu membingkai ulang apa yang harus dikalahkan Qwen 4 Max.

Apa yang berubah pada 19 September?

Artificial Analysis menerbitkan revisi indeks v4.3.2 pada 19 September 2026. Dalam revisi saat ini, Claude Opus 5 memperoleh skor 51 pada Intelligence Index pada upaya penalaran maksimumnya — 50 pada xhigh, 48 pada high, 45 pada medium, dan 39 pada low — dan berada di belakang Claude Fable 5.1 serta GPT-6 Astra, keduanya pada 53. Biaya per tugas pada indeks tersebut adalah $5.86.

Jika itu terdengar seperti penurunan, sebenarnya bukan. Modelnya tidak berubah. Indeksnya yang berubah. Liputan kami sendiri sepanjang Juli dan Agustus menyebut Claude Opus 5 pada angka 61 hingga 63 dan berada di puncak tabel, dan angka-angka itu benar berdasarkan revisi yang berlaku saat itu. Siapa pun yang masih mengutipnya tanpa tanggal revisi sedang mengutip angka yang sudah tidak berlaku, dan ini adalah kesalahan yang paling umum dalam perbandingan yang ditulis bulan ini. Konsekuensi praktisnya adalah klaim seperti "Claude Opus 5 adalah model dengan skor tertinggi yang tersedia" tidak lagi benar, dan perbandingan yang dibangun di atasnya pun runtuh.

Di sisi Qwen, konsekuensinya bahkan lebih tajam lagi. Tier unggulan yang diumumkan pada September 2026 diarahkan ke target yang didefinisikan ulang pada September 2026. Apa pun yang akhirnya diterbitkan Alibaba untuk Qwen 4 Max akan dibaca terhadap papan peringkat di mana 53 adalah angka yang harus dikalahkan, bukan 63.

A two-column scoreboard titled "Qwen 4 Max vs Claude Opus 5 - the scoreboard". Left column Qwen 4 Max: Status announced, no date; Input price not published; Output price not published; Context window not published; Independent score none exists; Open weights not published. Right column Claude Opus 5: Status generally available; Input price $5.00 per 1M tokens; Output price $25.00 per 1M tokens; Context window 1M tokens; Independent score 51 on index v4.3.2; Open weights none. Footer reads "Claude Opus 5 from Anthropic published pricing and Artificial Analysis index v4.3.2, September 19 2026.", with the OrcaRouter logo bottom-right.

Perbandingan, dinyatakan secara jujur

Satu sisi tabel ini sudah lengkap dan sisi lainnya kosong, dan berpura-pura sebaliknya justru akan menjadi keseluruhan mode kegagalan artikel ini. Inilah yang sebenarnya diketahui:

• Status — Claude Opus 5 tersedia secara umum sejak 24 Juli 2026, dibandingkan Qwen 4 Max yang diumumkan pada 22 September 2026 tanpa tanggal rilis

• Harga input — Claude Opus 5 $5.00 per 1 juta token, sedangkan Qwen 4 Max tidak dipublikasikan

• Harga output — Claude Opus 5 $25,00 per 1 juta token, sedangkan Qwen 4 Max tidak dipublikasikan

• Input cache — Claude Opus 5 $0.50 per 1 juta token pada pembacaan cache, dibandingkan Qwen 4 Max yang tidak dipublikasikan

• Konteks — Claude Opus 5 1 juta token pada default dan maksimum, versus Qwen 4 Max tidak dipublikasikan

• Batas maksimum keluaran — Claude Opus 5 128K token secara sinkron dan 300K pada Batches API dengan header beta, sedangkan Qwen 4 Max tidak dipublikasikan

• Modalitas — Claude Opus 5 input teks, gambar, dan file dengan output teks, dibandingkan Qwen 4 Max yang belum dipublikasikan

• Harga konteks panjang — Claude Opus 5 tidak mengenakan biaya tambahan, sehingga permintaan 900.000 token ditagih dengan tarif per token yang sama seperti permintaan 9.000 token, sedangkan Qwen 4 Max tidak dipublikasikan

• Skor independen — Claude Opus 5 51 pada Artificial Analysis Intelligence Index v4.3.2 dengan upaya maksimal, sedangkan Qwen 4 Max tidak ada evaluasi independen

• Skor yang dilaporkan vendor — Claude Opus 5 SWE-bench Verified 96,0%, SWE-bench Pro 79,2%, OSWorld 2.0 70,6%, Terminal-Bench 2.1 di pertengahan 80-an bergantung pada harness, dibandingkan Qwen 4 Max tidak melaporkan apa pun

• Kontrol penalaran — pemikiran adaptif Claude Opus 5 aktif secara default dengan tangga upaya lima langkah, versus Qwen 4 Max yang tidak dipublikasikan

Sepuluh baris "tidak dipublikasikan" bukanlah alat retoris. Itu adalah keadaan bukti, dan kesimpulan jujur darinya adalah bahwa belum ada perbandingan kemampuan antara kedua model ini yang dapat dilakukan oleh siapa pun.

Bagian dari celah yang tidak akan menutup

Harga dan konteks pada akhirnya akan dipublikasikan. Satu perbedaan akan tetap ada setelah peluncuran, dan itu layak diputuskan sekarang daripada pada minggu Qwen 4 Max dikirim: kedua model itu dirancang untuk dibeli dengan cara yang berbeda.

Claude Opus 5 adalah model tertutup tunggal pada satu harga dari satu vendor, dengan komitmen penghentian yang dipublikasikan tidak lebih awal dari 24 Juli 2027. Itu adalah target yang stabil untuk perencanaan kapasitas. Qwen 4 Max adalah andalan dari keluarga yang berulang kali dirilis Alibaba dalam rentang harga yang jauh lebih luas — generasi Qwen 3.8 mencakup andalan terdepan pada biaya input $2,00 dan tier Flash yang jauh di bawahnya — dan tier andalan dari lini Qwen secara historis merupakan tier dengan masa pakai berguna paling pendek sebelum tier yang lebih murah menyusulnya.

Perbedaan lainnya adalah bobot terbuka, dan ini mengarah ke arah sebaliknya. Generasi Qwen 3.8 menerbitkan bobot untuk model terbesarnya di bawah lisensi Qwen khusus, yang justru memungkinkan fine-tuning, kuantisasi, dan self-hosting sama sekali. Claude Opus 5 tidak merilis bobot dan tidak akan pernah melakukannya. Jika beban kerja Anda membutuhkan model yang dapat Anda jalankan di dalam perimeter Anda sendiri, atau memodifikasinya, itu adalah keunggulan struktural yang tidak dapat dihapus oleh revisi benchmark apa pun dari Alibaba — dan itu adalah alasan terkuat untuk peduli pada perbandingan khusus ini alih-alih menganggapnya sebagai satu flagship melawan flagship lainnya.

A screenshot of the OrcaRouter model page for Claude Opus 5 (anthropic/claude-opus-5, English UI), showing the 1M token context badge, the model ID anthropic/claude-opus-5, a 128K maximum output, text plus image plus file input with text output, the Vision, Tools, JSON and Reasoning tags, the listing date 2026-07-24 credited to Anthropic, a p50 time-to-first-token of 5.75s, the OpenAI-compatible code sample, the Public benchmarks block, and the opening of the model description calling Claude Opus 5 Anthropic flagship for demanding reasoning, coding and long-horizon agentic work.

Cara menjalankan perbandingan ini hari ini

Claude Opus 5 kini sudah tersedia, dan OrcaRouter merutekannya sebagai anthropic/claude-opus-5 dengan harga daftar Anthropic tanpa markup 0% — tarif penyedia diteruskan apa adanya, sehingga angka $5,00 dan $25,00 di atas adalah yang Anda ditagih, bukan padanan yang sudah dimarkup. Hal itu lebih penting daripada biasanya untuk model di rentang harga ini: margin platform 10 persen pada tarif keluaran $25,00 adalah $2,50 per juta token, yang lebih besar daripada seluruh biaya masukan sebagian besar alternatif berbobot terbuka. Di sampingnya, katalognya memuat hampir 200 model pada satu endpoint yang kompatibel dengan OpenAI, dengan failover otomatis saat jalur penyedia menurun dan DSL perutean untuk menyatakan kebijakan secara eksplisit alih-alih meng-hard-code nama model ke dalam aplikasi Anda.

Yang tidak dibawa OrcaRouter adalah Qwen 4 Max, atau tier Qwen 4 mana pun. Katalognya tidak memiliki satu pun entri untuk keluarga tersebut, yang memang seperti yang Anda perkirakan untuk model yang diumumkan tetapi belum dirilis. Ketika tier-tier itu nanti benar-benar dirilis, model-model itu akan muncul di tempat yang sama, dan sampai saat itu model Qwen yang layak dibandingkan dengan Claude Opus 5 adalah model yang benar-benar bisa Anda panggil: Qwen3.8-Max, tersedia secara umum sejak 3 Agustus 2026 dengan harga $2,00 untuk input dan $6,00 untuk output per juta token, dengan bobot yang dipublikasikan dan skor kecerdasan independen yang tercatat sebesar 56 pada $1,14 per tugas — angka yang tercatat di bawah revisi indeks yang lebih awal, jadi bandingkanlah dengan angka 51 milik Claude Opus 5 hanya dengan catatan tersebut.

Apa yang harus dilakukan dengan ini sebelum kartu model ada

Tidak ada putusan yang bisa diberikan di sini, karena salah satu dari kedua model itu tidak ada sebagai produk. Yang bisa dikatakan adalah bahwa perbandingan itu berubah bentuk pada 19 September 2026 tanpa ada vendor yang melakukan apa pun: Claude Opus 5 bukan lagi model dengan skor tertinggi pada indeks independen yang menjadi andalan sebagian besar perbandingan, dan kini ia berada dua poin di belakang dua model lain. Peluncuran Qwen 4 Max akan masuk ke tabel itu, bukan tabel dari bulan Juli.

Jadi, keputusan untuk beberapa bulan ke depan bukanlah Qwen 4 Max versus Claude Opus 5. Melainkan Claude Opus 5 versus model Qwen yang sudah dirilis — sebuah model unggulan dengan harga input seperlimanya dan bobot yang dipublikasikan — dan perbandingan itu sudah tersedia sekarang, dengan angka nyata di kedua sisi. Tinjau kembali saat Alibaba menerbitkan kartu model, dan anggap setiap tabel benchmark Qwen 4 Max yang Anda lihat sebelum itu sebagai belum terverifikasi.

A screenshot of the OrcaRouter model page for Qwen3.8 Max (qwen/qwen3.8-max, English UI), showing the 1M token context badge, the model ID qwen/qwen3.8-max, text plus image plus video input with text output, the Vision, Tools, JSON, Reasoning and Thinking capability tags, the listing date 2026-08-03, a p50 time-to-first-token of 3.29s, the OpenAI-compatible Python code sample, and the model description naming Qwen3.8-Max Alibaba newest flagship and highest-capability tier to date.

Dibandingkan dalam artikel ini2

Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari