
Qwen 3.8 vs Claude Opus 4.8: Skala Murah Bertemu Spesialis Penalaran
- metaBARUMeta: Muse Spark 1.22026-08-05$1.25 / $4.25 per 1 juta token · 819 tok/s
- qwenBARUQwen: Qwen3.8 Max2026-08-03$2.00 / $6.00 per 1 juta token · 56 tok/s
- deepseekBARUDeepSeek: DeepSeek V4 Flash 07312026-07-3150Kecerdasan69Koding
- qwenBARUQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token · 198 tok/s
- orcaBARUOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicBARUAnthropic: Claude Opus 52026-07-2461Kecerdasan78Koding
- googleGoogle: Gemini 3.6 Flash2026-07-2150Kecerdasan69Koding
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Kecerdasan49Koding
- metaMeta: Muse Spark 1.12026-07-1651Kecerdasan71Koding
- kimiMoonshotAI: Kimi K32026-07-1557Kecerdasan76Koding
- openaiOpenAI: GPT-5.6 Luna2026-07-0951Kecerdasan71Koding
- openaiOpenAI: GPT-5.6 Terra2026-07-0955Kecerdasan77Koding
- openaiOpenAI: GPT-5.6 Sol2026-07-0959Kecerdasan77Koding
- grokxAI: Grok 4.52026-07-0854Kecerdasan72Koding
- tencentTencent: Hy32026-07-0641Kecerdasan59Koding
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Kecerdasan42Koding
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Kecerdasan39Koding
- anthropicAnthropic: Claude Sonnet 52026-06-3053Kecerdasan72Koding
- klingKling: Kling 3.0 Turbo2026-06-1757Kecerdasan52Koding57Matematika
- z-aiZ.ai: GLM 5.22026-06-1651Kecerdasan69Koding60Matematika
Alibaba mempratinjau Qwen3.8-Max di Shanghai pada 19 Juli 2026 sebagai model berparameter 2,4 triliun yang dirancang untuk skala dan ketelitian. Milik Anthropic, Claude Opus 4.8 adalah hewan yang sangat berbeda: unggulan penalaran mendalam premium yang diandalkan tim ketika sebuah tugas memiliki banyak langkah dan jawaban yang salah berbiaya mahal.
Selama dua minggu, perbandingan itu sulit dibuat dengan jujur, karena Qwen belum mempublikasikan harga maupun tolok ukur. Itu berubah pada 3 Agustus 2026, ketika Qwen3.8-Max mencapai ketersediaan umum dengan daftar tarif $2 / $6 per juta token dan tabel tolok ukur yang lengkap. Pertanyaan filosofisnya tetap sama — skala mentah dan keterbukaan versus keandalan penalaran — tetapi sekarang ada angka di kedua sisinya.
Catatan untuk para pengembang — cara tercepat untuk menyelesaikan pertanyaan seperti ini adalah dengan menjalankan keduanya pada alur kerja Anda sendiri. OrcaRouter menghadirkan 200+ model di belakang satu endpoint yang kompatibel dengan OpenAI, sehingga Anda dapat mempertemukan Qwen 3.8 Max dengan Opus 4.8 pada tugas yang sama tanpa perlu menyambungkan dua SDK.
Kesimpulan TL;DR. Opus 4.8 tetap menjadi spesialis penalaran: diaudit ke dalam kelompok teratas Artificial Analysis Intelligence Index dan dipercaya untuk rantai agen panjang di mana jawaban salah yang diyakini benar memakan biaya lebih besar daripada tagihan token. Kelemahannya adalah biaya dan verbositas — AA menempatkan tarif campurannya sekitar $3.85/1M pada upaya maksimal, dan boros token, dengan Grok 4.5 dilaporkan menyelesaikan tugas sebanding menggunakan kira-kira 4× lebih sedikit token keluaran. Qwen3.8-Max kini melawan dengan sesuatu yang tidak dimilikinya pada bulan Juli: harga nyata yang rendah sebesar $2 / $6 tetap untuk 1M token, input yang di-cache sebesar $0.25, dan tabel tolok ukur vendor yang dipimpin oleh Terminal-Bench 2.1 86.6 dan OSWorld-Verified 86.1. Ia juga menunjukkan ketekunan agen yang sesungguhnya dalam satu pengujian pihak ketiga yang tersedia. Namun tetap belum dinilai oleh evaluator independen mana pun. Opus untuk penalaran yang harus Anda percaya; Qwen untuk pekerjaan yang peka biaya dan mengutamakan ketelitian.
Poin-poin penting
• Qwen3.8-Max telah GA sejak 3 Agustus 2026 dengan harga $2 / $6 per 1M token, seragam di seluruh konteks 1M token — kartu tarif yang sebenarnya, menggantikan diskon pratinjau sementara bulan Juli.
• Opus 4.8 jauh lebih mahal: Artificial Analysis memperkirakan biaya gabungannya mendekati $3.85/1M pada upaya maksimal, dan ia boros token — dilaporkan ~4× lebih banyak token output per tugas dibanding Grok 4.5, sehingga proses agen yang panjang memperbesar kesenjangan.
• Sumber-sumber bertentangan tentang angka AA pasti Opus 4.8. Pada AA v4.1, Kimi K3 (57.1) dilaporkan tepat di atasnya, jadi pernyataan yang andal adalah "kluster teratas, di bawah para pemimpin Sol Fable 5 / GPT-5.6" daripada satu skor pasti tunggal.
• Qwen kini memiliki angka agenik, yang dilaporkan sendiri: Terminal-Bench 2.1 86.6, OSWorld-Verified 86.1, FrontierSWE 73.5 (dari 40.7 pendahulunya). Tidak ada yang diverifikasi secara independen.
• Satu titik data agentik pihak ketiga Qwen menguntungkan: dibandingkan dengan Kimi K3, ia menghasilkan 354 kutipan repo berbanding 274, digunakan 22 permintaan gateway berbanding 53, dan mencatat 0 panggilan alat yang gagal berbanding 2 — sementara mencetak 80/100 berbanding 83 milik Kimi.
• Keterbukaan terpecah secara permanen: Qwen berjanji merilis bobot terbuka dalam minggu ini, ditambah Qwen3.8-27B dengan VRAM ~17GB; Opus 4.8 tertutup dan hanya tersedia melalui API.
Catatan akurasi: semua angka kualitas Qwen3.8-Max dilaporkan oleh Alibaba dan belum diverifikasi oleh pihak ketiga. Angka Opus 4.8 dikaitkan dengan Artificial Analysis dan sumber-sumber yang disebutkan dan mungkin berbeda dari pelaporan Anthropic sendiri; karena pelacak berbeda pendapat tentang indeks pasti Opus, kami menyatakan posisi relatifnya daripada satu angka tunggal. Harga Qwen adalah kartu tarif GA dan menggantikan diskon pratinjau bulan Juli.
Spesifikasi dan harga, berdampingan
Berikut adalah data konkret, setiap angka diatribusikan pada sumbernya.
• Pembuat / status — Qwen3.8-Max: Alibaba; GA (3 Agustus 2026); Claude Opus 4.8: Anthropic; flagship GA penalaran mendalam
• Arsitektur — Qwen3.8-Max: ~2.4T total, sparse MoE (parameter aktif masih belum diungkapkan); Opus 4.8: Tertutup; arsitektur tidak diungkapkan
• Jendela konteks — Qwen3.8-Max: 1M token (983,616 dengan berpikir; output maksimum 131,072); Opus 4.8: andalan konteks panjang
• AA Intelligence Index — Qwen3.8-Max: Masih belum diberi skor; Opus 4.8: Klaster teratas, di bawah para pemimpin (Artificial Analysis; Kimi K3 dengan 57.1 dilaporkan tepat di atasnya)
• Kekuatan inti — Qwen3.8-Max: Skala, ketelitian, ekonomi konteks panjang; Opus 4.8: Penalaran multi-langkah yang mendalam + keandalan agen
• Skor agentik yang dilaporkan vendor — Qwen3.8-Max: Terminal-Bench 2.1 86.6, OSWorld-Verified 86.1 (dilaporkan Alibaba); Opus 4.8: n/a — reputasi diperoleh dari produksi
• Harga (masuk / keluar) — Qwen3.8-Max: $2.00 / $6.00 per 1M, datar; input cache $0.25; Opus 4.8: Premium — AA campuran ~$3.85/1M pada upaya maksimum
• Efisiensi token — Qwen3.8-Max: banyak kata; IFBench 82.8 adalah skor terendah dari laporan mandirinya; Opus 4.8: banyak token — ~4× lipat dari keluaran Grok 4.5 (dilaporkan)
• Bobot terbuka — Qwen3.8-Max: Dijanjikan dalam minggu ini (belum ada lisensi); Opus 4.8: Tidak — tertutup / hanya API
Dua hal membingkai perbandingan ini, dan keduanya bergerak pada 3 Agustus.
Pertama, kesenjangan biaya kini dapat diukur, bukan sekadar konseptual. Pada bulan Juli, keunggulan Qwen adalah diskon yang tidak bisa Anda anggarkan. Kini itu adalah tarif, dan bentuk kesenjangannya tidak biasa: Opus mahal dan berat token, yang berarti keduanya berlipat ganda. Jika Opus mengeluarkan token output empat kali lipat untuk tugas yang sama dan mengenakan biaya premium per token, proses agentik yang panjang dapat memakan biaya berkali-kali lipat dari yang disarankan oleh tarif utama. Tarif output Qwen sebesar $6, konteks 1M flat, dan input cache $0,25 menyerang penggandaan itu secara langsung.
Kedua, kolom benchmark Qwen tidak lagi kosong — dan untuk sekali ini, sebagian darinya benar-benar relevan. Seluruh klaim Opus 4.8 adalah keandalan agenik, dan Alibaba kini telah menerbitkan angka-angka agenik: Terminal-Bench 2.1 86.6 untuk operasi shell, OSWorld-Verified 86.1 untuk mengoperasikan GUI sungguhan. Angka-angka itu mengukur hal yang tepat. Catatannya adalah soal asal-usul, bukan relevansi: Alibaba menghasilkannya menggunakan harness mereka sendiri, dan belum ada pihak ketiga yang mereplikasinya. Sementara itu, reputasi Opus bertumpu pada sesuatu yang lebih sulit untuk dipublikasikan tetapi bisa dibilang lebih berharga — penggunaan produksi yang berkelanjutan di banyak tim, yang merupakan jenis bukti yang tidak dapat dibuat oleh tabel vendor.

Keandalan penalaran vs ketelitian mentah
Perbedaan menarik antara keduanya bukanlah kualitas sekali jalan — melainkan bagaimana mereka berperilaku ketika sebuah tugas memiliki banyak langkah dan dilengkapi alat-alat nyata.
Reputasi Opus 4.8 dibangun di atas keandalan agen: rantai penalaran yang panjang di mana ia melacak konteks, pulih dari jalan buntu, dan mengembalikan jawaban yang dapat Anda tindak lanjuti tanpa memeriksa ulang setiap langkah. Itulah sifat yang membuat tim rela membayar mahal, karena dalam produksi, biaya jawaban multi-langkah yang salah dengan penuh keyakinan jauh lebih besar daripada tagihan token. Trade-off-nya adalah Opus boros token — Grok 4.5 dilaporkan menyelesaikan tugas serupa dengan output token sekitar 4× lebih sedikit — sehingga keandalannya datang dengan biaya nyata yang berkelanjutan.
Qwen 3.8 menjawab dengan kekuatan yang berbeda: ketelitian yang luar biasa, dan kini ada satu data pihak ketiga tentangnya. Dalam uji pemahaman arsitektur yang dijalankan oleh Trilogy AI (Qwen3.8-Max vs Kimi K3), Qwen mencetak 80/100 berbanding 83 milik Kimi — kalah pada skor utama — tetapi ia adalah agen yang lebih tekun, menghasilkan 354 kutipan repo berbanding 274 milik Kimi, menggunakan 22 permintaan gateway berbanding 53, serta mencatat 0 panggilan alat gagal berbanding 2. Kedua model mencapai kesimpulan arsitektur inti yang sama; Qwen hanya melakukan lebih banyak kerja grounding untuk sampai ke sana, dengan penggunaan alat yang lebih bersih.
Hasil tanpa satu pun panggilan alat yang gagal itu adalah sinyal agentik paling menggembirakan yang dimiliki Qwen, karena panggilan alat yang gagal adalah yang sebenarnya merusak agen produksi. Itu juga hanya satu pengujian, pada satu tugas, oleh satu evaluator — jauh dari basis bukti di balik reputasi Opus.
Biaya dari ketelitian Qwen adalah latensi dan token. Para pengulas era pratinjau menemukannya "sangat bagus dan sangat lambat" — 30+ menit untuk membangun situs web, lebih dari satu jam untuk simulasi poker, model paling lambat yang pernah digunakan pengulas tersebut. Dua catatan kini berlaku. Itu adalah infrastruktur pratinjau, dan penyajian GA adalah sistem yang berbeda; telemetri 7 hari OrcaRouter saat ini menunjukkan p50 waktu-ke-token-pertama sebesar 1,64 detik, meskipun TTFT dan throughput ujung-ke-ujung pada pembangunan selama satu jam adalah besaran yang berbeda. Temuan ini layak diuji ulang daripada diulang begitu saja.
Ada juga kekhawatiran struktural yang layak disebut: skor terendah yang dilaporkan Alibaba sendiri adalah IFBench 82.8, yaitu kepatuhan terhadap instruksi dalam kondisi terbatas. Untuk pipeline agen yang mengurai keluaran model di setiap langkah, model yang melampaui cakupan dan menambahkan pekerjaan yang tidak diminta merupakan risiko, apa pun tingkat ketelitiannya. Di sinilah kedisiplinan Opus membuktikan nilainya.

Biaya dalam praktik: di mana kesenjangan token 4× terasa.
Ambil contoh proses agen multi-langkah: 80.000 token masukan konteks dan — ini adalah variabel kuncinya — volume keluaran yang berbeda, karena Opus dilaporkan mengeluarkan sekitar 4× lebih banyak.
• Qwen3.8-Max pada 8.000 token keluaran: 0.08M × $2 = $0.16, ditambah 0.008M × $6 = $0.048. ≈ $0.21 per proses.
• Opus 4.8 dengan harga gabungan ~$3,85/1M untuk 80.000 input + ~32.000 output (4× token): kira-kira $0,43 per proses pada harga gabungan — dan jauh lebih besar jika Anda menghitung input dan output secara terpisah dengan tarif tier premium.
• Pada 3.000 run/hari: Qwen ≈ $630/hari; Opus ≈ $1.290/hari atau lebih.
• Dengan input cache Qwen sebesar $0.25/1M pada konteks stabil, biayanya turun menjadi ≈ $0.07 — kira-kira 6× lebih murah daripada Opus.
Penyeimbang yang jujur adalah yang selalu berlaku untuk perbandingan Opus: jika Opus menyelesaikan tugas dalam satu upaya sementara model yang lebih murah membutuhkan dua upaya ditambah pemeriksaan manusia, model yang lebih murah itu sebenarnya tidak lebih murah. Sifat Opus yang bertele-tele sebagian merupakan mekanisme keandalannya — ia bernalar dengan bersuara, dan itu memakan token. Pertanyaan untuk beban kerja Anda adalah apakah Anda membayar untuk pertimbangan yang Anda butuhkan. Untuk penalaran berisiko tinggi dan bervolume rendah, Anda mungkin memang membayarnya. Untuk analisis bervolume tinggi yang Anda verifikasi di hilir, Anda mungkin tidak.
Keterbukaan dan pertanyaan on-premise
Opus 4.8 ditutup dan hanya API, secara permanen. Qwen3.8-Max mungkin tidak — bobot dijanjikan dalam minggu ini — tetapi model unggulan tersebut bukan target self-hosting yang realistis: sekitar 1,2TB pada 4-bit dibandingkan sekitar 141GB per H200 berarti delapan atau lebih akselerator kelas atas, dan dengan jumlah parameter aktif yang masih tidak diungkapkan, Anda tidak dapat memodelkan throughput yang akan dibeli oleh pengeluaran itu. Juga belum ada teks lisensi, sehingga kegunaan komersial secara formal belum ditentukan.
Yang diumumkan secara bersamaan Qwen3.8-27B adalah rilis praktis bagi tim yang lebih mengutamakan kendali daripada kemampuan mentah. Juga dirilis dengan open-weights, model ini dikabarkan berjalan dalam sekitar 17GB VRAM — satu kartu kelas atas. Jika Anda membandingkannya dengan Opus karena membutuhkan penalaran di dalam jaringan Anda sendiri, 27B adalah model yang layak dievaluasi; keterbukaan model unggulan 2.4T sebagian besar hanya bersifat teoretis.
FAQ
Apakah Qwen 3.8 lebih baik dari Claude Opus 4.8?
Bukan berdasarkan bukti yang ada. Opus 4.8 berada di klaster teratas Indeks Artificial Analysis Intelligence yang diaudit dan terbukti dalam penalaran agenik mendalam di produksi. Qwen3.8-Max memiliki hasil yang dilaporkan sendiri dengan kuat (Terminal-Bench 2.1 86.6, OSWorld-Verified 86.1) dan satu pengujian agenik pihak ketiga yang mendukung, tetapi tanpa skor independen. Qwen menang pada harga; Opus menang pada bukti dan keandalan penalaran.
Mengapa nomor benchmark Opus 4.8 digambarkan dengan begitu samar?
Karena pelacak benar-benar bertentangan. Pada AA v4.1, Kimi K3 (57.1) dilaporkan tepat di atas Opus 4.8, menempatkan Opus di klaster teratas tetapi di bawah para pemimpin Fable 5 / GPT-5.6 Sol — namun sumber yang berbeda melaporkannya secara berbeda, sehingga mengutip satu angka pasti akan menyesatkan. Posisi relatifnya adalah pernyataan yang dapat diandalkan.
Berapa lebih murah Qwen 3.8 dibandingkan Claude Opus 4.8?
Secara signifikan, dan kesenjangan semakin melebar pada proses yang panjang. Qwen3.8-Max adalah $2 / $6 per 1M flat, dengan input yang di-cache sebesar $0,25. Artificial Analysis memperkirakan biaya gabungan Opus mendekati $3,85/1M pada upaya maksimal, dan Opus dilaporkan ~4× lebih boros token daripada Grok 4.5 — sehingga kesenjangan harga berlipat ganda seiring dengan volume keluaran. Pada proses multi-langkah yang umum, Qwen kira-kira 2–6× lebih murah tergantung pada caching.
Apakah Qwen 3.8 Max sudah keluar dari pratinjau?
Ya, pada 3 Agustus 2026. Layanan ini memiliki daftar tarif yang dipublikasikan dan endpoint yang kompatibel dengan OpenAI dan DashScope, sehingga kampanye kredit Qoder bulan Juli dan penawaran diskon 90% tidak lagi menggambarkan cara penjualannya.
Apakah Qwen 3.8 dapat diandalkan untuk pekerjaan agen?
Sinyal awal memang menjanjikan, tetapi masih tipis. Alibaba melaporkan Terminal-Bench 2.1 86.6 dan OSWorld-Verified 86.1, dan dalam satu pengujian pihak ketiga, ia mencatat nol panggilan alat yang gagal dibandingkan dengan dua dari pesaing. Di sisi lain, skor yang dilaporkan sendiri terlemahnya adalah IFBench 82.8 dalam mengikuti instruksi, dan para penguji pratinjau berulang kali melihatnya melampaui ruang lingkup — risiko nyata bagi pipeline yang mengurai keluaran setiap langkah.
Bisakah saya menghosting sendiri Qwen 3.8 untuk menghindari harga premium Opus?
{{1}}Bukan yang flagship, realistisnya.{{/1}} {{2}}Bobot dijanjikan dalam minggu ini{{/2}} {{3}}tetapi tidak ada lisensi yang diterbitkan,{{/3}} {{4}}dan pada ~1,2TB dalam 4-bit Anda akan membutuhkan delapan atau lebih GPU kelas H200.{{/4}} {{5}}Qwen3.8-27B yang diumumkan bersamaan, dilaporkan ~17GB VRAM, adalah opsi yang layak.{{/5}} {{6}}Opus 4.8 bersifat tertutup, jadi tidak ada jalur self-host sama sekali di sana.{{/6}}
Yang mana yang harus saya gunakan hari ini?
Opus 4.8 untuk pekerjaan produksi yang kritis terhadap penalaran atau bersifat agenik, yang harus dapat Anda percaya, di mana jawaban multi-langkah yang salah itu mahal. Qwen3.8-Max untuk pekerjaan yang sensitif terhadap biaya dan mengutamakan ketelitian — terutama analisis konteks panjang di mana tarif datar 1M dan input cache $0.25 membuat ekonominya sulit untuk diperdebatkan.
Intinya
Qwen 3.8 vs Claude Opus 4.8 masih merupakan perbedaan filosofi, tetapi ekonominya tidak lagi hipotetis. Qwen3.8-Max hadir di GA dengan harga riil yang jauh di bawah Opus, dan kesenjangan ini semakin melebar karena Opus memiliki harga premium dan boros token. Qwen juga memublikasikan angka agenik yang langsung menyentuh area andalan Opus, dan pengujian agenik pihak ketiganya menunjukkan penggunaan alat yang lebih bersih dibanding rival yang kuat.
Opus mempertahankan keunggulannya di bidang yang selalu menjadi andalannya: posisi teraudit di klaster teratas, dan rekam jejak produksi untuk penalaran multi-langkah yang andal yang tidak bisa digantikan oleh tabel vendor mana pun. Kesenjangan Qwen yang tersisa adalah yang sudah lazim — tidak ada skor independen, tidak ada jumlah parameter aktif yang diungkapkan, belum ada lisensi, dan kelemahan kepatuhan instruksi yang dilaporkan sendiri, yang justru krusial pada pipeline agen yang menjadi alasan Opus dipilih. Perhatikan dua peristiwa: skor Intelligence Index independen yang pertama, dan rilis bobot (weights) dengan lisensi. Sampai saat itu, Opus adalah model yang Anda percaya untuk keputusan bernilai mahal, dan Qwen 3.8 adalah yang Anda andalkan untuk volume — diuji pada alur kerja Anda sendiri.

Dibandingkan dalam artikel ini4
Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari
