
Claude Sonnet 5.5 vs Qwen3.8 Max: Enam Minggu, Dua Tingkat, Satu Putusan soal Biaya
- typesafeBARUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 984 tok/s
- openaiBARUOpenAI: GPT-6 Luna2026-09-2237Kecerdasan
- openaiBARUOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- anthropicBARUAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- grokBARUGrok 4.72026-09-2146Kecerdasan
- OrcaBARUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 juta token · 195 tok/s
- orcaBARUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 juta token
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
Lakukan perhitungan pada tiga prompt dan perbandingannya sebagian besar sudah terpecahkan sebelum Anda mencapai tolok ukur. Panggilan balasan dukungan singkat: 2.000 token masukan, 500 keluaran. Pada Qwen3.8 Max dengan $2 per juta untuk masukan dan $6 per juta untuk keluaran, itu empat persepuluh sen; pada Claude Sonnet 5.5 dengan $2 dan $10, itu sembilan persepuluh sen. Refaktor repositori: 400.000 masukan, 30.000 keluaran — empat puluh tiga sen dibandingkan delapan puluh tiga. Sesi agentik panjang yang benar-benar menghabiskan anggarannya: dua juta token masuk, 200.000 keluar, jadi $5,20 dibandingkan $6,30 begitu angkanya cukup besar sehingga sisi masukan mendominasi.
Kesenjangan yang awalnya berupa perbedaan 2,25× pada harga output menyempit menjadi sekitar 1,2× pada skala agentik, dan penskalaan itu bukan sekadar keingintahuan. Qwen3.8 Max dan Claude Sonnet 5.5 keduanya adalah model 1M token dengan batas output yang tinggi, keduanya dihargai $2 per juta untuk input, dan keduanya dirilis dalam rentang delapan minggu satu sama lain — milik vendor tersebut pada 3 Agustus 2026 dengan penyegaran bertanggal pada 2 September, milik Anthropic pada 28 September. Perbedaan di antara keduanya bukan pada kartu tarif. Perbedaannya adalah apa yang masing-masing keluarkan agar bisa selesai.
Apa yang dirilis, dan kapan
Qwen3.8 Max adalah tier berkemampuan tertinggi dari Alibaba hingga saat ini. Alibaba memposisikannya secara langsung bersaing dengan GPT-5.5, Claude Opus 4.7, dan Gemini 3.1 Pro dalam panduan migrasinya sendiri, serta merekomendasikannya setiap kali suatu tugas membutuhkan penalaran terkuat yang tersedia. Model ini membawa jendela konteks 1M token, menerima input teks, gambar, dan video, serta menghasilkan teks — input video adalah satu-satunya kemampuan di sini yang tidak dimiliki Claude Sonnet 5.5. Harganya adalah $2 per juta token input dan $6 per juta token output, dengan pembacaan cache sebesar $0,25 dan penulisan cache sebesar $2,50. Entri 3 Agustus dalam katalog kami didampingi oleh penyegaran 2 September yang terdaftar sebagai Qwen3.8 Max (0902), yang membawa tarif utama yang sama dan batas output 131K.

Claude Sonnet 5.5 adalah model kedua dalam generasi 5.5 Anthropic, dirilis pada 28 September 2026, enam hari setelah Claude Opus 5.5. Tersedia sebagai claude-sonnet-5-5 di Claude API dan di Amazon Bedrock, Google Cloud, dan Microsoft Foundry, dengan jendela 1M token, batas output sinkron 128K yang dapat diperluas hingga 300K pada Message Batches API di balik output-300k-2026-03-24 header, dan tarif Claude Sonnet 5 dipertahankan persis: $2 masuk, $10 keluar, $0,20 pembacaan cache, $2,50 penulisan cache. Retensi data nol sejak peluncuran, penghentian tidak lebih awal dari 28 September 2027.
Jadi tarif input-nya identik, jendela konteksnya berukuran sama, dan kedua vendor itu melakukan penyegaran dalam rentang satu bulan satu sama lain. Segala hal yang membedakan keduanya ada di sisi output tagihan atau di benchmark.
Tolok ukur: pesan pengguna
Ada dua jenis bukti di sini dan keduanya tidak dapat dipertukarkan.
Tabel peluncuran Anthropic dilaporkan oleh vendor, tidak direproduksi oleh pihak ketiga mana pun, dan mencakup delapan evaluasi. Baris-baris yang penting
• Terminal-Bench 4.0 — Claude Sonnet 5.5 70,6% dibandingkan dengan 10,3% milik Claude Sonnet 5
• CursorBench 4.0 — 55,5% dibandingkan dengan 34,1% milik Claude Sonnet 5
• GDPval-AA v2.1 — 1844 dibandingkan dengan 1449 untuk Claude Sonnet 5, 1846 untuk Claude Opus 5.5 dan 1487 untuk GPT-6 Sol
• Humanity's Last Exam, dengan alat — 64,5% berbanding 54,9%; Claude Opus 5.5 berada di 67,7%
• OSWorld 2.1, sebagian — 80,1% dibandingkan dengan 57,0%
• Chartography, tanpa alat — 61,6% dibandingkan 15,6%
Alibaba tidak menerbitkan tabel empat kolom yang setara secara langsung, jadi satu-satunya angka yang dapat ditempatkan pada sumbu yang sama adalah angka-angka yang independen. Artificial Analysis, revisi v4.3.2
• Indeks Kecerdasan Komposit — Claude Sonnet 5.5 56 di peringkat 3 dari 216; Qwen3.8 Max 45 di peringkat 27
• Biaya per tugas Intelligence Index — $7.60 dibandingkan $5.41
• Kecepatan keluaran — model Anthropic dijalankan terhadap baseline Claude Sonnet 5 yang diukur pada 78,7 token per detik; Qwen3.8 Max terukur pada 39,1
• Verbositas — 410M token keluaran di Index dibandingkan 190M
Skor per evaluasi Qwen3.8 Max sendiri terbilang terhormat, bukan marginal: 92,8% pada GPQA Diamond, 88,8% pada Terminal-Bench 2.1, 80,3% pada recall konteks panjang, 47,8% pada tau-banking. Ia kehilangan posisi pada komposit karena tidak memenangkan apa pun secara meyakinkan dan tier Anthropic yang lebih baru memenangkan beberapa hal secara mutlak. Perhatikan juga bahwa halaman independen untuk Qwen3.8 Max mencantumkan tanggal rilis 2 September 2026 dan pembacaan konteks 984K — halaman itu menjelaskan penyegaran (0902), bukan build Agustus, dan mencampuradukkan angka antara keduanya akan menjadi kesalahan.

Apa yang hilang dari kedua kolom itu sama pentingnya dengan apa yang ada di dalamnya. Tidak ada yang secara independen mereproduksi angka OSWorld atau Terminal-Bench milik Anthropic. Tidak ada yang mempublikasikan angka Chartography atau CursorBench untuk Qwen3.8 Max. Komposit adalah satu-satunya angka yang diukur dengan cara yang sama pada kedua model, dan itulah tepatnya mengapa angka biaya per tugas di bawahnya memainkan peran yang begitu besar.
Angka yang menentukan, dan angka itu tidak ada di kedua kartu tarif.
Artificial Analysis mengenakan biaya yang sama untuk kedua model: menjalankan sepuluh evaluasi di Index, menghitung token, lalu mengalikannya dengan harga daftar. Claude Sonnet 5.5 menghasilkan $7,60 per tugas dan Qwen3.8 Max $5,41, premi 40% untuk model Anthropic meskipun skor kompositnya lebih tinggi. Pembacaan verbositas menjelaskan arahnya — 410M token versus 190M — dan pembacaan kecepatan menjelaskan sisanya: model yang menghasilkan lebih sedikit token dan memerlukan waktu lebih lama per token bukanlah model yang membayar output dengan tarif dua kali lipat.
Klaim efisiensi Anthropic sendiri sejalan dengan cerita yang sama, bukan bertentangan dengannya. Perusahaan mengatakan Claude Sonnet 5.5 menghasilkan output 30%+ lebih cepat daripada Claude Sonnet 5 dan berbiaya "hingga 30% lebih murah per tugas" pada harga yang sama — klaim tentang token per tugas, bukan tentang tarif. Apakah itu tetap berlaku terhadap model yang menghabiskan kurang dari setengah jumlah token justru merupakan pertanyaan yang diajukan oleh angka $7.60, dan satu kali uji independen hanyalah satu titik data.
Konsekuensi praktisnya: tarif output $6 versus $10 adalah angka yang akan dilihat bagian pengadaan, dan itu adalah angka yang paling tidak prediktif dalam artikel ini. Angka yang prediktif adalah token per tugas pada prompt Anda sendiri, dan tidak ada vendor yang akan memberikannya kepada Anda.
Input, video, dan jebakan migrasi
Perbedaan kemampuan yang langsung terlihat adalah modalitas. Qwen3.8 Max menerima video bersama teks dan gambar; Claude Sonnet 5.5 menerima teks dan gambar. Untuk analisis rekaman layar, pipeline rekaman rapat, atau apa pun yang memperlakukan video sebagai input kelas utama, itu bukanlah kesenjangan benchmark — melainkan pertanyaan kelayakan biner, dan hanya satu dari model-model ini yang lolos.

Perbedaan yang muncul seminggu kemudian bersifat perilaku. Claude Sonnet 5.5 membuat lima perubahan yang memutus kompatibilitas pada kode yang berjalan di Claude Sonnet 5. Sebuah non-default temperature, top_p atau top_k kini mengembalikan 400. Mengirim thinking: {"type": "disabled"} mengembalikan 400 yang menunjuk ke between_tools, pengaturan thinking terendah yang baru, diterima pada effort low, medium, dan high serta ditolak pada xhigh atau max. Penggunaan tool yang dipaksa — tool_choice berupa "any" atau tool bernama — mengembalikan 400 secara langsung. Versi lama dari computer_20251124 tool computer-use ditolak di Claude API dan Google Cloud. Dan blok thinking terikat pada model dan akun yang menghasilkannya, sehingga penalaran dapat diteruskan dari Claude Sonnet 5 tetapi tidak keluar ke keluarga lain, dan prefiks percakapan yang diedit dapat mengubah replay menjadi error.
Qwen3.8 Max tidak menuntut semua itu. Ini adalah model berformat OpenAI dengan antarmuka permintaan yang konvensional, dan beralih ke model ini dari tier Qwen lain hanyalah perubahan string model.
Timbanglah kedua biaya itu secara jujur. Memilih model Qwen membuat Anda kehilangan selisih komposit sebelas poin dan angka-angka vendor Anthropic yang toh tidak dapat Anda verifikasi secara independen. Memilih model Anthropic membuat Anda kehilangan input video dan daftar periksa berisi empat perubahan API yang masing-masing akan gagal secara mencolok dengan kode 400 saat pertama kali dipanggil — yang merupakan jenis kegagalan yang baik, tetapi tetap saja pekerjaan sehari.
Di mana OrcaRouter cocok
Alasan untuk merutekan alih-alih memilih adalah bahwa angka penentu — biaya per tugas pada lalu lintas Anda — tidak dapat dihitung dari dokumentasi vendor mana pun.
OrcaRouter adalah endpoint tunggal yang kompatibel dengan OpenAI untuk lebih dari 200 model dengan harga daftar dari penyedia yang diteruskan tanpa markup, sehingga pemotongan tarif atau perubahan tingkat di kedua sisi langsung berlaku pada hari yang sama saat diumumkan. Kedua build Qwen3.8 Max ada dalam katalog dengan harga $2 / $6 milik Alibaba sendiri — entri Agustus dan penyegaran (0902) — bersama dengan Claude Sonnet 5, model yang masih digunakan oleh sebagian besar lalu lintas API Claude, dapat dirutekan sejak 30 Juni dengan harga $2 / $10 dari Anthropic dengan kecepatan terukur 150 token output per detik. Claude Sonnet 5.5 sendiri belum ada di katalog kami; meskipun demikian, rute jujur untuk mengaksesnya adalah API milik vendor itu sendiri dan tiga cloud yang terdaftar di Anthropic, dan cara untuk mencobanya tanpa memindahkan beban kerja adalah sebagian lalu lintas di belakang failover otomatis ke Claude Sonnet 5 atau Qwen3.8 Max.
Yang mana, untuk pekerjaan yang mana?
Qwen3.8 Max unggul pada input video, pada laju keluaran, pada biaya terukur per tugas indeks, dan pada upaya integrasi. Ini adalah default yang tepat untuk pekerjaan bervolume tinggi dengan spesifikasi yang jelas, di mana kesenjangan komposit dua belas poin tidak muncul dalam kualitas keluaran.
Claude Sonnet 5 menang pada evaluasi independen, pada evaluasi pengodean agentic di mana data vendor Anthropic menunjukkan lonjakan 60 poin dibanding pendahulunya sendiri di Terminal-Bench 4.0, pada batas output batch 300K, dan pada keputusan yang berbentuk pekerjaan yang tidak dapat dibuat oleh kartu tarif: model ini adalah pilihan ketika tugasnya cukup sulit sehingga benar lebih penting daripada murah.
Yang akan mengubah jawaban untuk model mana pun adalah hal yang sama, dan itu bukan rilis tolok ukur baru. Itu adalah hitungan token per tugas pada prompt Anda sendiri, dengan pengaturan effort Anda sendiri, untuk kedua model. Parameter effort Anthropic dan plafon output Qwen sama-sama menjadi tuas pada angka itu, dan keduanya diatur oleh Anda, bukan oleh daftar harga vendor.
Satu hal yang dipastikan oleh perbandingan ini: dengan $2 per juta untuk input, sisi input dari tagihan tidak lagi menjadi pembeda antara model andalan Tiongkok dan kelas menengah Anthropic. Perlombaan itu sudah beralih ke sisi output dan ke jumlah token sejak berbulan-bulan lalu.
Dibandingkan dalam artikel ini3
Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari
