Kartu judul yang dihasilkan bertuliskan 'Claude Haiku 5.5 vs Qwen3.8-Flash-Next' dengan subjudul 'Model dengan bobot terbuka bukanlah yang murah', sebuah batang berlabel 'Biaya per tugas Intelligence Index yang selesai' ditandai $0.21 untuk Claude Haiku 5.5 dan $0.37 untuk Qwen3.8-Flash-Next, serta baris catatan kaki yang berbunyi 'Angka independen menurut Artificial Analysis; harga menurut Anthropic dan Alibaba.' Logo OrcaRouter asli dikompositkan di kanan bawah.
Guides & Insights

Claude Haiku 5.5 vs Qwen3.8-Flash-Next: Model dengan Bobot Terbuka Bukanlah yang Murah

Penulis

Rowan Sterling

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Naluri kita mengatakan bahwa model open-weight dari tier flash Alibaba akan memotong harga model kecil Anthropic yang tertutup, dan pada dua angka yang tertera, memang begitu: Qwen3.8-Flash-Next ditawarkan pada $0,15 per juta token masukan dan $0,47 per juta token keluaran di API milik Alibaba sendiri, dibandingkan $0,10 dan $0,50 untuk Claude Haiku 5.5. Namun, jalankan keduanya terhadap rangkaian benchmark yang sama, dan urutannya berbalik. Artificial Analysis mengukur Claude Haiku 5.5 pada upaya Max sebesar $0,21 per tugas Intelligence Index yang diselesaikan; Qwen3.8-Flash-Next membutuhkan biaya $0,37 pada pengukuran yang sama, untuk skor tiga poin lebih rendah. Harga yang lebih murah dimiliki oleh model dengan tagihan yang lebih besar, dan alasannya sama dengan yang menentukan sebagian besar perbandingan ini: kartu tarif bukanlah harga, dan model open-weight mendapatkan nilainya di tempat lain selain tagihan API terkelola. "Tempat lain" itulah subjek sebenarnya dari pertarungan ini.

Apa itu masing-masing

Keduanya hadir dengan selisih enam minggu dan keduanya bukan jenis artefak yang sama.

• Claude Haiku 5.5 — model berbobot tertutup yang dirilis pada 7 Oktober 2026, di Claude API, Amazon Bedrock, Google Cloud, Microsoft Foundry dan Claude Platform di AWS. Konteks 1 juta token, hingga 128.000 token keluaran pada API Messages sinkron, pemikiran adaptif dengan pengatur upaya dari Rendah hingga Maks dan default sedang, batas pengetahuan Juni 2026, dan kartu tarif yang bertingkat pada 100.000 token.

• Qwen3.8-Flash-Next — model mixture-of-experts berbobot terbuka yang dirilis pada 26 Agustus 2026 di bawah lisensi qwen-community-1.0, yang digambarkan oleh Alibaba sebagai pratinjau eksperimental dari arsitektur yang akan mendasari Qwen4. Model ini menyimpan 125B parameter model utama plus tabel embedding n-gram 51B terpisah — sekitar 176B sebelum modul prediksi multi-token 4B — dan mengaktifkan 6B per token, dengan 512 pakar, perutean top-10, dan 48 lapisan. Secara native, model ini memiliki konteks 262.144 token, dapat diperluas hingga 1M dengan YaRN, serta menerima input teks, gambar, dan video.

• Qwen3.8-Flash — mitra komersial yang disajikan, juga sudah aktif sejak 26 Agustus 2026 di QwenCloud milik Alibaba dengan harga $0,16 per juta token input dan $0,47 per juta token output dengan konteks default 1 juta token. Layak dipisahkan dari Flash-Next: yang satu adalah checkpoint yang dapat Anda unduh dan periksa, yang lain adalah endpoint terkelola berbayar.

Perbedaan antara dua yang terakhir adalah alasan utama mengapa perbandingan ini menarik. Claude Haiku 5.5 dan Qwen3.8-Flash-Next nyaris tidak bersaing, karena hanya satu di antaranya yang dapat dijalankan di perangkat keras Anda sendiri.

Paruh yang terukur, yang mengarah ke arah sebaliknya

Semua angka independen berikut berasal dari Artificial Analysis pada Intelligence Index v4.3.2. Daftar tarif Anthropic dan Alibaba adalah harga yang diterbitkan sendiri oleh vendor.

• Intelligence Index — Claude Haiku 5.5 pada Max effort 43, kedua dari 182 model. Qwen3.8-Flash-Next 40, keenam dari 117 di kelasnya. Terpaut tiga poin, menguntungkan Anthropic.

• Biaya per tugas — $0,21 dibanding $0,37. Model yang lebih mahal per token justru 43% lebih murah per tugas yang diselesaikan.

• Token output pada run Index — 440 juta untuk Claude Haiku 5.5 dan 240 juta untuk Qwen3.8-Flash-Next, keduanya dibandingkan median 100 juta. Model Qwen adalah penulis yang lebih efisien namun tetap menjadi tugas yang lebih mahal, yang menunjukkan bahwa kesenjangannya bukan hanya volume token, melainkan campuran input dan valuasi yang diterapkan evaluator.

• Kecepatan keluaran — 241,9 token per detik dibandingkan 56,0. Claude Haiku 5.5 lebih dari empat kali lebih cepat pada pengukuran yang sama, dan waktu 295 detik ke token pertama pada proses tersebut adalah artefak dari berpikir pada upaya Max, bukan angka jaringan; waktu ke token pertama Qwen3.8-Flash-Next adalah 2,53 detik.

• Bentuk kartu tarif — Claude Haiku 5.5 naik dari $0.10 dan $0.50 menjadi $0.50 dan $2.50 pada 100.000 token. Qwen3.8-Flash tetap datar di $0.16 dan $0.47 terlepas dari panjangnya, yang merupakan keunggulan nyata pada prompt panjang dan satu-satunya tempat argumen harga tertera bertahan saat bersentuhan dengan dokumen panjang.

• Tokenizer — Claude Haiku 5.5 menggunakan tokenizer yang lebih baru yang juga dipakai oleh Claude 4.7 dan versi setelahnya, sehingga teks yang sama dihitung sekitar 30% lebih banyak token daripada pada Haiku sebelumnya. Hal itu membuat prompt membengkak menuju ambang 100.000 token; ini adalah dokumentasi Anthropic sendiri, dan justru merugikan model pada kasus prompt panjang, tempat tarif tetap Qwen tampak paling unggul.

Jadi bentuk trade-off-nya adalah: bayar lebih banyak per token, dapatkan jawaban yang lebih cepat dan sedikit lebih pintar yang biayanya lebih rendah per tugas yang diselesaikan, dengan jurang tarif yang perlu diwaspadai pada input panjang. Atau bayar lebih sedikit per token dan dapatkan model yang lebih lambat yang biayanya lebih tinggi per tugas yang diselesaikan, dengan tarif tetap dan jendela native 262,144 token.

A screenshot of OrcaRouter's model page for qwen/qwen3.8-flash, showing the model card and its list pricing of $0.15 per million input tokens and $0.47 per million output tokens, captured in English.A screenshot of the Artificial Analysis model page for Claude Haiku 5.5 at maximum effort, showing an Intelligence Index of 43 on v4.3.2 at rank 2 of 182 models, a 1,000,000-token context window, 241.9 output tokens per second at rank 8 of 182, a cost of $0.21 per Intelligence Index task, and 440 million output tokens against a 100 million median.

Di mana bobot terbuka benar-benar mengubah perhitungan

Semua yang di atas membandingkan dua API terkelola, dan itulah perbandingan yang tidak dirancang untuk dimenangkan oleh Qwen3.8-Flash-Next. Argumennya adalah bahwa ia tidak harus disewa.

• Dukungan penyajian day-zero. SGLang telah merilis halaman cookbook dan image khusus; vLLM sudah memiliki build untuknya sementara pull request dukungan arsitekturnya masih terbuka. NVIDIA memvalidasi keduanya plus TensorRT LLM pada rak GB300 NVL72, dan NeMo mencakup fine-tuning.

• Persyaratan perangkat keras minimum untuk checkpoint 176B sangat rendah. Tabel embedding n-gram 51B dapat berada di memori host alih-alih VRAM, karena alamat pencariannya diketahui sebelumnya dan dapat di-prefetch. Itulah yang memungkinkan model berjalan pada klaster DGX Spark dan workstation 4×RTX PRO 6000, dan kuantisasi komunitas pada hari yang sama — build 1-bit yang muat dalam RAM 75GB dengan akurasi sekitar 80% dari akurasi penuh — menempatkannya pada perangkat keras yang dimiliki tim kecil.

• Fine-tuning tersedia. Bukan dalam arti API tuning yang dihosting: bobotnya milik Anda, di bawah lisensi komunitas dengan syarat-syarat yang sudah biasa, dan arsitekturnya didokumentasikan dalam laporan teknis yang mempublikasikan ablasi dan hasil negatifnya.

• Jendelanya lebih kecil daripada yang terlihat. 262.144 token secara native, dapat diperluas hingga 1 juta dengan YaRN — versus 1 juta native pada Claude Haiku 5.5, tanpa catatan tambahan soal rope-scaling. Pada beban kerja dokumen panjang, tempat tarif flat Qwen terlihat paling menarik, model yang benar-benar mampu menampung dokumen itu justru yang satunya lagi.

• Benchmark tersebut dilaporkan oleh vendor. Tabel milik Alibaba sendiri menempatkan Flash-Next di depan DeepSeek-V4-Flash-0731 pada DeepSWE 1.1 (58,7 versus 54,4), SWE-bench Pro (62,5 versus 56,0) dan GPQA Diamond (91,7 versus 90,8), serta di belakangnya pada NL2Repo-Bench (48,1 versus 54,2) — pembuatan kode tingkat repositori, satu-satunya dimensi agentik di mana model yang lebih kecil tidak mampu mengimbangi. Tidak satu pun dari itu telah direproduksi oleh pihak ketiga, dan model tersebut berusia enam minggu.

Itu adalah batas jujur antara keduanya. Claude Haiku 5.5 adalah layanan bermeter dengan plafon kualitas tetap dan tanpa permukaan operasional. Qwen3.8-Flash-Next adalah artefak yang kurva biayanya melengkung turun mendekati harga listrik dan yang plafon kualitasnya adalah seberapa pun yang dapat Anda layani, ditambah risiko tabel benchmark yang tidak direproduksi dan arsitektur yang masih sedang diserap oleh runtime.

Cara realistis untuk memutuskan

Tiga pertanyaan menyelesaikannya, dan hanya yang pertama yang berkaitan dengan tolok ukur.

Apakah Anda memiliki, atau ingin, GPU? Jika tidak, kasus self-host bersifat teoretis dan perbandingan terkelola di atas adalah keseluruhan ceritanya — dan pemenangnya adalah Claude Haiku 5.5 dalam hal biaya per tugas, kecepatan, dan skor, dengan catatan bahwa langkah 100.000 token-nya menghukum prompt yang panjang. Jika Anda memang memiliki akselerator yang berada di bawah target utilisasi, Qwen3.8-Flash-Next adalah salah satu dari sedikit model terbuka di mana dekode parameter aktif 6B benar-benar murah dijalankan dalam volume besar, dan angka $0.37 per tugas tidak lagi menjadi angka yang relevan.

Berapa panjang rata-rata prompt? Inilah satu-satunya tempat argumen harga tertera berlaku. Di bawah 100.000 token — setelah tokenizer yang menggelembungkan sekitar 30% — Claude Haiku 5.5 lebih murah pada setiap meteran. Di atasnya, tarif tetap $0,16 dan $0,47 adalah pilihan yang lebih baik, dan keunggulannya melebar seiring bertambahnya panjang hingga jendela native 262.144 token, yang setelahnya ekstensi YaRN menjadi masalah rekayasa yang berbeda.

Berapa besar toleransi beban kerja terhadap variasi latensi? 241,9 token keluaran per detik dibandingkan 56,0 adalah selisih yang besar, dan penerapan yang dihosting sendiri menambahkan antrean ke dalamnya. Agen dukungan langsung atau pengendali browser — beban kerja yang disebut Anthropic untuk tingkat ini — akan merasakan perbedaannya.

Bagi siapa pun yang ingin menjawab pertanyaan kedua dan ketiga alih-alih menalar tentangnya, instrumen termurah adalah endpoint bersama. Qwen3.8-Flash-Next belum ada di katalog OrcaRouter, dan Claude Haiku 5.5 juga belum; saudara Qwen yang kami rutekan adalah Qwen3.8-Flash, pada harga daftar penyedia dengan markup 0% yang diteruskan, yang merupakan padanan terdekat yang dilayani untuk model dalam perbandingan ini dan baseline yang tepat untuk uji biaya prompt panjang. Di sisi Anthropic, Claude Haiku 4.5, Claude Sonnet 5.5, dan Claude Opus 5.5 semuanya dapat dipanggil dari kunci yang sama hari ini, sehingga eksperimen harga dua generasi hanyalah konfigurasi, bukan kontrak kedua — dan karena penetapan harganya bersifat pass-through, bukan campuran, potongan vendor pada salah satu sisi akan muncul di sisi kami pada hari yang sama saat diumumkan. Failover otomatis adalah yang membuat eksperimen aman untuk dijalankan pada lalu lintas nyata: model pratinjau atau tabel benchmark yang tidak direproduksi adalah kasus yang tepat untuk mengarahkan rute ke sesuatu yang baru sementara model tepercaya berada di belakangnya.

Apa yang bisa mengubah jawabannya

Dua hal, keduanya bisa diperiksa. Yang pertama adalah evaluasi independen atas Qwen3.8-Flash-Next pada harness yang juga menjalankan Claude Haiku 5.5 — tabel vendor itu dibandingkan dengan DeepSeek, dan angka 40 dari papan independen hanyalah satu penempatan tunggal. Skor coding tingkat repositori adalah baris yang perlu dicermati, karena NL2Repo adalah area tempat model ini sudah terbukti tertinggal. Yang kedua adalah apakah pekerjaan runtime-nya terwujud: dukungan vLLM masih di-merge melalui pull request yang masih terbuka, dan sampai itu selesai, self-hosting arsitektur ini adalah latihan bagi tim yang menyukai hal semacam itu, bukan jalur yang didukung.

Hingga saat itu, ringkasannya singkat. Qwen3.8-Flash-Next adalah model yang lebih menarik untuk dimiliki dan lebih mahal untuk disewa. Claude Haiku 5.5 adalah endpoint terkelola yang lebih murah, lebih cepat, dan berskor lebih tinggi, dengan daftar tarif yang menghukum apa pun yang panjang. Pilih berdasarkan apakah Anda membeli token atau membeli checkpoint — dan jika Anda membeli token, perhatikan bahwa model open-weight bukanlah diskon yang Anda asumsikan.

A generated two-column scoreboard titled 'Claude Haiku 5.5 vs Qwen3.8-Flash-Next — the scoreboard'. Left column Claude Haiku 5.5: weights, closed and API-only; input price $0.10 per million up to 100,000 tokens; output price $0.50 per million up to 100,000 tokens; native context 1,000,000 tokens; independent score 43 on Intelligence Index v4.3.2 at Max effort, rank 2 of 182; cost per task $0.21; measured output speed 241.9 tokens per second. Right column Qwen3.8-Flash-Next: weights, open under the qwen-community-1.0 license; served price $0.16 per million input and $0.47 per million output, flat; native context 262,144 tokens, extensible to 1M with YaRN; independent score 40, rank 6 of 117; cost per task $0.37; measured output speed 56.0 tokens per second. A footer line reads 'Vendor pricing per Anthropic and Alibaba; independent figures per Artificial Analysis.' The real OrcaRouter logo is composited bottom-right.