
Claude Haiku 5.5 vs Qwen3.8 27B: Sapu Bersih di API, dan Mengapa Bobot Terbuka Masih Ada
- openaiBARUOpenAI: GPT-6.1 Sol2026-09-2952Kecerdasan
- anthropicBARUAnthropic: Claude Sonnet 5.52026-09-2856Kecerdasan
- typesafeBARUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 127 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Kecerdasan
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- xAIGrok 4.72026-09-2146Kecerdasan
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 juta token · 58 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 juta token · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 350 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
Sebagian besar perbandingan dalam seri ini bermuara pada suatu trade-off. Yang ini tidak, dan tidak adanya trade-off itu sendiri merupakan temuan. Claude Haiku 5.5, yang dirilis pada 7 Oktober 2026, mengalahkan Qwen3.8 27B, model dense 27B dengan bobot terbuka dari 14 Agustus 2026, pada skor kecerdasan komposit, pada biaya per token, pada biaya per tugas yang diselesaikan, pada jendela konteks, pada batas maksimum respons, pada pengodean agentik, dan pada baris penalaran sains — dan ia melakukannya dari satu API proprietary yang tidak memerlukan perangkat keras. Satu-satunya baris yang dimenangkan Qwen3.8 27B secara mutlak adalah input video, dan yang lainnya adalah lisensi.
Itu bukan alasan untuk mengesampingkan model tersebut, karena lisensi Apache-2.0 dan modalitas video bukanlah hadiah hiburan. Itu adalah alasan untuk bersikap tepat tentang mengapa siapa pun akan memilih kubu open-weights, dan untuk berhenti berpura-pura bahwa argumennya tentang tolok ukur.
Angka-angka yang sebenarnya digunakan untuk menjalankan kedua model
Per juta token dalam dolar AS. Tarif vendor berasal dari dokumentasi penetapan harganya sendiri; pengukuran yang digunakan bersama adalah Artificial Analysis Intelligence Index v4.3.2, dibaca 2026-10-08, keduanya dalam konfigurasi upaya tertinggi yang dipublikasikan.

• Masukan — Claude Haiku 5.5 $0,10 hingga 100.000 token dan $0,50 di atasnya; Qwen3.8 27B $0,50 pada tarif pihak ketiga yang tercatat oleh dewan.
• Output — Claude Haiku 5.5 $0.50 hingga 100.000 token dan $2.50 di atasnya; Qwen3.8 27B $3.00.
• Input cache — Claude Haiku 5.5 $0.01 dan $0.05, diskon 90%; Qwen3.8 27B $0.10, diskon 80%.
• Skor independen — 43,40 untuk Claude Haiku 5.5 (Max) dibandingkan dengan 33,70 untuk Qwen3.8 27B (Xhigh). Selisih 9,70 poin, yang paling lebar di batch ini.
• Biaya per tugas yang diselesaikan — $0,21 dibandingkan $1,01, pada proses evaluasi yang sama. Selisih 4,7x, juga yang paling besar di sini.
• Konteks dan output — 1 juta token dan batas respons 128.000 token untuk Claude Haiku 5.5; konteks 256K token untuk Qwen3.8 27B.
• Modalitas — keduanya menerima dan gambar dan mengembalikan. Qwen3.8 27B menambahkan input video; Claude Ha 5.5 tidak.
• Bobot — Qwen3.8 27B adalah 27B parameter padat di bawah Apache 2.0, dapat diunduh. Claude Haiku 5.5 bersifat proprietari dan hanya API.

Mengapa kesenjangan per tugas adalah empat kali kesenjangan per token
Kartu tarif sudah menunjukkan selisih input 5x dan selisih output 6x yang menguntungkan vendor, jadi arahnya tidak dipertanyakan. Yang perlu dicermati adalah bahwa angka per tugas lebih kecil daripada angka per token, yang merupakan kebalikan dari apa yang terjadi pada pertandingan lain batch ini, dan alasannya instruktif.
Claude Haiku 5.5 mengeluarkan 162.164 token keluaran per tugas Intelligence Index — 129.047 penalaran dan 33.118 jawaban. Qwen3.8 27B mengeluarkan 66.797, terbagi menjadi 47.711 penalaran dan 19.087 jawaban. Model vendor ini menghabiskan 2,4 kali lebih banyak token per tugas, sehingga keunggulan laju keluaran 6x-nya terkompresi menjadi keunggulan 4,7x per tugas. Angka itu masih sangat besar. Hanya saja, itu bukan angka yang diiklankan dalam kartu tarif.
Perhitungan campuran adalah cara yang lebih jelas untuk melihat bentuknya. Pada campuran 7:2:1 yang berat input — bobot yang sebenarnya dimiliki sebagian besar lalu lintas produksi — Claude Haiku 5.5 menjadi $0,077 per juta token dibandingkan $0,470 untuk Qwen3.8 27B. Pada campuran seimbang 1:1, angkanya $0,30 dibandingkan $1,75. Jurang 100.000 token milik vendor adalah satu-satunya hal yang dapat menutup selisih ini: setelah melewatinya, tarif Claude Haiku 5.5 menjadi $0,50 dan $2,50 untuk keseluruhan permintaan, dan kedua model bertemu pada harga yang kira-kira sama — pada titik itu Anda membayar premi skor 9,7 poin tanpa manfaat apa pun.
Di mana kartu vendor dan dewan independen tidak sepakat
Inilah kumpulan baris yang layak diperlambat, karena kartu model Qwen3.8 27B sendiri terbaca jauh lebih kuat daripada yang ditunjukkan oleh pengukuran independen, dan perbedaan itulah alasan utama klaim "model 27B yang menyaingi model yang jauh lebih besar" membutuhkan sumber kedua.
Angka-angka yang diterbitkan sendiri oleh vendor, sebagaimana tercatat di halaman katalog kami untuk model tersebut, mencakup 90,3 pada LiveCodeBench v6, 89,2 pada GPQA Diamond, 84,3 pada OSWorld-Verified, dan 79,0 pada QwenSWEBench. Angka-angka itu dilaporkan oleh vendor dan belum direproduksi, dan angka-angka tersebut menggambarkan sebuah model yang kompetitif jauh di atas kelas bobotnya.
Dalam uji independen Artificial Analysis, Qwen3.8 27B mencetak skor 0,0556 pada Terminal-Bench 4.0, 0,4664 pada SciCode, 0,3392 pada Humanity's Last Exam dan 1423,21 pada GDPval-AA v2.1. Letakkan 0,0556 itu di samping 84,3 yang dilaporkan kartu vendor pada OSWorld, dan bentuk ketidaksesuaiannya menjadi jelas: dalam pekerjaan agentik komputer-dan-terminal, papan independen menempatkan model ini kira-kira di posisi yang pantas bagi model dense 27B, sedangkan kartu vendor tidak.
Dua baris justru mengarah ke arah sebaliknya, dan keduanya layak disebutkan karena alasan yang sama. Qwen3.8 27B mencetak0,4824 pada AutomationBench versus 0,3541 milik Claude Haiku 5.5 — kemenangan independen 12,8 poin pada hal yang paling mendekati tolok ukur otomasi bisnis yang dimiliki kedua papan itu. Itu angka nyata dari proses yang sama, pada baris yang paling dekat dengan tujuan orang sebenarnya men-deploy model kecil.
Pembacaan yang jujur bukanlah "vendor melebih-lebihkan segalanya". Melainkan bahwa kartu model mengukur tugas-tugas yang dipilih para penulisnya, papan independen mengukur serangkaian tugas yang tetap, dan keunggulan Qwen3.8 27B ada dalam daftar vendor dan tidak ada dalam daftar papan.
Hitungan ekonominya berubah ketika Anda memiliki perangkat kerasnya
Setiap tarif yang dikutip di atas adalah harga API, dan untuk Qwen3.8 27B itu adalah kerangka yang salah.
Ini adalah model dense 27B di bawah Apache 2.0. Model ini muat pada satu akselerator modern dengan kuantisasi yang dapat diterima sebagian besar tim, yang berarti biaya marginal sebuah token tidak lagi menjadi meteran vendor dan menjadi utilisasi Anda sendiri. Itulah sebabnya harga untuk memanggilnya berbeda antar-host dengan cara yang tidak mungkin dilakukan oleh model proprietary mana pun dalam perbandingan ini: papan mencatat tarif pihak ketiga $0.50 masuk dan $3.00 keluar, dan katalog OrcaRouter memuatnya pada $0.33 masuk dan $2.40 keluar tanpa baris cache-read sama sekali, karena kami menjalankan bobotnya di infrastruktur kami sendiri alih-alih menjual ulang endpoint milik orang lain.
Bagi tim yang sudah membayar GPU, perbandingannya bukan $0,21 versus $1,01 per tugas. Melainkan tarif yang ditagih vendor versus biaya inkremental satu permintaan pada perangkat keras yang Anda miliki, dan itu angka yang berbeda. Itulah argumen untuk kubu open-weights, dan itu satu-satunya argumen yang bertahan saat berhadapan dengan tabel benchmark.
Ada konsekuensi kedua yang kurang jelas dari lisensi yang merupakan Apache 2.0: model dapat dikirimkan di dalam sebuah produk, disetel halus pada lalu lintas Anda sendiri, dipatok ke revisi tertentu, dan diaudit hingga ke bobotnya. Tidak satu pun dari itu tersedia berapa pun harganya dari model proprietary yang hanya berbasis API, dan untuk beban kerja yang diatur, hal itu sering menjadi kendala penentu alih-alih preferensi.

Memanggil salah satu dari mereka
Qwen3.8 27B is on the OrcaRouter catalogue as qwen/qwen3.8-27b at $0.33 and $2.40 per million tokens, self-hosted on our own infrastructure, with the OpenAI-compatible endpoint at https://api.orcarouter.ai/v1. Run against our own traffic over the last week it returns a median 1,837 ms to first token at 319 output tokens per second — a fast model, measured on our playground rather than a standardised harness, so treat that as a serving figure and not a benchmark. Video, image and text input, 262K-token context, native tool calling, structured outputs and a reasoning mode are all supported on the same key as everything else on the catalogue.
Claude Haiku 5.5 tidak tercantum di katalog. Ia dapat diakses langsung melalui API vendor dan melalui AWS, Azure, serta platform cloud utama, dan itulah pernyataan yang akurat. Yang memang tercantum di katalog dari jajaran produk vendor adalah Claude Sonnet 5.5 dan Claude Opus 5.5, yang membuat jalur eskalasi dari model kecil yang dihosting sendiri ke model agentik tingkat menengah yang dihosting menjadi perubahan routing, bukan integrasi kedua — failover otomatis tetap mendasarinya dalam kedua skenario.
Putusan tersebut, yang tidak biasanya berat sebelah
Sebagai panggilan API pada teks atau gambar, Claude Haiku 5.5 memenangkan perbandingan ini pada setiap baris yang bukan tentang lisensi. Sembilan koma tujuh poin indeks, 4,7x lebih murah per tugas yang diselesaikan, empat kali jendela konteks, dua kali plafon respons, dan harga lima hingga enam kali lebih rendah di dalam rezim prompt pendek. Tidak ada argumen bentuk beban kerja yang menyelamatkan Qwen3.8 27B soal harga, karena kerugian vendor — penggunaan token keluaran yang berat — nilainya jauh lebih kecil daripada keunggulan tarifnya.
Yang menyelamatkannya adalah segala hal yang tidak tercakup oleh harga API: lisensi yang mengizinkan redistribusi, bobot yang dapat dimiliki dan disematkan, input video, dan jalur yang dihosting sendiri di mana biaya per token adalah perangkat keras Anda sendiri alih-alih kartu milik vendor. Jika Anda mencari cara termurah untuk mengklasifikasikan, mengekstrak, meringkas, dan merutekan teks, Claude Haiku 5.5 adalah jawabannya dan jaraknya tidak dekat. Jika Anda mencari model yang dapat Anda masukkan ke dalam produk Anda sendiri, di perangkat keras Anda sendiri, di bawah audit Anda sendiri, maka kesenjangan benchmark sudah bukan lagi pertanyaannya sejak beberapa paragraf lalu.
Dibandingkan dalam artikel ini1
Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari
