
Claude Haiku 5.5 vs GLM 5.3 Flash: Sama Kuat di Benchmark yang Dikutip Kedua Vendor
- openaiBARUOpenAI: GPT-6.1 Sol2026-09-2952Kecerdasan
- anthropicBARUAnthropic: Claude Sonnet 5.52026-09-2856Kecerdasan
- typesafeBARUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Kecerdasan
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- xAIGrok 4.72026-09-2146Kecerdasan
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 juta token · 60 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 juta token · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 356 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
Run Claude Haiku 5.5 and GLM 5.3 Flash through Terminal Bench 4.0 and you get the same number: 0.32828 for both. Not close — identical, to five decimal places, on the benchmark that the vendor leads with in its own launch materials and that Z.ai's launch materials lead with too. For two models built on entirely different stacks, by vendors in different countries, released six weeks apart, that is a coincidence worth stopping on.
Itu juga angka yang salah untuk dijadikan dasar keputusan. Kedua model itu berbeda tajam di semua aspek lain, dan pola perbedaan tersebut cukup tidak biasa sehingga seharusnya mengubah cara Anda membaca klaim utama dari kedua vendor. Salah satunya menang dalam indeks komposit dan angka biaya per tugas. Yang lain menang dalam hampir semua hal yang tampak seperti penerapan sebenarnya.
Mereka tidak dipisahkan oleh kemampuan. Mereka dipisahkan oleh bentuk.
Mulailah dengan satu angka yang mengatakan "ini adalah kelas model yang sama."
• SciCode — 0,5498 untuk Claude Haiku 5.5 dibandingkan dengan 0,5162 untuk GLM 5.3 Flash. Dua poin untuk Anthropic, pada tolok ukur yang selisih dua poin hanyalah noise.
• Terminal Bench 4.0 — 0,32828 melawan 0,32828. Seri, persis.
• Jendela konteks — satu juta token untuk keduanya.
• Harga output, tier pertama — $0.50 per juta token untuk keduanya.
Empat baris, empat hampir-cocok. Jika Anda berhenti di sini, Anda akan menyimpulkan bahwa model-model ini dapat dipertukarkan dan memilih berdasarkan harga. Kesimpulan itu akan salah, dan rangkaian baris berikutnya adalah alasannya.
Di mana mereka menyimpang, arahnya konsisten
Baris-baris yang memang memisahkan mereka tidak tersebar. Baris-baris itu mengelompok menjadi dua kelompok, dan masing-masing model memiliki satu kelompok secara mutlak.
Grup agentik tersebut termasuk dalam GLM 5.3 Flash. Skor parsial AutomationBench tercatat 0.6037 untuk GLM 5.3 Flash dibandingkan 0.3541 untuk Claude Haiku 5.5 — selisih 25 poin, perbedaan tunggal terbesar antara kedua model ini pada pengukuran bersama apa pun. Tau-Bench Banking tercatat 0.4722 untuk GLM 5.3 Flash; Claude Haiku 5.5 tidak memiliki angka yang dipublikasikan pada baris tersebut. GPQA tercatat 0.9121 untuk GLM 5.3 Flash; sekali lagi tidak ada angka Anthropic untuk dibandingkan. Pada ukuran apakah suatu model dapat menjaga tugas multi-langkah tetap utuh dan menggunakan alat secara andal di dalam domain terstruktur, model Z.ai unggul dengan margin yang jauh melampaui perbedaan indeks komposit yang bergerak ke arah sebaliknya.
Kelompok komposit-dan-biaya menjadi milik Claude Haiku 5.5. Artificial Analysis Intelligence Index v4.3.2 terbaca 43,40 berbanding 41,81 — 1,59 poin, dan angka yang dikutip oleh setiap ringkasan pertarungan ini. Biaya per tugas Index yang telah diselesaikan tercatat $0,21 berbanding $0,25. Waktu jam dinding per tugas Index tercatat 424,6 detik berbanding 1.035,4 detik: model Anthropic selesai dalam waktu kurang dari setengahnya.
Itulah bentuk pilihannya. Claude Haiku 5.5 lebih cepat, lebih murah per pekerjaan yang diselesaikan, dan lebih tinggi secara agregat. GLM 5.3 Flash lebih andal pada kelas pekerjaan spesifik yang membuat model murah dibeli.

Yang mana yang harus dipercaya?
Bukan keduanya, dengan sendirinya — dan ketidaksepakatan itu sendiri adalah informasinya.
Intelligence Index adalah campuran berbobot di seluruh kategori penalaran, sains, pemrograman, dan agentik. Indeks ini dirancang untuk menjawab "kira-kira seberapa mampu model ini" dalam satu angka, dan itu memang berhasil dilakukannya. Yang tidak dapat dilakukannya adalah memberi tahu Anda apakah keunggulan 1,59 poin berasal dari kategori tempat beban kerja Anda berada atau dari kategori yang tidak pernah disentuhnya. Di sini, keunggulan itu sebagian besar berasal dari baris seperti SciCode dan Humanity's Last Exam — 0,5498 berbanding 0,5162, dan 0,4439 berbanding 0,3985 — sementara defisit 25 poin terletak pada AutomationBench dengan tanda yang berlawanan.
Sebuah tim yang membangun asisten pengodean pada loop terminal akan menyadari keunggulan SciCode. Sebuah tim yang membangun agen yang harus menyelesaikan alur kerja perbankan dari awal hingga akhir akan menyadari kesenjangan AutomationBench, dan mereka akan menyadarinya setiap hari. Kedua tim melihat indeks yang sama dan seharusnya sampai pada kesimpulan yang berlawanan.
Langkah praktisnya adalah membaca komposit sebagai filter, bukan sebagai peringkat. Jika dua model berada dalam kisaran sekitar dua poin indeks, komposit telah memberi tahu Anda bahwa keduanya berada dalam rentang yang sama dan tidak memberi tahu apa pun tentang mana yang harus dipilih. Pada titik itu, satu-satunya baris yang layak dibaca adalah baris yang cocok dengan beban kerja Anda — dan jika vendor belum menerbitkan baris yang Anda butuhkan, ketidakhadirannya itu sendiri merupakan titik data, bukan celah yang harus diisi dengan asumsi.
Baris tokenizer yang tak seorang pun cantumkan dalam tabel perbandingan
Dokumentasi Anthropic sendiri memuat satu kalimat yang mengubah setiap perbandingan harga yang melibatkan Claude Haiku 5.5, dan kalimat itu mudah terlewat saat dibaca. Model ini menggunakan tokenizer yang lebih baru yang sama dengan Claude 4.7 dan versi setelahnya, yang menghitung teks yang sama sebagai sekitar 30% lebih banyak token daripada model yang digantikannya.
Bandingkan itu dengan daftar tarif, dan hitung-hitungannya menjadi kurang menguntungkan daripada yang disiratkan label harganya. Tarif input Claude Haiku 5.5 adalah $0.10 per juta token, sedangkan GLM 5.3 Flash $0.15 — keunggulan 1,5×. Jika prompt yang sama memakai 30% lebih banyak token, keunggulan efektif pada teks identik menyempit cukup banyak, meskipun tidak hilang. Tarif output identik pada $0.50 di tier pertama, jadi efek tokenizer berlaku tanpa ada yang mengimbanginya di sana.
Hasil terukur adalah versi jujur dari klaim itu: menurut perhitungan Artificial Analysis sendiri, Claude Haiku 5.5 menghasilkan 162.164 token keluaran per tugas Index, dibandingkan 68.673 untuk GLM 5.3 Flash — 2,4 kali lipat — dan tetap menghasilkan $0,21 per tugas yang diselesaikan, dibandingkan $0,25. Keunggulan tarifnya bertahan menghadapi verbositas, dan yang tersisa darinya lebih kecil daripada yang dikatakan kartu tarif.
Hanya satu dari dua ini yang tarifnya dinyatakan flat. Harga Claude Haiku 5.5 naik bertingkat setelah 100.000 token prompt menjadi $0,50 untuk input dan $2,50 untuk output; GLM 5.3 Flash tidak memiliki ambang batas setara yang dipublikasikan. Untuk sebagian besar trafik chat dan bantuan kode, lonjakan itu tidak pernah berlaku. Untuk pekerjaan agen dokumen panjang atau konteks besar, lonjakan itu selalu berlaku, dan pada titik itu perbandingannya berbalik jauh melampaui apa pun yang disiratkan oleh angka tingkat pertama.

Garis yang memutuskannya sebelum angka-angka mana pun melakukannya
Semua di atas mengasumsikan Anda dapat memilih secara bebas di antara kedua model ini. Sebagian besar tim tidak bisa, dan alasannya adalah satu baris lembar spesifikasi yang cenderung terkubur dalam diskusi benchmark.
GLM 5.3 Flash adalah model berbobot terbuka, dirilis di bawah lisensi MIT, dengan total 320 miliar parameter dan 18 miliar parameter aktif. Model ini dapat diunduh, dihosting sendiri, di-fine-tune, dikuantisasi, dipatok ke versi tertentu, dan dijalankan di dalam tenancy yang Anda kendalikan. Claude Haiku 5.5 bersifat proprietary dan hanya tersedia melalui API, tanpa jumlah parameter yang dipublikasikan, tanpa lisensi, dan tanpa repositori.
Jika dokumen kebutuhan Anda menyatakan bahwa model harus berjalan di perangkat keras Anda sendiri, atau bahwa checkpoint tertentu harus tetap dapat dipanggil selama tiga tahun ke depan, perbandingan ini sudah selesai sebelum kolom harga dibaca. Itu bukan sekadar hal teknis. Itu adalah alasan paling umum tim akhirnya menggunakan model kelas menengah dengan bobot terbuka, dan itulah alasan keunggulan 25 poin di AutomationBench bukan satu-satunya hal yang menarik ke arah Z.ai.
Hal itu juga berlaku sebaliknya, dan kejujuran yang sama juga berlaku. Anthropic menerbitkan komitmen penghentian untuk Claude Haiku 5.5 yang tidak lebih awal dari Oktober 2027, dan menyediakan model tersebut di API pihak pertama dengan kartu sistem dan kumpulan evaluasi yang terdokumentasi. Rilis open-weights tidak otomatis lebih tahan lama — Anda mewarisi beban operasional bersama bobotnya, dan file lisensi bukanlah kontrak dukungan. Mana dari keduanya yang Anda inginkan adalah pertanyaan tentang tim Anda, bukan tentang modelnya.
Kedua sisi pada satu tombol, jika Anda ingin menyelesaikannya secara empiris.
GLM 5.3 Flash ada di katalog OrcaRouter pada harga daftar Z.ai dengan markup 0%, diteruskan apa adanya alih-alih digabungkan, jadi tarif di atas adalah tarif yang tertulis di tagihan dan setiap perubahan yang dilakukan Z.ai langsung berlaku di sisi kami pada hari yang sama. Claude Haiku 5.5 tidak ada di katalog kami — model ini dapat diakses melalui API milik Anthropic sendiri — dan lebih baik menyatakannya secara terang-terangan daripada membiarkannya tersirat.
Yang justru dimudahkan oleh katalog adalah bentuk pengujian yang sebenarnya dituntut oleh pertarungan ini. Ketidaksepakatan antara indeks komposit dan baris-baris agentik adalah hipotesis tentang Anda dalam kaitannya dengan beban kerja, dan satu-satunya cara untuk menyelesaikannya adalah menjalankan kedua model pada jejak yang sama. Dengan GLM 5.3 Flash pada rute dan segmen Anthropic di sisi lain gateway yang sama, itu menjadi perubahan konfigurasi alih-alih dua integrasi — satu API untuk 200+ model, satu kunci, failover otomatis di bawahnya, dan DSL perutean saat Anda ingin memisahkan lalu lintas berdasarkan kelas tugas dan membaca biaya dari satu faktur.

Vonis itu, dinyatakan sesuai dengan cara angka-angka mendukungnya.
Jika pekerjaan Anda adalah teks masuk, teks keluar, prompt Anda tetap berada di dalam tier harga pertama, dan Anda membayar per token untuk volume nyata, Claude Haiku 5.5 adalah model yang lebih baik di sini: komposit lebih tinggi, lebih murah per tugas yang diselesaikan, dan lebih dari dua kali lebih cepat per tugas. Angka utama terminal-benchmark itu imbang dan tidak boleh dipakai untuk menentukan apa pun.
Jika pekerjaan Anda adalah agen yang harus menyelesaikan alur kerja multi-langkah tanpa pengawasan, GLM 5.3 Flash unggul pada satu tolok ukur bersama yang mengukur tepat hal itu, sebesar 25 poin, dan model ini lebih murah di antara keduanya untuk dimodifikasi karena Anda dapat memegang bobotnya.
Hasil seri pada 0,32828 adalah gambaran yang tepat untuk pasangan ini, tetapi bukan karena model-modelnya setara. Itulah satu-satunya baris di mana dua model yang hampir tidak memiliki kesamaan lain kebetulan menghasilkan angka yang sama — dan memperlakukan angka itu sebagai ringkasan perbandingan adalah cara sebuah keputusan pengadaan dibuat berdasarkan angka yang paling tidak informatif dalam tabel.
