Kartu judul hero berjudul 'Tingkat Flash Tiongkok, Diaudit' dengan tag pemeriksaan klaim 'Oktober 2026', tiga chip harga bertuliskan Claude Haiku 5.5 $0.10 masuk / $0.50 keluar per 1 juta token, GLM 5.3 Flash $0.15 / $0.50 dan DeepSeek V4.1 Flash $0.30 / $1.20, sebuah baris bertuliskan 'Terminal Bench 4.0 0.32828 - seri', dan baris Index v4.3.2 bertuliskan 43.40 - 41.81 - 39.46.
Guides & Insights

Claude Haiku 5.5 Ditujukan untuk Flash Tier Tiongkok. Hanya Separuh dari Klaim Itu yang Lolos dari Pengujian Ketat.

Penulis

Magnus Corvin

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Seorang pembaca yang menulis dalam bahasa Mandarin mengajukan argumen tajam minggu ini: Claude Haiku 5.5 tampaknya dirancang untuk menguasai pasar Tiongkok tingkat menengah, karena menawarkan harga lebih murah daripada DeepSeek V4.1 Flash dan GLM 5.3 Flash dalam hal harga dan mencetak skor di atas GLM 5.3 Flash pada Terminal Bench 4.0 dan Artificial Analysis Intelligence Index. Ini bacaan yang lebih tajam daripada sebagian besar komentar peluncuran. Ini juga dua klaim yang dibungkus menjadi satu, dan keduanya tidak membawa kadar kebenaran yang sama.

Anthropic merilis Claude Haiku 5.5 pada 7 Oktober 2026 — peluncuran publik penuh dengan pengumuman bertanggal, kartu sistem, dan daftar tarif yang dipublikasikan. Itu memberi klaim tersebut sesuatu yang jarang didapat komentar pasar dari sumber sekunder: angka yang dapat Anda periksa.

Audit di bawah ini menemukan bahwa satu paruh lebih kuat daripada yang dikatakan pembaca dan paruh lainnya salah pada tolok ukur spesifik yang dikutipnya. Kedua temuan itu penting untuk diketahui, karena keduanya mengarah ke arah yang berlawanan.

Klaim tersebut, dinyatakan secara tepat

Jika diurai menjadi bagian-bagiannya, argumen tersebut terdiri dari tiga bagian.

Harga — Claude Haiku 5.5 lebih murah daripada DeepSeek V4.1 Flash dan lebih murah daripada GLM 5.3 Flash.

• Skor independen — berada sekitar satu poin di atas GLM 5.3 Flash pada Artificial Analysis Intelligence Index.

• Tolok ukur pengodean — ini juga mencatat skor satu poin di atas GLM 5.3 Flash pada Terminal Bench 4.0.

Dua di antaranya dapat diverifikasi terhadap tabel yang dipublikasikan dan tetap bertahan, dengan penyesuaian. Yang ketiga dapat diverifikasi terhadap tabel yang sama dan hasilnya berbeda dari yang dijelaskan.

A three-column scoreboard titled 'The claim, audited - Claude Haiku 5.5 against the flash tier' comparing Claude Haiku 5.5, GLM 5.3 Flash and DeepSeek V4.1 Flash across six rows: input price, output price, Intelligence Index v4.3.2 (43.40, 41.81 and 39.46), Terminal Bench 4.0 (0.32828, 0.32828 and 0.2677), cost per finished task ($0.21, $0.25 and $0.27) and weights (proprietary, MIT open, MIT open), footed 'Vendor list rates; Index and benchmark figures per Artificial Analysis v4.3.2.'

Bagian harga: benar, dan kurang dinyatakan dalam satu arah, dinyatakan berlebihan dalam arah lain

Tarif yang dipublikasikan Anthropic untuk Claude Haiku 5.5 adalah $0,10 per juta token input dan $0,50 per juta token output hingga prompt 100.000 token, lalu meningkat menjadi $0,50 dan $2,50 di atas ambang tersebut. Pembacaan input yang di-cache dikenakan $0,01 dan penulisannya $0,125. Jendela konteksnya adalah satu juta token; output maksimumnya 128.000.

GLM 5.3 Flash, dari Z.ai, dipatok pada $0,15 dan $0,50, dengan input yang di-cache pada $0,026. DeepSeek V4.1 Flash dipatok pada $0,30 dan $1,20, dengan input yang di-cache pada $0,006.

Soal tarif utama, pembaca benar. Tarif input $0,10 sepertiga lebih rendah daripada GLM 5.3 Flash dan dua pertiga lebih rendah daripada DeepSeek V4.1 Flash, sementara tarif output $0,50 persis menyamai GLM 5.3 Flash sekaligus jauh di bawah setengah milik DeepSeek. Itu tampak seperti pendaratan yang sengaja dirancang: samai output rival yang lebih murah, kalahkan pada input, dan biarkan rasionya yang berbicara.

Yang membuat klaim ini lebih baik adalah biaya terukur per tugas yang diselesaikan. Pada Intelligence Index v4.3.2 milik Artificial Analysis, biaya seluruh pekerjaan tercatat sebesar $0,21 untuk Claude Haiku 5.5, $0,25 untuk GLM 5.3 Flash, dan $0,27 untuk DeepSeek V4.1 Flash. Daftar tarif menyebutkan Claude Haiku 5.5 1,5 kali lebih murah daripada GLM 5.3 Flash untuk input; hasil pengukuran menyebutkan pekerjaan yang diselesaikan sekitar seperenam lebih murah. Tetap yang termurah di antara ketiganya — hanya saja tidak sebesar selisih yang tersirat pada label harga.

Alasannya adalah hal yang paling sering diabaikan oleh sebagian besar perbandingan harga. Claude Haiku 5.5 bertele-tele. Artificial Analysis mencatat 162.164 token keluaran untuknya saat menjalankan Index, dibandingkan dengan 68.673 untuk GLM 5.3 Flash dan 88.574 untuk DeepSeek V4.1 Flash. Dokumentasi Anthropic sendiri menambahkan efek kedua: model ini menggunakan tokenizer yang lebih baru yang sama dengan yang dipakai Claude 4.7 dan versi setelahnya, sehingga teks yang sama dihitung sekitar 30% lebih banyak token dibandingkan pada model yang digantikannya. Tarif yang lebih murah yang diterapkan pada lebih banyak token adalah tarif yang lebih murah yang diterapkan pada lebih banyak token.

Satu kerumitan yang hanya muncul pada tagihan yang dirutekan: katalog kami sendiri mencantumkan DeepSeek V4.1 Flash pada $0,15 untuk input dan $0,60 untuk output dengan pengganda 2× yang diterapkan selama dua jendela harian, 01:00–04:00 dan 06:00–10:00 UTC. Selama delapan belas jam sehari, itu adalah tarif dasar; selama enam jam sehari, tarif outputnya $1,20. Trafik batch yang dapat dijadwalkan di luar jendela tersebut mendapatkan harga DeepSeek yang jauh lebih baik daripada yang disiratkan oleh tarif daftar utama vendor, sedangkan trafik interaktif tidak. Jika Anda benar-benar memodelkan perbandingan ini, kalender sama pentingnya dengan kartu tarif.

A capture of the Artificial Analysis model page for Claude Haiku 5.5 (Max), showing its standing chips of Intelligence #21/182, Speed #91/182, Cost #46/182 and Verbosity #62/182, the rates $0.10 in and $0.50 out with a 90% cache discount, a cost of $0.21 per task, 440M generated tokens, and the summary line that Claude Haiku 5.5 scores 43 on the Intelligence Index against a median of 13.

Bagian skornya: "sekitar satu poin" adalah 1,6

Pada Artificial Analysis Intelligence Index v4.3.2, Claude Haiku 5.5 diukur sebesar 43,40 dalam konfigurasi Max-nya. GLM 5.3 Flash diukur sebesar 41,81. DeepSeek V4.1 Flash berada pada 39,46.

Jadi, bagian indeks dari klaim itu secara arah benar dan dibulatkan ke bawah: selisihnya 1,59 poin, bukan satu. Itu keunggulan nyata pada indeks yang mencapai enam puluhan, dan itulah angka yang dikutip di setiap ringkasan pertemuan ini.

Yang tidak diklaimnya adalah tolok ukur yang mendasarinya. Kedua vendor menerbitkan set evaluasi mereka sendiri, dan setnya tidak sama — Anthropic melaporkan GDPval-AA v2.1, OSWorld 2.1, Terminal-Bench 4.0, dan FrontierCode untuk Claude Haiku 5.5; Z.ai melaporkan rangkaian evaluasinya sendiri untuk GLM 5.3 Flash. Papan independen adalah satu-satunya baris perbandingan yang benar-benar setara yang tersedia, dan itulah tepatnya mengapa kesenjangan indeks dijadikan sandaran begitu kuat dan mengapa bagian berikutnya penting.

Bagian coding: yang ini seri total, bukan kemenangan

Terminal Bench 4.0, pada pengukuran independen bersama, menunjukkan 0,32828 untuk Claude Haiku 5.5 dan 0,32828 untuk GLM 5.3 Flash. Identik hingga lima tempat desimal.

Itu adalah angka yang paling layak dikutip dalam perbandingan ini dan klaimnya keliru tentang hal itu. Kemungkinan sumber kebingungannya adalah angka yang berdekatan: GLM-5.3 lengkap, varian non-Flash, mencetak 0.4192 pada tolok ukur yang sama. Jika Anda pernah melihat "GLM" dan "Terminal Bench" dalam satu kalimat di sebelah angka satu poin di atas Claude Haiku 5.5, itu adalah varian saudaranya, bukan Flash.

Tiga baris lainnya yang diterbitkan Artificial Analysis untuk kedua model lebih menarik daripada hasil imbang itu, dan tidak mengarah ke satu arah:

• SciCode — 0,5498 untuk Claude Haiku 5.5 versus 0,5162 untuk GLM 5.3 Flash. Keunggulan 3,4 poin bagi Anthropic.

• Humanity's Last Exam — 0,4439 versus 0,3985. Keunggulan 4,5 poin untuk Anthropic.

• AutomationBench, skor parsial — 0,3541 dibandingkan dengan 0,6037. Keunggulan 25 poin bagi GLM 5.3 Flash, dan sejauh ini merupakan selisih terbesar dalam set ini.

Baris terakhir itulah yang paling akan dipedulikan oleh tim pengadaan, karena otomatisasi agentik adalah tempat model tingkat menengah benar-benar diterapkan. Pada ukuran apakah model mampu menyelesaikan tugas multi-langkah hingga tuntas, model open-weights yang lebih murah dijalankan menang dengan selisih yang membuat perbedaan indeks 1,6 poin ke arah sebaliknya tampak kecil.

Kecepatan terpaut dengan cara yang sama seperti harga, hanya lebih ekstrem lagi. Artificial Analysis mengukur 424,6 detik per tugas Index untuk Claude Haiku 5.5 dibandingkan 1035,4 detik untuk GLM 5.3 Flash. Model Anthropic mencapainya dalam waktu kurang dari setengah waktu aktual, yang pada loop agen merupakan angka operasional yang lebih besar daripada laju token.

Apa yang sepenuhnya dihilangkan oleh klaim

Perbandingan ini dibingkai sebagai narasi harga-dan-skor, yang diam-diam melewatkan dimensi tempat kedua model paling berbeda. GLM 5.3 Flash berbobot terbuka, diterbitkan di bawah lisensi MIT, dengan total 320 miliar parameter dan 18 miliar parameter aktif. DeepSeek V4.1 Flash juga berbobot terbuka dengan total 552 miliar dan 16 miliar aktif. Claude Haiku 5.5 bersifat proprietary, hanya tersedia melalui API, tanpa jumlah parameter yang dipublikasikan dan tanpa repositori.

Itu bukan catatan kaki bagi banyak pembeli; itu adalah baris pertama dokumen persyaratan. Tim yang perlu menjalankan inferensi di tenancy-nya sendiri, melakukan fine-tuning, atau mempertahankan versi model tetap tidak berubah selama bertahun-tahun sama sekali tidak memilih di antara ketiga opsi ini berdasarkan poin indeks — dua dari tiga opsi sudah didiskualifikasi sebelum kolom harga dibaca. Pembingkaian pembaca adalah pengamatan posisi pasar dan itu wajar; hanya saja, perbedaan struktural justru berlawanan dengan model yang dibela oleh pembingkaian tersebut.

Menjalankan perbandingan sendiri

GLM 5.3 Flash dan DeepSeek V4.1 Flash keduanya ada di katalog OrcaRouter dengan harga daftar penyedia tanpa markup 0%, yang membuat sisi Tiongkok dari perbandingan ini bisa Anda panggil hari ini alih-alih dimodelkan di spreadsheet. Karena tarifnya diteruskan apa adanya, bukan dicampur, perubahan harga vendor sampai ke sisi kami pada hari yang sama saat perubahan itu sampai ke sisi mereka — dan jendela DeepSeek berbasis kalender yang dijelaskan di atas terlihat di blok harga yang sama yang akan menjadi dasar routing Anda. Satu kunci, satu SDK, failover otomatis di baliknya, dan DSL routing jika Anda lebih suka menyatakan batas biaya di rute daripada di kode aplikasi.

Claude Haiku 5.5 tidak ada di katalog kami. Itu dapat diakses melalui API milik Anthropic sendiri, dan lebih baik mengatakannya secara terang-terangan daripada membiarkannya tersirat.

A capture of the OrcaRouter models index, headed 'Models' with the subtitle '207 models, 16 providers - one API key, one bill' and an OpenAI-compatible cURL example showing a POST to the chat completions endpoint with the model field.

Apa yang sudah dipahami dengan benar oleh pembaca, dan apa yang harus dilakukan dengan itu

Naluri itu tepat. Jika Anda ingin gelombang model kelas menengah Tiongkok yang murah namun mumpuni tampak mahal, kira-kira inilah kartu yang akan Anda mainkan: menyamai laju keluaran pesaing yang lebih murah, memangkas separuh laju masukannya, unggul 1,6 poin indeks, dan biarkan angka harga per tugas yang diselesaikan membawa argumennya. Claude Haiku 5.5 melakukan itu, dan melakukannya sambil lebih dari dua kali lebih cepat per tugas daripada model yang dibidiknya.

Apa yang salah dipahami pembaca justru lebih sempit dan lebih menarik. Terminal Bench 4.0 bukanlah kemenangan; itu adalah seri yang persis. Keunggulan harga, ketika Anda membebankan biaya untuk keseluruhan pekerjaan alih-alih per token, sekitar seperenam, bukan 1,5× seperti yang disiratkan oleh kartu tarif. Dan satu tolok ukur di mana kedua model paling berjauhan adalah yang bersifat agentic, di mana GLM 5.3 Flash unggul 25 poin.

Jadi versi jujur dari klaim itu adalah ini: Claude Haiku 5.5 ditujukan untuk kelas flash Tiongkok, ia menang dalam perbandingan itu pada indeks komposit, pada biaya per tugas yang diselesaikan, dan pada latensi, ia tidak menang dalam hal otomatisasi agentik atau keterbukaan, dan keunggulan benchmark coding spesifik yang membuat argumen itu terasa menentukan tidak ada.

Dibandingkan dalam artikel ini2

Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari