Kartu hero berjudul 'Claude Haiku 5.5 vs Ling 3.1 Flash' dengan baris di atasnya '560B parameter, tanpa bobot', dengan kontras Index versus AutomationBench yang menunjukkan 0.3541 berbanding 0.6174, baris biaya yang menunjukkan $0.21 per tugas berbanding $0.99 per tugas dan baris waktu yang menunjukkan 424.6s per tugas berbanding 360.4s per tugas.
Engineering & Research

Claude Haiku 5.5 vs Ling 3.1 Flash: Model Berparameter 560 Miliar yang Biayanya Empat Kali Lebih Mahal per Jawaban

Penulis

Rowan Sterling

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Enam hari memisahkan keduanya. InclusionAI merilis Ling 3.1 Flash pada 1 Oktober 2026; vendor tersebut merilis Claude Haiku 5.5 pada 7 Oktober. Keduanya dijual sebagai model tingkat flash, keduanya membawa jendela konteks satu juta token, dan pada baris penalaran dari satu-satunya papan independen yang telah menjalankan keduanya, keduanya begitu berdekatan sehingga perbedaannya berada di dalam derau. Lalu Anda sampai pada baris yang mengukur apakah agen benar-benar menyelesaikan pekerjaan, dan keduanya terpaut 26 poin — dan pada baris yang mengukur berapa biaya pekerjaan yang selesai, di mana model dengan 560 miliar parameter memiliki harga empat setengah kali lipat harga model yang jumlah parameternya tidak dipublikasikan oleh siapa pun.

Tidak satu pun kartu tarif memperkirakan hal itu. Ling 3.1 Flash tercantum pada $0,30 per juta token input dan $0,90 per juta token output. Claude Haiku 5.5 tercantum pada $0,10 dan $0,50 untuk prompt hingga 100.000 token, lalu naik menjadi $0,50 dan $2,50 di atas itu. Jika dibaca sebagai harga per token, Ling tiga kali lebih mahal pada input dan sedikit di bawah dua kali lipat pada output, celah yang merupakan jenis selisih yang mengakhiri perbandingan dalam satu baris.

Itu tidak mengakhiri yang ini, karena kartu tarif diberi harga per token dan keputusannya diberi harga per tugas. Kedua angka itu keluar dari pertarungan ini dengan tanda yang berlawanan, dan alasannya bukan karena bertele-tele.

Berapa biaya tugas yang selesai, bukan berapa biaya token.

Pada Artificial Analysis Intelligence Index v4.3.2, biaya terukur untuk menyelesaikan satu tugas indeks penuh adalah $0,21 untuk Claude Haiku 5.5 dan $0,99 untuk Ling 3.1 Flash. Itu adalah kesenjangan 4,6× — lebih lebar daripada rasio input 3×, dan berada pada arah yang sama.

Penjelasan yang tampak jelas — bahwa model mahal itu lebih banyak berbicara — adalah penjelasan yang keliru. Ling 3.1 Flash menghasilkan 100.671 token keluaran per tugas indeks; Claude Haiku 5.5 menghasilkan 162.164. Model yang lebih murah justru lebih banyak mengobrol, dengan selisih lebih dari 60%. Jadi, uangnya juga tidak mengalir ke tempat yang ditunjukkan oleh kartu tarif.

Pecah biaya per tugas dan biaya itu mendarat tepat di tempat metodologi indeks benar-benar membelanjakannya. Dari $0.21 milik Claude Haiku 5.5, sekitar 62% ada di sisi input; dari $0.99 milik Ling 3.1 Flash, sekitar 91% ada di sisi input. Ini adalah proses penalaran yang sarat cache, dan kedua vendor menetapkan harga token input yang di-cache dengan sangat berbeda: $0.01 per juta untuk Claude Haiku 5.5 dibandingkan $0.06 per juta untuk Ling 3.1 Flash — selisih 6× pada satu baris yang mendominasi tagihan. Daftar tarif yang dipublikasikan membandingkan $0.10 dengan $0.30. Baris yang menentukan faktur membandingkan $0.01 dengan $0.06.

Katalog kami sendiri meneruskan harga daftar penyedia pada markup 0%, dan itulah cara Anda dapat membedakan kedua situasi tersebut pada tagihan langsung alih-alih tagihan yang dimodelkan. Ling 3.1 Flash tidak ada di katalog pada ejaan apa pun dari jalur vendornya yang dapat kami resolusi — bukan di bawah InclusionAI, bukan di bawah Ling, bukan di bawah salah satu dari delapan bentuk yang kami coba — jadi $0.30 dan $0.90 di atas adalah tarif resmi yang diterbitkan vendor itu sendiri dan tidak ada yang dapat kami rutekan untuk Anda hari ini. Claude Haiku 5.5 juga tidak ada di katalog; ia berjalan melalui API Anthropic sendiri. Yang memang ada di katalog dari sekitar perbandingan ini adalah GLM 5.3 Flash, DeepSeek V4.1 Flash, Qwen3.8 Flash dan Gemini 3.8 Flash, masing-masing pada harga daftar penyedia dengan markup 0%, sehingga perubahan tarif vendor sampai ke sisi kami pada hari yang sama saat perubahan itu sampai ke sisi mereka. Jika temuan di bawah ini adalah bahwa profil agentic Ling 3.1 Flash adalah yang dibutuhkan beban kerja Anda, langkah praktis berikutnya adalah adu langsung melawan model-model yang mampu agentic yang kami rutekan, pada satu kunci dengan failover otomatis di bawahnya dan DSL perutean ketika batas biaya sebaiknya berada di rute alih-alih di kode aplikasi.

A two-column scoreboard titled 'Claude Haiku 5.5 vs Ling 3.1 Flash - the scoreboard' with rows Index v4.3.2 43.40 against 41.09, cost per task $0.21 against $0.99, time per task 424.6s against 360.4s, Terminal Bench 4.0 0.3283 against 0.3333, AutomationBench 0.3541 against 0.6174 and output tokens per task 162,164 against 100,671, footed 'All figures per Artificial Analysis Intelligence Index v4.3.2.'

Tujuh baris di mana keduanya diukur

Artificial Analysis adalah satu-satunya papan yang telah menjalankan kedua model, dan tumpang tindihnya sempit tetapi informatif. Baris-barisnya tidak sepakat satu sama lain, dan arah ketidaksepakatan itu tidak acak.

• Indeks Kecerdasan v4.3.2 — 43,40 untuk Claude Haiku 5.5 (Max) dibandingkan 41,09 untuk Ling 3.1 Flash. Keunggulan 2,31 poin bagi Anthropic.

• Biaya per tugas Index yang diselesaikan — $0,21 dibandingkan $0,99 pada papan yang sama.

• Waktu per tugas Index — 424,6 detik untuk Claude Haiku 5.5 dibandingkan 360,4 detik untuk Ling 3.1 Flash. Ini adalah baris di mana ekspektasi terpatahkan: model 560 miliar parameter justru yang lebih cepat di antara keduanya di seluruh indeks secara keseluruhan, sekitar 15%.

• Terminal Bench 4.0 — 0.3283 versus 0.3333. Ling 3.1 Flash unggul setengah poin, yang pada benchmark yang dikutip kedua vendor merupakan hasil imbang.

• SciCode — 0,5498 versus 0,5405. Claude Haiku 5.5 dengan selisih 0,9 poin. Juga seri.

Humanity's Last Exam, tanpa alat — 0,4439 versus 0,3943. Claude Haiku 5.5 dengan selisih 5 poin, pemisahan nyata yang pertama.

• AutomationBench, skor parsial — 0,3541 versus 0,6174. Ling 3.1 Flash dengan selisih 26 poin, dan dengan selisih yang lebih besar daripada gabungan semua selisih lain dalam daftar ini.

Ada dua baris lagi di luar kumpulan bersama itu dan layak disertakan, karena itulah yang paling diperhatikan pembeli. Pada GDPval-AA, yang dijalankan Artificial Analysis di 44 pekerjaan, keduanya adalah 1620.05 dan 1621.75 — imbang secara statistik. Pada AA-Briefcase v1.1, evaluasi pekerjaan profesional bentuk panjang dengan peringkat Elo, Claude Haiku 5.5 mencatat 1577.72 berbanding 1400.35 milik Ling 3.1 Flash, selisih 177 poin yang menguntungkan Anthropic. Itu adalah pemisahan non-agentik terlebar antara keduanya di mana pun pada papan peringkat.

Satu baris yang seharusnya menentukan sebagian besar percakapan ini

Rata-rata tingkat indeks menyembunyikan ke mana waktu dan uang sebenarnya pergi, dan pasangan ini adalah kasus paling jelas akan hal itu dalam batch ini. Angka per-evaluasi pada Terminal Bench 4.0 tidak berdekatan dalam dimensi apa pun kecuali skornya.

• Terminal Bench 4.0, Ling 3.1 Flash — 0,3333 dengan biaya $5,49 per tugas dan 1.283 detik per tugas.

• Terminal Bench 4.0, Claude Haiku 5.5 — 0,3283 dengan $0,65 per tugas dan 908 detik per tugas.

Lima perseribu poin skor memisahkan keduanya. Biayanya 8,4× dan waktu dindingnya 1,4×. Tim yang membaca tabel benchmark dan memilih model dengan skor 0,3333, menurut perhitungan Artificial Analysis sendiri, telah memilih untuk membayar delapan kali lipat demi tiba sepertiga menit lebih lambat dengan jawaban yang sama.

Ini bukan argumen bahwa skor tidak berarti; ini argumen bahwa skor adalah rasio pekerjaan yang diselesaikan terhadap pekerjaan yang dicoba, dan itu tidak mengatakan apa pun tentang sumber daya yang dikonsumsi untuk mencapainya. Tolok ukur penyelesaian agentik justru merupakan konteks ketika perbedaan itu paling terasa, karena agen yang mencoba ulang adalah agen yang membayar harga penuh pada setiap percobaan ulang, dan model yang biayanya delapan kali lebih mahal per percobaan mengubah loop percobaan ulang menjadi pos anggaran.

A capture of the Artificial Analysis model page for Claude Haiku 5.5 (Max), showing its standing chips of Intelligence #21/182, Speed #91/182, Cost #46/182 and Verbosity #62/182, the rates $0.10 in and $0.50 out with a 90% cache discount, a cost of $0.21 per task, 440M generated tokens, and the summary line that Claude Haiku 5.5 scores 43 on the Intelligence Index against a median of 13.

560 miliar parameter tanpa perlu mengunduh apa pun

Inilah bagian dari lembar spesifikasi Ling 3.1 Flash yang benar-benar tidak biasa, dan itu bukan soal ukurannya.

Ling 3.1 Flash adalah model sparse mixture-of-experts — total 560 miliar parameter, 25 miliar aktif per token — dan Artificial Analysis mengklasifikasikannya sebagai proprietary. Tidak ada bobot, tidak ada berkas lisensi, dan tidak ada repositori. Model sparse besar dengan bentuk seperti itu biasanya hadir sebagai rilis terbuka, karena itulah yang dilakukan oleh yang lain di tingkat ini: GLM 5.3 Flash merilis bobot MIT pada 320 miliar total dan 18 miliar aktif, dan DeepSeek V4.1 Flash merilis bobot MIT pada 552 miliar total dan 16 miliar aktif. Ling 3.1 Flash adalah kelas arsitektur yang sama pada urutan skala yang sama, diterbitkan hanya sebagai API.

Pilihan itu memiliki konsekuensi yang tidak ditunjukkan oleh baris-baris benchmark. Model dengan 25 miliar parameter aktif harus dilayani di suatu tempat, dan jika Anda tidak dapat menyimpan checkpoint-nya, Anda tidak bisa memilih di mana atau dengan margin berapa — Anda menyewa layanan penyajian vendor untuk model itu. Harga tugas Terminal Bench sebesar $5.49 di atas bukan terutama artefak tarif token; itulah biaya menyewa model sparse besar dari satu-satunya pihak yang dapat menjalankannya. Model-model open-weights sejenis di tingkat ini memberi Anda opsi untuk menggeser angka itu sendiri.

Itu juga berlaku sebaliknya, dan kejujuran yang sama tetap berlaku. Rilis terbuka tidak secara otomatis menjadi produk yang lebih baik: Anda mewarisi beban penyajian, pilihan kuantisasi, dan treadmill peningkatan bersama dengan bobotnya, dan file lisensi bukanlah kontrak dukungan. Anthropic menerbitkan komitmen pensiun untuk Claude Haiku 5.5 yang tidak lebih cepat dari 7 Oktober 2027, pada API pihak pertama dengan kartu sistem. Manakah dari dua pengaturan tersebut yang Anda inginkan adalah pertanyaan tentang tim Anda, bukan tentang model mana pun.

Untuk apa Ling 3.1 Flash

Baca profilnya secara keseluruhan dan itu menggambarkan produk yang koheren, bukan produk yang penuh kompromi: model besar, sparse, berkonteks panjang yang menyelesaikan alur kerja mandiri multi-langkah lebih baik daripada apa pun yang diukur di rentang harga ini, tidak istimewa dalam penalaran sekali jalan yang sulit, dan melakukannya dengan tarif tetap tanpa jurang panjang prompt. Pada AutomationBench, model ini unggul 26 poin dari Claude Haiku 5.5, dan skor AA-Briefcase-nya adalah satu-satunya titik dalam perbandingan ini yang menempatkannya di belakang bagian tengah lapangan alih-alih di depannya.

Itu adalah deskripsi yang bisa dipertahankan tentang pekerja agentik batch: arahkan ia ke antrean pekerjaan terstruktur yang masing-masing harus diselesaikan, terima bahwa tugas diukur dalam menit, jaga prompt tetap cukup panjang sehingga langkah ambang batas akan terasa menghukum, dan utamakan keandalan di garis finis di atas biaya token mana pun. Yang tidak cocok untuknya adalah hal yang biasanya menjadi alasan model kelas flash dibeli. Ia hanya menerima teks — tidak ada input gambar sama sekali, sedangkan Claude Haiku 5.5 menerima teks dan gambar. Waktu tugas indeksnya lebih singkat, tetapi waktu tugas Terminal Bench-nya lebih lama, dan pada $0,99 per tugas indeks yang diselesaikan versus $0,21, ia menghabiskan empat setengah kali lebih banyak untuk mencapai komposit yang hampir sama.

A capture of InclusionAI's Ling Studio playground with the model selector reading Ling-3.1-flash, a Model Settings panel showing temperature 0.6, top_k 20 and Thinking enabled, tabs for Chat, Prompt, Agent, explore and Tools, and tool toggles for Web Search, Time Query and Weather Query.

Yang mana dari keduanya, berdasarkan bukti yang ada

Jika pekerjaan Anda adalah teks masuk, teks keluar, dengan harga per token pada volume, Claude Haiku 5.5 memenangkan perbandingan ini pada setiap baris yang mencapai faktur: biaya tugas indeks lebih rendah, biaya tugas riil lebih rendah pada tolok ukur yang paling penting bagi agen, komposit lebih tinggi, skor pekerjaan profesional bentuk panjang lebih baik, fidelitas lebih baik, dan input gambar yang sama sekali tidak ditawarkan model lain.

Jika pekerjaan Anda adalah agen tanpa pengawasan yang harus menyelesaikan alur kerja multi-langkah, Ling 3.1 Flash mencetak 26 poin di atas Claude Haiku 5.5 pada satu tolok ukur bersama yang mengukur tepat hal itu, dan itu layak diuji daripada diabaikan karena harga. Ujilah pada jejak Anda sendiri, bukan pada tabel ini — dan hitung biaya pengujian per pekerjaan yang diselesaikan, karena itulah angka yang berubah ketika agen mencoba ulang.

Jika Anda perlu memegang bobotnya, tidak satu pun dari keduanya adalah model Anda. Ling 3.1 Flash bersifat proprieter dengan 560 miliar parameter; Claude Haiku 5.5 bersifat proprieter tanpa jumlah yang dipublikasikan. Rilis terbuka di tingkat ini berada di tempat lain pada papan peringkat, dan perbandingan itu dimulai dari serangkaian baris yang sepenuhnya berbeda.

Skor kompositnya menyebut 2,31 poin. Tolok ukur agentik menyebut 26 ke arah sebaliknya. Kartu tarif menyebut 3× pada input; biaya tugas selesai menyebut 4,6× pada arah yang sama dengan kartu itu. Empat angka, dua arah — itulah sebabnya satu-satunya cara andal untuk menyelesaikan ini adalah menjalankan keduanya terhadap jejak pekerjaan Anda sendiri dan membaca biayanya dari pekerjaan yang telah selesai, bukan dari token.

Dibandingkan dalam artikel ini1

Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari