Kartu judul hero untuk 'Ling-3.1-flash vs GLM-5.3-Flash', dengan subjudul 'Throughput empat kali lipat melawan selisih satu poin indeks'. Dua kartu membulat tersusun berdampingan dengan jarak yang jelas: kartu kiri, berlabel 'Ling-3.1-flash', bertuliskan 'Kecepatan: 211 tok/s', 'Indeks AA: 41', 'Lisensi: tidak ada yang dipublikasikan'; kartu kanan, berlabel 'GLM-5.3-Flash', bertuliskan 'Kecepatan: 53 tok/s', 'Indeks AA: 42', 'Lisensi: MIT'. Sebaris teks footer berbunyi 'Throughput pada API masing-masing vendor; indeks menurut Artificial Analysis.' Logo OrcaRouter dikompositkan di sudut kanan bawah.
Guides & Insights

Ling-3.1-flash vs GLM-5.3-Flash: Empat Kali Throughput Berbanding Satu Poin Indeks

Penulis

Gideon Frost

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Ling-3.1-flash dan GLM-5.3-Flash terpaut satu poin pada Artificial Analysis Intelligence Index — 41 berbanding 42 — yang membuat keduanya tampak seperti keputusan yang sama dua kali. Padahal tidak. GLM-5.3-Flash menghasilkan output pada 53,0 token per detik di API milik Z.ai sendiri; Ling-3.1-flash menghasilkannya pada 211,0 token per detik di API milik InclusionAI. Itu perbedaan throughput empat kali lipat, dan jauh lebih besar daripada apa pun yang digunakan indeks itu untuk memisahkan keduanya. Salah satu model lebih mumpuni di antara keduanya pada hampir setiap sumbu kualitas dan terbuka di bawah MIT. Yang satunya adalah model yang selesai lebih dulu, tertutup, dan tidak memiliki harga, lisensi, atau checkpoint yang dipublikasikan. Memilih di antara keduanya adalah soal apa yang ditunggu oleh beban kerja Anda.

Sumbu Ling-3.1-flash menang mutlak.

Kecepatan bukan sekadar catatan kaki ketika Anda memilih di antara model pada tingkat kemampuan yang sama, dan di sini kecepatan menjadi seluruh alasan bagi model Ant.

• Throughput keluaran — Ling-3.1-flash 211,0 token per detik pada API InclusionAI vs GLM-5.3-Flash 53,0 token per detik pada Z.ai. Empat kali kecepatan generasinya.

• Waktu ke token pertama — Ling-3.1-flash 1,80 detik vs GLM-5.3-Flash 3,18 detik. Model Ant mulai menjawab sementara model Z.ai masih berpikir, yang lebih penting daripada throughput dalam penggunaan interaktif dan streaming.

• Waktu per tugas Intelligence Index — Ling-3.1-flash sekitar 357 detik vs GLM-5.3-Flash sekitar 979 detik. Satu tugas evaluasi memakan waktu GLM-5.3-Flash hampir tiga kali lebih lama dari awal hingga akhir, karena model ini lebih lambat per token dan juga lebih lambat untuk memulai.

Bagi loop agen yang melakukan selusin panggilan berurutan, atau produk tempat seseorang mengamati token yang datang, itu bukan penentu seri — itulah seluruh alasan untuk memilih satu model. GLM-5.3-Flash adalah model yang lebih baik di atas kertas dan yang lebih lambat di jalur permintaan.

Di mana GLM-5.3-Flash memang lebih baik

Di semua tempat lain, dan daftarnya cukup panjang sehingga keunggulan throughput harus membuktikan kelayakannya.

• Keandalan pengetahuan — GLM-5.3-Flash mencetak skor +7,47 pada AA-Omniscience, terbaik di antara ketiga model tingkat Flash, dengan tingkat halusinasi 27,6% pada pertanyaan yang dijawab. Ling-3.1-flash mencetak skor +2,22 dengan tingkat halusinasi 37,9%. Pada metrik yang lebih menghukum informasi yang dikarang daripada penolakan, kesenjangannya nyata dan mengarah ke arah yang sama dengan indeks.

• Pengetahuan ilmiah — GLM-5.3-Flash mencatat 0,912 pada GPQA Diamond. Ling-3.1-flash tidak memiliki baris GPQA Diamond yang dipublikasikan. DeepSeek V4.1 Flash (Max) juga tidak. Model dengan skor 0,91 pada pertanyaan sains tingkat pascasarjana adalah instrumen yang berbeda dari model yang belum diukur pada pertanyaan-pertanyaan tersebut.

• Modalitas — GLM-5.3-Flash menerima teks, gambar, dan video. Ling-3.1-flash hanya menerima teks. Ini bukan kesenjangan performa yang dapat ditutup oleh tolok ukur; ini adalah kemampuan yang tidak ada.

• Bobot dan lisensi — GLM-5.3-Flash adalah bobot terbuka di bawah MIT, dapat diunduh dan dihosting sendiri. Ling-3.1-flash tidak menerbitkan checkpoint apa pun, tidak ada teks lisensi, dan tercatat sebagai proprietari.

• Kerja pengetahuan agentik — GLM-5.3-Flash 1,453.73 Elo pada AA-Briefcase v1.1 versus 1,400.35 milik Ling-3.1-flash, pada tolok ukur yang dibangun khusus seputar tugas-tugas kerja pengetahuan, bukan pengoperasian terminal.

• Harga — GLM-5.3-Flash dipublikasikan pada $0,15 per juta token input dan $0,50 per juta token output di API Z.ai, dibandingkan dengan Ling-3.1-flash sebesar $0,30 dan $0,90. Setengah tarif input dan sekitar setengah tarif output, dari model dengan skor indeks lebih tinggi dan bobot terbuka.

A two-column generated scoreboard titled 'Ling-3.1-flash vs GLM-5.3-Flash — the scoreboard'. The left column, 'Ling-3.1-flash', reads 'AA Index: 41', 'Speed: 211 tok/s', 'First token: 1.80 s', 'Omniscience: +2.22', 'Weights: closed', 'Price: $0.30 / $0.90'; the right column, 'GLM-5.3-Flash', reads 'AA Index: 42', 'Speed: 53 tok/s', 'First token: 3.18 s', 'Omniscience: +7.47', 'Weights: MIT', 'Price: $0.15 / $0.50'. A footer line reads 'Index and quality rows per Artificial Analysis; throughput per each vendor's own API.' The OrcaRouter logo is composited in the bottom-right corner.

Baris-baris tempat model Ant membalas

Ling-3.1-flash tidak kalah dalam semua hal. Pada pekerjaan terminal agentik, ia sedikit lebih unggul dan pada coding-science, ia setara:

• Terminal-Bench 4.0 — Ling-3.1-flash 0.333 vs GLM-5.3-Flash 0.328. Praktis seri, dan keduanya berada di bawah tier terdepan.

• SciCode — Ling-3.1-flash 0.541 vs GLM-5.3-Flash 0.516. Kemenangan tipis.

• AutomationBench-AA — 0.617 vs 0.604. Satu lagi kemenangan tipis.

• GDPval-AA — Ling-3.1-flash 1.621,75 Elo vs GLM-5.3-Flash 1.646,86. GLM merebut kembali yang ini.

Baca keempat baris itu bersama-sama dan polanya menjadi jelas. Jika kedua model itu bisa dipisahkan sama sekali, pemisahannya berada di dalam noise dari satu kali evaluasi. Perbedaan indeks satu poin di antara keduanya bukanlah sebuah peringkat; itu seperti lemparan koin yang sedikit lebih condong ke GLM karena baris-baris reliabilitas. Yang bukan lemparan koin adalah selisih throughput 4× dan selisih harga 2×, yang keduanya mengarah ke arah sebaliknya.

Ada juga detail penyajian yang perlu diperhatikan, karena hal ini mengubah besarnya kesenjangan throughput tersebut tergantung dari mana Anda memanggil model. API Z.ai sendiri mengukur pada 53,0 token per detik. Pengukuran tujuh hari katalog kami sendiri untuk GLM-5.3-Flash pada rute kami menunjukkan 150,6 token per detik keluaran pada latensi token pertama median 4,2 detik. Bobot yang sama yang disajikan dari deployment berbeda berjalan hampir tiga kali lebih cepat. Angka throughput vendor adalah properti penyedia, bukan properti model.

Spesifikasi, baris demi baris

Subjek lebih dulu di setiap baris:

• Ukuran — Ling-3.1-flash total 560B / 25B aktif vs GLM-5.3-Flash total 320B / 18B aktif.

• Konteks yang dideklarasikan — 1M token pada keduanya. Baris penalaran konteks panjang GLM-5.3-Flash terukur 0,80 pada AA-LCR; Ling-3.1-flash di 0,83. Keduanya mendekati 0,84 milik DeepSeek V4.1 Flash (Max), yang berarti penalaran konteks panjang bukan lagi pembeda di tingkat ini.

• Batas maksimum keluaran — GLM-5.3-Flash 128.000 token pada katalog kami vs Ling-3.1-flash tanpa maksimum yang dipublikasikan. Salah satunya dapat disesuaikan ukurannya untuk generasi panjang dan yang lain tidak.

• Indeks — 41 vs 42.

• Throughput — 211,0 token per detik vs 53,0 pada API vendor, 150,6 terukur pada rute kami.

• Bobot — berpemilik tanpa lisensi vs terbuka di bawah MIT.

• Modalitas — hanya teks vs teks, gambar, dan video sebagai input.

• Harga — $0,30 / $0,90 per juta masukan / keluaran vs $0,15 / $0,50 di API Z.ai.

Cara benar-benar menjalankan perbandingan ini

GLM-5.3-Flash kini ada di katalog OrcaRouter, tercantum pada $0,075 per juta token masukan, $0,25 per juta token keluaran, dan $0,0173 per juta pembacaan cache — bacalah kartu live-nya alih-alih paragraf ini, karena tarif penyajian berubah dan pass-through, pengaturan ini berarti perubahan harga penyedia tercermin di sisi kami pada hari yang sama. Nilai pengaturan tersebut untuk pertandingan spesifik ini adalah bahwa keterbukaan dan keunggulan harga GLM-5.3-Flash adalah dua hal yang menjadikannya default yang masuk akal, dan rute tertutup dengan markup 0% adalah cara Anda terus menguji Ling-3.1-flash terhadapnya tanpa menambahkan hubungan vendor.

Ling-3.1-flash tidak ada di katalog kami — pencarian terhadap model publik kami mengembalikan hasil tidak ditemukan untuk model di bawah InclusionAI, dan tulisan ini tidak akan menyiratkan bahwa kami menyediakannya. Model ini berjalan melalui API milik Ant sendiri dan platform pihak ketiga yang membawa rilis tersebut, dan hanya sejauh itulah ketersediaannya secara jujur.

Bentuk produktif dari perbandingan ini bukanlah soal ini atau itu. GLM-5.3-Flash bersifat terbuka, paling murah, multimodal, lebih andal dalam menjawab pertanyaan pengetahuan, dan tersedia melalui 23 penyedia — itulah jalur default. Keunggulan Ling-3.1-flash terletak pada throughput dan TTFT di loop agentic, dan konsekuensinya adalah model ini tertutup, hanya teks, lebih mahal, dan hanya dapat dijangkau melalui lebih sedikit pintu. Arahkan pekerjaan interaktif dan sensitif latensi ke model yang cepat, pertahankan pekerjaan batch, padat pengetahuan, dan multimodal pada model terbuka, serta pasang fallback di antara keduanya agar upstream yang lambat tidak menjadi produk yang lambat.

Mana yang harus dipilih

Jika kriteria evaluasi Anda adalah kemampuan, biaya, keterbukaan, dan modalitas, GLM-5.3-Flash memenangi perbandingan ini dan selisihnya tidak tipis — skor indeks lebih tinggi, profil keandalan pengetahuan terbaik di kelasnya, GPQA Diamond 0,912, bobot berlisensi MIT, input video, setengah harga, dan 23 penyedia di belakangnya. Jika kriteria Anda mencakup berapa lama pengguna menunggu atau berapa banyak panggilan berurutan yang dapat dilakukan suatu tugas, Ling-3.1-flash adalah model yang menyelesaikannya, dan laju generasi empat kali lipatnya bukan kesalahan pembulatan dalam loop agen.

Yang akan menyelesaikannya adalah detail layanan yang tidak dipublikasikan oleh kedua vendor dalam bentuk yang sebanding: throughput yang benar-benar terkirim pada beban kerja Anda, melalui penyedia Anda. Kedua model merespons format chat-completions yang kompatibel dengan OpenAI yang sama, yang berarti beralih di antara keduanya adalah perubahan konfigurasi, bukan migrasi — dan untuk dua model yang dipisahkan oleh satu poin indeks dan faktor empat dalam kecepatan, mengukur satu angka itu pada lalu lintas Anda sendiri adalah penggunaan waktu satu sore yang lebih baik daripada membaca baris benchmark lain.

Screenshot of the OrcaRouter model page for z-ai/glm-5.3-flash, in English, captured 2026-10-07. The header reads 'GLM 5.3 Flash', 'ctx 1M tokens', 'Max output 128K', inputs 'text + image + video' and output 'text', with vision, tools, JSON and reasoning capability icons and a release date of 2026-08-26. Four rounded stat tiles read '$0.07', '$0.25', '4.20 s' and '10.00 s' — the input and output rates rendered to two decimals, then the median first-token latency and another latency figure. The description states '320B total / 18B active parameters, 1M-token context, text + image + video in, text out.' The PRICING panel lists 'Input / 1M tokens $0.075', 'Output / 1M tokens $0.250' and 'Cache read / 1M $0.017'. A code sample shows base_url https://api.orcarouter.ai/v1 with model 'z-ai/glm-5.3-flash'.Screenshot of the Artificial Analysis model page for GLM 5.3 Flash, in English, captured 2026-10-07, marked 'Open weights model' and 'Released August 2026'. It shows an Intelligence Index of 42, 53.0 output tokens per second, $0.25 cost per Intelligence Index task, 180M output tokens generated across the index, input $0.15 with an 83% cache discount and output $0.50 per 1M tokens, a 1M context window, text and image input, 320B total parameters with 18.8B active parameters, and a licence of MIT with weights on Hugging Face. The summary line calls the model 'notably slow (75)'.

Dibandingkan dalam artikel ini1

Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari