Kartu judul hero untuk 'Ling-3.1-flash mencapai 41 pada AA Intelligence Index', dengan subjudul 'total 560B / 25B aktif MoE dari Ant Group'. Sebuah kartu besar dengan sudut membulat memuat angka '41' dengan label 'Artificial Analysis Intelligence Index v4.3.2'; di bawahnya, kartu kecil kedua bertuliskan 'vs 20' dengan label 'Ling-3.0-flash'. Baris footer berbunyi 'Angka indeks diukur secara independen oleh Artificial Analysis; model dirilis 2026-10-01.' Logo OrcaRouter dikomposisikan di sudut kanan bawah.
Guides & Insights

Ling-3.1-flash Mencapai 41 pada Artificial Analysis Intelligence Index: MoE 560B Dua Kali Lipat Pendahulunya

Penulis

Rowan Sterling

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Ling-3.1-flash, mixture-of-experts dengan 560 miliar parameter milik Ant Group, kini menyandang angka yang tidak ditulis oleh laboratoriumnya sendiri: 41 pada Artificial Analysis Intelligence Index. Indeks ini dijalankan oleh evaluator independen, pada perangkat keras yang dikendalikan evaluator tersebut, terhadap rangkaian uji tetap — dan indeks itu menempatkan model tersebut 21 poin di atas pendahulu langsungnya sendiri, Ling-3.0-flash, yang masih berada di 20 pada indeks yang sama. Ant mengumumkan Ling-3.1-flash pada akhir September 2026, Artificial Analysis menetapkan tanggal rilisnya pada 1 Oktober, dan usianya tiga bulan lebih muda daripada model yang skornya dilipatgandakannya.

Selisih itulah inti ceritanya. Pergerakan 21 poin pada komposit yang dibentuk dari sepuluh evaluasi berbeda bukanlah hal yang bisa dipalsukan oleh grafik vendor, dan bukanlah hal yang bisa dibahas blog ini dua minggu lalu, ketika satu-satunya pengukuran Ling-3.1-flash yang ada adalah kartu benchmark milik Ant sendiri: 1.673 Elo pada GDPval-AA v2.1, 75,16 pada FrontierSWE, 65,35 pada HealthBench Professional. Angka-angka itu adalah klaim nyata dari lab nyata, tetapi belum direproduksi. Angka 41 berbeda jenisnya. Ini adalah angka pertama dalam rilis ini yang bisa dijadikan acuan oleh pihak ketiga.

Apa yang sebenarnya diukur oleh 41

Artificial Analysis Intelligence Index v4.3.2 adalah komposit berbobot dari sepuluh evaluasi: AA-Briefcase v1.1, GDPval-AA v2.1, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience, dan AA-LCR v1.1. Membaca komposit secara terpisah adalah sebuah kesalahan, jadi baris per evaluasi lebih penting daripada angka utamanya:

• GDPval-AA — 1.621,75 untuk Ling-3.1-flash dibandingkan 948,35 untuk Ling-3.0-flash. Ini adalah lonjakan tunggal terbesar dalam kumpulan ini dan menjadi dasar sebagian besar pergerakan indeks tersebut.

• GDP.pdf — 0,100 lulus semua, naik dari 0,054. Masih rendah secara absolut, tetapi hampir dua kali lipat.

• Penalaran konteks panjang AA-LCR v1.1 — 0,83 berbanding 0,73 untuk pendahulunya, dan setara dengan DeepSeek V4.1 Flash (Max) pada 0,84.

• SciCode — 0,541 dibandingkan 0,420. Peningkatan dari sisi sains pemrograman, bukan peningkatan kualitas obrolan.

• Penalaran fisika CritPt — 0,180, dibandingkan 0,017 sebelumnya. Sepuluh kali lipat pendahulunya pada basis kecil.

• AA-Omniscience — +2.22, dibandingkan dengan −17.88 untuk Ling-3.0-flash. Yang ini dibahas di bawah, karena bertentangan dengan judul utama.

Ling-3.0-flash tidak sekadar kalah dari Ling-3.1-flash pada baris-baris ini; ia runtuh pada dua di antaranya. Ia mencetak 0,032 pada AutomationBench-AA dan tepat 0,000 pada Terminal-Bench 4.0. Itulah konteks di mana angka 41 harus dibaca — pendahulunya adalah model berbobot terbuka yang efisien dan murah yang pada dasarnya tidak memiliki kemampuan terminal agentik sama sekali.

A single-column generated scoreboard titled 'Ling-3.1-flash — the scoreboard' with six rows: 'AA Index: 41', 'Predecessor index: 20', 'Terminal-Bench 4.0: 0.333', 'SciCode: 0.541', 'Price: $0.30 / $0.90', 'Weights: not published', and a footer reading 'All figures per Artificial Analysis, independently measured.' The OrcaRouter logo is composited in the bottom-right corner.

Dari mana keuntungan itu berasal: kerja agentik, bukan percakapan

Bandingkan kontribusi indeks Ling-3.1-flash dengan dua model kelas Flash yang paling sering disejajarkan dengannya, dan muncul sebuah pola yang disembunyikan oleh agregatnya. DeepSeek V4.1 Flash (Max) mencatat 39 pada indeks yang sama dan GLM 5.3 Flash mencatat 42, jadi ketiganya berada dalam rentang tiga poin. Namun mereka mencapainya dari tempat yang berbeda.

• Pekerjaan terminal agentik — Ling-3.1-flash 0.333 pada Terminal-Bench 4.0, DeepSeek V4.1 Flash (Max) 0.268, GLM 5.3 Flash 0.328.

• Pekerjaan dunia nyata agentik — Ling-3.1-flash 1.621,75 Elo pada GDPval-AA, DeepSeek V4.1 Flash (Max) 1.600, GLM 5.3 Flash 1.646,86.

• AutomationBench-AA — Ling-3.1-flash 0.617, DeepSeek V4.1 Flash (Max) 0.689, GLM 5.3 Flash 0.604.

• Ilmu pemrograman — Ling-3.1-flash 0.541 pada SciCode, DeepSeek V4.1 Flash (Max) 0.519, GLM 5.3 Flash 0.516.

Pembacaan yang sempit adalah bahwa Ling-3.1-flash kompetitif pada tolok ukur agentik dan sedikit unggul pada SciCode. Pembacaan yang berguna adalah bahwa ia adalah yang terkuat di antara ketiganya pada dua ukuran terminal agentik yang paling sering dimaksud orang ketika mereka berkata "bisakah ia menggerakkan loop alat" — dan ia tertinggal dari keduanya pada ukuran keandalan pengetahuan. Itu adalah bentuk yang spesifik, bukan kemenangan umum, dan hal itu layak disebutkan sebelum ada yang membeli beban kerja hanya berdasarkan angka indeksnya.

Tagihan yang datang dengan model yang lebih besar

Ling-3.0-flash dihargai $0,07 per juta token input dan $0,22 per juta token output di API milik Ant sendiri, dan bobotnya terbuka di bawah MIT. Ling-3.1-flash belum memiliki keduanya. Artificial Analysis mencatat biaya operasionalnya sebesar $0,30 per juta input dan $0,90 per juta output — dengan tarif cache-hit $0,06, diskon 80% dari harga input — diukur terhadap API milik InclusionAI sendiri sebagai penyedia layanan. Itu berarti kenaikan sekitar empat kali lipat harga input dibandingkan model yang digantikannya, untuk kenaikan indeks 21 poin.

Apakah trade-off itu bagus sepenuhnya bergantung pada beban kerja, dan indeks itu sendiri dapat menghitung harganya: menjalankan kesepuluh evaluasi Intelligence Index terhadap Ling-3.1-flash memakan biaya sekitar $960 dengan tarif tersebut, dibandingkan dengan sekitar $477 untuk DeepSeek V4.1 Flash (Max) dan $280 untuk GLM 5.3 Flash. Alasannya bukan hanya daftar tarif. Ling-3.1-flash adalah penalar yang sangat banyak bicara — ia menghabiskan 220 juta token keluaran saat mengolah indeks, jauh di atas median untuk tingkat harganya, dan rata-rata proses evaluasinya sekitar 357 detik per tugas, dibandingkan dengan 285 detik untuk DeepSeek V4.1 Flash (Max) dan 979 detik untuk GLM 5.3 Flash. Secara per tugas, Ling-3.1-flash berbiaya sekitar $0,99, dibandingkan dengan $0,27 milik DeepSeek dan $0,25 milik GLM 5.3 Flash.

Tak satu pun dari ini terlihat dari 41, dan semuanya berakhir di invoice. Sebuah model bisa memenangkan indeks dan kehilangan anggaran.

Dua angka yang bertentangan dengan judul berita

Yang pertama adalah keandalan pengetahuan. Ling-3.1-flash memperoleh +2,22 pada AA-Omniscience, yang mengukur apakah sebuah model tahu apa yang diketahuinya: jawaban benar menghasilkan poin, halusinasi mengurangi poin, dan penolakan tidak memengaruhi poin. Tingkat akurasinya 29,1% dan tingkat halusinasinya 37,9%. Jika disandingkan dengan model-model lain di kelompoknya, itu adalah profil terlemah di grup — GLM 5.3 Flash memperoleh +7,47 dengan tingkat halusinasi 27,6%, dan DeepSeek V4.1 Flash (Max) memperoleh −5,30 dengan tingkat halusinasi yang mencengangkan, yakni 96,5% di antara pertanyaan yang dijawab. Skor komposit memberi penghargaan kepada Ling-3.1-flash atas kemampuan yang ditunjukkannya, bukan atas keandalan saat menunjukkannya, dan model yang mengarang sepertiga dari apa yang diklaimnya memerlukan retrieval di sekitarnya saat digunakan di produksi.

Yang kedua adalah konteks. Artificial Analysis mencantumkan Ling-3.1-flash dengan jendela konteks 1.000.000 token. Materi rilis Ant sendiri juga menyebut 1M sebagai target. Namun, dokumentasi developer Ant, yang merinci jendela keluarga ini model per model, memberi Ling-3.0-flash 256K native yang dapat diperluas hingga 1M dan belum memuat entri untuk Ling-3.1-flash sama sekali. Baris long-context khas yang benar-benar terukur — AA-LCR pada 0,83 — adalah skor penalaran atas konteks panjang, bukan pengukuran jendela yang dilayani. Anggap 1M sebagai batas atas yang dideklarasikan dan validasi jendela yang benar-benar diberikan dengan permintaan konteks panjang Anda sendiri sebelum Anda merancang berdasarkan itu.

Bagaimana perbandingannya di lembar spesifikasi

Gambaran dimensi demi dimensi, subjek terlebih dahulu, pada setiap baris:

• Total parameter — Ling-3.1-flash 560B vs DeepSeek V4.1 Flash (Max) 552B vs GLM 5.3 Flash 320B.

• Parameter yang aktif per token — Ling-3.1-flash 25B vs DeepSeek V4.1 Flash (Max) 16B vs GLM 5.3 Flash 18B. Ling-3.1-flash mengaktifkan paling banyak, yang menjadi salah satu alasan biaya serving-nya berada di posisi itu.

• Bobot dan lisensi — Ling-3.1-flash tidak dipublikasikan (proprietari, tidak ada teks lisensi) vs DeepSeek V4.1 Flash (Max) terbuka di bawah MIT vs GLM 5.3 Flash terbuka di bawah MIT.

• Konteks yang dinyatakan — Ling-3.1-flash 1M vs DeepSeek V4.1 Flash (Max) 1M vs GLM 5.3 1M. Ketiganya mengklaim batas atas yang sama; hanya dua di antaranya yang memiliki checkpoint yang dapat diunduh yang bisa Anda gunakan untuk memverifikasinya.

• Modalitas — Ling-3.1-flash input teks, output teks vs DeepSeek V4.1 Flash (Max) input teks dan gambar vs GLM 5.3 Flash input teks, gambar, dan video. Inilah satu-satunya dimensi di mana Ling-3.1-flash jelas tertinggal, dan tidak ada baris benchmark yang mampu mengompensasinya.

• Harga di API vendor — Ling-3.1-flash $0.30 / $0.90 per juta input / output vs DeepSeek V4.1 Flash (Max) $0.30 / $1.20 vs GLM 5.3 Flash $0.15 / $0.50.

• Skor indeks — 41 vs 39 vs 42. Selisih tiga poin dalam perbandingan tiga arah bukanlah sebuah peringkat; itu adalah seri yang ditentukan oleh evaluasi mana pun yang kebetulan menyerupai beban kerja pembaca.

Di mana Anda dapat menyebutnya

Ling-3.1-flash saat ini tidak ada di katalog OrcaRouter — pencarian pada API model publik kami untuk model di bawah InclusionAI mengembalikan status not-found, dan kami tidak akan menyiratkan sebaliknya. Saat ini model tersebut berjalan pada API milik Ant sendiri dan pada platform pihak ketiga yang menyediakan rilis ini, dan itulah gambaran jujur dari cakupan ketersediaannya. Yang perlu dicatat bagi siapa pun yang membandingkan ketiga model di atas adalah bahwa dua model lainnya dapat dirutekan saat ini: DeepSeek V4.1 Flash dan GLM 5.3 Flash keduanya ada di katalog OrcaRouter pada harga daftar penyedianya tanpa markup, di balik satu kunci API, dengan failover otomatis di antara keduanya. Jika perbandingan di atas menunjukkan bahwa beban kerja Anda lebih mementingkan keandalan pengetahuan daripada pekerjaan terminal agentik, GLM 5.3 Flash adalah yang patut dicoba — dan Anda dapat mencobanya terhadap DeepSeek V4.1 Flash dengan kunci yang sama tanpa kontrak kedua atau satu baris kode klien baru.

Apa yang diubah oleh 41, dan apa yang tidak.

Yang diubahnya adalah kedudukan rilis ini. Ling-3.1-flash bukan lagi spesifikasi dengan grafik vendor yang dilampirkan; ini adalah model dengan posisi yang diukur secara independen, dan posisi itu merupakan lompatan generasi yang sesungguhnya dalam kemampuan agentik dibandingkan Ling-3.0-flash — jenis lompatan yang berasal dari perubahan desain, bukan dari lebih banyak komputasi dengan resep yang sama. Yang tidak diubahnya adalah apa pun terkait pengadaan. Bobotnya masih tertutup, lisensinya masih belum ditulis, modalitasnya masih hanya teks, dan harganya sekitar empat kali lipat pendahulunya untuk peningkatan yang terkonsentrasi pada tugas agen dan terminal.

Jika pekerjaan Anda adalah loop agen, pengoperasian alat, dan rantai alat yang panjang, 41 adalah angka paling berarti yang dirilis tentang model ini sejauh ini dan angka itu layak dicermati secara serius selagi ketersediaannya masih terus meluas. Jika pekerjaan Anda bersifat multimodal, atau tanya jawab yang kritis terhadap pengetahuan, atau inferensi bervolume tinggi yang sensitif terhadap anggaran, 41 tidak menjangkau masalah Anda — dan GLM 5.3 Flash, yang sudah dapat dirutekan dan sudah terbuka di bawah MIT dengan setengah harga output, adalah model yang lebih tepat posisinya di antara ketiganya. Indeks memberi tahu Anda posisi Ling-3.1-flash. Indeks tidak memberi tahu Anda apakah Anda perlu memedulikannya, dan pertanyaan itu dijawab oleh apa yang sedang Anda bangun.

Screenshot of the Artificial Analysis model page for Ling 3.1 Flash, in English, captured 2026-10-07, headed 'Ling 3.1 Flash Intelligence, Performance & Price Analysis' and marked 'Proprietary model' and 'Released October 2026'. The page shows an Intelligence Index of 41, 211 output tokens per second, a cost of $0.99 per Intelligence Index task, 220M output tokens generated across the index, input $0.30 and output $0.90 per 1M tokens with an 80% cache discount, a 1M context window, text input and text output, and the summary line that the model 'scores 41 on the Artificial Analysis Intelligence Index, placing it well above average among comparable models (median: 13)'.Screenshot of the Artificial Analysis model page for Ling 3.0 Flash, in English, captured 2026-10-07, headed 'Ling 3.0 Flash Intelligence, Performance & Price Analysis' and marked 'Open weights model' and 'Released August 2026'. It shows an Intelligence Index of 20, 332 output tokens per second, input $0.075 with an 80% cache discount and output $0.22 per 1M tokens, a 262k context window, and 124B total parameters with 5.1B active parameters.

Dibandingkan dalam artikel ini2

Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari