Kartu hero editorial yang dihasilkan berjudul "Ling-3.1-flash vs Ling-3.0-flash" dengan subjudul "Satu dapat diunduh hari ini. Yang lain adalah kalimat dalam postingan pers." Dua kolom perbandingan: "Ling-3.1-flash (diumumkan)" mencantumkan "~560B total / ~25B aktif", "konteks hingga 1M token" dan "tanpa bobot, tanpa lisensi"; "Ling-3.0-flash (dirilis)" mencantumkan "124B total / 5.1B aktif", "konteks yang dilayani 262,144 token" dan "bobot MIT di Hugging Face".
Guides & Insights

Ling-3.1-flash vs Ling-3.0-flash: Apa yang Sebenarnya Berubah dengan Jendela 1M Token dan 4,5x Parameter

Penulis

Gideon Frost

Tanggal Terbit

Model terbaru · 20Lihat semua model →
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Keluarga Ling milik Ant Group memiliki tier cepat baru, dan kali ini usianya baru satu kalimat. Ling-3.1-flash diumumkan pada 30 September 2026 — sekitar 560 miliar parameter total, sekitar 25 miliar aktif per token, jendela konteks yang dikutip hingga 1 juta token, dan frasa klise yang disertakan: "Kami berencana segera menjadikan model ini open source." Model yang digantikannya di puncak lini cepat, Ling-3.0-flash, sepenuhnya berbeda dalam segala hal: 124 miliar parameter total, 5,1 miliar aktif per token, konteks yang disajikan 262.144 token, bobot berlisensi MIT di Hugging Face sejak 7 Agustus, dan Artificial Analysis Intelligence Index independen sebesar 20. Salah satu model ini bisa Anda unduh hari ini. Model lainnya hanya bisa Anda baca informasinya. Membandingkan keduanya benar-benar berguna, tetapi hanya jika perbandingannya dimulai dari sana.

Aritmetika di judulnya mudah dan sedikit menyesatkan. Ling-3.1-flash memiliki jumlah parameter total sekitar 4,5× Ling-3.0-flash dan jumlah parameter aktif sekitar 4,9× — 25B versus 5,1B per token. Pembacaan sekilas mengatakan "model jauh lebih besar, berarti model jauh lebih pintar." Pembacaan yang lebih cermat adalah bahwa Ant secara kasar mempertahankan rasio sparsitas sambil menskalakan bodinya, dan yang Anda dapatkan dari itu adalah kapasitas, belum tentu kedalaman penalaran per token: model yang merutekan 25B dari 560B miliknya melalui setiap token melakukan lebih banyak kerja per token daripada model yang merutekan 5,1B, tetapi model itu juga membayar sekitar lima kali komputasi per token untuk melakukannya. Ke mana pertukaran itu bermuara sepenuhnya bergantung pada apakah arsitektur Ant menangani parameter tambahan secara efisien — dan itu pertanyaan yang tidak dijawab oleh pengumuman tersebut.

Kedua model itu, berdampingan

Letakkan fakta-fakta yang telah dipublikasikan secara bersebelahan dan pisahkan generasinya dengan rapi. Setiap baris di bawah ini menyatakan apa yang sebenarnya telah dipublikasikan oleh Ant atau evaluator independen; jika suatu angka tidak ada, angka itu tidak ada karena belum ada yang mempublikasikannya.

• Total parameter — Ling-3.1-flash: ~560B (vendor). Ling-3.0-flash: 124B (kartu model).

• Parameter aktif per token — Ling-3.1-flash: ~25B (vendor). Ling-3.0-flash: 5.1B (kartu model).

• Jendela konteks — Ling-3.1-flash: hingga 1 juta token (vendor). Ling-3.0-flash: 256K native, disajikan pada 262.144 (kartu model dan resep inferensi).

• Bobot dan lisensi — Ling-3.1-flash: tidak dipublikasikan; tidak ada repositori, tidak ada lisensi (diperiksa pada 30 September dan sekali lagi pada 1 Oktober 2026). Ling-3.0-flash: MIT, di Hugging Face sebagai inclusionAI/Ling-3.0-flash dan di ModelScope sejak 7 Agustus 2026.

• Format bobot — Ling-3.1-flash: tidak tersedia. Ling-3.0-flash: BF16 (~255GB) dan FP8 (~128GB) dari lab, ditambah kuantisasi komunitas.

• Asal-usul benchmark — Ling-3.1-flash: sepenuhnya dilaporkan vendor, tidak ada harness publik, tidak ada bobot untuk dijalankan ulang. Ling-3.0-flash: dinilai secara independen oleh Artificial Analysis pada Intelligence Index 20, dengan kecepatan output terukur dan volume pembangkitan token yang dipublikasikan bersama.

• Ketersediaan — Ling-3.1-flash: hanya produk Ling Studio milik Ant sendiri. Ling-3.0-flash: dapat dihosting sendiri, plus dapat dipanggil melalui API pengembang Ant.

Headless capture of the Artificial Analysis model page for Ling 3.0 Flash. The page shows the model's stat strip with text input and text output, a 262k-token context window, 5.1B active parameters, and a written summary stating that Ling 3.0 Flash scores 20 on the Artificial Analysis Intelligence Index against a median of 8, generated 260M tokens during evaluation, is priced at $0.07 per 1M input tokens and $0.22 per 1M output tokens, and runs at 325 tokens per second.

Untuk apa kemungkinan kapasitas tambahan itu digunakan

Deskripsi satu baris milik Ant sendiri tentang Ling-3.1-flash adalah hal yang paling informatif dalam rilis ini. Aplikasi Ling Studio memasarkannya untuk "agen serbaguna, pencarian, pekerjaan kantor rutin, dan pengembangan perangkat lunak/kode" — pembingkaian pekerjaan kantor dan agentik, bukan pembingkaian tolok ukur penalaran. Itu konsisten dengan cara keluarga ini diorganisasi: Ling adalah lini teks-dan-alat serbaguna, Ring adalah lini penalaran, dan Ming menangani multimodal. Ling-3.0-flash menempati slot yang sama satu generasi sebelumnya, dan secara eksplisit merupakan tier cepat dan murah, bukan produk andalan.

Baca peningkatan skala itu dalam konteks tersebut dan itu masuk akal. Beban kerja agentik dan pemanggilan alat bersifat panjang, repetitif, dan haus konteks: satu loop agen dapat membakar puluhan ribu token keluaran alat yang terakumulasi sebelum ia mengambil tindakan, jadi jendela 1M token adalah kebutuhan fungsional, bukan hiasan lembar spesifikasi. Meningkatkan skala jumlah parameter total sambil mempertahankan fraksi aktif yang besar adalah cara Anda menambahkan pengetahuan dunia dan kedalaman dalam mengikuti instruksi ke model yang tetap harus cukup cepat untuk berada di dalam sebuah loop. Ant tidak sedang membangun flagship yang lebih lambat dan lebih pintar di sini; ia sedang membangun tier cepat yang lebih besar.

Argumen tandingannya adalah biaya, dan itu adalah aritmetika yang sama yang datang dari arah berlawanan. Kapasitas tambahan tidak gratis saat inferensi — biaya itu dibayar pada setiap token, dan Ant sama sekali belum menerbitkan harga untuk Ling-3.1-flash: tidak ada daftar tarif API, tidak ada diskon cache, tidak ada yang sebanding dengan $0.075/$0.22 per juta token yang dicantumkan generasi sebelumnya. Itulah angka yang hilang yang akan menentukan perbandingan ini, dan angka itu memang tidak ada.

Benchmark, dan siapa yang menjalankannya

Ling-3.1-flash hadir dengan tiga skor yang tampak kuat secara terpisah: 1.673 Elo pada GDPVal-AA v2.1, 75,16 pada FrontierSWE, dan 65,35 pada HealthBench Professional. Ketiganya milik Ant sendiri, diambil dari pengumuman, dan tidak ada satu pun yang telah direproduksi oleh lab eksternal. Konsekuensi praktisnya adalah skor-skor tersebut dapat dibandingkan dengan angka vendor lain tetapi tidak dengan angka independen — dan Indeks Kecerdasan 20 poin Artificial Analysis untuk Ling-3.0-flash adalah angka independen pada skala yang berbeda, sehingga menempatkan keduanya berdampingan berarti membandingkan pengukuran dengan klaim. Tidak ada halaman Ling-3.1-flash di Artificial Analysis pada saat penulisan ini.

Satu catatan kaki pada grafik Ant sendiri layak ditandai dengan sendirinya. Kartu tersebut menyatakan bahwa hasil HealthBench Professional dievaluasi dalam "lingkungan AQ" dan bahwa kemampuan kesehatan Ling-3.1-flash saat ini hanya dapat dialami di AQ. Tidak ada dokumentasi publik yang menjelaskan apa itu AQ. Skor utama yang membawa kualifikasi lingkungan tanpa nama bukanlah sesuatu yang dapat direproduksi oleh tim luar, bahkan setelah bobotnya tersedia.

Mau pakai yang mana sebenarnya minggu ini

Pertanyaan antargenerasi ini terjawab secara berbeda-beda, tergantung pada apa yang Anda butuhkan hari ini, dan bagi hampir semua orang, jawaban saat ini bukanlah model yang lebih baru.

Jika Anda perlu menjalankan sesuatu minggu ini, Ling-3.0-flash adalah satu-satunya dari keduanya yang tersedia dalam bentuk yang dapat digunakan: bobot MIT yang dapat Anda host sendiri, FP8 jika Anda menginginkan jejak yang lebih kecil, harga API pihak pertama yang dipublikasikan, dan skor independen yang memberi tahu Anda apa yang Anda dapatkan. Ini adalah model yang benar-benar bagus di tingkatannya — evaluasi independen menempatkannya di frontier Pareto open-weights untuk kecerdasan terhadap total parameter, dan menilai kecepatannya dengan tinggi, dengan catatan bahwa model ini luar biasa bertele-tele dan menghasilkan sekitar 260M token selama dievaluasi, dibandingkan median mendekati 100M.

Jika Anda merencanakan untuk enam bulan ke depan, Ling-3.1-flash adalah arah yang dituju dan belum menjadi komponen. Hal-hal spesifik yang perlu diperhatikan sebelum ia menjadi komponen: apakah bobotnya benar-benar dibuka dan di bawah lisensi apa, apakah jendela yang dilayani benar-benar 1M atau perpanjangan dari konteks native yang lebih pendek, berapa biayanya per juta token, dan apakah laboratorium independen mereproduksi 75.16 pada FrontierSWE. Jika salah satu dari hal-hal itu terwujud, itu akan menjadi alasan untuk menjalankan ulang perbandingan. Belum ada yang terwujud.

Ant Group's own Ling-3.1-flash benchmark card, published 30 September 2026. Bar-chart panels cover GDPval-AA v2.1 (1,673 Elo for Ling-3.1-flash), tau-Banking, SkillsBench, Automationbench, Terminal-Bench 4.0, CyberGym, FrontierSWE (75.16), SWE Atlas Codebase QnA, Finance Agent v2, HealthBench Professional (65.35), DRACO and MultiChallenge, with GPT-5.6 Sol, Claude Opus 5, Kimi K3, GLM 5.3, GLM 5.3 Flash and DeepSeek-V4.1-Flash as the comparison set. A footnote states HealthBench Professional was evaluated in the AQ environment.

Di mana ini cocok dalam routing stack

Tidak ada model Ling yang ada di katalog kami hari ini — Ling-3.0-flash, Ling-3.0-flash-VL, dan Ling-3.1-flash semuanya mengembalikan not-found terhadap API model OrcaRouter, jadi jawaban jujur untuk "bisakah saya memanggilnya melalui kalian" adalah tidak, untuk saat ini. Yang sebenarnya menjadi keunggulan lapisan routing pada minggu seperti ini adalah separuh masalah lainnya: model-model yang akan Anda gunakan sebagai pembanding bagi kandidat. Claude Opus 5, GPT-5.6 Sol, dan DeepSeek-V4.1-Flash semuanya adalah rute aktif dengan harga daftar penyedia tanpa markup, dan router yang menampung semuanya di balik satu kunci dengan failover otomatis adalah cara Anda menjaga harness evaluasi tetap mengarah ke target yang bergerak tanpa harus memelihara empat integrasi. Ketika bobot Ling-3.1-flash sudah tersedia dan lisensinya bisa dibaca, itulah juga bentuk keputusannya: tambahkan satu endpoint, bukan bangun ulang seluruh stack.

Ringkasan generasionalnya singkat. Ling-3.0-flash adalah model yang sudah dirilis, dinilai secara independen, berlisensi permisif, dan dapat di-hosting sendiri saat ini. Ling-3.1-flash adalah janji yang lebih besar, berkonteks lebih panjang, dan lebih mahal untuk dijalankan yang belum Ant wujudkan dalam bentuk apa pun yang dapat digunakan pengembang. Menganggap yang kedua sebagai peningkatan atas yang pertama adalah kesalahan yang diundang oleh rilis ini, dan angka-angkanya belum mendukungnya.

Generated two-lane information card. Top lane headed "Independently measured" holds "Ling-3.0-flash — AA Intelligence Index 20 (v4.3)" and "Ling-3.0-flash — 325 tokens/sec, 260M tokens generated". Bottom lane headed "Vendor-reported only" holds "Ling-3.1-flash — 1,673 Elo GDPval-AA v2.1", "Ling-3.1-flash — 75.16 FrontierSWE" and "Ling-3.1-flash — 65.35 HealthBench Professional (AQ environment, undefined)".