
Ling-3.1-flash vs Ling-3.0-flash: Apa yang Sebenarnya Berubah dengan Jendela 1M Token dan 4,5x Parameter
- typesafeBARUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 262 tok/s
- OpenAIBARUOpenAI: GPT-6 Luna2026-09-2237Kecerdasan
- OpenAIBARUOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- AnthropicBARUAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- xAIBARUGrok 4.72026-09-2146Kecerdasan
- OrcaBARUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 juta token · 114 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 969 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 juta token · 49 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 219 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- xAISpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
Keluarga Ling milik Ant Group memiliki tier cepat baru, dan kali ini usianya baru satu kalimat. Ling-3.1-flash diumumkan pada 30 September 2026 — sekitar 560 miliar parameter total, sekitar 25 miliar aktif per token, jendela konteks yang dikutip hingga 1 juta token, dan frasa klise yang disertakan: "Kami berencana segera menjadikan model ini open source." Model yang digantikannya di puncak lini cepat, Ling-3.0-flash, sepenuhnya berbeda dalam segala hal: 124 miliar parameter total, 5,1 miliar aktif per token, konteks yang disajikan 262.144 token, bobot berlisensi MIT di Hugging Face sejak 7 Agustus, dan Artificial Analysis Intelligence Index independen sebesar 20. Salah satu model ini bisa Anda unduh hari ini. Model lainnya hanya bisa Anda baca informasinya. Membandingkan keduanya benar-benar berguna, tetapi hanya jika perbandingannya dimulai dari sana.
Aritmetika di judulnya mudah dan sedikit menyesatkan. Ling-3.1-flash memiliki jumlah parameter total sekitar 4,5× Ling-3.0-flash dan jumlah parameter aktif sekitar 4,9× — 25B versus 5,1B per token. Pembacaan sekilas mengatakan "model jauh lebih besar, berarti model jauh lebih pintar." Pembacaan yang lebih cermat adalah bahwa Ant secara kasar mempertahankan rasio sparsitas sambil menskalakan bodinya, dan yang Anda dapatkan dari itu adalah kapasitas, belum tentu kedalaman penalaran per token: model yang merutekan 25B dari 560B miliknya melalui setiap token melakukan lebih banyak kerja per token daripada model yang merutekan 5,1B, tetapi model itu juga membayar sekitar lima kali komputasi per token untuk melakukannya. Ke mana pertukaran itu bermuara sepenuhnya bergantung pada apakah arsitektur Ant menangani parameter tambahan secara efisien — dan itu pertanyaan yang tidak dijawab oleh pengumuman tersebut.
Kedua model itu, berdampingan
Letakkan fakta-fakta yang telah dipublikasikan secara bersebelahan dan pisahkan generasinya dengan rapi. Setiap baris di bawah ini menyatakan apa yang sebenarnya telah dipublikasikan oleh Ant atau evaluator independen; jika suatu angka tidak ada, angka itu tidak ada karena belum ada yang mempublikasikannya.
• Total parameter — Ling-3.1-flash: ~560B (vendor). Ling-3.0-flash: 124B (kartu model).
• Parameter aktif per token — Ling-3.1-flash: ~25B (vendor). Ling-3.0-flash: 5.1B (kartu model).
• Jendela konteks — Ling-3.1-flash: hingga 1 juta token (vendor). Ling-3.0-flash: 256K native, disajikan pada 262.144 (kartu model dan resep inferensi).
• Bobot dan lisensi — Ling-3.1-flash: tidak dipublikasikan; tidak ada repositori, tidak ada lisensi (diperiksa pada 30 September dan sekali lagi pada 1 Oktober 2026). Ling-3.0-flash: MIT, di Hugging Face sebagai inclusionAI/Ling-3.0-flash dan di ModelScope sejak 7 Agustus 2026.
• Format bobot — Ling-3.1-flash: tidak tersedia. Ling-3.0-flash: BF16 (~255GB) dan FP8 (~128GB) dari lab, ditambah kuantisasi komunitas.
• Asal-usul benchmark — Ling-3.1-flash: sepenuhnya dilaporkan vendor, tidak ada harness publik, tidak ada bobot untuk dijalankan ulang. Ling-3.0-flash: dinilai secara independen oleh Artificial Analysis pada Intelligence Index 20, dengan kecepatan output terukur dan volume pembangkitan token yang dipublikasikan bersama.
• Ketersediaan — Ling-3.1-flash: hanya produk Ling Studio milik Ant sendiri. Ling-3.0-flash: dapat dihosting sendiri, plus dapat dipanggil melalui API pengembang Ant.

Untuk apa kemungkinan kapasitas tambahan itu digunakan
Deskripsi satu baris milik Ant sendiri tentang Ling-3.1-flash adalah hal yang paling informatif dalam rilis ini. Aplikasi Ling Studio memasarkannya untuk "agen serbaguna, pencarian, pekerjaan kantor rutin, dan pengembangan perangkat lunak/kode" — pembingkaian pekerjaan kantor dan agentik, bukan pembingkaian tolok ukur penalaran. Itu konsisten dengan cara keluarga ini diorganisasi: Ling adalah lini teks-dan-alat serbaguna, Ring adalah lini penalaran, dan Ming menangani multimodal. Ling-3.0-flash menempati slot yang sama satu generasi sebelumnya, dan secara eksplisit merupakan tier cepat dan murah, bukan produk andalan.
Baca peningkatan skala itu dalam konteks tersebut dan itu masuk akal. Beban kerja agentik dan pemanggilan alat bersifat panjang, repetitif, dan haus konteks: satu loop agen dapat membakar puluhan ribu token keluaran alat yang terakumulasi sebelum ia mengambil tindakan, jadi jendela 1M token adalah kebutuhan fungsional, bukan hiasan lembar spesifikasi. Meningkatkan skala jumlah parameter total sambil mempertahankan fraksi aktif yang besar adalah cara Anda menambahkan pengetahuan dunia dan kedalaman dalam mengikuti instruksi ke model yang tetap harus cukup cepat untuk berada di dalam sebuah loop. Ant tidak sedang membangun flagship yang lebih lambat dan lebih pintar di sini; ia sedang membangun tier cepat yang lebih besar.
Argumen tandingannya adalah biaya, dan itu adalah aritmetika yang sama yang datang dari arah berlawanan. Kapasitas tambahan tidak gratis saat inferensi — biaya itu dibayar pada setiap token, dan Ant sama sekali belum menerbitkan harga untuk Ling-3.1-flash: tidak ada daftar tarif API, tidak ada diskon cache, tidak ada yang sebanding dengan $0.075/$0.22 per juta token yang dicantumkan generasi sebelumnya. Itulah angka yang hilang yang akan menentukan perbandingan ini, dan angka itu memang tidak ada.
Benchmark, dan siapa yang menjalankannya
Ling-3.1-flash hadir dengan tiga skor yang tampak kuat secara terpisah: 1.673 Elo pada GDPVal-AA v2.1, 75,16 pada FrontierSWE, dan 65,35 pada HealthBench Professional. Ketiganya milik Ant sendiri, diambil dari pengumuman, dan tidak ada satu pun yang telah direproduksi oleh lab eksternal. Konsekuensi praktisnya adalah skor-skor tersebut dapat dibandingkan dengan angka vendor lain tetapi tidak dengan angka independen — dan Indeks Kecerdasan 20 poin Artificial Analysis untuk Ling-3.0-flash adalah angka independen pada skala yang berbeda, sehingga menempatkan keduanya berdampingan berarti membandingkan pengukuran dengan klaim. Tidak ada halaman Ling-3.1-flash di Artificial Analysis pada saat penulisan ini.
Satu catatan kaki pada grafik Ant sendiri layak ditandai dengan sendirinya. Kartu tersebut menyatakan bahwa hasil HealthBench Professional dievaluasi dalam "lingkungan AQ" dan bahwa kemampuan kesehatan Ling-3.1-flash saat ini hanya dapat dialami di AQ. Tidak ada dokumentasi publik yang menjelaskan apa itu AQ. Skor utama yang membawa kualifikasi lingkungan tanpa nama bukanlah sesuatu yang dapat direproduksi oleh tim luar, bahkan setelah bobotnya tersedia.
Mau pakai yang mana sebenarnya minggu ini
Pertanyaan antargenerasi ini terjawab secara berbeda-beda, tergantung pada apa yang Anda butuhkan hari ini, dan bagi hampir semua orang, jawaban saat ini bukanlah model yang lebih baru.
Jika Anda perlu menjalankan sesuatu minggu ini, Ling-3.0-flash adalah satu-satunya dari keduanya yang tersedia dalam bentuk yang dapat digunakan: bobot MIT yang dapat Anda host sendiri, FP8 jika Anda menginginkan jejak yang lebih kecil, harga API pihak pertama yang dipublikasikan, dan skor independen yang memberi tahu Anda apa yang Anda dapatkan. Ini adalah model yang benar-benar bagus di tingkatannya — evaluasi independen menempatkannya di frontier Pareto open-weights untuk kecerdasan terhadap total parameter, dan menilai kecepatannya dengan tinggi, dengan catatan bahwa model ini luar biasa bertele-tele dan menghasilkan sekitar 260M token selama dievaluasi, dibandingkan median mendekati 100M.
Jika Anda merencanakan untuk enam bulan ke depan, Ling-3.1-flash adalah arah yang dituju dan belum menjadi komponen. Hal-hal spesifik yang perlu diperhatikan sebelum ia menjadi komponen: apakah bobotnya benar-benar dibuka dan di bawah lisensi apa, apakah jendela yang dilayani benar-benar 1M atau perpanjangan dari konteks native yang lebih pendek, berapa biayanya per juta token, dan apakah laboratorium independen mereproduksi 75.16 pada FrontierSWE. Jika salah satu dari hal-hal itu terwujud, itu akan menjadi alasan untuk menjalankan ulang perbandingan. Belum ada yang terwujud.

Di mana ini cocok dalam routing stack
Tidak ada model Ling yang ada di katalog kami hari ini — Ling-3.0-flash, Ling-3.0-flash-VL, dan Ling-3.1-flash semuanya mengembalikan not-found terhadap API model OrcaRouter, jadi jawaban jujur untuk "bisakah saya memanggilnya melalui kalian" adalah tidak, untuk saat ini. Yang sebenarnya menjadi keunggulan lapisan routing pada minggu seperti ini adalah separuh masalah lainnya: model-model yang akan Anda gunakan sebagai pembanding bagi kandidat. Claude Opus 5, GPT-5.6 Sol, dan DeepSeek-V4.1-Flash semuanya adalah rute aktif dengan harga daftar penyedia tanpa markup, dan router yang menampung semuanya di balik satu kunci dengan failover otomatis adalah cara Anda menjaga harness evaluasi tetap mengarah ke target yang bergerak tanpa harus memelihara empat integrasi. Ketika bobot Ling-3.1-flash sudah tersedia dan lisensinya bisa dibaca, itulah juga bentuk keputusannya: tambahkan satu endpoint, bukan bangun ulang seluruh stack.
Ringkasan generasionalnya singkat. Ling-3.0-flash adalah model yang sudah dirilis, dinilai secara independen, berlisensi permisif, dan dapat di-hosting sendiri saat ini. Ling-3.1-flash adalah janji yang lebih besar, berkonteks lebih panjang, dan lebih mahal untuk dijalankan yang belum Ant wujudkan dalam bentuk apa pun yang dapat digunakan pengembang. Menganggap yang kedua sebagai peningkatan atas yang pertama adalah kesalahan yang diundang oleh rilis ini, dan angka-angkanya belum mendukungnya.

