Ling-3.0-flash: Apa yang Sekarang Kita Ketahui tentang Open-Weight Fast-Tier MoE Milik Ant Group
Guides & Insights

Ling-3.0-flash: Apa yang Sekarang Kita Ketahui tentang Open-Weight Fast-Tier MoE Milik Ant Group

Penulis

Rowan Sterling

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Laboratorium InclusionAI milik Ant Group telah resmi merilis Ling-3.0-flash — diumumkan pada 24 Juli 2026, dan bersumber terbuka di bawah lisensi MIT pada 7 Agustus — dan kondisinya telah banyak berubah sejak pratinjau yang kami terbitkan di sini pada bulan Juli. Ini adalah model mixture-of-experts dengan penalaran hibrida asli yang memiliki total 124B parameter dan hanya 5,1B aktif per token, dibangun sebagai tingkatan cepat dan murah dari keluarga Ling. Dua angka yang mengubah segalanya: Artificial Analysis kini memberinya skor 38 pada Intelligence Index (naik 24 poin dari generasi tingkatan cepat sebelumnya, Ling-2.6-flash) dan menempatkannya di frontier Pareto bobot terbuka untuk kecerdasan versus total parameter. Bobot tersedia di Hugging Face dan ModelScope.

Saat pertama kali kami membahas model ini pada 24 Juli, ringkasan yang jujur adalah: hanya API, tanpa bobot, tanpa pernyataan lisensi, tanpa benchmark independen. Keempat pernyataan tersebut kini sudah usang. Ant merilis bobot modelnya sebagai open source di bawah lisensi MIT pada 7 Agustus, dan Artificial Analysis sejak itu telah menerbitkan evaluasi independen yang lengkap. Pembaruan ini merevisi ringkasan awal sebagaimana mestinya — label “belum terverifikasi” yang mendominasi pos Juli kini berlaku untuk sekumpulan klaim yang jauh lebih sempit, terutama angka kecepatan puncak Ant, bukan untuk model secara keseluruhan.

TL;DR.Ling-3.0-flash adalah MoE bobot terbuka tingkat cepat milik Ant Group: total 124B / 5.1B aktif, lisensi MIT, konteks native 256K (262K saat disajikan). Artificial Analysis memberinya Intelligence Index sebesar 38 — naik 24 poin dari Ling-2.6-flash generasi sebelumnya dan berada di frontier Pareto model bobot terbuka untuk kecerdasan vs total parameter — dengan output terukur sekitar 368 token/detik. Bobotnya tersedia di Hugging Face dan ModelScope dengan lisensi MIT. Masih hanya dari vendor: klaim throughput puncak 1.100+ token/detik, angka time-to-first-token di bawah 100ms, dan tabel benchmark pada kartu model. Harga API first-party adalah $0.075 input / $0.22 output per 1 juta token (diskon 80% untuk cache hit); tingkatan gratis saat peluncuran berakhir pada 3 Agustus.

Poin-poin penting

• Ini adalah tingkatan cepat/murah, bukan flagship-nya. Flagship 1T-parameter generasi sebelumnya tetap menjadi model terbesar InclusionAI; Ling-3.0-flash adalah saudara yang lebih kecil dan lebih cepat yang ditujukan untuk teks volume tinggi dan pemanggilan alat.

• Bobot kini terbuka di bawah lisensi MIT. Bobot-bobot tersebut tersedia di Hugging Face (inclusionAI/Ling-3.0-flash) dan ModelScope pada 7 Agustus di bawah lisensi MIT — kebalikan dari gambaran "hanya-API" di bulan Juli.

• Akhirnya model ini memiliki skor independen. Artificial Analysis mengukur Indeks Intelijen 38, naik 24 dari Ling-2.6-flash, dan menempatkan model tersebut pada frontier Pareto bobot terbuka untuk intelijen versus total parameter.

• Kecepatan kini sebagian sudah terukur. AA mencatat sekitar 368 token/detik output dan ~1,98 detik waktu ke token pertama; angka puncak 1.100+ token/detik yang digembar-gemborkan Ant masih hanya berasal dari vendor.

• Harga telah ditetapkan, dan peluncuran gratis telah berakhir. API pihak pertama mencantumkan $0.075 masuk / $0.22 keluar per 1 juta token dengan diskon cache-hit 80%; tingkatan gratis peluncuran berakhir pada 3 Agustus.

• Ini adalah satu bagian dari keluarga tiga model. InclusionAI membagi lini produknya menjadi Ling (MoE tujuan umum untuk teks dan alat, model ini), Ring (penalaran), dan Ming (multimodal).

Catatan tentang cara membaca pembaruan ini: ini adalah revisi dari pratinjau 24 Juli, ditulis setelah bobotnya menjadi terbuka dan skor independen pertama muncul. Setiap spesifikasi, tolok ukur, dan harga di bawah ini diberi label berdasarkan sumber. Jika Ant Group adalah satu-satunya sumber — klaim kecepatan puncak dan tabel tolok ukur kartu model — kami menyatakannya dengan terus terang. Jika Artificial Analysis telah mengukur sesuatu secara independen, kami mengutipnya.

Apa yang sebenarnya kita ketahui

Arsitekturnya kini didokumentasikan secara lengkap di kartu model. Ling-3.0-flash menggunakan tumpukan perhatian hybrid-linear native — lapisan Kimi Delta Attention (KDA) dan Gated MLA yang berselang-seling dengan rasio 5:1 (35 KDA + 7 MLA), dengan gating diagonal berbutir halus pada KDA — di atas MoE sparse 1/64 (512 pakar yang dirutekan, 8 yang diaktifkan per token). Dengan begitu, ia mencapai total 124B parameter dengan hanya 5.1B yang aktif. Jendela konteksnya 256K secara native, disajikan pada 262.144 token dalam resep inferensi, dan Ant mengklaim arsitektur ini dapat diskalakan hingga 1M. Panjang output maksimum tidak diungkapkan. Model ini hanya teks dengan dukungan pemanggilan alat; input multimodal berada di lini Ming yang terpisah.

Dua format bobot dipublikasikan oleh laboratorium tersebut — BF16 (sekitar 255GB) dan FP8 (sekitar 128GB) — dan varian kuantisasi komunitas sudah ditautkan dari kartu model. Resep deployment milik laboratorium itu sendiri menargetkan SGLang dan vLLM.

Ketersediaan: bobot terbuka di bawah lisensi MIT

Pada tanggal 7 Agustus, tim InclusionAI dari Ant Group merilis bobot model secara open-source dengan lisensi MIT di Hugging Face (inclusionAI/Ling-3.0-flash) dan ModelScope. Lisensi tersebut bersifat permisif dan dapat digunakan secara komersial — sama seperti lisensi yang digunakan untuk Ling 2.0 dan Ling 2.6 — serta berarti Anda dapat meng-host sendiri, melakukan fine-tune, dan men-deploy Ling-3.0-flash secara mandiri, alih-alih menyewanya melalui API. Model ini juga dapat dipanggil melalui API developer Ant sendiri dan beberapa platform pihak ketiga. Untuk model tingkat cepat dengan harga seperti ini, pertanyaan yang lebih menarik adalah apakah akan meng-host sendiri (FP8 berjalan di sekitar 128GB) atau tetap menggunakan API.

Skor independen: Indeks Intelijen AA sebesar 38.

Perubahan terbesar dari postingan Juli adalah bahwa angka independen kini ada. Artificial Analysis memiliki halaman untuk Ling-3.0-flash dan mengukurnya pada 38 di Intelligence Index — 24 poin di atas generasi fast-tier sebelumnya, Ling-2.6-flash (14), dan sejajar dengan MiMo-V2.5 dan Qwen 3.6 27B sambil mengaktifkan sebagian kecil dari parameter mereka. Artificial Analysis juga menempatkan model tersebut pada frontier Pareto bobot terbuka untuk kecerdasan versus total parameter: tidak ada model bobot terbuka dengan total parameter lebih sedikit yang mencetak skor lebih tinggi. Pemimpin fast-tier bobot terbuka di AA, DeepSeek V4 Flash, masih mencetak skor lebih tinggi (Index 52 pada usaha penalaran maksimum).

Hasil agenik dan konteks panjang juga menunjukkan arah yang kuat. Pada rangkaian τ3-Bench Banking milik AA, Ling-3.0-flash mencetak skor 27%, menempati posisi kedua di antara model open-weights kelas flash di belakang DeepSeek V4 Flash (39%). Pada GDPval-AA v2, ia mencapai Elo 1108, naik dari 545 untuk Ling-2.6-flash. Ant melatih model ini di lebih dari 10.000 lingkungan interaktif (dilaporkan vendor) dan memposisikannya sebagai simpul eksekusi untuk alur kerja agen — cepat, murah, dan sekali pakai, dengan penalaran berat diserahkan ke flagship yang lebih besar.

Satu catatan tentang sumber: tabel tolok ukur pada kartu model Ant — SWE-Bench Pro 56.6, SWE-bench Multilingual 72.4, MathArena AIME 2026 93.2, HLE 22.7 — dilaporkan oleh vendor dan belum direproduksi secara independen. Anggap saja sebagai klaim lab itu sendiri, dalam kategori yang sama dengan angka kecepatan puncak di bawah ini.

Kecepatan: diukur, lalu diklaim

Kisah kecepatan kini menjadi dua kisah yang berbeda. Secara independen, Artificial Analysis mengukur output sekitar 368 token/detik dan time-to-first-token ~1,98 detik pada API pihak pertama — benar-benar cepat untuk MoE dengan 5,1B aktif, dan cukup untuk menempatkan model di dekat puncak kelasnya dalam hal kecepatan. Sementara itu, Ant Group mengklaim rata-rata output di atas 1.100 token/detik pada konfigurasi GPU tertentu dan time-to-first-token di bawah 100ms dengan lapisan cache hierarkis tingkat klaster yang dibangun di atas SGLang HiCache dan Mooncake. Angka yang kedua itu hanya berasal dari vendor — diukur pada perangkat keras dan pengaturan batch yang dikendalikan Ant, tanpa publikasi pengujian ulang independen. Untuk perencanaan, gunakan angka AA; anggap 1.100+ tok/s sebagai batas pemasaran yang perlu diverifikasi pada beban kerja Anda sendiri.

Harga: murah, dan promonya sudah berakhir.

Artificial Analysis mencantumkan API pihak pertama sebesar $0.075 per 1 juta token input dan $0.22 per 1 juta output, dengan cache hits sebesar $0.015 (−80%) — semua harga ditetapkan oleh vendor. Tingkat gratis peluncuran (500 ribu token gratis/hari, akses API gratis) berakhir pada 3 Agustus, dan Ant mengadakan periode diskon 75% sementara untuk Ling Studio hingga 31 Agustus 2026, setelah itu harga daftar berlaku. Bahkan pada harga daftar penuh, $0.075/$0.22 menempatkan Ling-3.0-flash dengan kuat di kelas murah untuk model dengan Indeks 38.

Pada harga serendah ini, biaya peralihan lebih penting daripada harga per token. OrcaRouter ada untuk membuat peralihan itu murah: satu API untuk 200+ model, harga daftar penyedia diteruskan dengan markup 0%, dan failover otomatis di seluruh penyedia — jadi ketika model yang baru dibuka seperti ini terlihat bagus di atas kertas, Anda dapat mengujinya terhadap beban kerja nyata tanpa kontrak kedua, dan beralih kembali ke model yang berbeda dengan kunci yang sama jika model tersebut kurang memenuhi harapan pada tugas tertentu.

Keluarga Ling / Ring / Ming

Ling-3.0-flash tidak ada dalam isolasi — InclusionAI mengorganisasi rilisnya ke dalam tiga keluarga bernama, masing-masing ditujukan untuk tugas yang berbeda. Ling adalah lini MoE tujuan umum untuk pembuatan teks sehari-hari dan pemanggilan alat, dan Ling-3.0-flash berada di ujung cepat/murah, satu tingkat di bawah unggulan 1T-parameter generasi sebelumnya. Ring adalah lini yang berfokus pada penalaran, dibangun untuk rantai pemikiran multi-langkah. Ming adalah lini multimodal. Jika tugas Anda memerlukan penalaran yang lebih berat atau input gambar, model InclusionAI yang tepat mungkin bukan Ling-3.0-flash — ia dibangun untuk volume dan kecepatan dalam jalur teks-dan-alat.

Untuk siapa: tiga skenario

1. Pipeline teks atau pemanggilan alat yang bervolume tinggi dan sensitif terhadap latensi

Ini adalah kandang model ini. Dengan Index independen 38, lisensi MIT, dan kecepatan terukur sekitar 368 tok/s, taruhan tingkat cepat kini dapat diuji alih-alih sekadar hipotetis — Anda dapat menjalankan set evaluasi Anda sendiri padanya, atau mengunduh bobotnya dan meng-host sendiri. Hanya saja, jangan membangun di sekitar batas atas 1.100+ tok/s dari vendor sebelum Anda mengukurnya pada beban kerja Anda.

2. Tim yang menginginkan konteks panjang dengan anggaran terbatas

Konteks native 256K (262K yang disajikan) dengan jalur yang dinyatakan menuju 1M, pada harga $0,075/$0,22, merupakan kombinasi yang menarik untuk pekerjaan yang sarat retrieval atau pemrosesan dokumen. Angka konteks panjang pada kartu model dilaporkan oleh vendor, jadi masukkan ke daftar pendek bersama opsi konteks panjang yang mapan dan verifikasi pada korpus Anda sendiri sebelum berkomitmen.

3. Pengamat yang memantau lanskap MoE China dan peta jalan InclusionAI

Pertanyaan bulan Juli — apakah InclusionAI akan tetap terbuka? — kini telah terjawab: ya, MIT, dan cepat. Kehadiran Ling-3.0-flash di frontier Pareto AA dengan 5,1 miliar parameter aktif menjadi titik data bagi siapa pun yang memantau bagaimana lab-lab Tiongkok bersaing dalam hal efisiensi, bukan jumlah parameter mentah.

Apa yang masih belum terverifikasi

Daftar singkat, sekarang setelah kesenjangan besar telah ditutup. Klaim kecepatan puncak vendor (1.100+ tok/s, TTFT di bawah 100ms) tidak memiliki pengukuran ulang independen. Tabel benchmark pada model-card dilaporkan oleh vendor. Varian FP4/INT4 dan jalur deployment single-DGX-Spark dinyatakan oleh vendor. Dan soal pengetahuan, Omniscience Index milik AA menunjukkan bahwa peningkatan dibandingkan generasi sebelumnya sebagian besar berasal dari abstensi — halusinasi turun (97% → 44%) sementara akurasi hanya naik sedikit (16% → 18%) — jadi jangan salah mengartikan lonjakan Indeks utama sebagai lompatan pengetahuan yang menyeluruh.

Kapan tidak menggunakannya

Lewati Ling-3.0-flash untuk pekerjaan multimodal — itu lini Ming. Lewati jika Anda membutuhkan flagship penalaran berat daripada eksekutor cepat — itu jalur Ring. Jika Anda berencana self-host, siapkan anggaran untuk perangkat keras yang sesungguhnya: BF16 kira-kira 255GB, FP8 kira-kira 128GB. Dan jika sebuah klaim penting bagi Anda, verifikasikan — angka kecepatan puncak dan konteks panjang adalah milik Ant sampai laboratorium independen mengujinya ulang.

FAQ

Apakah Ling-3.0-flash open weight?

Ya. Bobotnya dirilis sebagai open source pada 7 Agustus di bawah lisensi MIT, di Hugging Face (inclusionAI/Ling-3.0-flash) dan ModelScope. Itu adalah lisensi permisif yang dapat digunakan secara komersial — lisensi yang sama dengan yang digunakan Ling 2.0 dan Ling 2.6.

Bagaimana performa Ling-3.0-flash pada tolok ukur?

Artificial Analysis mengukur Indeks Intelijen sebesar 38, meningkat 24 poin dari Ling-2.6-flash, dan menempatkan model tersebut pada frontier Pareto bobot terbuka untuk kecerdasan vs total parameter. Tabel tolok ukur pada kartu model Ant (misalnya SWE-Bench Pro 56.6) dilaporkan oleh vendor dan belum direproduksi secara independen.

Seberapa cepat sebenarnya?

Artificial Analysis mengukur output sekitar 368 token/detik dengan waktu-ke-token-pertama ~1,98 detik pada API pihak pertama. Ant mengklaim throughput puncak 1.100+ token/detik dan TTFT di bawah 100ms pada konfigurasi GPU tertentu — itu adalah angka dari vendor tanpa pengukuran ulang independen.

Berapa harga Ling-3.0-flash?

AA mencantumkan API pihak pertama sebesar $0,075 per 1 juta token input dan $0,22 per 1 juta output, dengan diskon 80% untuk cache-hit. Tingkat gratis peluncuran berakhir pada 3 Agustus, dan periode diskon 75% sementara di Ling Studio berlangsung hingga 31 Agustus 2026.

Seberapa besar jendela konteks?

Secara native 256K, disajikan pada 262.144 token; Ant mengklaim arsitektur tersebut dapat diskalakan hingga 1M. Panjang output maksimum tidak diungkapkan.

Apa perbedaan antara Ling, Ring, dan Ming?

Ling adalah lini MoE serba guna untuk teks dan pemanggilan alat milik InclusionAI, dan Ling-3.0-flash berada di ujung yang cepat/murah. Ring adalah lini yang berfokus pada penalaran. Ming menangani tugas multimodal. Ketiganya adalah keluarga terpisah untuk pekerjaan yang berbeda, bukan tingkatan dari satu model.

Apakah Ling-3.0-flash sama dengan flagship 1T sebelumnya?

Bukan. Ling-3.0-flash adalah rilis fast-tier yang lebih baru dan lebih kecil (total 124B / 5.1B aktif). Flagship 1T-parameter dari generasi sebelumnya tetap menjadi model yang lebih besar.

Haruskah saya menggunakan Ling-3.0-flash dalam produksi hari ini?

Lebih dapat dipertahankan daripada di bulan Juli, sekarang karena ada skor independen dan lisensi MIT. Jalankan set evaluasi Anda sendiri terlebih dahulu, verifikasi klaim kecepatan vendor terhadap beban kerja Anda, dan tentukan pilihan antara API dan self-hosting (FP8 berjalan pada sekitar 128GB). Angka-angka khusus vendor yang tersisa cukup sempit untuk direncanakan.

Intinya

Ling-3.0-flash naik dari "lembar spesifikasi dan klaim vendor" menjadi "bobot terbuka dan dinilai secara independen" dalam dua minggu. Indeks Inteligensi AA sebesar 38 pada 5,1 miliar parameter aktif — berada di frontier Pareto bobot terbuka, berlisensi MIT, dengan harga $0,075/$0,22 — menjadikannya salah satu model bobot terbuka paling efisien yang dapat Anda gunakan saat ini, dan salah satu yang benar-benar dapat Anda jalankan sendiri. Peringatannya kini lebih sempit daripada sebelumnya: angka kecepatan puncak dan kartu model masih milik Ant sampai laboratorium independen mereproduksinya. Untuk teks bervolume tinggi dan pemanggilan alat pada harga ini, model ini layak untuk dievaluasi secara sungguhan.