Ling-3.0-flash: Apa yang Sebenarnya Kita Ketahui tentang Fast-Tier MoE Baru dari Ant Group (dan Apa yang Tidak Kita Ketahui)
Guides & Insights

Ling-3.0-flash: Apa yang Sebenarnya Kita Ketahui tentang Fast-Tier MoE Baru dari Ant Group (dan Apa yang Tidak Kita Ketahui)

Penulis

Jim Song

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Laboratorium InclusionAI milik Ant Group merilis Ling-3.0-flash pada atau sekitar tanggal 23 Juli 2026 — yang berarti usianya baru beberapa hari pada saat penulisan singkat ini. Model ini adalah model bahasa mixture-of-experts (MoE) dengan total 124B parameter dan sekitar 5.1B aktif per token (rasio sparsity sekitar 24:1), dibangun untuk pembuatan teks dan pemanggilan alat. Model ini diposisikan sebagai tingkatan cepat dan murah dari keluarga Ling; posisi unggulan masih dimiliki oleh Ling-2.6-1T yang jauh lebih besar (total 1T / 63B aktif). Akses saat ini hanya melalui API — melalui portal pengembang Ant sendiri, melalui OpenRouter sebagai inclusionai/ling-3.0-flash, dan melalui ZenMux.

Itulah gambaran keseluruhan yang telah dikonfirmasi, dan penting untuk terus terang mengapa ringkasan ini terdengar lebih hati-hati daripada tulisan model pada umumnya. Tidak ada bobot Hugging Face, tidak ada repositori GitHub untuk Ling-V3, dan tidak ada pernyataan lisensi yang jelas — perubahan nyata dari Ling 2.0 dan Ling 2.6, yang keduanya dirilis sebagai bobot terbuka di bawah lisensi MIT. Juga tidak ada data tolok ukur independen dalam bentuk apa pun: Artificial Analysis, evaluator pihak ketiga yang paling sering dikutip untuk kelas model ini, belum memiliki halaman untuknya. Setiap angka kinerja dan kecepatan yang beredar saat ini berasal dari Ant Group sendiri.

TL;DR.Ling-3.0-flash adalah model MoE 124B/5.1B-aktif dari InclusionAI milik Ant Group, dirilis dalam beberapa hari terakhir, hanya API tanpa bobot Hugging Face dan lisensi yang belum dikonfirmasi. Klaim vendor — throughput puncak 1000 token/detik, waktu-ke-token-pertama di bawah 100ms — belum memiliki verifikasi independen, dan tidak ada skor Artificial Analysis untuk model spesifik ini. Ling-2.6-flash generasi sebelumnya mendapat skor Indeks Kecerdasan Artificial Analysis hanya 14 (Ling-2.6-1T mendapat 26), yang merupakan konteks berguna tetapi bukan pengganti kemampuan sebenarnya dari 3.0-flash. Harga (¥0,40 masuk / ¥1,20 keluar per 1M token, saat ini gratis selama minggu peluncuran dengan 500k token gratis/hari) bersifat promosi dan kemungkinan akan berubah. Anggap semuanya sebagai pratinjau, bukan keputusan akhir.

Poin-poin penting

Ini adalah tingkatan cepat/murah, bukan yang unggulan. Ling-2.6-1T tetap menjadi model terbesar InclusionAI; Ling-3.0-flash adalah saudara yang lebih kecil, lebih murah, lebih cepat yang ditujukan untuk penggunaan volume tinggi.

Belum ada tolok ukur independen.Artificial Analysis tidak memiliki halaman untuk Ling-3.0-flash. Satu-satunya angka publik adalah milik Ant Group sendiri, dan dokumen Ant saat ini tidak menunjukkan tabel tolok ukur untuk model ini sama sekali.

Klaim kecepatan hanya dari vendor. Puncak 1000 token/detik dan waktu ke token pertama di bawah 100ms berasal dari Ant Group, tanpa pengujian throughput pihak ketiga untuk mengonfirmasi kedua angka tersebut.

Tidak ada bobot terbuka, lisensi belum dikonfirmasi. Tidak ada repositori Hugging Face dan tidak ada proyek GitHub Ling-V3. Generasi Ling sebelumnya berlisensi MIT; apakah 3.0-flash akan mengikutinya tidak diketahui.

Harga adalah promosi minggu peluncuran. ¥0.40/¥1.20 per 1M token di platform Ant saat ini dibebaskan, dengan 500k token gratis/hari dan listing OpenRouter gratis — tidak satupun yang dapat diasumsikan tetap berlaku setelah promosi berakhir.

Ini adalah salah satu bagian dari keluarga tiga model. InclusionAI membagi lini produknya menjadi Ling (MoE tujuan umum, model ini), Ring (berfokus pada penalaran), dan Ming (multimodal).

Catatan tentang cara membaca ringkasan ini: setiap spesifikasi, tolok ukur, dan harga di bawah ini diberi label berdasarkan sumber. Di mana Ant Group adalah satu-satunya sumber, kami menyatakannya dengan jelas dan memberikan catatan kehati-hatian yang sesuai. Di mana model Ling generasi sebelumnya memiliki skor independen, kami mengutipnya untuk konteks — bukan sebagai pengganti data mengenai Ling-3.0-flash itu sendiri, yang belum ada. Ini kemungkinan akan memerlukan tindak lanjut setelah pengujian independen menyusul.

Apa yang sebenarnya kita ketahui

Secara arsitektur, Ling-3.0-flash adalah model sparse MoE: total 124 miliar parameter, dengan sekitar 5.1 miliar aktif pada setiap token, yang membuatnya murah dan cepat untuk dijalankan relatif terhadap ukuran totalnya. Jendela konteksnya adalah 256 ribu token menurut dokumentasi Ant sendiri, dengan klaim vendor bahwa itu dapat diperluas hingga 1 juta; daftar OpenRouter menunjukkan 262.144 token, yang sesuai dengan angka 256 ribu. Panjang output maksimum tidak diungkapkan di mana pun yang dapat kami temukan. Model ini mendukung pembuatan teks standar dan pemanggilan alat, tetapi tidak ada masukan atau keluaran multimodal yang disebutkan — kemampuan itu berada pada lini Ming yang terpisah.

Tentang ketersediaan, gambarnya hanya melalui API dan konsisten di tiga rute yang kami temukan: platform pengembang Ant Group sendiri, OpenRouter (terdaftar sebagai inclusionai/ling-3.0-flash), dan ZenMux. Tidak satu pun dari ini yang mengekspos bobot yang dapat diunduh. Tidak ada halaman organisasi GitHub untuk proyek "Ling-V3", dan dokumentasi Ant tidak menyebutkan lisensi untuk model spesifik ini — sebuah celah yang berarti, karena Ling 2.0 dan Ling 2.6 keduanya dirilis sebagai bobot terbuka di bawah MIT. Sampai InclusionAI mengklarifikasi hal ini, jangan berasumsi bahwa Ling-3.0-flash akan menjadi terbuka, dan jangan berasumsi bahwa ia tidak akan.

Celah: yang belum terverifikasi

Kesenjangan terbesar adalah benchmark. Pada saat tulisan ini dibuat, Artificial Analysis — evaluator independen yang paling sering dikutip untuk kelas model yang persis seperti ini — tidak memiliki halaman untuk Ling-3.0-flash; pola URL yang biasanya menjadi host-nya mengembalikan 404. Itu berarti saat ini tidak ada skor penalaran, pengkodean, atau matematika pihak ketiga untuk model ini, dari Artificial Analysis atau evaluator independen lain yang dapat kami temukan. Dokumentasi Ant sendiri memperparah hal ini: dokumen tersebut sama sekali tidak menerbitkan tabel benchmark untuk 3.0-flash, baik dari vendor maupun lainnya, yang tidak biasa untuk perilisan model dan layak untuk ditandai sendiri.

Sebagai konteks kasar, model Ling generasi sebelumnya memang memiliki skor independen. Ling-2.6-flash mencatat Artificial Analysis Intelligence Index sebesar 14, dan Ling-2.6-1T yang lebih besar mencetak 26 — keduanya jauh di belakang model open-weight terkemuka yang dilacak oleh Artificial Analysis pada saat itu. Angka vendor milik Ant sendiri untuk Ling-2.6-flash mengklaim 61,2% pada SWE-bench Verified dan 73,85% pada AIME2026. Tidak satu pun dari angka-angka ini boleh langsung diterapkan pada Ling-3.0-flash; generasi baru dengan arsitektur baru dapat bergerak ke salah satu arah, dan sampai evaluator independen benar-benar menjalankannya, klaim kemampuan apa pun untuk 3.0-flash hanyalah tebakan yang dibungkus sebagai fakta.

Klaim kecepatan vendor: cepat di atas kertas, tidak terverifikasi dalam praktik

Pitch kinerja utama Ant Group untuk Ling-3.0-flash bukanlah kualitas penalaran — melainkan kecepatan mentah. Vendor tersebut mengklaim throughput puncak 1000 token per detik dan waktu ke token pertama di bawah 100 milidetik, keduanya akan benar-benar cepat jika dikonfirmasi. Namun "jika dikonfirmasi" memiliki arti penting dalam kalimat itu: angka-angka ini semata-mata berasal dari materi Ant Group sendiri, diukur dalam kondisi yang dikendalikan Ant dan belum sepenuhnya diungkapkan (perangkat keras, ukuran batch, panjang prompt, dan beban kerja semuanya mempengaruhi angka throughput secara substansial). Tidak ada laboratorium independen yang telah menerbitkan ulang pengukuran. Sampai seseorang di luar Ant menjalankan uji yang sebanding, anggap 1000 tok/s dan TTFT di bawah 100ms sebagai angka pemasaran yang layak diperiksa terhadap beban kerja Anda sendiri, bukan fakta yang sudah pasti.

Harga, dan mengapa itu adalah target yang bergerak.

Di platform Ant Group sendiri, harga daftar untuk Ling-3.0-flash adalah ¥0.40 per 1M token input dan ¥1.20 per 1M token output — murah secara desain, konsisten dengan posisinya sebagai tingkat cepat/murah. Namun harga daftar itu sebenarnya bukan yang dibayar siapa pun saat ini: Ant sedang menjalankan promosi minggu peluncuran gratis, dan secara terpisah menawarkan 500k token gratis per hari di platformnya. Daftar OpenRouter menunjukkan varian ling-3.0-flash:free seharga $0/$0. Tidak satu pun dari ini boleh disalahartikan sebagai harga yang stabil. Promosi peluncuran berakhir, tingkat gratis dibatasi, dan angka ¥0.40/¥1.20 sendiri bisa berubah setelah data penggunaan nyata masuk. Jika Anda merencanakan pengeluaran produksi seputar model ini, buatlah anggaran berdasarkan harga daftar, bukan harga promosi, dan periksa kembali sebelum berkomitmen.

Keluarga Ling / Ring / Ming

Ling-3.0-flash tidak berdiri sendiri — InclusionAI mengatur rilisnya ke dalam tiga famili yang diberi nama, masing-masing ditujukan untuk tugas yang berbeda. Ling adalah lini MoE serba guna, mencakup pembuatan teks sehari-hari dan pemanggilan alat; Ling-3.0-flash berada di ujung cepat/murah dari lini tersebut, dengan Ling-2.6-1T masih sebagai andalan yang lebih besar. Ring adalah lini fokus penalaran InclusionAI, dibangun untuk tugas yang mengandalkan rantai pemikiran multi-langkah, bukan throughput mentah. Ming adalah lini multimodal, menangani gambar dan modalitas non-teks lainnya yang tidak disentuh oleh Ling. Jika tugas Anda membutuhkan penalaran yang lebih berat atau input multimodal, model InclusionAI yang tepat kemungkinan bukan Ling-3.0-flash — model ini dibangun untuk volume dan kecepatan dalam jalur teks-dan-alat, bukan untuk merambah ke wilayah dua famili lainnya.

Untuk siapa: tiga skenario

1. Pipeline teks atau pemanggilan alat dengan volume tinggi dan sensitif terhadap latensi — sebagai uji coba, bukan komitmen

Jika beban kerja Anda didominasi oleh pembuatan teks yang sensitif terhadap throughput atau pemanggilan alat — obrolan, agen ringan, panggilan API frekuensi tinggi — posisi Ling-3.0-flash (jumlah parameter aktif kecil, klaim TTFT di bawah 100ms, harga peluncuran hampir gratis) membuatnya layak untuk uji coba. Tangkapannya adalah bahwa "layak untuk uji coba" berbeda dengan "layak untuk mengalihkan lalu lintas produksi ke." Dengan nol data benchmark independen, Andalah tolok ukurnya saat ini: jalankan set evaluasi Anda sendiri melaluinya sebelum mempercayainya untuk hal yang berhadapan dengan pelanggan, dan jangan membangun model biaya di sekitar harga promosi saat ini.

2. Tim yang membutuhkan konteks panjang dengan anggaran terbatas

Jendela konteks 256K (dengan klaim vendor bahwa dapat diperluas hingga 1M) dengan harga daftar yang sangat murah adalah kombinasi yang menarik untuk kasus penggunaan yang intensif dalam pengambilan atau pemrosesan dokumen, asalkan kualitas penalaran model yang sebenarnya bertahan sepanjang panjang konteks tersebut — yang, sekali lagi, belum diuji oleh sumber independen. Ini adalah kandidat yang masuk akal untuk dimasukkan dalam daftar pendek bersama dengan opsi konteks panjang murah yang sudah mapan, tetapi harus dievaluasi secara berdampingan dengan mereka daripada diadopsi hanya berdasarkan keunggulan lembar spesifikasi Ant.

3. Pengamat melacak lanskap Kementerian Pendidikan China dan peta jalan InclusionAI

Untuk tim yang melacak lanskap persaingan lab model Cina yang terbuka dan semi-terbuka, daripada menggunakan satu model tertentu dalam produksi, Ling-3.0-flash adalah titik data yang berguna: ini menandakan bahwa InclusionAI berulang dengan cepat di tingkat cepatnya, berpotensi mundur dari bobot terbuka (setidaknya untuk saat ini), dan terus bertaruh pada struktur tiga keluarga (Ling/Ring/Ming) daripada satu model umum. Layak untuk ditandai dan ditinjau kembali setelah tolak ukur dan kejelasan lisensi tersedia.

Kapan tidak menggunakannya

Jangan gunakan Ling-3.0-flash untuk hal apa pun yang memerlukan kutipan klaim kemampuan yang terverifikasi — tidak ada tolok ukur independen yang bisa dijadikan acuan, sehingga pernyataan apa pun tentang kemampuan penalaran, pengkodean, atau matematikanya saat ini tidak dapat diverifikasi. Jangan gunakan jika Anda memerlukan bobot terbuka untuk hosting mandiri, penyesuaian halus, atau alasan kepatuhan; tidak ada yang tersedia, dan lisensi untuk model khusus ini bahkan belum disebutkan, apalagi dikonfirmasi sebagai permisif. Jangan gunakan untuk tugas multimodal — itu tugas lini Ming, bukan Ling. Dan berhati-hatilah dalam menyusun model biaya berdasarkan harga saat ini: minggu peluncuran gratis, 500 ribu token harian gratis, dan tingkat OpenRouter gratis semuanya bersifat promosi, dan harga daftar ¥0,40/¥1,20 yang kemungkinan akan kembali diterapkan belum diuji dengan pola penggunaan di dunia nyata.

FAQ

Apakah Ling-3.0-flash open weight?

Saat ini tidak. Tidak ada repositori Hugging Face dan tidak ada proyek GitHub Ling-V3 pada saat penulisan ini. Generasi Ling sebelumnya (2.0 dan 2.6) dirilis di bawah MIT sebagai bobot terbuka, tetapi tidak ada yang mengonfirmasi bahwa Ling-3.0-flash akan mengikuti pola tersebut — atau tidak.

Bagaimana performa Ling-3.0-flash pada tolok ukur?

Belum ada tolok ukur independen untuk model ini — Artificial Analysis tidak memiliki halaman untuk model ini. Dokumentasi Ant Group sendiri juga tidak mempublikasikan tabel tolok ukur untuk model ini. Untuk konteks historis kasar, Ling-2.6-flash generasi sebelumnya mendapat skor Artificial Analysis Intelligence Index sebesar 14, dan Ling-2.6-1T mendapat skor 26, tetapi tidak ada satu pun dari angka-angka tersebut yang harus diasumsikan berlaku untuk generasi baru ini.

Seberapa cepat sebenarnya?

Ant Group mengklaim throughput puncak 1000 token/detik dan waktu ke-token-pertama di bawah 100ms. Keduanya adalah angka-angka dari vendor saja tanpa pengukuran ulang independen yang dipublikasikan sejauh ini. Anggap saja sebagai klaim yang harus diverifikasi pada beban kerja Anda sendiri, bukan kinerja yang dikonfirmasi.

Berapa harga Ling-3.0-flash?

Penetapan harga di platform Ant adalah ¥0,40 per 1 juta token input dan ¥1,20 per 1 juta token output, tetapi saat ini gratis selama promosi minggu peluncuran, dengan 500k token gratis/hari juga tersedia. OpenRouter juga mencantumkan varian gratis. Harapkan persyaratan promosi ini berubah.

Seberapa besar jendela konteks?

256K token menurut dokumentasi Ant, dengan klaim vendor bahwa itu dapat diperpanjang hingga 1M. Daftar OpenRouter menunjukkan 262,144 token, konsisten dengan angka 256K. Panjang output maksimum tidak disebutkan.

Apa perbedaan antara Ling, Ring, dan Ming?

Ling adalah lini MoE serbaguna untuk teks dan pemanggilan alat dari InclusionAI, dan Ling-3.0-flash berada di ujung yang cepat/murah. Ring adalah lini yang berfokus pada penalaran. Ming menangani tugas multimodal. Mereka adalah keluarga model terpisah yang dibangun untuk pekerjaan berbeda, bukan tingkatan dari model yang sama.

Apakah Ling-3.0-flash sama dengan Ling-2.6-1T?

No. Ling-2.6-1T adalah andalan besar InclusionAI (1T total / 63B parameter aktif) dan tetap menjadi model yang terpisah dan lebih besar. Ling-3.0-flash (124B total / ~5.1B aktif) adalah rilis yang lebih baru, lebih kecil, dan lebih cepat.

Haruskah saya menggunakan Ling-3.0-flash dalam produksi hari ini?

Hanya setelah menjalankan evaluasi Anda sendiri. Tanpa tolok ukur independen, lisensi yang belum dikonfirmasi, dan harga yang saat ini bersifat promosi, masuk akal untuk melakukan uji coba tetapi terlalu dini untuk mengkomitmenkan beban kerja yang kritis terhadap produksi atau sensitif terhadap kepatuhan padanya tanpa pengujian Anda sendiri dan rencana tentang apa yang terjadi ketika ketentuan promosi berakhir.

Intinya

Ling-3.0-flash adalah rilis baru yang benar-benar layak dilacak — model MoE aktif 124B/5.1B yang ditujukan langsung pada pekerjaan teks dan panggilan alat yang cepat, murah, dan bervolume tinggi, dari lab yang sebelumnya telah mengirimkan model yang kredibel. Namun saat ini, itu hanya lembar spesifikasi dan seperangkat klaim vendor, bukan produk yang terverifikasi: tidak ada tolok ukur independen, tidak ada bobot terbuka, tidak ada lisensi yang dikonfirmasi, dan harga yang secara eksplisit promosi. Itu bukan alasan untuk mengabaikannya — itu adalah alasan untuk mencobanya dengan hati-hati, verifikasi klaim yang penting bagi Anda secara langsung, dan tinjau kembali ringkasan ini setelah Artificial Analysis atau evaluator independen lainnya menerbitkan angka nyata.

© 2026 OrcaRouter

Untuk Penyedia

Mengoperasikan platform inferensi? Hadirkan model Anda di OrcaRouter.

Hubungi kami

Gabung komunitas kami

DiscordEmailXGitHubYouTube