Kartu judul untuk Ling-3.0-flash-VL yang merangkum model tersebut sebagai mixture-of-experts multimodal native dengan 124B parameter dan 5,5B aktif dari lab inclusionAI milik Ant Group, dirilis pada September 2026 di bawah lisensi MIT, mencetak skor 25 pada Artificial Analysis Intelligence Index v4.3, serta menghasilkan 142,9 token output per detik.
Guides & Insights

Ling-3.0-flash-VL: Model Visi 5,5B-Aktif milik Ant Mencapai 25 pada Intelligence Index

Penulis

Rowan Sterling

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Ling-3.0-flash-VL sekarang memiliki angka benchmark yang tidak diketik oleh siapa pun di Ant Group, dan itulah beritanya. Model multimodal native pertama dari lab inclusionAI milik Ant mendapat skor 25 pada Artificial Analysis Intelligence Index — sebuah uji independen, pada skala v4.3 terkini, yang diterbitkan bersama halaman model yang mencantumkan kecepatan, latensi, dan harganya. Angka ini muncul tiga minggu setelah kartu model milik vendor sendiri mengklaim 42 pada indeks yang sama, dan hal paling berguna yang dapat dilakukan pembaca dengan kedua angka tersebut adalah memahami mengapa keduanya bukan kontradiksi: Ant mengukur terhadap protokol Intelligence Index v4.1.1, Artificial Analysis mengukur terhadap v4.3, dan itu adalah penggaris yang berbeda yang dibangun dari kumpulan evaluasi yang berbeda. Angka vendor tidak bertahan saat bersentuhan dengan pihak ketiga, melainkan diukur ulang pada skala yang belum ada ketika angka itu ditulis.

Model di balik skor ini adalah mixture-of-experts sparse dengan 124B parameter total dan sekitar 5,5B aktif per token, dirilis di bawah lisensi MIT dengan bobot BF16 dan FP8, menerima teks, gambar, dan video serta mengembalikan teks. Angka parameter aktif itulah yang menjadi seluruh argumen untuk hal ini. Dengan 5,5B aktif, Ling-3.0-flash-VL berada pada apa yang kini menjadi kurva paling menarik dalam model terbuka — batas terdepan kecerdasan yang diplot terhadap parameter yang diaktifkan alih-alih ukuran total — dan ia berada di sana karena ia melakukan cukup banyak pekerjaan per unit komputasi inferensi, bukan karena ukurannya yang sangat besar.

Artikel ini membahas apa yang sebenarnya dirilis dan kapan, apa kata pengujian independen, mengapa klaim Pareto bertahan lebih baik daripada kebanyakan, berapa biaya modelnya, dan di mana Anda benar-benar dapat memanggilnya. Versi singkatnya, bagi siapa pun yang hanya menginginkan itu: Ling-3.0-flash-VL itu nyata, open-weight, luar biasa murah untuk dijalankan sebagai layanan, terukur di atas rata-rata untuk kelas ukurannya, dan nyata lebih bertele-tele serta lebih lambat dirilis daripada yang disiratkan skor mentahnya. Angka 42 yang diklaim vendornya tidak pernah direproduksi secara independen dan tidak dapat dibandingkan dengan 25 yang sekarang ada di papan peringkat.

Apa yang sebenarnya dirilis, dan linimasa yang terus diratakan

Coverage of this release tends to collapse several separate events into one launch date, and the dates matter because they explain why early write-ups described a model that nobody outside Ant could score. The Hugging Face repository inclusionAI/Ling-3.0-flash-VL was created on September 4, 2026 — 64 shards of BF16 weights, an MIT license, a custom-code stack for the bailing_moe_v3_vl architecture, and, for a few days, almost nobody downloading it. The FP8 quantization followed on September 8, roughly 126 GB across 64 shards, with the vision tower kept at higher precision than the expert weights. Artificial Analysis lists the release as September 10, 2026, which is the date its own page anchors to, and the model page carrying the score went live around then.

Jadi, "dirilis September 2026" akurat tetapi tidak berguna. Urutan praktisnya adalah: bobot pada tanggal 4, format presisi kedua pada tanggal 8, dan pengukuran independen pada tanggal 10. Alasan ini penting adalah bahwa model dengan bobot di disk tetapi tanpa endpoint yang dihosting dan tanpa skor pihak ketiga, bagi sebagian besar tim, belum menjadi sesuatu yang dapat dievaluasi — itu adalah unduhan yang harus Anda siapkan infrastrukturnya. Ling-3.0-flash-VL melewati batas itu ketika API dan skor independen keduanya sudah ada.

Dukungan serving hadir bersamaan dengan bobotnya, bukan setelahnya. Ant menerbitkan cookbook deployment SGLang dan memelihara fork vLLM yang disetel untuk Ling bagi arsitektur tersebut, yakni bagian dari rilis terbuka yang biasanya tertinggal hingga beberapa minggu. Di sini, hal itu tidak tertinggal.

Nomor di papan, dan yang ada di kartu

Inilah gambaran independen dari Artificial Analysis, yang merupakan satu-satunya pengukuran pihak ketiga atas model ini yang saat ini ada:

• Indeks Kecerdasan — 25 pada v4.3, peringkat #2 dari 64 di kelas ukurannya, dibandingkan median kelas sebesar 8br /> • Total parameter — 124Bbr /> • Parameter aktif — 5.5B per tokenbr /> • Kecepatan keluaran — 142.9 token/detik, #10 dari 64, dibandingkan median rekan sebesar 105.1br /> • Waktu ke token pertama — 2.21 detik, dibandingkan median rekan sebesar 2.29br /> • Jendela konteks — 262K token sebagaimana diukur oleh Artificial Analysis, dibandingkan dengan 256K yang dinyatakan oleh kartu model itu sendiribr /> • Lisensi — MIT, bobot terbuka

Dan inilah angka dari vendor yang begitu sering dicetak di sebelahnya: 42 pada protokol Artificial Analysis Intelligence Index v4.1.1, empat poin di atas skor yang diraih versi teks-saja Ling-3.0-flash pada protokol yang sama. Klaim itu ada di kartu model, tidak memiliki jejak evaluasi yang dipublikasikan, dan bukan angka yang dilaporkan Artificial Analysis. Dua hal sekaligus benar: angka 42 itu tidak pernah direproduksi, dan itu bukan bukti adanya ketidakjujuran, karena v4.1.1 dan v4.3 tidak mengukur hal yang sama. Artificial Analysis menyatakan ulang indeksnya pada September 2026 dan menilai ulang seluruh papan peringkatnya; v4.3 mencakup sepuluh evaluasi termasuk AA-Briefcase, GDPval-AA v2, AutomationBench-AA, Terminal-Bench v4.0, dan Humanity's Last Exam. Artikel mana pun yang masih mengutip angka 42 di sebelah angka 25 tanpa menyebut versinya sedang membandingkan dua tes yang berbeda lalu menyebutnya sebagai penurunan.

The Artificial Analysis model page for Ling-3.0-flash-VL showing an Intelligence Index of 25 on v4.3 with a class ranking of #2 of 64, 124B total and 5.5B active parameters, a 262K-token context window, 142.9 output tokens per second, a 2.21 second time to first token, 160M output tokens from the Intelligence Index ranked #8 of 64, and a listed price of $0.00 per 1M tokens in and out.

Detail yang layak diperhatikan di luar skor utamanya adalah verbositas. Artificial Analysis mencatat Ling-3.0-flash-VL menghabiskan 160M token keluaran untuk menyelesaikan Intelligence Index, berada di peringkat #8 dari 64 dibandingkan median 84M, dan melabelinya "sangat bertele-tele". Bagi model yang nilai jualnya adalah inferensi murah melalui jumlah parameter aktif yang kecil, hal itu bertentangan langsung dengan nilai jual tersebut. Anda membayar per token, bukan per parameter. Model yang mengaktifkan 5,5B tetapi mengeluarkan hampir dua kali lipat jumlah token median untuk menjawab pertanyaan yang sama mengembalikan sebagian dari keunggulan struktural itu di kasir — yang justru merupakan jenis interaksi yang disembunyikan oleh tabel harga per token dan diungkap oleh pengukuran biaya per tugas.

Klaim Pareto, saat diberi sedikit tekanan

Klaim bahwa Ling-3.0-flash-VL berada di frontier Pareto kecerdasan versus parameter aktif, secara tidak biasa, adalah klaim yang didukung oleh data independen, bukan sekadar dimungkinkan. Median kelas pada indeks ini adalah 8; Ling-3.0-flash-VL mencetak skor 25; dan ia melakukannya sambil mengaktifkan 5,5B parameter per token. Bagi tim yang kendala mengikatnya adalah throughput yang dapat dilayani — satu akselerator, anggaran permintaan tetap, penerapan edge — rasio itu adalah seluruh dasar keputusan, dan ini merupakan pencapaian yang benar-benar kuat.

Dua catatan membuat ini bukan kemenangan yang sepenuhnya mulus. Yang pertama adalah perbedaan jumlah parameter: kartu model menyebutkan sekitar 5,5B aktif, sedangkan cookbook SGLang menggambarkan model dengan 5,1B parameter aktif. Keduanya adalah dokumen Ant, perbedaannya kecil, dan itu sedikit mengubah bentuk kurva, bukan arahnya. Yang kedua adalah bahwa "frontier" merupakan klaim relatif tentang bidang yang bergerak setiap minggu. Menjadi yang terbaik dalam kecerdasan per parameter aktif pada ukuran tertentu adalah posisi yang Anda pegang sampai model berikutnya di band tersebut dirilis, dan band ini padat.

Demonstrasi utama milik vendor sendiri — bahwa Ling-3.0-flash-VL, yang berkompetisi di Image-to-WebDev Arena dengan nama pengguna "linthium," mencetak skor 1.441 melawan GPT-5.4 dengan skor 1.440 — harus dibaca sebagai penarik perhatian, bukan hasil. Selisih satu poin berada di dalam noise Elo arena, angka itu dilaporkan vendor, dan itu bukan jenis selisih yang menentukan apa pun. Klaim kemampuan di baliknya lebih menarik daripada angkanya: model ini dibangun untuk loop umpan balik visi di mana ia menghasilkan kode front-end dari sebuah tata letak, merender output-nya sendiri, melihat hasil render, dan mengoreksi — amati, bertindak, verifikasi, koreksi, bukan memberi keterangan sekali lalu berhenti.

A single-column scoreboard card for Ling-3.0-flash-VL listing six rows: Intelligence Index 25 on v4.3, active parameters 5.5B, total parameters 124B, context window 262K tokens, output speed 142.9 tokens per second, and license MIT open weights, with a footer noting the index figure is per Artificial Analysis and the vendor card claims 42 on the retired v4.1.1 protocol.

Berapa biayanya, yang tidak sejelas kelihatannya

Halaman Artificial Analysis mencantumkan Ling-3.0-flash-VL pada $0.00 per 1 juta token input dan $0.00 per 1 juta token output, dibandingkan dengan median sejawat sebesar $0.14 dan $0.40. Itu bukan harga. Itu hanya tampak seperti harga. Artificial Analysis memberi harga pada endpoint yang bisa dilihatnya, dan endpoint yang bisa dilihatnya gratis — model tersebut berjalan di Ling Studio milik Ant sebagai uji coba gratis, dan akses promosi gratis itulah yang tercermin dalam daftar tersebut. Dokumentasi multimodal Ant sendiri sama sekali tidak menerbitkan harga per token untuk model visi tersebut, jadi tidak ada kartu tarif vendor untuk memverifikasi angka nol itu. Sebagai gambaran skala, saudara kandungnya yang hanya teks, Ling-3.0-flash, telah dicantumkan sekitar $0.075 per 1 juta token input dan $0.22 per 1 juta token output, dan varian Ling spesifik domain milik Ant juga diluncurkan sebagai API gratis.

Treat the zero as a testing window rather than a tariff. Free tiers on freshly released models are a customer-acquisition instrument, and the honest planning assumption is that Ling-3.0-flash-VL will eventually carry a price somewhere in the neighbourhood of its text sibling. There is also a live ambiguity the arrival of a paid endpoint will not resolve: Ant's own API examples use the model identifier Ling-3.0-flash-VL-rc1, a release-candidate marker, and it remains unclear whether the served checkpoint is byte-identical to the September 4 open weights. If you are benchmarking your own prompts against the hosted API and expecting the results to transfer to a self-hosted BF16 build, that is an assumption you should test before you build on it.

Gambaran biaya menjadi terbalik tergantung pada sisi mana Anda berada. Bagi tim yang sudah memiliki akselerator, build FP8 sekitar 126 GB muat dalam node kelas 80GB dengan delapan akselerator, dan jumlah parameter aktif 5,5B berarti Anda membayar biaya teramortisasi node tersebut terhadap jejak komputasi per token yang sangat kecil — versi termurah yang mungkin dari model ini adalah versi yang Anda layani sendiri. Bagi tim tanpa akselerator, pertanyaannya adalah apakah endpoint berbayar tiba sebelum tier gratis ditutup.

Di mana Anda benar-benar dapat meneleponnya, termasuk bagian saat kami mengatakan tidak

Ling-3.0-flash-VL is reachable through Ant's own platform — an OpenAI-compatible endpoint at api.ant-ling.com/v1/chat/completions and an Anthropic-compatible one alongside it — plus free trial access on Ling Studio, plus open weights you can serve yourself. Independent gateways have begun listing it as well, and that is genuinely the fastest way to try it without provisioning anything.

The thing worth stating plainly is that OrcaRouter does not route Ling-3.0-flash-VL today. It is not on our model catalogue, so anything you read here about calling it through us would be fiction, and we would rather you knew that up front. What we do route is the vision model most directly comparable to it: DeepSeek V4 Flash Vision Exp, Deep​Seek's experimental multimodal build, which is live on our catalogue with a 1M-token context window and a published rate. If your actual requirement is a capable vision model behind one OpenAI-compatible endpoint — with a fallback chain configured so a provider hiccup retries before your response starts, and provider list pricing passed through with nothing added on top, so a vendor price change reaches you the same day it lands — that is the model to try first while Ling-3.0-flash-VL remains off-catalogue.

A release-timeline card for Ling-3.0-flash-VL covering four dated events: the Hugging Face repository created September 4 2026 with MIT-licensed BF16 weights, FP8 weights published September 8 at roughly 126 GB, the release anchored to September 10 by Artificial Analysis, and an independent Intelligence Index score of 25 published the same week, with a footer noting the model is not carried on the OrcaRouter catalogue.

Apa yang perlu diperhatikan dari sini

Tiga hal akan menentukan apakah rilis ini terlihat signifikan dalam enam bulan. Yang pertama adalah uji coba independen kedua: satu skor dari satu evaluator hanyalah satu titik data, dan pertanyaan yang menarik adalah apakah penempatan Ling-3.0-flash-VL pada kurva kecerdasan-versus-parameter-aktif bertahan pada harness yang berbeda. Yang kedua adalah harga yang sebenarnya. Sampai Ant menerbitkan rate card untuk model visi tersebut, setiap perbandingan biaya yang melibatkannya hanyalah perkiraan yang menyamar sebagai angka, dan tier gratis menjalankan peran yang seharusnya dijalankan oleh harga. Yang ketiga adalah delta kualitas FP8 — menara visi sengaja dipertahankan pada presisi yang lebih tinggi daripada bobot ahli dalam build itu, dan apakah versi terkuantisasi menyamai BF16 pada tugas visual berbutir halus adalah persis jenis pertanyaan yang baru muncul setelah orang menjalankannya di produksi alih-alih melakukan benchmark terhadapnya.

Penilaian yang tersedia hari ini lebih sempit daripada yang tersirat dari liputan peluncuran dan lebih berguna daripada skornya saja. Ling-3.0-flash-VL adalah model visi sungguhan, berlisensi MIT, dapat dihosting sendiri, yang mengaktifkan sebagian kecil dari 124B parameternya, mencetak skor 25 pada indeks independen terkini terhadap median kelas 8, dan mengembalikan sebagian keunggulan itu melalui verbositas. Itu adalah model yang bagus dengan bentuk yang jujur. Angka 42 di kartu adalah angka dari penggaris yang sudah tidak ada lagi.