Sebuah kartu judul hero untuk perbandingan 'Ling-3.0-flash-VL vs Ling 3.0 Flash' dengan subjudul 'Satu Otak 124B, Kini dengan Mata'. Di atas judul terdapat dua ikon garis datar — dokumen teks di kiri dan mata di atas bingkai gambar di kanan — dan di bawah subjudul dua label yang dipisahkan oleh pembatas tipis: 'BACKBONE HYBRID-LINEAR MOE YANG SAMA' dan 'SATUNYA MENAMBAHKAN INPUT GAMBAR & VIDEO NATIF'. Tidak ada angka atau harga yang muncul. Logo OrcaRouter ditempatkan di pojok kanan bawah.
Guides & Insights

Ling-3.0-flash-VL vs Ling 3.0 Flash: Satu Otak 124B, Kini dengan Mata

Penulis

Magnus Corvin

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Ling-3.0-flash-VL dan Ling 3.0 Flash bukanlah rival, dan membaca pasangan ini sebagai adu model akan membawa Anda pada kesimpulan yang salah. Ling-3.0-flash-VL adalah checkpoint visi-bahasa yang dirilis minggu ini oleh laboratorium inclusionAI milik Ant Group — bobotnya tersedia di Hugging Face dengan lisensi MIT sejak 4 September 2026 — dan dibangun langsung di atas Ling 3.0 Flash, model teks open-weight berparameter 124B dari laboratorium tersebut yang menjadi andalan tingkat cepatnya sejak akhir Juli. Keduanya berbagi desain MoE hybrid-linear yang sama, ekonomi aktivasi-sparse yang sama, resep penyajian konteks 256K yang sama, dan lisensi MIT yang sama. Yang ditambahkan oleh checkpoint VL adalah satu hal yang tidak pernah dimiliki model teks: masukan gambar dan video asli, yang disalurkan melalui encoder ViT, proyektor MLP dua lapis, dan encoding temporal VideoRoPE. Jadi perbandingannya menyempit menjadi satu pertanyaan praktis — jika beban kerja Anda tidak pernah melihat gambar, apakah model yang memiliki mata layak untuk dialihkan?

Alasan pertanyaan ini memang layak diajukan adalah bahwa {{1}}inclusionAI tidak menempatkan Ling-3.0-flash-VL sebagai lini produk terpisah.{{/1}} Kartu modelnya menyebut model itu sebagai “model multimodal asli generasi berikutnya kami,” yang dibangun di atas Ling-3.0-flash, mewarisi kemampuan bahasa, penalaran, dan konteks panjang dari model tersebut, serta memperluasnya dengan visi yang ikut berperan dalam seluruh siklus pemahaman, penalaran, tindakan, dan verifikasi — bukan visi sebagai masukan tempelan. Bagi keluarga model yang rilis andalannya sebelumnya secara eksplisit hanya berupa teks, ini adalah pergeseran nyata, dan ini mengubah checkpoint mana yang harus dijadikan standar oleh tim yang berfokus pada teks dan perkakas.

Dua checkpoint, satu backbone

Ling 3.0 Flash, lawan dalam perbandingan ini, adalah yang lebih matang dari keduanya. Diumumkan pada akhir Juli 2026 dan dirilis sebagai sumber terbuka di bawah lisensi MIT pada 7 Agustus, model ini merupakan mixture-of-experts hybrid-linear dengan total 124B parameter dan sekitar 5,1B aktif per token — 35 lapisan KDA dan 7 lapisan Gated MLA ditumpuk dengan rasio 5:1, 512 pakar yang dirutekan dengan 8 yang diaktifkan, konteks native 256K yang dilayani pada 262.144 token. Model ini hanya teks, dengan dukungan pemanggilan alat, pemikiran yang diaktifkan secara default melalui template obrolan, dan profil biaya yang luar biasa rendah untuk ukurannya. Model ini juga merupakan separuh yang terdokumentasi dari pasangan ini: Artificial Analysis mencantumkannya di papan peringkat langsungnya, di mana ia menempati peringkat pertama di antara 63 model di kelasnya, dan telah mengukur keluaran sekitar 313 token per detik pada API vendor.

Ling-3.0-flash-VL mempertahankan arsitektur tersebut dan menambahkan tumpukan visual di atasnya. Kartu model tersebut menjelaskan encoder visual ViT yang fitur-fiturnya disejajarkan ke ruang teks melalui proyektor MLP dua lapis, dengan VideoRoPE yang menyandikan posisi spasial dan urutan temporal sehingga model dapat melakukan lokalisasi peristiwa dan penalaran video panjang. Backbone-nya merupakan hibrida KDA-ke-MLA 5:1 yang sama, kali ini dengan total 124B / 5.5B aktif per token, serta trunk 42 lapis. Inputnya berupa teks, gambar, dan video; outputnya berupa teks. Konteksnya diklaim mencapai 1M token, dengan konfigurasi SGLang yang direkomendasikan untuk melayani 256K melalui penskalaan YaRN. Seperti halnya versi teksnya, model ini hadir dengan mode berpikir aktif secara default (dapat dinonaktifkan per permintaan melalui chat_template_kwargs), dan berjalan dengan SGLang atau fork vLLM kustom milik inclusionAI. Rilis BF16-nya berukuran sekitar 250 GB pada disk dalam 64 shard safetensor—masuk dalam kelas seperempat terabyte yang sama dengan bobot model teksnya.

Seberapa baru informasinya? Pada saat tulisan ini dibuat, repositori VL memiliki jumlah unduhan hanya puluhan, kartu modelnya masih dalam proses pembaruan, dan Artificial Analysis belum mendaftarkannya. Semua hal di bawah ini yang tidak secara eksplisit disebutkan sebagai berasal dari Artificial Analysis adalah laporan dari inclusionAI sendiri.

A screenshot of the Hugging Face model card for inclusionAI/Ling-3.0-flash-VL, showing the header '@inclusionAI Ling-3.0-flash-VL', the 'Model card' and 'Files and versions' tabs, the introduction text 'We are introducing Ling-3.0-flash-VL, our next-generation native multimodal model' together with the 124B total / 5.5B activated / up to 1M context summary, and the right-hand sidebar noting License: mit, 42 downloads last month, Safetensors ~125B params, and 'This model isn't deployed — ask for provider support'.

Papan skor

Asimetri di sini bukan pada kualitas — melainkan pada modalitas. Enam dimensi menangkap keputusan tersebut:

Inteligensi (kartu vendor, Indeks AA v4.1.1) — Ling-3.0-flash-VL: 42, dilaporkan vendor. Ling 3.0 Flash: 38, angka indeks sebelumnya yang dikutip kartu tersebut.

Papan langsung AA hari ini (v4.3) — Ling-3.0-flash-VL: belum tercantum. Ling 3.0 Flash: diperkirakan 25, menempati peringkat #1 dari 63 di kelasnya.

Input — Ling-3.0-flash-VL: teks, gambar, dan video. Ling 3.0 Flash: teks saja.

Konteks — keduanya mengklaim hingga 1M token; dalam praktiknya, keduanya saat ini dilayani pada 256K (262.144).

Harga — Ling-3.0-flash-VL: belum ada harga resmi; hanya bobot terbuka MIT yang tersedia. Ling 3.0 Flash: sekitar $0,07 per 1 juta input dan $0,22 per 1 juta output pada API pihak pertama milik vendor.

Pilih ini untuk— Ling-3.0-flash-VL: dokumen, tangkapan layar, bagan, video, dan agen pengendali GUI. Ling 3.0 Flash: tool-calling padat teks dan pipeline agen jangka panjang.

A two-column scoreboard titled 'Ling-3.0-flash-VL vs Ling 3.0 Flash — the scoreboard'. Left column 'Ling-3.0-flash-VL': 'Intelligence (vendor card, AA Index v4.1.1): 42 — vendor-reported', 'AA live board today (v4.3): not listed yet', 'Inputs: text, image, video', 'Context: up to 1M; 256K recipe', 'Price: no list price — MIT open weights', 'Pick it for: documents, video, GUI agents'. Right column 'Ling 3.0 Flash': 'Intelligence (vendor card, AA Index v4.1.1): 38 — earlier AA figure', 'AA live board today (v4.3): 25 estimated, #1 of 63 in class', 'Inputs: text only', 'Context: 256K native; 1M claimed', 'Price: $0.07 / $0.22 per 1M (vendor API)', 'Pick it for: text-heavy agentic pipelines'. Footer reads 'VL figures vendor-reported; Flash figures per Artificial Analysis.' The OrcaRouter logo is composited in the bottom-right corner.

Papan skor yang tidak dapat dimasuki model teks.

Di sinilah keduanya benar-benar berbeda, dan perbedaannya bersifat struktural, bukan kompetitif: pada tolok ukur gambar dan video, Ling 3.0 Flash khusus teks tidak memiliki entri sama sekali, karena tidak dapat menerima masukan tersebut. Bagan milik Ling-3.0-flash-VL sendiri — evaluasi inclusionAI yang belum direproduksi, dijalankan sebagian secara internal dan sebagian lagi terhadap API para pesaing dalam pengaturan pengujian resmi — menampilkan angka-angka pada tiga kategori yang ditekankan oleh kartu model. Pada pemahaman gambar kompleks, ia menunjukkan MMMU-Pro sebesar 79.0 dan MathVision sebesar 84.87, dengan skor yang jauh lebih rendah yaitu 19.88 pada Humanity's Last Exam-Multimodal, yang mencerminkan betapa sulitnya set tersebut bagi semua orang. Untuk pekerjaan dokumen dan bagan, ia kuat: OmniDocBench1.5 pada 91.35 dan CharXiv_RQ pada 81.30. Dan pada rangkaian uji agen-multimodal yang membuat rilis ini menarik — ClawEval-MM pada 59.9, WebVoyager pada 90.83, Vision2Web pada 57.69 — ia diminta untuk membaca antarmuka dan bertindak atasnya, yang justru merupakan pekerjaan agen GUI yang tidak dapat dilakukan oleh model teks.

Bacalah semuanya itu dalam konteksnya dan muncullah gambaran yang koheren: ini bukan model yang disetel untuk memenangkan kuis soal gambar, melainkan model yang disetel untuk mengubah piksel menjadi aksi — membaca tata letak, mengikuti bagan, mengoperasikan halaman. Pada bagan milik vendor itu sendiri, model ini memimpin dalam perbandingan tiga arah (Qwen3.8-27B dengan upaya penalaran tinggi, Gemini 3.5 Flash-Lite, dan Kimi-K2.6) pada OmniDocBench, WebVoyager, dan ClawEval-MM, serta tertinggal pada set pengetahuan-dan-penalaran yang berat seperti MathVision dan HLE-MM. Perlakukan setiap angka itu sebagai klaim inclusionAI sampai laboratorium netral mengonfirmasinya — tetapi arah penyetelan modelnya jelas dan konsisten.

Satu-satunya angka yang layak diperdebatkan: 42 vs 38

Klaim yang paling mungkin mendorong tim berbasis teks untuk beralih adalah klaim utamanya: inclusionAI melaporkan Ling-3.0-flash-VL mencetak 42 pada Artificial Analysis Intelligence Index (v4.1.1), empat poin di atas 38 yang diatribusikannya kepada Ling 3.0 Flash pada versi indeks yang sama. Perhatikan apa yang diukur indeks tersebut: komposit v4.1.1-nya memadukan rangkaian pengujian teks dan agen — GDPval, Terminal-Bench, SciCode, GPQA Diamond, Humanity's Last Exam dan sejenisnya, yang kesemuanya bukan tugas citra. Jadi, vendor mengklaim bahwa penambahan pelatihan visual pada backbone bersama meningkatkan kecerdasan sisi-teks model sebesar empat poin, bukan sekadar bahwa model kini dapat mendeskripsikan gambar. Itu adalah klaim yang mencolok dan sepenuhnya masuk akal — penyetelan instruksi multimodal umumnya meningkatkan kemampuan teks.

Dua peringatan terkait sumber data menjaga angka itu tetap proporsional. Pertama, 38 adalah angka dari generasi indeks yang lebih lama: Artificial Analysis sejak itu memindahkan papan langsungnya ke versi indeks yang lebih baru (v4.3), yang saat ini mencantumkan Ling 3.0 Flash dengan perkiraan 25 sementara masih menempatkannya di peringkat pertama di antara 63 model di kelasnya. Pasangan 42-vs-38 dari vendor tersebut berada pada skala yang lebih lama, jadi tidak boleh dibaca sebagai "empat poin di atas skor AA untuk model teks saat ini." Kedua, angka 42 adalah angka yang dikeluarkan oleh inclusionAI sendiri untuk model yang belum dicantumkan oleh Artificial Analysis, dan inclusionAI belum memublikasikan hasil checkpoint VL pada suite teks individual (SWE-Bench, Terminal-Bench) yang dalam bagan model teksnya sendiri ditampilkan secara terpisah. Empat poin adalah persis besarnya peningkatan yang ingin Anda reproduksi sebelum Anda memigrasikan pipeline khusus teks berdasarkan kekuatan angka tersebut.

A screenshot of the Artificial Analysis model page for Ling 3.0 Flash, showing the heading 'Ling 3.0 Flash — Intelligence, Performance & Price Analysis', 'Released August 2026', an estimated 25 on the Artificial Analysis Intelligence Index with a #1-of-63 rank in its class, pricing near $0.07 per 1M input and $0.22 per 1M output tokens, roughly 313 output tokens per second, and technical specs listing text-only input, a 262k context window, and 124B total / 5.1B active parameters.

Harga: yang satu memiliki harga daftar, yang lainnya tidak.

Perbandingan biaya saat ini hanya berisi satu harga di dalamnya. Ling 3.0 Flash dapat dipanggil hari ini melalui API pihak pertama vendor dengan harga sekitar $0,07 per 1M input dan $0,22 per 1M output — harga yang ditetapkan vendor, dikonfirmasi pada daftar Artificial Analysis — dengan input yang di-cache lebih murah, dan diskon masa peluncurannya telah berakhir. Ling-3.0-flash-VL tidak memiliki harga API yang dipublikasikan di mana pun; Anda belum dapat membayar per token untuk model tersebut. Jika Anda menginginkannya minggu ini, Anda harus meng-host sendiri: bobot MIT sekitar 250 GB dalam BF16, pada kelas perangkat keras yang sama yang sudah dibutuhkan model teks — 4× GPU 141GB (H20-3e atau H200) atau node Blackwell 4-GPU dengan tensor-parallel 4, atau 8× H100/H800 80GB pada TP8.

{{1}}Hal itu mengubah kerangka ekonomi bagi tim yang hanya berfokus pada teks.{{/1}} {{2}}Jika Anda membeli token, model teks seharga $0.07/$0.22 itu murah dan sudah terbukti.{{/2}} {{3}}Jika Anda sudah menghosting sendiri model teks 124B, checkpoint VL bukanlah pembelian infrastruktur kedua — melainkan tambahan ~250 GB bobot pada kelas server yang sama, yang hanya setimpal untuk beban kerja yang benar-benar mengonsumsi piksel.{{/3}} {{4}}Model yang memiliki mata hanya akan terbayar ketika mata benar-benar terlibat dalam proses.{{/4}}

Siapa yang harus memilih yang mana

Khusus teks dan volume tinggi — tetap gunakan Ling 3.0 Flash. Anda mendapatkan model yang terbukti, terdaftar AA, harga per-token yang nyata, dan pemanggilan alat yang matang. Kenaikan indeks empat poin model VL tidak dapat direproduksi dan throughput sisi teksnya tidak terukur; belum ada bukti bahwa model tersebut lebih baik untuk teks, hanya klaim belaka.

Visi memasuki loop — dokumen, tangkapan layar, bagan, foto, bingkai video, atau UI yang harus dibaca dan diklik oleh agen Anda — Ling-3.0-flash-VL adalah pilihan yang jelas, karena ia adalah fondasi penalaran yang sama dengan yang sudah Anda pahami, dengan tambahan stack visi, bukan model multimodal terpisah yang harus Anda evaluasi ulang dari awal.

Trafik campuran, belum diputuskan — langkah berisiko rendah adalah menjaga keduanya tetap dapat diakses dan merutekan berdasarkan permintaan, bukan merombak arsitektur untuk salah satunya. Itulah properti yang model gateway ada untuk berikan: satu API untuk 200+ model, harga daftar penyedia diteruskan dengan markup 0%, dan failover otomatis saat penyedia mengalami penurunan kinerja. Kedua checkpoint Ling belum ada yang berada di belakang endpoint OrcaRouter — harga model teks adalah harga milik vendor itu sendiri dan model VL belum memiliki harga terhosting sama sekali — tetapi ketika model VL mendapatkannya, memindahkan sebagian trafik ke model itu dan mengukurnya adalah perubahan konfigurasi, bukan proyek integrasi.

Apa yang masih kurang?

• Sebuah pengujian independen terhadap Ling-3.0-flash-VL pada Indeks Kecerdasan Artificial Analysis saat ini — angka 42 adalah klaim inclusionAI untuk versi indeks sebelumnya.

• Harga API yang di-hosting untuk model VL, yang merupakan penghalang terbesar untuk adopsi kasual.

• Menerbitkan split khusus teks (SWE-Bench Pro, Terminal-Bench 2.1) untuk checkpoint VL, sehingga tim yang fokus pada teks dapat memverifikasi bahwa tumpukan visi tidak merugikannya.

• Angka latensi ujung-ke-ujung atau throughput untuk VL di bawah beban gambar — kecepatan model teks diukur; kecepatan model visi tidak diukur.

Konfirmasi netral terhadap bagan tolok ukur visi, yang sebagian dijalankan pada kerangka uji milik inclusionAI sendiri dan setidaknya satu tolok ukur internal dijadwalkan untuk dirilis kemudian.

Putusan

Ini bukan kontes kualitas model; ini adalah keputusan modalitas dengan klaim empat poin yang terlampir. Jika input Anda berupa teks, pertahankan Ling 3.0 Flash — lebih murah, terdaftar AA, dan terukur, dan keunggulan model VL atasnya saat ini hanyalah angka dari vendor pada skala indeks yang lebih lama. Jika beban kerja Anda berawal dari layar — halaman dokumen, tangkapan layar, bagan, bingkai video, GUI yang harus dioperasikan agen Anda — Ling-3.0-flash-VL adalah otak 124B yang sama yang sudah Anda pahami, kini mampu melihat, dan itu adalah opsi yang benar-benar baru yang tidak ada di tier cepat Ling seminggu lalu. Adopsi di tempat yang benar-benar membutuhkan visi, validasi 42 itu sebelum Anda memigrasikan apa pun atas dasar kekuatannya, dan pertahankan pilihan tetap dapat dibalik di lapisan perutean sampai skor independen dan harga daftar tiba.