
Ling-3.0-flash-VL: Ant membuka model multimodal pada lini Ling yang cepat
- deepseekBARUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiBARUOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleBARUGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenBARUQwen: Qwen3.8 Max (0902)2026-09-0240Kecerdasan72Koding
- anthropicBARUAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0340Kecerdasan72Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Kecerdasan78Koding
- googleGoogle: Gemini 3.6 Flash2026-07-2134Kecerdasan69Koding
Pada tanggal 4 September 2026, laboratorium inclusionAI milik Ant Group menerbitkan bobot berlisensi MIT untuk Ling-3.0-flash-VL di Hugging Face dan, pada hari yang sama, memperbarui dokumentasi pengembang platform Ant Ling agar sesuai. Ling-3.0-flash-VL adalah checkpoint pertama yang mampu memproses visi dalam keluarga Ling-3.0-flash: tulang punggung sparse mixture-of-experts dengan sekitar 124 miliar parameter yang sama yang membuat Ling-3.0-flash khusus teks menjadi salah satu model penalaran murah yang paling banyak dibicarakan di akhir musim panas, kini membaca gambar dan klip video pendek serta teks. Kuantisasi FP8 menyusul pada tanggal 8 September, pagi hari ketika tulisan ini dibuat. Jadi dalam empat hari, rilis ini memperoleh tiga permukaan yang dapat ditindaklanjuti pembaca — bobot terbuka, API resmi di platform Ling milik Ant, dan skor 42 yang dilaporkan vendor pada protokol Artificial Analysis Intelligence Index versi 4.1.1, empat poin di atas skor 38 yang diukur secara independen dari saudara teksnya. Yang belum diperolehnya adalah pengumuman resmi: kartu Hugging Face dan tutorial pengembang adalah seluruh peluncurannya, itulah sebabnya tulisan ini memisahkan apa yang dinyatakan vendor dari apa yang dapat diverifikasi oleh pihak luar.
Rilis ini penting karena pengaruhnya terhadap peta produk Ant. Hingga pertengahan 2026, pekerjaan multimodal dalam portofolio model Ant berada di lini Ming yang terpisah, sementara Ling-3.0-flash diposisikan — termasuk dalam penjelasan blog ini untuk model teks — sebagai tingkat teks-dan-alat yang cepat untuk agen, pengodean, dan riset mendalam. Ling-3.0-flash-VL meruntuhkan batas tersebut: ia membawa informasi visual ke dalam model penalaran yang dibangun dengan jejak parameter aktif yang sangat kecil dan eksekusi agen yang panjang, serta menyerahkan hasilnya kepada pengembang melalui tiga cara sekaligus. Itu menjadikannya keputusan yang benar-benar berbeda dari varian domain-tuned sebelumnya (Ling-3.0-flash-Fin, Ling-3.0-flash-Sante), yang dirilis sebagai API gratis tanpa bobot. Yang satu ini terbuka, berjalan di platform berbayar Ant, dan masih cukup muda sehingga belum ada orang di luar vendor yang memublikasikan uji coba independen. Fakta terakhir itulah yang paling penting dalam tulisan ini.
Apa yang dirilis, dan kapan
Setiap tanggal di bawah ini dapat diperiksa dari repositori dan dokumen; tidak ada satu pun yang bertumpu pada siaran pers yang tidak ada.
• 4 September — repositori Hugging Face inclusionAI/Ling-3.0-flash-VL dibuat pada pukul 15:24 UTC dengan 64 shard bobot bf16, tumpukan kode khusus lengkap untuk bailing_moe_v3_vl arsitektur, templat obrolan dengan pemikiran yang aktif secara bawaan, dan lisensi MIT. Jumlah unduhan masih puluhan saat tulisan ini dibuat: ini adalah rilis yang hanya akan terlihat oleh pengawas repositori pada hari pertama.
• 4 September — Portal pengembang platform Ling milik Ant menambahkan tutorial pemahaman multimodal yang mendokumentasikan model pada API resmi (stempel "pembaruan terakhir" di halaman tersebut bertanggal 4 September 2026). Media pengembang Tiongkok melaporkan kemampuan tersebut pada hari berikutnya, menggambarkannya sebagai pemahaman gambar dan video pendek untuk tanya-jawab visual dan analisis konten.
• Mulai 5 September — dukungan serving dan deployment muncul dengan cepat: cookbook deployment SGLang untuk model tersebut, fork vLLM kustom yang dikelola oleh organisasi inclusionAI, serta daftar pustaka deployment bring-your-own-weights dengan endpoint chat-completions yang siap pakai. Ini semua adalah runtime dan infrastruktur, bukan pengumuman, tetapi menunjukkan bahwa model ini memang dibuat untuk disajikan, bukan sekadar dipublikasikan.
• 8 September — kuantisasi FP8 inclusionAI/Ling-3.0-flash-VL-fp8 hadir (64 shard, ~126 GB), dengan menara visi yang sengaja dipertahankan pada presisi lebih tinggi sementara bobot MoE dikompresi ke FP8 E4M3. Untuk self-hosting pada GPU yang lebih sedikit atau lebih kecil, ini adalah checkpoint yang sebenarnya akan diunduh kebanyakan orang.

Kartu di atas adalah hal yang paling mendekati posting peluncuran untuk rilis ini — deskripsi model, arsitektur, tautan ke resep SGLang dan vLLM, dan tidak ada pengumuman di tempat lain yang dapat kami temukan. Perhatikan ketidakcocokan yang perlu ditandai sejak awal: kartu model menyebutkan "hanya 5.5B parameter yang diaktifkan per token", sementara buku resep SGLang yang ditulis sekitar rilis yang sama menggambarkan model "5.1B aktif". Pada checkpoint yang benar-benar baru, perbedaannya kemungkinan berasal dari penghitungan vision tower, bukan karena dua model yang berbeda, tetapi ini persis jenis detail yang seharusnya diberi label belum pasti, bukan dirapikan.
Model 124B yang mengaktifkan 5.5B — kini dengan mata
Ling-3.0-flash-VL mempertahankan resep sparse-MoE hibrida yang menjadi ciri khas saudara teksnya. Kartu tersebut menjelaskan backbone 42 lapisan yang bergantian antara lapisan Kimi-Delta-Attention dan Gated-MLA dengan rasio 5:1 — ritme struktural yang sama dengan Ling-3.0-flash — dengan total parameter sekitar 124,8 miliar dan hanya sebagian kecil yang aktif per token. Yang baru adalah tumpukan persepsi: encoder visual ViT yang memberi makan proyektor MLP dua lapis ke dalam backbone bahasa, plus VideoRoPE untuk mengkodekan posisi spasial dan temporal sehingga bingkai video tiba dengan urutan yang dapat dipahami model. Input adalah teks, gambar, dan video; output adalah teks.
• Parameter — total 124B, ~5.5B diaktifkan per token menurut kartu vendor (lihat catatan akuntansi di atas).
Konteks — diiklankan sebagai "hingga 1M token"; resep deployment yang ada saat ini menggunakan 256K melalui penskalaan rope YaRN, yang merupakan angka praktis yang jujur untuk dijadikan acuan perencanaan sampai seseorang memublikasikan uji coba lebih panjang yang terverifikasi.
• Thinking — penalaran aktif secara default melalui template chat; baik contoh API resmi maupun resep penyajian menunjukkan sakelar per-permintaan enable_thinking: false untuk panggilan yang sensitif terhadap latensi.
• Lisensi — MIT, kedua format presisi, tanpa klausul tambahan. Ini adalah lisensi bersih yang sama yang membuat open-sourcing model teks pada bulan Agustus menjadi terkenal, dan inilah alasan utama mengapa self-hosting menjadi opsi yang realistis, bukan area abu-abu.
Niat desain sama pentingnya dengan lembar spesifikasi. Ant memposisikan Ling-3.0-flash-VL sebagai model yang "menghadirkan informasi visual ke dalam proses lengkap pemahaman, penalaran, tindakan, dan verifikasi" — yang merupakan bahasa untuk beban kerja agen, bukan pelabelan gambar. Model yang dapat menonton rekaman layar 30 detik, mempertahankan sesi pemanggilan alat yang panjang dalam konteks, dan menjaga biaya aktivasi tetap dekat dengan 5 miliar parameter diarahkan tepat pada agen penggunaan komputer dan agen berbasis video pendek. Itu adalah produk yang berbeda dari model visi-bahasa yang dioptimalkan untuk tanya-jawab gambar tunggal, dan itulah kerangka yang harus digunakan untuk membaca setiap tolok ukur di bawah ini.
Apa yang sebenarnya diterima oleh API resmi
Tutorial platform Ant Ling mendokumentasikan Ling-3.0-flash-VL pada dua bentuk API: endpoint yang kompatibel dengan OpenAI di api.ant-ling.com/v1/chat/completions dan endpoint yang kompatibel dengan Anthropic di api.ant-ling.com/anthropic/v1/messages. Batasan-batasan ini perlu diketahui sebelum Anda membangun di atasnya:
• Gambar — JPEG dan PNG, hanya base64, hingga 40 gambar per permintaan, setiap gambar hingga 16.384 × 784 piksel dan setiap string base64 hingga 32 MB. Parameter image_url.detail yang kompatibel dengan OpenAI diabaikan; mesin menentukan resolusi secara internal.
• Video — MP4, MOV atau WMV, satu klip per permintaan, dibatasi maksimal 30 detik, diambil sampel pada kecepatan tetap 2 frame per detik hingga 32 frame, base64 hingga 32 MB. Video hanya berfungsi pada endpoint yang kompatibel dengan OpenAI; endpoint yang kompatibel dengan Anthropic menerima teks dan gambar tetapi tidak menerima video.
• Identifikasi model — contoh curl di tutorial menyebut model Ling-3.0-flash-VL-rc1 alih-alih Ling-3.0-flash-VL. Akhiran -rc1 itu adalah penanda kandidat rilis dan pertanyaan terbuka yang sebenarnya: tidak ada satu pun dalam dokumentasi yang menyebutkan bobot mana yang dilayani platform atau apakah checkpoint API sesuai dengan build bobot terbuka 4 September. Jika Anda mengevaluasi API terhadap bobot terbuka, itulah hal pertama yang harus diuji, bukan asumsi yang dibuat.

Halaman di atas adalah tempat batasan-batasan input berada — format gambar dan video, batas per permintaan, dan dua bentuk endpoint. Di sana juga model dikonfirmasi sebagai penawaran API komersial yang aktif, bukan sekadar stub yang hanya ada di dokumentasi.
Angka-angka — dan siapa yang melaporkannya

Satu angka utama pada kartu model tersebut adalah 42 pada protokol Artificial Analysis Intelligence Index versi 4.1.1, yang menurut Ant unggul empat poin dari skor 38 milik Ling-3.0-flash yang hanya berteks. Perbedaan dalam kalimat itu sangat krusial. Angka 38 adalah hasil pengukuran Artificial Analysis — dijalankan secara independen, dipublikasikan di papan peringkat mereka, dan dikutip dengan positif di berbagai liputan industri tentang model teks tersebut. Angka 42 adalah klaim pada kartu model Ant sendiri, dibuat berdasarkan protokol indeks AA tetapi belum dicantumkan oleh Artificial Analysis, yang hingga tulisan ini dibuat belum memiliki halaman untuk Ling-3.0-flash-VL. Belum ada siapa pun di luar Ant yang menjalankan checkpoint ini. Anggap saja 42 sebagai angka dari vendor, dari keluarga yang sama yang menghasilkan angka 38 asli pada model teks — alasan untuk melihat, bukan angka yang layak dikutip sebagai angka yang mapan.
Segala hal lain dalam rilis ini bersifat kualitatif atau metodologis. Kartu model tersebut menggambarkan model ini melalui bagan kapabilitas "pahami, nalar, bertindak" dan mengisyaratkan evaluasi Terminal-Bench agentik yang dijalankan dengan protokol bergaya AA, tetapi tidak memublikasikan hasil teks numerik yang dapat kami reproduksi di sini; buku panduan penerapan mencantumkan sel akurasi (MMMU-Pro, GSM8K) yang terkait dengan konfigurasi penyajian tertentu yang layak dibaca, tetapi pengukuran tersebut lebih bersifat infrastruktur daripada evaluasi independen. Ringkasan jujurnya singkat: model penalaran yang masuk akal, murah untuk disajikan, dan berkemampuan visi, tetapi belum ada papan skor independen publik.
Berapa biayanya, dan apa yang disarankan oleh riwayat keluarga
Tutorial multimodal Ant tidak mencantumkan harga per token untuk Ling-3.0-flash-VL, jadi semua hal di sini adalah inferensi, dengan label yang jelas demikian. Acuan yang berguna adalah padanan teksnya di platform yang sama: harga resmi pihak pertama Ling-3.0-flash sekitar $0,075 per 1 juta token input dan $0,22 per 1 juta output, dengan pembacaan cache sekitar 80% lebih murah, dan konsol Tiongkok menetapkan harganya dalam renminbi (¥0,40 input / ¥1,20 output per 1 juta token) setelah promosi awal diskon 75% yang berakhir pada 31 Agustus. Model multimodal 124B-A5.5B lebih mahal untuk dijalankan daripada model teks 124B-A5.1B — menara visi bersifat padat dan berjalan untuk setiap token gambar — jadi harga pada atau sedikit di atas kisaran tersebut adalah prior yang masuk akal. Sejarah keluarga ini juga menunjukkan arah sebaliknya: varian domain Fin dan Sante diluncurkan sebagai API gratis, sehingga Ant telah menunjukkan bahwa mereka akan menggunakan harga nol untuk menyemai adopsi varian Ling yang ingin mereka hadirkan ke pasar. Apakah VL mengikuti kisaran model teks berbayar atau pola varian gratis, hal itu sama sekali belum menjadi informasi publik.
Untuk rute self-host, angka-angkanya konkret karena file-nya publik. Rilisan bf16 kira-kira merupakan unduhan 250 GB yang tersebar di 64 shard — kebutuhan multi-GPU kecuali pada node tunggal terbesar — sementara rilisan FP8 (~126 GB, vision tower tetap dalam bf16) muat dengan nyaman pada node dengan 8 akselerator kelas 80 GB dan merupakan versi yang sebenarnya akan dijalankan oleh sebagian besar tim. Klaim throughput dari serving cookbook memang ada, tetapi berasal dari pihak yang dekat dengan vendor; perkirakan peringatan umum bahwa token/s sesungguhnya bergantung pada perangkat keras dan batch Anda.
Di mana lapisan routing cocok — sejujurnya
Saat peluncuran, tidak ada gateway model pihak ketiga besar yang kami periksa mencantumkan Ling-3.0-flash-VL, dan OrcaRouter — platform routing tempat blog ini berada — juga tidak melayaninya. Tidak ada satu pun hal dalam tulisan ini yang boleh dibaca seolah-olah ia melayani model tersebut. Itulah keadaan jujur dari sebuah model yang baru berusia empat hari, dan penting untuk disampaikan secara terus terang karena opsi yang benar-benar dimiliki pembaca saat ini hanya ada dua: memanggil API resmi Ant, atau melakukan self-host terhadap bobot MIT. Sudut pandang routing adalah apa yang terjadi selanjutnya. Begitu model seperti ini mencapai layanan pihak ketiga, ekonomi router pass-through menjadi alasan untuk lebih memilihnya dalam evaluasi: harga daftar penyedia diteruskan dengan markup 0%, sehingga penurunan harga vendor (atau eksperimen tier gratis seperti peluncuran Fin dan Sante) langsung aktif pada hari yang sama saat diumumkan, dan failover otomatis memungkinkan Anda mengarahkan workload nyata ke model open yang baru berumur beberapa hari tanpa mempertaruhkan seluruh stack pada uptime satu vendor atau perilaku satu checkpoint. Untuk sebuah keluarga yang telah menetapkan ulang harganya sekali dan terpecah menjadi empat varian dalam enam minggu, ini bukan sekadar hipotetis — ini adalah perbedaan antara menguji ulang secara manual setiap kali Ant bergerak versus menguji ulang sekali melalui satu API.
Apa yang harus ditonton
Rilis ini masih cukup baru sehingga sinyal yang berguna sebagian besar merupakan pemeriksaan yang dapat dijalankan siapa pun. Pertama, apakah Artificial Analysis (atau laboratorium independen lain) mencantumkan Ling-3.0-flash-VL dan mengonfirmasi atau mengoreksi angka 42 — satu titik data itu memisahkan "model terbaik keluarga" dari "angka vendor lain". Kedua, apakah -rc1 pengidentifikasi pada API resmi mengarah ke bobot terbuka 4 September; jika tidak, API dan jalur self-host adalah model yang berbeda dan setiap perbandingan yang Anda baca perlu menyebutkan model mana yang digunakan. Ketiga, harga: tarif VL yang dipublikasikan di platform Ling, dan apakah tarif tersebut mengikuti jalur berbayar model teks atau pola API gratis Fin/Sante. Keempat, apakah checkpoint FP8 mempertahankan akurasi kartu dalam pelayanan nyata — menara visi yang dipertahankan dalam bf16 adalah tanda yang baik, tetapi klaim visi terkuantisasi membutuhkan uji coba, bukan konfigurasi. Dan kelima, pertanyaan peta produk: dengan visi kini berada di dalam lini Ling yang cepat, perhatikan apakah Ant mempertahankan Ming sebagai merek multimodal terpisah atau membiarkan keduanya menyatu.
Bagi pengembang, jawaban jangka pendeknya singkat. Jika Anda ingin membangun di atas ini hari ini, API resmi adalah jalur tanpa infrastruktur, dan bobot FP8 adalah jalur self-host, dan keduanya sudah nyata sejak minggu ini. Jika Anda ingin membangun di atas angka 42, tunggulah seseorang di luar Ant untuk mereproduksinya. Segala hal yang benar-benar berguna tentang Ling-3.0-flash-VL — bobot MIT, arsitektur yang masuk akal, desain harga-per-aktivasi yang agresif, dan skor vendor yang patut diperhitungkan — sudah tersedia; segala hal yang akan menjadikannya default yang aman masih belum tuntas.
