Kartu judul yang membandingkan Ling-3.0-flash-VL dan DeepSeek V4 Flash Vision Exp, menampilkan Ling dengan total 124B dan 5,5B parameter aktif dengan jendela konteks 262K, dibandingkan dengan DeepSeek V4 Flash Vision Exp dengan sekitar 305B parameter, jendela konteks 1M token, dan output maksimum 384K, dengan catatan kaki bahwa indeks Ling bersumber dari Artificial Analysis dan angka DeepSeek dilaporkan oleh vendor.
Guides & Insights

Ling-3.0-flash-VL vs DeepSeek V4 Flash Vision Exp: Dua Taruhan pada Visi Terbuka

Penulis

Rowan Sterling

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Ling-3.0-flash-VL dan DeepSeek V4 Flash Vision Exp adalah dua model visi berbobot terbuka di kelas bobot ini yang secara realistis dapat diunduh dan dilayani sendiri oleh sebuah tim saat ini, dan keduanya dibangun oleh orang-orang yang tidak sepakat tentang untuk apa visi itu digunakan. Ling-3.0-flash-VL, dari lab inclusionAI milik Ant Group, mengaktifkan sekitar 5,5B dari 124B parameternya per token dan memperlakukan visi sebagai sesuatu yang diterapkan di dalam lingkaran umpan balik — hasilkan, render, lihat, koreksi — dengan biaya inferensi serendah mungkin. DeepSeek V4 Flash Vision Exp, build multimodal pertama DeepSeek, memadukan jendela konteks 1M token dengan output maksimum 384K token dan memperlakukan visi sebagai satu input lagi yang dibaca agen dalam perjalanannya menyelesaikan pekerjaan panjang. Yang satu dioptimalkan untuk betapa murahnya berpikir. Yang lain dioptimalkan untuk seberapa banyak yang bisa ditampungnya saat melakukannya.

Perbedaan itulah, bukan selisih benchmark, yang seharusnya mendorong pilihan. Kedua model tidak memiliki protokol evaluasi bersama untuk dibandingkan, dan hanya satu di antaranya yang memiliki skor independen sama sekali. Berikut ini bentuk jujur dari pertarungannya: taruhan arsitektur, spesifikasi yang benar-benar berbeda, situasi benchmark termasuk mengapa minim, berapa biaya masing-masing, dan mana yang menang untuk pekerjaan yang mana — ditambah bagian di mana kami menyatakan dengan jelas mana dari keduanya yang ada di katalog kami.

Kedua taruhan tersebut, dinyatakan secara tepat

Sisi Ling dari ini adalah taruhan pada sparsitas aktivasi sebagai tuas biaya utama. Ling-3.0-flash-VL adalah sparse mixture-of-experts dengan total 124B parameter — kartu model menunjukkan sekitar 124,8B, dan cookbook SGLang menyebut 5,1B aktif sedangkan kartu menyatakan kira-kira 5,5B — yang menjalankan trunk hibrida 42 lapis yang bergantian antara Kimi Delta Attention dan blok MLA bergerbang dengan rasio 5:1. Encoder visi resolusi arbitrer dan proyektor MLP dua lapis memasok trunk tersebut, dengan VideoRoPE menangani posisi spasial dan temporal sehingga frame video berada dalam urutan yang koheren. Konsekuensi arsitekturnya adalah model yang biaya menjalankannya per token hanya sebagian kecil dari 124B padat, dan itulah alasan utamanya muncul di frontier kecerdasan versus parameter aktif.

The Deep​Seek side is a bet on context and agentic endurance. DeepSeek V4 Flash Vision Exp takes the DeepSeek-V4-Flash text architecture and adds a vision encoder and an aligner, then continues training — one source puts the result around 305B parameters, which Deep​Seek has not confirmed in detail. It carries a 1,048,576-token context window and 384,000 tokens of maximum output, supports JSON output, tool calls, the Responses API, the Anth​ropic API and conversation-prefix continuation, and Deep​Seek has been explicit that this is not a visual question-answering model. It is perception for agents: reading web screenshots, software interfaces and charts, then continuing into tool calls. Images are converted to tokens and billed as such, capped at 384 tokens per image.

Baca kedua paragraf itu bersama-sama dan bentuk keputusannya akan tampak. Jika beban kerja Anda adalah "lihat ini, putuskan sesuatu, bertindak, lihat lagi," jumlah parameter aktif Ling-lah yang membuat loop itu terjangkau, dan desain umpan balik visinya ditujukan tepat untuk hal itu. Jika beban kerja Anda adalah "baca dokumen 400 halaman ini yang berisi gambar dan terus lanjut," jendela konteks Deep​Seek adalah fiturnya, dan tidak ada apa pun di sisi Ling yang menandinginya.

Mengapa perbandingan benchmark lebih tipis daripada yang terlihat

Ini adalah bagian yang paling sering dilewati oleh perbandingan, dan melewatkannya menghasilkan tabel angka yang tidak berarti apa-apa. Berikut adalah keadaan bukti yang sebenarnya.

Ling-3.0-flash-VL memiliki satu pengukuran independen: 25 pada Artificial Analysis Intelligence Index v4.3, berada di peringkat #2 dari 64 di kelas ukurannya, dibandingkan dengan median kelas sebesar 8. Kartu vendor secara terpisah mengklaim 42 pada protokol Intelligence Index v4.1.1, yang merupakan skala yang sudah tidak digunakan dan tidak dapat dibandingkan — perlakukan 42 sebagai tidak direproduksi.

DeepSeek V4 Flash Vision Exp tidak memiliki halaman Artificial Analysis sama sekali. Setiap angka yang diterbitkan untuknya adalah milik Deep​Seek sendiri, dari pengumuman peluncuran, dan beberapa di antaranya secara eksplisit relatif terhadap Opus-4.8, bukan terhadap protokol tetap. Itu bukan kritik terhadap angka-angka itu; itu adalah pernyataan tentang apa yang dapat Anda lakukan dengan angka-angka itu. Anda tidak dapat menempatkan model yang dinilai secara independen dan model yang dinilai hanya oleh vendor dalam kolom yang sama lalu menyatakan pemenang, dan halaman mana pun yang melakukannya sedang merekayasa hasil.

Yang sah adalah membandingkan setiap model dengan catatan yang dilaporkannya sendiri, dengan asal-usul yang dilampirkan:

• Ling-3.0-flash-VL, independen — Intelligence Index 25 pada v4.3, #2 dari 64 di kelas, median kelas 8, menurut Artificial Analysisbr /> • Ling-3.0-flash-VL, vendor — 42 pada protokol v4.1.1 yang telah dihentikan, dan 1,441 versus 1,440 milik GPT-5.4 di Image-to-WebDev Arena sebagai "linthium"; keduanya dilaporkan vendor dan selisih arena berada dalam noise Elobr /> • DeepSeek V4 Flash Vision Exp, vendor — Terminal Bench 2.1 83.9; DeepSWE 59.3 melawan 58.0 milik Opus-4.8; Agents' Last Exam 27.3 melawan 25.7 milik Opus-4.8; Toolathlon-Verified 75.9; Cybergym 75.3; Chartography 64.3; NL2Repo 57.7; DSBench-Hard 63.6; ZeroBench Pass@5 35.0; ApexBench Pass@1 36.5; AutomationBench 25.7br /> • DeepSeek V4 Flash Vision Exp, independen — tidak ada yang dipublikasikan

Perhatikan bahwa daftar DeepSeek sebagian besar terdiri dari: evaluasi agentik dan rekayasa perangkat lunak, bukan evaluasi visi. Cara DeepSeek sendiri membingkainya adalah bahwa pada tugas teks murni, model visi tersebut menyamai DeepSeek-V4-Flash resmi tanpa regresi, dan bahwa keuntungannya ada pada benchmark agen multimodal — di mana DeepSeek menggambarkan hasilnya sebagai mendekati Opus-4.8, bukan mengalahkannya, dan mengakui selisih sekitar sepuluh poin pada tugas terstruktur data-sains dan kode, yaitu NL2Repo dan DSBench-Hard. Itu adalah rangkaian klaim yang luar biasa hati-hati, dan itu memberi tahu Anda bahwa model ini dijual sebagai peningkatan persepsi untuk stack agen yang ada, bukan sebagai plafon baru.

A two-column comparison scoreboard for Ling-3.0-flash-VL and DeepSeek V4 Flash Vision Exp across six shared dimensions: Intelligence Index 25 on v4.3 versus none published, active parameters 5.5B versus undisclosed, context window 262K versus 1M tokens, max output tens of thousands versus 384K, license MIT versus MIT, and independent score yes versus none, with a footer noting the Ling figure is per Artificial Analysis and all DeepSeek figures are vendor-reported.

Spesifikasi yang justru berbeda

Sebagian besar isi kedua lembar spesifikasi itu sama: keduanya berbobot terbuka di bawah MIT, keduanya menerima teks dan gambar sebagai masukan dan mengembalikan teks, keduanya menyediakan bobot BF16 dengan build terkuantisasi, keduanya telah menerbitkan resep serving, dan keduanya menangani video dalam suatu bentuk. Perbedaannya terkonsentrasi di empat tempat.

• Parameter — Ling-3.0-flash-VL berukuran total 124B dengan sekitar 5.5B aktif per token; DeepSeek V4 Flash Vision Exp dilaporkan sekitar 305B tanpa angka parameter aktif yang dipublikasikanbr /> • Jendela konteks — Ling-3.0-flash-VL memiliki 262K token menurut Artificial Analysis, dibandingkan dengan 256K yang dinyatakan oleh kartu modelnya sendiri; DeepSeek V4 Flash Vision Exp menjalankan 1,048,576 token secara nativebr /> • Output maksimum — Ling-3.0-flash-VL jauh lebih pendek, dalam kisaran puluhan ribu token; DeepSeek V4 Flash Vision Exp mencapai 384,000br /> • Penanganan gambar — Ling-3.0-flash-VL menerima hingga 40 gambar per permintaan dengan ukuran hingga 16,384 × 784 piksel per gambar, hanya base64; DeepSeek V4 Flash Vision Exp menerima base64, URL eksternal, atau referensi Files API, dan membatasi biaya gambar pada 384 token per gambarbr /> • Parameter aktif — Ling-3.0-flash-VL mengaktifkan sekitar 5.5B per token; DeepSeek V4 Flash Vision Exp tidak memublikasikan angka parameter aktif

Baris penanganan gambar justru yang sering diremehkan. Batas keras 384 token per gambar berarti diagram yang padat atau tangkapan layar satu halaman penuh dikompresi ke sekitar anggaran yang sama dengan thumbnail — murah, dan lossy dengan cara yang berdampak pada tugas pembacaan yang teliti. Pendekatan Ling justru sebaliknya: anggaran piksel per gambar yang sangat besar, transportasi hanya base64, dan karenanya payload permintaan jauh lebih berat. Mana yang lebih baik sepenuhnya bergantung pada apakah gambar Anda adalah foto dokumen yang perlu dibaca secara presisi, atau tangkapan layar UI yang perlu dipahami secara perkiraan.

Baris kedua yang kurang dihargai adalah output maksimum. Batas puluhan ribu token Ling-3.0-flash-VL tidak masalah untuk loop deskripsikan-lalu-perbaiki dan menjadi kendala bagi apa pun yang ingin mengeluarkan artefak besar — file yang dihasilkan panjang, penulisan ulang dokumen lengkap, diff ribuan baris. Output 384K DeepSeek ada justru karena beban kerja yang dimaksudkan berakhir pada hasil tool-call yang besar atau artefak yang dihasilkan. Jika pipeline Anda mengharapkan model mengembalikan sesuatu yang panjang, baris tunggal itu menentukan pertandingan sebelum benchmark mana pun melakukannya.

Harga, dan perbedaan antara gratis dan tidak diberi harga

DeepSeek V4 Flash Vision Exp memiliki angka nyata di katalog kami: $0,24 per 1 juta token masukan dan $0,73 per 1 juta token keluaran, dengan jendela konteks 1.048.576 token dan keluaran maksimum 384.000 token, dapat diakses sebagai deepseek/deepseek-v4-flash-vision-exp. Itu tarif yang dipublikasikan, ditagih dengan cara yang sama seperti V4-Flash teks, dengan gambar dikonversi menjadi token hingga 384 per gambar. Ini tarif yang bisa Anda masukkan ke spreadsheet.

Ling-3.0-flash-VL tidak memilikinya. Halaman Artificial Analysis mencantumkannya sebesar $0,00 per 1 juta token input dan $0,00 per 1 juta token output dibandingkan median para pesaingnya sebesar $0,14 dan $0,40 — tetapi itu mencerminkan uji coba gratis yang berjalan di Ling Studio milik Ant, bukan tarif resmi. Dokumentasi multimodal Ant tidak menerbitkan harga per token untuk model visi tersebut, sehingga tidak ada acuan untuk memverifikasi angka nol itu. Varian saudaranya yang hanya berbasis teks, Ling-3.0-flash, dicantumkan sekitar $0,075 per 1 juta token input dan $0,22 per 1 juta token output, dan rilis Ling khusus domain dari Ant diluncurkan sebagai API gratis, yang menyiratkan bentuk akhir yang serupa — tetapi sebuah dugaan bukanlah harga.

Bandingkan keduanya secara jujur dan perbandingan biayanya adalah: satu model memiliki tarif, yang lain memiliki jendela promosi dan perkiraan yang masuk akal. Siapa pun yang menyatakan Ling-3.0-flash-VL lebih murah daripada DeepSeek V4 Flash Vision Exp sedang membandingkan uji coba gratis dengan harga daftar. Pernyataan yang dapat dipertahankan adalah bahwa Ling-3.0-flash-VL kemungkinan besar akan lebih murah per token setelah harga ditetapkan, karena 5,5B parameter aktif adalah keunggulan struktural yang tidak dapat dihapus oleh perubahan tarif apa pun — dengan catatan bahwa verbositas Ling-3.0-flash-VL menggerogoti keunggulan itu. Artificial Analysis mencatatnya membakar 160M token output pada Intelligence Index, berada di peringkat #8 dari 64 dibandingkan median 84M dan diberi label "very verbose." Anda membayar per token yang dihasilkan, jadi model yang mengatakan hampir dua kali lebih banyak untuk mencapai jawaban yang sama mengembalikan sebagian dari apa yang dimenangkan oleh aktivasi sparse-nya.

Yang mana, untuk apa

Pohon keputusan yang jujur bercabang berdasarkan konteks dan panjang keluaran sebelum bercabang berdasarkan hal lain apa pun, karena itulah dimensi-dimensi tempat kedua model tidak dapat saling menggantikan.

Pilih DeepSeek V4 Flash Vision Exp ketika pekerjaan Anda panjang dan berakhir dengan artefak: dokumen ratusan halaman dengan gambar, basis kode yang dibaca dari awal sampai akhir, loop agen yang perlu mengeluarkan hasil besar, beban kerja saat Anda ingin menyerahkan gambar lewat URL atau referensi Files API alih-alih base64, dan pipeline saat Anda memerlukan Responses API, kelanjutan prefiks, atau tarif per token yang dipublikasikan yang dapat Anda gunakan sebagai dasar penganggaran. Ini juga satu-satunya dari keduanya yang vendornya mengklaim paritas dengan model teksnya sendiri pada tugas teks, yang penting jika satu model menggantikan dua di stack Anda.

Pilih Ling-3.0-flash-VL ketika kendala yang mengikat Anda adalah biaya per panggilan dan loop Anda pendek: otomatisasi GUI, inspeksi tangkapan layar berulang, pembuatan front-end dengan siklus render-dan-perbaiki, pemeriksaan sekilas dokumen medis atau keuangan tempat Anda memerlukan resolusi per gambar yang tinggi dan dapat menerima keluaran kecil. Jumlah parameter aktif 5,5B adalah alasan untuk memilihnya, lisensi MIT adalah alasan aman untuk di-hosting sendiri, dan desain vision-feedback-loop ditujukan tepat pada pola observe-act-verify-correct. Ketahuilah bahwa Anda memilih model tanpa harga dengan jalur masuk gratis dan tanpa komitmen tentang apa yang berikutnya.

Dan jika yang sebenarnya Anda butuhkan adalah satu model yang membaca gambar secara kompeten tanpa salah satu ekstrem — tanpa trik sparsitas 5.5B, tanpa jendela sejuta token — maka tak satu pun dari keduanya adalah jawaban yang menarik, dan model visi kelas menengah biasa akan melayani Anda lebih baik dan lebih murah daripada kedua spesialis tersebut.

Menjalankannya, dan di mana kita cocok, sejujurnya.

DeepSeek V4 Flash Vision Exp sudah ada di katalog kami. Anda dapat memanggilnya melalui endpoint OrcaRouter yang kompatibel dengan OpenAI dengan string model deepseek/deepseek-v4-flash-vision-exp, menggunakan kunci yang sama seperti yang Anda pakai untuk semuanya, dengan tarif terpublikasi $0,24/$0,73 tanpa tambahan apa pun — harga daftar penyedia diteruskan langsung, jadi jika Deep​Seek memangkas tarifnya, itu sampai ke Anda di hari yang sama alih-alih pada pembaruan kontrak berikutnya. Jika Anda baru pertama kali menempatkan model visi ke jalur produksi, ini adalah pilihan yang lebih aman dari keduanya untuk memulai pada lapisan routing, karena Anda dapat mengonfigurasi rantai fallback sehingga error dari satu penyedia akan dicoba ulang ke rute lain sebelum respons Anda mulai. Tidak ada yang ingin panggilan visi produksi pertamanya menjadi pelajaran tentang kegagalan penyedia tunggal.

The OrcaRouter model page for DeepSeek V4 Flash Vision (Exp) showing a $0.24 per 1M input and $0.73 per 1M output token price, a 1,048,576-token context window, a 384,000-token maximum output, p50 time to first token of 1.31 seconds, the deepseek/deepseek-v4-flash-vision-exp model identifier, and Python and cURL code samples against https://api.orcarouter.ai/v1.

Ling-3.0-flash-VL is not on our catalogue, and we are not going to imply otherwise. It is reachable through Ant's own platform, which publishes an OpenAI-compatible endpoint and an Anth​ropic-compatible one, through free trial access on Ling Studio, and through the open weights on Hugging Face, which you can serve yourself with the published SGLang recipe or Ant's own vLLM fork. One thing to verify before you invest in that path: Ant's API examples use the identifier Ling-3.0-flash-VL-rc1, a release-candidate marker, and whether the served checkpoint matches the open weights has not been settled publicly. If you benchmark against the hosted API expecting the numbers to transfer to a self-hosted BF16 deployment, test that assumption first.

The Artificial Analysis model page for Ling-3.0-flash-VL showing an Intelligence Index of 25 on v4.3, a class rank of #2 of 64, 124B total and 5.5B active parameters, 142.9 output tokens per second, and a listed price of $0.00 per 1M tokens in and out reflecting free trial access.

Ringkasan yang lolos dari pemeriksaan ketat: ini bukan jawaban yang saling bersaing untuk satu pertanyaan. DeepSeek V4 Flash Vision Exp adalah lapisan persepsi konteks panjang untuk agen dengan harga yang dipublikasikan dan lembar tolok ukur yang dilaporkan vendor yang bersandar pada evaluasi agentik. Ling-3.0-flash-VL adalah model visi yang murah untuk dijalankan dengan satu skor independen yang nyata, tier gratis tanpa harga, dan desain yang ditujukan untuk loop korektif pendek. Cocokkan bentuk beban kerja Anda dengan bentuk modelnya, dan fakta bahwa hanya satu dari keduanya yang memiliki skor independen di papan skor seharusnya memengaruhi seberapa besar bobot yang Anda berikan pada pemasaran yang satunya lagi.

Kunci yang sama dapat mengakses sisa katalog, dan Anda dapat menjelajahi katalog model lengkap untuk melihat apa lagi yang ada di balik satu endpoint yang kompatibel dengan OpenAI.

Dibandingkan dalam artikel ini2

Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari