Kartu judul yang membandingkan Ling-3.0-flash-VL, model penglihatan-bahasa 124B parameter dengan 5,5B aktif di bawah MIT dengan Intelligence Index independen sebesar 25 dan jalur penyajian NVIDIA CUDA, dengan InternLumina U2, model difusi multi-codebook 16B parameter dengan 1B aktif di bawah Apache-2.0 yang satu-satunya checkpoint terbitannya dilatih dengan Ascend, mencakup pemahaman plus generasi, penyuntingan, dan 3D.
Guides & Insights

Ling-3.0-flash-VL vs InternLumina U2: Keduanya Telah Dirilis, Silikon Berbeda

Penulis

Alistair Wren

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Kedua model ini sekarang sudah nyata, dapat dijalankan, dan dapat diunduh, yang tidak berlaku dua minggu lalu — dan perbedaan di antara keduanya hampir tidak ada hubungannya dengan benchmark. Ling-3.0-flash-VL, dari lab inclusionAI milik Ant Group, menempatkan bobot BF16 dan FP8 di Hugging Face antara 4 dan 8 September 2026, menerbitkan resep penyajian SGLang dan vLLM bersama bobot tersebut, dan memperoleh skor independen 25 pada Artificial Analysis Intelligence Index v4.3. InternLumina U2, dari tim InternLM di Shanghai AI Laboratory, merilis kode inferensi lebih dulu lalu merilis bobot model yang dilatih dengan Ascend ke Hugging Face pada 10 September — tujuh shard safetensors di dalam ascend/ subfolder, sehingga melengkapi repositori itu menjadi enam belas file.

Yang menjadi intinya adalah untuk apa kedua peluncuran bobot itu dirancang. Jalur terbit Ling-3.0-flash-VL adalah jalur CUDA yang sudah dimiliki semua orang: node dengan delapan akselerator menjalankan build FP8, dan stack penyajiannya adalah yang sudah Anda jalankan. Checkpoint terbit InternLumina U2 adalah versi Ascend, dan README-nya secara eksplisit menyatakan bahwa Anda mengunduh checkpoint mana pun yang sesuai dengan cara Anda berencana menjalankan inferensi — dengan checkpoint yang dilatih NVIDIA masih terdaftar sebagai segera hadir. Dua model dirilis dalam minggu yang sama, dan hanya satu di antaranya berjalan pada perangkat keras yang ada di depan sebagian besar tim.

Itu membingkai ulang perbandingan ini secara berguna. Ini bukan lagi tulisan tentang rilis versus vaporware, dan siapa pun yang masih menggambarkan InternLumina U2 sebagai menunggu bobot sedang berpatokan pada README yang sudah berumur seminggu. Ini adalah tulisan tentang dua desain visual terpadu yang sangat berbeda yang hadir di dua ekosistem silikon yang berbeda, dan tentang bagian mana dari masing-masing rilis yang benar-benar sudah selesai.

Apa yang kini terkandung dalam setiap rilis

Ling-3.0-flash-VL adalah sparse mixture-of-experts dengan 124B parameter yang mengaktifkan sekitar 5,5B parameter per token, pada trunk hybrid 42 lapis yang bergantian antara Kimi Delta Attention dan blok MLA bergerbang dengan rasio 5:1. Encoder visi beresolusi arbitrer dan proyektor MLP dua lapis menyuplai trunk tersebut, dengan VideoRoPE menangani posisi spasial dan temporal. Model ini menerima teks, gambar, dan video lalu mengembalikan teks. Baik BF16 (64 shard) maupun FP8 (sekitar 126 GB, menara visi sengaja dipertahankan pada presisi lebih tinggi daripada bobot expert) tersedia publik di bawah lisensi MIT, dan rilis ini cukup lengkap sehingga komunitas benchmark independen menilainya — 25 pada Intelligence Index v4.3, peringkat #2 dari 64 di kelas ukurannya melawan median kelas sebesar 8. Yang tidak dipublikasikannya adalah harga per token untuk model visi, dan contoh API-nya membawa pengenal -rc1 yang membiarkan terbuka apakah checkpoint yang dilayani cocok dengan bobot terbuka.

InternLumina U2 adalah sparse mixture-of-experts dengan 16B parameter dan sekitar 1B parameter aktif, dibangun di atas backbone model bahasa difusi LLaDA-2.0 MoE, yang mencakup enam keluarga tugas dalam satu model: QA teks, generasi teks-ke-gambar, pemahaman gambar, pengeditan gambar, pemahaman video, dan pemahaman 3D. Kode inferensi untuk semua itu bersifat publik di main. Checkpoint yang dilatih dengan Ascend kini sudah publik di Hugging Face. Yang masih tertunda, menurut roadmap repositori itu sendiri: checkpoint yang dilatih dengan NVIDIA, kode pelatihan (repositori terpisah), dan laporan teknis. Roadmap ini mencentang empat kotak dan menyisakan dua kotak terbuka — kode inferensi, bobot Ascend, serta stack pelatihan dan inferensi Ascend sudah selesai; kode pelatihan dan laporan teknis belum.

Satu detail praktis terletak di antara kedua paragraf itu. Menjalankan jalur visi U2 memerlukan bobot tokenizer AToken di atoken_inference/checkpoints/atoken-sod.pt, dan driver yang dirilis mengharapkan direktori checkpoint terpisah dengan aset model disimpan bersama. Kodenya nyata dan dapat diinstal dengan Python 3.11, PyTorch 2.6.0 dan, pada jalur CUDA, flash-attn 2.7.2. Dukungan Ascend berada di ascend-npu-support branch terpisah dan membutuhkan CANN plus build torch_npu yang cocok sebagai pengganti toolchain CUDA. Tidak ada yang disembunyikan; semuanya didokumentasikan. Ini hanyalah jalan yang lebih panjang daripada pip install dan string model.

Dua jawaban atas pertanyaan "apa itu token visual"

Arsitektur-arsitektur ini tidak sepakat di suatu titik yang lebih dalam daripada jumlah parameter, dan ketidaksepakatan itu adalah hal yang paling menarik tentang menempatkan keduanya berdampingan.

Ling-3.0-flash-VL mempertahankan kontrak standar. Sebuah gambar menjadi urutan token melalui encoder visi dan proyektor, token-token itu masuk ke trunk transformer, dan semuanya berjalan secara autoregresif. Kebaruannya bukan pada bagaimana visi direpresentasikan, melainkan pada seberapa murah trunk berjalan — 5,5B parameter aktif per token dari total 124B, yang merupakan alasan utama model ini muncul di frontier kecerdasan versus parameter aktif. VideoRoPE memberikan posisi spasial dan temporal satu pengodean yang konsisten sehingga video tidak memerlukan mekanisme terpisah.

InternLumina U2 mengubah representasi itu sendiri. Ini menggunakan tokenizer AToken milik Apple, di mana setiap posisi visual dijelaskan oleh delapan codebook komplementer — tekstur lokal, teks tersemat, geometri, dan detail frekuensi tinggi sebagai aliran terpisah alih-alih satu vektor yang dipadatkan. Setiap codebook mempertahankan embedding-nya sendiri saat masuk, dan delapan embedding per posisi dikonkatenasi dan diproyeksikan ke bawah menjadi satu token backbone. Saat keluar, prediksinya adalah apa yang oleh tim disebut autoregresif kedalaman-codebook yang paralel secara spasial: backbone difusi menghilangkan derau dari banyak posisi spasial yang dikenai masker sekaligus, lalu head autoregresif multi-codebook memprediksi delapan kode untuk setiap posisi secara berurutan. Pemahaman dan generasi berjalan melalui mesin yang sama — itulah klaim sebenarnya. Argumen tim adalah bahwa satu codebook membatasi seberapa banyak informasi yang dapat dibawa oleh satu token visual, sementara hibrida diskret-kontinu memisahkan pemahaman dan generasi ke dalam representasi dan jalur dekode yang berbeda, dan bahwa beralih sepenuhnya ke diskret dengan beberapa codebook adalah cara untuk mendapatkan model yang benar-benar terpadu alih-alih dua tumpukan yang hanya dibaut menjadi satu.

Keduanya adalah posisi yang koheren, dan keduanya membawa biaya yang berlawanan. Representasi multi-codebook dapat menampung detail visual yang lebih halus; representasi ini juga mengalikan anggaran token per gambar dengan jumlah codebook dan membuat decoding jauh lebih rumit, yang agaknya menjadi salah satu alasan mengapa 16B-A1B dipilih sebagai skala. Sparsitas Ling memberikan inferensi per token yang murah; hal itu juga berarti kapasitas aktif yang lebih kecil per forward pass, yang merupakan pertukaran yang secara diam-diam digambarkan oleh median kelas 8 pada indeks kecerdasan — Ling-3.0-flash-VL melampauinya dengan nyaman pada 25, tetapi model ini tidak bersaing dengan model frontier padat dalam penalaran mentah.

Permukaan tugas hanya tumpang tindih sebagian.

Mengelompokkan keduanya sebagai "model multimodal" terlalu melebih-lebihkan tumpang tindihnya. Mengetahui di mana batasnya mencegah banyak perbandingan yang keliru.

• Input — Ling-3.0-flash-VL menerima teks, gambar, dan video, hingga 40 gambar per permintaan, dan mengembalikan teks; InternLumina U2 menerima teks, gambar, video, dan aset 3D, serta mengembalikan teks, gambar yang dihasilkan, atau gambar yang dieditbr /> • Generasi gambar — Ling-3.0-flash-VL tidak dapat menghasilkan atau mengedit gambar sama sekali; klaim utama InternLumina U2 adalah bahwa ia melakukan keduanya, hingga 1024×1024, dari bobot yang sama yang membaca gambarbr /> • 3D — Ling-3.0-flash-VL tidak memiliki jalur 3D; InternLumina U2 menyertakan pipeline berbasis Blender yang merender aset GLB dan GLTF menjadi 64 pasangan tampilan warna-dan-kedalaman untuk penalaran modelbr /> • Video — Ling-3.0-flash-VL menangani video melalui pengodean temporal VideoRoPE; InternLumina U2 mengambil sampel 64 framebr /> • Konteks dan keluaran — Ling-3.0-flash-VL mengukur jendela konteks 262K token dibandingkan dengan 256K yang dinyatakan dalam kartu modelnya, dan keluaran maksimum yang relatif pendek; InternLumina U2 tidak mempublikasikan kedua angka tersebutbr /> • Parameter aktif — Ling-3.0-flash-VL mengaktifkan sekitar 5,5B per token; InternLumina U2 mengaktifkan sekitar 1B, yang merupakan seperlima dari jumlah tersebut

Baca daftar itu dan kesimpulannya adalah bahwa keduanya merupakan substitusi untuk tepat satu tugas — membaca gambar dan menjawab pertanyaan tentangnya — dan komplementer di hampir semua hal lainnya. Jika Anda memerlukan model yang menghasilkan atau menyunting gambar, Ling-3.0-flash-VL bukan kandidat dan tidak ada tolok ukur yang mengubahnya. Jika Anda memerlukan satu model yang membaca bagan, menghasilkan varian, dan bernalar atas aset 3D, InternLumina U2 ditujukan untuk itu dan Ling-3.0-flash-VL tidak menanganinya.

The GitHub repository page for InternLM/InternLumina-U2 showing the Apache-2.0 license, a commit titled Document weight downloads and mark Ascend checkpoint released from two days earlier, a file listing including infer_t2i_sft.py, infer_mmu_sft.py, infer_video_sft.py and infer_3d_sft.py, 52 stars, and the Releases panel reading No releases published.

Tolok ukur: satu skor independen dibandingkan dengan halaman angka vendor

Kualitas buktinya tidak berimbang, dan penting untuk menjelaskan dengan tepat mengapa, bukan sekadar menetapkan pemenang.

Nilai 25 untuk Ling-3.0-flash-VL pada Intelligence Index v4.3 merupakan pengujian pihak ketiga pada protokol yang dipublikasikan, dengan median kelas di angka 8 sebagai konteks, ditambah throughput terukur 142,9 token keluaran per detik terhadap median sesama sebesar 105,1 dan waktu ke token pertama 2,21 detik. Kartu vendornya secara terpisah mengklaim 42 pada v4.1.1 yang telah dihentikan protokol tersebut, yang merupakan skala berbeda dan tidak dapat disandingkan dengan angka 25 seolah-olah model itu mengalami penurunan; indeks tersebut disusun ulang pada September 2026 dan dinilai ulang secara menyeluruh. Vendor juga melaporkan kemenangan 1,441 berbanding 1,440 di Image-to-WebDev Arena atas GPT-5.4 dengan nama samaran "linthium" — selisih satu poin yang berada dalam derau Elo, dan dilaporkan oleh vendor.

Angka-angka InternLumina U2 adalah milik lab sendiri, diberi label pendahuluan dan parsial, dengan tabel perbandingan lengkap dan laporan teknis masih tertunda. Angka-angka itu kini berada dalam sebuah tabel di README repositori, bukan di papan peringkat benchmark, dan belum dapat diverifikasi secara independen karena belum ada pihak ketiga yang mempublikasikan sebuah uji coba. Dinyatakan sebagaimana lab menyatakannya:

• Pemahaman — ChartQA 86.52, CharXiv-DQ 83.65, HallusionBench 62.15, MMMU-Pro 36.13, MathVision 33.22, DynaMath 56.37br /> • Video — Video-MME 51.26, MVBench 59.74, MLVU 57.03br /> • Generasi dan penyuntingan — GenEval 0.81, DPG 87.10, TIIF Short 84.60, TIIF Long 85.95, ImgEdit 3.83br /> • Sumber — setiap angka InternLumina U2 dilaporkan vendor dan bersifat pendahuluan; setiap angka Ling-3.0-flash-VL dilaporkan vendor kecuali Intelligence Index, yang berasal dari Artificial Analysis

Dua di antaranya layak diberi tanda. GenEval 0.81 tertinggal dari 0.89 milik pesaing yang disebut namanya menurut tabel lab itu sendiri — contoh langka seorang vendor menerbitkan kekalahan, dan alasan untuk sedikit lebih memercayai bagian lain dari lembar tersebut. Dan ImgEdit pada 3.83 tidak berarti apa-apa tanpa tabel pendampingnya, yang merupakan bagian dari apa yang akan dimuat laporan teknis yang tertunda. Perlakukan daftar InternLumina U2 sebagai hasil yang ingin dipertahankan oleh lab, bukan sebagai hasil yang dapat Anda tindak lanjuti. Perhatikan juga bahwa skor pemahamannya dan skor indeks Ling-3.0-flash-VL bukan kuantitas yang dapat dibandingkan: yang satu adalah kumpulan angka vendor spesifik tugas, yang lain adalah indeks komposit pihak ketiga.

A two-column comparison scoreboard for Ling-3.0-flash-VL and InternLumina U2 across six shared dimensions: Intelligence Index 25 on v4.3 versus none yet, active parameters 5.5B versus 1B, total parameters 124B versus 16B, license MIT versus Apache-2.0, published checkpoint NVIDIA CUDA versus Ascend only, and task surface understanding only versus plus generation, editing and 3D, with a footer noting the Ling figure is per Artificial Analysis and InternLumina U2 figures are vendor-reported preliminary.

Lisensi, perangkat keras, dan berapa sebenarnya biaya bertaruh pada masing-masing

Ling-3.0-flash-VL berlisensi MIT untuk kedua format presisi, yang kira-kira sebersih mungkin untuk bobot terbuka — tanpa syarat tambahan, tanpa pembatasan bidang penggunaan, tanpa ambiguitas soal penerapan komersial. Build FP8 dengan ukuran sekitar 126 GB muat dalam satu node berisi delapan akselerator kelas 80GB; BF16 kira-kira dua kali lipatnya. Dukungan serving sudah tersedia di SGLang dan fork vLLM yang dikelola Ant. Risiko yang tersisa lebih bersifat komersial daripada legal: Ant tidak menerbitkan tarif per token untuk model visi tersebut, akses gratis di Ling Studio bersifat promosi dan bukan tarif, dan Artificial Analysis mencantumkannya pada $0,00 per 1 juta token masuk dan keluar hanya karena endpoint yang dapat dilihatnya adalah endpoint gratis.

InternLumina U2 adalah Apache-2.0 di repositori utama, dengan dua pengecualian yang patut dibaca: direktori yang dibundel VeOmni/ tetap mempertahankan lisensi Apache-2.0 upstream-nya, dan atoken_inference/ berasal dari ml-atoken milik Apple dan didistribusikan ulang berdasarkan ketentuan asli Apple. Klaim infrastrukturnya serius — ia menargetkan GPU NVIDIA dan NPU Huawei Ascend dengan penyelarasan numerik tingkat operator antara backend, dan tim melaporkan pelatihan end-to-end pada klaster Ascend seribu kartu dengan peningkatan efisiensi pelatihan 1,85× dari operator yang difusikan, sharding HSDP yang disetel, dan gradient checkpointing. Itu rekayasa nyata. Itu juga ortogonal terhadap apakah modelnya bagus: efisiensi pelatihan pada Ascend tidak mengatakan apa pun tentang kualitas keluaran, dan checkpoint yang ada saat ini adalah yang ditujukan untuk stack tersebut.

Jadi asimetri praktisnya bukanlah terbuka versus tertutup. Keduanya terbuka, keduanya berlisensi permisif, dan keduanya dapat diunduh hari ini. Yang menjadi persoalan adalah bahwa salah satu rilis mengasumsikan perangkat keras yang kemungkinan Anda miliki dan yang lain mengasumsikan perangkat keras yang kemungkinan tidak Anda miliki. Jika armada Anda NVIDIA, Ling-3.0-flash-VL adalah pekerjaan satu sore dan InternLumina U2 adalah penantian. Jika armada Anda Ascend — yang semakin umum di pasar Tiongkok tempat model ini dibuat — persamaan itu benar-benar terbalik, dan InternLumina U2 adalah yang memiliki jalur yang sudah selesai sementara resep Ling-3.0-flash-VL mengasumsikan CUDA.

Pertanyaan yang benar-benar ditanyakan orang tentang pasangan ini

Apakah bobot InternLumina U2 sudah bisa diunduh?

Ya, checkpoint yang dilatih dengan Ascend adalah — tujuh shard safetensors yang diterbitkan di bawah ascend/ di Hugging Face, bersama dengan file konfigurasi, tokenizer, dan pemodelan. Checkpoint yang dilatih dengan NVIDIA berada dalam subfolder terpisah dan masih tercantum sebagai segera hadir, sedangkan kode pelatihan dan laporan teknisnya masih belum tersedia.

Apakah Ling-3.0-flash-VL secara mutlak lebih baik karena memiliki skor independen?

Tidak — hal itu lebih didukung bukti dan lebih mudah dijalankan pada perangkat keras umum, yang merupakan klaim berbeda. Ling-3.0-flash-VL tidak dapat menghasilkan atau menyunting gambar, tidak dapat memproses aset 3D, dan tidak memiliki harga yang dipublikasikan. Jika tugas Anda adalah pembuatan gambar, penyuntingan gambar, atau pemahaman 3D, InternLumina U2 menanganinya dan Ling-3.0-flash-VL sama sekali tidak menanganinya, sebanyak apa pun benchmark yang dimiliki model Ling.

Apakah angka 42 pada kartu model Ling-3.0-flash-VL bertentangan dengan angka 25 dari Artificial Analysis?

Tidak secara langsung. Angka 42 diukur terhadap Intelligence Index protocol v4.1.1 dan angka 25 terhadap v4.3; indeks tersebut dinyatakan ulang pada September 2026 dan dinilai ulang secara menyeluruh, serta kedua versi dibangun dari kumpulan evaluasi yang berbeda. Yang dapat dikatakan adalah bahwa angka 42 belum pernah direproduksi secara independen dan angka 25 telah diproduksi secara independen.

Di mana salah satu dari keduanya dapat dipanggil

Baik Ling-3.0-flash-VL maupun InternLumina U2 tidak ada di katalog model kami, dan mengatakan sebaliknya akan menjadi klaim yang dapat diperiksa pembaca dalam sepuluh detik. Ling-3.0-flash-VL dapat diakses melalui platform milik Ant sendiri, yang menerbitkan endpoint yang kompatibel dengan OpenAI dan satu lagi yang kompatibel dengan Anthropic, melalui akses uji coba gratis di Ling Studio, dan melalui bobot terbuka jika Anda menyajikannya sendiri. InternLumina U2 dapat diakses melalui checkpoint Hugging Face dan driver inferensi repositori tersebut, pada perangkat keras yang menjadi target checkpoint itu.

Yang kami rutekan adalah model visi yang paling sering dibandingkan dengan pasangan ini dalam praktik: DeepSeek V4 Flash Vision Exp, tersedia di katalog dengan jendela konteks 1M token dan tarif yang dipublikasikan, pada endpoint yang kompatibel dengan OpenAI yang sama seperti bagian lain katalog. Ketika sebuah lab merilis bobot terbuka, lapisan perutean biasanya dapat menawarkan model tersebut tanpa menunggu layanan yang dihosting lab itu sendiri menjadi stabil — yang merupakan perbedaan praktis antara model yang dapat dikutip dan model yang dapat dipanggil. Perbedaan itu sudah berlaku untuk Ling-3.0-flash-VL dan, untuk saat ini, bersifat akademis bagi InternLumina U2, yang kisah perilisannya adalah jalur perangkat keras alih-alih pertanyaan hosting.

The Artificial Analysis model page for Ling-3.0-flash-VL showing an Intelligence Index of 25 on v4.3 with a class rank of #2 of 64 against a class median of 8, 124B total and 5.5B active parameters, a 262K-token context window, an MIT license and 142.9 output tokens per second.

Putusan ini benar-benar terbelah, dan terbelah berdasarkan perangkat keras serta tugas, bukan berdasarkan kualitas. Ling-3.0-flash-VL adalah rilis yang lengkap: MIT, kedua format presisi, dinilai pihak ketiga, mengutamakan CUDA, dan terbatas pada pemahaman. InternLumina U2 adalah desain yang lebih ambisius dan rilis yang belum sepenuhnya selesai: checkpoint satu tumpukan perangkat keras telah diterbitkan, cakupan enam tugas terpadu yang mencakup generasi dan 3D, dan laporan teknis yang masih tertunggak. Jika Anda memerlukan model visi di perangkat keras NVIDIA minggu ini, pilihannya sudah jelas dengan sendirinya. Jika desain multi-codebook InternLumina U2 yang menarik bagi Anda, hal yang perlu diperhatikan adalah checkpoint NVIDIA — dan posisi jujurnya sampai saat itu adalah bahwa tabel tolok ukurnya, termasuk baris yang tidak dimenangkannya, menggambarkan model yang paruh keduanya belum dirilis.