Ett titelkort som ställer Ling-3.0-flash-VL, en vision-language-modell med 124B parametrar och 5,5B aktiva under MIT-licens med ett oberoende Intelligence Index på 25 och en NVIDIA CUDA-serveringsväg, mot InternLumina U2, en multi-codebook-diffusionsmodell med 16B parametrar och 1B aktiva under Apache-2.0-licens, vars enda publicerade checkpoint är Ascend-tränad och som omfattar förståelse samt generering, redigering och 3D.
Guides & Insights

Ling-3.0-flash-VL vs InternLumina U2: Båda släppta, olika kisel

Författare

Alistair Wren

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Båda dessa modeller är nu verkliga, körbara och nedladdningsbara, vilket inte var sant för två veckor sedan — och skillnaden mellan dem har nästan ingenting att göra med benchmarks. Ling-3.0-flash-VL, från Ant Groups inclusionAI-lab, lade upp BF16- och FP8-vikter på Hugging Face mellan den 4 och 8 september 2026, publicerade SGLang- och vLLM-serveringsrecept tillsammans med dem och fick en oberoende poäng på 25 på Artificial Analysis Intelligence Index v4.3. InternLumina U2, från Shanghai AI Laboratorys InternLM-team, levererade först inferenskod och släppte sedan sina Ascend-tränade modellvikter till Hugging Face den 10 september — sju safetensors-shards i en ascend/-underkatalog, vilket gör att arkivet totalt omfattar sexton filer.

Haken är vad de två viktsläppen byggdes för. Ling-3.0-flash-VLs publicerade väg är CUDA-vägen som alla redan har: en nod med åtta acceleratorer kör FP8-bygget, och serveringsstackarna är de du redan kör. InternLumina U2:s publicerade checkpoint är Ascend-varianten, och README är tydlig med att du laddar ner den checkpoint som matchar hur du planerar att köra inferens – med den NVIDIA-tränade checkpointen fortfarande listad som kommande. Två modeller släppta samma vecka, och bara en av dem körs på hårdvaran som de flesta team står framför.

Det ger jämförelsen en användbar ny infallsvinkel. Det här är inte längre en artikel om släppt kontra vaporware, och den som fortfarande beskriver InternLumina U2 som väntande på vikter utgår från en vecka gammal README. Det är en artikel om två mycket olika enhetliga visuella designer som kom till två olika kisel-ekosystem, och om vilka delar av respektive släpp som faktiskt är färdiga.

Vad varje utgåva nu innehåller

Ling-3.0-flash-VL är en gles mixture-of-experts-modell med 124B parametrar som aktiverar ungefär 5,5B parametrar per token, på en 42-lagers hybridstam som alternerar Kimi Delta Attention med gated MLA-block i förhållandet 5:1. En visionsencoder med godtycklig upplösning och en tvålagers MLP-projektor matar den stammen, där VideoRoPE hanterar rumslig och temporal position. Den tar text, bilder och video och returnerar text. Både BF16 (64 shards) och FP8 (ungefär 126 GB, där visionstornet medvetet hålls i högre precision än expertvikterna) är offentliga under MIT-licensen, och släppet är tillräckligt komplett för att den oberoende benchmark-gemenskapen betygsatte den — 25 på Intelligence Index v4.3, rankad #2 av 64 i sin storleksklass mot en klassmedian på 8. Det den inte publicerar är ett pris per token för visionsmodellen, och dess API-exempel bär en -rc1 identifierare som lämnar öppet huruvida den serverade checkpointen matchar de öppna vikterna.

InternLumina U2 är en gles mixture-of-experts-modell med 16B parametrar och omkring 1B aktiva parametrar, byggd på en LLaDA-2.0 MoE-diffusionsspråkmodell som backbone, och täcker sex uppgiftsfamiljer i en och samma modell: text-QA, text-till-bild-generering, bildförståelse, bildredigering, videoförståelse och 3D-förståelse. Inferenskoden för alla dessa är offentlig på main. Den Ascend-tränade checkpointen är nu offentlig på Hugging Face. Ännu återstår, enligt repots egen roadmap: den NVIDIA-tränade checkpointen, träningskoden (ett separat repo) och den tekniska rapporten. Roadmappen bockar av fyra rutor och lämnar två öppna – inferenskod, Ascend-vikter och Ascend-tränings- och inferensstacken klara; träningskod och teknisk rapport inte.

En praktisk detalj ligger mellan de två styckena. Att köra U2:s visionsvägar kräver AToken-tokenizerns vikter i atoken_inference/checkpoints/atoken-sod.pt, och den släppta drivrutinen förväntar sig en delad checkpoint-katalog där modellens tillgångar hålls samman. Koden är verklig och installeras mot Python 3.11, PyTorch 2.6.0 och, på CUDA-vägen, flash-attn 2.7.2. Ascend-stöd finns på en separat ascend-npu-support-gren och kräver CANN plus ett matchande torch_npu-bygge i stället för CUDA-verktygskedjan. Inget av detta är dolt; allt är dokumenterat. Det är helt enkelt en längre väg än pip install och en modellsträng.

Två svar på frågan "vad är en visuell token"

Arkitekturerna går isär någonstans djupare än antalet parametrar, och oenigheten är det mest intressanta med att ställa dessa två sida vid sida.

Ling-3.0-flash-VL behåller standardkontraktet. En bild blir en sekvens av tokens via vision-encodern och projektorn, dessa tokens går in i en transformerstam, och allt körs autoregressivt. Det nya ligger inte i hur vision representeras utan i hur billigt stammen körs – 5,5B aktiva parametrar per token av totalt 124B, vilket är hela anledningen till att modellen hamnar på fronten för intelligens kontra aktiva parametrar. VideoRoPE ger rumslig och temporal position en konsekvent kodning, så video inte behöver något separat maskineri.

InternLumina U2 förändrar representationen själv. Den använder Apples AToken-tokenizer, där varje visuell position beskrivs av åtta kompletterande kodböcker – lokal textur, inbäddad text, geometri och högfrekventa detaljer som separata strömmar snarare än en enda kollapsad vektor. Varje kodbok behåller sin egen inbäddning på väg in, och de åtta inbäddningarna per position sammanfogas och projiceras ned till en enda backbone-token. På väg ut är förutsägelsen vad teamet kallar spatial-parallell, kodboksdjup autoregressiv: diffusions-backbonen avbrusar många maskerade spatiala positioner samtidigt, och sedan förutsäger ett autoregressivt huvud med flera kodböcker de åtta koderna för varje position i ordning. Förståelse och generering körs genom samma maskineri – vilket är själva påståendet. Teamets argument är att en enda kodbok begränsar hur mycket information en visuell token kan bära, medan diskret-kontinuerliga hybrider delar upp förståelse och generering över olika representationer och avkodningsvägar, och att gå helt diskret med flera kodböcker är hur man får en genuint enhetlig modell snarare än två stackar som skruvats ihop.

Båda dessa är koherenta positioner, och de medför motsatta kostnader. Representationer med flera kodböcker kan hålla finare visuell detalj; de multiplicerar också tokenbudgeten per bild med antalet kodböcker och gör avkodningen betydligt mer invecklad, vilket förmodligen är en del av anledningen till att 16B-A1B valdes som skala. Lings sparsitet ger billig inferens per token; det innebär också en mindre aktiv kapacitet per framåtpassning, vilket är den avvägning som klassmedianen på 8 i intelligensindexet tyst illustrerar — Ling-3.0-flash-VL klarar den med god marginal på 25, men den konkurrerar inte med täta frontier-modeller i rå resonemangsförmåga.

Uppgiftsytorna överlappar bara delvis

Att placera båda under "multimodell" överdriver överlappningen. Att veta var gränsen går förhindrar en hel del dålig jämförelseshopping.

• Indata — Ling-3.0-flash-VL tar text, bilder och video, upp till 40 bilder per begäran, och returnerar text; InternLumina U2 tar text, bilder, video och 3D-tillgångar, och returnerar text, genererade bilder eller redigerade bilderbr /> • Bildgenerering — Ling-3.0-flash-VL kan inte generera eller redigera bilder alls; InternLumina U2:s centrala påstående är att den gör båda, upp till 1024×1024, från samma vikter som läser bilderbr /> • 3D — Ling-3.0-flash-VL har ingen 3D-väg; InternLumina U2 levererar en Blender-baserad pipeline som renderar GLB- och GLTF-tillgångar till 64 parade färg- och djupvyer för att modellen ska kunna resonera kringbr /> • Video — Ling-3.0-flash-VL hanterar video genom VideoRoPE temporal kodning; InternLumina U2 samplar 64 bildrutorbr /> • Kontext och utdata — Ling-3.0-flash-VL uppmäter ett kontextfönster på 262K token mot de 256K som dess modellkort anger, och en jämförelsevis kort maximal utdata; InternLumina U2 har inte publicerat någon av siffrornabr /> • Aktiva parametrar — Ling-3.0-flash-VL aktiverar ungefär 5,5B per token; InternLumina U2 aktiverar omkring 1B, vilket är en femtedel så mycket

Läs den listan och slutsatsen är att dessa två är substitut för exakt en uppgift – att läsa en bild och svara på frågor om den – och komplement nästan överallt annars. Om du behöver en modell som genererar eller redigerar en bild är Ling-3.0-flash-VL inte en kandidat, och ingen benchmark ändrar på det. Om du behöver en modell som läser ett diagram, genererar en variant och resonerar över en 3D-tillgång, är InternLumina U2 inriktad på det och Ling-3.0-flash-VL hanterar det inte.

The GitHub repository page for InternLM/InternLumina-U2 showing the Apache-2.0 license, a commit titled Document weight downloads and mark Ascend checkpoint released from two days earlier, a file listing including infer_t2i_sft.py, infer_mmu_sft.py, infer_video_sft.py and infer_3d_sft.py, 52 stars, and the Releases panel reading No releases published.

Benchmarks: ett oberoende resultat mot en sida med leverantörssiffror

Beviskvaliteten är inte i närheten, och det är värt att vara precis om varför i stället för att utropa en vinnare.

Ling-3.0-flash-VL:s 25 på Intelligence Index v4.3 är en tredjepartskörning på ett publicerat protokoll, med klassmedianen på 8 som kontext, plus uppmätt genomströmning på 142,9 utdatatoken per sekund mot en median bland jämförbara modeller på 105,1 och 2,21 sekunder till första token. Dess leverantörskort gör separat anspråk på 42 på det pensionerade v4.1.1-protokollet, vilket är en annan skala och inte kan ställas bredvid 25:an som om modellen hade gått ned; indexet omräknades i september 2026 och samtliga resultat poängsattes på nytt. Leverantören rapporterar också en vinst i Image-to-WebDev Arena med 1 441 mot 1 440 över GPT-5.4 under användarnamnet "linthium" – en marginal på en poäng inom Elo-bruset, och leverantörsrapporterad.

InternLumina U2:s siffror är labbets egna, märkta som preliminära och partiella, medan de fullständiga jämförelsetabellerna och den tekniska rapporten ännu inte är klara. De finns nu i en tabell på repositoryts README i stället för på en benchmark-topplista, och de kan ännu inte verifieras oberoende eftersom ingen tredje part har publicerat en körning. Återgivet så som labbet formulerar dem:

• Förståelse — ChartQA 86,52, CharXiv-DQ 83,65, HallusionBench 62,15, MMMU-Pro 36,13, MathVision 33,22, DynaMath 56,37br /> • Video — Video-MME 51,26, MVBench 59,74, MLVU 57,03br /> • Generering och redigering — GenEval 0,81, DPG 87,10, TIIF Short 84,60, TIIF Long 85,95, ImgEdit 3,83br /> • Källor — samtliga siffror för InternLumina U2 är leverantörsrapporterade och preliminära; samtliga siffror för Ling-3.0-flash-VL är leverantörsrapporterade, med undantag för Intelligence Index, som kommer från Artificial Analysis

Två av dem förtjänar att flaggas. GenEval 0,81 ligger efter en namngiven konkurrents 0,89 enligt labbets egen tabell – ett sällsynt fall av att en leverantör publicerar en förlust, och ett skäl att lita lite mer på resten av arket. Och ImgEdit på 3,83 är meningslöst utan den medföljande tabellen, vilket är en del av vad den väntande tekniska rapporten kommer att innehålla. Behandla InternLumina U2-listan som resultat som labbet avser att försvara, inte som resultat du kan agera på. Notera också att dess förståelsepoäng och Ling-3.0-flash-VL:s indexpoäng inte är jämförbara storheter: den ena är en uppsättning uppgiftsspecifika leverantörssiffror, den andra ett sammansatt tredjepartsindex.

A two-column comparison scoreboard for Ling-3.0-flash-VL and InternLumina U2 across six shared dimensions: Intelligence Index 25 on v4.3 versus none yet, active parameters 5.5B versus 1B, total parameters 124B versus 16B, license MIT versus Apache-2.0, published checkpoint NVIDIA CUDA versus Ascend only, and task surface understanding only versus plus generation, editing and 3D, with a footer noting the Ling figure is per Artificial Analysis and InternLumina U2 figures are vendor-reported preliminary.

Licens, hårdvara och vad en satsning på vardera faktiskt kostar

Ling-3.0-flash-VL är MIT-licensierad i båda precisionsformaten, vilket är ungefär så rent som öppna vikter kan bli – inga tilläggsklausuler, inga begränsningar för användningsområde, ingen oklarhet kring kommersiell driftsättning. FP8-bygget på cirka 126 GB ryms inom en nod med åtta acceleratorer i 80 GB-klassen; BF16 är ungefär dubbelt så stort. Stöd för serving finns redan i SGLang och i en vLLM-fork som underhålls av Ant. Den kvarvarande risken är kommersiell snarare än juridisk: Ant publicerar inget pris per token för visionsmodellen, gratis åtkomst på Ling Studio är ett kampanjerbjudande snarare än en taxa, och Artificial Analysis listar den till 0,00 USD per miljon tokens för indata och utdata endast för att slutpunkten som den kan se är den kostnadsfria.

InternLumina U2 är Apache-2.0 i huvudarkivet, med två undantag värda att läsa: den medföljande VeOmni/ katalogen behåller sin uppströms Apache-2.0-licens, och atoken_inference/ härstammar från Apples ml-atoken och redistribueras under Apples ursprungliga villkor. Infrastrukturpåståendet är seriöst — det riktar sig mot både NVIDIA-GPU:er och Huawei Ascend-NPU:er med numerisk alignering på operatornivå mellan backendarna, och teamet rapporterar träning end-to-end på ett Ascend-kluster med tusen kort, med en förbättring av träningseffektiviteten på 1,85× från fusionerade operatorer, trimmad HSDP-sharding och gradient-checkpointing. Det är riktig ingenjörskonst. Det är också ortogonalt mot huruvida modellen är något att ha: träningseffektivitet på Ascend säger ingenting om utdatakvaliteten, och den checkpoint som finns i dag är den som är inriktad mot den stacken.

Så den praktiska asymmetrin handlar inte om öppen kontra stängd. Båda är öppna, båda har tillåtande licenser och båda kan laddas ner i dag. Det är att den ena utgåvan förutsätter den hårdvara du förmodligen har, och den andra förutsätter den hårdvara du förmodligen inte har. Om din maskinpark är NVIDIA är Ling-3.0-flash-VL ett eftermiddagsjobb och InternLumina U2 något man får vänta på. Om din maskinpark är Ascend – vilket blir allt vanligare på den kinesiska marknad som den här modellen byggdes för – inverteras den ekvationen helt, och InternLumina U2 är den som har en färdig väg medan Ling-3.0-flash-VL:s recept förutsätter CUDA.

Frågor som folk faktiskt ställer om den här kombinationen

Är vikterna för InternLumina U2 nedladdningsbara ännu?

Ja, den Ascend-tränade checkpointen är — sju safetensors-shards publicerade under ascend/ på Hugging Face, tillsammans med config-, tokenizer- och modelleringsfilerna. Den NVIDIA-tränade checkpointen är en separat undermapp och listas fortfarande som kommande, och träningskoden och den tekniska rapporten återstår.

Är Ling-3.0-flash-VL strikt bättre eftersom den har en oberoende poäng?

Nej – den har bättre underlag och är enklare att köra på vanlig hårdvara, vilket är ett annat påstående. Ling-3.0-flash-VL kan inte generera eller redigera bilder, kan inte bearbeta 3D-tillgångar och har inget publicerat pris. Om din uppgift är bildgenerering, bildredigering eller 3D-förståelse hanterar InternLumina U2 det, medan Ling-3.0-flash-VL inte hanterar det alls, hur många benchmarks Ling-modellen än har.

Motsäger 42:an på Ling-3.0-flash-VL:s modellkort 25:an från Artificial Analysis?

Inte direkt. 42:an mättes mot Intelligence Index-protokollet v4.1.1 och 25:an mot v4.3; indexet reviderades i september 2026 och poängsattes på nytt över hela linjen, och de två versionerna bygger på olika utvärderingsset. Vad som kan sägas är att 42:an aldrig har reproducerats oberoende och att 25:an har tagits fram oberoende.

Där någon av dessa kan anropas

Varken Ling-3.0-flash-VL eller InternLumina U2 finns med i vår modellkatalog, och att påstå något annat vore ett påstående som en läsare kan kontrollera på tio sekunder. Ling-3.0-flash-VL går att nå via Ants egen plattform, som tillhandahåller en OpenAI-kompatibel endpoint och en Anthropic-kompatibel sådan, via kostnadsfri provåtkomst på Ling Studio, och via de öppna vikterna om du serverar dem själv. InternLumina U2 går att nå via Hugging Face-checkpointen och repots inferensdrivrutin, på den hårdvara som checkpointen är avsedd för.

Den route vi erbjuder är den visionsmodell som den här kombinationen oftast ställs mot i praktiken: DeepSeek V4 Flash Vision Exp, tillgänglig i katalogen med ett kontextfönster på 1M tokens och ett publicerat pris, på samma OpenAI-kompatibla endpoint som resten av katalogen. När ett labb släpper öppna vikter kan ett routningslager vanligtvis erbjuda modellen utan att vänta på att labbets egen hostade tjänst ska stabiliseras — vilket är den praktiska skillnaden mellan att en modell går att citera och att en modell går att anropa. Den skillnaden är verklig för Ling-3.0-flash-VL och, för närvarande, akademisk för InternLumina U2, vars släpphistoria är en hårdvaruväg snarare än en hostingfråga.

The Artificial Analysis model page for Ling-3.0-flash-VL showing an Intelligence Index of 25 on v4.3 with a class rank of #2 of 64 against a class median of 8, 124B total and 5.5B active parameters, a 262K-token context window, an MIT license and 142.9 output tokens per second.

Domen är genuint delad, och den delar sig efter hårdvara och uppgift snarare än efter kvalitet. Ling-3.0-flash-VL är den kompletta utgåvan: MIT, båda precisionsformaten, tredjepartsbedömd, CUDA-först och begränsad till förståelse. InternLumina U2 är den mer ambitiösa designen och den mindre färdiga utgåvan: en hårdvarustacks checkpoint publicerad, en enhetlig yta med sex uppgifter som inkluderar generering och 3D, och en teknisk rapport som ännu återstår. Om du behöver en visionsmodell på NVIDIA-hårdvara den här veckan gör valet sig självt. Om det är InternLumina U2:s multi-codebook-design som intresserar dig är det NVIDIA-checkpointen du bör hålla ögonen på — och den ärliga hållningen fram till dess är att dess benchmarktabell, inklusive raden där den förlorar, beskriver en modell vars andra halva ännu inte har släppts.