
InternLumina-U2 vs Microsoft Mage-VL: Två tysta labb som satsar på att visionstokens bör bära mer
- AlibabaNYQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens
- z-aiNYZ.ai: GLM 5.3 Flash2026-08-2658Intelligens72Kodning
- DeepSeekNYDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1M tokens
- z-aiZ.ai: GLM 5.32026-08-1860Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1552Intelligens68Kodning
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1261Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0557Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligens72Kodning
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligens69Kodning
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligens78Kodning
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligens69Kodning
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligens49Kodning
- metaMeta: Muse Spark 1.12026-07-1653Intelligens71Kodning
- kimiMoonshotAI: Kimi K32026-07-1560Intelligens76Kodning
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligens71Kodning
Microsoft Mage-VL och InternLumina-U2 släpptes båda på det sätt som forskningslaboratorier släpper när de inte är säkra på att resultatet är en produkt ännu: tyst. Microsoft publicerade Mage-VL:s vikter och kod på Hugging Face den 25 juli 2026 utan något tillkännagivande; Shanghai AI Laboratory:s InternLM-organisation publicerade InternLumina-U2:s inferenskod på GitHub den 1 september 2026 utan något tillkännagivande heller. Med fem veckors mellanrum släppte två av världens största laboratorier modeller som delar en stilla övertygelse – att sättet vi omvandlar visuell information till tokens är flaskhalsen – och lämnade sedan dem åt communityn att upptäcka. En av dem kan du ladda ner och köra idag, om än omständligt. Den andra kan du inte köra alls, eftersom dess vikter ännu inte existerar. Detta är den ärliga kartan över de två, och över varför ”båda leverantörsrapporterade, båda obevisade” inte är samma mening för båda.
Fem veckor, två satsningar på representationseffektivitet
Den röda tråden är verklig, inte retorisk. Mage-VL är en codec-nativ videomodell: istället för att avkoda en ström till jämnt samplade bildrutor och skicka ett tätt rutnät av patch:ar genom en fryst webbtränad vision transformer, följer den strukturen hos moderna videocodecs genom att dela upp en ström i ankarramar och den komprimerade rörelsedatan mellan dem, och tar emot den kompakta representationen direkt. Microsofts rapporterade vinst är en stor minskning av visuella tokens och en betydligt snabbare strömmande perceptionsväg – företaget beskriver det som att åtgärda en sorts Moravecs paradox för video-språkmodeller, där små realtidsperceptionsuppgifter kostar lika mycket beräkningskraft som svårt offline-resonerande. Mage-VL är en betraktare: den konsumerar video effektivt och svarar på frågor om vad den ser, närapå i realtid.
InternLumina-U2 är en satsning på samma flaskhals från andra hållet. Där Mage-VL komprimerar video genom att följa codec:en, komprimerar InternLumina-U2 varje visuell input genom att beskriva varje position med åtta kompletterande diskreta koder istället för en, med hjälp av en tokenizer som labbet kallar AToken. Vadet är att en enda codebook begränsar hur mycket information en visuell token kan bära, så ett ordförråd med flera codebooks gör att en diffusionsmodell med 16B parametrar kan utföra både förståelse och generering genom samma gränssnitt — läsa ett diagram, svara på en videofråga, beskriva en 3D-tillgång, generera en bild från text, redigera en utifrån instruktion — utan en separat genereringsstack. Mage-VL vill uppfatta strömmar billigt; InternLumina-U2 vill uppfatta och rita med en enda uppsättning vikter.
Resultattavlan
Båda modellernas siffror är leverantörsrapporterade och ej oberoende verifierade, så resultattavlan anger källan för varje rad.
• Form — Mage-VL: en kompakt codec-nativ vision-språkmodell (cirka 5B parametrar i BF16) byggd kring en Qwen-textstomme, tränad för bild- och videoförståelse. InternLumina-U2: en MoE-modell med 16B parametrar och 1B aktiva (16B-A1B), en gles diffusions-LLM som täcker förståelse, generering och redigering.
• Visuell representation — Mage-VL: codec-nativa token som följer video-codec-strukturen (ankare plus rörelse); rapporterad minskning av visuella token med >75 % vid strömmande video. InternLumina-U2: fullständigt diskreta token från åtta codebooks, genererade av AToken-tokenizern.
• Vad den gör — Mage-VL: tittar på bild- och videoinmatning, svarar i text; byggd för strömningsperception. InternLumina-U2: hävdar textförståelse, bildförståelse, text-till-bild, bildredigering, videoförståelse och 3D-förståelse.
• Vikter — Mage-VL: publika på Hugging Face sedan 25 juli 2026 (microsoft/Mage-VL, Apache-2.0). InternLumina-U2: inte publika — Hugging Face-repot är en tom stub, vikterna markerade som "kommer snart".
• Rubriksiffror — Mage-VL: Video-MME 64,0, NExT-QA 83,1, OVO-Bench 64,0, alla Microsoft-rapporterade. InternLumina-U2: ChartQA 86,52, MathVision 33,22, VideoMME 51,26, GenEval 0,81, alla lab-rapporterade, preliminära och ofullständiga.
• Serveringsverklighet — Mage-VL: nedladdningsbar, men det finns ingen standardväg för vLLM eller SGLang; koden kräver trust_remote_code, och ingen inferensleverantör driftsätter den för närvarande. InternLumina-U2: kan inte serveras av någon — vikterna finns inte offentligt, och även den släppta inferensdrivrutinen förväntar sig checkpointfiler som inte finns i repositoryt.

"Tillgänglig men besvärlig" är inte detsamma som "inte tillgänglig"
Detta är den skillnad som betyder mest om du faktiskt försöker bygga något. Mage-VL är verkligt på det sätt som räknas först: vikterna finns på Hugging Face, modellkortet har haft stor nedladdningstrafik sedan slutet av juli, och ett litet ekosystem av community-kvantiseringar har vuxit fram kring det. ”Verkligt” betyder inte ”lätt.” Modellkortet visar en tagg för anpassad kod, den visuella kodaren är inte den standardfrysta ViT som befintliga server-stackar förutsätter, och Microsofts eget repo bär den praktiska konsekvensen – att köra det innebär trust_remote_code och ingen nyckelfärdig leverantörsdistribution. Men ett målmedvetet team med en GPU kan ladda det, rikta det mot en videoström och se om den codec-nativa tesen håller för deras data. Det är en enorm skillnad jämfört med InternLumina-U2, där samma mening slutar annorlunda: ett målmedvetet team kan läsa inferenskoden, och sedan stannar det, eftersom det inte finns några vikter att ladda.

Hugging Face-kortet för microsoft/Mage-VL, fångat den 27 augusti 2026 — den codec-nativa strömningsbeskrivningen, Apache-2.0-licensen, arxiv-taggen och ett avsnitt om inferensleverantörer som visar att ingen leverantör för närvarande distribuerar modellen.
Benchmarkasymmetrin följer samma linje. Båda modellernas siffror är leverantörspåståenden; ingen oberoende part har ännu gjort om mätningarna. Men Mage-VL:s påståenden vilar åtminstone på en nedladdningsbar artefakt, vilket innebär att gapet mellan påstående och verifiering bara handlar om att någon kör den. InternLumina-U2:s påståenden vilar på en punkt i färdplanen – ”fullständiga jämförelsetabeller kommer att publiceras i den kommande tekniska rapporten” – och det finns ingen artefakt som skulle kunna verifiera dem. Labbets egen ofullständiga tabell visar till och med att modellen ligger efter minst en konkurrent som den påstår sig överträffa (GenEval 0,81 mot LLaDA2.0-Uni:s 0,89), vilket är en nyttig påminnelse om att läsa etiketten ”preliminär, ofullständig” bokstavligt.
Där de kunde komponera istället för att tävla
Det mest användbara sättet att läsa dessa två är som intilliggande stegpinnar på en stege, inte som rivaler om samma jobb. En codec-nativ bevakare som Mage-VL är intressant just för att den är billig nog att köras kontinuerligt – något som bevakar varje bildruta i en ström och bara eskalerar när något värt en större modells uppmärksamhet dyker upp. Den större modellen som den eskalerar till skulle i princip kunna vara en enhetlig modell av det slag InternLumina-U2 påstår sig vara: den ständigt påslagna grinden som avgör vad man ska titta på, och den djupa modellen som faktiskt läser av diagrammet, följer 3D-scenen eller producerar den redigerade bilden. Båda är obevisade – Mage-VL obevisad men körbar, InternLumina-U2 obevisad och outgiven – så den ärliga beskrivningen är en komposition du skulle kunna bygga när varje sida har validerats oberoende, inte en direkt jämförelse du kan köra i dag.

GitHub-repot InternLM/InternLumina-U2, avbildat den 2 september 2026 — repots landningssida som visar beskrivningen av diffusion med flera kodböcker, Apache-2.0-licensmärket och skripten för inferensens ingångspunkter som utgör den offentliga utgåvan medan vikterna ligger utanför trädet.
Vad ett routinglager gör med obevisade kontrollpunkter
Ingen av dessa modeller är hostad på OrcaRouter, och vi tänker inte antyda något annat — Mage-VL har ingen standardsökväg för serving någonstans, och InternLumina-U2 har inga vikter. Det routnings-DSL:et verkligen är användbart för i den här situationen är att uttrycka kompositionen ovan som ett enda anrop i stället för specialskräddad integrationskod: en billig, alltid påslagen perceptionsmodell som matar en djupare modell, kopplad i kedja så att den dyra modellen bara körs när den billiga säger att något har ändrats. Och när det gäller problemet med oprövade checkpoints — vilket är hela riskprofilen för båda dessa — är automatisk failover den mekanism som låter ett team prova en modell som Mage-VL på en riktig sökväg utan att satsa sökvägen på den: första gången den nya checkpointen hänger sig, returnerar skräp eller kastar ett fel faller anropet tillbaka till en beprövad modell, och ingen ingenjör behöver väckas för att slå om en strömbrytare. Ett API för 200+ modeller, leverantörens listpris som förs vidare utan påslag, och det nya objektet provspelat bakom ett skyddsnät i stället för framför produktion.
Slutsatsen
Om du vill testa tesen om codec-nativ video idag, så finns bara Mage-VL — och "finns" kommer med förbehåll om anpassad kod och gör-det-själv-drift. Om du vill testa tesen om en enhetlig modell med flera codebooks, så kan du inte det, eftersom InternLumina-U2 fortfarande är en specifikation som väntar på sina vikter; vad du däremot kan göra är att läsa dess arkitektur redan nu, så att du är redo i samma ögonblick som stubben på Hugging Face fylls i. Betrakta Microsoft-modellen som en omständlig men verklig artefakt och Shanghai AI Lab-modellen som ett väldokumenterat löfte, och kom ihåg att i den här jämförelsen gäller "leverantörsrapporterad och ej reproducerad" för båda — det betyder helt enkelt något annat när det finns en fil du kan ladda ner.
