
PixelUMM vs Microsoft Mage-VL: Den ena raderar den visuella tokeniseraren, den andra skriver om den
- openaiNYOpenAI: GPT-6.1 Sol2026-09-2952Intelligens
- anthropicNYAnthropic: Claude Sonnet 5.52026-09-2856Intelligens
- typesafeNYTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M tokens · 223 tok/s
- OpenAINYOpenAI: GPT-6 Luna2026-09-2238Intelligens
- OpenAINYOpenAI: GPT-6 Sol2026-09-2248Intelligens
- AnthropicNYAnthropic: Claude Opus 5.52026-09-2258Intelligens
- xAINYGrok 4.72026-09-2146Intelligens
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M tokens · 124 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
Både PixelUMM och Microsoft Mage-VL byggdes av team som var övertygade om att sättet som vision omvandlas till tokens på är fel flaskhals – och de åtgärdade det i motsatta riktningar. Mage-VL, Microsofts kodeknativa strömmande modell, behåller en tokenizer och gör den långt mer aggressiv: den följer strukturen hos moderna videokodekar, behåller varje ankarbild och endast de patcharna i predikterade bildrutor där kodeken spenderar bitar, och rapporterar att den skär ner visuella tokens med mer än 75 % samtidigt som den uppnår en snabbhetsökning på upp till 3,5× i väggklockstid jämfört med enhetlig bildrutesampling. PixelUMM, NVIDIA:s encodarfria enhetliga modell, tar bort tokenizern helt – varje 16×16-patch av råa pixlar når backbone genom en enda linjär projektion, utan VAE och utan någon vision transformer någonstans. Den ena komprimerar hårdare. Den andra vägrar komprimera överhuvudtaget. Och bara en av dem kan generera något.
Den sista skillnaden är vad som gör den här kombinationen mer intressant än en specifikationsstrid. Mage-VL är en iakttagare – en strömmande perceptionsmodell med en proaktiv grind som avgör när den ska tala. PixelUMM är en läsare som också ritar: samma vikter svarar på frågor om en bild och genererar ny video utifrån en textprompt. De är två oförenliga svar på "vad en enhetlig visionsmodell bör vara", och varje labs siffror är dess egna.
Var komprimeringen sker
Mage-VLs premiss är en modern Moravecs paradox: visuella språkmodeller är starka på svårt offlineresonemang men långsamma och beräkningshungriga vid enkel realtidsperseption. Dess lösning är codec-alignering. I stället för att avkoda en ström till enhetligt samplade bildrutor och skicka ett tätt rutnät genom en fryst, webbförtränad ViT, separerar Mage-VL en ström i ankarbildrutor (I) och predikterade bildrutor (P), behåller alla patchar i ankarbildrutorna och behåller endast patchar från predikterade bildrutor som bär verklig rörelse eller ny detalj. Kodaren Mage-ViT är tränad från grunden på ett 16×16-patchrutnät med 3D-rotationspositionskodning och är uttryckligen codec-agnostisk — samma gränssnitt accepterar H.264/AVC- eller HEVC-rörelsevektorer och residualenergi, eller den inlärda bithastighetskartan för en neural codec, utan ändrad arkitektur eller omträning.
PixelUMM:s premiss är att själva encodern är problemet, inte dess effektivitet. Dess artikel argumenterar för att modeller som BAGEL har två visuella gränssnitt – en ViT för semantiska egenskaper och en VAE för rekonstruktionslatenter – vilket ungefär fördubblar den visuella kontexten per konditioneringsbild och tvingar pipelines för vision-språk-förträning att byggas om kring en andra ström. PixelUMM tar bort båda: bilder blir 16×16 spatiala patchar, videor blir spatiotemporala tubelets med 4 bildrutor, och råa pixlar når en decoder-only-Transformer genom enkellagriga linjära projektioner. Förståelse är autoregressiv text; generering är flödesmatchning i pixelrummet.
• Komprimeringsstrategi — Mage-VL: temporal, codec-härledd; behåll ankare, glesa ut predikterade bildrutor. PixelUMM: ingen; behåll varje patch av råa pixlar.
• Vad tränas från grunden – Mage-VL: hela den visuella stacken, på cirka 100M omärkta bilder och videor. PixelUMM: pixelinbäddarna och avkodarna, ovanpå en Qwen3-8B-språkryggrad.
• Stomme — Mage-VL: Qwen3-4B-Instruct-2507, den enda förtränade komponenten, bakom en tvålagers MLP-projektor. PixelUMM: Qwen3-8B, cirka 15,2 miljarder parametrar totalt.
• Streamningsbeteende — Mage-VL: en kognitionsgrind poängsätter varje rullande fönster och förblir tyst tills en händelse värd ett svar har slutförts, och anropar den fullständiga modellen först då. PixelUMM: inget streamingläge; förfrågningar är anrop för generering eller förståelse.

Vad var och en gör, och vad den inte gör
Mage-VL är en enda checkpoint som samtidigt tillhandahåller bild- och videoförståelse och den proaktiva strömningsgrinden — samma vikter svarar på offlinefrågor och driver händelsestyrd kommentering. Den paketerar kodekprocessorn, det neurala kodekpaketet och grinden. En andra utgåva, microsoft/Mage-ViT, är den fristående visuella encodern från förträningsfasen från grunden, erbjuden som en drop-in-front-end för annan multimodal träning. Vad Mage-VL inte gör är att generera. Den läser.
PixelUMM täcker text-till-bild, text-till-video vid 96 bildrutor och 24 fps samt text som betingas av bild och video. Den levereras med fyra checkpoints – S8-F22-R05 som är standard och täcker alla fyra uppgifterna, S8-F18-R01 finjusterad för bättre text-till-video vid 480p och 720p men som inte klarar videoförståelse, samt två mellanliggande stadier. Vad den inte gör är streaming, redigering eller 3D. Om du behöver en modell som tittar på en live-ström och talar när något händer, har PixelUMM helt fel form, och ingen benchmarkkolumn kommer att berätta det för dig.
Adoptionsgapet är den första ärliga signalen.
De två utgåvorna är inte lika mogna, och nedladdningsräknarna säger det tydligare än något lanseringsinlägg.
• Mage-VL — publicerad på Hugging Face den 25 juli 2026 under Apache-2.0, med en medföljande teknisk rapport och en arXiv-identifierare. I början av oktober visade den ungefär 13 800 nedladdningar och 414 gilla-markeringar, och ett litet ekosystem av communityarbete hade vuxit fram runt den.
• PixelUMM — publicerad på Hugging Face den 1 oktober 2026 under en icke-kommersiell checkpoint-licens. Dess nedladdningsantal var noll och antalet gillningar var tre när detta skrevs. Den är några dagar gammal.
Det finns fortfarande inget tillkännagivande från något av labben för respektive lansering — Mage-VL släpptes i juli utan ett, och PixelUMM släpptes i oktober utan ett. Den symmetrin är verklig, men det vore ett misstag att läsa det som att de två är likvärdiga artefakter. Mage-VL har fått tio veckors uppmärksamhet från communityn; PixelUMM har fått dagar. En modell som ingen utanför labbet har kört är en annan sak än en modell som några tusen personer har laddat ner, och bara en av dessa två tillhör den andra kategorin.

Resultattavlan, med proveniens
Alla siffror är utvecklingslabbets egna. Mage-VL:s kommer från Microsofts modellkort och tekniska rapport; PixelUMM:s från dess preprint. Ingen av dem har oberoende reproducerats.
• Visuella tokens — Mage-VL: rapporterad minskning med över 75 % jämfört med tät bildrutesampling. PixelUMM: ingen minskning; argumentet är att råa patchar tar bort en andra kodning i stället för att krympa den första.
• Väggklockehastighet — Mage-VL: upp till 3,5× snabbare än enhetlig bildrutesampling vid matchad noggrannhet, enligt Microsoft. PixelUMM: inget jämförande hastighetsanspråk i artikeln.
• Encoderkvalitet — Mage-VL: Mage-ViT rapporterar 99,33 % för CIFAR-10 och 85,69 % för ImageNet vid en budget på 256 token, från cirka 100 miljoner omärkta medier. PixelUMM: ingen motsvarande encoder-benchmark, eftersom det inte finns någon encoder att benchmarka.
• Videoförståelse — Mage-VL: rapporterade förbättringar jämfört med Qwen3-VL-4B på samtliga video- och temporal-grounding-benchmarks som den rapporterar, inklusive +22,5 på QVHighlight och +17,1 på ActivityNet. PixelUMM: MVBench 70,53, Video-MME 57,33 utan undertexter, LongVideoBench 59,61, LVBench 40,41.
• Bildförståelse — Mage-VL: i nivå med Qwen3-VL-4B på statiska bilder, enligt Microsoft. PixelUMM: MMMU 41,67, AI2D 80,12, DocVQA 90,42, ChartQA 82,96.
• Generering — Mage-VL: ingen. PixelUMM: GenEval totalt 0.83 med en prompt-omskrivare, DPG-Bench 85.74, VBench Del 1 kvalitet 84.10.
• Strömning — Mage-VL: proaktiv händelsegating med rapporterade toppvärden för TimVal, F1, ROC-AUC och PR-AUC på SoccerNet-strömning. PixelUMM: stöds inte.
• Licens — Mage-VL: Apache-2.0, kod och vikter. PixelUMM: Apache-2.0-kod, NVIDIA One-Way Noncommercial License på checkpointen.
De två kolumnerna överlappar inte tillräckligt för att rangordna. Mage-VL rapporterar att en effektiv encoder slår en konkurrent på samma skala; PixelUMM rapporterar att en 15B-modell hamnar i samma band som de specialiserade systemen omkring den, och säger rent ut i sin egen artikel att olika träningsdata innebär att resultaten ”inte kan fastställa vilken arkitektur som är överlägsen”.
Den praktiska uppdelningen
Välj efter uppgift, inte efter poäng. Om du bygger realtidsbaserad videouppfattning – en monitor som tittar på en ström och kommenterar när något händer, med tokenkostnad som den bindande begränsningen – är Mage-VL den enda av de två som gör det, den är Apache-2.0, och dess skala i 4B-klassen innebär att en enda nod kan köra den. Om du behöver en modell som läser bilder och video och även genererar dem, är PixelUMM den enda av de två som gör det, men den är en forskningsartefakt under en icke-kommersiell licens, dess vikter är 128 distribuerade checkpoint-shards bakom ett dolt index, och text-till-video kör Cosmos skyddsräcken som standard med en separat Python-miljö för gaten.
För ett team som behöver båda funktionerna är argumentet för att nå dem via ett enda routningslager i stället för två direkta integrationer enkelt, även om ingen av dem hostas i dag: en enda nyckel, leverantörernas listpriser som förs vidare med 0 % påslag, och redundansregler som låter dig placera en nyligen öppnad Apache-2.0-modell framför en del av trafiken medan den beprövade modellen hanterar resten. OrcaRouter är byggt för den typen av problem – och för att vara tydlig, vi routar varken PixelUMM eller Mage-VL just nu, så detta är en beskrivning av arbetsflödet, inte en förteckning.
Vad skulle avgöra det?
Två händelser spelar roll. Den första är en oberoende omkörning av Mage-ViTs encoder-siffror eller Mage-VLs videoresultat av någon som inte har något eget intresse i dem – tio veckors nedladdningar har ännu inte gett en enda. Den andra är varje ändring av PixelUMMs checkpoint-licens, vilket är det enda faktum som för närvarande skiljer en forskningsartefakt från en driftsättningsbar. Tills något av dem är på plats är det användbara du kan säga om detta par att Microsoft satsade på att göra det visuella gränssnittet billigare och NVIDIA satsade på att ta bort det, och ingen av satsningarna har bedömts av någon utanför laboratoriet som gjorde den.
