
PixelUMM vs Microsoft Mage-VL: de een verwijdert de visuele tokenizer, de ander herschrijft hem
- openaiNIEUWOpenAI: GPT-6.1 Sol2026-09-2952Intelligentie
- anthropicNIEUWAnthropic: Claude Sonnet 5.52026-09-2856Intelligentie
- typesafeNIEUWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 mln tokens · 223 tok/s
- OpenAINIEUWOpenAI: GPT-6 Luna2026-09-2238Intelligentie
- OpenAINIEUWOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- AnthropicNIEUWAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- xAINIEUWGrok 4.72026-09-2146Intelligentie
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 mln tokens · 124 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 mln tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
Zowel PixelUMM als Microsoft Mage-VL werden gebouwd door teams die ervan overtuigd waren dat de manier waarop visie in tokens wordt omgezet de verkeerde bottleneck is — en ze losten het in tegengestelde richtingen op. Mage-VL, het codec-native streamingmodel van Microsoft, behoudt een tokenizer en maakt die veel agressiever: het volgt de structuur van moderne videocodecs, behoudt elk ankerframe en alleen die patches van voorspelde frames waar de codec bits aan besteedt, en rapporteert dat het visuele tokens met meer dan 75% vermindert terwijl het tot 3,5× wall-clock-versnelling behaalt ten opzichte van uniforme framebemonstering. PixelUMM, het encoder-vrije geünificeerde model van NVIDIA, verwijdert de tokenizer volledig — elke 16×16-patch ruwe pixels bereikt de backbone via één enkele lineaire projectie, zonder ergens een VAE of vision transformer. De ene comprimeert harder. De andere weigert helemaal te comprimeren. En slechts één van hen kan überhaupt iets genereren.
Dat laatste verschil maakt deze combinatie interessanter dan een specificatiestrijd. Mage-VL is een observator — een streaming perceptiemodel met een proactieve poort die beslist wanneer het moet spreken. PixelUMM is een lezer die ook tekent: dezelfde gewichten beantwoorden vragen over een afbeelding en genereren nieuwe video op basis van een tekstprompt. Het zijn twee onverenigbare antwoorden op "wat een verenigd visiemodel zou moeten zijn", en elk lab heeft zijn eigen cijfers.
Waar de compressie plaatsvindt
Het uitgangspunt van Mage-VL is een moderne Moravec-paradox: vision-language-modellen zijn sterk in moeilijk offline redeneren, maar traag en rekenhongerig bij eenvoudige realtime perceptie. De oplossing is codec-afstemming. In plaats van een stream te decoderen naar uniform gesamplede frames en een dicht raster door een bevroren, op het web voorgetrainde ViT te duwen, splitst Mage-VL een stream op in anchor (I)-frames en voorspelde (P)-frames, behoudt alle anchor-patches en houdt alleen de patches van voorspelde frames die echte beweging of nieuwe details bevatten. De encoder, Mage-ViT, wordt vanaf nul getraind op een 16×16 patch-raster met 3D roterende positiecodering en is expliciet codec-agnostisch — dezelfde interface accepteert H.264/AVC- of HEVC-bewegingsvectoren en restenergie, of de geleerde rate map van een neurale codec, zonder wijziging van architectuur of hertraining.
Het uitgangspunt van PixelUMM is dat de encoder zelf het probleem is, niet zijn efficiëntie. In zijn paper wordt betoogd dat modellen zoals BAGEL twee visuele interfaces hebben — een ViT voor semantische kenmerken en een VAE voor reconstructie-latenten — wat de visuele context per conditioneringsafbeelding ruwweg verdubbelt en vision-language pretraining-pijplijnen dwingt om rond een tweede stream opnieuw te worden opgebouwd. PixelUMM verwijdert beide: afbeeldingen worden 16×16 ruimtelijke patches, video's worden 4-frame spatiotemporele tubelets, en ruwe pixels bereiken een decoder-only Transformer via eenlaagse lineaire projecties. Begrip is autoregressieve tekst; generatie is flow matching in de pixelruimte.
• Compressiestrategie — Mage-VL: temporaal, van codec afgeleid; behoud ankers, maak voorspelde frames schaarser. PixelUMM: geen; behoud elke patch van ruwe pixels.
• Wat vanaf nul wordt getraind — Mage-VL: de volledige visuele stack, op ongeveer 100M ongeëtiketteerde afbeeldingen en video's. PixelUMM: de pixel-embedders en -decoders, bovenop een Qwen3-8B-taalbackbone.
• Backbone — Mage-VL: Qwen3-4B-Instruct-2507, de enige vooraf getrainde component, achter een tweelaagse MLP-projector. PixelUMM: Qwen3-8B, in totaal ongeveer 15,2 miljard parameters.
• Streaminggedrag — Mage-VL: een cognitieve poort scoort elk rollend venster en blijft stil totdat een gebeurtenis die een reactie waard is, is voltooid, en roept pas dan het volledige model aan. PixelUMM: geen streamingmodus; verzoeken zijn generatie- of begripsaanroepen.

Wat elk ervan doet, en wat het niet doet.
Mage-VL is één checkpoint dat tegelijkertijd beeld- en videobegrip en de proactieve streaming-gate levert — dezelfde gewichten beantwoorden offline vragen en sturen event-gated commentaar aan. Het bundelt de codec-processor, het neurale-codec-pakket en de gate. Een tweede release, microsoft/Mage-ViT, is de zelfstandige visuele encoder uit de from-scratch pretrainingsfase, aangeboden als een drop-in front-end voor andere multimodale training. Wat Mage-VL niet doet, is genereren. Het leest.
PixelUMM dekt tekst-naar-afbeelding, tekst-naar-video met 96 frames en 24 fps, en tekst met afbeeldings- en videoconditionering. Het wordt geleverd met vier checkpoints — S8-F22-R05 als de standaard die alle vier taken dekt, S8-F18-R01 afgestemd op betere tekst-naar-video bij 480p en 720p maar niet in staat tot videobegrip, en twee tussenfasen. Wat het niet doet, is streaming, bewerken of 3D. Als je een model nodig hebt dat een livefeed volgt en spreekt wanneer er iets gebeurt, dan is PixelUMM volledig het verkeerde model, en geen enkele benchmarkkolom zal je dat vertellen.
De adoptiekloof is het eerste eerlijke signaal
De twee releases zijn niet even volwassen, en de downloadtellers zeggen dat helderder dan welke lanceringspost dan ook.
• Mage-VL — gepubliceerd op Hugging Face op 25 juli 2026 onder Apache-2.0, met een bijbehorend technisch rapport en een arXiv-identifier. Begin oktober vertoonde het ongeveer 13.800 downloads en 414 likes, en er was een klein ecosysteem van communitywerk rond ontstaan.
• PixelUMM — gepubliceerd op Hugging Face op 1 oktober 2026 onder een niet-commerciële checkpointlicentie. Het aantal downloads was nul en het aantal likes was drie toen dit werd geschreven. Het is pas een paar dagen oud.
Er is nog steeds geen aankondiging van een van beide labs voor de betreffende release — Mage-VL werd in juli uitgebracht zonder aankondiging en PixelUMM werd in oktober uitgebracht zonder aankondiging. Die symmetrie is reëel, maar het zou een vergissing zijn om die te interpreteren als dat de twee gelijkwaardige artefacten zijn. Mage-VL heeft tien weken aandacht van de community gehad; PixelUMM heeft dagen gehad. Een model dat niemand buiten het lab heeft gedraaid, is iets anders dan een model dat een paar duizend mensen hebben gedownload, en slechts één van deze twee valt in de tweede categorie.

Het scorebord, met herkomst
Elk cijfer is van het ontwikkelende lab zelf. Die van Mage-VL komen uit de kaart en het technisch rapport van Microsoft; die van PixelUMM uit de preprint daarvan. Geen van beide is onafhankelijk gereproduceerd.
• Visuele tokens — Mage-VL: gerapporteerde reductie van meer dan 75% ten opzichte van dichte framesampling. PixelUMM: geen reductie; het argument is dat ruwe patches een tweede codering wegnemen in plaats van de eerste te verkleinen.
• Snelheid in werkelijke tijd — Mage-VL: tot 3,5× sneller dan uniforme framesampling bij gelijke nauwkeurigheid, zoals gerapporteerd door Microsoft. PixelUMM: geen vergelijkende snelheidsclaim in het artikel.
• Encoderkwaliteit — Mage-VL: Mage-ViT rapporteert 99,33% op CIFAR-10 en 85,69% op ImageNet bij een budget van 256 tokens, op basis van ongeveer 100M niet-gelabelde media. PixelUMM: geen equivalente encoderbenchmark, aangezien er geen encoder is om te benchmarken.
• Videobegrip — Mage-VL: gerapporteerde verbeteringen ten opzichte van Qwen3-VL-4B op elke benchmark voor video- en temporele grounding die het rapporteert, waaronder +22,5 op QVHighlight en +17,1 op ActivityNet. PixelUMM: MVBench 70,53, Video-MME 57,33 zonder ondertitels, LongVideoBench 59,61, LVBench 40,41.
• Beeldbegrip — Mage-VL: op gelijke hoogte met Qwen3-VL-4B op statische afbeeldingen, volgens Microsoft. PixelUMM: MMMU 41,67, AI2D 80,12, DocVQA 90,42, ChartQA 82,96.
• Generatie — Mage-VL: geen. PixelUMM: GenEval algemeen 0,83 met een prompt-herschrijver, DPG-Bench 85,74, VBench Part 1-kwaliteit 84,10.
• Streaming — Mage-VL: proactieve event-gating met gerapporteerde beste TimVal-, F1-, ROC-AUC- en PR-AUC-scores op SoccerNet-streaming. PixelUMM: niet ondersteund.
• Licentie — Mage-VL: Apache-2.0, code en gewichten. PixelUMM: Apache-2.0-code, NVIDIA One-Way Noncommercial License op het checkpoint.
De twee kolommen overlappen onvoldoende om een rangorde te kunnen bepalen. Mage-VL meldt dat een efficiënte encoder een concurrent van dezelfde schaal verslaat; PixelUMM meldt dat een 15B-model in dezelfde band terechtkomt als de gespecialiseerde systemen eromheen, en zegt ronduit in zijn eigen paper dat verschillende trainingsdata betekenen dat de resultaten "niet kunnen vaststellen welke architectuur superieur is".
De praktische opsplitsing
Kies op basis van de taak, niet op basis van de score. Als je realtime videoperceptie bouwt — een monitor die een stream bekijkt en commentaar geeft wanneer er iets gebeurt, met tokenkosten als de bindende beperking — is Mage-VL de enige van de twee die dit doet, het is Apache-2.0, en zijn schaal van de 4B-klasse betekent dat één node het kan bedienen. Als je één model nodig hebt dat afbeeldingen en video leest en ze ook genereert, is PixelUMM de enige van de twee die dat doet, maar het is een onderzoeksartefact onder een niet-commerciële licentie, de gewichten ervan zijn 128 gedistribueerde checkpoint-shards achter een verborgen index, en tekst-naar-video draait standaard met Cosmos-guardrails, met een aparte Python-omgeving voor de gate.
Voor een team dat beide capaciteiten nodig heeft, is het argument om ze via één routinglaag te bereiken in plaats van via twee directe integraties eenvoudig, ook al wordt geen van beide vandaag gehost: één sleutel, lijstprijzen van providers doorgegeven met 0% opslag, en failoverregels waarmee je een nieuw vrijgegeven Apache-2.0-model voor een deel van het verkeer kunt zetten terwijl het bewezen model de rest opvangt. OrcaRouter is gebouwd voor dat soort probleem — en om expliciet te zijn, we routeren momenteel noch PixelUMM noch Mage-VL, dus dit is een beschrijving van de workflow, geen aanbiedingenlijst.
Wat zou het beslechten?
Twee gebeurtenissen doen ertoe. De eerste is een onafhankelijke herhaling van de encodercijfers van Mage-ViT of de videoresultaten van Mage-VL door iemand die er geen belang bij heeft — tien weken aan downloads hebben er nog geen opgeleverd. De tweede is elke wijziging aan de checkpointlicentie van PixelUMM, het enige feit dat momenteel een onderzoeksartefact scheidt van een inzetbaar exemplaar. Totdat een van beide zich aandient, is het nuttige dat je over dit tweetal kunt zeggen dat Microsoft heeft ingezet op het goedkoper maken van de visuele interface en NVIDIA op het verwijderen ervan, en geen van beide weddenschappen is beoordeeld door iemand buiten het lab dat ze heeft afgesloten.
