Een gegenereerde titelkaart in de huisstijl van OrcaRouter met de tekst “PixelUMM vs InternLumina-U2”, met vier statistiektegels: “41.67 / 57.33” (PixelUMM MMMU en Video-MME), “0.81 / 51.26” (InternLumina-U2 GenEval en Video-MME), “Apache-2.0” (InternLumina-U2-code en beide checkpoints) en “1-way NC” (de PixelUMM-checkpointlicentie). Een voettekstregel luidt: “Door de leverancier gerapporteerde cijfers; geen onafhankelijke herhaling van een van beide modellen.”. Het OrcaRouter-logo is gecompositeerd in de opgevulde strook rechtsonder.
Guides & Insights

PixelUMM vs InternLumina-U2: Twee encoder-vrije bèta's, en het enige verschil dat de doorslag geeft

Auteur

Elias Hawthorne

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen →
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Twee modellen, beide openbaar, beide ongewoon ontworpen, en slechts op één ervan kun je een product bouwen. PixelUMM is het encoderloze uniforme model van NVIDIA — 15,2 miljard parameters op een Qwen3-8B-backbone, leest en schrijft ruwe pixels via 16×16-patches en 4-frame-tubelets, zonder VAE en zonder enige vision-encoder in de stack. InternLumina-U2 is het 16B mixture-of-experts-diffusiemodel van Shanghai AI Laboratory dat elke visuele input comprimeert naar acht complementaire discrete codes via een tokenizer genaamd AToken. Beide wedden erop dat de visuele interface de bottleneck is. De weddenschap die er meer toe doet, is die in de licentiebestanden: InternLumina-U2 levert Apache-2.0-gewichten, PixelUMM levert een checkpoint onder een niet-commerciële licentie. Als je tussen hen kiest voor iets commercieels, is die zin de hele vergelijking en is de rest van deze pagina context daarvoor.

Beide sets cijfers hieronder komen van de labs zelf. Geen van beide modellen heeft een onafhankelijke evaluatie, een arena-Elo of een reproductie door derden. Geen van beide wordt via een gehoste API aangeboden. Wat verschilt, is wat je met het artefact mag doen zodra je het downloadt, en hoe ver elke release daadwerkelijk is.

Waar elk nu staat

De releaseplanningen zijn in een verschillend tempo opgeschoven, en beide geruisloos.

• PixelUMM — GitHub-repository aangemaakt op 4 september 2026; arXiv-preprint 2609.38597 gedateerd 29 september 2026; Hugging Face-modelrepository aangemaakt op 1 oktober 2026 om 21:40 UTC. Er is geen NVIDIA-blogbericht, persbericht of lanceringsthread voor opgedoken.

• InternLumina-U2 — GitHub-repository aangemaakt op 1 september 2026; Hugging Face-stub dezelfde dag geregistreerd; met Ascend getrainde checkpointgewichten toegevoegd op 10 september 2026; NVIDIA/CUDA-checkpointgewichten toegevoegd op 24 september 2026. Zeven shards per stack, beide vandaag downloadbaar.

De InternLumina-U2 die begin september bestond — alleen code, gewichten "binnenkort beschikbaar", een lege modelrepository — is niet de InternLumina-U2 die nu bestaat. Iedereen die er aan het begin van de maand over las en concludeerde dat de gewichten ontbraken, moet het opnieuw controleren; zowel de Huawei Ascend- als de NVIDIA/CUDA-checkpoints staan online, onder Apache-2.0, met tokenizer, config, chatsjabloon en remote-modellingcode ernaast.

A headless-browser capture of the Hugging Face model card for the InternLumina-U2 repository, showing the model title, the Apache-2.0 licence tag, and the repository's download and like counters alongside the file listing for the checkpoint shards.

Twee antwoorden op dezelfde vraag

Beide modellen vertrekken vanuit dezelfde klacht: het meeslepen van een vision-encoder voor begrip en een VAE voor generatie betekent dat elke afbeelding tweemaal wordt weergegeven, waardoor de visuele context ongeveer verdubbelt en een trainingspijplijn wordt gedwongen om twee interfaces te onderhouden.

PixelUMM's antwoord is om beide te verwijderen. Ruwe pixels gaan rechtstreeks naar binnen via lineaire projecties met één laag — een 16×16-patch per beeldpositie, een tubelet van 4 frames per videopositie — en de backbone is een decoder-only Transformer waarvan het Mixture-of-Transformers-ontwerp gedeelde attention combineert met taakspecifieke parameters. Tekst wordt autoregressief voorspeld; pixels worden voorspeld via flow matching. De paper besteedt acht secties aan ontwerpstudies — patchgrootte, patchartefacten, dynamiek in pixelruimte versus VAE-ruimte, compute-scaling — wat aangeeft dat de echte vraag van het team was of het paradigma überhaupt standhoudt.

Het antwoord van InternLumina-U2 is om een discrete interface te behouden, maar elke token veel meer informatie te laten bevatten. De AToken-tokenizer beschrijft elke visuele positie met acht complementaire codeboeken die textuur, ingebedde tekst en geometrie bestrijken; de acht embeddings worden per positie geconcateneerd en geprojecteerd naar één backbone-token. Het decoderen verloopt in omgekeerde richting, met ruimtelijk parallelle denoising en een autoregressieve multi-codeboek-head die de acht codes in volgorde voorspelt. De backbone is een sparse diffusie-LLM uit de LLaDA-2.0-lijn, 16B totaal met 1B actief.

• Visuele interface — PixelUMM: ruwe pixelpatches en tubelets, helemaal geen tokenizer. InternLumina-U2: volledig discrete tokens met acht codebooks van AToken, geen continue latente.

• Backbone — PixelUMM: Qwen3-8B (15,2B totaal), één dense decoder met experts voor begrip en generatie. InternLumina-U2: 16B totaal / 1B actief sparse MoE-diffusietaalmodel.

• Generatiemethode — PixelUMM: flow matching in pixelruimte plus autoregressieve tekst. InternLumina-U2: gemaskeerde diffusie-denoising over discrete codes.

• Geclaimde taken — PixelUMM: tekst-naar-afbeelding, tekst-naar-video, afbeelding-naar-tekst, video-naar-tekst. InternLumina-U2: die plus beeldbewerking en 3D-begrip.

• Gewichtsformaat — PixelUMM: 128 .distcp-shards (~30 GB) achter een verborgen .metadata-index. InternLumina-U2: zeven .safetensors-shards per hardwarestack, standaard Hugging Face-layout.

A generated scoreboard card titled “PixelUMM vs InternLumina-U2 — the scoreboard”, with the two model names as column headings and six dimension rows spanning both columns: visual interface, backbone, generation method, video understanding, weight format and licence. PixelUMM's column shows raw pixel patches and tubelets, a Qwen3-8B backbone at 15.2B, pixel-space flow matching, Video-MME 57.33 with MVBench 70.53, 128 distributed-checkpoint shards, and a noncommercial checkpoint licence; InternLumina-U2's column shows eight-codebook discrete AToken tokens, a 16B-A1B sparse MoE diffusion backbone, masked diffusion denoising, Video-MME 51.26 with MVBench 59.74, seven safetensors shards per hardware stack, and Apache-2.0. A footer notes that the figures are vendor-reported with no independent rerun.

Het scorebord, met zijn herkomst eraan gehecht.

Lees elke rij als de eigen bewering van een lab. Die van PixelUMM komen uit de preprint daarvan; die van InternLumina-U2 zijn de eigen beschrijving van het lab zelf, waarin ze als "voorlopig, gedeeltelijk" worden omschreven, waarbij de volledige vergelijkingstabellen zijn uitgesteld naar een technisch rapport dat nog niet is verschenen.

• MMMU (beeldredenering) — PixelUMM 41,67 (eigen resultaat van de auteurs). InternLumina-U2: niet gerapporteerd.

• ChartQA — PixelUMM 82.96. InternLumina-U2 86.52.

• DocVQA — PixelUMM 90,42. InternLumina-U2: niet gerapporteerd.

• Video-MME (geen ondertitels) — PixelUMM 57.33. InternLumina-U2 51.26.

• MVBench — PixelUMM 70.53. InternLumina-U2 59.74.

• GenEval totaal — PixelUMM 0,83 met een LLM-promptherschrijver, 0,77 zonder. InternLumina-U2 0,81.

• DPG-Bench algemeen — PixelUMM 85,74. InternLumina-U2 87,10.

• Videogeneratie — PixelUMM VBench deel 1 kwaliteit 84,10 / semantisch 79,80, deel 2 totaal 83,24. InternLumina-U2: niet gerapporteerd.

• 3D-begrip — PixelUMM: geen dergelijke taak. InternLumina-U2 rapporteert 3D MM-Vet 41.8.

De vergelijking is ongelijk omdat de twee labs verschillende tabellen publiceren, niet omdat de een wint. PixelUMM heeft een volledige sectie voor videogeneratie en geen bewerking of 3D; InternLumina-U2 claimt zes taakfamilies en rapporteert een gedeeltelijke tabel over die families. Getallen van verschillende labs onder dezelfde benchmarknaam zijn niet dezelfde meting — splits, prompts en sampling verschillen — dus behandel de ChartQA- en GenEval-rijen als ongeveer gelijk en houd het daarbij.

Bij licenties is dit het punt waarop het geen gelijkspel meer is.

Dit is het onderdeel dat geen enkele benchmarktabel toont. De PixelUMM-repository is Apache-2.0 en de kaart zegt dat ook, opvallend genoeg. De checkpoint is een afzonderlijk artefact onder de NVIDIA One-Way Noncommercial License, beperkt tot niet-commercieel onderzoek of evaluatie, en één bronbestand behoudt daarnaast een CC BY-NC 4.0-vermelding die van DiT is overgenomen. Onderzoeksgebruik: prima. Interne productfunctie: een gesprek met juridische zaken, en mogelijk een kort gesprek.

InternLumina-U2 is van begin tot eind Apache-2.0, zowel de code als beide checkpoints, zonder afzonderlijke niet-commerciële uitzondering. Voor een team dat moet kunnen shippen is dat geen klein voordeel — het bepaalt de hele beslissing. Beide modellen zijn qua volwassenheid van onderzoeksniveau. Slechts één ervan is onbeperkt in gebruik.

Welke je nu echt moet proberen, en hoe

Als je werk video-begrip is of je wilt een model dat video en afbeeldingen genereert vanuit één set gewichten, dan is PixelUMM het volledigere artefact en is het bijbehorende paper de nuttigere lectuur — maar het is een onderzoeksproject onder een niet-commerciële licentie, dus het hoort op een evaluatiebank, niet in een pijplijn. Als je werk de breedte van grafieken, documenten en beeldgeneratie is, of je hebt bewerking en 3D nodig, dan bestrijkt InternLumina-U2 meer terrein en kent het geen licentieplafond; de prijs is dat de 16B-A1B-diffusiebackbone en de AToken-tokenizer echte serving-engineering betekenen, en de gepubliceerde cijfers zijn expliciet gedeeltelijk.

Geen van beide is op het moment van schrijven beschikbaar via een gehoste API, en dat geldt ook voor OrcaRouter — we routeren geen van beide modellen. Wanneer dat verandert, is het argument om ze via een routeringslaag te bereiken in plaats van via directe integratie hetzelfde als voor elk nieuw geopend model: één sleutel voor 200+ modellen, lijstprijzen van providers die tegen 0% markup worden doorgegeven, en automatische failover zodat een model dat slechter blijkt te zijn dan de leverancierstabel deed vermoeden, kan worden gedegradeerd door een route te wijzigen in plaats van een deployment te herschrijven. Tot die tijd is het eerlijke advies het saaie advies — download welke licentie dan ook die jouw gebruiksscenario toestaat, voer je eigen evaluatie uit op je eigen data, en plan niet op basis van de cijfers van een van beide labs totdat iemand buiten het lab ze opnieuw uitvoert.

Wat zou het antwoord veranderen

Drie dingen, in volgorde van impact. Een commerciële licentie op de checkpoint van PixelUMM zou er een echte nek-aan-nekvergelijking van maken en zou het van "de paper lezen" naar "de gewichten evalueren" brengen. Een technisch rapport van Shanghai AI Laboratory met de volledige vergelijkingstabellen zou de gedeeltelijke cijfers van InternLumina-U2 omzetten in iets controleerbaars, en zou ook onthullen hoeveel van de breedte over zes taken op pariteit staat versus op tokendiepte. En de eerste onafhankelijke reproductie van een van beide modellen — een GenEval- of MVBench-herhaling door een team dat geen belang heeft bij de uitkomst — is het moment waarop een van deze twee ophoudt een leverancierstabel te zijn. Tot dan is de ene een ongebruikelijke architectuur die je alleen kunt bestuderen, en de andere een ongebruikelijke architectuur die je kunt uitbrengen.