
PixelUMM vs InternLumina-U2: Två encoderfria betaversioner, och den enda skillnaden som avgör det
- openaiNYOpenAI: GPT-6.1 Sol2026-09-2952Intelligens
- anthropicNYAnthropic: Claude Sonnet 5.52026-09-2856Intelligens
- typesafeNYTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M tokens · 223 tok/s
- OpenAINYOpenAI: GPT-6 Luna2026-09-2238Intelligens
- OpenAINYOpenAI: GPT-6 Sol2026-09-2248Intelligens
- AnthropicNYAnthropic: Claude Opus 5.52026-09-2258Intelligens
- xAINYGrok 4.72026-09-2146Intelligens
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M tokens · 124 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
Två modeller, båda publika, båda ovanligt utformade, och bara en av dem kan du bygga en produkt på. PixelUMM är NVIDIAs encoderfria enhetliga modell — 15,2 miljarder parametrar på en Qwen3-8B-backbone, som läser och skriver råa pixlar via 16×16-patchar och 4-frames-tubelets, utan VAE och utan någon bildencoder någonstans i stacken. InternLumina-U2 är Shanghai AI Laboratorys 16B mixture-of-experts-diffusionsmodell som komprimerar varje visuell indata till åtta komplementära diskreta koder genom en tokenizer som kallas AToken. Båda satsade på att det visuella gränssnittet är flaskhalsen. Vadet som spelar större roll är det i licensfilerna: InternLumina-U2 levereras med Apache-2.0-vikter, PixelUMM levereras med en checkpoint under en icke-kommersiell licens. Om du väljer mellan dem för något kommersiellt är den meningen hela jämförelsen och resten av den här sidan är kontext till den.
Båda uppsättningarna siffror nedan kommer från labben själva. Ingen av modellerna har en oberoende utvärdering, ett arena-Elo eller en tredjepartsreproduktion. Ingen av dem tillhandahålls via något hostat API. Det som skiljer sig är vad du tillåts göra med artefakten när du väl har laddat ner den, och hur långt varje release faktiskt har kommit.
Var var och en står just nu
Releasetidslinjerna har förskjutits i olika takt, och båda två i tysthet.
• PixelUMM — GitHub-repositorium skapat 4 september 2026; arXiv-förhandsutskrift 2609.38597 daterad 29 september 2026; Hugging Face-modellrepositorium skapat 1 oktober 2026 kl. 21:40 UTC. Inget NVIDIA-blogginlägg, pressmeddelande eller lanseringstråd har dykt upp för det.
• InternLumina-U2 — GitHub-repositorium skapat 1 september 2026; Hugging Face-stub registrerad samma dag; Ascend-tränade checkpointvikter tillagda 10 september 2026; NVIDIA/CUDA-checkpointvikter tillagda 24 september 2026. Sju shards per stack, båda nedladdningsbara idag.
InternLumina-U2 som fanns i början av september – endast kod, vikter "kommer snart", ett tomt modellarkiv – är inte samma InternLumina-U2 som finns nu. Den som läste om det i början av månaden och drog slutsatsen att vikterna saknades bör kontrollera igen; både Huawei Ascend- och NVIDIA/CUDA-checkpointarna finns uppe, under Apache-2.0, tillsammans med tokenizer, config, chattmall och fjärrmodelleringskod.

Två svar på samma fråga
Båda modellerna utgår från samma klagomål: att bära en visionskodare för förståelse och en VAE för generering innebär att varje bild representeras två gånger, vilket grovt fördubblar den visuella kontexten och tvingar en träningspipeline att underhålla två gränssnitt.
PixelUMM:s svar är att ta bort båda. Råa pixlar går rakt in genom enkellagriga linjära projektioner — en 16×16-patch per bildposition, en tubelet med 4 bildrutor per videoposition — och stommen är en Transformer med enbart dekoder, vars Mixture-of-Transformers-design kombinerar delad attention med uppgiftsspecifika parametrar. Text förutsägs autoregressivt; pixlar förutsägs genom flow matching. Artikeln ägnar åtta avsnitt åt designstudier — patchstorlek, patchartefakter, dynamik i pixelrummet kontra VAE-rummet, beräkningsskalning — vilket säger att teamets egentliga fråga var huruvida paradigmet håller överhuvudtaget.
InternLumina-U2:s svar är att behålla ett diskret gränssnitt men låta varje token bära mycket mer. AToken-tokeniseraren beskriver varje visuell position med åtta kompletterande kodböcker som täcker textur, inbäddad text och geometri; de åtta inbäddningarna sammanfogas per position och projiceras till en enda token i stamnätet. Avkodningen går åt andra hållet, med rumsligt parallell avbrusning och ett autoregressivt huvud med flera kodböcker som förutsäger de åtta koderna i tur och ordning. Stamnätet är en gles diffusions-LLM av LLaDA-2.0-härkomst, 16B totalt med 1B aktiva.
• Visuellt gränssnitt — PixelUMM: råa pixelpatchar och tubelets, ingen tokeniserare alls. InternLumina-U2: helt diskreta tokens med åtta kodböcker från AToken, ingen kontinuerlig latent.
• Stomme — PixelUMM: Qwen3-8B (15,2B totalt), en enda tät avkodare med förståelse- och genereringsexperter. InternLumina-U2: 16B totalt / 1B aktiva gles MoE-diffusionsspråkmodell.
• Genereringsmetod — PixelUMM: flödesmatchning i pixelrymden plus autoregressiv text. InternLumina-U2: maskerad diffusionsavbrusning över diskreta koder.
• Påstådda uppgifter — PixelUMM: text-till-bild, text-till-video, bild-till-text, video-till-text. InternLumina-U2: dessa plus bildredigering och 3D-förståelse.
• Viktformat — PixelUMM: 128 .distcp-delar (~30 GB) bakom ett dolt .metadata index. InternLumina-U2: sju .safetensors-delar per hårdvarustack, standardlayout för Hugging Face.

Resultattavlan, med sin proveniens bifogad
Läs varje rad som ett labbs eget påstående. PixelUMM:s kommer från dess preprint; InternLumina-U2:s är labbets egen beskrivning av dem som "preliminära, partiella", med de fullständiga jämförelsetabellerna uppskjutna till en teknisk rapport som ännu inte har publicerats.
• MMMU (bildresonemang) — PixelUMM 41,67 (författarnas egen). InternLumina-U2: inte rapporterat.
• ChartQA — PixelUMM 82,96. InternLumina-U2 86,52.
• DocVQA — PixelUMM 90,42. InternLumina-U2: inte rapporterat.
• Video-MME (inga undertexter) — PixelUMM 57.33. InternLumina-U2 51.26.
• MVBench — PixelUMM 70.53. InternLumina-U2 59.74.
• GenEval totalt — PixelUMM 0,83 med en LLM-promptomskrivare, 0,77 utan. InternLumina-U2 0,81.
• DPG-Bench totalt — PixelUMM 85,74. InternLumina-U2 87,10.
• Videogenerering — PixelUMM VBench del 1 kvalitet 84,10 / semantik 79,80, del 2 totalt 83,24. InternLumina-U2: ej rapporterat.
• 3D-förståelse — PixelUMM: ingen sådan uppgift. InternLumina-U2 rapporterar 3D MM-Vet 41,8.
Jämförelsen är ojämn eftersom de två labben publicerar olika tabeller, inte för att det ena vinner. PixelUMM har en fullständig videogenereringssektion och ingen redigering eller 3D; InternLumina-U2 hävdar sex uppgiftsfamiljer och rapporterar en partiell tabell över dem. Siffror mellan labb under samma benchmark-namn är inte samma mätning – uppdelningar, promptar och sampling skiljer sig – så betrakta raderna för ChartQA och GenEval som ungefär likvärdiga och stanna där.
Licensiering är där det här slutar vara oavgjort
Det här är delen som ingen benchmarktabell visar. PixelUMM-repot är Apache-2.0, och modellkortet säger det, tydligt. Checkpointen är en separat artefakt under NVIDIA One-Way Noncommercial License, begränsad till icke-kommersiell forskning eller utvärdering, och en källfil behåller dessutom ett CC BY-NC 4.0-meddelande som ärvts från DiT. Forskningsanvändning: okej. Intern produktfunktion: ett samtal med juridik, och möjligen ett kort sådant.
InternLumina-U2 är Apache-2.0 rakt igenom, både koden och båda checkpoints, utan något separat undantag för icke-kommersiell användning. För ett team som behöver leverera är det inte en liten fördel — det är hela avgörandet. Båda modellerna är av forskningskvalitet vad gäller mognad. Bara en av dem får användas utan begränsningar.
Vilken ska man faktiskt prova, och hur?
Om ditt arbete är videoförståelse eller du vill ha en modell som genererar video och bilder från en uppsättning vikter, är PixelUMM den mer kompletta artefakten och dess artikel är den mer användbara läsningen – men det är ett forskningsprojekt under en icke-kommersiell licens, så det hör hemma på en utvärderingsbänk, inte i en pipeline. Om ditt arbete är bredd inom diagram-, dokument- och bildgenerering, eller du behöver redigering och 3D, täcker InternLumina-U2 ett bredare område och har inget licenstak; priset är att 16B-A1B-diffusionsbackbonen och AToken-tokenizern innebär verklig serving-engineering, och dess publicerade siffror är uttryckligen partiella.
Ingen av dem finns på något hostat API i skrivande stund, och det inkluderar OrcaRouter — vi routar ingen av modellerna. När det ändras är argumentet för att nå dem via ett routningslager i stället för genom direkt integration detsamma som gäller för varje nyligen öppnad modell: en nyckel över 200+ modeller, leverantörernas listpriser som förs vidare med 0 % påslag, och automatisk failover så att en modell som visar sig vara sämre än vad leverantörens tabell antydde kan nedgraderas genom att ändra en rutt i stället för att skriva om en driftsättning. Fram till dess är det ärliga rådet det tråkiga — ladda ner vilken licens som än tillåter ditt användningsfall, kör din egen utvärdering på dina egna data, och planera inte utifrån någon av labbens siffror förrän någon utanför labbet kör om dem.
Vad skulle ändra svaret
Tre saker, i ordning efter genomslagskraft. En kommersiell licens på PixelUMMs checkpoint skulle göra jämförelsen verkligt jämn och flytta den från "läs artikeln" till "utvärdera vikterna". En teknisk rapport från Shanghai AI Laboratory som innehåller de fullständiga jämförelsetabellerna skulle göra InternLumina-U2:s partiella siffror till något kontrollerbart, och skulle också avslöja hur mycket av bredden över sex uppgifter som ligger på paritet kontra på tokendjup. Och den första oberoende reproduktionen av någon av modellerna – en GenEval- eller MVBench-omkörning av ett team utan egenintresse i resultatet – är ögonblicket då någon av dessa slutar vara en leverantörstabell. Fram till dess är den ena en ovanlig arkitektur som man bara kan studera, och den andra är en ovanlig arkitektur som man kan skeppa.
