
Förhandsvisning av InternLumina-U2: En 16B-diffusionsmodell för bild, video och 3D — vikterna kommer snart
- AlibabaNYQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens
- z-aiNYZ.ai: GLM 5.3 Flash2026-08-2658Intelligens72Kodning
- DeepSeekNYDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1M tokens
- z-aiZ.ai: GLM 5.32026-08-1860Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1552Intelligens68Kodning
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1261Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0557Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligens72Kodning
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligens69Kodning
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligens78Kodning
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligens69Kodning
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligens49Kodning
- metaMeta: Muse Spark 1.12026-07-1653Intelligens71Kodning
- kimiMoonshotAI: Kimi K32026-07-1560Intelligens76Kodning
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligens71Kodning
Klockan 04:03 UTC den 1 september 2026 skapade Shanghai AI Laboratory GitHub-repositoriet InternLumina-U2. Tretton minuter senare registrerade samma organisation ett repo med samma namn på Hugging Face. Det fanns inget lanseringsinlägg, ingen modellkort och inget tillkännagivande av något slag – bara inferenskoden för InternLumina-U2, en mixture-of-experts-modell med 16 miljarder parametrar (1 miljard aktiv) som labbet beskriver som en enda modell som täcker bildförståelse, text-till-bild-generering, bildredigering, videoförståelse och 3D-förståelse genom ett enda diskret-token-gränssnitt. Koden är verklig och offentlig; själva modellen är det inte – ännu. Vikterna är markerade med "kommer snart", Hugging Face-repositoriet är en tom platshållare och den utlovade tekniska rapporten har inte dykt upp. Det som gick ut tyst den 1 september är ändå den mest kompletta offentliga bilden av den här modellen som finns någonstans.
Om detta är första gången du hör talas om InternLumina-U2, så är det hela poängen. Ingenting om releasen tillkännagavs, och ingen oberoende bevakning verkar finnas ännu — tidiga signalartiklar är precis där en sådan här modell dyker upp först, före lanseringsinlägget och ibland före vikterna. Allt nedan är hämtat från GitHub-repositoriet, projektsidan och den Hugging Face-stubb som labbet självt publicerade den 1 september, och allt som ligger bortom dessa källor är uttryckligen märkt som slutledning.
Vad som faktiskt levererades den 1 september
GitHub-repositoriet InternLM/InternLumina-U2 skapades den 1 september 2026 och fick tre commits den dagen — init-commiten, en ändring som markerar modelllänken "kommer snart" och benchmarkresultaten "preliminära", samt en navigeringsfix. Det är licensierat under Apache-2.0 och har en README med titeln "Intern Lumina U2: A Multi-Codebook Diffusion Large Language Model for Omni-Visual Understanding, Image Generation and Editing", en engelsk och en kinesisk version, ett komplett inferensramverk och en färdplan. En egenhet värd att notera: repots egen nyhetsnotis är stämplad "[2026-08]", men init-commiten och repots båda tidsstämplar är daterade 1 september 2026 — betrakta början av september som det faktiska releasedatumet, inte augusti. Repositoriet nedan är hela den offentliga releasen: varje fil som syns i trädet är en del av det som släpptes, och inget mer existerar någonstans ännu.

• GitHub — InternLM/InternLumina-U2, skapad 2026-09-01 under Apache-2.0, med inferenskod för text, text-till-bild, bildförståelse, bildredigering, videoförståelse och 3D-förståelse.
• Hugging Face — internlm/InternLumina-U2, skapad 2026-09-01, innehåller för närvarande endast en .gitattributes-fil och en README på 28 byte vars hela innehåll är Apache-2.0-licenshuvudet. Inga vikter, ingen config, inga tokenizer-filer.
• Projektsida — internlm.github.io/InternLumina-U2, med arkitekturfigurer, en preliminär benchmark-tabell och platshållardemos; den tekniska rapporten är märkt ”kommer snart”.
Inferenskoden är organiserad som ett drivskript med en sektion per uppgift: vanlig textgenerering, text-till-bild upp till 1024×1024 med konfigurerbar CFG och tidssteg, bildförståelse över naturliga bilder och informationsrika diagram, instruktionsbaserad bildredigering med ett valfritt dual-CFG-läge, videoförståelse över 64 samplade bildrutor samt 3D-förståelse över GLB/GLTF-tillgångar som renderas till 64 färg- och djupvyer genom en medföljande Blender-pipeline före tokenisering. Denna bredd av uppgifter är modellens hela designtes, och det är värt att stanna upp inför innan vi dyker in i arkitekturen.
En modell, sex jobb, ett tokenvokabulär.
InternLumina-U2 tillhör en snabbt framväxande forskningslinje som satsar på att språk och bild bör dela ett enda diskret-tokengränssnitt i stället för att leva i separata stackar för förståelse och generering. Labbets eget tidigare arbete i denna riktning – Lumina-DiMOO, den enhetliga diskret-diffusionsmodellen som visades på WAIC 2025 – nämns tillsammans med LLaDA2.0-Uni, Show-o2 och MMaDA som de banbrytande system som InternLumina-U2 bygger vidare på och hävdar sig överträffa. InternLumina-U2:s specifika satsning är att flaskhalsen för dessa enhetliga modeller inte är arkitekturen utan den visuella vokabulären: en enda codebook begränsar hur mycket information en visuell token kan bära, medan diskret–kontinuerliga hybrider som delar upp förståelse och generering mellan olika representationer ändå tvingar modellen att hålla två stackar.
InternLumina-U2:s svar är helt diskret flerkodboksmodellering. Den visuella sidan använder Apples AToken-tokenizer, som beskriver varje visuell position med åtta kompletterande kodböcker — ett försök att bevara lokal textur, inbäddad text, geometri och högfrekventa detaljer utan att öka sekvenslängden. På indatasidan har var och en av de åtta kodböckerna sin egen inbäddning, och de åtta positionsvisa inbäddningarna konkateneras och projiceras till en enda backbone-token. På utdatasidan är förutsägelsen rumsligt parallell men autoregressiv i kodboksdjupet: diffusionsbackbonen avbrusar många maskerade rumsliga positioner parallellt, och ett autoregressivt huvud med flera kodböcker förutsäger sedan de åtta koderna för varje position i tur och ordning.
• Skala — 16B parametrar totalt, 1B aktiva (16B-A1B), en gles MoE.
• Språklig ryggrad — LLaDA-2.0 MoE, en diffusionsbaserad språkmodell, vars blockdiffusionsmål utökas till visuella uppgifter genom gemensam multi-task-träning (leverantörens beskrivning).
• Visuell representation — helt diskreta token från 8 kodböcker via Apples AToken-tokeniserare.
• Hårdvara — anpassad för både NVIDIA GPU:er och Huawei Ascend NPU:er vid träning, utvärdering och inferens, med numerisk överensstämmelse på operatornivå mellan backendarna.

Vad det i praktiken ger, om påståendena håller, är den äldsta drömmen inom det multimodala fältet: en enda uppsättning vikter som kan läsa en bild, redigera den, rita en ny utifrån text, svara på frågor om en video och beskriva en 3D-tillgång — med förståelse och generering som förstärker varandra genom samma gränssnitt snarare än att sys ihop från specialiserade modeller. Det är också det påstående som är mest värt ett skeptiskt öga, eftersom det är det svåraste att göra sant.
Siffrorna, sådana de är.
Alla riktmärken InternLumina-U2 har är leverantörsrapporterade, preliminära och ofullständiga. README- och projektsidan säger det själva: ”Preliminära, ofullständiga resultat. Fullständiga jämförelsetabeller kommer att publiceras i den kommande tekniska rapporten.” Ingen oberoende utvärdering finns, eftersom vikterna inte är offentliga. Betrakta siffrorna nedan som labbets egna påståenden, inte verifierade resultat.
• Diagram-/dokumentförståelse — ChartQA 86.52, CharXiv-DQ 83.65 (enligt leverantören).
• Visuellt matematiskt resonemang — MathVision 33.22, DynaMath 56.37; labbet säger att detta slår den enbart förståelsebaserade InternVL3-8B på båda.
• Robusthet mot hallucinationer — HallusionBench 62,15.
• Videoförståelse — VideoMME 51.26, MVBench 59.74, MLVU 57.03 (projektsida).
• 3D-förståelse — 3D MM-Vet 41.8.
• Text-till-bild — DPG-Bench 87.10, TIIF-Bench Short/Long 84.60/85.95, GenEval 0.81 (projektsida).
• Bildredigering — ImgEdit 3.83.
Jämförelsehistorien är där en ärlig läsare bör sakta ner. README-filen hävdar att InternLumina-U2 överträffar enhetliga modeller som InternVL-U, LLaDA2.0-Uni, Show-o2 och Lumina-DiMOO på finkorniga förståelse- och generationsbenchmarks — men projektets egen tabell visar InternLumina-U2 på GenEval 0.81 mot LLaDA2.0-Unis 0.89, så modellen ligger efter minst en konkurrent på minst ett centralt generationsmått. Att plocka ut några gynnsamma siffror från en ofullständig tabell är precis vad varningen om "fullständiga jämförelsetabeller i den tekniska rapporten" är utformad för att tona ner. Siffrorna är en riktningssignal från labbet, inte mer.
Vad är verkligt kontra vad som utlovas
Releasens omfattning är ovanligt tydlig, och den har betydelse för alla som avgör om de kan prova detta idag. Levererat: inferenskoden. Inte levererat: vikterna, träningskoden (utlovad i ett separat repository), Ascend-tränings- och inferensstacken samt den tekniska rapporten. Hugging Face-repositoryt som så småningom kommer att innehålla modellen är en stub — skärmdumpen nedan visar hela det nuvarande innehållet på den sida man når när man klickar på länken "Modell (kommer snart)" i README.

Inte ens den släppta koden kan producera utdata ännu. Inferensdrivrutinen förväntar sig en uppdelad Hugging Face-checkpointkatalog och AToken-tokenizerns vikter på en specifik sökväg — varken katalogen eller vikterna finns i repot — så det som går att ladda ner idag är en specifikation av hur modellen kommer att köras, inte en körande modell. Och när vikterna väl landar, kommer self-hosting inte att vara ett rutinmässigt pip-install-jobb. Modellen använder ett block-diffusion-generate-API snarare än standardgränssnittet generate i Transformers, AToken-tokenizern kräver FlashAttention, koden behöver en synlig GPU vid importtillfället, rotdrivrutinen körs som en enda process, och 3D-pipelinen förutsätter Blender 4.5 för asset-enkodning. Det är ett riktigt driftsättningsprojekt, inte ett helgexperiment — vilket är precis den typ av friktion som ett routinglager finns till för att absorbera för de flesta team.
När vikterna landar, behandla det som den oprövade modell det är.
Ingen kan köra InternLumina-U2 i dag, och ingen leverantör kan betjäna den, eftersom vikterna inte finns offentligt. Det kommer att förändras någon gång — Apache-2.0-licensen och labbets 2026-mönster med aggressivt öppen källkod (ArchSpaces ”öppna allt”-satsning, InternVL3.5, Intern-S2-vetenskapsmodellerna) gör att ett släpp av vikterna är sannolikt snarare än hypotetiskt. När det väl händer är det rationella första steget inte att satsa en produktionspipeline på en diffusionsmodell från dag ett med ovanliga krav på serving och noll oberoende utvärderingar. Det är att köra den sida vid sida med den modell du redan litar på, på en testväg, med automatisk failover till den beprövade modellen i samma ögonblick som den nya börjar bete sig illa. Det är det användningsfall som ett routinglager är byggt för: ett API över 200+ modeller, leverantörernas listpriser som skickas vidare med 0 % påslag, och failover som gör ”prova det nya” till en routingregel i stället för en migrering. OrcaRouter är uppbyggd på det sättet — och för att vara tydlig: vi routar inte InternLumina-U2 och kan inte göra det, eftersom vikterna inte har släppts. Det här avsnittet handlar om arbetsflödet för när de väl släpps, inte ett påstående om att modellen finns tillgänglig någonstans i dag.
Vad du ska titta på härnäst
Fyra händelser skulle flytta InternLumina-U2 från förhandsvisning till verklighet, ungefär i sannolikhetsordning. För det första: att Hugging Face-repositoriet fylls på — safetensors-filer, en config och AToken-tokenizervikterna som dyker upp i stubben är ögonblicket då modellen faktiskt existerar. För det andra: den tekniska rapporten, som förväntas innehålla de fullständiga jämförelsetabellerna och skulle omvandla de partiella leverantörssiffrorna ovan till något kontrollerbart. För det tredje: träningskodsrepositoriet och Ascend-stacken, som spelar roll för alla som vill finjustera eller köra detta på icke-NVIDIA-maskinvara. För det fjärde: en första oberoende utvärdering — en arena-Elo, en reproducerad ChartQA- eller GenEval-körning — som testar löftet om "en modell, sex jobb" utan labbets egen urvalsbias. Att koden är publik den 1 september innebär att arkitekturen redan går att kartlägga; att vikterna saknas innebär att allt om faktisk kvalitet fortfarande är ett påstående. Håll koll på modellrepositoriet snarare än nyhetsflödet — de intressanta delarna är redan offentliga, och själva modellen ligger förmodligen inte långt efter.
