
InternLumina-U2 Preview: Eén 16B diffusiemodel voor beeld, video en 3D — weights komen er nog aan
- AlibabaNIEUWQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens
- z-aiNIEUWZ.ai: GLM 5.3 Flash2026-08-2658Intelligentie72Coderen
- DeepSeekNIEUWDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1 mln tokens
- z-aiZ.ai: GLM 5.32026-08-1860Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1552Intelligentie68Coderen
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1261Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0557Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligentie72Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligentie78Coderen
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligentie69Coderen
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligentie49Coderen
- metaMeta: Muse Spark 1.12026-07-1653Intelligentie71Coderen
- kimiMoonshotAI: Kimi K32026-07-1560Intelligentie76Coderen
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligentie71Coderen
Op 1 september 2026 om 04:03 UTC maakte het Shanghai AI Laboratory de GitHub-repository InternLumina-U2 aan. Dertien minuten later registreerde dezelfde organisatie een identiek genaamde repository op Hugging Face. Er was geen lanceringsbericht, geen modelkaart en geen enkele aankondiging — alleen de inferentiecode voor InternLumina-U2, een mixture-of-experts-model met 16B-parameters (1B actief) dat het laboratorium aanprijst als één model dat beeldbegrip, tekst-naar-beeldgeneratie, beeldbewerking, videobegrip en 3D-begrip bestrijkt via één enkele interface met discrete tokens. De code is echt en openbaar; het model zelf nog niet. De gewichten zijn gemarkeerd als 'coming soon', de Hugging Face-repository is een lege placeholder en het beloofde technische rapport is niet verschenen. Wat er op 1 september stilletjes naar buiten kwam, is niettemin het meest complete openbare beeld van dit model dat er ergens bestaat.
Als dit de eerste keer is dat je over InternLumina-U2 hoort, is dat precies de bedoeling. Er is niets over de release aangekondigd en er lijkt nog geen onafhankelijke berichtgeving te bestaan — vroege signaleringsartikelen zijn precies waar zo'n model als eerste opduikt, vóór het lanceringsbericht en soms vóór de gewichten. Alles hieronder is afkomstig uit de GitHub-repository, de projectpagina en de Hugging Face-stub die het lab zelf op 1 september publiceerde, en alles wat verder gaat dan deze bronnen is expliciet als gevolgtrekking bestempeld.
Wat er op 1 september daadwerkelijk is uitgebracht
De GitHub-repository InternLM/InternLumina-U2 werd aangemaakt op 1 september 2026 en kreeg die dag drie commits: de init, een wijziging die de modellink als "coming soon" en de benchmarkresultaten als "preliminary" markeerde, en een navigatiefix. Het is gelicenseerd onder Apache-2.0 en bevat een README met de titel "Intern Lumina U2: A Multi-Codebook Diffusion Large Language Model for Omni-Visual Understanding, Image Generation and Editing", een Engelse en een Chinese versie, een volledige inference-harness en een routekaart. Een opvallend detail: het eigen nieuwsbericht van de repository is afgestempeld met "[2026-08]", maar de init-commit en beide tijdstempels van de repository dateren van 1 september 2026 — behandel begin september dus als de feitelijke releasedatum, niet augustus. De onderstaande repository is de volledige openbare release: elk bestand dat in de boom zichtbaar is, maakt deel uit van wat is uitgebracht, en er bestaat nog niets meer waar dan ook.

• GitHub — InternLM/InternLumina-U2, gemaakt op 2026-09-01 onder Apache-2.0, met inferentiecode voor tekst, tekst-naar-afbeelding, beeldbegrip, beeldbewerking, videobegrip en 3D-begrip.
• Hugging Face — internlm/InternLumina-U2, aangemaakt op 2026-09-01, bevat momenteel alleen een .gitattributes-bestand en een README van 28 bytes waarvan de volledige inhoud de Apache-2.0-licentieheader is. Geen gewichten, geen config en geen tokenizer-bestanden.
• Projectpagina — internlm.github.io/InternLumina-U2, met architectuurfiguren, een voorlopige benchmarktabel en placeholderdemo's; het technisch rapport is gemarkeerd als "binnenkort beschikbaar".
De inferentiecode is georganiseerd als één driver-script met een sectie per taak: gewone tekstgeneratie, tekst-naar-beeld tot 1024×1024 met configureerbare CFG en tijdstappen, beeldbegrip van natuurlijke afbeeldingen en complexe grafieken, op instructies gebaseerde beeldbewerking met een optionele dual-CFG-modus, videobegrip over 64 gesamplede frames, en 3D-begrip over GLB/GLTF-assets die vóór tokenisatie via een gebundelde Blender-pijplijn worden gerenderd tot 64 kleur- en diepteaanzichten. Die breedte aan taken is de hele ontwerpthese van het model, en het is de moeite waard om er even bij stil te staan voordat we in de architectuur duiken.
Eén model, zes taken, één tokenvocabulaire
InternLumina-U2 maakt deel uit van een snel evoluerende onderzoekslijn die erop wedt dat taal en visie één enkele interface met discrete tokens moeten delen in plaats van te leven in afzonderlijke stacks voor begrip en generatie. Het eigen eerdere werk van het lab in deze richting — Lumina-DiMOO, het uniforme discrete-diffusiemodel dat op WAIC 2025 werd getoond — wordt samen met LLaDA2.0-Uni, Show-o2 en MMaDA genoemd als de baanbrekende systemen waarop InternLumina-U2 voortbouwt en die het beweert te overtreffen. De specifieke weddenschap die InternLumina-U2 aangaat, is dat het knelpunt voor deze uniforme modellen niet de architectuur is, maar de visuele woordenschat: een enkel codeboek beperkt hoeveel informatie één visuele token kan dragen, terwijl discrete-continue hybriden die begrip en generatie over verschillende representaties verdelen, het model toch dwingen om twee stacks te onderhouden.
Het antwoord van InternLumina-U2 is volledig discrete modellering met meerdere codeboeken. De visuele kant gebruikt de AToken-tokenizer van Apple, die elke visuele positie beschrijft met acht complementaire codeboeken — een poging om lokale textuur, ingebedde tekst, geometrie en hoogfrequente details te behouden zonder de sequentielengte op te blazen. Aan de invoerzijde heeft elk van de acht codeboeken zijn eigen embedding, en worden de acht embeddings per positie geconcateneerd en geprojecteerd tot één backbone-token. Aan de uitvoerzijde is de voorspelling ruimtelijk parallel maar autoregressief over de codeboekdiepte: de diffusie-backbone denoiseert veel gemaskeerde ruimtelijke posities parallel, en een autoregressieve head met meerdere codeboeken voorspelt vervolgens de acht codes van elke positie in volgorde.
• Scale — 16B totale parameters, waarvan 1B actief (16B-A1B), een sparse MoE.
• Taal-backbone — LLaDA-2.0 MoE diffusietaalmodel, waarvan de block-diffusiondoelstelling wordt uitgebreid naar visuele taken via gezamenlijke multi-taaktraining (leveranciersbeschrijving).
• Visuele weergave — 8-codebook volledig discrete tokens van Apple's AToken-tokenizer.
• Hardware — aangepast aan zowel NVIDIA GPU's als Huawei Ascend NPU's tijdens training, evaluatie en inferentie, met numerieke afstemming op operatorniveau tussen backends.

Wat dat in de praktijk oplevert, als de beweringen kloppen, is de oudste droom van het multimodale veld: één enkele set gewichten die een afbeelding kan lezen, bewerken, een nieuwe kan tekenen op basis van tekst, vragen over een video kan beantwoorden en een 3D-asset kan beschrijven — waarbij begrip en generatie elkaar via dezelfde interface versterken in plaats van aan elkaar te worden geregen vanuit specialismemodellen. Dat is ook de bewering die het meest om een kritische blik vraagt, omdat het de moeilijkste is om waar te maken.
De cijfers, zoals ze zijn.
Elke benchmark die InternLumina-U2 heeft, is door de leverancier gerapporteerd, voorlopig en gedeeltelijk. De README en de projectpagina zeggen dat zelf: "Voorlopige, gedeeltelijke resultaten. Volledige vergelijkingstabellen verschijnen in het komende technische rapport." Er bestaat geen onafhankelijke evaluatie, omdat de gewichten niet openbaar zijn. Beschouw de onderstaande cijfers als eigen claims van het lab, niet als geverifieerde scores.
• Grafiek-/documentbegrip — ChartQA 86.52, CharXiv-DQ 83.65 (door de leverancier gerapporteerd).
• Visueel wiskundig redeneren — MathVision 33.22, DynaMath 56.37; het lab zegt dat dit het uitsluitend op begrip gerichte InternVL3-8B op beide verslaat.
• Robuustheid tegen hallucinaties — HallusionBench 62.15.
• Videobegrip — VideoMME 51.26, MVBench 59.74, MLVU 57.03 (projectpagina).
• 3D-begrip — 3D MM-Vet 41.8.
• Tekst-naar-beeld — DPG-Bench 87.10, TIIF-Bench Short/Long 84.60/85.95, GenEval 0.81 (projectpagina).
• Afbeeldingsbewerking — ImgEdit 3.83.
Bij het vergelijkingsverhaal moet een eerlijke lezer even stilstaan. De README beweert dat InternLumina-U2 uniforme modellen zoals InternVL-U, LLaDA2.0-Uni, Show-o2 en Lumina-DiMOO overtreft op benchmarks voor fijnmazig begrip en generatie — maar de eigen tabel van de projectpagina toont InternLumina-U2 op GenEval 0,81 tegenover 0,89 voor LLaDA2.0-Uni, dus het model blijft achter bij ten minste één concurrent op ten minste één prominente generatiemetriek. Het uitkiezen van een paar gunstige cijfers uit een gedeeltelijke tabel is precies wat het voorbehoud van 'volledige vergelijkingstabellen in het technisch rapport' moet verzachten. De cijfers zijn een richtinggevend signaal van het lab, niet meer dan dat.
Wat is echt versus wat beloofd wordt?
De reikwijdte van de release is ongewoon expliciet, en dat is belangrijk voor iedereen die wil bepalen of ze dit vandaag al kunnen proberen. Uitgebracht: de inferentiecode. Niet uitgebracht: de gewichten, de trainingscode (toegezegd in een aparte repository), de Ascend-trainings- en inferentiestack, en het technisch rapport. De Hugging Face-repository die uiteindelijk het model zal bevatten, is een stub — de onderstaande screenshot toont de volledige huidige inhoud van de pagina die een lezer bereikt door op de link 'Model (binnenkort beschikbaar)' in de README te klikken.

Zelfs de vrijgegeven code kan nog geen output produceren. De inference-driver verwacht een gesplitste Hugging Face-checkpointdirectory en de AToken-tokenizergewichten op een specifiek pad — en geen van beide staat in de repository — dus wat vandaag downloadbaar is, is een specificatie van hoe het model zal draaien, geen draaiend model. En wanneer de gewichten uiteindelijk arriveren, zal self-hosting geen routine pip-install-klus zijn. Het model gebruikt een block-diffusion generate-API in plaats van de standaard Transformers generate-interface, de AToken-tokenizer vereist FlashAttention, de code heeft bij import een zichtbare GPU nodig, de root-driver is single-process, en de 3D-pipeline verwacht Blender 4.5 voor asset-encoding. Dat is een echt deploymentproject, geen weekendexperiment — en dat is precies het soort frictie dat een routinglaag voor de meeste teams hoort op te vangen.
Wanneer de gewichten binnenkomen, behandel het als het onbewezen model dat het is.
Niemand kan InternLumina-U2 vandaag draaien en geen enkele provider kan het aanbieden, omdat de gewichten niet openbaar beschikbaar zijn. Dat zal op een gegeven moment veranderen — de Apache-2.0-licentie en het 2026-patroon van agressief open-sourcen van het lab (de ArchSpace-''open everything''-push, InternVL3.5, de Intern-S2-wetenschapsmodellen) maken een vrijgave van de gewichten waarschijnlijk in plaats van hypothetisch. Wanneer het zover is, is de rationele eerste stap niet om een productiepijplijn te verwedden op een diffusiemodel van dag één met ongebruikelijke serving-vereisten en nul onafhankelijke evaluaties. Het is om het naast het model te draaien dat je al vertrouwt, op een testpad, met automatische failover naar het bewezen model zodra het nieuwe model zich misdraagt. Dat is het gebruiksscenario waarvoor een routeringslaag is gebouwd: één API voor 200+ modellen, lijstprijzen van providers doorgegeven tegen 0% opslag, en failover die van ''het nieuwe uitproberen'' een routeringsregel maakt in plaats van een migratie. OrcaRouter is zo ingericht — en om het duidelijk te zeggen: wij routeren InternLumina-U2 niet en kunnen dat ook niet, omdat de gewichten niet zijn vrijgegeven. Dit gedeelte gaat over de workflow voor wanneer dat wel het geval is, niet over een bewering dat het model vandaag ergens beschikbaar is.
Wat nu te kijken
Vier gebeurtenissen zouden InternLumina-U2 van preview naar werkelijkheid brengen, in globale volgorde van waarschijnlijkheid. Ten eerste, het vullen van de Hugging Face-repository: safetensors-bestanden, een config en de AToken-tokenizergewichten die in die stub verschijnen, is het moment waarop het model daadwerkelijk bestaat. Ten tweede, het technisch rapport, dat de volledige vergelijkingstabellen zou moeten bevatten en de bovenstaande gedeeltelijke leverancierscijfers in iets controleerbaars zou veranderen. Ten derde, de repository met trainingscode en de Ascend-stack, die van belang zijn voor iedereen die dit wil fine-tunen of draaien op niet-NVIDIA-hardware. Ten vierde, een eerste onafhankelijke evaluatie — een arena-Elo, een gereproduceerde ChartQA- of GenEval-run — die de belofte van "één model, zes taken" test zonder de eigen selectiebias van het lab. Dat de code op 1 september openbaar is, betekent dat de architectuur al te achterhalen is; dat de gewichten ontbreken, betekent dat alles over de feitelijke kwaliteit nog een bewering is. Houd de modelrepository in de gaten in plaats van de aankondigingsfeed — de interessante delen zijn al openbaar, en het model zelf is waarschijnlijk niet ver weg.
