Een hero-titelkaart voor de vergelijking 'InternLumina-U2 vs Qwen2.5 Omni' met de ondertitel 'Het omnimodel dat Alibaba leverde versus het model dat nog altijd beloofd wordt' en drie stat-chips — 'Qwen2.5 Omni: 17 maanden in productie', 'InternLumina-U2: één dag code', 'Apache-2.0 aan beide zijden' — met het OrcaRouter-logo in de rechterbenedenhoek.
Guides & Insights

InternLumina-U2 vs Qwen2.5 Omni: het Omni-model dat Alibaba heeft geleverd versus het model dat Shanghai AI Lab nog steeds belooft

Auteur

Gideon Frost

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

InternLumina-U2 en Qwen2.5 Omni zijn beide antwoorden op dezelfde ambitie — één model dat alle modaliteiten aankan in plaats van een dierentuin aan specialisten — maar ze liggen twee generaties uit elkaar. Qwen2.5 Omni is het antwoord dat daadwerkelijk is uitgekomen: een open-weightmodel met 7 miljard parameters, uitgebracht in maart 2025 en op het moment van schrijven zeventien maanden oud, dat tekst, afbeeldingen, audio en video als invoer neemt en antwoordt met tekst of natuurlijke, gestreamde spraak. InternLumina-U2 is het antwoord van Shanghai AI Laboratory, gepubliceerd als inferentiecode op 1 september 2026: een sparse diffusiemodel met 16B-parameters dat beweert beelden, video en 3D waar te nemen en afbeeldingen te genereren en te bewerken via één gedeelde interface van discrete tokens. De ene generatie van het omni-idee draait al anderhalf jaar in productie; de andere is een dag oud en kan door niemand worden uitgevoerd, omdat de gewichten nog niet bestaan. De kloof tussen beide is het verschil tussen een nagekomen belofte en een gedane belofte.

De omni die is uitgebracht: Qwen2.5 Omni

Qwen2.5 Omni is serieus te nemen als baseline, omdat het een van de zeldzame open modellen is die de belofte van 'alles waarnemen, antwoorden in elke vorm' daadwerkelijk waarmaakt. De Thinker-Talker-architectuur combineert een tekstdenker met een talker die spraak produceert, met behulp van een tijd-uitgelijnde multimodale positiecodering zodat audio en video gesynchroniseerd blijven; de invoer omvat tekst, afbeeldingen, audio en video, en de uitvoer kan in dezelfde beurt tekst plus spraak zijn, met vier ingebouwde stemmen. De beperkingen zijn even goed gedocumenteerd als de mogelijkheden: de context is 32K tokens, er is geen function calling en geen gestructureerde uitvoer, en het is een omni-gesprekspartner in plaats van een agent. Wat het níét doet, is het benadrukken waard voor deze vergelijking: het neemt afbeeldingen, audio en video waar, maar genereert ze niet. De 'omni' in Qwen2.5 Omni betekent omni-perceptie met spraaksynthese aan de uitvoerzijde; de pixels gaan erin, en woorden komen eruit.

De staat van dienst is onmiskenbaar. Het model is honderdduizenden keren gedownload, heeft een gehoste API via het eigen platform van de ontwikkelaar en diverse platforms van derden, en heeft zeventien maanden besteed aan het opbouwen van kwantiseringen, community-tools en een bekende prijs — aggregatorlijsten plaatsen tekst op ongeveer $0,09 per miljoen invoertokens en $0,34 per miljoen uitvoertokens, met audio apart gefactureerd. Zeventien maanden is lang genoeg om zowel de sterke punten als de grenzen goed in kaart te brengen. Dat is wat volwassenheid oplevert: geen perfectie, maar voorspelbaarheid.

De omni die beloofd is: InternLumina-U2

InternLumina-U2 probeert een stap verder te gaan dan Qwen2.5 Omni, en dat is precies de stap waar de moeilijkheid ligt. Het ontwerpuitgangspunt is dat perceptie en generatie één discrete-tokeninterface moeten delen: in plaats van een taalmodel dat video waarneemt en een afzonderlijk diffusiemodel dat tekent, zou één sparse-MoE-diffusie-backbone — 16B in totaal, 1B actief — zowel een afbeelding, een grafiek, een video of een 3D-asset kunnen lezen als een nieuwe afbeelding of een bewerking kunnen genereren, gebruikmakend van een volledig discrete visuele woordenschat met acht codeboeken, zodat elke visuele positie voldoende informatie draagt om beide richtingen te ondersteunen. Dat is een wezenlijk grotere claim dan die van Qwen2.5 Omni. Het is één ding om elke invoermodaliteit naar tekst en spraak te leiden; het is iets anders om met één set gewichten pixels te genereren met dezelfde vloeiendheid waarmee het erover redeneert.

Het is op dit moment ook een niet te controleren bewering. Het lab publiceerde inferentiecode, een projectpagina met een "voorlopige, gedeeltelijke" benchmarktabel en een lege Hugging Face-stub; de gewichten, de trainingscode, het technische rapport en de Ascend-NPU-stack zijn allemaal gemarkeerd als "binnenkort beschikbaar". Er bestaat geen onafhankelijke evaluatie omdat er niets te evalueren valt. De architectuur van Qwen2.5 Omni was controleerbaar in de week dat het werd uitgebracht, omdat de gewichten ermee werden meegeleverd; de architectuur van InternLumina-U2 is vandaag leesbaar en de kwaliteit ervan is nog steeds een belofte van de leverancier.

Het scorebord

Omdat een van deze modellen zeventien maanden geschiedenis heeft en het andere een dag code, dragen de rijen herkomst in plaats van te doen alsof de kolommen symmetrisch zijn.

• Leeftijd — Qwen2.5 Omni: uitgebracht in maart 2025, zeventien maanden in het wild, honderduizenden downloads. InternLumina-U2: inferentiecode gepubliceerd op 1 september 2026, nul downloads, nul onafhankelijke runs.

• Vorm — Qwen2.5 Omni: ~7B end-to-end, Thinker-Talker met tijd-uitgelijnde multimodale positiecodering. InternLumina-U2: 16B totaal / 1B actieve sparse MoE-diffusie-LLM met een discrete visuele tokenizer met acht codeboeken.

• Invoer — beide verwerken tekst en afbeeldingen; Qwen2.5 Omni verwerkt daarnaast audio en video voor omni-chat; InternLumina-U2 claimt bovendien videobegrip over 64 gesamplede frames en 3D-begrip over Blender-gerenderde GLB/GLTF-weergaven.

• Output — Qwen2.5 Omni: tekst en streaming spraak, vier stemmen. InternLumina-U2: claimt tekst, tekst-naar-afbeelding tot 1024×1024, en instructiegebaseerde afbeeldingsbewerking.

• Generatiegrens — Qwen2.5 Omni: genereert woorden en spraak, geen pixels. InternLumina-U2: probeert pixelgeneratie en -bewerking binnen hetzelfde discrete-tokenmodel dat leest.

• Gewichten en licentie — beide in principe Apache-2.0 open gewichten; die van Qwen2.5 Omni zijn vandaag al downloadbaar, die van InternLumina-U2 zijn nog niet openbaar.

• Serveren — Qwen2.5 Omni: gehoste API plus zelfhosting (een zware full-precision-implementatie); bekende context van 32K, geen function calling. InternLumina-U2: kan niet worden geserveerd — de uitgebrachte driver verwacht checkpoints die niet bestaan.

• Kopcijfers — Qwen2.5 Omni: al lang gevestigd op de OmniBench-leaderboard (een score rond 0.561 op de huidige boards); InternLumina-U2: ChartQA 86.52, MathVision 33.22, GenEval 0.81 — allemaal door leveranciers gerapporteerd, voorlopig en gedeeltelijk.

A comparison scoreboard for InternLumina-U2 and Qwen2.5 Omni: InternLumina-U2 with Age 1 day code only, Size 16B-A1B diffusion MoE, Input image/video/3D (claims), Output text image gen & edits, Weights not yet public, Frontier reads AND draws; Qwen2.5 Omni with Age 17 months in production, Size ~7B Thinker-Talker, Input text/image/audio/video, Output text & streaming speech, Weights public since Mar 2025, Frontier reads speaks no pixels, with a footer noting InternLumina figures are vendor-reported and Qwen figures are Alibaba-reported, and the OrcaRouter logo in the bottom-right corner.

Waarom de generatiekloof het echte verhaal is

Zet de leeftijden opzij en het wezenlijke verschil is de grens waar elk model stopt. Qwen2.5 Omni koos voor een behapbare versie van omni: breed waarnemen, antwoorden in taal of spraak, en beeld- en videosynthese overlaten aan dedicated generatiemodellen elders in de stack. Die taakverdeling is hoe vrijwel elk productie-multimodaal systeem in 2026 is gebouwd, en het is waarom Qwen2.5 Omni in 2025 kon uitkomen en in 2026 bruikbaar kon blijven — het doet zijn deel goed en componeert met de rest. InternLumina-U2 is een weddenschap dat de taakverdeling juist het probleem is: dat een model dat gedwongen wordt om alles — perceptie én generatie — in één gedeelde discrete woordenschat te representeren, een dieper begrip van visie ontwikkelt dan een model dat het alleen maar hoeft te beschrijven. Die weddenschap, als die zich uitbetaalt, is het belangrijkste resultaat. Als dat niet gebeurt, eindigt InternLumina-U2 als een langzamere, hongerigere Qwen2.5 Omni met een beeldgenerator die onhandig in dezelfde gewichten is geschroefd. De hele wedstrijd — en het is een wedstrijd tussen een uitgebracht ontwerp en een hypothese, niet tussen twee draaibare modellen — is of de moeilijkere architectuur zichzelf rechtvaardigt.

A screenshot of the Hugging Face model page for Qwen/Qwen2.5-Omni-7B (captured August 27 2026), showing the Thinker-Talker overview, the Apache-2.0 license, and the model's text, image, audio and video modality tags.

De Hugging Face-kaart van Qwen/Qwen2.5-Omni-7B, vastgelegd op 27 augustus 2026 — het Thinker-Talker-overzicht, de Apache-2.0-licentie en de modaliteitstags van het model voor tekst, beeld, audio en video.

Wat anderhalf jaar aan downloads je daadwerkelijk oplevert

Volwassenheid is geen vibe; het is een lijst van dingen die je weet. Met Qwen2.5 Omni weet je dat de 32K-context een harde beperking is en kun je eromheen ontwerpen. Je weet dat er geen function-calling-pad is en je zult niet doen alsof het er wel is. Je weet bij benadering wat een deployment kost, zowel via een gehoste API als op je eigen GPU's, omdat genoeg mensen het model hebben geprijsd en gedraaid om de cijfers te laten stabiliseren. Je weet dat de OmniBench-positie echt is, omdat onafhankelijke leaderboards het al meer dan een jaar volgen. Met InternLumina-U2 is geen van die werkwoorden van toepassing — je weet niet, je kunt niet weten, want er is geen artefact. Wanneer een model een dag oud en gewichtloos is, is elke bewering erover een intentieverklaring. Die asymmetrie is geen kritiek op de wetenschap; het is de juiste epistemische houding voor iedereen die kiest waarop hij wil bouwen.

A screenshot of the GitHub repository InternLM/InternLumina-U2 (captured September 2 2026), showing the Apache-2.0 repo landing page with the multi-codebook diffusion description and the inference scripts that make the architecture public while weights stay out of the tree.

De GitHub-repository InternLM/InternLumina-U2, vastgelegd op 2 september 2026 — de landingspagina van de repository die de architectuur openbaar maakt — beschrijving, licentie en de inferentiescripts — terwijl de gewichten zelf ontbreken in de bestandsboom.

De routeringsbeslissing, eerlijk geformuleerd

We zullen de beschikbaarheid duidelijk stellen: OrcaRouter host InternLumina-U2 niet, omdat er geen gewichten zijn om te hosten, en we hebben Qwen2.5 Omni momenteel ook niet — dat draait via de eigen API van de ontwikkelaar en platforms van derden. Dus de routeringsles hier gaat over houding, niet over het vandaag via één sleutel aanroepen van deze twee. Het duurzame patroon is waar elke beslissing tussen een volwassen model en een nieuwkomer uiteindelijk op uitkomt: houd het bewezen model op het hoofdpad, waar één API voor 200+ modellen en een doorberekening van 0% marge betekenen dat je de prijs van de provider betaalt en niets meer; wijs de onbewezen nieuwkomer een testpad toe met automatische failover, zodat de eerste keer dat het stokt, afdwaalt of onzin teruggeeft, de aanroep terugvalt op het model met de staat van dienst van zeventien maanden. Zo kun je een ambitieuze nieuwe architectuur als InternLumina-U2 evalueren op de dag dat de gewichten verschijnen — zonder het productiepad waar je al van afhankelijk bent op het spel te zetten.

Het vonnis

Qwen2.5 Omni is het omni-model waarop je vandaag kunt bouwen: geleverd, downloadbaar, gedocumenteerd, met bekende beperkingen en een vaste prijs. InternLumina-U2 is het omni-model om in de gaten te houden: een echte architectuurstap voorbij perceptie, richting creatie, Apache-2.0, met publieke code en gewichten die nog moeten komen. Als de multi-codebook-gok van het lab standhoudt bij onafhankelijke tests, zal InternLumina-U2 niet zozeer een rivaal van Qwen2.5 Omni zijn als wel de volgende generatie van hetzelfde idee. Zo niet, dan zal de zeventien maanden oude generalist die daadwerkelijk is uitgebracht er nog steeds zijn en gewoon het werk doen dat hij al die tijd heeft gedaan. Let op de Hugging Face-stub; het oordeel wacht op de safetensors-bestanden, niet op dit artikel.

© 2026 OrcaRouter

Voor aanbieders

Beheer je een inferentieplatform? Zet je modellen op OrcaRouter.

providers@orcarouter.ai

Word lid van de community

Discordsupport@orcarouter.aiXGitHubYouTube