Een gegenereerde hero-kaart met de titel 'Qwen3.8-Omni-Flash vs InternLumina U2' onder de eyebrow 'Gehuurde zintuigen vs eigen gewichten', met de ondertitel 'Een gesloten long-media-API tegenover een 16B-diffusiemodel dat je kunt downloaden.' en vier chips: 'Gewichten: gesloten vs Apache 2.0', 'Genereert afbeeldingen: slechts één kant', 'Context: 1M vs niet bekendgemaakt', 'Hier routeerbaar: geen van beide'. Het OrcaRouter-logo is gecompositeerd in de rechteronderhoek.
Guides & Insights

Qwen3.8-Omni-Flash vs InternLumina U2: Gehuurde zintuigen vs eigen gewichten

Auteur

Elias Hawthorne

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

De nuttige manier om Qwen3.8-Omni-Flash en InternLumina U2 te vergelijken is niet via benchmarkrijen, omdat ze niet op dezelfde rijen voorkomen. Het is door te vragen wie ze mag draaien. De Qwen3.8-Omni-Flash van de leverancier, sinds 18 september 2026 open voor API-klanten, is een gesloten model op de eigen platforms van de leverancier: één miljoen tokens context, tot een uur continue audio en video per aanroep, alleen tekstuitvoer en geen gewichten. Het InternLumina U2 van Shanghai AI Laboratory is een 16B-A1B mixture-of-experts-diffusiemodel onder Apache 2.0 waarvan de Ascend-checkpoints nu van Hugging Face te downloaden zijn, terwijl de NVIDIA-checkpoints en het technische rapport nog steeds als te verschijnen staan vermeld. Het ene is een dienst die je per token huurt. Het andere is een bestand dat je kunt vasthouden, met de kanttekening op welke hardware het momenteel draait. Dat verschil bepaalt meer echte implementaties dan welke score dan ook in de tabel van een van beide leveranciers.

Wat InternLumina U2 eigenlijk is

De architectuur is het interessante deel, en ze is echt ongewoon. InternLumina U2 is een sparse MoE met 16 miljard totale parameters en 1 miljard actieve, en het is een diffusietaalmodel in plaats van een autoregressief model — het verfijnt een hele sequentie parallel in plaats van tokens van links naar rechts te emitteren. De visuele representatie is volledig discreet: acht codebooks met visuele tokens gebouwd op Apples AToken, en dat is wat één model zowel een afbeelding laat lezen als er een laat produceren zonder een aparte decoder die eraan vastzit. Tekstvraagbeantwoording, tekst-naar-afbeelding-generatie, beeldbegrip, beeldbewerking, videobegrip en 3D-begrip zijn allemaal hetzelfde model dat hetzelfde soort werk doet over hetzelfde vocabulaire.

• Grootte en vorm — InternLumina U2 is in totaal 16B, 1B actief, sparse MoE; het aantal parameters van Qwen3.8-Omni-Flash is niet bekendgemaakt.

• Generatie — InternLumina U2 genereert en bewerkt afbeeldingen en verwerkt 3D-begrip; Qwen3.8-Omni-Flash genereert helemaal geen media en retourneert tekst.

• Decodering — InternLumina U2 is een diffusie-LLM die parallel decodeert; Qwen3.8-Omni-Flash is autoregressief.

• Context en duur — Qwen3.8-Omni-Flash biedt een venster van 1M tokens en tot een uur continue audio-video in één enkele aanroep; in de gepubliceerde materialen van InternLumina U2 wordt niets daarvan beschreven, en langdurige audio behoort niet tot de vermelde mogelijkheden.

• Gewichten — InternLumina U2 is Apache 2.0, met Ascend-checkpoints gepubliceerd en NVIDIA-checkpoints nog in afwachting; Qwen3.8-Omni-Flash heeft geen gewichten en geen aangekondigd plan voor welke dan ook.

• Hoe je het krijgt — InternLumina U2 is een download van Hugging Face met inferentiecode op GitHub; Qwen3.8-Omni-Flash is een API-aanroep naar Alibaba Cloud Model Studio of het Qianwen-platform.

• Onafhankelijke scores — voor geen van beide. De eigen kaart van InternLumina U2 noemt de benchmarktabel "voorlopige, gedeeltelijke resultaten"; die van Qwen zijn allemaal tegen zijn eigen voorganger en niet gereproduceerd.

A generated two-column scoreboard titled 'Qwen3.8-Omni-Flash vs InternLumina U2 - the scoreboard'. Six shared dimension labels, left column Qwen3.8-Omni-Flash: 'Weights: not released', 'Size: undisclosed', 'Context: 1M tokens', 'Output: text only', 'Generates images: no', 'Access: vendor API only'; right column InternLumina U2: 'Weights: Apache 2.0 on Ascend', 'Size: 16B total, 1B active', 'Context: not published', 'Output: text and images', 'Generates images: yes', 'Access: download from Hugging Face'. The footer reads 'Qwen figures vendor-reported; InternLumina card says preliminary, partial results.' The OrcaRouter logo is composited in the bottom-right corner.

De gewichtenvraag is verschoven sinds de preview-verslaggeving

Als je ons eerdere stuk over InternLumina U2 hebt gelezen toen de code voor het eerst verscheen, is de stand van zaken in één richting veranderd en in een andere gelijk gebleven, en beide kanten zijn van belang. De Hugging Face-repository is niet langer een lege placeholder: de ascend/ map bevat nu zeven safetensors-shards plus de configuratie, tokenizer en modelcode, wat betekent dat het model echt te downloaden en te draaien is door iedereen met de juiste hardware. De nvidia/ map is nog steeds gemarkeerd als binnenkort beschikbaar, het technische rapport moet nog verschijnen, en de benchmarksectie van de repository zelf zegt nog steeds "voorlopige, gedeeltelijke resultaten." De juiste uitspraak vandaag is dus niet "de gewichten zijn uitgebracht" of "de gewichten ontbreken" — maar dat de checkpoints van de ene hardwarestack zijn gepubliceerd en die van de andere niet, wat een echte beperking is voor iedereen met een NVIDIA-cluster.

Twee andere dingen zijn stilletjes verschoven. De GitHub-repository blijft ook ruim na de eerste release van 1 september commits ontvangen, dus de uitgebrachte code wordt onderhouden in plaats van weggezet. En de downloadteller op de Hugging Face-repository staat nog steeds op nul, wat minder over het model zegt dan over de doelgroep: een 16B-A1B-diffusiemodel met Ascend-first-checkpoints is gericht op een lab, niet op een productteam dat dit kwartaal een gehoste endpoint zoekt.

Waar de twee echt overlappen, en waar niet.

Beeldbegrip is het snijpunt, en het is nauwer dan het lijkt. Beide modellen kunnen naar een afbeelding kijken en er vragen over beantwoorden, wat de hele taak is voor Qwen3.8-Omni-Flash en een van de zes taken voor InternLumina U2. Alles daarna loopt sterk uiteen. InternLumina U2 kan die afbeelding vervolgens bewerken of een nieuwe genereren op basis van een prompt, in hetzelfde model, met dezelfde visuele woordenschat die het gebruikte om de afbeelding te lezen. Qwen3.8-Omni-Flash kan geen enkele pixel produceren, maar het accepteert een uur audio en video in één aanroep en vertelt je wie er sprak, wanneer, en wat er werd besloten — wat de gepubliceerde materialen van InternLumina U2 helemaal niet claimen te doen.

De overlap die minder belangrijk is dan mensen aannemen, is video. Beide worden beschreven als iets dat video verwerkt, maar ze doen er verschillende dingen mee: de ene begrijpt een lange opname als een document, de andere behandelt video als een visuele modaliteit naast 3D. Een team dat een uur aan beeldmateriaal samengevat wil hebben, is niet gebaat bij de tweede, en een team dat een frame wil laten genereren, is niet gebaat bij de eerste.

A headless screenshot of the Hugging Face model page for InternLumina-U2 showing the Apache 2.0 licence badge, the tags for diffusion, multimodal, image-generation, image-editing and vision-language, the model card heading 'A Multi-Codebook Diffusion Large Language Model for Omni-Visual Understanding, Image Generation and Editing', and the 'Technical Report (Coming Soon)' note.

Kosten, controle en wat je eigenlijk koopt

De prijsvergelijking is niet van dezelfde orde. Qwen3.8-Omni-Flashrekent per token af — $0,15 per miljoen input, $0,016 gecachet, $0,47 output op de internationale lijst, met daarnaast een aparte prijslijst voor het vasteland die niet vergelijkbaar is — en de koplancering was een door de leverancier gerapporteerde verlaging van meer dan 98% op de kosten van een uur audio-input, berekend door een sample van twee minuten te prijzen en die met dertig te vermenigvuldigen, waarbij video gesampled werd op 720p en één frame per seconde. InternLumina U2rekent niets, want er valt niets te factureren: de kosten zijn je hardware en je tijd, en de eigen modelkaart van het model publiceert geen doorvoercijfer waarmee je dat zou kunnen omrekenen naar een bedrag per token.

Dat is de afweging in één regel. De API geeft je capaciteiten die je niet zelf kunt hosten en een kostenpost per uur die meeschaalt met het gebruik; de open weights geven je een vaste kostenpost en volledige controle over het datapad, tegen de prijs van een inferentiestack die je zelf moet bouwen en een checkpointset die momenteel Ascend-hardware betekent. Voor gereguleerde workloads waarbij media het gebouw niet mogen verlaten, is de tweede geen voorkeur — het is de enige optie op deze pagina. Voor een team dat deze maand analyse van lange audio nodig heeft, is de eerste de enige optie op deze pagina.

OrcaRouter host beide modellen vandaag niet, en we zeggen dat liever ronduit dan dat we een routeringspad suggereren dat niet bestaat: Qwen3.8-Omni-Flash draait alleen op Alibaba's eigen platforms, en InternLumina U2 is een download in plaats van een endpoint. Wat we wél draaien is de rest van de Qwen3.8-lijn — Qwen3.8-Flash en Qwen3.8-Max — via één API tegen de lijstprijs van de provider met 0% markup, wat de praktische manier is om een werkende baseline aan te houden voor de gesloten-modelkant van deze vergelijking, terwijl de open-weight-kant zijn NVIDIA-checkpoints nog op orde brengt.

A headless screenshot of the OrcaRouter model page for Qwen3.8 Flash at www.orcarouter.ai/models/qwen/qwen3.8-flash, showing the model header, the code sample, the input modalities and capabilities, the published pricing and the p50 TTFT figure.

Welke je eigenlijk zou moeten kiezen

Kies InternLumina U2 als je één model nodig hebt dat afbeeldingen leest, genereert en bewerkt en je bereid bent de inference-stack zelf te beheren — en als je accelerators Ascend zijn, of als je kunt wachten op de NVIDIA-checkpoints. Het is het enige van de twee modellen dat een afbeelding kan maken, en het enige dat je kunt draaien zonder gegevens naar een leverancier te sturen. Beschouw de benchmarkcijfers als onbewezen totdat het technische rapport verschijnt, want de modelkaart zegt precies dat.

Kies Qwen3.8-Omni-Flash als je probleem uren audio en video betreft in plaats van pixels als uitvoer — vergaderintelligentie, analyse van lange opnames, audio-intensief agentisch werk in het Chinees en Engels — en als je een afhankelijkheid van één bron en tekstuele output kunt accepteren. Het kostenverhaal is sterk op het gebied van invoeraudio-uren en veel zwakker op de totale factuur, de benchmarks zijn door de leverancier gerapporteerd en niet gereproduceerd, en de eerste uitvoeringen door derden die verschijnen plaatsen het in het 28e percentiel voor redeneren, op een steekproef die klein genoeg is om een test te rechtvaardigen in plaats van een beslissing.

Als je beide nodig hebt, zijn ze complementair, geen alternatieven: een open-weight beeldmodel dat je zelf host en een gesloten langemediamodel dat je aanroept. Geen van beide is vandaag via ons te routeren. Waar je aan de ene kant op moet letten, is het NVIDIA-checkpoint en het technische rapport; aan de andere kant de eerste onafhankelijke evaluatie, die nog niet bestaat en die de grootste lacune vormt in alles wat tot nu toe over Qwen3.8-Omni-Flash is geschreven.

Vergeleken in dit artikel1

Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt