Een hero-titelkaart voor de vergelijking 'InternLumina-U2 vs Gemini Omni 1.1 Flash' met de subtitel 'Het model dat je nog niet kunt draaien versus het model waarvoor je per seconde betaalt' en drie stat-chips — 'InternLumina-U2: alleen code, gewichten volgen binnenkort', 'Gemini Omni 1.1 Flash: GA 27 augustus 2026', '$0.03–$0.30 per seconde video' — met het OrcaRouter-logo in de rechterbenedenhoek.
Guides & Insights

InternLumina-U2 vs Gemini Omni 1.1 Flash: Het model dat je nog niet kunt draaien versus het model dat je per seconde betaalt

Auteur

Rowan Sterling

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Als je deadline deze week is, heeft deze vergelijking een antwoord van één zin. Gemini Omni 1.1 Flash is Google's algemeen beschikbare videogeneratiemodel — je roept het aan via een API, het retourneert een clip met gesynchroniseerde audio, en je betaalt per seconde output. InternLumina-U2 is het stilletjes gepubliceerde Apache-2.0-onderzoeksmodel van het Shanghai AI Laboratory — je kunt de inferentiecode downloaden, maar niet de gewichten, die het lab nog steeds als 'binnenkort beschikbaar' markeert. De ene is een product dat je nu kunt kopen; de andere is een papieren weddenschap die je helemaal niet kunt draaien. De interessante vraag is waarom iemand ze in de eerste plaats in dezelfde zin zou zetten, en wat elk je vertelt over waar open multimodaal werk naartoe gaat eind 2026.

Alles hieronder is gelabeld per bron. De details van InternLumina-U2 komen uit de GitHub-repository en de projectpagina die het laboratorium op 1 september 2026 publiceerde — dezelfde dag dat de lege Hugging Face-stub verscheen — en elk van de benchmarkcijfers is door de leverancier gerapporteerd, voorlopig en niet gereproduceerd. De details van Gemini Omni 1.1 Flash komen uit Google's eigen releasemateriaal en de prijspagina voor het model dat op 27 augustus 2026 algemeen beschikbaar werd.

Twee antwoorden op dezelfde "multimodale" vraag

Beide modellen vallen onder de losse noemer 'één model, vele modaliteiten', en dat gedeelde label is de enige reden waarom ze worden vergeleken. Verder hebben ze vrijwel niets gemeen. Gemini Omni 1.1 Flash is een gesloten, gehoste, video-eerst-generatiedienst: voer er tekst, een afbeelding, een korte referentieclip of audio aan toe, en het produceert tot tien seconden 720p-video met ingebakken spraak, muziek en geluidseffecten, uitbreidbaar in stappen van tien seconden tot een scène van veertig seconden. Het redeneert over de clip die je al hebt — de uitbreidingsronde bekijkt nu tot tien seconden aan eerdere context in plaats van de vorige — en het ondersteunt bediening op eerste/laatste frame, zodat je het begin en einde van een shot kunt vastzetten en het model het midden kan invullen. Het is een tool voor het maken van bewegende beelden, verkocht per seconde.

InternLumina-U2 is een gok in de tegenovergestelde richting: een enkel schaars mixture-of-experts-model, met 16B totale parameters en 1B actieve parameters, dat beweert afbeeldingen, video en 3D-assets te begrijpen en afbeeldingen te genereren en te bewerken via één gedeelde discrete-tokeninterface. De visuele kant ervan is volledig discreet — acht complementaire codeboeken van een tokenizer die het lab AToken noemt, zodat elke visuele positie door acht codes wordt beschreven in plaats van één — en de taalkant is een diffusie-backbone die het lab ontwikkelt vanuit LLaDA-2.0. Het uitgangspunt is dat begrip en generatie elkaar moeten versterken binnen één gewichtenset, in plaats van te worden samengevoegd uit specialistische modellen. Of dat werkt, is op dit moment niet te beantwoorden: het model is nergens draaibaar, omdat de gewichten niet publiek beschikbaar zijn.

Het scorebord, zoals het is.

Het eerlijke scorebord voor dit paar moet op elke rij herkomstinformatie bevatten, want de ene kolom is een verzendproduct met gepubliceerde prijzen en de andere is een nog niet vrijgegeven onderzoeksclaim zonder enige prijs.

• Wat het is — Gemini Omni 1.1 Flash: een gehost model voor videogeneratie en -bewerking (model-ID gemini-omni-1.1-flash), GA 27 augustus 2026. InternLumina-U2: een open-science diffusie-LLM voor omnivisueel begrip, beeldgeneratie en -bewerking; code uitgebracht op 1 september 2026.

• Gewichten — Gemini Omni 1.1 Flash: geen, gesloten en alleen gehost. InternLumina-U2: ook nog geen, maar onder Apache-2.0-licentie en expliciet gemarkeerd als 'binnenkort beschikbaar'.

• De output die je krijgt — Gemini Omni 1.1 Flash: clips van 10 seconden in 720p met audio, uitbreidbaar tot 40 seconden; 1080p- en 4K-upscales; tekst erbij. InternLumina-U2: nog niets — inferentiecode en een routekaart.

• Wat het als invoer ondersteunt — Gemini Omni 1.1 Flash: tekst, beeld, video (tot ~131K inputtokens; drie clips van 10 seconden per prompt), audio. InternLumina-U2: claimt ondersteuning voor tekst, natuurlijke afbeeldingen, dichte grafieken, video over 64 gesamplede frames en GLB/GLTF 3D-assets, gerenderd naar 64 kleur- en dieptebeelden.

• Hoe je het uitvoert — Gemini Omni 1.1 Flash: de Gemini API van Google via de stateful Interactions API; consumententoegang via Google Flow voor AI Plus-, Pro- en Ultra-abonnees. InternLumina-U2: alleen self-hosting, en pas nadat de gewichten zijn vrijgegeven; de code verwacht een gesplitste checkpoint-map, de gewichten van de AToken-tokenizer, FlashAttention en Blender 4.5 voor het 3D-pad.

• Wat het kost — Gemini Omni 1.1 Flash: $0,03/sec voor 360p-draft, $0,10/sec voor 720p, $0,15/sec voor 1080p, $0,30/sec voor 4K, met een tokenprijslijst van $1,50 per miljoen input en $9,00 per miljoen tekstoutput. InternLumina-U2: wat je eigen GPU's ook kosten, zodra het bestaat.

A comparison scoreboard for InternLumina-U2 and Gemini Omni 1.1 Flash: InternLumina-U2 with Type 16B-A1B diffusion MoE, Weights Apache-2.0 not yet public, Core job Understand & generate stills, Status code only weights 'soon', Price none yet, Run it no one can today; Gemini Omni 1.1 Flash with Type closed hosted video model, Weights none Google API only, Core job video gen & edit with audio, Status GA Aug 27 2026, Price $0.03–$0.30 per second, Run it Gemini API (Interactions), with a footer noting InternLumina figures are vendor-reported and Gemini pricing is per Google, and the OrcaRouter logo in the bottom-right corner.

De twee kolommen meten niet dezelfde as. De Gemini-kant is geprijsd, beschikbaar en direct bruikbaar; de InternLumina-kant is een specificatie van een model dat nog geen model is.

Het deel dat op dit moment actueel is: de GA van Gemini Omni 1.1 Flash

Gemini Omni 1.1 Flash is deze week op eigen merites belangrijk, omdat het het moment is waarop Google's omni-videolijn geen preview meer is. Het eerdere Gemini Omni Flash preview-eindpunt wordt op 30 september 2026 uitgeschakeld, en dit GA-model is de vervanging waar ontwikkelaars naartoe worden overgezet. De upgradelijst is concreet: scèneverlenging van veertig seconden opgebouwd uit stappen van tien seconden, keyframe-controle waarmee je een eerste en laatste frame kunt opgeven en het model de verbindende beelden laat genereren, referentieclips tot drie seconden om een personage of setting consistent te houden, en een 360p-conceptlaag geprijsd op een derde van 720p die tot 60% sneller draait voor het itereren op prompts vóór de dure definitieve render. Als je videopijplijnen bouwt, is de prijstabel — $0,10 voor een seconde 720p, $1,01 voor een clip van tien seconden, ongeveer $4 voor een 720p-scène van veertig seconden opgebouwd uit vier extensieaanroepen — het getal dat je kostenmodel verandert.

Niets daarvan maakt het in operationele zin een concurrent van InternLumina-U2. Gemini Omni 1.1 Flash genereert beweging; InternLumina-U2 zal, als zijn claims het contact met de gewichten overleven, beweging begrijpen en stilstaande beelden genereren. Een team dat dit kwartaal productvideo nodig heeft, kiest niet tussen de twee — het Gemini-model is de enige van het tweetal dat überhaupt kan worden aangeroepen, en het is beschikbaar via de eigen API van Google en verschillende platforms van derden.

A screenshot of the Gemini API Models documentation on Google's AI developer site (captured September 2 2026), showing the sidebar navigation listing the current Gemini model family including the Gemini Omni line.

De Gemini API-documentatie 'Models' op de AI-ontwikkelaarssite van Google, vastgelegd op 2 september 2026 — de pagina die de huidige Gemini-familie vermeldt, met de Gemini Omni-lijn in de zijbalknavigatie.

Het deel dat helemaal niet actueel is: InternLumina-U2

De release van InternLumina-U2 op 1 september was van de stilste soort: drie commits aan een GitHub-repository, een projectpagina, een 28-byte Hugging Face-stub waarvan de volledige inhoud een Apache-2.0-licentieheader is, en geen aankondiging. Wat echt openbaar is, zijn de inferentie-harness en de architectuur, en die verdienen een zorgvuldige lezing juist omdat niemand het model zelf heeft kunnen testen. De repo toont een driver met één entrypoint per taak — tekst, tekst-naar-afbeelding tot 1024×1024, beeldbegrip over natuurlijke afbeeldingen en dense grafieken, instructiegebaseerde beeldbewerking met een optionele dual-CFG-modus, videobegrip over 64 gesamplede frames, en 3D-begrip over met Blender gerenderde GLB/GLTF-weergaven. De ontwerpweddenschap is dat een discreet visueel vocabulaire met meerdere codeboeken één backbone al het werk laat doen zonder de sequentielengte op te blazen — hetzelfde instinct van 'visuele tokens zouden meer informatie moeten dragen' dat codec-native videomodellen aandrijft, toegepast op een uniforme begrijp-en-genereer-interface.

A screenshot of the GitHub repository InternLM/InternLumina-U2 (captured September 2 2026), showing the Apache-2.0 repo landing page, the 'Multi-Codebook Diffusion Large Language Model for Omni-Visual Understanding, Image Generation and Editing' description, three commits, and the per-task inference scripts.

De GitHub-repository InternLM/InternLumina-U2, vastgelegd op 2 september 2026 — de Apache-2.0-landingspagina van de repository met de beschrijving "Multi-Codebook Diffusion Large Language Model", drie commits en de inferentiescripts per taak die tot nu toe de volledige openbare release vormen.

De benchmarktabel op de projectpagina wordt door het lab zelf aangeduid als "voorlopige, gedeeltelijke resultaten", en de cijfers die erin staan, werken twee kanten op: sterke scores op grafiek- en documentbenchmarks (ChartQA 86,52, CharXiv-DQ 83,65, door de leverancier gerapporteerd) staan naast een GenEval van 0,81 die achterblijft bij de 0,89 van minstens één model dat het lab naar eigen zeggen overtreft. Er is geen onafhankelijke evaluatie, want er valt geen model te evalueren. Alles wat de werkelijke kwaliteit betreft, blijft een bewering totdat er safetensors-bestanden in die lege Hugging Face-stub verschijnen.

Wat een routinglaag doet wanneer er slechts één zijde bestaat

Dit is een van die vergelijkingen waarbij het bij routing echt om tijd gaat, niet om keuze. We gaan niet doen alsof OrcaRouter InternLumina-U2 aanbiedt — dat kan niemand, de gewichten zijn niet vrijgegeven — en Gemini Omni 1.1 Flash staat evenmin in onze catalogus; je bereikt het via de eigen API van Google. Waar een routinglaag in deze tussentijd eigenlijk voor dient, is je opties openhouden zonder je pipeline twee keer te herbouwen. Het pass-through-model is het mechanisme: wanneer een gehost model van een leverancier daadwerkelijk in een catalogus wordt opgenomen, wordt de lijstprijs van de leverancier met 0% opslag doorgegeven, dus het per-seconde-tarief dat de leverancier publiceert, is het per-seconde-tarief dat je via één enkele sleutel betaalt in plaats van via een contract per leverancier. En wanneer er eindelijk een model met Apache-2.0-gewichten zoals InternLumina-U2 verschijnt, is de rationele zet niet om je werkende videostack eruit te rukken — het is om het nieuwe model uit te rollen op een testpad achter automatische failover, zodat de call de eerste keer dat het onbewezen diffusiemodel zich misdraagt zonder codeaanpassing terugvalt op het model dat je al vertrouwt. Probeer het nieuwe model op een plek waar het je geen kwaad kan doen; routeer wat de rekeningen betaalt.

Het vonnis

Als je deze maand video nodig hebt, is de beslissing voor je gemaakt: Gemini Omni 1.1 Flash bestaat echt, heeft een prijs en is algemeen beschikbaar, en InternLumina-U2 kan door niemand worden aangeroepen. Als je volgt waar open multimodaal onderzoek naartoe gaat, is InternLumina-U2 het interessantere artefact — een zeldzame, volledig-discrete gok met meerdere codeboeken van een groot lab, Apache-2.0, waarbij de architectuur al openbaar is en de gewichten waarschijnlijk niet ver achter zullen blijven. Behandel de repo als een preview van een onderzoeksrichting, behandel het GA-videomodel als een tool waar je vandaag al op kunt bouwen, en laat het gedeelde label 'multimodaal' je er niet van overtuigen dat ze voor dezelfde taak strijden.

© 2026 OrcaRouter

Voor aanbieders

Beheer je een inferentieplatform? Zet je modellen op OrcaRouter.

providers@orcarouter.ai

Word lid van de community

Discordsupport@orcarouter.aiXGitHubYouTube