
InternLumina-U2 vs Gemini Omni 1.1 Flash: Modellen du inte kan köra ännu vs den du betalar för per sekund
- AlibabaNYQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens
- z-aiNYZ.ai: GLM 5.3 Flash2026-08-2658Intelligens72Kodning
- DeepSeekNYDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1M tokens
- z-aiZ.ai: GLM 5.32026-08-1860Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1552Intelligens68Kodning
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1261Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0557Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligens72Kodning
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligens69Kodning
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligens78Kodning
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligens69Kodning
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligens49Kodning
- metaMeta: Muse Spark 1.12026-07-1653Intelligens71Kodning
- kimiMoonshotAI: Kimi K32026-07-1560Intelligens76Kodning
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligens71Kodning
Om din deadline infaller den här veckan har den här jämförelsen ett svar på en mening. Gemini Omni 1.1 Flash är Googles allmänt tillgängliga videogenereringsmodell – du anropar den via ett API, den returnerar ett klipp med synkroniserat ljud, och du betalar per sekund av utdata. InternLumina-U2 är Shanghai AI Laboratorys tyst publicerade Apache-2.0-forskningsmodell – du kan ladda ner dess inferenskod, men inte dess vikter, som laboratoriet fortfarande märker "kommer snart". Den ena är en produkt du kan köpa just nu; den andra är ett pappersformat vad du inte kan köra alls. Den intressanta frågan är varför någon skulle sätta dem i samma mening från första början, och vad var och en säger dig om vart öppet multimodalt arbete är på väg i slutet av 2026.
Allt nedan är märkt efter källa. InternLumina-U2:s detaljer kommer från GitHub-repositoriet och projektsidan som labbet publicerade den 1 september 2026 — samma dag som den tomma Hugging Face-stubben dök upp — och var och en av dess benchmarksiffror är leverantörsrapporterade, preliminära och ej reproducerade. Gemini Omni 1.1 Flash:s detaljer kommer från Googles egna releasesmaterial och prissättningssida för modellen som blev allmänt tillgänglig den 27 augusti 2026.
Två svar på samma "multimodala" fråga.
Båda modellerna lever under den lösa parollen "en modell, många modaliteter", och det är bara den gemensamma etiketten som gör att de jämförs. Under den har de nästan ingenting gemensamt. Gemini Omni 1.1 Flash är en sluten, värdbaserad, videocentrerad genereringstjänst: mata den med text, en bild, ett kort referensklipp eller ljud, så producerar den upp till tio sekunders 720p-video med tal, musik och ljudeffekter inbakade, förlängningsbar i tio sekunders steg till en scen på fyrtio sekunder. Den resonerar om det klipp du redan har – förlängningspasset undersöker nu upp till tio sekunder av tidigare kontext i stället för den tidigare enda – och den stöder kontroll av första/sista bildrutan så att du kan låsa starten och slutet av en tagning och låta modellen fylla i mitten. Det är ett verktyg för att skapa rörliga bilder, sålt per sekund.
InternLumina-U2 är en satsning i motsatt riktning: en enda gles mixture-of-experts-modell, med totalt 16B parametrar varav 1B aktiva, som hävdar sig förstå bilder, video och 3D-tillgångar samt generera och redigera bilder genom ett gemensamt diskret-token-gränssnitt. Dess visuella sida är helt diskret – åtta kompletterande kodböcker från en tokenizer som labbet kallar AToken, så varje visuell position beskrivs av åtta koder snarare än en – och dess språkliga sida är en diffusionsryggrad som labbet bygger vidare från LLaDA-2.0. Idén är att förståelse och generering ska förstärka varandra i en enda viktuppsättning, istället för att sys ihop från specialiserade modeller. Huruvida det fungerar går i nuläget inte att besvara: modellen kan inte köras någonstans, eftersom vikterna inte finns offentligt.
Poängtavlan, sådan den nu är.
Den ärliga resultattavlan för detta par måste innehålla proveniens på varje rad, eftersom den ena kolumnen är en lanserad produkt med publicerade priser och den andra är ett ej offentliggjort forskningspåstående utan pris alls.
• Vad det är — Gemini Omni 1.1 Flash: en värdbaserad modell för videogenerering och videoredigering (modell-ID gemini-omni-1.1-flash), allmänt tillgänglig (GA) den 27 augusti 2026. InternLumina-U2: en diffusions-LLM inom öppen vetenskap för omni-visuell förståelse, bildgenerering och bildredigering; koden släpptes den 1 september 2026.
• Vikter — Gemini Omni 1.1 Flash: inga, stängda och endast värdbaserade. InternLumina-U2: inga ännu heller, men Apache-2.0-licensierad och uttryckligen märkt "kommer snart."
• Utdata du får — Gemini Omni 1.1 Flash: 10 sekunders 720p-klipp med ljud, förlängningsbara till 40 sekunder; 1080p- och 4K-uppskalningar; samt text. InternLumina-U2: inget ännu — inferenskod och en färdplan.
• Vad den tar emot — Gemini Omni 1.1 Flash: text, bild, video (upp till ~131K indatatokens; tre 10-sekundersklipp per prompt), ljud. InternLumina-U2: sägs ta emot text, naturliga bilder, täta diagram, video med över 64 samplade bildrutor och GLB/GLTF-3D-tillgångar renderade till 64 färg- och djupvyer.
• Så här kör du det — Gemini Omni 1.1 Flash: Googles Gemini API via det tillståndsbevarande Interactions API:et; konsumentåtkomst genom Google Flow för AI Plus-, Pro- och Ultra-prenumeranter. InternLumina-U2: endast självhostning, och endast efter att vikterna har släppts; koden förväntar sig en uppdelad checkpoint-katalog, AToken-tokenizerns vikter, FlashAttention och Blender 4.5 för 3D-sökvägen.
• Vad det kostar — Gemini Omni 1.1 Flash: $0,03/sek vid 360p-utkast, $0,10/sek vid 720p, $0,15/sek vid 1080p, $0,30/sek vid 4K, med en tokenprislista på $1,50 per miljon indata och $9,00 per miljon textutdata. InternLumina-U2: vad dina egna GPU:er än kostar, när den väl finns.

De två kolumnerna mäter inte samma axel. Gemini-sidan är prissatt, tillhandahållen och omedelbart användbar; InternLumina-sidan är en specifikation av en modell som ännu inte är en modell.
Den del som faktiskt är aktuell: Gemini Omni 1.1 Flashs GA
Gemini Omni 1.1 Flash är viktig på sina egna villkor den här veckan, eftersom det är ögonblicket då Googles omni-videolinje slutade vara en förhandsvisning. Den tidigare Gemini Omni Flash-förhandsvisningsändpunkten är planerad att stängas av den 30 september 2026, och denna GA-modell är ersättningen som utvecklare flyttas över till. Uppgraderingslistan är konkret: fyrtiosekunders scenförlängning byggd på tio sekunders steg, nyckelbildskontroll som låter dig specificera en första och sista bildruta och få modellen att generera den anslutande inspelningen, referensklipp på upp till tre sekunder för att hålla en karaktär eller miljö konsekvent, samt en 360p-utkastnivå prissatt till en tredjedel av 720p som kör upp till 60 % snabbare för att iterera på promptar innan den dyra slutrenderingen. Om du bygger videopipelines är pristabellen — $0,10 för en sekund av 720p, $1,01 för ett tio sekunders klipp, cirka $4 för en fyrtiosekunders 720p-scen byggd från fyra förlängningsanrop — den siffra som förändrar din kostnadsmodell.
Inget av detta gör den till en konkurrent till InternLumina-U2 i någon operativ mening. Gemini Omni 1.1 Flash genererar rörelse; InternLumina-U2, om dess påståenden överlever kontakt med modellvikterna, kommer att förstå rörelse och generera stillbilder. Ett team som behöver produktvideo detta kvartal väljer inte mellan de två – Gemini-modellen är den enda av paret som överhuvudtaget kan anropas, och den är tillgänglig via Googles eget API och flera tredjepartsplattformar.

Dokumentationen för "Models" i Gemini API på Googles AI-utvecklarwebbplats, tagen 2 september 2026 — sidan som listar den aktuella Gemini-familjen, med Gemini Omni-serien i sidnavigeringen.
Delen som inte alls är aktuell: InternLumina-U2
InternLumina-U2:s release den 1 september var av det tystaste slaget: tre commits till ett GitHub-repository, en projektsida, en 28-byte-stub på Hugging Face vars hela innehåll är ett licenshuvud för Apache-2.0, och inget tillkännagivande. Det som verkligen är offentligt är inferensramverket och arkitekturen, och de är värda en noggrann genomläsning just eftersom ingen har kunnat testa själva modellen. Repot visar en driver med en ingångspunkt per uppgift – text, text-till-bild upp till 1024×1024, bildförståelse av naturliga bilder och täta diagram, instruktionsbaserad bildredigering med ett valfritt dual-CFG-läge, videoförståelse av 64 samplade bildrutor och 3D-förståelse av Blender-renderade GLB/GLTF-vyer. Designen satsar på att ett diskret visuellt ordförråd med flera kodböcker låter en enda backbone hantera allt utan att blåsa upp sekvenslängden – samma instinkt som driver codec-nativa videomodeller, nämligen att ”visuella token ska bära mer information”, tillämpad på ett enhetligt gränssnitt för förståelse och generering.

InternLM/InternLumina-U2 GitHub-repot, fångat den 2 september 2026 – landningssidan för Apache-2.0-repot med beskrivningen "Multi-Codebook Diffusion Large Language Model", tre commits och de uppgiftsspecifika inferensskript som utgör hela den offentliga releasen hittills.
Benchmarktabellen på projektsidan är märkt ”preliminära, delvisa resultat” av labbet självt, och siffrorna där går åt båda hållen: starka diagram- och dokumentsiffror (ChartQA 86,52, CharXiv-DQ 83,65, leverantörsrapporterade) står bredvid en GenEval på 0,81 som ligger efter 0,89 för åtminstone en modell som labbet påstår sig överträffa. Det finns ingen oberoende utvärdering, eftersom det inte finns någon modell att utvärdera. Allt om faktisk kvalitet förblir ett påstående tills safetensors-filer dyker upp i den tomma Hugging Face-stubben.
Vad ett routinglager gör när endast en sida finns
Det här är en av de jämförelser där routningsaspekten egentligen handlar om tid, inte val. Vi ska inte låtsas att OrcaRouter betjänar InternLumina-U2 – det kan ingen, vikterna är inte släppta – och Gemini Omni 1.1 Flash finns inte heller i vår katalog; du når den via Googles eget API. Vad ett routningslager faktiskt är till för i detta glapp är att hålla dina alternativ öppna utan att bygga om din pipeline två gånger. Pass-through-modellen är mekanismen: när en värdbaserad leverantörsmodell väl dyker upp i en katalog skickas leverantörens listpris vidare med 0 % påslag, så att priset per sekund som leverantören publicerar är priset per sekund du betalar via en enda nyckel i stället för via ett avtal per leverantör. Och när ett Apache-2.0-viktsläpp som InternLumina-U2 äntligen kommer, är det rationella draget inte att riva ut din fungerande videostack – det är att sätta upp den nya modellen på en testväg bakom automatisk failover, så att första gången den oprövade diffusionsmodellen beter sig illa faller anropet tillbaka på den modell du redan litar på, utan en kodändring. Prova det nya där det inte kan skada dig; routa det som betalar räkningarna.
Domen
Om du behöver video den här månaden är beslutet redan fattat: Gemini Omni 1.1 Flash är på riktigt, prissatt och allmänt tillgänglig, och InternLumina-U2 kan inte anropas av någon. Om du följer vart öppen multimodal forskning är på väg är InternLumina-U2 den mer intressanta artefakten — en ovanlig fullt diskret, multi-codebook-satsning från ett stort labb, Apache-2.0, där arkitekturen redan är offentlig och vikterna troligen inte ligger långt efter. Betrakta repot som en förhandsvisning av en forskningsriktning, betrakta den allmänt tillgängliga videomodellen som ett verktyg du kan bygga på idag, och låt inte den gemensamma etiketten ”multimodal” övertyga dig om att de konkurrerar om samma jobb.
