
InternLumina-U2 vs Gemini Omni 1.1 Flash: Das Modell, das du noch nicht ausführen kannst, vs. das, das du pro Sekunde bezahlst
- AlibabaNEUQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens
- z-aiNEUZ.ai: GLM 5.3 Flash2026-08-2658Intelligenz72Coding
- DeepSeekNEUDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.32026-08-1860Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1552Intelligenz68Coding
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1261Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0557Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligenz72Coding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligenz69Coding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 pro 1 Mio. Tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligenz78Coding
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligenz69Coding
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligenz49Coding
- metaMeta: Muse Spark 1.12026-07-1653Intelligenz71Coding
- kimiMoonshotAI: Kimi K32026-07-1560Intelligenz76Coding
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligenz71Coding
Wenn Ihre Frist diese Woche ist, hat dieser Vergleich eine Antwort in einem Satz. Gemini Omni 1.1 Flash ist Googles allgemein verfügbares Videogenerierungsmodell – Sie rufen es über eine API auf, es liefert einen Clip mit synchronisiertem Audio, und Sie zahlen pro Sekunde Ausgabe. InternLumina-U2 ist das still veröffentlichte Apache-2.0-Forschungsmodell des Shanghai AI Laboratory – Sie können dessen Inferenzcode herunterladen, aber nicht die Gewichte, die das Labor weiterhin als „bald verfügbar“ kennzeichnet. Das eine ist ein Produkt, das Sie sofort kaufen können; das andere ist eine Wette in Papierform, die Sie überhaupt nicht ausführen können. Die interessante Frage ist, warum überhaupt jemand sie in denselben Satz stellt – und was jedes davon darüber verrät, wohin sich offene multimodale Arbeit Ende 2026 bewegt.
Alle folgenden Angaben sind nach Quelle gekennzeichnet. Die Angaben zu InternLumina-U2 stammen aus dem GitHub-Repository und der Projektseite, die das Labor am 1. September 2026 veröffentlichte — am selben Tag, an dem der leere Eintrag auf Hugging Face erschien — und jede einzelne seiner Benchmark-Zahlen stammt vom Anbieter, ist vorläufig und nicht reproduziert. Die Angaben zu Gemini Omni 1.1 Flash stammen aus Googles eigenen Veröffentlichungsmaterialien und der Preisseite für das Modell, das am 27. August 2026 allgemein verfügbar wurde.
Zwei Antworten auf dieselbe "multimodale" Frage.
Beide Modelle stehen unter dem losen Banner „ein Modell, viele Modalitäten“, und genau diese gemeinsame Kennzeichnung ist der einzige Grund, warum sie miteinander verglichen werden. Unter diesem Banner haben sie fast nichts gemeinsam. Gemini Omni 1.1 Flash ist ein geschlossener, gehosteter Video-First-Generierungsdienst: Man füttert ihn mit Text, einem Bild, einem kurzen Referenzclip oder Audio, und er erzeugt bis zu zehn Sekunden 720p-Video mit eingebauter Sprache, Musik und Soundeffekten, das in Zehn-Sekunden-Schritten zu einer vierzig Sekunden langen Szene erweiterbar ist. Er verarbeitet den Clip, den man bereits hat – der Erweiterungsdurchlauf untersucht jetzt bis zu zehn Sekunden des vorherigen Kontexts anstelle der bisherigen einen Sekunde – und unterstützt die Steuerung des ersten und des letzten Frames, sodass man den Anfang und das Ende einer Einstellung festlegen und das Modell die Mitte füllen lassen kann. Er ist ein Werkzeug zur Erstellung von Bewegtbildern, das sekundenweise verkauft wird.
InternLumina-U2 ist eine Wette in die entgegengesetzte Richtung: ein einzelnes Sparse-Mixture-of-Experts-Modell mit 16B Gesamtparametern und 1B aktiven Parametern, das behauptet, Bilder, Videos und 3D-Assets zu verstehen und Bilder über eine gemeinsame diskrete Token-Schnittstelle zu erzeugen und zu bearbeiten. Seine visuelle Seite ist vollständig diskret – acht komplementäre Codebücher eines Tokenizers, den das Labor AToken nennt, sodass jede visuelle Position durch acht Codes statt durch einen beschrieben wird – und seine Sprachseite ist ein Diffusions-Backbone, das das Labor von LLaDA-2.0 erweitert. Die Idee dahinter ist, dass Verstehen und Erzeugen sich in einem einzigen Gewichtssatz gegenseitig verstärken sollten, anstatt aus spezialisierten Modellen zusammengesetzt zu werden. Ob das funktioniert, ist derzeit nicht zu beantworten: Das Modell ist nirgendwo ausführbar, weil die Gewichte nicht öffentlich existieren.
Die Anzeigetafel, so wie sie nun einmal ist
Die ehrliche Punktetafel für dieses Paar muss in jeder Zeile eine Herkunftsangabe enthalten, denn die eine Spalte ist ein ausgeliefertes Produkt mit veröffentlichten Preisen und die andere eine unveröffentlichte Forschungsaussage ohne jeden Preis.
• Was es ist — Gemini Omni 1.1 Flash: ein gehostetes Video-Generierungs- und Bearbeitungsmodell (Modell-ID gemini-omni-1.1-flash), allgemeine Verfügbarkeit (GA) am 27. August 2026. InternLumina-U2: ein Open-Science-Diffusions-LLM für omni-visuelles Verständnis, Bildgenerierung und -bearbeitung, Code veröffentlicht am 1. September 2026.
• Gewichte — Gemini Omni 1.1 Flash: keine, geschlossen und nur gehostet. InternLumina-U2: ebenfalls noch keine, aber unter Apache-2.0 lizenziert und ausdrücklich als „bald verfügbar“ markiert.
• Ausgabe, die Sie erhalten — Gemini Omni 1.1 Flash: 10-Sekunden-720p-Clips mit Audio, erweiterbar auf 40 Sekunden; 1080p- und 4K-Upscaling; zusätzlich Text. InternLumina-U2: noch nichts — Inferenzcode und eine Roadmap.
• Was es aufnimmt — Gemini Omni 1.1 Flash: Text, Bild, Video (bis zu ~131.000 Eingabetokens; drei 10-Sekunden-Clips pro Prompt), Audio. InternLumina-U2: laut eigenen Angaben Text, natürliche Bilder, dichte Diagramme, Video über 64 abgetastete Frames und GLB/GLTF-3D-Assets, die in 64 Farb- und Tiefenansichten gerendert werden.
• So führen Sie es aus — Gemini Omni 1.1 Flash: Googles Gemini-API über die zustandsbehaftete Interactions-API; Endkonsumentenzugriff über Google Flow für AI Plus-, Pro- und Ultra-Abonnenten. InternLumina-U2: nur selbst hosten, und erst nachdem die Gewichte veröffentlicht wurden; der Code erwartet ein Verzeichnis mit aufgeteilten Checkpoints, die AToken-Tokenizer-Gewichte, FlashAttention und Blender 4.5 für den 3D-Pfad.
Was es kostet — Gemini Omni 1.1 Flash: 0,03 $/Sekunde bei 360p-Entwurf, 0,10 $/Sekunde bei 720p, 0,15 $/Sekunde bei 1080p, 0,30 $/Sekunde bei 4K, mit einer Token-Preiskarte von 1,50 $ pro Million Eingabe und 9,00 $ pro Million Textausgabe. InternLumina-U2: was auch immer deine eigenen GPUs kosten, sobald es existiert.

Die beiden Spalten messen nicht dieselbe Achse. Die Gemini-Seite ist bepreist, verfügbar und sofort nutzbar; die InternLumina-Seite ist eine Spezifikation eines Modells, das noch kein Modell ist.
Der Teil, der tatsächlich aktuell ist: die GA von Gemini Omni 1.1 Flash
Gemini Omni 1.1 Flash ist diese Woche für sich genommen von Bedeutung, denn es ist der Moment, in dem Googles Omni-Videolinie aufgehört hat, eine Vorschau zu sein. Der frühere Gemini-Omni-Flash-Vorschau-Endpunkt soll am 30. September 2026 abgeschaltet werden, und dieses GA-Modell ist der Ersatz, auf den Entwickler umgestellt werden. Die Liste der Verbesserungen ist konkret: 40-Sekunden-Szenenerweiterung aus 10-Sekunden-Schritten, Keyframe-Steuerung, mit der Sie ein erstes und ein letztes Bild festlegen und das Modell das verbindende Filmmaterial generieren lassen können, Referenzclips von bis zu drei Sekunden, um eine Figur oder ein Setting konsistent zu halten, sowie eine 360p-Entwurfsstufe, die ein Drittel des Preises von 720p kostet und bis zu 60 % schneller läuft, um an Prompts zu iterieren, bevor der teure Endrender erfolgt. Wenn Sie Video-Pipelines bauen, ist die Preistabelle – $0.10 für eine Sekunde 720p, $1.01 für einen 10-Sekunden-Clip, etwa $4 für eine 40-Sekunden-720p-Szene aus vier Erweiterungsaufrufen – die Zahl, die Ihr Kostenmodell verändert.
Nichts davon macht es in irgendeinem operativen Sinne zu einem Konkurrenten von InternLumina-U2. Gemini Omni 1.1 Flash erzeugt Bewegung; InternLumina-U2 wird, wenn seine Behauptungen den Kontakt mit den Gewichten überleben, Bewegung verstehen und Standbilder erzeugen. Ein Team, das in diesem Quartal Produktvideos benötigt, entscheidet sich nicht zwischen den beiden – das Gemini-Modell ist das einzige der beiden, das überhaupt aufgerufen werden kann, und es ist über Googles eigene API und mehrere Drittanbieter-Plattformen verfügbar.

Die Dokumentation „Models" der Gemini-API auf Googles AI-Entwicklerwebsite, erfasst am 2. September 2026 — die Seite, die die aktuelle Gemini-Familie auflistet, mit der Gemini-Omni-Linie in der Seitenleisten-Navigation.
Der Teil, der überhaupt nicht aktuell ist: InternLumina-U2
Die Veröffentlichung von InternLumina-U2 am 1. September war die unscheinbarste Art von Release: drei Commits in einem GitHub-Repository, eine Projektseite, ein 28-Byte-Hugging-Face-Stub, dessen gesamter Inhalt ein Apache-2.0-Lizenzheader ist, und keine Ankündigung. Was wirklich öffentlich ist, sind die Inference-Harness und die Architektur, und sie verdienen eine sorgfältige Lektüre, gerade weil niemand das Modell selbst testen konnte. Das Repository zeigt einen Treiber mit einem Einstiegspunkt pro Aufgabe – Text, Text-zu-Bild bis zu 1024×1024, Bildverständnis für natürliche Bilder und dichte Diagramme, anweisungsbasiertes Bildbearbeiten mit optionalem Dual-CFG-Modus, Videoverständnis über 64 abgetastete Frames und 3D-Verständnis über Blender-gerenderte GLB/GLTF-Ansichten. Die Design-Wette ist, dass ein diskretes visuelles Vokabular mit mehreren Codebüchern es einem einzelnen Backbone ermöglicht, all dies zu bewältigen, ohne die Sequenzlänge aufzublähen – derselbe Instinkt, dass „visuelle Tokens mehr Informationen tragen sollten", der codec-native Videomodelle antreibt, angewendet auf eine einheitliche Verstehen-und-Generieren-Schnittstelle.

Das GitHub-Repository InternLM/InternLumina-U2, erfasst am 2. September 2026 — die Apache-2.0-Repository-Landingpage mit der Beschreibung „Multi-Codebook Diffusion Large Language Model“, drei Commits und den aufgabenspezifischen Inferenzskripten, die die gesamte bisherige öffentliche Veröffentlichung darstellen.
Die Benchmark-Tabelle auf der Projektseite wird vom Labor selbst als „vorläufige, teilweise Ergebnisse“ bezeichnet, und die dortigen Zahlen sind zweischneidig: starke Diagramm- und Dokumentwerte (ChartQA 86,52, CharXiv-DQ 83,65, vom Anbieter gemeldet) stehen neben einem GenEval von 0,81, das hinter dem Wert von 0,89 mindestens eines Modells zurückbleibt, das das Labor eigenen Angaben zufolge übertrifft. Es gibt keine unabhängige Bewertung, weil es kein Modell zu bewerten gibt. Alles, was die tatsächliche Qualität betrifft, bleibt eine Behauptung, bis safetensors-Dateien in diesem leeren Hugging-Face-Stub erscheinen.
Was eine Routing-Schicht tut, wenn nur eine Seite existiert
Dies ist einer dieser Vergleiche, bei denen es beim Routing wirklich um Zeit geht, nicht um Wahl. Wir werden nicht so tun, als würde OrcaRouter InternLumina-U2 anbieten – das kann niemand, die Gewichte sind nicht freigegeben –, und Gemini Omni 1.1 Flash ist ebenfalls nicht in unserem Katalog; Sie erreichen es über die eigene API von Google. Was eine Routing-Schicht in dieser Lücke tatsächlich bewirkt, ist, Ihnen die Optionen offen zu halten, ohne Ihre Pipeline zweimal neu aufzubauen. Das Pass-through-Modell ist der Mechanismus: Wenn ein gehostetes Anbietermodell tatsächlich in einem Katalog landet, wird der Listenpreis des Anbieters mit 0 % Aufschlag durchgereicht, sodass der vom Anbieter veröffentlichte Sekundensatz genau der Satz ist, den Sie über einen einzigen Schlüssel zahlen, statt über einen Vertrag pro Anbieter. Und wenn schließlich ein Apache-2.0-Gewichts-Release wie InternLumina-U2 erscheint, ist die rationale Vorgehensweise nicht, Ihren funktionierenden Video-Stack herauszureißen, sondern das neue Modell auf einem Testpfad hinter automatischem Failover aufzusetzen, sodass beim ersten Fehlverhalten des unerprobten Diffusionsmodells der Aufruf ohne Codeänderung auf das Modell zurückfällt, dem Sie bereits vertrauen. Probieren Sie das Neue dort, wo es Ihnen nicht schaden kann; routen Sie das, was die Rechnungen bezahlt.
Das Urteil
Wenn Sie diesen Monat Video benötigen, ist die Entscheidung für Sie bereits gefallen: Gemini Omni 1.1 Flash ist real, hat einen Preis und ist allgemein verfügbar, während InternLumina-U2 von niemandem aufgerufen werden kann. Wenn Sie beobachten, wohin sich die offene multimodale Forschung bewegt, ist InternLumina-U2 das interessantere Artefakt – eine seltene Wette eines großen Labors auf ein vollständig diskretes Multi-Codebook-Modell, lizenziert unter Apache-2.0, mit bereits öffentlicher Architektur und Gewichten, die vermutlich nicht lange auf sich warten lassen. Behandeln Sie das Repo als Vorschau auf eine Forschungsrichtung, das allgemein verfügbare Videomodell als Werkzeug, auf dem Sie heute aufbauen können, und lassen Sie sich von der gemeinsamen Bezeichnung „multimodal“ nicht zu der Annahme verleiten, dass die beiden um dieselbe Aufgabe konkurrieren.
