
InternLumina-U2 vs Microsoft Mage-VL: Zwei stille Labore wetten darauf, dass Vision-Tokens mehr Gewicht tragen sollten
- AlibabaNEUQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens
- z-aiNEUZ.ai: GLM 5.3 Flash2026-08-2658Intelligenz72Coding
- DeepSeekNEUDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.32026-08-1860Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1552Intelligenz68Coding
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1261Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0557Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligenz72Coding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligenz69Coding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 pro 1 Mio. Tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligenz78Coding
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligenz69Coding
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligenz49Coding
- metaMeta: Muse Spark 1.12026-07-1653Intelligenz71Coding
- kimiMoonshotAI: Kimi K32026-07-1560Intelligenz76Coding
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligenz71Coding
Microsoft Mage-VL und InternLumina-U2 wurden beide so veröffentlicht, wie Forschungslabore Dinge veröffentlichen, wenn sie noch nicht sicher sind, ob das Ergebnis bereits ein Produkt ist: still und heimlich. Microsoft stellte die Mage-VL-Gewichte und den Code am 25. Juli 2026 ohne Ankündigung auf Hugging Face bereit; die InternLM-Organisation des Shanghai AI Laboratory veröffentlichte den Inferenzcode von InternLumina-U2 am 1. September 2026 ebenfalls ohne Ankündigung auf GitHub. Im Abstand von fünf Wochen brachten zwei der größten Labore der Welt Modelle heraus, die eine stille Überzeugung teilen – dass die Art, wie wir Vision in Tokens verwandeln, der Engpass ist – und überließen es dann der Community, sie zur Kenntnis zu nehmen. Das eine kann man heute herunterladen und ausführen, wenn auch umständlich. Das andere kann man überhaupt nicht ausführen, weil seine Gewichte noch nicht existieren. Das ist die ehrliche Landkarte der beiden – und der Grund, warum „beides vom Anbieter gemeldet, beides unbewiesen" nicht für beide derselbe Satz ist.
Fünf Wochen, zwei Wetten auf Repräsentationseffizienz
Der rote Faden ist real, nicht rhetorisch. Mage-VL ist ein codec-natives Videomodell: Statt einen Stream in gleichmäßig abgetastete Frames zu dekodieren und ein dichtes Raster von Patches durch einen eingefrorenen, im Web vortrainierten Vision Transformer zu schieben, folgt es der Struktur moderner Videocodecs, trennt einen Stream in Ankerframes und die komprimierten Bewegungsdaten dazwischen und verarbeitet diese kompakte Repräsentation direkt. Microsofts berichteter Nutzen ist eine große Reduktion visueller Tokens und ein deutlich schnellerer Streaming-Wahrnehmungspfad – das Unternehmen bezeichnet das als Behebung einer Art Moravec'schem Paradox für Videosprachmodelle, bei dem kleine Echtzeit-Wahrnehmungsaufgaben so viel Rechenleistung kosten wie schwieriges Offline-Denken. Mage-VL ist ein Beobachter: Es konsumiert Video effizient und beantwortet Fragen zu dem, was es sieht, nahezu in Echtzeit.
InternLumina-U2 ist eine Wette auf denselben Engpass aus der anderen Richtung. Während Mage-VL Video komprimiert, indem es dem Codec folgt, komprimiert InternLumina-U2 jede visuelle Eingabe, indem es jede Position mit acht komplementären diskreten Codes statt mit einem beschreibt – mithilfe eines Tokenizers, den das Labor AToken nennt. Die Wette dahinter: Ein einzelnes Codebook begrenzt, wie viele Informationen ein visuelles Token tragen kann. Ein Vokabular aus mehreren Codebooks ermöglicht es daher einem 16B-Parameter-Diffusionsmodell, Verstehen und Generieren über dieselbe Schnittstelle abzuwickeln – Diagramme lesen, Videofragen beantworten, ein 3D-Asset beschreiben, ein Bild aus Text erzeugen, eines auf Anweisung bearbeiten – ohne einen separaten Generierungs-Stack. Mage-VL möchte Streams kostengünstig wahrnehmen; InternLumina-U2 möchte mit einem einzigen Gewichtssatz wahrnehmen und zeichnen.
Die Anzeigetafel
Die Zahlen beider Modelle stammen vom Hersteller und wurden nicht unabhängig reproduziert, daher kennzeichnet die Anzeigetafel jede Zeile mit ihrer Herkunft.
• Shape — Mage-VL: ein kompaktes, codec-natives Vision-Language-Modell (etwa 5B Parameter in BF16), das auf einem Qwen-Text-Backbone basiert und für das Verstehen von Bildern und Videos trainiert wurde. InternLumina-U2: eine 16B-Parameter-MoE mit 1B aktiven Parametern (16B-A1B), ein spärlich aktiviertes Diffusions-LLM, das Verstehen, Generieren und Bearbeiten abdeckt.
• Visuelle Darstellung — Mage-VL: codec-native Tokens, die der Videocodec-Struktur folgen (Anker plus Bewegung); berichtete Reduktion der visuellen Tokens um über 75 % bei Streaming-Video. InternLumina-U2: vollständig diskrete Tokens aus acht Codebüchern vom AToken-Tokenizer.
• Was es tut — Mage-VL: verarbeitet Bild- und Videoeingaben und antwortet in Text; entwickelt für Streaming-Wahrnehmung. InternLumina-U2: gibt Text- und Bildverständnis, Text-zu-Bild, Bildbearbeitung, Video- und 3D-Verständnis an.
• Gewichte — Mage-VL: öffentlich auf Hugging Face seit 25. Juli 2026 (microsoft/Mage-VL, Apache-2.0). InternLumina-U2: nicht öffentlich — das Hugging-Face-Repository ist ein leerer Stub, Gewichte als „coming soon“ markiert.
• Schlagzeilenzahlen — Mage-VL: Video-MME 64.0, NExT-QA 83.1, OVO-Bench 64.0, alle von Microsoft gemeldet. InternLumina-U2: ChartQA 86.52, MathVision 33.22, VideoMME 51.26, GenEval 0.81, alle vom Labor gemeldet, vorläufig und unvollständig.
• Realität der Bereitstellung — Mage-VL: herunterladbar, aber es gibt keinen Standardweg über vLLM oder SGLang; der Code erfordert trust_remote_code, und kein Inferenzanbieter stellt es derzeit bereit. InternLumina-U2: von niemandem bereitstellbar — die Gewichte sind nicht öffentlich verfügbar, und selbst der veröffentlichte Inferenztreiber erwartet Checkpoint-Dateien, die sich nicht im Repository befinden.

„Verfügbar, aber umständlich“ ist nicht dasselbe wie „nicht verfügbar“.
Dies ist der Unterschied, der am meisten zählt, wenn man tatsächlich versucht, etwas zu bauen. Mage-VL ist in der Hinsicht real, die zuerst zählt: Die Gewichte liegen auf Hugging Face, die Model Card verzeichnet seit Ende Juli starken Download-Verkehr, und ein kleines Ökosystem von Community-Quantisierungen ist darum herum entstanden. „Real“ bedeutet nicht „einfach“. Die Model Card weist ein Custom-Code-Tag auf, der visuelle Encoder ist nicht das eingefrorene Standard-ViT, das bestehende Serving-Stacks voraussetzen, und Microsofts eigenes Repository bringt die praktische Konsequenz mit sich: Es auszuführen bedeutet trust_remote_code und keine schlüsselfertige Bereitstellung über einen Provider. Aber ein entschlossenes Team mit einer GPU kann es laden, auf einen Videostream richten und sehen, ob die Codec-Native-These für ihre Daten Bestand hat. Das ist ein enormer Unterschied zu InternLumina-U2, wo derselbe Satz anders endet: Ein entschlossenes Team kann den Inferenzcode lesen — und dann ist Schluss, denn es gibt keine Gewichte zum Laden.

Die Hugging-Face-Karte für microsoft/Mage-VL, aufgenommen am 27. August 2026 – die codec-native Streaming-Beschreibung, die Apache-2.0-Lizenz, das arXiv-Tag und ein Abschnitt zu Inferenzanbietern, der zeigt, dass derzeit kein Anbieter das Modell bereitstellt.
Die Benchmark-Asymmetrie folgt derselben Linie. Die Zahlen beider Modelle sind Anbieterangaben ohne unabhängige Wiederholungsläufe. Aber die Behauptungen von Mage-VL stützen sich zumindest auf ein herunterladbares Artefakt, was bedeutet, dass die Lücke zwischen Behauptung und Verifizierung nur davon abhängt, dass jemand es ausführt. Die Behauptungen von InternLumina-U2 stützen sich auf einen Punkt auf der Roadmap – „vollständige Vergleichstabellen werden im kommenden technischen Bericht erscheinen“ – und es existiert kein Artefakt, das sie verifizieren könnte. Die eigene partielle Tabelle des Labors zeigt sogar, dass das Modell hinter mindestens einem Konkurrenten zurückbleibt, den es eigenen Angaben zufolge übertrifft (GenEval 0.81 gegenüber 0.89 von LLaDA2.0-Uni), was eine nützliche Erinnerung daran ist, das Etikett „vorläufig, unvollständig“ wörtlich zu nehmen.
Wo sie komponieren statt konkurrieren konnten
The most useful way to read these two is as adjacent rungs on a ladder, not as rivals for the same job. A codec-native watcher like Mage-VL is interesting precisely because it is cheap enough to run continuously — the thing that watches every frame of a stream and only escalates when something worth a bigger model's attention appears. The bigger model it escalates to could, in principle, be a unified model of the kind InternLumina-U2 claims to be: the always-on gate that decides what to look at, and the deep model that actually reads the chart, follows the 3D scene, or produces the edited image. Both are unproven — Mage-VL unproven-but-runnable, InternLumina-U2 unproven-and-unreleased — so the honest framing is a composition you could build once each side has been independently validated, not a head-to-head you can run today.

Das GitHub-Repository InternLM/InternLumina-U2, aufgenommen am 2. September 2026 – die Repository-Startseite mit der Beschreibung der Multi-Codebook-Diffusion, dem Apache-2.0-Lizenzabzeichen und den Inferenz-Einstiegspunkt-Skripten, die die öffentliche Version ausmachen, während die Gewichte nicht im Dateibaum enthalten sind.
Was eine Routing-Schicht mit unbestätigten Checkpoints macht
Keines dieser beiden Modelle wird auf OrcaRouter gehostet, und wir werden nicht den Anschein erwecken, dass es anders wäre — Mage-VL hat nirgendwo einen standardmäßigen Serving-Pfad, und InternLumina-U2 hat keine Gewichte. Der eigentliche Nutzen der Routing-DSL liegt in dieser Situation darin, die oben beschriebene Komposition als einen einzigen Aufruf auszudrücken statt als maßgeschneiderten Klebecode: ein günstiges, dauerhaft aktives Wahrnehmungsmodell, das ein tieferes Modell speist und so verkettet ist, dass das teure Modell nur dann läuft, wenn das günstige meldet, dass sich etwas geändert hat. Und für das Problem der unvalidierten Checkpoints — das zugleich das gesamte Risikoprofil beider Modelle darstellt — ist automatisches Failover der Mechanismus, der es einem Team ermöglicht, ein Modell wie Mage-VL auf einem realen Pfad auszuprobieren, ohne den Pfad auf das neue Modell zu verwetten: Wenn der neue Checkpoint zum ersten Mal hängt, Müll zurückgibt oder einen Fehler wirft, fällt der Aufruf auf ein bewährtes Modell zurück, und kein Ingenieur muss geweckt werden, um einen Schalter umzulegen. Eine API für 200+ Modelle, Listenpreise der Anbieter ohne Aufschlag durchgereicht, und das neue Modell wird hinter einem Sicherheitsnetz vorgeführt statt vor der Produktion.
Das Fazit
If you want to test the codec-native-video thesis today, only Mage-VL exists — and "exists" comes with caveats about custom code and DIY serving. If you want to test the multi-codebook unified-model thesis, you cannot, because InternLumina-U2 is still a specification waiting on its weights; what you can do is read its architecture now so you are ready the moment the stub on Hugging Face fills in. Treat the Microsoft model as an awkward-but-real artifact and the Shanghai AI Lab model as a well-documented promise, and remember that in this matchup "vendor-reported and unreproduced" applies to both — it just means something different when there is a file you can download.
