
InternLumina-U2 vs. North Micro Vision Instruct: Ein Dokumentenleser, den Sie heute ausführen können, vs. ein 16B-Modell, das noch nicht so weit ist.
- AlibabaNEUQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens
- z-aiNEUZ.ai: GLM 5.3 Flash2026-08-2658Intelligenz72Coding
- DeepSeekNEUDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.32026-08-1860Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1552Intelligenz68Coding
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1261Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0557Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligenz72Coding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligenz69Coding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 pro 1 Mio. Tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligenz78Coding
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligenz69Coding
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligenz49Coding
- metaMeta: Muse Spark 1.12026-07-1653Intelligenz71Coding
- kimiMoonshotAI: Kimi K32026-07-1560Intelligenz76Coding
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligenz71Coding
Wenn Sie diese Woche ein Modell brauchen, das Dokumente, Screenshots und Diagramme liest, hat dieser Vergleich eine kurze, praktische Antwort: {{1}}North Micro Vision Instruct ist ein Open-Weight-Modell von Cohere mit 2,4 Milliarden Parametern, das unter Apache-2.0 veröffentlicht wurde, seit dem 10. August 2026 heruntergeladen werden kann und bei Dokumentaufgaben gut genug ist, um es noch heute auf Ihre eigenen Dateien anzusetzen.{{/1}} InternLumina-U2 ist das 16-Milliarden-Parameter-Diffusionsmodell des Shanghai AI Laboratory – ein weitaus ehrgeizigeres Design, das neben einem halben Dutzend anderer Aufgaben auch Diagramm- und Dokumentverständnis für sich beansprucht – aber seine Gewichte sind nicht öffentlich, sein Hugging-Face-Repository ist ein leerer Stub, und niemand kann es bislang irgendwo ausführen.{{2}} Die längere Antwort dreht sich darum, was passiert, wenn zwei Apache-2.0-Modelle überlappende Behauptungen über das Lesen aufstellen, aber nur eines von ihnen etwas ist, das man in der Hand halten kann.{{/2}}
Die 2.4B, die tatsächlich existiert.
North Micro Vision Instruct ist der Vision-Spezialist in der North-Familie von Cohere: insgesamt rund 2,4B Parameter, ein kompaktes Modell, das für das Lesen in nativer Auflösung entwickelt wurde. Der konzeptionelle Hintergrund ist, dass die meisten Vision-Modelle Bilder auf ein festes Raster herunterskalieren und dabei die feinen Details verlieren, von denen Dokumente leben. Deshalb akzeptiert North Micro Vision Instruct Bilder in ihrer nativen Auflösung bis zu etwa einer A4-Seite bei 200 dpi und erhält dabei Seitenverhältnis und kleinen Text. Die von Cohere berichteten Zahlen sind für diese Größenklasse stark: DocVQA bei 0,921, ChartQA bei 0,808, OCRBench bei 0,792 – allesamt von Cohere angegeben und unabhängig nicht bestätigt – bei einem validierten multimodalen Kontext von rund 8K Tokens und einer dokumentierten Schwachstelle bei MMMU (0,329). Das erinnert daran, dass es ein Lesespezialist ist, kein Reasoning-Generalist. Es hat keine eigene gehostete API und keinen üblichen gehosteten Zugang; die praktische Lösung ist das Selbst-Hosting eines 2,4B-Modells, das klein genug ist, um auf einer einzelnen modernen Workstation-GPU zu laufen. Die Community-Adaption war stetig – die Hugging-Face-Modellkarte verzeichnete bis Ende August Zehntausende Downloads pro Monat.
Das 16B, das ein Versprechen ist.
InternLumina-U2 ist eine andere Art von Artefakt. Was das Shanghai AI Laboratory am 1. September 2026 veröffentlicht hat, ist Inferenzcode und eine Architektur, kein Modell: ein spärlich besetztes Mixture-of-Experts-Diffusions-LLM mit insgesamt 16B Parametern, von denen 1B aktiv sind, aufgebaut um eine vollständig diskrete visuelle Repräsentation mit acht Codebüchern. Unter den sechs Aufgabenfamilien, die das Treiberskript des Repos abdeckt — Text, Bildverständnis, Text-zu-Bild, Bildbearbeitung, Videoverständnis, 3D-Verständnis — schließt das Bildverständnis ausdrücklich dichte Diagramme und Dokumente ein. Die vorläufige Tabelle der Projektseite führt Diagramm- und Dokumentwerte auf, die das Labor im selben Bereich angibt, den der Spezialist beansprucht: ChartQA 86.52, CharXiv-DQ 83.65, neben einem HallusionBench-Wert von 62.15 und einem MathVision-Wert von 33.22. Die Seite bezeichnet die Ergebnisse als „vorläufig, unvollständig“; der technische Bericht, der die vollständigen Tabellen enthalten würde, ist als „coming soon“ markiert — und die entscheidende Tatsache: Es gibt keine Gewichte, mit denen irgendjemand es überprüfen könnte.
Die Anzeigetafel
Alle unten aufgeführten Zahlen stammen von den Anbietern. Die von North Micro Vision Instruct sind Coheres eigene Evaluierung; die von InternLumina-U2 sind die vorläufige Teiltabelle des Labors.
• Größe und Form — North Micro Vision Instruct: ~2,4B dichtes Modell, Reader mit nativer Auflösung. InternLumina-U2: 16B gesamt / 1B aktiv, sparse MoE, diskretes Multi-Codebook-Diffusionsmodell.
• Was es tut — North Micro Vision Instruct: liest Bilder, Dokumente, Diagramme und UI-Bildschirme; antwortet in Text, mit Quellenangabe. InternLumina-U2: bietet Lesen plus Generierung — versteht Bilder/Videos/3D, generiert und bearbeitet Bilder.
• Gewichte — North Micro Vision Instruct: seit 10. August 2026 öffentlich verfügbar (CohereLabs/North-Micro-Vision-Instruct, Apache-2.0). InternLumina-U2: nicht öffentlich; Hugging-Face-Stub leer, Gewichte als „in Kürze verfügbar“ markiert.
• Haupt-Lesewerte — North Micro Vision Instruct: DocVQA 0.921, ChartQA 0.808, OCRBench 0.792 (von Cohere gemeldet). InternLumina-U2: ChartQA 86.52, CharXiv-DQ 83.65, HallusionBench 62.15 (vom Labor gemeldet, vorläufig).
Dokumentkontext — North Micro Vision Instruct: native Auflösung bis zu ~A4 bei 200 dpi, ~8K validierter multimodaler Kontext. InternLumina-U2: dichte Diagramme und natürliche Bilder werden über den AToken-Multi-Codebook-Encoder verarbeitet; Kontext noch nicht spezifiziert.
• Bekannte Schwächen — North Micro Vision Instruct: MMMU 0,329, kein Tool-Calling — ein Leser, kein Denker oder Agent. InternLumina-U2: liegt bei GenEval (0,81 gegenüber 0,89) in seiner eigenen unvollständigen Tabelle hinter mindestens einem genannten Konkurrenten; alles unverifiziert.
• So führen Sie es aus — North Micro Vision Instruct: Selbst ein 2.4B-Modell hosten; die vLLM-Unterstützung war noch im Kommen, als dies geschrieben wurde. InternLumina-U2: Niemand kann es ausführen — keine Gewichte, und der veröffentlichte Treiber benötigt ein Checkpoint-Verzeichnis und Tokenizer-Dateien, die nicht im Repository enthalten sind.

Derselbe Benchmark, zwei sehr unterschiedliche Erkenntnistheorien
ChartQA ist der klarste Weg, den Unterschied zwischen den beiden Behauptungen zu erkennen. Beide Modelle melden einen ChartQA-Wert; North Micro Vision Instruct meldet 0,808 als Genauigkeitsanteil, und InternLumina-U2 meldet 86,52 als Prozentsatz – derselbe Benchmark, im Wesentlichen dasselbe Ergebnis in der Spanne von hohen bis mittleren 80er-Werten auf verschiedenen Skalen, abgesehen von den unterschiedlichen Evaluierungs-Splits und Prompt-Setups, die ChartQA-Vergleiche zwischen verschiedenen Arbeiten selbst dann heikel machen, wenn beide Modelle existieren. Worauf es ankommt, ist der erkenntnistheoretische Unterschied: Der Wert 0,808 von North Micro Vision Instruct ist mit einem herunterladbaren Artefakt verknüpft, sodass jedes Team mit einer GPU und einem Satz von Diagrammen ihn noch diese Woche reproduzieren oder widerlegen kann. Der Wert 86,52 von InternLumina-U2 hängt an einer Roadmap. Eine Zahl, die man nicht überprüfen kann, ist eine Zahl, auf die man sich nicht stützen sollte – genau das räumt das Labor selbst ein, indem es seine Tabelle als vorläufig kennzeichnet.

Die Hugging-Face-Karte von CohereLabs/North-Micro-Vision-Instruct, erfasst am 27. August 2026 — die Beschreibung des 2,4B-Vision-Language-Modells mit nativer Auflösung, die Apache-2.0-Lizenz und die von Cohere gemeldeten Benchmarks zum Lesen von Dokumenten.
Lesen, im Vergleich zu Lesen und Zeichnen
Die Kluft in der Architekturphilosophie zählt mehr als die Kluft bei den Benchmarks. North Micro Vision Instruct ist ein eng fokussierter Spezialist: Es liest – und es erledigt genau diese eine Aufgabe so günstig, dass man es in einer Pipeline auf jeder Seite, jedem Screenshot und jeder Rechnung laufen lassen kann, ohne auf die GPU-Rechnung zu schauen. Genau diese Günstigkeit ist das Feature – Dokumentenintelligenz im großen Maßstab ist ebenso ein Kostenproblem wie ein Genauigkeitsproblem. InternLumina-U2 setzt auf das genaue Gegenteil: ein riesiges Sparse-Modell, das versucht, Lesen mit Bildgenerierung, Bildbearbeitung, Videoverständnis und 3D-Verständnis in einer gemeinsamen Schnittstelle für diskrete Tokens zu vereinen – gestützt auf die Theorie, dass sich Verstehen und Generieren gegenseitig verstärken. Wenn es funktioniert, ist es eine andere Werkzeugklasse – aber „wenn es funktioniert“ ist ein großes Wenn, und ein 16B-A1B-Diffusions-MoE mit eigenem Tokenizer und Blender-gerendertem 3D-Preprocessing wird nie der günstige Dauerleser sein, der ein 2,4B-Spezialist ist. Das sind keine echten Substitute. Sie sind ein Werkzeug, das man heute einsetzen kann, und eine Forschungsrichtung, auf die man sich vorbereiten kann.

Das GitHub-Repository InternLM/InternLumina-U2, erfasst am 2. September 2026 – die Repository-Startseite mit der Beschreibung „Omni-Visual Understanding, Image Generation and Editing" und den Inferenzskripten für die jeweiligen Aufgaben; der Pfad für Bildverständnis darunter ist derjenige, der natürliche Bilder und dichte Diagramme abdeckt.
Was das bedeutet, wenn Sie eine Dokument-Pipeline aufbauen
Keines der beiden Modelle wird auf OrcaRouter gehostet — North Micro Vision Instruct ist ein selbst gehostetes Modell ohne gehostete API, und InternLumina-U2 besitzt keine Gewichte, die irgendjemand hosten könnte. Beim Routing geht es hier also nicht darum, beide heute über einen einzigen Schlüssel aufzurufen, sondern um das Muster, das Sie an dem Tag anwenden würden, an dem sich eines von beiden ändert: Eine Dokument-Pipeline paart fast immer einen günstigen Reader mit einem größeren Reasoner; der Wert einer Routing-Ebene liegt darin, diese Paarung als einen einzigen Aufruf abzubilden und die Durchreichung mit 0 % Aufschlag bei den gehosteten Modellen, die Sie tatsächlich nutzen, ehrlich zu halten. Wenn ein Apache-2.0-Checkpoint wie InternLumina-U2 endlich erscheint, besteht der sinnvolle Schritt nicht darin, einen funktionierenden Dokument-Stack herauszureißen, sondern darin, den Neuling auf einen durch automatisches Failover abgesicherten Testpfad zu setzen, damit er sich Produktionsverkehr verdient, indem er ihn übersteht — und in dem Moment, in dem er an einem echten Diagramm scheitert, fällt der Aufruf auf das Modell zurück, das sich bereits bewährt hat. Eine API über 200+ Modelle hinweg ist der Mechanismus; Failover ist das Sicherheitsnetz; der Spezialist, den Sie heute ausführen können, zahlt die Rechnungen, während das 16B-Versprechen noch eingehalten wird.
Das Urteil
Für das Lesen von Dokumenten und Diagrammen im Hier und Jetzt ist North Micro Vision Instruct das einzige der beiden, das in einem brauchbaren Sinne existiert – klein, Apache-2.0, herunterladbar und mit starken, vom Anbieter gemeldeten Punktwerten, die man tatsächlich überprüfen kann. InternLumina-U2 ist das interessantere langfristige Artefakt, denn es versucht, das Lesen zu einer von sechs Fähigkeiten in einem einzigen vereinheitlichten Modell zu machen. Wenn das funktioniert, verändert es die Bedeutung von „Vision-Modell“. Beobachte sein leeres Hugging-Face-Repository so, wie du einen Startcountdown beobachten würdest: An dem Tag, an dem safetensors-Dateien erscheinen, wird aus dem Versprechen ein Modell, und der Vergleich wird ein echter. Bis dahin lass nicht zu, dass ein vom Anbieter gemeldeter 86.52 bei einem Diagramm-Benchmark in deiner Entscheidungsfindung höher eingestuft wird als ein herunterladbarer 0.808.
