Een hero-titelkaart voor de vergelijking 'InternLumina-U2 vs North Micro Vision Instruct' met de ondertitel 'Een documentlezer die je vandaag kunt draaien vs een 16B die er nog niet is' en drie stat-chips — 'North Micro: 2,4B, vandaag draaibaar', 'InternLumina-U2: 16B, nog geen gewichten', 'ChartQA 0,808 vs 86,52 (beide gerapporteerd)' — met het OrcaRouter-logo in de rechteronderhoek.
Guides & Insights

InternLumina-U2 vs North Micro Vision Instruct: een documentlezer die je vandaag al kunt draaien vs een 16B-model dat er nog niet is

Auteur

Magnus Corvin

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Als u deze week een model nodig hebt dat documenten, schermafbeeldingen en grafieken leest, heeft deze vergelijking een kort praktisch antwoord: North Micro Vision Instruct is een open-weightmodel met 2,4 miljard parameters van Cohere, uitgebracht onder Apache-2.0, downloadbaar sinds 10 augustus 2026, en goed genoeg in documenttaken om vandaag nog op uw eigen bestanden te richten. InternLumina-U2 is het diffusiemodel met 16 miljard parameters van Shanghai AI Laboratory — een veel ambitieuzer ontwerp dat ook aanspraak maakt op begrip van grafieken en documenten, naast een half dozijn andere taken — maar de gewichten zijn niet openbaar, de Hugging Face-repository is een lege stub, en niemand kan het ergens draaien. Het langere antwoord gaat over wat er gebeurt wanneer twee Apache-2.0-modellen overlappende beweringen doen over lezen, maar slechts één ervan iets is dat u in uw hand kunt houden.

De 2.4B die daadwerkelijk bestaat

North Micro Vision Instruct is de visionspecialist in Cohere's North-familie: ongeveer 2,4 miljard parameters in totaal, een compact model dat is gebouwd om op native resolutie te lezen. Het ontwerpprincipe is dat de meeste vision-modellen afbeeldingen verkleinen naar een vast raster en daarbij de fijne details verliezen waar documenten van afhankelijk zijn — daarom accepteert North Micro Vision Instruct afbeeldingen op hun native resolutie, tot ongeveer een A4-pagina bij 200 dpi, met behoud van beeldverhouding en kleine tekst. De door Cohere gerapporteerde cijfers zijn sterk voor de grootteklasse: DocVQA op 0,921, ChartQA op 0,808, OCRBench op 0,792, alle door Cohere gerapporteerd en niet onafhankelijk gereproduceerd, met een gevalideerde multimodale context rond 8K tokens en een gedocumenteerde zwakke plek bij MMMU (0,329) — een herinnering dat het een leesspecialist is, geen redeneergeneralist. Het heeft geen eigen gehoste API en geen standaard gehoste route; het praktische verhaal is het zelf hosten van een 2,4B-model, dat klein genoeg is om op een enkele moderne workstation-GPU te draaien. De community-adoptie is gestaag — de Hugging Face-modelkaart liet eind augustus tienduizenden downloads per maand zien.

De 16B die een belofte is.

InternLumina-U2 is een ander soort artefact. Wat Shanghai AI Laboratory op 1 september 2026 publiceerde, is inferentiecode en een architectuur, geen model: een schaarse mixture-of-experts-diffusie-LLM met in totaal 16B parameters, waarvan er 1B actief zijn, opgebouwd rond een volledig discrete visuele representatie met acht codeboeken. Van de zes taakfamilies die het driver-script van de repository ondersteunt — tekst, beeldbegrip, tekst-naar-beeld, beeldbewerking, videobegrip, 3D-begrip — omvat beeldbegrip expliciet informatiedichte grafieken en documenten. De voorlopige tabel op de projectpagina vermeldt grafiek- en documentcijfers die het lab in hetzelfde bereik rapporteert als wat de specialist claimt: ChartQA 86,52, CharXiv-DQ 83,65, naast een HallusionBench van 62,15 en een MathVision van 33,22. De pagina noemt de resultaten 'voorlopig, gedeeltelijk'; het technisch rapport dat de volledige tabellen zou bevatten, is gemarkeerd als 'binnenkort beschikbaar', en — het beslissende feit — er zijn geen gewichten waarmee iemand de resultaten zou kunnen verifiëren.

Het scorebord

Alle onderstaande cijfers zijn door de leveranciers gerapporteerd. De cijfers van North Micro Vision Instruct zijn Cohere's eigen evaluatie; die van InternLumina-U2 zijn de voorlopige gedeeltelijke tabel van het lab.

• Grootte en vorm — North Micro Vision Instruct: ~2,4B dense model, native-resolutielezer. InternLumina-U2: 16B totaal / 1B actief sparse MoE, discreet diffusiemodel met meerdere codeboeken.

• Wat het doet — North Micro Vision Instruct: leest afbeeldingen, documenten, grafieken en UI-schermen; antwoordt in tekst, met bronverwijzing. InternLumina-U2: claimt lezen plus genereren — begrijpt afbeeldingen/video/3D, genereert en bewerkt afbeeldingen.

- Gewichten — North Micro Vision Instruct: openbaar sinds 10 augustus 2026 (CohereLabs/North-Micro-Vision-Instruct, Apache-2.0). InternLumina-U2: niet openbaar; Hugging Face-stub leeg, gewichten gemarkeerd als "binnenkort beschikbaar."

• Belangrijkste leesscores — North Micro Vision Instruct: DocVQA 0,921, ChartQA 0,808, OCRBench 0,792 (gerapporteerd door Cohere). InternLumina-U2: ChartQA 86,52, CharXiv-DQ 83,65, HallusionBench 62,15 (gerapporteerd door het lab, voorlopig).

• Documentcontext — North Micro Vision Instruct: native resolutie tot ~A4 bij 200 dpi, ~8K gevalideerde multimodale context. InternLumina-U2: informatiedichte grafieken en natuurlijke afbeeldingen worden verwerkt via de AToken multi-codebook encoder; context nog niet gespecificeerd.

• Bekende zwakheden — North Micro Vision Instruct: MMMU 0,329, geen tool calling — een lezer, geen redeneerder of agent. InternLumina-U2: blijft achter bij ten minste één genoemde concurrent op GenEval (0,81 vs. 0,89) in de eigen gedeeltelijke tabel; alles is ongeverifieerd.

• Hoe je het draait — North Micro Vision Instruct: host zelf een 2.4B-model; vLLM-ondersteuning was nog in ontwikkeling toen dit werd geschreven. InternLumina-U2: niemand kan het draaien — geen gewichten, en de uitgebrachte driver heeft een checkpoint-map en tokenizer-bestanden nodig die niet in de repository zitten.

A comparison scoreboard for InternLumina-U2 and North Micro Vision Instruct: InternLumina-U2 with Size 16B-A1B diffusion MoE, Weights not public 'coming soon', Reading scores ChartQA 86.52 (reported), Weak spot GenEval 0.81 trails rival, Context not yet specified, Run it no one can today; North Micro Vision Instruct with Size ~2.4B dense reader, Weights public since Aug 10 2026, Reading scores ChartQA 0.808 DocVQA 0.921, Weak spot MMMU 0.329 no tools, Context native-res ~A4 8K ctx, Run it self-host one GPU, with a footer noting all figures are vendor-reported and unreproduced, and the OrcaRouter logo in the bottom-right corner.

Dezelfde benchmark, twee zeer verschillende kennistheorieën.

ChartQA is de meest directe manier om het verschil tussen de twee beweringen te zien. Beide modellen rapporteren een ChartQA-getal; North Micro Vision Instruct rapporteert 0,808 als nauwkeurigheidsfractie, en InternLumina-U2 rapporteert 86,52 als percentage — dezelfde benchmark, in wezen hetzelfde resultaat in de band van hoog-tachtig tot midden-tachtig op verschillende schalen, afgezien van de verschillende evaluatieverdelingen en promptconfiguraties die ChartQA-vergelijkingen tussen papers hachelijk maken, zelfs wanneer beide modellen bestaan. Het epistemische verschil is wat telt: de 0,808 van North Micro Vision Instruct is gekoppeld aan een downloadbaar artefact, dus elk team met een GPU en een set grafieken kan het deze week reproduceren of weerleggen. De 86,52 van InternLumina-U2 is gekoppeld aan een routekaart. Een getal dat je niet kunt controleren, is een getal waarop je niet moet voortbouwen — en dat is precies het standpunt dat het lab zelf erkent door zijn tabel als voorlopig te bestempelen.

A screenshot of the Hugging Face model page for CohereLabs/North-Micro-Vision-Instruct (captured August 27 2026), showing the 2.4B native-resolution vision-language description, the Apache-2.0 license, and the model-size and download figures.

De Hugging Face-kaart van CohereLabs/North-Micro-Vision-Instruct, vastgelegd op 27 augustus 2026 — de 2,4B native-resolutie vision-language beschrijving, de Apache-2.0-licentie en Cohere's gerapporteerde benchmarks voor documentlezen.

Lezen, versus lezen en tekenen

De kloof in architectuurfilosofie is meer waard dan de benchmarkkloof. North Micro Vision Instruct is een smalle specialist: het leest, en het doet die ene taak betaalbaar genoeg dat je het kunt draaien op elke pagina, elke screenshot, elke factuur in een pipeline zonder je GPU-rekening in de gaten te houden. Die goedkoopheid is het kenmerk — documentintelligentie op schaal is evenzeer een kostenprobleem als een nauwkeurigheidsprobleem. InternLumina-U2 is de tegenovergestelde gok: een enorm sparse model dat lezen probeert samen te voegen met beeldgeneratie, beeldbewerking, videobegrip en 3D-begrip in één gedeelde discrete-token-interface, op de theorie dat begrip en generatie elkaar versterken. Als het werkt, is het een andere klasse tool — maar "als het werkt" doet veel werk, en een 16B-A1B diffusie-MoE met een aangepaste tokenizer en met Blender gerenderde 3D-voorverwerking zal nooit de goedkope altijd-aan-lezer zijn die een 2.4B-specialist is. Dit zijn niet echt substituten. Het zijn een tool die je vandaag kunt inzetten en een onderzoeksrichting waarop je je kunt voorbereiden.

A screenshot of the GitHub repository InternLM/InternLumina-U2 (captured September 2 2026), showing the Apache-2.0 repo landing page with the 'Omni-Visual Understanding, Image Generation and Editing' description and the per-task inference scripts.

De GitHub-repository InternLM/InternLumina-U2, vastgelegd op 2 september 2026 — de landingspagina van de repository met de beschrijving "Omni-Visual Understanding, Image Generation and Editing" en de inferentiescripts per taak; het beeldbegrip-pad daarin is wat gericht is op natuurlijke afbeeldingen en dichte grafieken.

Wat dit betekent als u een documentpipeline bouwt

Geen van beide modellen wordt gehost op OrcaRouter — North Micro Vision Instruct is een zelfgehost model zonder gehoste API, en InternLumina-U2 heeft geen gewichten die iemand kan hosten — dus de routing-invalshoek is hier niet: “ze vandaag allebei via één sleutel oproepen.” Het is het patroon dat je zou gebruiken op de dag dat een van beide verandert: een documentpijplijn koppelt bijna altijd een goedkope lezer aan een grotere redeneerder, en de waarde van een routinglaag is dat ze die koppeling als één aanroep uitdrukt en de doorberekening met 0% opslag eerlijk houdt op de gehoste modellen die je wél gebruikt. Wanneer een Apache-2.0-checkpoint zoals InternLumina-U2 eindelijk uitkomt, is de verstandige zet niet om een werkende documentstack eruit te trekken — het is om de nieuwkomer op een testpad achter automatische failover te zetten, zodat hij productieverkeer verdient door het te overleven; op het moment dat hij faalt op een echte grafiek, valt de aanroep terug op het model dat zich al heeft bewezen. Eén API voor 200+ modellen is het mechanisme; failover is het vangnet; de specialist die je vandaag kunt draaien, is wat de rekeningen betaalt terwijl de 16B-belofte nog wordt waargemaakt.

Het vonnis

Voor het lezen van documenten en grafieken in het hier en nu is North Micro Vision Instruct de enige van de twee die in bruikbare zin bestaat — klein, Apache-2.0, downloadbaar, met sterke, door de leverancier gerapporteerde scores die je echt kunt natrekken. InternLumina-U2 is het interessantere langetermijnartefact, omdat het probeert lezen een van de zes vaardigheden in een enkel uniform model te maken; als dat werkt, verandert dat wat 'vision model' betekent. Bekijk de lege Hugging Face-repo zoals je naar een lanceercountdown kijkt: de dag dat er safetensors-bestanden verschijnen, wordt de belofte een model en wordt de vergelijking een echte. Tot die tijd: laat een door de leverancier gerapporteerde 86,52 op een grafiekbenchmark in je besluitvorming niet zwaarder wegen dan een downloadbare 0,808.

© 2026 OrcaRouter

Voor aanbieders

Beheer je een inferentieplatform? Zet je modellen op OrcaRouter.

providers@orcarouter.ai

Word lid van de community

Discordsupport@orcarouter.aiXGitHubYouTube