Ett hero-titelkort för jämförelsen 'InternLumina-U2 vs North Micro Vision Instruct' med underrubriken 'En dokumentläsare du kan köra idag vs en 16B som inte är där än' och tre statistik-chips — 'North Micro: 2.4B, körbar idag', 'InternLumina-U2: 16B, inga vikter ännu', 'ChartQA 0.808 vs 86.52 (båda rapporterade)' — med OrcaRouter-logotypen i nedre högra hörnet.
Guides & Insights

InternLumina-U2 vs North Micro Vision Instruct: En dokumentläsare du kan köra idag vs en 16B-modell som inte är där än

Författare

Magnus Corvin

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Om du behöver en modell som läser dokument, skärmbilder och diagram den här veckan, har den här jämförelsen ett kort praktiskt svar: North Micro Vision Instruct är en modell med öppna vikter och 2,4 miljarder parametrar från Cohere, utgiven under Apache-2.0-licensen, nedladdningsbar sedan 10 augusti 2026 och tillräckligt bra för dokumentuppgifter för att det ska vara värt att rikta den mot dina egna filer redan idag. InternLumina-U2 är en diffusionsmodell från Shanghai AI Laboratory med 16 miljarder parametrar – en betydligt mer ambitiös konstruktion som också gör anspråk på att förstå diagram och dokument, bland ett halvt dussin andra uppgifter – men dess vikter är inte offentliga, dess Hugging Face-repository är en tom platshållare och ingen någonstans kan köra den ännu. Det längre svaret handlar om vad som händer när två Apache-2.0-modeller gör överlappande anspråk på att kunna läsa, men bara en av dem är något du kan hålla i handen.

De 2,4B som faktiskt existerar

North Micro Vision Instruct är visionsexperten i Coheres North-familj: cirka 2,4 miljarder parametrar totalt, en kompakt modell byggd för att läsa i naturlig upplösning. Designidén är att de flesta visionsmodeller nedskalar bilder till ett fast rutnät och förlorar de fina detaljer som dokument lever på – därför accepterar North Micro Vision Instruct bilder i deras naturliga upplösning upp till ungefär en A4-sida vid 200 dpi, med bevarat bildförhållande och liten text. Coheres rapporterade siffror är starka för storleksklassen: DocVQA på 0,921, ChartQA på 0,808, OCRBench på 0,792, alla rapporterade av Cohere och ej oberoende reproducerade, med en validerad multimodalkontext på cirka 8 000 tokens och en dokumenterad svag punkt på MMMU (0,329) – en påminnelse om att det är en lässpecialist, inte en generell resonemangsmodell. Den har inget eget värdbaserat API och ingen standardvärd väg; det praktiska scenariot är egen hosting av en 2,4-miljardersmodell, som är tillräckligt liten för att köras på ett enda modernt arbetsstations-GPU. Communityns användning har varit stadig – Hugging Face-kortet visade tiotusentals nedladdningar i månaden i slutet av augusti.

Den 16B som är ett löfte

InternLumina-U2 är en annan typ av artefakt. Det som Shanghai AI Laboratory publicerade den 1 september 2026 är inferenskod och en arkitektur, inte en modell: en diffusionsbaserad LLM med sparse mixture-of-experts, 16B parametrar totalt, varav 1B aktiva, byggd kring en helt diskret visuell representation med åtta codebooks. Bland de sex uppgiftsfamiljer som repots driverskript täcker — text, bildförståelse, text-till-bild, bildredigering, videoförståelse, 3D-förståelse — inkluderar bildförståelse uttryckligen kompakta diagram och dokument. Projektsidans preliminära tabell listar diagram- och dokumentsiffror som labbet rapporterar i samma härad som specialisten gör anspråk på: ChartQA 86.52, CharXiv-DQ 83.65, tillsammans med HallusionBench 62.15 och MathVision 33.22. Sidan kallar resultaten "preliminära, partiella", den tekniska rapport som skulle innehålla de fullständiga tabellerna är märkt "kommer snart", och — det avgörande faktumet — det finns inga vikter att kontrollera med.

Resultattavlan

Alla siffror nedan är leverantörsrapporterade. North Micro Vision Instructs är Coheres egen utvärdering; InternLumina-U2:s är labbets preliminära, ofullständiga tabell.

• Storlek och form — North Micro Vision Instruct: ~2,4B tät, läsare med nativ upplösning. InternLumina-U2: 16B totalt / 1B aktiva i en gles MoE, diskret diffusionsmodell med flera kodböcker.

• Vad den gör — North Micro Vision Instruct: läser bilder, dokument, diagram och UI-skärmar; svarar i text, med förankring. InternLumina-U2: påstås läsa plus generera — förstår bilder/video/3D, genererar och redigerar bilder.

• Vikter — North Micro Vision Instruct: offentliga sedan 10 augusti 2026 (CohereLabs/North-Micro-Vision-Instruct, Apache-2.0). InternLumina-U2: inte offentliga; Hugging Face-stubben är tom, vikterna märkta ”kommer snart”.

• Huvudsakliga läspoäng — North Micro Vision Instruct: DocVQA 0,921, ChartQA 0,808, OCRBench 0,792 (rapporterat av Cohere). InternLumina-U2: ChartQA 86,52, CharXiv-DQ 83,65, HallusionBench 62,15 (rapporterat av labbet, preliminärt).

• Dokumentkontext — North Micro Vision Instruct: nativ upplösning upp till ~A4 vid 200 dpi, ~8K validerad multimodal kontext. InternLumina-U2: informationstäta diagram och naturliga bilder hanteras via AToken multi-codebook-kodaren; kontext ännu inte specificerad.

• Kända svagheter — North Micro Vision Instruct: MMMU 0.329, inget verktygsanrop — en läsare, inte en resonerare eller agent. InternLumina-U2: ligger efter minst en namngiven konkurrent på GenEval (0.81 mot 0.89) i sin egen ofullständiga tabell; allt overifierat.

• Hur du kör det — North Micro Vision Instruct: självhosta en 2.4B-modell; vLLM-stödet var fortfarande på väg att implementeras när detta skrevs. InternLumina-U2: ingen kan köra det — inga vikter, och den släppta drivrutinen kräver en checkpoint-katalog och tokenizer-filer som inte finns i repot.

A comparison scoreboard for InternLumina-U2 and North Micro Vision Instruct: InternLumina-U2 with Size 16B-A1B diffusion MoE, Weights not public 'coming soon', Reading scores ChartQA 86.52 (reported), Weak spot GenEval 0.81 trails rival, Context not yet specified, Run it no one can today; North Micro Vision Instruct with Size ~2.4B dense reader, Weights public since Aug 10 2026, Reading scores ChartQA 0.808 DocVQA 0.921, Weak spot MMMU 0.329 no tools, Context native-res ~A4 8K ctx, Run it self-host one GPU, with a footer noting all figures are vendor-reported and unreproduced, and the OrcaRouter logo in the bottom-right corner.

Samma riktmärke, två mycket olika kunskapssyner

ChartQA är det tydligaste sättet att se skillnaden mellan de två påståendena. Båda modellerna rapporterar en ChartQA-siffra; North Micro Vision Instruct rapporterar 0,808 som en träffsäkerhetsandel, och InternLumina-U2 rapporterar 86,52 som en procentsats – samma riktmärke, i princip samma resultat i 80-talsintervallet, fast på olika skalor, med reservation för de olika utvärderingsindelningarna och promptkonfigurationerna som gör ChartQA-jämförelser mellan artiklar vilseledande även när båda modellerna finns. Den epistemiska skillnaden är det som räknas: North Micro Vision Instructs 0,808 är kopplad till en nedladdningsbar artefakt, så vilket team som helst med en GPU och en uppsättning diagram kan reproducera eller vederlägga den siffran den här veckan. InternLumina-U2:s 86,52 är kopplad till en färdplan. En siffra du inte kan kontrollera är en siffra du inte bör bygga på – vilket är precis den ståndpunkt labbet självt bekräftar genom att beteckna sin tabell som preliminär.

A screenshot of the Hugging Face model page for CohereLabs/North-Micro-Vision-Instruct (captured August 27 2026), showing the 2.4B native-resolution vision-language description, the Apache-2.0 license, and the model-size and download figures.

Hugging Face-kortet för CohereLabs/North-Micro-Vision-Instruct, hämtat den 27 augusti 2026 — beskrivningen av den 2,4B stora vision-language-modellen med nativ upplösning, Apache-2.0-licensen och Coheres rapporterade riktmärken för dokumentläsning.

Att läsa, kontra att läsa och rita.

Den arkitektoniska filosofiklyftan är värd mer än benchmark-klyftan. North Micro Vision Instruct är en smal specialist: den läser, och den gör det jobbet tillräckligt prisvärt för att du ska kunna köra den på varje sida, varje skärmdump, varje faktura i en pipeline utan att behöva hålla koll på GPU-kostnaden. Den billigheten är själva funktionen — dokumentintelligens i stor skala är ett kostnadsproblem i lika hög grad som ett noggrannhetsproblem. InternLumina-U2 är den motsatta satsningen: en enorm gles modell som försöker föra samman läsning med bildgenerering, bildredigering, videoförståelse och 3D-förståelse i ett gemensamt gränssnitt för diskreta token, utifrån teorin att förståelse och generering förstärker varandra. Om det fungerar är det ett verktyg av en annan klass — men "om det fungerar" får bära en tung börda, och en 16B-A1B-diffusions-MoE med en specialanpassad tokenizer och Blender-renderad 3D-förbehandling kommer aldrig att vara den billiga alltid-på-läsaren som en 2.4B-specialist är. Dessa är egentligen inte substitut. De är ett verktyg du kan driftsätta idag och en forskningsriktning du kan förbereda dig för.

A screenshot of the GitHub repository InternLM/InternLumina-U2 (captured September 2 2026), showing the Apache-2.0 repo landing page with the 'Omni-Visual Understanding, Image Generation and Editing' description and the per-task inference scripts.

GitHub-förvaret InternLM/InternLumina-U2, fångat den 2 september 2026 — förvarets startsida med beskrivningen "Omni-Visual Understanding, Image Generation and Editing" och de uppgiftsspecifika inferensskripten; bland dessa är bildförståelsesökvägen den som riktar sig mot naturliga bilder och täta diagram.

Vad detta innebär om du bygger en dokumentpipeline

Ingen av modellerna drivs på OrcaRouter — North Micro Vision Instruct är en modell du själv driver, utan något värdbaserat API, och InternLumina-U2 har inte släppt några vikter som någon kan driva — så routningsaspekten här är inte att "anropa dem båda via en enda nyckel i dag." Det är mönstret du skulle använda den dag endera av dem förändras: en dokumentpipeline parar nästan alltid ihop en billig läsmodell med en större resonerande modell, och ett routningslagers värde är att uttrycka den kopplingen som ett enda anrop och säkerställa att pass-through med 0 % påslag förblir transparent för de värdbaserade modeller du faktiskt använder. När en Apache-2.0-checkpoint som InternLumina-U2 äntligen släpps, är det förnuftiga draget inte att riva ut en fungerande dokumentstack — det är att lägga nykomlingen på en testväg bakom automatisk failover, så att den förtjänar produktionstrafik genom att överleva den, och i samma stund som den misslyckas på ett riktigt diagram faller anropet tillbaka på den modell som redan bevisat sitt värde. Ett och samma API för 200+ modeller är mekanismen; failover är säkerhetsnätet; specialisten du kan köra i dag är den som betalar räkningarna medan 16B-löftet fortfarande infrias.

Domen

För dokument- och diagramavläsning här och nu är North Micro Vision Instruct den enda av de två som existerar i användbar mening — liten, Apache-2.0, nedladdningsbar, med starka leverantörsrapporterade poäng du faktiskt kan gå och kontrollera. InternLumina-U2 är den mer intressanta långsiktiga artefakten, eftersom den försöker göra läsning till en av sex förmågor i en enda enhetlig modell, och om det fungerar förändrar det vad "visionmodell" betyder. Bevaka dess tomma Hugging Face-repo som du skulle bevaka en nedräkning inför en uppskjutning: den dag safetensors-filerna dyker upp blir löftet en modell, och jämförelsen blir en verklig sådan. Tills dess, låt inte en leverantörsrapporterad 86,52 på ett diagramriktmärke övertrumfa en nedladdningsbar 0,808 i ditt beslutsfattande.

© 2026 OrcaRouter

För leverantörer

Driver du en inferensplattform? Få dina modeller på OrcaRouter.

providers@orcarouter.ai

Gå med i vår community

Discordsupport@orcarouter.aiXGitHubYouTube