Karta tytułowa hero porównania „InternLumina-U2 vs North Micro Vision Instruct" z podtytułem „Czytnik dokumentów, który możesz uruchomić dziś, vs 16B, którego jeszcze nie ma" i trzema chipami statystyk — „North Micro: 2.4B, dostępny dziś", „InternLumina-U2: 16B, brak wag", „ChartQA 0.808 vs 86.52 (oba raportowane)" — z logo OrcaRouter w prawym dolnym rogu.
Guides & Insights

InternLumina-U2 kontra North Micro Vision Instruct: Czytnik dokumentów, który możesz uruchomić już dziś, kontra model 16B, którego jeszcze nie ma

Autor

Magnus Corvin

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Jeśli w tym tygodniu potrzebujesz modelu, który czyta dokumenty, zrzuty ekranu i wykresy, to porównanie ma krótką praktyczną odpowiedź: North Micro Vision Instruct to model o otwartych wagach liczący 2,4 miliarda parametrów od Cohere, wydany na licencji Apache-2.0, do pobrania od 10 sierpnia 2026 roku, i wystarczająco dobry w zadaniach dokumentowych, aby warto było już dziś skierować go na własne pliki. InternLumina-U2 to model dyfuzyjny o 16 miliardach parametrów od Shanghai AI Laboratory – znacznie bardziej ambitny projekt, który również twierdzi, że rozumie wykresy i dokumenty, pośród kilku innych zadań – ale jego wagi nie są publiczne, jego repozytorium na Hugging Face to pusty placeholder i nikt nigdzie nie może go jeszcze uruchomić. Dłuższa odpowiedź dotyczy tego, co się dzieje, gdy dwa modele na licencji Apache-2.0 wysuwają podobne roszczenia dotyczące czytania, ale tylko jeden z nich jest czymś, co można wziąć do ręki.

Ten 2.4B, który faktycznie istnieje

North Micro Vision Instruct jest specjalistą od wizji w rodzinie North firmy Cohere: to model o łącznie około 2,4 mld parametrów, kompaktowy i zaprojektowany do odczytu w natywnej rozdzielczości. Zamysł projektu jest taki, że większość modeli wizyjnych zmniejsza obrazy do stałej siatki i traci drobne szczegóły, od których zależą dokumenty — dlatego North Micro Vision Instruct przyjmuje obrazy w ich natywnej rozdzielczości, aż do około strony A4 przy 200 dpi, zachowując proporcje i mały tekst. Raportowane przez Cohere wyniki są solidne jak na tę klasę wielkości: DocVQA 0,921, ChartQA 0,808, OCRBench 0,792 — wszystko raportowane przez Cohere i niezweryfikowane niezależnie, ze zwalidowanym kontekstem multimodalnym rzędu 8 tys. tokenów i udokumentowanym słabym punktem w MMMU (0,329). To przypomnienie, że jest to specjalista od odczytu, a nie ogólny model rozumowania. Nie ma on własnego hostowanego API ani standardowej ścieżki hostingu; praktycznie oznacza to samodzielne hostowanie modelu 2,4 mld, który jest na tyle mały, że można go uruchomić na pojedynczym nowoczesnym GPU w stacji roboczej. Adopcja w społeczności utrzymuje się na stałym poziomie — pod koniec sierpnia karta Hugging Face pokazywała dziesiątki tysięcy pobrań miesięcznie.

To 16B, które jest obietnicą

InternLumina-U2 to inny rodzaj artefaktu. To, co Shanghai AI Laboratory opublikowało 1 września 2026 r., to kod inferencyjny i architektura, a nie model: rzadki model dyfuzyjny LLM oparty na mieszaninie ekspertów, z 16B parametrów łącznie i 1B aktywnych, zbudowany wokół w pełni dyskretnej reprezentacji wizualnej z ośmioma księgami kodowymi. Wśród sześciu rodzin zadań objętych skryptem sterującym repozytorium — tekst, rozumienie obrazu, tekst-na-obraz, edycja obrazu, rozumienie wideo, rozumienie 3D — rozumienie obrazu wyraźnie obejmuje gęste wykresy i dokumenty. Wstępna tabela na stronie projektu zawiera wyniki dla wykresów i dokumentów, które laboratorium podaje w tym samym przedziale, który deklaruje specjalista: ChartQA 86.52, CharXiv-DQ 83.65, obok HallusionBench 62.15 i MathVision 33.22. Strona nazywa wyniki „wstępnymi, częściowymi”, raport techniczny, który miałby zawierać pełne tabele, oznaczony jest jako „wkrótce”, a — co decydujące — nie ma wag, które pozwoliłyby komukolwiek to sprawdzić.

Tablica wyników

Wszystkie poniższe wyniki są raportowane przez dostawców. Wyniki North Micro Vision Instruct to własna ewaluacja Cohere; wyniki InternLumina-U2 to wstępna, częściowa tabela laboratorium.

• Rozmiar i architektura — North Micro Vision Instruct: gęsty model o ~2,4B parametrów, czytający w natywnej rozdzielczości. InternLumina-U2: rzadki model MoE (16B łącznie / 1B aktywnych), dyskretny model dyfuzyjny z wieloma codebookami.

• Co robi — North Micro Vision Instruct: czyta obrazy, dokumenty, wykresy i ekrany UI; odpowiada tekstem z odniesieniami do źródeł. InternLumina-U2: deklaruje czytanie i generowanie — rozumie obrazy/wideo/3D, generuje i edytuje obrazy.

• Wagi — North Micro Vision Instruct: publiczne od 10 sierpnia 2026 r. (CohereLabs/North-Micro-Vision-Instruct, Apache-2.0). InternLumina-U2: niepubliczne; stub na Hugging Face pusty, wagi oznaczone jako „wkrótce”.

• Najważniejsze wyniki testów — North Micro Vision Instruct: DocVQA 0.921, ChartQA 0.808, OCRBench 0.792 (raportowane przez Cohere). InternLumina-U2: ChartQA 86.52, CharXiv-DQ 83.65, HallusionBench 62.15 (raportowane przez laboratorium, dane wstępne).

• Kontekst dokumentu — North Micro Vision Instruct: natywna rozdzielczość do ~A4 przy 200 dpi, ~8K zwalidowany kontekst multimodalny. InternLumina-U2: gęste wykresy i naturalne obrazy obsługiwane przez enkoder AToken z wieloma słownikami kodowymi; kontekst nie został jeszcze określony.

• Znane słabości — North Micro Vision Instruct: MMMU 0,329, brak wywoływania narzędzi — to czytnik, a nie rozumujący ani agent. InternLumina-U2: w teście GenEval ustępuje co najmniej jednemu wymienionemu z nazwy rywalowi (0,81 wobec 0,89) we własnej częściowej tabeli; wszystko niezweryfikowane.

• Jak to uruchamiasz — North Micro Vision Instruct: samodzielny hosting modelu 2.4B; wsparcie vLLM wciąż było wdrażane, gdy to pisano. InternLumina-U2: nikt nie może go uruchomić — brak wag, a wydany sterownik wymaga katalogu punktów kontrolnych i plików tokenizera, których nie ma w repozytorium.

A comparison scoreboard for InternLumina-U2 and North Micro Vision Instruct: InternLumina-U2 with Size 16B-A1B diffusion MoE, Weights not public 'coming soon', Reading scores ChartQA 86.52 (reported), Weak spot GenEval 0.81 trails rival, Context not yet specified, Run it no one can today; North Micro Vision Instruct with Size ~2.4B dense reader, Weights public since Aug 10 2026, Reading scores ChartQA 0.808 DocVQA 0.921, Weak spot MMMU 0.329 no tools, Context native-res ~A4 8K ctx, Run it self-host one GPU, with a footer noting all figures are vendor-reported and unreproduced, and the OrcaRouter logo in the bottom-right corner.

Ten sam benchmark, dwie bardzo różne epistemologie.

ChartQA to najczystszy sposób, aby zobaczyć różnicę między tymi dwoma twierdzeniami. Oba modele podają liczbę ChartQA; North Micro Vision Instruct raportuje 0,808 jako ułamek dokładności, a InternLumina-U2 raportuje 86,52 jako procent — ten sam benchmark, w zasadzie ten sam wynik w paśmie od górnych 80 do środkowych 80 na różnych skalach, z grubsza rzecz biorąc, z zastrzeżeniem różnych podziałów ewaluacyjnych i konfiguracji promptów, które sprawiają, że porównania ChartQA między artykułami są zdradliwe nawet wtedy, gdy oba modele istnieją. {{1}}Kluczowa jest różnica epistemiczna: wynik 0,808 modelu North Micro Vision Instruct jest powiązany z artefaktem do pobrania, więc każdy zespół z GPU i zestawem wykresów może go odtworzyć lub obalić w tym tygodniu.{{/1}} Wynik 86,52 modelu InternLumina-U2 jest powiązany z mapą drogową. {{2}}Liczba, której nie można sprawdzić, to liczba, na której nie należy budować — i to dokładnie to stanowisko, które samo laboratorium przyznaje, oznaczając swoją tabelę jako wstępną.{{/2}}

A screenshot of the Hugging Face model page for CohereLabs/North-Micro-Vision-Instruct (captured August 27 2026), showing the 2.4B native-resolution vision-language description, the Apache-2.0 license, and the model-size and download figures.

Karta Hugging Face CohereLabs/North-Micro-Vision-Instruct, zarejestrowana 27 sierpnia 2026 r. — opis modelu wizyjno-językowego o natywnej rozdzielczości 2,4B, licencja Apache-2.0 oraz podane przez Cohere wyniki testów czytania dokumentów.

Czytanie a czytanie i rysowanie

Różnica w filozofii architektury jest cenniejsza niż różnica w benchmarkach. North Micro Vision Instruct to wąski specjalista: czyta i robi to na tyle tanio, że można go uruchomić na każdej stronie, każdym zrzucie ekranu i każdej fakturze w potoku przetwarzania, nie patrząc na rachunek za GPU. Ta taniość to kluczowa cecha — inteligencja dokumentów na dużą skalę to problem kosztów w równym stopniu co problem dokładności. InternLumina-U2 to zakład w przeciwną stronę: ogromny rzadki model, który próbuje połączyć czytanie z generowaniem obrazów, edycją obrazów, rozumieniem wideo i rozumieniem 3D w jeden wspólny interfejs dyskretnych tokenów, w oparciu o teorię, że rozumienie i generowanie wzajemnie się wzmacniają. Jeśli zadziała, będzie to narzędzie innej klasy — ale „jeśli zadziała” to bardzo duże „jeśli”, a dyfuzyjny MoE 16B-A1B z niestandardowym tokenizerem i preprocesingiem 3D renderowanym w Blenderze nigdy nie będzie tanim, zawsze włączonym czytnikiem, jakim jest specjalista 2.4B. To nie są tak naprawdę substytuty. Jedno to narzędzie, które możesz wdrożyć dziś, a drugie to kierunek badań, na który możesz się przygotować.

A screenshot of the GitHub repository InternLM/InternLumina-U2 (captured September 2 2026), showing the Apache-2.0 repo landing page with the 'Omni-Visual Understanding, Image Generation and Editing' description and the per-task inference scripts.

Repozytorium GitHub InternLM/InternLumina-U2, zarchiwizowane 2 września 2026 r. — strona główna repozytorium z opisem „Omni-Visual Understanding, Image Generation and Editing” oraz skryptami wnioskowania dla poszczególnych zadań; wśród nich ścieżka rozumienia obrazów jest ukierunkowana na naturalne obrazy i gęste wykresy.

Co to oznacza, jeśli budujesz potok dokumentów.

Żaden z tych modeli nie jest hostowany na OrcaRouter — North Micro Vision Instruct to model do samodzielnego hostowania, bez hostowanego API, a InternLumina-U2 nie ma wag, które można by hostować — więc w kwestii routingu nie chodzi o to, by „wywołać oba przez jeden klucz już dziś”. To wzorzec, z którego skorzystasz w dniu, gdy którykolwiek z nich się zmieni: potok dokumentów prawie zawsze łączy niedrogi czytnik z większym modelem rozumującym, a wartość warstwy routingu polega na ujęciu tego połączenia jako jednego wywołania i uczciwym przekazywaniu kosztów bez marży (0%) na hostowanych modelach, z których faktycznie korzystasz. Gdy w końcu pojawi się punkt kontrolny na licencji Apache-2.0, taki jak InternLumina-U2, rozsądnym posunięciem nie jest wyrywanie działającego systemu do przetwarzania dokumentów — lecz umieszczenie nowego modelu na ścieżce testowej z automatycznym przełączaniem awaryjnym, aby zasłużył na ruch produkcyjny, przetrwawszy go, a w chwili, gdy zawiedzie na prawdziwym wykresie, wywołanie wraca do modelu, który już się sprawdził. Jedno API obejmujące ponad 200 modeli to mechanizm; przełączanie awaryjne to siatka bezpieczeństwa; wyspecjalizowany model, który możesz uruchomić już dziś, płaci rachunki, dopóki obietnica 16B wciąż jest dotrzymywana.

Werdykt

Jeśli chodzi o czytanie dokumentów i wykresów tu i teraz, North Micro Vision Instruct jest jedynym z tych dwóch, który jest w praktyce używalny — mały, na licencji Apache-2.0, do pobrania, z wynikami deklarowanymi przez producenta, które naprawdę możesz sprawdzić. InternLumina-U2 to bardziej interesujący długoterminowo obiekt, ponieważ próbuje uczynić czytanie jedną z sześciu umiejętności w jednym, zunifikowanym modelu, a jeśli to zadziała, zmieni to znaczenie „modelu widzenia”. Obserwuj jego puste repozytorium na Hugging Face tak, jak ogląda się odliczanie do startu: w dniu, w którym pojawią się pliki safetensors, obietnica stanie się modelem, a porównanie stanie się prawdziwe. Do tego czasu nie pozwól, aby deklarowany przez producenta wynik 86,52 w benchmarku wykresów przeważył nad dostępnym do pobrania wynikiem 0,808 przy podejmowaniu decyzji.

© 2026 OrcaRouter

Dla dostawców

Prowadzisz platformę inferencyjną? Udostępnij swoje modele w OrcaRouter.

providers@orcarouter.ai

Dołącz do społeczności

Discordsupport@orcarouter.aiXGitHubYouTube