
InternLumina-U2 kontra North Micro Vision Instruct: Czytnik dokumentów, który możesz uruchomić już dziś, kontra model 16B, którego jeszcze nie ma
- AlibabaNOWOŚĆQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiNOWOŚĆZ.ai: GLM 5.3 Flash2026-08-2658Inteligencja72Kod
- DeepSeekNOWOŚĆDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 za 1 mln tokenów
- z-aiZ.ai: GLM 5.32026-08-1860Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1552Inteligencja68Kod
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1261Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0557Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligencja72Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligencja78Kod
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligencja69Kod
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligencja49Kod
- metaMeta: Muse Spark 1.12026-07-1653Inteligencja71Kod
- kimiMoonshotAI: Kimi K32026-07-1560Inteligencja76Kod
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligencja71Kod
Jeśli w tym tygodniu potrzebujesz modelu, który czyta dokumenty, zrzuty ekranu i wykresy, to porównanie ma krótką praktyczną odpowiedź: North Micro Vision Instruct to model o otwartych wagach liczący 2,4 miliarda parametrów od Cohere, wydany na licencji Apache-2.0, do pobrania od 10 sierpnia 2026 roku, i wystarczająco dobry w zadaniach dokumentowych, aby warto było już dziś skierować go na własne pliki. InternLumina-U2 to model dyfuzyjny o 16 miliardach parametrów od Shanghai AI Laboratory – znacznie bardziej ambitny projekt, który również twierdzi, że rozumie wykresy i dokumenty, pośród kilku innych zadań – ale jego wagi nie są publiczne, jego repozytorium na Hugging Face to pusty placeholder i nikt nigdzie nie może go jeszcze uruchomić. Dłuższa odpowiedź dotyczy tego, co się dzieje, gdy dwa modele na licencji Apache-2.0 wysuwają podobne roszczenia dotyczące czytania, ale tylko jeden z nich jest czymś, co można wziąć do ręki.
Ten 2.4B, który faktycznie istnieje
North Micro Vision Instruct jest specjalistą od wizji w rodzinie North firmy Cohere: to model o łącznie około 2,4 mld parametrów, kompaktowy i zaprojektowany do odczytu w natywnej rozdzielczości. Zamysł projektu jest taki, że większość modeli wizyjnych zmniejsza obrazy do stałej siatki i traci drobne szczegóły, od których zależą dokumenty — dlatego North Micro Vision Instruct przyjmuje obrazy w ich natywnej rozdzielczości, aż do około strony A4 przy 200 dpi, zachowując proporcje i mały tekst. Raportowane przez Cohere wyniki są solidne jak na tę klasę wielkości: DocVQA 0,921, ChartQA 0,808, OCRBench 0,792 — wszystko raportowane przez Cohere i niezweryfikowane niezależnie, ze zwalidowanym kontekstem multimodalnym rzędu 8 tys. tokenów i udokumentowanym słabym punktem w MMMU (0,329). To przypomnienie, że jest to specjalista od odczytu, a nie ogólny model rozumowania. Nie ma on własnego hostowanego API ani standardowej ścieżki hostingu; praktycznie oznacza to samodzielne hostowanie modelu 2,4 mld, który jest na tyle mały, że można go uruchomić na pojedynczym nowoczesnym GPU w stacji roboczej. Adopcja w społeczności utrzymuje się na stałym poziomie — pod koniec sierpnia karta Hugging Face pokazywała dziesiątki tysięcy pobrań miesięcznie.
To 16B, które jest obietnicą
InternLumina-U2 to inny rodzaj artefaktu. To, co Shanghai AI Laboratory opublikowało 1 września 2026 r., to kod inferencyjny i architektura, a nie model: rzadki model dyfuzyjny LLM oparty na mieszaninie ekspertów, z 16B parametrów łącznie i 1B aktywnych, zbudowany wokół w pełni dyskretnej reprezentacji wizualnej z ośmioma księgami kodowymi. Wśród sześciu rodzin zadań objętych skryptem sterującym repozytorium — tekst, rozumienie obrazu, tekst-na-obraz, edycja obrazu, rozumienie wideo, rozumienie 3D — rozumienie obrazu wyraźnie obejmuje gęste wykresy i dokumenty. Wstępna tabela na stronie projektu zawiera wyniki dla wykresów i dokumentów, które laboratorium podaje w tym samym przedziale, który deklaruje specjalista: ChartQA 86.52, CharXiv-DQ 83.65, obok HallusionBench 62.15 i MathVision 33.22. Strona nazywa wyniki „wstępnymi, częściowymi”, raport techniczny, który miałby zawierać pełne tabele, oznaczony jest jako „wkrótce”, a — co decydujące — nie ma wag, które pozwoliłyby komukolwiek to sprawdzić.
Tablica wyników
Wszystkie poniższe wyniki są raportowane przez dostawców. Wyniki North Micro Vision Instruct to własna ewaluacja Cohere; wyniki InternLumina-U2 to wstępna, częściowa tabela laboratorium.
• Rozmiar i architektura — North Micro Vision Instruct: gęsty model o ~2,4B parametrów, czytający w natywnej rozdzielczości. InternLumina-U2: rzadki model MoE (16B łącznie / 1B aktywnych), dyskretny model dyfuzyjny z wieloma codebookami.
• Co robi — North Micro Vision Instruct: czyta obrazy, dokumenty, wykresy i ekrany UI; odpowiada tekstem z odniesieniami do źródeł. InternLumina-U2: deklaruje czytanie i generowanie — rozumie obrazy/wideo/3D, generuje i edytuje obrazy.
• Wagi — North Micro Vision Instruct: publiczne od 10 sierpnia 2026 r. (CohereLabs/North-Micro-Vision-Instruct, Apache-2.0). InternLumina-U2: niepubliczne; stub na Hugging Face pusty, wagi oznaczone jako „wkrótce”.
• Najważniejsze wyniki testów — North Micro Vision Instruct: DocVQA 0.921, ChartQA 0.808, OCRBench 0.792 (raportowane przez Cohere). InternLumina-U2: ChartQA 86.52, CharXiv-DQ 83.65, HallusionBench 62.15 (raportowane przez laboratorium, dane wstępne).
• Kontekst dokumentu — North Micro Vision Instruct: natywna rozdzielczość do ~A4 przy 200 dpi, ~8K zwalidowany kontekst multimodalny. InternLumina-U2: gęste wykresy i naturalne obrazy obsługiwane przez enkoder AToken z wieloma słownikami kodowymi; kontekst nie został jeszcze określony.
• Znane słabości — North Micro Vision Instruct: MMMU 0,329, brak wywoływania narzędzi — to czytnik, a nie rozumujący ani agent. InternLumina-U2: w teście GenEval ustępuje co najmniej jednemu wymienionemu z nazwy rywalowi (0,81 wobec 0,89) we własnej częściowej tabeli; wszystko niezweryfikowane.
• Jak to uruchamiasz — North Micro Vision Instruct: samodzielny hosting modelu 2.4B; wsparcie vLLM wciąż było wdrażane, gdy to pisano. InternLumina-U2: nikt nie może go uruchomić — brak wag, a wydany sterownik wymaga katalogu punktów kontrolnych i plików tokenizera, których nie ma w repozytorium.

Ten sam benchmark, dwie bardzo różne epistemologie.
ChartQA to najczystszy sposób, aby zobaczyć różnicę między tymi dwoma twierdzeniami. Oba modele podają liczbę ChartQA; North Micro Vision Instruct raportuje 0,808 jako ułamek dokładności, a InternLumina-U2 raportuje 86,52 jako procent — ten sam benchmark, w zasadzie ten sam wynik w paśmie od górnych 80 do środkowych 80 na różnych skalach, z grubsza rzecz biorąc, z zastrzeżeniem różnych podziałów ewaluacyjnych i konfiguracji promptów, które sprawiają, że porównania ChartQA między artykułami są zdradliwe nawet wtedy, gdy oba modele istnieją. {{1}}Kluczowa jest różnica epistemiczna: wynik 0,808 modelu North Micro Vision Instruct jest powiązany z artefaktem do pobrania, więc każdy zespół z GPU i zestawem wykresów może go odtworzyć lub obalić w tym tygodniu.{{/1}} Wynik 86,52 modelu InternLumina-U2 jest powiązany z mapą drogową. {{2}}Liczba, której nie można sprawdzić, to liczba, na której nie należy budować — i to dokładnie to stanowisko, które samo laboratorium przyznaje, oznaczając swoją tabelę jako wstępną.{{/2}}

Karta Hugging Face CohereLabs/North-Micro-Vision-Instruct, zarejestrowana 27 sierpnia 2026 r. — opis modelu wizyjno-językowego o natywnej rozdzielczości 2,4B, licencja Apache-2.0 oraz podane przez Cohere wyniki testów czytania dokumentów.
Czytanie a czytanie i rysowanie
Różnica w filozofii architektury jest cenniejsza niż różnica w benchmarkach. North Micro Vision Instruct to wąski specjalista: czyta i robi to na tyle tanio, że można go uruchomić na każdej stronie, każdym zrzucie ekranu i każdej fakturze w potoku przetwarzania, nie patrząc na rachunek za GPU. Ta taniość to kluczowa cecha — inteligencja dokumentów na dużą skalę to problem kosztów w równym stopniu co problem dokładności. InternLumina-U2 to zakład w przeciwną stronę: ogromny rzadki model, który próbuje połączyć czytanie z generowaniem obrazów, edycją obrazów, rozumieniem wideo i rozumieniem 3D w jeden wspólny interfejs dyskretnych tokenów, w oparciu o teorię, że rozumienie i generowanie wzajemnie się wzmacniają. Jeśli zadziała, będzie to narzędzie innej klasy — ale „jeśli zadziała” to bardzo duże „jeśli”, a dyfuzyjny MoE 16B-A1B z niestandardowym tokenizerem i preprocesingiem 3D renderowanym w Blenderze nigdy nie będzie tanim, zawsze włączonym czytnikiem, jakim jest specjalista 2.4B. To nie są tak naprawdę substytuty. Jedno to narzędzie, które możesz wdrożyć dziś, a drugie to kierunek badań, na który możesz się przygotować.

Repozytorium GitHub InternLM/InternLumina-U2, zarchiwizowane 2 września 2026 r. — strona główna repozytorium z opisem „Omni-Visual Understanding, Image Generation and Editing” oraz skryptami wnioskowania dla poszczególnych zadań; wśród nich ścieżka rozumienia obrazów jest ukierunkowana na naturalne obrazy i gęste wykresy.
Co to oznacza, jeśli budujesz potok dokumentów.
Żaden z tych modeli nie jest hostowany na OrcaRouter — North Micro Vision Instruct to model do samodzielnego hostowania, bez hostowanego API, a InternLumina-U2 nie ma wag, które można by hostować — więc w kwestii routingu nie chodzi o to, by „wywołać oba przez jeden klucz już dziś”. To wzorzec, z którego skorzystasz w dniu, gdy którykolwiek z nich się zmieni: potok dokumentów prawie zawsze łączy niedrogi czytnik z większym modelem rozumującym, a wartość warstwy routingu polega na ujęciu tego połączenia jako jednego wywołania i uczciwym przekazywaniu kosztów bez marży (0%) na hostowanych modelach, z których faktycznie korzystasz. Gdy w końcu pojawi się punkt kontrolny na licencji Apache-2.0, taki jak InternLumina-U2, rozsądnym posunięciem nie jest wyrywanie działającego systemu do przetwarzania dokumentów — lecz umieszczenie nowego modelu na ścieżce testowej z automatycznym przełączaniem awaryjnym, aby zasłużył na ruch produkcyjny, przetrwawszy go, a w chwili, gdy zawiedzie na prawdziwym wykresie, wywołanie wraca do modelu, który już się sprawdził. Jedno API obejmujące ponad 200 modeli to mechanizm; przełączanie awaryjne to siatka bezpieczeństwa; wyspecjalizowany model, który możesz uruchomić już dziś, płaci rachunki, dopóki obietnica 16B wciąż jest dotrzymywana.
Werdykt
Jeśli chodzi o czytanie dokumentów i wykresów tu i teraz, North Micro Vision Instruct jest jedynym z tych dwóch, który jest w praktyce używalny — mały, na licencji Apache-2.0, do pobrania, z wynikami deklarowanymi przez producenta, które naprawdę możesz sprawdzić. InternLumina-U2 to bardziej interesujący długoterminowo obiekt, ponieważ próbuje uczynić czytanie jedną z sześciu umiejętności w jednym, zunifikowanym modelu, a jeśli to zadziała, zmieni to znaczenie „modelu widzenia”. Obserwuj jego puste repozytorium na Hugging Face tak, jak ogląda się odliczanie do startu: w dniu, w którym pojawią się pliki safetensors, obietnica stanie się modelem, a porównanie stanie się prawdziwe. Do tego czasu nie pozwól, aby deklarowany przez producenta wynik 86,52 w benchmarku wykresów przeważył nad dostępnym do pobrania wynikiem 0,808 przy podejmowaniu decyzji.
