Wygenerowana karta tytułowa w firmowym stylu OrcaRouter z napisem „PixelUMM kontra North Micro Vision Instruct”, z czterema kafelkami statystyk: „2.4B” (całkowita liczba parametrów North Micro Vision Instruct), „~180k” (jego pobrania z Hugging Face do początku października), „0.921 / 90.42” (jego DocVQA jako ułamek dokładności w porównaniu z procentem PixelUMM) oraz „Apache-2.0” (jego licencja na kod i wagi, w porównaniu z niekomercyjnym checkpointem PixelUMM). W stopce widnieje „Dane zgłoszone przez dostawcę; brak niezależnego ponownego uruchomienia któregokolwiek z modeli.”. Logo OrcaRouter jest wkomponowane w pasek z paddingiem w prawym dolnym rogu.
Guides & Insights

PixelUMM vs North Micro Vision Instruct: niekomercyjny model badawczy kontra czytnik 2,4B, który możesz wdrożyć

Autor

Alistair Wren

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Ustaw North Micro Vision Instruct i PixelUMM obok siebie, a różnica rozmiarów jest niemal rozpraszająca: 2,4 miliarda parametrów dla czytnika Cohere o natywnej rozdzielczości w porównaniu z 15,2 miliarda parametrów dla ujednoliconego modelu NVIDIA. Ciekawą osią jest enkoder. North Micro Vision Instruct zbudowano w konwencjonalny sposób — 400-milionowy enkoder wizyjny inicjalizowany z SigLIP 2 SO400M, zasilający 2-miliardowy model językowy, wyposażony w słownik 262 144 tokenów i wydany na licencji Apache-2.0. PixelUMM opiera się na założeniu, że właśnie ten układ jest wąskim gardłem, i usuwa enkoder: surowe fragmenty pikseli o wymiarach 16×16 trafiają do szkieletu Qwen3-8B przez jednowarstwowe projekcje liniowe, a te same wagi generują wideo, a także odpowiadają na pytania o nie. Jeden to specjalistyczne urządzenie do czytania, które możesz dziś pobrać i wdrożyć. Drugi to teza badawcza z linkiem do pobrania i licencją, która nie pozwala wykorzystać go w produktach.

Liczby podane poniżej dla obu modeli pochodzą z ich własnych laboratoriów. Żadna z nich nie została niezależnie odtworzona, a oba podmioty publikują różne zestawy benchmarków, więc część wspólna jest węższa, niż się wydaje.

Argument za nudną architekturą

North Micro Vision Instruct został opublikowany na Hugging Face 10 sierpnia 2026 r., miał osiem tygodni na gromadzenie użytkowników, a na początku października miał około 180 000 pobrań i 150 polubień — o rząd wielkości więcej uwagi niż liczące kilka dni repozytorium PixelUMM. Jego argumentacja jest konkretna i nieefektowna: większość modeli wizyjnych zmniejsza obraz do stałej siatki i traci drobne szczegóły, na których opierają się dokumenty, więc ten przetwarza obrazy w natywnej rozdzielczości, zachowując proporcje i mały tekst.

• Parametry — łącznie 2,4 mld: model językowy 2 mld plus 400-milionowy enkoder wizyjny wytrenowany specjalnie na bazie SigLIP 2 SO400M.

• Kontekst — szkielet językowy o oknie 128K tokenów, ale zwalidowany multimodalny zakres działania wynosi około 8K tokenów. Karta wprost stwierdza, że dłuższe konteksty multimodalne opierają się na ekstrapolacji i nie zostały poddane benchmarkom.

• Wejścia i wyjścia — przeplatany tekst i obrazy na wejściu, tekst na wyjściu. Wielojęzyczny — ponad jedenaście języków. Żadnego generowania jakiegokolwiek rodzaju.

• Zgłoszone wyniki — DocVQA 0.921, ChartQA 0.808, OCRBench 0.792, wszystkie zgłoszone przez Cohere i nieodtworzone. MMMU 0.329, czego karta nie ukrywa: to specjalista od czytania, a nie generalista od rozumowania.

• Wdrożenie — Transformers 5.16.0 i akcelerator, pojedynczy nowoczesny GPU dla modelu 2,4B w bfloat16; Flash Attention 2 opcjonalne, a nie wymagane.

Nic w tym projekcie nie jest nowatorskie. To także powód, dla którego można go pobrać, dostroić i postawić przed prawdziwymi dokumentami w tym tygodniu.

A headless-browser capture of the Hugging Face model card for the North Micro Vision Instruct repository, showing the model title, the Apache-2.0 licence tag, and the repository's download and like counters.

Argumenty przeciwko temu, przedstawione przez drugą stronę

Preprint PixelUMM zaczyna się od nazwania kosztu tej architektury. Zamrożony transformer wizyjny wstępnie wytrenowany na danych internetowych dostarcza cechy semantyczne do rozumienia; osobny VAE dostarcza reprezentacje latentne zorientowane na rekonstrukcję na potrzeby generowania; utrzymywanie obu tych elementów w przybliżeniu podwaja kontekst wizualny przypadający na obraz warunkujący i wymusza przebudowę potoków wstępnego trenowania wizja-język wokół drugiego strumienia. North Micro Vision Instruct unika tego podwojenia jedynie poprzez całkowitą rezygnację z drugiego zadania — nie generuje, więc potrzebuje jednego interfejsu, a nie dwóch.

PixelUMM doprowadza ten argument do końca. Żadnego enkodera, żadnego VAE, żadnego tokenizera: 16×16 fragmenty pikseli dla obrazów, 4-klatkowe czasoprzestrzenne tubelety dla wideo, oba docierające do Transformera tylko z dekoderem poprzez jednowarstwowe rzutowania liniowe, z rozumieniem przez autoregresyjny tekst i generowaniem przez dopasowywanie przepływu w przestrzeni pikseli. Jego osiem empirycznych sekcji to studia nad wyborami projektowymi, a nie zwycięstwa rankingowe — rozmiar fragmentu, artefakty fragmentów, dynamika trenowania w przestrzeni pikseli versus w przestrzeni VAE, skalowanie obliczeń — czyli artykuł pytający, czy paradygmat się utrzymuje, a nie taki, który twierdzi, że już zwyciężył.

• Ścieżka wizualna — North Micro Vision Instruct: wstępnie wytrenowany enkoder wizyjny 400M w natywnej rozdzielczości. PixelUMM: brak enkodera; surowe patche przepuszczane przez projekcję liniową.

• Co potrafi — North Micro Vision Instruct: odczytuje obrazy i dokumenty, odpowiada w formie tekstu, lokalizuje i opisuje. PixelUMM: odczytuje obrazy i wideo oraz generuje obrazy i 4-sekundowe wideo na podstawie tekstu.

• Skala — 2,4 mld parametrów gęstych w porównaniu z około 15,2 mld całkowitych na szkielecie Qwen3-8B, przedstawianych jako „8B MoT” w tabelach samej pracy.

• Licencja — Apache-2.0 na kod i wagi w porównaniu z Apache-2.0 na kod z licencją NVIDIA One-Way Noncommercial License na checkpointcie.

A generated scoreboard card titled “PixelUMM vs North Micro Vision Instruct — the scoreboard”, with the two model names as column headings and six dimension rows spanning both columns: parameters, visual path, inputs and outputs, DocVQA, MMMU and licence. North Micro Vision Instruct's column shows 2.4B total, a 400M SigLIP 2 SO400M vision encoder at native resolution, interleaved text and images in with text out, DocVQA 0.921, MMMU 0.329 and Apache-2.0; PixelUMM's column shows about 15.2B total, no encoder with raw patches through a linear projection, image and video reading plus image and video generation, DocVQA 90.42, MMMU 41.67 and a noncommercial checkpoint licence. A footer notes that the figures are vendor-reported with no independent rerun.

Uczciwe czytanie dwóch tablic wyników

Obydwa modele publikują różne benchmarki, a tam, gdzie się pokrywają, skale się różnią.

• DocVQA — North Micro Vision Instruct 0,921 jako ułamek dokładności. PixelUMM 90,42 jako wartość procentowa. Ta sama nazwa benchmarku, inne podziały i konfiguracje promptów, a tylko jeden z tych dwóch jako powód podaje obsługę natywnej rozdzielczości.

• ChartQA — North Micro Vision Instruct 0.808. PixelUMM 82.96. Znów mniej więcej ten sam przedział, gdy przestaniesz porównywać surowe ciągi.

• OCRBench — North Micro Vision Instruct 0,792. PixelUMM 78,00.

• MMMU — North Micro Vision Instruct 0,329, PixelUMM 41,67. Oba wyniki są niskie jak na standardy dużych modeli wizyjno-językowych, a oba laboratoria podają je bez upiększania.

• tylko PixelUMM — MVBench 70,53, Video-MME 57,33, LongVideoBench 59,61, GenEval 0,83 z przepisywaczem promptów, VBench część 1, jakość 84,10.

• North Micro Vision Instruct-only — zadania z zakresu groundingu, opisywania obrazów i pracy z wieloma obrazami; udokumentowany brak wywoływania narzędzi i wyraźnie żadnych zachowań agentowych.

Uderzające w tym nakładaniu się jest to, jak blisko 2,4B specjalista plasuje się obok 15,2B generalisty w czytaniu dokumentów i wykresów. To nie jest dowód, że podejście bez enkodera zawodzi — to dowód, że czytanie dokumentów to zadanie, w którym kompaktowy enkoder o natywnej rozdzielczości jest bardzo dobrze dopasowany, a architektura PixelUMM celuje w inny argument. Sam artykuł PixelUMM przyznaje rację w zdaniu wartym zacytowania: ponieważ dane treningowe różnią się między modelami, jego wyniki „nie mogą ustalić, która architektura jest lepsza”.

Gdzie tak naprawdę zapada decyzja

Jeśli masz dokumenty, wykresy, formularze lub zrzuty ekranu i potrzebujesz odpowiedzi w tym miesiącu, North Micro Vision Instruct jest praktycznym wyborem i nie ma tu nawet porównania: Apache-2.0, 2,4B, standardowa ścieżka ładowania Transformers, brak środowiska z guardrailami, brak indeksu rozproszonych punktów kontrolnych, brak drugiego stosu Pythona. Dostrój go do własnego rozkładu dokumentów i masz specjalistę. Zastrzeżenie dotyczy zakresu — skieruj go na zadanie rozumowania, a wynik MMMU cię dopadnie.

Oferta PixelUMM to szeroki zakres możliwości i pytanie badawcze. Odczytuje i generuje obrazy oraz wideo z jednego zestawu wag, a przy tym jest zdecydowanie ciekawszą lekturą. Ale jego checkpoint jest objęty licencją niekomercyjną, jego wagi to 128 fragmentów rozproszonego checkpointu za ukrytym indeksem metadanych o łącznym rozmiarze około 30 GB, wymaga zestawu narzędzi CUDA 13 z FlashAttention skompilowanym ze źródeł, a jego ścieżka tekst-na-wideo uruchamia zabezpieczenia Cosmos, które wymagają repozytorium z ograniczonym dostępem i osobnego środowiska. To stanowisko laboratoryjne, a nie wdrożenie.

Aspekt routingu pojawia się później, jeśli w ogóle się pojawi. Żaden z tych modeli nie jest dziś dostępny za pośrednictwem żadnego hostowanego API — OrcaRouter nie trasuje żadnego z nich — i żaden nie będzie, dopóki nie pozwoli na to ich licencjonowanie. Gdy model taki jak North Micro Vision Instruct rzeczywiście pojawi się za wspólnym endpointem, powód, by preferować to zamiast bezpośredniej integracji, jest zwykły: jeden klucz obsługujący ponad 200 modeli, ceny katalogowe dostawców przekazywane dalej przy 0% marży, przełączanie awaryjne, które obniża pozycję modelu osiągającego gorsze wyniki, niż deklaruje jego karta, oraz brak drugiej umowy do negocjowania, gdy chcesz przeprowadzić test A/B zamiennika. To opis przepływu pracy, a nie twierdzenie o dostępności.

Jedyny test, który by ich rozdzielił

Uruchom oba na tym samym zestawie dokumentów przy tej samej rozdzielczości i oceń przypadki drobnego tekstu, a następnie zmień jedną zmienną: usuń koder wizji z porównania, podając PixelUMM jego dane wejściowe w natywnej rozdzielczości. Jeśli model bez kodera radzi sobie z gęstym tekstem przy ułamku kosztu parametrów, to najsilniejszy możliwy dowód tezy — i test, który może przeprowadzić każdy, kto ma wolną kartę, ponieważ oba checkpointy można pobrać. Dopóki ktoś tego nie zrobi, praktyczne podsumowanie pozostaje w mocy: mały czytnik Apache-2.0 to ten, który wdrażasz, a duży niekomercyjny generalista to ten, który badasz.