
PixelUMM vs North Micro Vision Instruct: niekomercyjny model badawczy kontra czytnik 2,4B, który możesz wdrożyć
- openaiNOWOŚĆOpenAI: GPT-6.1 Sol2026-09-2952Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Sonnet 5.52026-09-2856Inteligencja
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 223 tok/s
- OpenAINOWOŚĆOpenAI: GPT-6 Luna2026-09-2238Inteligencja
- OpenAINOWOŚĆOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- AnthropicNOWOŚĆAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- xAINOWOŚĆGrok 4.72026-09-2146Inteligencja
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 za 1 mln tokenów · 124 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 za 1 mln tokenów · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
Ustaw North Micro Vision Instruct i PixelUMM obok siebie, a różnica rozmiarów jest niemal rozpraszająca: 2,4 miliarda parametrów dla czytnika Cohere o natywnej rozdzielczości w porównaniu z 15,2 miliarda parametrów dla ujednoliconego modelu NVIDIA. Ciekawą osią jest enkoder. North Micro Vision Instruct zbudowano w konwencjonalny sposób — 400-milionowy enkoder wizyjny inicjalizowany z SigLIP 2 SO400M, zasilający 2-miliardowy model językowy, wyposażony w słownik 262 144 tokenów i wydany na licencji Apache-2.0. PixelUMM opiera się na założeniu, że właśnie ten układ jest wąskim gardłem, i usuwa enkoder: surowe fragmenty pikseli o wymiarach 16×16 trafiają do szkieletu Qwen3-8B przez jednowarstwowe projekcje liniowe, a te same wagi generują wideo, a także odpowiadają na pytania o nie. Jeden to specjalistyczne urządzenie do czytania, które możesz dziś pobrać i wdrożyć. Drugi to teza badawcza z linkiem do pobrania i licencją, która nie pozwala wykorzystać go w produktach.
Liczby podane poniżej dla obu modeli pochodzą z ich własnych laboratoriów. Żadna z nich nie została niezależnie odtworzona, a oba podmioty publikują różne zestawy benchmarków, więc część wspólna jest węższa, niż się wydaje.
Argument za nudną architekturą
North Micro Vision Instruct został opublikowany na Hugging Face 10 sierpnia 2026 r., miał osiem tygodni na gromadzenie użytkowników, a na początku października miał około 180 000 pobrań i 150 polubień — o rząd wielkości więcej uwagi niż liczące kilka dni repozytorium PixelUMM. Jego argumentacja jest konkretna i nieefektowna: większość modeli wizyjnych zmniejsza obraz do stałej siatki i traci drobne szczegóły, na których opierają się dokumenty, więc ten przetwarza obrazy w natywnej rozdzielczości, zachowując proporcje i mały tekst.
• Parametry — łącznie 2,4 mld: model językowy 2 mld plus 400-milionowy enkoder wizyjny wytrenowany specjalnie na bazie SigLIP 2 SO400M.
• Kontekst — szkielet językowy o oknie 128K tokenów, ale zwalidowany multimodalny zakres działania wynosi około 8K tokenów. Karta wprost stwierdza, że dłuższe konteksty multimodalne opierają się na ekstrapolacji i nie zostały poddane benchmarkom.
• Wejścia i wyjścia — przeplatany tekst i obrazy na wejściu, tekst na wyjściu. Wielojęzyczny — ponad jedenaście języków. Żadnego generowania jakiegokolwiek rodzaju.
• Zgłoszone wyniki — DocVQA 0.921, ChartQA 0.808, OCRBench 0.792, wszystkie zgłoszone przez Cohere i nieodtworzone. MMMU 0.329, czego karta nie ukrywa: to specjalista od czytania, a nie generalista od rozumowania.
• Wdrożenie — Transformers 5.16.0 i akcelerator, pojedynczy nowoczesny GPU dla modelu 2,4B w bfloat16; Flash Attention 2 opcjonalne, a nie wymagane.
Nic w tym projekcie nie jest nowatorskie. To także powód, dla którego można go pobrać, dostroić i postawić przed prawdziwymi dokumentami w tym tygodniu.

Argumenty przeciwko temu, przedstawione przez drugą stronę
Preprint PixelUMM zaczyna się od nazwania kosztu tej architektury. Zamrożony transformer wizyjny wstępnie wytrenowany na danych internetowych dostarcza cechy semantyczne do rozumienia; osobny VAE dostarcza reprezentacje latentne zorientowane na rekonstrukcję na potrzeby generowania; utrzymywanie obu tych elementów w przybliżeniu podwaja kontekst wizualny przypadający na obraz warunkujący i wymusza przebudowę potoków wstępnego trenowania wizja-język wokół drugiego strumienia. North Micro Vision Instruct unika tego podwojenia jedynie poprzez całkowitą rezygnację z drugiego zadania — nie generuje, więc potrzebuje jednego interfejsu, a nie dwóch.
PixelUMM doprowadza ten argument do końca. Żadnego enkodera, żadnego VAE, żadnego tokenizera: 16×16 fragmenty pikseli dla obrazów, 4-klatkowe czasoprzestrzenne tubelety dla wideo, oba docierające do Transformera tylko z dekoderem poprzez jednowarstwowe rzutowania liniowe, z rozumieniem przez autoregresyjny tekst i generowaniem przez dopasowywanie przepływu w przestrzeni pikseli. Jego osiem empirycznych sekcji to studia nad wyborami projektowymi, a nie zwycięstwa rankingowe — rozmiar fragmentu, artefakty fragmentów, dynamika trenowania w przestrzeni pikseli versus w przestrzeni VAE, skalowanie obliczeń — czyli artykuł pytający, czy paradygmat się utrzymuje, a nie taki, który twierdzi, że już zwyciężył.
• Ścieżka wizualna — North Micro Vision Instruct: wstępnie wytrenowany enkoder wizyjny 400M w natywnej rozdzielczości. PixelUMM: brak enkodera; surowe patche przepuszczane przez projekcję liniową.
• Co potrafi — North Micro Vision Instruct: odczytuje obrazy i dokumenty, odpowiada w formie tekstu, lokalizuje i opisuje. PixelUMM: odczytuje obrazy i wideo oraz generuje obrazy i 4-sekundowe wideo na podstawie tekstu.
• Skala — 2,4 mld parametrów gęstych w porównaniu z około 15,2 mld całkowitych na szkielecie Qwen3-8B, przedstawianych jako „8B MoT” w tabelach samej pracy.
• Licencja — Apache-2.0 na kod i wagi w porównaniu z Apache-2.0 na kod z licencją NVIDIA One-Way Noncommercial License na checkpointcie.

Uczciwe czytanie dwóch tablic wyników
Obydwa modele publikują różne benchmarki, a tam, gdzie się pokrywają, skale się różnią.
• DocVQA — North Micro Vision Instruct 0,921 jako ułamek dokładności. PixelUMM 90,42 jako wartość procentowa. Ta sama nazwa benchmarku, inne podziały i konfiguracje promptów, a tylko jeden z tych dwóch jako powód podaje obsługę natywnej rozdzielczości.
• ChartQA — North Micro Vision Instruct 0.808. PixelUMM 82.96. Znów mniej więcej ten sam przedział, gdy przestaniesz porównywać surowe ciągi.
• OCRBench — North Micro Vision Instruct 0,792. PixelUMM 78,00.
• MMMU — North Micro Vision Instruct 0,329, PixelUMM 41,67. Oba wyniki są niskie jak na standardy dużych modeli wizyjno-językowych, a oba laboratoria podają je bez upiększania.
• tylko PixelUMM — MVBench 70,53, Video-MME 57,33, LongVideoBench 59,61, GenEval 0,83 z przepisywaczem promptów, VBench część 1, jakość 84,10.
• North Micro Vision Instruct-only — zadania z zakresu groundingu, opisywania obrazów i pracy z wieloma obrazami; udokumentowany brak wywoływania narzędzi i wyraźnie żadnych zachowań agentowych.
Uderzające w tym nakładaniu się jest to, jak blisko 2,4B specjalista plasuje się obok 15,2B generalisty w czytaniu dokumentów i wykresów. To nie jest dowód, że podejście bez enkodera zawodzi — to dowód, że czytanie dokumentów to zadanie, w którym kompaktowy enkoder o natywnej rozdzielczości jest bardzo dobrze dopasowany, a architektura PixelUMM celuje w inny argument. Sam artykuł PixelUMM przyznaje rację w zdaniu wartym zacytowania: ponieważ dane treningowe różnią się między modelami, jego wyniki „nie mogą ustalić, która architektura jest lepsza”.
Gdzie tak naprawdę zapada decyzja
Jeśli masz dokumenty, wykresy, formularze lub zrzuty ekranu i potrzebujesz odpowiedzi w tym miesiącu, North Micro Vision Instruct jest praktycznym wyborem i nie ma tu nawet porównania: Apache-2.0, 2,4B, standardowa ścieżka ładowania Transformers, brak środowiska z guardrailami, brak indeksu rozproszonych punktów kontrolnych, brak drugiego stosu Pythona. Dostrój go do własnego rozkładu dokumentów i masz specjalistę. Zastrzeżenie dotyczy zakresu — skieruj go na zadanie rozumowania, a wynik MMMU cię dopadnie.
Oferta PixelUMM to szeroki zakres możliwości i pytanie badawcze. Odczytuje i generuje obrazy oraz wideo z jednego zestawu wag, a przy tym jest zdecydowanie ciekawszą lekturą. Ale jego checkpoint jest objęty licencją niekomercyjną, jego wagi to 128 fragmentów rozproszonego checkpointu za ukrytym indeksem metadanych o łącznym rozmiarze około 30 GB, wymaga zestawu narzędzi CUDA 13 z FlashAttention skompilowanym ze źródeł, a jego ścieżka tekst-na-wideo uruchamia zabezpieczenia Cosmos, które wymagają repozytorium z ograniczonym dostępem i osobnego środowiska. To stanowisko laboratoryjne, a nie wdrożenie.
Aspekt routingu pojawia się później, jeśli w ogóle się pojawi. Żaden z tych modeli nie jest dziś dostępny za pośrednictwem żadnego hostowanego API — OrcaRouter nie trasuje żadnego z nich — i żaden nie będzie, dopóki nie pozwoli na to ich licencjonowanie. Gdy model taki jak North Micro Vision Instruct rzeczywiście pojawi się za wspólnym endpointem, powód, by preferować to zamiast bezpośredniej integracji, jest zwykły: jeden klucz obsługujący ponad 200 modeli, ceny katalogowe dostawców przekazywane dalej przy 0% marży, przełączanie awaryjne, które obniża pozycję modelu osiągającego gorsze wyniki, niż deklaruje jego karta, oraz brak drugiej umowy do negocjowania, gdy chcesz przeprowadzić test A/B zamiennika. To opis przepływu pracy, a nie twierdzenie o dostępności.
Jedyny test, który by ich rozdzielił
Uruchom oba na tym samym zestawie dokumentów przy tej samej rozdzielczości i oceń przypadki drobnego tekstu, a następnie zmień jedną zmienną: usuń koder wizji z porównania, podając PixelUMM jego dane wejściowe w natywnej rozdzielczości. Jeśli model bez kodera radzi sobie z gęstym tekstem przy ułamku kosztu parametrów, to najsilniejszy możliwy dowód tezy — i test, który może przeprowadzić każdy, kto ma wolną kartę, ponieważ oba checkpointy można pobrać. Dopóki ktoś tego nie zrobi, praktyczne podsumowanie pozostaje w mocy: mały czytnik Apache-2.0 to ten, który wdrażasz, a duży niekomercyjny generalista to ten, który badasz.
