
PixelUMM kontra Microsoft Mage-VL: jeden usuwa tokenizator wizualny, drugi go przepisuje
- openaiNOWOŚĆOpenAI: GPT-6.1 Sol2026-09-2952Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Sonnet 5.52026-09-2856Inteligencja
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 223 tok/s
- OpenAINOWOŚĆOpenAI: GPT-6 Luna2026-09-2238Inteligencja
- OpenAINOWOŚĆOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- AnthropicNOWOŚĆAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- xAINOWOŚĆGrok 4.72026-09-2146Inteligencja
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 za 1 mln tokenów · 124 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 za 1 mln tokenów · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
Oba PixelUMM i Microsoft Mage-VL zostały zbudowane przez zespoły przekonane, że sposób, w jaki wizja jest zamieniana na tokeny, jest niewłaściwym wąskim gardłem — i naprawiły to w przeciwnych kierunkach. Mage-VL, natywny dla kodeka model strumieniowy Microsoftu, zachowuje tokenizator i czyni go znacznie bardziej agresywnym: podąża za strukturą nowoczesnych kodeków wideo, zachowuje każdą klatkę kluczową i tylko te fragmenty klatek predykcyjnych, w których kodek zużywa bity, i donosi o zmniejszeniu liczby tokenów wizualnych o ponad 75%, jednocześnie zyskując do 3,5× przyspieszenia w czasie rzeczywistym w porównaniu z jednolitym próbkowaniem klatek. PixelUMM, zunifikowany model NVIDIA bez enkodera, całkowicie usuwa tokenizator — każdy fragment 16×16 surowego piksela trafia do szkieletu przez pojedynczą projekcję liniową, bez VAE i bez żadnego transformatora wizyjnego. Jeden kompresuje mocniej. Drugi wcale nie chce kompresować. I tylko jeden z nich potrafi cokolwiek wygenerować.
Ta ostatnia różnica sprawia, że to zestawienie jest ciekawsze niż walka na specyfikacje. Mage-VL to obserwator — strumieniowy model percepcji z proaktywną bramką, która decyduje, kiedy się odezwać. PixelUMM to czytelnik, który również rysuje: te same wagi odpowiadają na pytania o obraz i generują nowe wideo na podstawie opisu tekstowego. To dwie niekompatybilne odpowiedzi na pytanie „jaki powinien być zunifikowany model wizyjny”, a liczby każdego laboratorium są jego własne.
Gdzie następuje kompresja
Założeniem Mage-VL jest współczesny paradoks Moraveca: modele wizyjno-językowe są mocne w trudnym rozumowaniu offline, ale powolne i wymagające dużych nakładów obliczeniowych przy prostej percepcji w czasie rzeczywistym. Jego rozwiązaniem jest dopasowanie do kodeka. Zamiast dekodować strumień do równomiernie próbkowanych klatek i przepuszczać gęstą siatkę przez zamrożony ViT wstępnie wytrenowany na danych z sieci, Mage-VL rozdziela strumień na klatki zakotwiczenia (I) i klatki predykcyjne (P), zachowuje wszystkie patche klatek zakotwiczenia i zachowuje tylko te patche klatek predykcyjnych, które niosą rzeczywisty ruch lub nowy szczegół. Koder Mage-ViT jest trenowany od zera na siatce patchy 16×16 z rotacyjnym kodowaniem pozycji 3D i jest jawnie agnostyczny względem kodeka — ten sam interfejs przyjmuje wektory ruchu i energię resztkową H.264/AVC lub HEVC albo wyuczoną mapę przepływności kodeka neuronowego, bez zmiany architektury ani ponownego trenowania.
Założeniem PixelUMM jest to, że problemem jest sam enkoder, a nie jego wydajność. W swoim artykule argumentuje, że modele takie jak BAGEL mają dwa interfejsy wizualne — ViT do cech semantycznych i VAE do latentów rekonstrukcji — co w przybliżeniu podwaja kontekst wizualny na obraz warunkujący i wymusza przebudowę potoków wstępnego trenowania językowo-wizualnego wokół drugiego strumienia. PixelUMM usuwa oba: obrazy stają się 16×16 przestrzennymi patchami, wideo staje się 4-ramkowymi czasoprzestrzennymi tubeletami, a surowe piksele docierają do Transformera typu decoder-only przez jednowarstwowe projekcje liniowe. Rozumienie odbywa się przez autoregresyjny tekst; generowanie przez flow matching w przestrzeni pikseli.
• Strategia kompresji — Mage-VL: czasowa, pochodząca z kodeka; zachowaj kotwice, przerzedź przewidywane klatki. PixelUMM: brak; zachowaj każdy fragment surowego piksela.
• Co jest trenowane od zera — Mage-VL: cały stos wizualny, na około 100 mln obrazów i filmów bez etykiet. PixelUMM: embedery i dekodery pikseli, na bazie językowego szkieletu Qwen3-8B.
• Szkielet — Mage-VL: Qwen3-4B-Instruct-2507, jedyny wstępnie wytrenowany komponent, za dwuwarstwowym projektorem MLP. PixelUMM: Qwen3-8B, łącznie około 15,2 mld parametrów.
• Zachowanie strumieniowania — Mage-VL: brama poznawcza ocenia każde okno kroczące i pozostaje cicha, dopóki nie zakończy się zdarzenie warte odpowiedzi, wywołując pełny model dopiero wtedy. PixelUMM: brak trybu strumieniowania; żądania są wywołaniami generowania lub rozumienia.

Co robi każdy z nich, a czego nie robi
Mage-VL to pojedynczy checkpoint, który jednocześnie zapewnia rozumienie obrazu i wideo oraz proaktywną bramkę strumieniowania — te same wagi odpowiadają na pytania offline i napędzają komentarze sterowane zdarzeniami. Łączy w sobie procesor kodeka, pakiet neuronowego kodeka oraz bramkę. Drugie wydanie, microsoft/Mage-ViT, to samodzielny enkoder wizualny z etapu wstępnego trenowania od podstaw, oferowany jako gotowy do użycia interfejs wejściowy dla innych treningów multimodalnych. Mage-VL nie generuje. Odczytuje.
PixelUMM obejmuje tekst-na-obraz, tekst-na-wideo przy 96 klatkach i 24 kl./s oraz tekst warunkowany obrazem i wideo. Dostarczany jest z czterema checkpointami — S8-F22-R05 jako domyślny obejmujący wszystkie cztery zadania, S8-F18-R01 dostrojony do lepszego generowania wideo z tekstu przy 480p i 720p, ale niezdolny do rozumienia wideo, oraz dwa etapy pośrednie. Nie obsługuje streamingu, edycji ani 3D. Jeśli potrzebujesz modelu, który obserwuje transmisję na żywo i odzywa się, gdy coś się dzieje, PixelUMM zupełnie nie pasuje do tego zadania, a żadna kolumna w benchmarku ci tego nie powie.
Luka w adopcji to pierwszy uczciwy sygnał.
Te dwa wydania nie są równie dojrzałe, a liczniki pobrań mówią o tym wyraźniej niż jakikolwiek wpis o premierze.
• Mage-VL — opublikowany na Hugging Face 25 lipca 2026 r. na licencji Apache-2.0, wraz z towarzyszącym raportem technicznym i identyfikatorem arXiv. Do początku października odnotowywał około 13 800 pobrań i 414 polubień, a wokół niego rozwinął się niewielki ekosystem prac społeczności.
• PixelUMM — opublikowany na Hugging Face 1 października 2026 r. na niekomercyjnej licencji dotyczącej checkpointu. W chwili pisania tego tekstu liczba jego pobrań wynosiła zero, a liczba polubień — trzy. Ma zaledwie kilka dni.
Wciąż nie ma ogłoszenia z żadnego z laboratoriów dotyczącego odpowiedniego wydania — Mage-VL został wydany w lipcu bez ogłoszenia, a PixelUMM został wydany w październiku bez ogłoszenia. Ta symetria jest prawdziwa, ale błędem byłoby odczytywać ją jako to, że oba są równoważnymi artefaktami. Mage-VL cieszy się uwagą społeczności od dziesięciu tygodni; PixelUMM — od zaledwie kilku dni. Model, którego nikt spoza laboratorium nie uruchomił, to inna sprawa niż model, który pobrało kilka tysięcy osób, a tylko jeden z tych dwóch należy do drugiej kategorii.

Tablica wyników, z proweniencją
Każdy wynik pochodzi od samego laboratorium opracowującego dany model. Mage-VL – z karty i raportu technicznego Microsoftu; PixelUMM – z jego preprintu. Żadne z nich nie zostało niezależnie odtworzone.
• Tokeny wizualne — Mage-VL: zgłoszona redukcja o ponad 75% w porównaniu z gęstym próbkowaniem klatek. PixelUMM: brak redukcji; argument jest taki, że surowe patche usuwają drugie kodowanie, a nie zmniejszają pierwszego.
• Szybkość rzeczywista — Mage-VL: do 3,5× szybciej niż jednorodne próbkowanie klatek przy porównywalnej dokładności, według danych Microsoftu. PixelUMM: w artykule nie podano żadnego porównawczego twierdzenia dotyczącego szybkości.
• Jakość enkodera — Mage-VL: Mage-ViT raportuje 99,33% dla CIFAR-10 i 85,69% dla ImageNet przy budżecie 256 tokenów, na podstawie około 100 mln nieoznaczonych multimediów. PixelUMM: brak równoważnego benchmarku enkodera, ponieważ nie ma enkodera, który można by poddać benchmarkowi.
• Rozumienie wideo — Mage-VL: raportuje lepsze wyniki niż Qwen3-VL-4B w każdym raportowanym przez siebie benchmarku dotyczącym wideo i temporal-groundingu, w tym +22,5 w QVHighlight i +17,1 w ActivityNet. PixelUMM: MVBench 70,53, Video-MME 57,33 bez napisów, LongVideoBench 59,61, LVBench 40,41.
• Rozumienie obrazu — Mage-VL: na poziomie Qwen3-VL-4B w przypadku obrazów statycznych, zgodnie z danymi Microsoftu. PixelUMM: MMMU 41,67, AI2D 80,12, DocVQA 90,42, ChartQA 82,96.
• Generowanie — Mage-VL: brak. PixelUMM: GenEval ogółem 0,83 z przepisywaczem promptów, DPG-Bench 85,74, VBench: jakość części 1 84,10.
• Strumieniowanie — Mage-VL: proaktywne bramkowanie zdarzeń z raportowanymi najwyższymi wynikami TimVal, F1, ROC-AUC i PR-AUC w strumieniowaniu SoccerNet. PixelUMM: nieobsługiwane.
• Licencja — Mage-VL: Apache-2.0, kod i wagi. PixelUMM: kod na licencji Apache-2.0, NVIDIA One-Way Noncommercial License dla checkpointu.
Te dwie kolumny nie pokrywają się w wystarczającym stopniu, aby je uszeregować. Mage-VL informuje o wydajnym enkoderze pokonującym konkurenta o tej samej skali; PixelUMM informuje o modelu 15B plasującym się w tym samym przedziale co otaczające go systemy specjalistyczne, i wprost stwierdza w swoim własnym artykule, że odmienne dane treningowe oznaczają, iż wyniki „nie mogą ustalić, która architektura jest lepsza”.
Praktyczny podział
Wybieraj pod kątem zadania, a nie wyniku. Jeśli budujesz percepcję wideo w czasie rzeczywistym — monitor, który obserwuje strumień i komentuje, gdy coś się dzieje, przy czym koszt tokenów jest wiążącym ograniczeniem — Mage-VL jest jedynym z tych dwóch, który to robi, jest na licencji Apache-2.0, a jego skala klasy 4B oznacza, że pojedynczy węzeł może go obsłużyć. Jeśli potrzebujesz jednego modelu, który odczytuje obrazy i wideo, a także je generuje, PixelUMM jest jedynym z tych dwóch, który to potrafi, ale jest artefaktem badawczym na licencji niekomercyjnej, jego wagi to 128 fragmentów rozproszonego checkpointu za ukrytym indeksem, a text-to-video domyślnie uruchamia zabezpieczenia Cosmos z osobnym środowiskiem Python dla bramki.
Dla zespołu, który potrzebuje obu tych możliwości, argument za uzyskaniem do nich dostępu przez jedną warstwę routingu, a nie dwie bezpośrednie integracje, jest prosty, mimo że dziś żadna z nich nie jest hostowana: pojedynczy klucz, ceny katalogowe dostawców przekazywane z 0% marży oraz reguły przełączania awaryjnego, które pozwalają postawić nowo udostępniony model Apache-2.0 przed częścią ruchu, podczas gdy sprawdzony model obsługuje resztę. OrcaRouter powstał z myślą o tego typu problemach — i żeby było jasne, obecnie nie kierujemy ruchu ani do PixelUMM, ani do Mage-VL, więc jest to opis przepływu pracy, a nie wykaz.
Co by to rozstrzygnęło
Liczą się dwa wydarzenia. Pierwsze to niezależne powtórzenie liczb enkodera Mage-ViT lub wyników wideo Mage-VL przez kogoś, kto nie ma w tym żadnego interesu — dziesięć tygodni pobrań nie przyniosło jeszcze ani jednego. Drugie to jakakolwiek zmiana licencji checkpointu PixelUMM, która jest jedynym faktem obecnie oddzielającym artefakt badawczy od czegoś, co nadaje się do wdrożenia. Dopóki jedno z nich się nie zmaterializuje, jedyne użyteczne, co można powiedzieć o tej parze, to że Microsoft postawił na potanienie interfejsu wizualnego, a NVIDIA postawiła na jego usunięcie, i żaden z tych zakładów nie został oceniony przez nikogo spoza laboratorium, które go postawiło.
