Wygenerowana karta tytułowa w firmowym stylu OrcaRouter z napisem „PixelUMM vs InternLumina-U2”, z czterema kafelkami statystycznymi: „41.67 / 57.33” (PixelUMM MMMU i Video-MME), „0.81 / 51.26” (InternLumina-U2 GenEval i Video-MME), „Apache-2.0” (kod InternLumina-U2 i oba checkpointy) oraz „1-way NC” (licencja checkpointu PixelUMM). Wiersz stopki brzmi: „Wyniki podane przez dostawcę; brak niezależnego ponownego uruchomienia żadnego z modeli.” Logo OrcaRouter jest wkomponowane w pasek z paddingiem w prawym dolnym rogu.
Guides & Insights

PixelUMM vs InternLumina-U2: Dwie wersje beta bez enkodera i jedyna różnica, która rozstrzyga

Autor

Elias Hawthorne

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Dwa modele, oba publicznie dostępne, oba nietypowo zaprojektowane, i tylko na jednym z nich możesz zbudować produkt. PixelUMM to zunifikowany model NVIDIA bez enkodera — 15,2 miliarda parametrów na backbone Qwen3-8B, odczytujący i zapisujący surowe piksele przez patche 16×16 i 4-klatkowe tubelety, bez VAE i bez żadnego enkodera wizyjnego w całym stosie. InternLumina-U2 to dyfuzyjny model mixture-of-experts o 16 mld parametrów z Shanghai AI Laboratory, który kompresuje każde wejście wizualne do ośmiu komplementarnych kodów dyskretnych za pomocą tokenizera o nazwie AToken. Oba postawiły zakład, że wąskim gardłem jest interfejs wizualny. Zakład, który ma większe znaczenie, to ten z plików licencji: InternLumina-U2 udostępnia wagi Apache-2.0, PixelUMM udostępnia checkpoint na licencji niekomercyjnej. Jeśli wybierasz między nimi do czegokolwiek komercyjnego, to zdanie jest całym porównaniem, a reszta tej strony to kontekst dla niego.

Oba zestawy liczb poniżej pochodzą z samych laboratoriów. Żaden z modeli nie ma niezależnej ewaluacji, Elo areny ani reprodukcji przez podmiot trzeci. Żaden z nich nie jest obsługiwany przez żadne hostowane API. Różnica polega na tym, co wolno ci zrobić z artefaktem po jego pobraniu, oraz na tym, jak zaawansowane jest faktycznie każde z wydań.

Gdzie obecnie stoi każdy z nich

Harmonogramy wydania przesuwały się w różnym tempie, i to oba po cichu.

• PixelUMM — Repozytorium GitHub utworzone 4 września 2026; preprint arXiv 2609.38597 z 29 września 2026; repozytorium modelu Hugging Face utworzone 1 października 2026 o 21:40 UTC. Nie pojawił się dla niego żaden wpis na blogu NVIDIA, komunikat prasowy ani wątek premiery.

• InternLumina-U2 — repozytorium GitHub utworzone 1 września 2026; zaślepka Hugging Face zarejestrowana tego samego dnia; wagi checkpointów trenowanych na Ascend dodane 10 września 2026; wagi checkpointów NVIDIA/CUDA dodane 24 września 2026. Siedem shardów na stos, oba możliwe do pobrania już dziś.

Ten InternLumina-U2, który istniał na początku września — tylko kod, wagi „wkrótce”, puste repozytorium modelu — nie jest tym InternLumina-U2, który istnieje teraz. Każdy, kto czytał o nim na początku miesiąca i doszedł do wniosku, że brakuje wag, powinien sprawdzić ponownie; zarówno checkpointy Huawei Ascend, jak i NVIDIA/CUDA są już dostępne, na licencji Apache-2.0, a obok nich znajdują się tokenizer, konfiguracja, szablon czatu i zdalny kod do modelowania.

A headless-browser capture of the Hugging Face model card for the InternLumina-U2 repository, showing the model title, the Apache-2.0 licence tag, and the repository's download and like counters alongside the file listing for the checkpoint shards.

Dwie odpowiedzi na to samo pytanie.

Oba modele wychodzą od tej samej skargi: posiadanie kodera wizyjnego do rozumienia i VAE do generowania oznacza reprezentowanie każdego obrazu dwukrotnie, co w przybliżeniu podwaja kontekst wizualny i zmusza potok treningowy do utrzymywania dwóch interfejsów.

Odpowiedź PixelUMM jest taka: usunąć oba. Surowe piksele trafiają prosto do środka przez jednowarstwowe rzutowania liniowe — fragment 16×16 na każdą pozycję obrazu, 4-klatkowy tublet na każdą pozycję wideo — a szkieletem jest Transformer typu decoder-only, którego konstrukcja Mixture-of-Transformers łączy współdzieloną uwagę z parametrami specyficznymi dla zadania. Tekst jest przewidywany autoregresyjnie; piksele są przewidywane metodą flow matching. Artykuł poświęca osiem sekcji na badania projektowe — rozmiar fragmentu, artefakty fragmentów, dynamika w przestrzeni pikseli versus w przestrzeni VAE, skalowanie obliczeń — co mówi, że prawdziwym pytaniem zespołu było, czy ten paradygmat w ogóle się broni.

Odpowiedź InternLumina-U2 polega na zachowaniu dyskretnego interfejsu, ale sprawieniu, by każdy token niósł znacznie więcej informacji. Tokenizator AToken opisuje każdą pozycję wizualną ośmioma komplementarnymi księgami kodowymi obejmującymi teksturę, osadzony tekst i geometrię; osiem embeddingów jest łączonych dla każdej pozycji i rzutowanych na jeden token szkieletowy. Dekodowanie przebiega w odwrotnym kierunku, z przestrzennie równoległym odszumianiem i wieloksięgową autoregresyjną głową przewidującą osiem kodów po kolei. Szkielet to rzadki dyfuzyjny LLM z rodziny LLaDA-2.0, 16B łącznie z 1B aktywnych.

• Interfejs wizualny — PixelUMM: surowe fragmenty pikseli i tubelety, całkowicie bez tokenizera. InternLumina-U2: w pełni dyskretne tokeny z ośmiu codebooków z AToken, bez ciągłego latentu.

• Szkielet — PixelUMM: Qwen3-8B (15,2 mld łącznie), pojedynczy gęsty dekoder z ekspertami od rozumienia i generowania. InternLumina-U2: 16 mld łącznie / 1 mld aktywnych, rzadki dyfuzyjny model językowy MoE.

• Metoda generowania — PixelUMM: dopasowywanie przepływu w przestrzeni pikseli plus tekst autoregresyjny. InternLumina-U2: maskowane odszumianie dyfuzyjne na kodach dyskretnych.

• Zadania zadeklarowane — PixelUMM: tekst na obraz, tekst na wideo, obraz na tekst, wideo na tekst. InternLumina-U2: te same oraz edycję obrazów i rozumienie 3D.

• Format wag — PixelUMM: 128 shardów .distcp (~30 GB) za ukrytym indeksem .metadata. InternLumina-U2: siedem shardów .safetensors na stos sprzętowy, standardowy układ Hugging Face.

A generated scoreboard card titled “PixelUMM vs InternLumina-U2 — the scoreboard”, with the two model names as column headings and six dimension rows spanning both columns: visual interface, backbone, generation method, video understanding, weight format and licence. PixelUMM's column shows raw pixel patches and tubelets, a Qwen3-8B backbone at 15.2B, pixel-space flow matching, Video-MME 57.33 with MVBench 70.53, 128 distributed-checkpoint shards, and a noncommercial checkpoint licence; InternLumina-U2's column shows eight-codebook discrete AToken tokens, a 16B-A1B sparse MoE diffusion backbone, masked diffusion denoising, Video-MME 51.26 with MVBench 59.74, seven safetensors shards per hardware stack, and Apache-2.0. A footer notes that the figures are vendor-reported with no independent rerun.

Tablica wyników wraz z dołączoną proweniencją

Czytaj każdy wiersz jako twierdzenie samego laboratorium. Twierdzenia PixelUMM pochodzą z jego preprintu; twierdzenia InternLumina-U2 to własny opis laboratorium, które nazywa je „wstępnymi, częściowymi”, a pełne tabele porównawcze odłożono do raportu technicznego, który się nie ukazał.

• MMMU (rozumowanie na obrazach) — PixelUMM 41.67 (według autorów). InternLumina-U2: nie podano.

• ChartQA — PixelUMM 82,96. InternLumina-U2 86,52.

• DocVQA — PixelUMM 90.42. InternLumina-U2: nie podano.

• Video-MME (bez napisów) — PixelUMM 57,33. InternLumina-U2 51,26.

• MVBench — PixelUMM 70,53. InternLumina-U2 59,74.

• GenEval ogółem — PixelUMM 0,83 z przepisywaczem promptów LLM, 0,77 bez niego. InternLumina-U2 0,81.

• Ogólny wynik DPG-Bench — PixelUMM 85,74. InternLumina-U2 87,10.

• Generowanie wideo — PixelUMM VBench część 1 jakość 84,10 / semantyczna 79,80, część 2 łącznie 83,24. InternLumina-U2: nie podano.

• rozumienie 3D — PixelUMM: brak takiego zadania. InternLumina-U2 podaje 41,8 w 3D MM-Vet.

Porównanie jest nierówne, ponieważ oba laboratoria publikują różne tabele, a nie dlatego, że jedno wygrywa. PixelUMM ma pełną sekcję generowania wideo i nie ma edycji ani 3D; InternLumina-U2 deklaruje sześć rodzin zadań i podaje częściową tabelę dla nich. Liczby pochodzące z różnych laboratoriów dla tej samej nazwy benchmarku nie są tym samym pomiarem — podziały, prompty i próbkowanie się różnią — więc traktuj wiersze ChartQA i GenEval jako w przybliżeniu równe i na tym poprzestań.

Licencjonowanie to punkt, w którym to przestaje być remisem.

To jest ta część, której nie pokazuje żadna tabela benchmarków. Repozytorium PixelUMM jest objęte licencją Apache-2.0 i karta wyraźnie to mówi. Checkpoint to osobny artefakt objęty licencją NVIDIA One-Way Noncommercial License, ograniczoną do niekomercyjnych badań lub oceny, a jeden plik źródłowy dodatkowo zachowuje adnotację CC BY-NC 4.0 odziedziczoną po DiT. Użycie badawcze: w porządku. Wewnętrzna funkcja produktu: rozmowa z działem prawnym, być może krótka.

InternLumina-U2 jest w całości objęty licencją Apache-2.0 — zarówno kod, jak i oba punkty kontrolne — bez odrębnego wyłączenia dla zastosowań niekomercyjnych. Dla zespołu, który musi dostarczyć produkt, to nie jest drobna przewaga — to jest cała decyzja. Oba modele mają dojrzałość na poziomie badawczym. Tylko jeden z nich można stosować bez ograniczeń.

Który właściwie wypróbować i jak?

Jeśli Twoja praca dotyczy rozumienia wideo albo potrzebujesz modelu, który generuje wideo i obrazy z jednego zestawu wag, PixelUMM jest bardziej kompletnym artefaktem, a jego artykuł jest bardziej użyteczną lekturą — ale to projekt badawczy na licencji niekomercyjnej, więc należy go umieścić na stanowisku ewaluacyjnym, a nie w potoku. Jeśli Twoja praca obejmuje szeroki zakres generowania wykresów, dokumentów i obrazów albo potrzebujesz edycji i 3D, InternLumina-U2 pokrywa więcej obszarów i nie ma pułapu licencyjnego; jej kosztem jest to, że szkielet dyfuzyjny 16B-A1B i tokenizer AToken oznaczają realną inżynierię serwowania, a jej opublikowane liczby są wyraźnie częściowe.

Na dzień pisania tego tekstu żaden z nich nie znajduje się w żadnym hostowanym API, i dotyczy to również OrcaRouter — nie kierujemy ruchu do żadnego z tych modeli. Kiedy to się zmieni, argument za sięganiem po nie przez warstwę routingu, a nie przez bezpośrednią integrację, jest taki sam jak w przypadku każdego nowo otwartego modelu: jeden klucz dla ponad 200 modeli, ceny katalogowe dostawców przekazywane bez narzutu (0%) oraz automatyczne przełączanie awaryjne, dzięki któremu model, który okaże się gorszy, niż sugerowała tabela jego dostawcy, można zdegradować, zmieniając trasę, a nie przepisując wdrożenie. Do tego czasu uczciwa rada jest nudna — pobierz ten model, którego licencja pozwala na użycie w twoim przypadku, przeprowadź własną ocenę na własnych danych i nie planuj niczego w oparciu o liczby któregokolwiek z laboratoriów, dopóki ktoś spoza laboratorium ich nie powtórzy.

Co zmieniłoby odpowiedź

Trzy rzeczy, w kolejności wpływu. Komercyjna licencja na checkpoint PixelUMM sprawiłaby, że porównanie byłoby naprawdę bliskie, i przeniosłaby je z „przeczytaj artykuł” na „oceń wagi”. Raport techniczny z Shanghai AI Laboratory zawierający pełne tabele porównawcze zamieniłby częściowe liczby InternLumina-U2 w coś weryfikowalnego, a także ujawniłby, jaka część szerokości sześciu zadań jest na poziomie parytetu, a jaka na głębokości tokenów. A pierwsza niezależna reprodukcja któregokolwiek z modeli — ponowne uruchomienie GenEval lub MVBench przez zespół niezainteresowany wynikiem — jest momentem, w którym którekolwiek z nich przestaje być tabelą dostawcy. Do tego czasu jedno jest nietypową architekturą, którą można tylko badać, a drugie nietypową architekturą, którą można wdrożyć.