
InternLumina-U2 vs Microsoft Mage-VL: Dwa ciche laboratoria stawiają na to, że tokeny wizyjne powinny nieść więcej
- AlibabaNOWOŚĆQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiNOWOŚĆZ.ai: GLM 5.3 Flash2026-08-2658Inteligencja72Kod
- DeepSeekNOWOŚĆDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 za 1 mln tokenów
- z-aiZ.ai: GLM 5.32026-08-1860Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1552Inteligencja68Kod
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1261Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0557Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligencja72Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligencja78Kod
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligencja69Kod
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligencja49Kod
- metaMeta: Muse Spark 1.12026-07-1653Inteligencja71Kod
- kimiMoonshotAI: Kimi K32026-07-1560Inteligencja76Kod
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligencja71Kod
Microsoft Mage-VL i InternLumina-U2 trafiły do obiegu tak, jak laboratoria badawcze publikują wyniki, gdy nie są jeszcze pewne, że rezultat jest produktem: po cichu. Microsoft opublikował wagi i kod Mage-VL na Hugging Face 25 lipca 2026 roku bez żadnej zapowiedzi; organizacja InternLM z Shanghai AI Laboratory opublikowała kod wnioskowania InternLumina-U2 na GitHubie 1 września 2026 roku również bez zapowiedzi. W odstępie pięciu tygodni dwa z największych laboratoriów świata wypuściły modele, które łączy ciche przekonanie — że sposób, w jaki zamieniamy obrazy w tokeny, jest wąskim gardłem — po czym zostawiły je społeczności, by sama je zauważyła. Jeden z nich możesz dziś pobrać i uruchomić, choć niezręcznie. Drugiego w ogóle nie uruchomisz, ponieważ jego wagi jeszcze nie istnieją. To jest rzetelna mapa obu tych sytuacji — i tego, dlaczego „oba opisane przez producentów, oba niepotwierdzone" nie jest tym samym zdaniem w przypadku każdego z nich.
Pięć tygodni, dwa zakłady na efektywność reprezentacji
Wątek przewodni jest realny, nie retoryczny. Mage-VL to model wideo natywnie zaprojektowany pod kodeki: zamiast dekodować strumień na równomiernie próbkowane klatki i przepychać gęstą siatkę fragmentów (patches) przez zamrożony, wstępnie wytrenowany na danych z sieci transformer wizyjny, podąża on za strukturą nowoczesnych kodeków wideo — rozdziela strumień na klatki odniesienia i skompresowane dane ruchu, które je wiążą — i przetwarza tę zwartą reprezentację bezpośrednio. Deklarowaną przez Microsoft korzyścią jest duża redukcja liczby tokenów wizualnych i wyraźnie szybsza percepcja strumieniowa; firma przedstawia to jako naprawienie swoistego paradoksu Moraveca dla modeli wideo-językowych, w których małe zadania percepcji w czasie rzeczywistym kosztują tyle samo mocy obliczeniowej co trudne rozumowanie offline. Mage-VL to obserwator: efektywnie konsumuje wideo i niemal w czasie rzeczywistym odpowiada na pytania o to, co widzi.
InternLumina-U2 to zakład na to samo wąskie gardło, tylko z drugiej strony. Podczas gdy Mage-VL kompresuje wideo, wzorując się na kodeku, InternLumina-U2 kompresuje każde wejście wizualne, opisując każdą pozycję ośmioma komplementarnymi kodami dyskretnymi zamiast jednego, przy użyciu tokenizera, który laboratorium nazywa AToken. Zakład polega na tym, że pojedyncza księga kodów ogranicza to, ile informacji może przenieść jeden token wizualny, więc słownik złożony z wielu ksiąg kodów pozwala jednemu modelowi dyfuzyjnemu o 16 miliardach parametrów na rozumienie i generowanie przez ten sam interfejs — czytanie wykresów, odpowiadanie na pytania dotyczące wideo, opisywanie zasobów 3D, generowanie obrazów z tekstu, edytowanie ich zgodnie z instrukcją — bez osobnego stosu generowania. Mage-VL chce tanio postrzegać strumienie; InternLumina-U2 chce postrzegać i rysować za pomocą jednego zestawu wag.
Tablica wyników
Dane obu modeli są raportowane przez producentów i nie zostały niezależnie potwierdzone, dlatego tablica wyników przy każdym wierszu podaje jego pochodzenie.
• Kształt — Mage-VL: kompaktowy model wizyjno-językowy natywnie oparty na kodeku (ok. 5 mld parametrów w BF16), zbudowany wokół tekstowego rdzenia Qwen i trenowany do rozumienia obrazów oraz wideo. InternLumina-U2: model MoE o 16 mld parametrów z 1 mld aktywnych (16B-A1B), rzadki dyfuzyjny LLM obsługujący rozumienie, generowanie i edycję.
• Reprezentacja wizualna — Mage-VL: tokeny natywne dla kodeka, zgodne ze strukturą kodeka wideo (kotwica plus ruch); zgłoszono redukcję tokenów wizualnych o ponad 75% w strumieniowym wideo. InternLumina-U2: w pełni dyskretne tokeny z ośmiu ksiąg kodowych z tokenizera AToken.
• Co robi — Mage-VL: analizuje obrazy i wideo na wejściu, odpowiada tekstem; zaprojektowany do percepcji strumieniowej. InternLumina-U2: deklaruje rozumienie tekstu, obrazów, generowanie obrazów z tekstu, edycję obrazów, rozumienie wideo oraz rozumienie 3D.
• Wagi — Mage-VL: publiczne na Hugging Face od 25 lipca 2026 (microsoft/Mage-VL, Apache-2.0). InternLumina-U2: niepubliczne — repozytorium na Hugging Face to pusty placeholder, wagi oznaczone jako „wkrótce”.
• Najważniejsze liczby — Mage-VL: Video-MME 64.0, NExT-QA 83.1, OVO-Bench 64.0, wszystkie raportowane przez Microsoft. InternLumina-U2: ChartQA 86.52, MathVision 33.22, VideoMME 51.26, GenEval 0.81, wszystkie raportowane przez laboratorium, wstępne i częściowe.
• Serwowanie w praktyce — Mage-VL: do pobrania, ale nie istnieje standardowa ścieżka vLLM ani SGLang; kod wymaga trust_remote_code, a obecnie żaden dostawca usług inferencyjnych go nie wdraża. InternLumina-U2: nie może być serwowany przez nikogo — jego wagi nie są publicznie dostępne, a nawet opublikowany sterownik inferencji oczekuje plików checkpointów, których nie ma w repozytorium.

„Dostępne, ale niezręczne” to nie to samo co „niedostępne”.
To jest rozróżnienie, które ma największe znaczenie, jeśli faktycznie próbujesz coś zbudować. Mage-VL jest prawdziwe w sposób, który liczy się w pierwszej kolejności: wagi są na Hugging Face, karta modelu cieszy się dużym ruchem pobrań od końca lipca, a wokół niego wyrósł mały ekosystem społecznościowych kwantyzacji. „Prawdziwe” nie znaczy „łatwe”. Karta modelu pokazuje znacznik custom-code, enkoder wizualny nie jest standardowym zamrożonym ViT, jaki zakładają istniejące stosy serwerowe, a repozytorium Microsoftu pociąga za sobą praktyczną konsekwencję — uruchomienie go oznacza trust_remote_code i brak wdrożenia turnkey u dostawcy. Ale zdeterminowany zespół z GPU może go wczytać, skierować na strumień wideo i sprawdzić, czy teza o natywnym kodeku sprawdza się na jego danych. To ogromna różnica w porównaniu z InternLumina-U2, gdzie to samo zdanie kończy się inaczej: zdeterminowany zespół może przeczytać kod wnioskowania — i na tym koniec, bo nie ma wag do wczytania.

Karta modelu microsoft/Mage-VL na Hugging Face, zarejestrowana 27 sierpnia 2026 r. — opis strumieniowania natywnego dla kodeka, licencja Apache-2.0, tag arxiv oraz sekcja dostawców wnioskowania pokazująca, że żaden dostawca nie wdraża obecnie tego modelu.
Asymetria w benchmarkach wygląda podobnie. Liczby obu modeli to deklaracje producentów; jak dotąd nikt nie przeprowadził ich niezależnych weryfikacji. Twierdzenia Mage-VL mają jednak przynajmniej oparcie w artefakcie do pobrania, więc przepaść między deklaracją a weryfikacją sprowadza się do tego, czy ktoś ten artefakt uruchomi. Twierdzenia InternLumina-U2 opierają się zaś na zapowiedzi z planu działania — „pełne tabele porównawcze pojawią się w nadchodzącym raporcie technicznym” — a żaden artefakt, który mógłby je zweryfikować, nie istnieje. Co więcej, nawet częściowa tabela samego laboratorium pokazuje, że model ten ustępuje co najmniej jednemu rywalowi, którego wedle własnych deklaracji ma przewyższać (GenEval 0.81 wobec 0.89 dla LLaDA2.0-Uni), co jest pożyteczną wskazówką, by etykietę „wstępne, częściowe” czytać dosłownie.
Gdzie mogliby komponować zamiast rywalizować.
Najbardziej użytecznym sposobem odczytania tych dwóch rozwiązań jest potraktowanie ich jako sąsiednich szczebli drabiny, a nie rywali do tego samego zadania. Obserwator natywny dla kodeka, taki jak Mage-VL, jest interesujący właśnie dlatego, że jest na tyle tani, by działać w sposób ciągły — to coś, co przygląda się każdej klatce strumienia i eskaluje sprawę tylko wtedy, gdy pojawia się coś warte uwagi większego modelu. Większy model, do którego eskaluje, mógłby w zasadzie być modelem zunifikowanym tego rodzaju, za jaki uważa się InternLumina-U2: stale włączoną bramką, która decyduje, na co patrzeć, oraz głębokim modelem, który faktycznie czyta wykres, śledzi scenę 3D lub tworzy zredagowany obraz. Oba są niezweryfikowane — Mage-VL niezweryfikowany, ale nadający się do uruchomienia, InternLumina-U2 niezweryfikowany i niewydany — więc uczciwe ujęcie to kompozycja, którą można zbudować, gdy każda ze stron zostanie niezależnie potwierdzona, a nie bezpośrednie starcie, które można rozegrać już dziś.

Repozytorium GitHub InternLM/InternLumina-U2, zarejestrowane 2 września 2026 r. — strona główna repozytorium ukazująca opis wielokodebookowej dyfuzji, plakietkę licencji Apache-2.0 oraz skrypty wejściowe wnioskowania, które składają się na publiczne wydanie, podczas gdy wagi pozostają poza drzewem plików.
Co warstwa routingu robi z niepotwierdzonymi punktami kontrolnymi
Żaden z tych modeli nie jest hostowany na OrcaRouterze i nie zamierzamy sugerować inaczej — Mage-VL nie ma żadnej standardowej ścieżki serwowania, a InternLumina-U2 nie ma wag. To, do czego DSL routingu jest w tej sytuacji naprawdę przydatny, to wyrażenie powyższej kompozycji jako jednego wywołania zamiast szytej na miarę klejki: tani, zawsze włączony model percepcyjny zasilający głębszy model, połączone łańcuchowo tak, aby drogi model uruchamiał się tylko wtedy, gdy tani zgłosi, że coś się zmieniło. A jeśli chodzi o problem niezweryfikowanych checkpointów — który stanowi cały profil ryzyka obu tych modeli — automatyczne przełączanie awaryjne to mechanizm, który pozwala zespołowi wypróbować model taki jak Mage-VL na prawdziwej ścieżce bez stawiania tej ścieżki na szali: za pierwszym razem, gdy nowy checkpoint się zaciśnie, zwróci śmieci lub rzuci wyjątek, wywołanie przechodzi do sprawdzonego modelu i żaden inżynier nie musi być budzony, aby przełączyć przełącznik. Jedno API na ponad 200 modeli, cena katalogowa dostawcy przekazywana dalej z zerową marżą, a nowość testowana za siatką bezpieczeństwa, a nie w bezpośrednim starciu z produkcją.
Najważniejsze
Jeśli chcesz dziś przetestować tezę o wideo natywnym dla kodeka, istnieje tylko Mage-VL — a „istnieje” wiąże się z zastrzeżeniami dotyczącymi niestandardowego kodu i samodzielnego serwowania. Jeśli chcesz przetestować tezę o ujednoliconym modelu z wieloma księgami kodów, nie możesz, ponieważ InternLumina-U2 to wciąż specyfikacja czekająca na swoje wagi; możesz natomiast już teraz przeczytać o jej architekturze, aby być gotowym w chwili, gdy zastępnik na Hugging Face zostanie uzupełniony. Potraktuj model Microsoftu jako niezgrabny, ale realny artefakt, a model Shanghai AI Lab jako dobrze udokumentowaną obietnicę, i pamiętaj, że w tym starciu „zgłaszane przez dostawcę i niezreplikowane” odnosi się do obu — to po prostu znaczy coś innego, gdy istnieje plik, który można pobrać.
