
InternLumina-U2 kontra Qwen2.5 Omni: model Omni dostarczony przez Alibaba kontra ten, który Shanghai AI Lab wciąż obiecuje
- AlibabaNOWOŚĆQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiNOWOŚĆZ.ai: GLM 5.3 Flash2026-08-2658Inteligencja72Kod
- DeepSeekNOWOŚĆDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 za 1 mln tokenów
- z-aiZ.ai: GLM 5.32026-08-1860Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1552Inteligencja68Kod
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1261Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0557Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligencja72Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligencja78Kod
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligencja69Kod
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligencja49Kod
- metaMeta: Muse Spark 1.12026-07-1653Inteligencja71Kod
- kimiMoonshotAI: Kimi K32026-07-1560Inteligencja76Kod
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligencja71Kod
InternLumina-U2 i Qwen2.5 Omni to dwie odpowiedzi na tę samą ambicję — jeden model obsługujący wszystkie modalności zamiast zoo specjalistów — pochodzące z dwóch różnych pokoleń. Qwen2.5 Omni to odpowiedź, która faktycznie trafiła na rynek: model o otwartych wagach z 7 miliardami parametrów, wydany w marcu 2025 roku, w chwili pisania tego tekstu mający siedemnaście miesięcy, który przyjmuje tekst, obrazy, audio i wideo jako wejście, a odpowiada tekstem lub naturalną, strumieniowaną mową. InternLumina-U2 to odpowiedź Laboratorium Sztucznej Inteligencji w Szanghaju, opublikowana jako kod wnioskowania 1 września 2026 roku: rzadki model dyfuzyjny z 16 miliardami parametrów, który — według deklaracji — postrzega obrazy, wideo i 3D oraz generuje i edytuje obrazy przez jeden wspólny interfejs dyskretnych tokenów. Jedno pokolenie idei omni jest w produkcji od półtora roku; drugie ma jeden dzień i nie może być uruchomione przez nikogo, ponieważ jego wagi jeszcze nie istnieją. Dzieląca je różnica to różnica między obietnicą spełnioną a obietnicą złożoną.
Omni, które wydano: Qwen2.5 Omni
Qwen2.5 Omni warto traktować poważnie jako punkt odniesienia, ponieważ to rzadki otwarty model, który faktycznie zrealizował hasło „postrzegaj wszystko, odpowiadaj w dowolnej formie”. Jego architektura Thinker-Talker łączy tekstowego „myśliciela” z „mówcą” generującym mowę, wykorzystując wyrównane w czasie multimodalne kodowanie pozycyjne, dzięki czemu audio i wideo pozostają zsynchronizowane; dane wejściowe obejmują tekst, obrazy, audio i wideo, a dane wyjściowe mogą zawierać tekst i głos w tej samej turze, z czterema wbudowanymi głosami. Ograniczenia są udokumentowane w takim samym stopniu jak możliwości: kontekst wynosi 32 tysiące tokenów, nie ma wywoływania funkcji ani wyjścia strukturalnego, a model jest wszechstronnym rozmówcą, a nie agentem. To, czego nie robi, warto podkreślić w tym porównaniu — postrzega obrazy, audio i wideo, ale ich nie generuje. „Omni” w Qwen2.5 Omni oznacza wszechstronną percepcję z syntezą mowy po stronie wyjścia; piksele wchodzą, a słowa wychodzą.
Ta historia osiągnięć jest prawdziwa. Model został pobrany setki tysięcy razy, ma API hostowane na własnej platformie dewelopera oraz na kilku platformach zewnętrznych i przez siedemnaście miesięcy zdążył obrosnąć w kwantyzacje, narzędzia tworzone przez społeczność i ugruntowaną cenę — zestawienia agregatorów podają tekst na około 0,09 USD za milion tokenów wejściowych i 0,34 USD za milion tokenów wyjściowych, a audio rozliczane jest osobno. Siedemnaście miesięcy to wystarczająco długo, by zarówno jego mocne strony, jak i ograniczenia były dobrze zmapowane. To właśnie daje dojrzałość: nie doskonałość, ale przewidywalność.
Obiecany omni: InternLumina-U2
InternLumina-U2 próbuje pójść o krok dalej niż Qwen2.5 Omni, a właśnie w tym kroku tkwi trudność. Jego teza projektowa głosi, że percepcja i generowanie powinny współdzielić jeden interfejs dyskretnych tokenów: zamiast modelu językowego, który postrzega wideo, i osobnego modelu dyfuzyjnego, który rysuje, pojedynczy rzadki szkielet dyfuzyjny MoE — 16B łącznie, 1B aktywnych — miałby zarówno czytać obraz, wykres, wideo czy zasób 3D, jak i tworzyć nowy obraz lub edycję, używając w pełni dyskretnego słownika wizualnego z ośmioma książkami kodowymi, tak aby każda pozycja wizualna niosła wystarczająco informacji do obsługi obu kierunków. To twierdzenie jest znacząco większe niż w przypadku Qwen2.5 Omni. Co innego przekierowywać każdą modalność wejściową do tekstu i mowy; co innego sprawić, by jeden zestaw wag generował piksele tak płynnie, jak o nich rozumuje.
Jest to również, w tej chwili, twierdzenie niemożliwe do zweryfikowania. Laboratorium opublikowało kod wnioskowania, stronę projektu z „wstępną, częściową” tabelą benchmarków oraz pusty stub na Hugging Face; wagi, kod treningowy, raport techniczny i stos Ascend-NPU są oznaczone jako „wkrótce”. Nie istnieje żadna niezależna ewaluacja, bo nie ma czego ewaluować. Architekturę Qwen2.5 Omni można było sprawdzić w tydzień po premierze, ponieważ wagi zostały wydane razem z nią; architekturę InternLumina-U2 można przeczytać już dziś, ale jej jakość wciąż pozostaje obietnicą producenta.
Tablica wyników
Ponieważ jeden z tych modeli ma za sobą siedemnaście miesięcy historii, a drugi zaledwie jeden dzień kodu, wiersze niosą informację o swoim pochodzeniu, zamiast udawać, że kolumny są symetryczne.
• Wiek — Qwen2.5 Omni: wydany w marcu 2025, siedemnaście miesięcy na rynku, setki tysięcy pobrań. InternLumina-U2: kod inferencji opublikowany 1 września 2026, zero pobrań, zero niezależnych uruchomień.
• Shape — Qwen2.5 Omni: ~7B end-to-end, Thinker-Talker z multimodalnym kodowaniem pozycyjnym wyrównanym w czasie. InternLumina-U2: 16B parametrów łącznie / 1B aktywnych — dyfuzyjny LLM o rzadkiej architekturze MoE z dyskretnym tokenizerem wizualnym opartym na ośmiu księgach kodowych.
• Wejście — oba przyjmują tekst i obrazy; Qwen2.5 Omni dodatkowo przyjmuje audio i wideo do czatu omni; InternLumina-U2 dodatkowo deklaruje rozumienie wideo na podstawie 64 próbkowanych klatek oraz rozumienie 3D na podstawie widoków GLB/GLTF renderowanych w Blenderze.
Wyjście — Qwen2.5 Omni: tekst i mowa strumieniowa, cztery głosy. InternLumina-U2: deklaruje obsługę tekstu, generowanie obrazów na podstawie tekstu do 1024×1024 oraz edycję obrazów na podstawie instrukcji.
• Granica generacji — Qwen2.5 Omni: generuje słowa i głos, nie piksele. InternLumina-U2: próbuje generować i edytować piksele w tym samym modelu dyskretnych tokenów, który czyta.
• Wagi i licencja — oba są zasadniczo otwartymi wagami na licencji Apache-2.0; wagi Qwen2.5 Omni można pobrać już dziś, a wagi InternLumina-U2 nie są jeszcze publiczne.
• Serwowanie — Qwen2.5 Omni: API hostowane plus self-host (ciężkie wdrożenie w pełnej precyzji); znany kontekst 32K, brak wywoływania funkcji. InternLumina-U2: nie można serwować — wydany sterownik oczekuje punktów kontrolnych, które nie istnieją.
• Najważniejsze wyniki — Qwen2.5 Omni: od dawna obecny na liście liderów OmniBench (wynik około 0,561 na aktualnych listach); InternLumina-U2: ChartQA 86,52, MathVision 33,22, GenEval 0,81 — wszystkie podane przez producentów, wstępne i częściowe.

Dlaczego przepaść pokoleniowa jest prawdziwą historią
Odłóżmy na bok kwestię wieku, a zasadnicza różnica sprowadza się do granicy, na której zatrzymuje się każdy z modeli. Qwen2.5 Omni wybrał praktyczną wersję omni: postrzegać szeroko, odpowiadać tekstem lub głosem, a syntezę obrazu i wideo pozostawić wyspecjalizowanym modelom generacyjnym w pozostałej części stosu. Na tym podziale pracy opiera się praktycznie każdy produkcyjny system multimodalny w 2026 roku i dlatego Qwen2.5 Omni mógł trafić na rynek w 2025 roku i pozostać użyteczny w 2026 — dobrze wykonuje swoją część i współgra z resztą. InternLumina-U2 to zakład, że problemem jest właśnie ten podział pracy: że model zmuszony do reprezentowania wszystkiego — percepcji i generacji — we wspólnym dyskretnym słownictwie nauczy się głębszego rozumienia widzenia niż model, który musi je tylko opisywać. Ten zakład, jeśli się opłaci, okaże się ważniejszym rezultatem. Jeśli nie, InternLumina-U2 skończy jako wolniejszy i bardziej żarłoczny Qwen2.5 Omni z generatorem obrazów niezręcznie wmontowanym w te same wagi. Cały ten pojedynek — a to pojedynek między wdrożonym projektem a hipotezą, nie między dwoma działającymi modelami — rozstrzyga, czy trudniejsza architektura sama się uzasadnia.

Karta Qwen/Qwen2.5-Omni-7B w serwisie Hugging Face, zarejestrowana 27 sierpnia 2026 — przegląd Thinker-Talker, licencja Apache-2.0 oraz tagi modalności tekstu, obrazu, dźwięku i wideo modelu.
Co tak naprawdę kupuje półtora roku pobierania
Dojrzałość to nie vibe; to lista rzeczy, które wiesz. W przypadku Qwen2.5 Omni wiesz, że kontekst 32K to twarde ograniczenie, i potrafisz projektować wokół niego. Wiesz, że nie istnieje ścieżka wywoływania funkcji, i nie udajesz, że istnieje. Wiesz mniej więcej, ile kosztuje wdrożenie — zarówno przez hostowane API, jak i na własnych GPU — bo model był wyceniany i uruchamiany przez wystarczająco wiele osób, by liczby już się ustabilizowały. Wiesz, że pozycja w OmniBench jest realna, bo niezależne rankingi śledzą ją od ponad roku. W przypadku InternLumina-U2 żaden z tych czasowników nie ma zastosowania — nie wiesz i nie możesz wiedzieć, ponieważ nie istnieje żaden artefakt. Gdy model ma jeden dzień i jest pozbawiony wag, każde twierdzenie o nim jest deklaracją intencji. Ta asymetria nie jest przytykiem do nauki; to właściwa postawa epistemiczna dla każdego, kto wybiera, na czym budować.

Repozytorium GitHub InternLM/InternLumina-U2, zarchiwizowane 2 września 2026 — strona główna repozytorium upubliczniająca architekturę — opis, licencja oraz skrypty wnioskowania — podczas gdy same wagi są nieobecne w drzewie plików.
Decyzja routingu, uczciwie przedstawiona
Powiedzmy wprost, jak wygląda dostępność: OrcaRouter nie hostuje InternLumina-U2, bo nie ma żadnych wag, które można by hostować, a Qwen2.5 Omni również obecnie nie jest u nas dostępny — działa przez własne API dewelopera oraz platformy zewnętrzne. Lekcja dotycząca routingu jest więc tu kwestią podejścia, a nie wywoływania tych dwóch modeli przez jeden klucz już dziś. Trwały wzorzec to ten, do którego prędzej czy później dochodzi każda decyzja między dojrzałym modelem a nowicjuszem: sprawdzony model zostaje na głównej ścieżce, gdzie jedno API obejmujące ponad 200 modeli i 0% narzutu oznacza, że płacisz cenę z cennika dostawcy i nic więcej; nieprzetestowanego nowicjusza kierujesz na ścieżkę testową z automatycznym przełączaniem awaryjnym, więc gdy po raz pierwszy się zablokuje, zacznie dryfować lub zwracać bzdury, wywołanie spada do modelu z siedemnastomiesięcznym stażem. W ten sposób możesz ocenić ambitną nową architekturę, taką jak InternLumina-U2, już w dniu, w którym pojawią się jej wagi — bez stawiania na szali ścieżki produkcyjnej, od której już zależysz.
Werdykt
Qwen2.5 Omni to model omni, na którym możesz budować już dziś: jest dostarczony, do pobrania, udokumentowany, ma znane ograniczenia i ustaloną cenę. InternLumina-U2 to model omni, który warto obserwować: prawdziwy architektoniczny krok od percepcji ku tworzeniu, na licencji Apache-2.0, z publicznym kodem i wagami, które dopiero się pojawią. Jeśli zakład laboratorium na podejście multi-codebook utrzyma się w niezależnych testach, InternLumina-U2 będzie nie tyle rywalem dla Qwen2.5 Omni, co następną generacją tego samego pomysłu. Jeśli nie, siedemnastomiesięczny model ogólny, który faktycznie trafił na rynek, nadal będzie tam i będzie robił to, co robił od zawsze. Obserwuj stub na Hugging Face; werdykt czeka na pliki safetensors, a nie na ten artykuł.
