Wygenerowana karta hero zatytułowana „Qwen3.8-Omni-Flash vs InternLumina U2” pod nadtytułem „Wynajęte zmysły vs własne wagi”, z podtytułem „Zamknięte API do długich multimediów kontra model dyfuzyjny 16B, który możesz pobrać.” oraz czterema plakietkami: „Wagi: zamknięte vs Apache 2.0”, „Generuje obrazy: tylko jedna strona”, „Kontekst: 1M vs nieujawniony”, „Możliwość routingu tutaj: żadna”. Logo OrcaRouter jest wkomponowane w prawym dolnym rogu.
Guides & Insights

Qwen3.8-Omni-Flash kontra InternLumina U2: wynajęte zmysły kontra własne wagi

Autor

Elias Hawthorne

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Najbardziej użyteczny sposób porównania Qwen3.8-Omni-Flash i InternLumina U2 nie polega na zestawianiu wierszy rankingów, ponieważ modele te nie pojawiają się w tych samych. Polega on na pytaniu, komu wolno je uruchamiać. Qwen3.8-Omni-Flash od dostawcy, otwarty dla klientów API od 18 września 2026 r., to model zamknięty na platformach dostawcy: milion tokenów kontekstu, do godziny ciągłego dźwięku i wideo na wywołanie, wyjście wyłącznie tekstowe i brak wag. InternLumina U2 z Shanghai AI Laboratory to 16B-A1B model dyfuzyjny typu mixture-of-experts na licencji Apache 2.0, którego checkpointy dla Ascend można pobrać z Hugging Face już teraz, a checkpointy dla NVIDIA i raport techniczny wciąż figurują jako nadchodzące. Jedno to usługa, którą wynajmujesz za tokeny. Drugie to plik, który możesz mieć u siebie, z zastrzeżeniem dotyczącym tego, na jakim sprzęcie obecnie działa. Ta różnica rozstrzyga o większej liczbie rzeczywistych wdrożeń niż jakikolwiek wynik w tabeli któregokolwiek z dostawców.

Czym właściwie jest InternLumina U2

Najciekawsza jest tu architektura i jest ona naprawdę nietypowa. InternLumina U2 to rzadki MoE z 16 miliardami parametrów ogółem i 1 miliardem aktywnych, a przy tym jest to dyfuzyjny model językowy, a nie autoregresyjny — udoskonala całą sekwencję równolegle, zamiast emitować tokeny od lewej do prawej. Jego reprezentacja wizualna jest w pełni dyskretna: osiem ksiąg kodowych tokenów wizualnych zbudowanych na AToken firmy Apple, co pozwala jednemu modelowi zarówno odczytać obraz, jak i go wygenerować, bez osobnego dekodera doczepionego na końcu. Odpowiadanie na pytania tekstowe, generowanie obrazu z tekstu, rozumienie obrazów, edycja obrazów, rozumienie wideo i rozumienie 3D to wszystko ten sam model wykonujący ten sam rodzaj pracy na tym samym słowniku.

• Rozmiar i kształt — InternLumina U2 ma łącznie 16B, 1B aktywnych, rzadki MoE; liczba parametrów Qwen3.8-Omni-Flash nie została ujawniona.

• Generowanie — InternLumina U2 generuje i edytuje obrazy oraz obsługuje rozumienie 3D; Qwen3.8-Omni-Flash nie generuje żadnych multimediów, tylko zwraca tekst.

• Dekodowanie — InternLumina U2 to dyfuzyjny LLM dekodujący równolegle; Qwen3.8-Omni-Flash jest autoregresyjny.

• Kontekst i czas trwania — Qwen3.8-Omni-Flash ma okno 1M tokenów i do godziny ciągłego audio-wideo w pojedynczym wywołaniu; opublikowane materiały InternLumina U2 nie opisują niczego z tego, a długie audio nie znajduje się wśród wymienionych możliwości.

• Wagi — InternLumina U2 jest objęta licencją Apache 2.0, z opublikowanymi checkpointami Ascend i oczekującymi checkpointami NVIDIA; Qwen3.8-Omni-Flash nie ma wag ani ogłoszonego planu w tym zakresie.

• Jak je uzyskać — InternLumina U2 to plik do pobrania z Hugging Face z kodem wnioskowania na GitHubie; Qwen3.8-Omni-Flash to wywołanie API do Alibaba Cloud Model Studio lub platformy Qianwen.

• Niezależne wyniki — brak dla żadnego z nich. Własna karta InternLumina U2 opisuje jej tabelę benchmarków jako „wstępne, częściowe wyniki”; wyniki Qwen są wszystkie porównaniami z jego własnym poprzednikiem i nie zostały odtworzone.

A generated two-column scoreboard titled 'Qwen3.8-Omni-Flash vs InternLumina U2 - the scoreboard'. Six shared dimension labels, left column Qwen3.8-Omni-Flash: 'Weights: not released', 'Size: undisclosed', 'Context: 1M tokens', 'Output: text only', 'Generates images: no', 'Access: vendor API only'; right column InternLumina U2: 'Weights: Apache 2.0 on Ascend', 'Size: 16B total, 1B active', 'Context: not published', 'Output: text and images', 'Generates images: yes', 'Access: download from Hugging Face'. The footer reads 'Qwen figures vendor-reported; InternLumina card says preliminary, partial results.' The OrcaRouter logo is composited in the bottom-right corner.

Kwestia wag przesunęła się od czasu relacji z zapowiedzi

Jeśli czytaliście nasz wcześniejszy artykuł o InternLumina U2, gdy kod pojawił się po raz pierwszy, sytuacja zmieniła się w jednym kierunku, a w innym pozostała bez zmian — i obie te części mają znaczenie. Repozytorium Hugging Face nie jest już atrapą: ascend/ folder zawiera teraz siedem fragmentów safetensors oraz konfigurację, tokenizer i kod modelowania, co oznacza, że model jest naprawdę dostępny do pobrania i uruchomienia dla każdego, kto ma odpowiedni sprzęt. Z kolei nvidia/ folder jest nadal oznaczony jako „wkrótce”, raport techniczny wciąż ma się ukazać, a własna sekcja benchmarków repozytorium nadal podaje „wstępne, częściowe wyniki”. Zatem trafne stwierdzenie na dziś nie brzmi „wagi są udostępnione” ani „wag brakuje” — chodzi o to, że checkpointy jednego stosu sprzętowego są opublikowane, a drugiego nie, co jest realnym ograniczeniem dla każdego, którego klaster to NVIDIA.

Dwie inne rzeczy zmieniły się po cichu. Repozytorium GitHub nadal otrzymywało commity jeszcze długo po początkowym wydaniu z 1 września, więc udostępniony kod jest utrzymywany, a nie odłożony na półkę. A licznik pobrań w repozytorium Hugging Face nadal wskazuje zero, co mówi mniej o samym modelu, a więcej o odbiorcach: model dyfuzyjny 16B-A1B z checkpointami przygotowanymi przede wszystkim pod Ascend jest skierowany do laboratorium, a nie do zespołu produktowego szukającego w tym kwartale hostowanego endpointu.

Gdzie te dwa rzeczywiście się nakładają, a gdzie nie

Rozumienie obrazu to część wspólna, i jest węższa, niż się wydaje. Oba modele potrafią spojrzeć na obraz i odpowiedzieć na pytania o niego, co stanowi całe zadanie dla Qwen3.8-Omni-Flash i jedno z sześciu zadań dla InternLumina U2. Wszystko poza tym rozchodzi się diametralnie. InternLumina U2 może następnie edytować ten obraz lub wygenerować nowy na podstawie promptu, w tym samym modelu, używając tego samego słownika wizualnego, którego użył do jego odczytania. Qwen3.8-Omni-Flash nie potrafi wygenerować ani jednego piksela, ale przyjmie godzinę dźwięku i wideo w jednym wywołaniu i powie ci, kto mówił, kiedy i co zostało postanowione — czego materiały publikowane przez InternLumina U2 w ogóle nie deklarują.

Obszar nakładania się, który ma mniejsze znaczenie, niż ludzie przypuszczają, to wideo. Oba rozwiązania są opisywane jako obsługujące wideo, ale robią z nim różne rzeczy: jedno polega na rozumieniu długiego nagrania jako dokumentu, drugie na traktowaniu wideo jako modalności wizualnej obok 3D. Zespół, który potrzebuje podsumowania godzinnego materiału filmowego, nie skorzysta z drugiego rozwiązania, a zespół, który potrzebuje wygenerowania klatki, nie skorzysta z pierwszego.

A headless screenshot of the Hugging Face model page for InternLumina-U2 showing the Apache 2.0 licence badge, the tags for diffusion, multimodal, image-generation, image-editing and vision-language, the model card heading 'A Multi-Codebook Diffusion Large Language Model for Omni-Visual Understanding, Image Generation and Editing', and the 'Technical Report (Coming Soon)' note.

Koszt, kontrola i to, co tak naprawdę kupujesz

Porównanie cen nie jest porównaniem tego samego rodzaju. Qwen3.8-Omni-Flash rozlicza się za token — 0,15 USD za milion tokenów wejściowych, 0,016 USD za tokeny z pamięci podręcznej, 0,47 USD za tokeny wyjściowe według cennika międzynarodowego, z odrębnym cennikiem dla Chin kontynentalnych, którego nie da się porównać — a jego premierowy nagłówek to zgłoszona przez dostawcę obniżka o ponad 98% kosztu godziny wejścia audio, obliczona przez wycenę dwuminutowej próbki i pomnożenie przez trzydzieści, przy wideo próbkowanym w 720p i jednej klatce na sekundę. InternLumina U2 nie pobiera żadnych opłat, bo nie ma czego rozliczać: kosztem jest twój sprzęt i twój czas, a sama karta modelu nie podaje wartości przepustowości, która pozwoliłaby przeliczyć to na liczbę na token.

To jest cały kompromis w jednym zdaniu. API daje ci możliwości, których nie możesz hostować, oraz koszt godzinowy, który skaluje się wraz z użyciem; otwarte wagi dają stały koszt i pełną kontrolę nad ścieżką danych, za cenę stosu inferencyjnego, który musisz zbudować, oraz zestawu checkpointów, który obecnie oznacza sprzęt Ascend. W przypadku obciążeń podlegających regulacjom, w których multimedia nie mogą opuścić budynku, to drugie nie jest preferencją — to jedyna opcja na tej stronie. Dla zespołu, który w tym miesiącu potrzebuje analizy długich nagrań audio, to pierwsze jest jedyną opcją na tej stronie.

OrcaRouter nie hostuje dziś żadnego z tych modeli i wolimy powiedzieć to wprost, niż sugerować ścieżkę routingu, która nie istnieje: Qwen3.8-Omni-Flash działa wyłącznie na własnych platformach Alibaba, a InternLumina U2 to plik do pobrania, a nie endpoint. To, co uruchamiamy, to reszta linii Qwen3.8 — Qwen3.8-Flash i Qwen3.8-Max — przez jedno API w cenie katalogowej dostawcy z 0% marży, co jest praktycznym sposobem utrzymania działającego punktu odniesienia dla strony modeli zamkniętych w tym porównaniu, podczas gdy strona otwartych wag wciąż porządkuje swoje checkpointy NVIDIA.

A headless screenshot of the OrcaRouter model page for Qwen3.8 Flash at www.orcarouter.ai/models/qwen/qwen3.8-flash, showing the model header, the code sample, the input modalities and capabilities, the published pricing and the p50 TTFT figure.

Który właściwie powinieneś wybrać

Wybierz InternLumina U2, jeśli potrzebujesz jednego modelu, który czyta, generuje i edytuje obrazy, i jesteś gotów samodzielnie utrzymywać stos wnioskowania — oraz jeśli twoje akceleratory to Ascend albo możesz poczekać na punkty kontrolne NVIDIA. To jedyny z tych dwóch modeli, który potrafi tworzyć obraz, i jedyny, który możesz uruchomić bez wysyłania danych do dostawcy. Traktuj jego wyniki benchmarków jako niepotwierdzone, dopóki nie pojawi się raport techniczny, ponieważ karta modelu mówi dokładnie to.

Wybierz Qwen3.8-Omni-Flash, jeśli Twoim problemem są godziny audio i wideo, a nie piksele na wyjściu — inteligencja spotkań, analiza długich nagrań, praca agentowa w dużym stopniu oparta na audio po chińsku i angielsku — oraz jeśli możesz zaakceptować zależność od jednego źródła i wyjście wyłącznie tekstowe. Jego historia kosztów jest mocna w przypadku godzin audio wejściowego, a znacznie słabsza w przypadku całkowitego rachunku, jego benchmarki są raportowane przez dostawcę i niepowtórzone, a pierwsze pojawiające się testy stron trzecich plasują go w 28. percentylu pod względem rozumowania, na próbie wystarczająco małej, by powinna skłonić do testu, a nie do decyzji.

Jeśli potrzebujesz obu, są one dopełnieniem, a nie alternatywą: model obrazowy o otwartych wagach, który hostujesz, i zamknięty model do długich multimediów, do którego kierujesz wywołania. Żadnego z nich nie da się dziś trasować przez nas. Z jednej strony warto wypatrywać checkpointu NVIDIA i raportu technicznego; z drugiej — pierwszej niezależnej ewaluacji, która jeszcze nie istnieje i która jest największą luką we wszystkim, co napisano o Qwen3.8-Omni-Flash jak dotąd.