
Qwen3.8-Omni-Flash kontra InternLumina U2: wynajęte zmysły kontra własne wagi
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów
- orcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów
- deepseekNOWOŚĆDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencja76Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Najbardziej użyteczny sposób porównania Qwen3.8-Omni-Flash i InternLumina U2 nie polega na zestawianiu wierszy rankingów, ponieważ modele te nie pojawiają się w tych samych. Polega on na pytaniu, komu wolno je uruchamiać. Qwen3.8-Omni-Flash od dostawcy, otwarty dla klientów API od 18 września 2026 r., to model zamknięty na platformach dostawcy: milion tokenów kontekstu, do godziny ciągłego dźwięku i wideo na wywołanie, wyjście wyłącznie tekstowe i brak wag. InternLumina U2 z Shanghai AI Laboratory to 16B-A1B model dyfuzyjny typu mixture-of-experts na licencji Apache 2.0, którego checkpointy dla Ascend można pobrać z Hugging Face już teraz, a checkpointy dla NVIDIA i raport techniczny wciąż figurują jako nadchodzące. Jedno to usługa, którą wynajmujesz za tokeny. Drugie to plik, który możesz mieć u siebie, z zastrzeżeniem dotyczącym tego, na jakim sprzęcie obecnie działa. Ta różnica rozstrzyga o większej liczbie rzeczywistych wdrożeń niż jakikolwiek wynik w tabeli któregokolwiek z dostawców.
Czym właściwie jest InternLumina U2
Najciekawsza jest tu architektura i jest ona naprawdę nietypowa. InternLumina U2 to rzadki MoE z 16 miliardami parametrów ogółem i 1 miliardem aktywnych, a przy tym jest to dyfuzyjny model językowy, a nie autoregresyjny — udoskonala całą sekwencję równolegle, zamiast emitować tokeny od lewej do prawej. Jego reprezentacja wizualna jest w pełni dyskretna: osiem ksiąg kodowych tokenów wizualnych zbudowanych na AToken firmy Apple, co pozwala jednemu modelowi zarówno odczytać obraz, jak i go wygenerować, bez osobnego dekodera doczepionego na końcu. Odpowiadanie na pytania tekstowe, generowanie obrazu z tekstu, rozumienie obrazów, edycja obrazów, rozumienie wideo i rozumienie 3D to wszystko ten sam model wykonujący ten sam rodzaj pracy na tym samym słowniku.
• Rozmiar i kształt — InternLumina U2 ma łącznie 16B, 1B aktywnych, rzadki MoE; liczba parametrów Qwen3.8-Omni-Flash nie została ujawniona.
• Generowanie — InternLumina U2 generuje i edytuje obrazy oraz obsługuje rozumienie 3D; Qwen3.8-Omni-Flash nie generuje żadnych multimediów, tylko zwraca tekst.
• Dekodowanie — InternLumina U2 to dyfuzyjny LLM dekodujący równolegle; Qwen3.8-Omni-Flash jest autoregresyjny.
• Kontekst i czas trwania — Qwen3.8-Omni-Flash ma okno 1M tokenów i do godziny ciągłego audio-wideo w pojedynczym wywołaniu; opublikowane materiały InternLumina U2 nie opisują niczego z tego, a długie audio nie znajduje się wśród wymienionych możliwości.
• Wagi — InternLumina U2 jest objęta licencją Apache 2.0, z opublikowanymi checkpointami Ascend i oczekującymi checkpointami NVIDIA; Qwen3.8-Omni-Flash nie ma wag ani ogłoszonego planu w tym zakresie.
• Jak je uzyskać — InternLumina U2 to plik do pobrania z Hugging Face z kodem wnioskowania na GitHubie; Qwen3.8-Omni-Flash to wywołanie API do Alibaba Cloud Model Studio lub platformy Qianwen.
• Niezależne wyniki — brak dla żadnego z nich. Własna karta InternLumina U2 opisuje jej tabelę benchmarków jako „wstępne, częściowe wyniki”; wyniki Qwen są wszystkie porównaniami z jego własnym poprzednikiem i nie zostały odtworzone.

Kwestia wag przesunęła się od czasu relacji z zapowiedzi
Jeśli czytaliście nasz wcześniejszy artykuł o InternLumina U2, gdy kod pojawił się po raz pierwszy, sytuacja zmieniła się w jednym kierunku, a w innym pozostała bez zmian — i obie te części mają znaczenie. Repozytorium Hugging Face nie jest już atrapą: ascend/ folder zawiera teraz siedem fragmentów safetensors oraz konfigurację, tokenizer i kod modelowania, co oznacza, że model jest naprawdę dostępny do pobrania i uruchomienia dla każdego, kto ma odpowiedni sprzęt. Z kolei nvidia/ folder jest nadal oznaczony jako „wkrótce”, raport techniczny wciąż ma się ukazać, a własna sekcja benchmarków repozytorium nadal podaje „wstępne, częściowe wyniki”. Zatem trafne stwierdzenie na dziś nie brzmi „wagi są udostępnione” ani „wag brakuje” — chodzi o to, że checkpointy jednego stosu sprzętowego są opublikowane, a drugiego nie, co jest realnym ograniczeniem dla każdego, którego klaster to NVIDIA.
Dwie inne rzeczy zmieniły się po cichu. Repozytorium GitHub nadal otrzymywało commity jeszcze długo po początkowym wydaniu z 1 września, więc udostępniony kod jest utrzymywany, a nie odłożony na półkę. A licznik pobrań w repozytorium Hugging Face nadal wskazuje zero, co mówi mniej o samym modelu, a więcej o odbiorcach: model dyfuzyjny 16B-A1B z checkpointami przygotowanymi przede wszystkim pod Ascend jest skierowany do laboratorium, a nie do zespołu produktowego szukającego w tym kwartale hostowanego endpointu.
Gdzie te dwa rzeczywiście się nakładają, a gdzie nie
Rozumienie obrazu to część wspólna, i jest węższa, niż się wydaje. Oba modele potrafią spojrzeć na obraz i odpowiedzieć na pytania o niego, co stanowi całe zadanie dla Qwen3.8-Omni-Flash i jedno z sześciu zadań dla InternLumina U2. Wszystko poza tym rozchodzi się diametralnie. InternLumina U2 może następnie edytować ten obraz lub wygenerować nowy na podstawie promptu, w tym samym modelu, używając tego samego słownika wizualnego, którego użył do jego odczytania. Qwen3.8-Omni-Flash nie potrafi wygenerować ani jednego piksela, ale przyjmie godzinę dźwięku i wideo w jednym wywołaniu i powie ci, kto mówił, kiedy i co zostało postanowione — czego materiały publikowane przez InternLumina U2 w ogóle nie deklarują.
Obszar nakładania się, który ma mniejsze znaczenie, niż ludzie przypuszczają, to wideo. Oba rozwiązania są opisywane jako obsługujące wideo, ale robią z nim różne rzeczy: jedno polega na rozumieniu długiego nagrania jako dokumentu, drugie na traktowaniu wideo jako modalności wizualnej obok 3D. Zespół, który potrzebuje podsumowania godzinnego materiału filmowego, nie skorzysta z drugiego rozwiązania, a zespół, który potrzebuje wygenerowania klatki, nie skorzysta z pierwszego.

Koszt, kontrola i to, co tak naprawdę kupujesz
Porównanie cen nie jest porównaniem tego samego rodzaju. Qwen3.8-Omni-Flash rozlicza się za token — 0,15 USD za milion tokenów wejściowych, 0,016 USD za tokeny z pamięci podręcznej, 0,47 USD za tokeny wyjściowe według cennika międzynarodowego, z odrębnym cennikiem dla Chin kontynentalnych, którego nie da się porównać — a jego premierowy nagłówek to zgłoszona przez dostawcę obniżka o ponad 98% kosztu godziny wejścia audio, obliczona przez wycenę dwuminutowej próbki i pomnożenie przez trzydzieści, przy wideo próbkowanym w 720p i jednej klatce na sekundę. InternLumina U2 nie pobiera żadnych opłat, bo nie ma czego rozliczać: kosztem jest twój sprzęt i twój czas, a sama karta modelu nie podaje wartości przepustowości, która pozwoliłaby przeliczyć to na liczbę na token.
To jest cały kompromis w jednym zdaniu. API daje ci możliwości, których nie możesz hostować, oraz koszt godzinowy, który skaluje się wraz z użyciem; otwarte wagi dają stały koszt i pełną kontrolę nad ścieżką danych, za cenę stosu inferencyjnego, który musisz zbudować, oraz zestawu checkpointów, który obecnie oznacza sprzęt Ascend. W przypadku obciążeń podlegających regulacjom, w których multimedia nie mogą opuścić budynku, to drugie nie jest preferencją — to jedyna opcja na tej stronie. Dla zespołu, który w tym miesiącu potrzebuje analizy długich nagrań audio, to pierwsze jest jedyną opcją na tej stronie.
OrcaRouter nie hostuje dziś żadnego z tych modeli i wolimy powiedzieć to wprost, niż sugerować ścieżkę routingu, która nie istnieje: Qwen3.8-Omni-Flash działa wyłącznie na własnych platformach Alibaba, a InternLumina U2 to plik do pobrania, a nie endpoint. To, co uruchamiamy, to reszta linii Qwen3.8 — Qwen3.8-Flash i Qwen3.8-Max — przez jedno API w cenie katalogowej dostawcy z 0% marży, co jest praktycznym sposobem utrzymania działającego punktu odniesienia dla strony modeli zamkniętych w tym porównaniu, podczas gdy strona otwartych wag wciąż porządkuje swoje checkpointy NVIDIA.

Który właściwie powinieneś wybrać
Wybierz InternLumina U2, jeśli potrzebujesz jednego modelu, który czyta, generuje i edytuje obrazy, i jesteś gotów samodzielnie utrzymywać stos wnioskowania — oraz jeśli twoje akceleratory to Ascend albo możesz poczekać na punkty kontrolne NVIDIA. To jedyny z tych dwóch modeli, który potrafi tworzyć obraz, i jedyny, który możesz uruchomić bez wysyłania danych do dostawcy. Traktuj jego wyniki benchmarków jako niepotwierdzone, dopóki nie pojawi się raport techniczny, ponieważ karta modelu mówi dokładnie to.
Wybierz Qwen3.8-Omni-Flash, jeśli Twoim problemem są godziny audio i wideo, a nie piksele na wyjściu — inteligencja spotkań, analiza długich nagrań, praca agentowa w dużym stopniu oparta na audio po chińsku i angielsku — oraz jeśli możesz zaakceptować zależność od jednego źródła i wyjście wyłącznie tekstowe. Jego historia kosztów jest mocna w przypadku godzin audio wejściowego, a znacznie słabsza w przypadku całkowitego rachunku, jego benchmarki są raportowane przez dostawcę i niepowtórzone, a pierwsze pojawiające się testy stron trzecich plasują go w 28. percentylu pod względem rozumowania, na próbie wystarczająco małej, by powinna skłonić do testu, a nie do decyzji.
Jeśli potrzebujesz obu, są one dopełnieniem, a nie alternatywą: model obrazowy o otwartych wagach, który hostujesz, i zamknięty model do długich multimediów, do którego kierujesz wywołania. Żadnego z nich nie da się dziś trasować przez nas. Z jednej strony warto wypatrywać checkpointu NVIDIA i raportu technicznego; z drugiej — pierwszej niezależnej ewaluacji, która jeszcze nie istnieje i która jest największą luką we wszystkim, co napisano o Qwen3.8-Omni-Flash jak dotąd.
