
Ling-3.0-flash-VL kontra InternLumina U2: oba wydane, inny krzem
- deepseekNOWOŚĆDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiNOWOŚĆOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleNOWOŚĆGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenNOWOŚĆQwen: Qwen3.8 Max (0902)2026-09-0240Inteligencja72Kod
- anthropicNOWOŚĆAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 za 1 mln tokenów
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0340Inteligencja72Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligencja78Kod
- googleGoogle: Gemini 3.6 Flash2026-07-2134Inteligencja69Kod
Oba te modele są teraz prawdziwe, uruchamialne i możliwe do pobrania, co nie było prawdą dwa tygodnie temu — a różnica między nimi prawie nie ma nic wspólnego z benchmarkami. Ling-3.0-flash-VL z laboratorium inclusionAI firmy Ant Group umieścił w Hugging Face wagi BF16 i FP8 między 4 a 8 września 2026 r., opublikował wraz z nimi receptury serwowania SGLang i vLLM i uzyskał niezależny wynik 25 w Artificial Analysis Intelligence Index v4.3. InternLumina U2 z zespołu InternLM należącego do Shanghai AI Laboratory najpierw udostępnił kod wnioskowania, a następnie opublikował swoje wagi modelu wytrenowane na Ascend na Hugging Face 10 września — siedem shardów safetensors w podfolderze o nazwie ascend/, co dopełnia repozytorium do szesnastu plików.
Haczyk polega na tym, do czego zbudowano te dwa wydania wag. Opublikowana ścieżka Ling-3.0-flash-VL to ta CUDA, którą wszyscy już mają: węzeł z ośmioma akceleratorami uruchamia kompilację FP8, a stosy serwujące to te, które już uruchamiasz. Opublikowany checkpoint InternLumina U2 to wersja dla Ascend, a README wyraźnie mówi, że pobierasz ten checkpoint, który pasuje do sposobu, w jaki planujesz uruchamiać inferencję — przy czym checkpoint trenowany przez NVIDIA jest wciąż wymieniony jako „wkrótce”. Dwa modele wydane w tym samym tygodniu, a tylko jeden z nich działa na sprzęcie, przed którym stoi większość zespołów.
To użytecznie przeformułowuje porównanie. Nie jest to już materiał o wydanym produkcie kontra vaporware, a każdy, kto wciąż opisuje InternLumina U2 jako oczekujące na wagi, pracuje na tygodniowym README. To materiał o dwóch bardzo różnych projektach zunifikowanej wizualizacji, które pojawiły się w dwóch różnych ekosystemach krzemowych, oraz o tym, które części każdego wydania są faktycznie ukończone.
Co teraz zawiera każde wydanie
Ling-3.0-flash-VL to 124B-parametrowy rzadki model typu mixture-of-experts, aktywujący około 5,5B parametrów na token, oparty na 42-warstwowym hybrydowym trzonie, w którym Kimi Delta Attention występuje naprzemiennie z bramkowanymi blokami MLA w stosunku 5:1. Enkoder wizyjny o dowolnej rozdzielczości i dwuwarstwowy projektor MLP zasilają ten trzon, a VideoRoPE odpowiada za pozycję przestrzenną i czasową. Model przyjmuje tekst, obrazy i wideo, a zwraca tekst. Zarówno BF16 (64 shardy), jak i FP8 (około 126 GB; wieża wizyjna celowo utrzymana w wyższej precyzji niż wagi ekspertów) są publicznie dostępne na licencji MIT, a wydanie jest na tyle kompletne, że niezależna społeczność benchmarkowa je oceniła — 25 punktów w Intelligence Index v4.3, miejsce #2 spośród 64 w swojej klasie rozmiarowej, przy medianie klasowej wynoszącej 8. Nie publikuje natomiast ceny za token dla modelu wizyjnego, a jego przykłady API zawierają -rc1 identyfikator, który pozostawia otwartą kwestię, czy serwowany checkpoint odpowiada otwartym wagom.
InternLumina U2 to rzadki model typu mixture-of-experts o 16 mld parametrów i około 1 mld aktywnych parametrów, zbudowany na szkielecie dyfuzyjnego modelu językowego LLaDA-2.0 MoE, obejmujący sześć rodzin zadań w jednym modelu: QA tekstowe, generowanie obrazów z tekstu, rozumienie obrazów, edycja obrazów, rozumienie wideo i rozumienie 3D. Kod inferencyjny dla wszystkich tych zadań jest publicznie dostępny na main. Wytrenowany na Ascend checkpoint jest teraz publicznie dostępny na Hugging Face. Wciąż brakuje, zgodnie z własną roadmapą repozytorium: checkpointu wytrenowanego na NVIDIA, kodu treningowego (osobne repozytorium) i raportu technicznego. Roadmapa odhacza cztery punkty i pozostawia dwa otwarte — kod inferencyjny, wagi Ascend oraz stos treningowy i inferencyjny Ascend są gotowe; kod treningowy i raport techniczny nie.
Między tymi dwoma akapitami kryje się jeden praktyczny szczegół. Uruchamianie ścieżek wizyjnych U2 wymaga wag tokenizera AToken w atoken_inference/checkpoints/atoken-sod.pt, a udostępniony sterownik oczekuje rozdzielonego katalogu checkpointów, w którym zasoby modelu są przechowywane razem. Kod jest prawdziwy i instaluje się w oparciu o Python 3.11, PyTorch 2.6.0, a na ścieżce CUDA — flash-attn 2.7.2. Wsparcie dla Ascend znajduje się w osobnej ascend-npu-support gałęzi i wymaga CANN oraz pasującego torch_npu builda zamiast zestawu narzędzi CUDA. Nic z tego nie jest ukryte; wszystko to jest udokumentowane. To po prostu dłuższa droga niż pip install i ciąg znaków modelu.
Dwie odpowiedzi na pytanie „czym jest token wizualny”
Architektury różnią się czymś głębszym niż liczba parametrów, a ta różnica jest najciekawszą rzeczą w zestawieniu ich obu obok siebie.
Ling-3.0-flash-VL zachowuje standardowy kontrakt. Obraz staje się sekwencją tokenów poprzez enkoder wizji i projektor, te tokeny trafiają do rdzenia transformera, a wszystko działa autoregresyjnie. Nowość nie polega na tym, jak reprezentowana jest wizja, lecz na tym, jak tanio działa rdzeń — 5,5B aktywnych parametrów na token z 124B łącznie, co jest całym powodem, dla którego model pojawia się na granicy inteligencji względem aktywnych parametrów. VideoRoPE nadaje pozycji przestrzennej i czasowej jedno spójne kodowanie, dzięki czemu wideo nie wymaga osobnych mechanizmów.
InternLumina U2 zmienia samą reprezentację. Wykorzystuje tokenizator AToken firmy Apple, w którym każda pozycja wizualna jest opisywana przez osiem komplementarnych ksiąg kodowych — lokalną teksturę, wbudowany tekst, geometrię i detale wysokoczęstotliwościowe jako osobne strumienie, a nie jeden skondensowany wektor. Każda księga kodowa zachowuje własne osadzenie na wejściu, a osiem osadzeń dla poszczególnych pozycji jest konkatenowane i rzutowane w dół do pojedynczego tokenu szkieletu. Na wyjściu predykcja jest tym, co zespół nazywa przestrzennie równoległą, autoregresyjną w wymiarze głębokości ksiąg kodowych: szkielet dyfuzyjny odszumia jednocześnie wiele zamaskowanych pozycji przestrzennych, a następnie głowica autoregresyjna z wieloma księgami kodowymi przewiduje po kolei osiem kodów dla każdej pozycji. Rozumienie i generowanie przebiegają przez ten sam mechanizm — co jest właściwą tezą. Argument zespołu jest taki, że pojedyncza księga kodowa ogranicza, ile informacji może przenosić jeden token wizualny, podczas gdy hybrydy dyskretno-ciągłe rozdzielają rozumienie i generowanie między różne reprezentacje i ścieżki dekodowania, a przejście w pełni na tryb dyskretny z wieloma księgami kodowymi pozwala uzyskać naprawdę zunifikowany model, a nie dwa sklejone ze sobą stosy.
Oba te stanowiska są spójne i niosą ze sobą przeciwne koszty. Reprezentacje z wieloma codebookami mogą przechowywać drobniejsze szczegóły wizualne; mnożą też budżet tokenów na obraz przez liczbę codebooków i czynią dekodowanie znacznie bardziej złożonym, co prawdopodobnie częściowo tłumaczy, dlaczego wybrano skalę 16B-A1B. Rzadkość Ling zapewnia tanią inferencję na token; oznacza także mniejszą aktywną pojemność na pojedynczy przebieg w przód, co jest kompromisem, który po cichu ilustruje mediana w klasie wynosząca 8 w indeksie inteligencji — Ling-3.0-flash-VL bez trudu ją przekracza, osiągając 25, ale nie konkuruje z gęstymi modelami z czołówki pod względem surowego rozumowania.
Obszary zadań pokrywają się tylko częściowo.
Zaszeregowanie obu pod „model multimodalny" wyolbrzymia zakres ich pokrywania się. Wiedza o tym, gdzie się on kończy, zapobiega wielu nietrafionym porównaniom.
• Wejścia — Ling-3.0-flash-VL przyjmuje tekst, obrazy i wideo, do 40 obrazów na żądanie, i zwraca tekst; InternLumina U2 przyjmuje tekst, obrazy, wideo i zasoby 3D, a zwraca tekst, wygenerowane obrazy lub obrazy poddane edycjibr /> • Generowanie obrazów — Ling-3.0-flash-VL nie potrafi w ogóle generować ani edytować obrazów; kluczowe twierdzenie InternLumina U2 jest takie, że robi jedno i drugie, do rozdzielczości 1024×1024, przy użyciu tych samych wag, które odczytują obrazybr /> • 3D — Ling-3.0-flash-VL nie ma żadnej ścieżki 3D; InternLumina U2 dostarcza oparty na Blenderze potok, który renderuje zasoby GLB i GLTF do 64 sparowanych widoków koloru i głębi, na których model ma wnioskowaćbr /> • Wideo — Ling-3.0-flash-VL obsługuje wideo za pomocą czasowego kodowania VideoRoPE; InternLumina U2 próbkuje 64 klatkibr /> • Kontekst i dane wyjściowe — Ling-3.0-flash-VL odnotowuje okno kontekstu wynoszące 262K tokenów w zestawieniu z 256K podanymi w jej karcie modelu, a także stosunkowo krótkie maksymalne dane wyjściowe; InternLumina U2 nie opublikowała żadnej z tych wartościbr /> • Aktywne parametry — Ling-3.0-flash-VL aktywuje około 5,5B na token; InternLumina U2 aktywuje około 1B, czyli jedną piątą tego
Przeczytaj tę listę, a wniosek jest taki, że te dwa modele są substytutami dokładnie w jednym zadaniu — odczytywaniu obrazu i odpowiadaniu na pytania o niego — a niemal wszędzie indziej się uzupełniają. Jeśli potrzebujesz modelu, który generuje lub edytuje obraz, Ling-3.0-flash-VL nie jest kandydatem i żaden benchmark tego nie zmieni. Jeśli potrzebujesz jednego modelu, który odczytuje wykres, generuje wariant i prowadzi rozumowanie na temat zasobu 3D, InternLumina U2 jest do tego stworzony, a Ling-3.0-flash-VL tego nie obsługuje.

Benchmarki: jeden niezależny wynik kontra cała strona liczb od dostawców
Jakość dowodów nie jest wyrównana i warto precyzyjnie wyjaśnić dlaczego, zamiast ogłaszać zwycięzcę.
Wynik 25 modelu Ling-3.0-flash-VL w Intelligence Index v4.3 pochodzi z niezależnego testu przeprowadzonego według opublikowanego protokołu, przy medianie dla tej klasy wynoszącej 8 dla kontekstu, a zmierzona przepustowość to 142,9 tokena wyjściowego na sekundę wobec mediany wynoszącej 105,1 u konkurentów, przy czasie do pierwszego tokena wynoszącym 2,21 sekundy. W karcie producenta podano osobno wynik 42 w wycofanym protokole v4.1.1, który opiera się na innej skali i nie można go zestawiać z wynikiem 25 tak, jakby model zanotował spadek; indeks został zaktualizowany we wrześniu 2026 r. i ponownie oceniony w całości. Producent raportuje także zwycięstwo 1 441 do 1 440 w Image-to-WebDev Arena nad GPT-5.4 pod pseudonimem „linthium” — jednopunktowa przewaga mieszcząca się w szumie Elo, na dodatek zgłoszona przez producenta.
Liczby InternLumina U2 pochodzą od samego laboratorium, są oznaczone jako wstępne i częściowe, a pełne tabele porównawcze i raport techniczny wciąż są w przygotowaniu. Obecnie znajdują się w tabeli w README repozytorium, a nie na tablicy wyników benchmarku, i nie można ich jeszcze niezależnie zweryfikować, ponieważ żadna strona trzecia nie opublikowała przebiegu. Podane tak, jak podaje je laboratorium:
• Rozumienie — ChartQA 86.52, CharXiv-DQ 83.65, HallusionBench 62.15, MMMU-Pro 36.13, MathVision 33.22, DynaMath 56.37br /> • Wideo — Video-MME 51.26, MVBench 59.74, MLVU 57.03br /> • Generowanie i edycja — GenEval 0.81, DPG 87.10, TIIF Short 84.60, TIIF Long 85.95, ImgEdit 3.83br /> • Źródła danych — każda wartość InternLumina U2 jest podana przez dostawcę i ma charakter wstępny; każda wartość Ling-3.0-flash-VL jest podana przez dostawcę, z wyjątkiem Intelligence Index, który pochodzi od Artificial Analysis
Dwie z tych wartości zasługują na oznaczenie flagą. Zgodnie z własną tabelą laboratorium GenEval 0,81 ustępuje wynikowi 0,89 konkurenta wskazanego z nazwy — rzadki przypadek, gdy dostawca publikuje porażkę, i powód, by nieco bardziej ufać reszcie arkusza. A ImgEdit na poziomie 3,83 jest pozbawione znaczenia bez towarzyszącej tabeli, która jest częścią tego, co ma zawierać przygotowywany raport techniczny. Traktuj listę InternLumina U2 jako wyniki, których laboratorium zamierza bronić, a nie jako wyniki, na podstawie których można działać. Zauważ też, że jego wyniki w zakresie rozumienia i wynik indeksu Ling-3.0-flash-VL nie są porównywalnymi wielkościami: jedna z tych wartości to zbiór liczb dostawcy dla konkretnych zadań, a druga to złożony indeks strony trzeciej.

Licencja, sprzęt i ile faktycznie kosztuje zakład na każde z nich
Ling-3.0-flash-VL jest na licencji MIT w obu formatach precyzji, co jest w zasadzie najczystszym rozwiązaniem, na jakie pozwalają otwarte wagi — żadnych dodatkowych warunków, żadnych ograniczeń zakresu użycia, żadnej niejasności co do wdrożenia komercyjnego. Wersja FP8 o rozmiarze około 126 GB mieści się w jednym węźle ośmiu akceleratorów klasy 80 GB; BF16 to około dwa razy tyle. Obsługa serwowania już istnieje w SGLang oraz w utrzymywanym przez Ant forku vLLM. Pozostałe ryzyko ma charakter komercyjny, a nie prawny: Ant nie publikuje stawki za token dla modelu wizyjnego, darmowy dostęp w Ling Studio ma charakter promocyjny, a nie taryfowy, a Artificial Analysis podaje stawkę 0,00 USD za 1 mln tokenów na wejściu i wyjściu tylko dlatego, że widoczny dla niego endpoint jest tym darmowym.
InternLumina U2 jest na licencji Apache-2.0 w głównym repozytorium, z dwoma wyjątkami wartymi przeczytania: dołączony VeOmni/ zachowuje swoją pierwotną licencję Apache-2.0, a atoken_inference/ jest pochodną ml-atoken firmy Apple i jest redystrybuowany na oryginalnych warunkach Apple. Twierdzenie o infrastrukturze jest poważne — celuje zarówno w GPU NVIDIA, jak i w NPU Huawei Ascend, z wyrównaniem numerycznym na poziomie operatorów między backendami, a zespół donosi o trenowaniu end-to-end na tysiąckartowym klastrze Ascend z 1,85× poprawą wydajności treningu dzięki połączonym operatorom, dostrojonemu shardingowi HSDP i gradient checkpointingowi. To prawdziwa inżynieria. Jest też ortogonalne wobec tego, czy model jest dobry: wydajność treningu na Ascend nie mówi nic o jakości wyników, a checkpoint, który istnieje dziś, to ten skierowany na ten stos.
Tak więc praktyczna asymetria nie polega na otwartości kontra zamkniętości. Oba są otwarte, oba mają licencje permisywne i oba można pobrać już dziś. Rzecz w tym, że jedno wydanie zakłada sprzęt, który prawdopodobnie masz, a drugie zakłada sprzęt, którego prawdopodobnie nie masz. Jeśli twoja flota to NVIDIA, Ling-3.0-flash-VL to praca na jedno popołudnie, a InternLumina U2 to czekanie. Jeśli twoja flota to Ascend — co jest coraz częstsze na chińskim rynku, dla którego powstał ten model — to równanie odwraca się całkowicie i to InternLumina U2 ma gotową ścieżkę, podczas gdy przepisy Ling-3.0-flash-VL zakładają CUDA.
Pytania, które ludzie naprawdę zadają o {{1}}tę parę{{/1}}
Czy wagi InternLumina U2 są już dostępne do pobrania?
Tak, checkpoint wytrenowany na Ascendzie jest — siedem shardów safetensors opublikowanych w ascend/ na Hugging Face, wraz z plikami konfiguracji, tokenizera i modelowania. Checkpoint wytrenowany na NVIDIA to osobny podfolder i nadal widnieje jako wkrótce dostępny, a kod treningowy i raport techniczny wciąż nie zostały udostępnione.
Czy Ling-3.0-flash-VL jest ściśle lepszy, ponieważ ma niezależny wynik?
Nie — ma lepsze dowody i łatwiej go uruchomić na typowym sprzęcie, co jest innym twierdzeniem. Ling-3.0-flash-VL nie potrafi generować ani edytować obrazów, nie przetwarza zasobów 3D i nie ma opublikowanej ceny. Jeśli Twoim zadaniem jest generowanie obrazów, edycja obrazów lub rozumienie 3D, InternLumina U2 to obsługuje, a Ling-3.0-flash-VL nie obsługuje tego wcale, niezależnie od tego, jak wiele benchmarków ma model Ling.
Czy liczba 42 na karcie modelu Ling-3.0-flash-VL przeczy liczbie 25 od Artificial Analysis?
Nie bezpośrednio. Wynik 42 zmierzono względem protokołu Intelligence Index w wersji 4.1.1, a wynik 25 względem wersji 4.3; indeks został ogłoszony na nowo we wrześniu 2026 r. i ponownie przeliczony w całości, a obie wersje opierają się na różnych zestawach ewaluacyjnych. Można powiedzieć, że wynik 42 nigdy nie został niezależnie odtworzony, a wynik 25 został niezależnie wytworzony.
Gdzie można wywołać którekolwiek z tych
Ani Ling-3.0-flash-VL, ani InternLumina U2 nie znajduje się w naszym katalogu modeli, a twierdzenie przeciwne byłoby czymś, co czytelnik mógłby sprawdzić w dziesięć sekund. Ling-3.0-flash-VL jest dostępny przez własną platformę Ant, która udostępnia endpoint zgodny z OpenAI oraz endpoint zgodny z Anthropic, przez bezpłatny dostęp próbny w Ling Studio, a także przez otwarte wagi, jeśli samodzielnie je hostujesz. InternLumina U2 jest dostępna przez checkpoint na Hugging Face i sterownik inferencji z repozytorium, na sprzęcie docelowym tego checkpointu.
Trasa „What we do” to model wizyjny, z którym to zestawienie najczęściej bywa porównywane w praktyce: DeepSeek V4 Flash Vision Exp, dostępny w katalogu z oknem kontekstowym na 1 mln tokenów i opublikowaną stawką, na tym samym punkcie końcowym zgodnym z OpenAI co reszta katalogu. Gdy laboratorium udostępnia otwarte wagi, warstwa routingu zwykle może zaoferować model, nie czekając, aż własna usługa hostowana laboratorium się ustabilizuje — co stanowi praktyczną różnicę między modelem, który można wycenić, a modelem, który można wywołać. Ta różnica jest aktualna dla Ling-3.0-flash-VL i, na razie, akademicka dla InternLumina U2, którego historia wydania to ścieżka sprzętowa, a nie kwestia hostingu.

Werdykt jest naprawdę podzielony, a dzieli się ze względu na sprzęt i zadanie, a nie na jakość. Ling-3.0-flash-VL to kompletne wydanie: licencja MIT, oba formaty precyzji, oceniane przez podmioty trzecie, CUDA-first i ograniczone do rozumienia. InternLumina U2 to bardziej ambitny projekt i mniej ukończone wydanie: opublikowano checkpoint dla jednego stosu sprzętowego, ujednoliconą powierzchnię sześciu zadań obejmującą generowanie i 3D, a raport techniczny wciąż pozostaje do dostarczenia. Jeśli w tym tygodniu potrzebujesz modelu wizyjnego na sprzęcie NVIDIA, wybór narzuca się sam. Jeśli interesuje Cię projekt multi-codebook InternLuminy U2, tym, na co warto patrzeć, jest checkpoint NVIDIA — a uczciwym stanowiskiem do tego czasu jest to, że jej tabela wyników, w tym wiersz, w którym przegrywa, opisuje model, którego druga połowa nie została jeszcze wydana.
