Karta hero dla porównania „InternLumina-U2 vs Gemini Omni 1.1 Flash” z podtytułem „Model, którego jeszcze nie możesz uruchomić, vs ten, za który płacisz za sekundę” i trzema chipami statystyk — „InternLumina-U2: tylko kod, wagi wkrótce”, „Gemini Omni 1.1 Flash: GA 27 sierpnia 2026”, „0,03–0,30 USD za sekundę wideo” — z logo OrcaRouter w prawym dolnym rogu.
Guides & Insights

InternLumina-U2 vs Gemini Omni 1.1 Flash: model, którego jeszcze nie uruchomisz, oraz ten, za który płacisz za sekundę

Autor

Rowan Sterling

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Jeśli Twój termin upływa w tym tygodniu, to porównanie ma jednozdaniową odpowiedź. Gemini Omni 1.1 Flash to powszechnie dostępny model generowania wideo firmy Google — wywołujesz go przez API, a on zwraca klip ze zsynchronizowanym dźwiękiem, i płacisz za każdą sekundę wygenerowanego materiału. InternLumina-U2 to po cichu opublikowany model badawczy Shanghai AI Laboratory na licencji Apache-2.0 — możesz pobrać jego kod wnioskowania, ale nie wagi, które laboratorium nadal oznacza jako „coming soon”. Jeden to produkt, który możesz kupić od ręki; drugi to zakład w postaci publikacji naukowej — w ogóle nie da się go uruchomić. Interesujące pytanie brzmi: dlaczego w ogóle ktoś miałby umieszczać je w tym samym zdaniu i co każde z nich mówi ci o tym, dokąd otwarte badania multimodalne zmierzają pod koniec 2026 roku.

Wszystko poniżej jest oznaczone źródłem. Szczegóły InternLumina-U2 pochodzą z repozytorium GitHub i strony projektu, które laboratorium opublikowało 1 września 2026 r. — tego samego dnia, w którym na Hugging Face pojawił się pusty placeholder — a każda z jego wartości benchmarkowych jest raportowana przez producenta, ma charakter wstępny i nie została niezależnie odtworzona. Szczegóły Gemini Omni 1.1 Flash pochodzą z oficjalnych materiałów Google oraz strony z cennikiem modelu, który stał się powszechnie dostępny 27 sierpnia 2026 r.

Dwie odpowiedzi na to samo pytanie „multimodalne”.

Oba modele funkcjonują pod luźnym hasłem „jeden model, wiele modalności” i to właśnie ta wspólna etykieta jest jedynym powodem, dla którego są ze sobą porównywane. Pod nią nie mają ze sobą niemal nic wspólnego. Gemini Omni 1.1 Flash to zamknięta, hostowana usługa generowania wideo nastawiona przede wszystkim na obraz: podajesz tekst, obraz, krótki klip referencyjny lub audio, a ona generuje do dziesięciu sekund wideo 720p z wbudowaną mową, muzyką i efektami dźwiękowymi, które można wydłużać o dziesięciosekundowe przyrosty, aż do czterdziestosekundowej sceny. Model analizuje posiadany klip – etap wydłużania sprawdza teraz do dziesięciu sekund wcześniejszego kontekstu zamiast poprzedniej jednej sekundy – i obsługuje sterowanie pierwszą/ostatnią klatką, dzięki czemu możesz ustalić początek i koniec ujęcia, a model wypełni środkową część. To narzędzie do tworzenia ruchomych obrazów, sprzedawane za sekundę.

InternLumina-U2 to zakład w przeciwnym kierunku: pojedynczy rzadki model mieszanki ekspertów, mający łącznie 16B parametrów, z czego 1B aktywnych, który twierdzi, że rozumie obrazy, wideo i zasoby 3D oraz generuje i edytuje obrazy za pośrednictwem jednego wspólnego interfejsu dyskretnych tokenów. Jego strona wizualna jest w pełni dyskretna — osiem komplementarnych książek kodowych z tokenizera, który laboratorium nazywa AToken, sprawia, że każda pozycja wizualna jest opisana ośmioma kodami zamiast jednym — a strona językowa to szkielet dyfuzyjny, który laboratorium rozwija z LLaDA-2.0. Założenie jest takie, że rozumienie i generowanie powinny wzajemnie się wzmacniać w jednym zestawie wag, zamiast być zszywane z modeli specjalistycznych. To, czy to działa, pozostaje obecnie pytaniem bez odpowiedzi: model nie jest nigdzie uruchamialny, ponieważ jego wagi nie istnieją publicznie.

Tablica wyników, jeśli można to tak nazwać

Rzetelna tablica wyników dla tej pary musi w każdym wierszu zawierać pochodzenie danych, ponieważ jedna kolumna to produkt dostępny na rynku z opublikowanymi cenami, a druga to niepublikowane twierdzenie badawcze bez żadnej ceny.

• Co to jest — Gemini Omni 1.1 Flash: hostowany model generowania i edycji wideo (identyfikator modelu gemini-omni-1.1-flash), GA 27 sierpnia 2026. InternLumina-U2: otwarty naukowo dyfuzyjny LLM do wszechstronnego rozumienia wizualnego, generowania i edycji obrazów, kod opublikowany 1 września 2026.

• Wagi — Gemini Omni 1.1 Flash: brak, zamknięty i wyłącznie hostowany. InternLumina-U2: również brak na razie, ale na licencji Apache-2.0 i wyraźnie oznaczony jako „wkrótce”.

• Otrzymywane wyniki — Gemini Omni 1.1 Flash: 10-sekundowe klipy 720p z dźwiękiem, możliwość wydłużenia do 40 sekund; skalowanie do 1080p i 4K; tekst na boku. InternLumina-U2: jeszcze nic — kod wnioskowania i plan działania.

• Co przyjmuje na wejściu — Gemini Omni 1.1 Flash: tekst, obraz, wideo (do ~131 tys. tokenów wejściowych; trzy 10-sekundowe klipy na zapytanie), audio. InternLumina-U2: twierdzi, że obsługuje tekst, naturalne obrazy, gęste wykresy, wideo na podstawie ponad 64 próbkowanych klatek oraz zasoby 3D GLB/GLTF renderowane do 64 widoków koloru i głębi.

• Jak to uruchomić — Gemini Omni 1.1 Flash: API Gemini od Google przez stanowy Interactions API; dostęp konsumencki przez Google Flow dla subskrybentów AI Plus, Pro i Ultra. InternLumina-U2: tylko self-host, i to dopiero po udostępnieniu wag; kod wymaga podzielonego katalogu checkpointów, wag tokenizera AToken, FlashAttention oraz Blendera 4.5 do ścieżki 3D.

• Ile to kosztuje — Gemini Omni 1.1 Flash: 0,03 USD/s w wersji roboczej 360p, 0,10 USD/s w 720p, 0,15 USD/s w 1080p, 0,30 USD/s w 4K, z cennikiem tokenów wynoszącym 1,50 USD za milion tokenów wejściowych i 9,00 USD za milion tokenów tekstu na wyjściu. InternLumina-U2: tyle, ile kosztują twoje własne GPU, gdy tylko powstanie.

A comparison scoreboard for InternLumina-U2 and Gemini Omni 1.1 Flash: InternLumina-U2 with Type 16B-A1B diffusion MoE, Weights Apache-2.0 not yet public, Core job Understand & generate stills, Status code only weights 'soon', Price none yet, Run it no one can today; Gemini Omni 1.1 Flash with Type closed hosted video model, Weights none Google API only, Core job video gen & edit with audio, Status GA Aug 27 2026, Price $0.03–$0.30 per second, Run it Gemini API (Interactions), with a footer noting InternLumina figures are vendor-reported and Gemini pricing is per Google, and the OrcaRouter logo in the bottom-right corner.

Te dwie kolumny nie mierzą tej samej osi. Strona Gemini jest wyceniona, udostępniana i natychmiast użyteczna; strona InternLumina to specyfikacja modelu, który nie jest jeszcze modelem.

Część, która jest faktycznie aktualna: GA Gemini Omni 1.1 Flash

W tym tygodniu Gemini Omni 1.1 Flash ma znaczenie samo w sobie, ponieważ to moment, w którym linia wideo omni Google przestała być tylko wersją preview. Wcześniejszy endpoint preview Gemini Omni Flash ma zostać wyłączony 30 września 2026 roku, a ten model GA jest zamiennikiem, na który przenoszeni są deweloperzy. Lista ulepszeń jest konkretna: rozszerzenie sceny do czterdziestu sekund oparte na dziesięciosekundowych przyrostach, sterowanie klatkami kluczowymi, dzięki któremu można określić pierwszą i ostatnią klatkę, a model wygeneruje łączący je materiał; klipy referencyjne do trzech sekund utrzymujące spójność postaci lub scenerii; oraz poziom roboczy 360p wyceniony na jedną trzecią ceny 720p, działający do 60% szybciej przy iterowaniu promptów przed kosztownym finalnym renderem. Jeśli budujesz pipeline'y wideo, tabela cen — 0,10 USD za sekundę 720p, 1,01 USD za klip dziesięciosekundowy, około 4 USD za czterdziestosekundową scenę 720p złożoną z czterech wywołań rozszerzeń — to liczba, która zmienia Twój model kosztów.

Nic z tego nie czyni go konkurentem dla InternLumina-U2 w żadnym sensie operacyjnym. Gemini Omni 1.1 Flash generuje ruch; InternLumina-U2 — o ile jej twierdzenia przetrwają kontakt z wagami — będzie rozumieć ruch i generować nieruchome obrazy. Zespół, który w tym kwartale potrzebuje wideo produktowego, nie stoi przed wyborem między tymi dwoma — model Gemini jest jedynym z tej pary, który w ogóle można wywołać, i jest dostępny przez własne API Google oraz kilka platform zewnętrznych.

A screenshot of the Gemini API Models documentation on Google's AI developer site (captured September 2 2026), showing the sidebar navigation listing the current Gemini model family including the Gemini Omni line.

Dokumentacja „Models” API Gemini w witrynie deweloperskiej AI Google, zarchiwizowana 2 września 2026 r. — strona z listą bieżącej rodziny modeli Gemini, z linią Gemini Omni w nawigacji bocznej.

Ta część, która w ogóle nie jest aktualna: InternLumina-U2

Premiera InternLumina-U2 z 1 września była najcichszą z możliwych: trzy commity w repozytorium GitHub, strona projektu, 28-bajtowy stub na Hugging Face, którego całą zawartość stanowi nagłówek licencji Apache-2.0, i żadnego ogłoszenia. To, co jest naprawdę publiczne, to harness wnioskowania i architektura – i warto je uważnie przeczytać właśnie dlatego, że nikt nie był w stanie przetestować samego modelu. Repozytorium pokazuje sterownik z jednym punktem wejścia na zadanie: tekst, generowanie tekstu na obraz do 1024×1024, rozumienie obrazów – zarówno naturalnych zdjęć, jak i gęstych wykresów – edycję obrazów na podstawie instrukcji z opcjonalnym trybem dual-CFG, rozumienie wideo na 64 próbkowanych klatkach oraz rozumienie 3D na widokach GLB/GLTF renderowanych w Blenderze. Projektowy zakład polega na tym, że dyskretny słownik wizualny z wieloma książkami kodowymi pozwala jednemu backbone’owi robić to wszystko bez zwiększania długości sekwencji – ten sam instynkt, zgodnie z którym „tokeny wizualne powinny nieść więcej informacji”, napędza kodekowe modele wideo, tutaj zastosowany do ujednoliconego interfejsu rozumienia i generowania.

A screenshot of the GitHub repository InternLM/InternLumina-U2 (captured September 2 2026), showing the Apache-2.0 repo landing page, the 'Multi-Codebook Diffusion Large Language Model for Omni-Visual Understanding, Image Generation and Editing' description, three commits, and the per-task inference scripts.

Repozytorium InternLM/InternLumina-U2 na GitHubie, zarejestrowane 2 września 2026 r. — strona repozytorium na licencji Apache-2.0 z opisem „Multi-Codebook Diffusion Large Language Model", trzema commitami oraz skryptami inferencji dla poszczególnych zadań, które stanowią całość dotychczasowego publicznego udostępnienia.

Tabela wyników na stronie projektu jest przez samo laboratorium oznaczona jako „wyniki wstępne, częściowe”, a zawarte w niej liczby są obosieczne: wysokie wyniki dla wykresów i dokumentów (ChartQA 86,52; CharXiv-DQ 83,65 – deklarowane przez dostawcę) sąsiadują z wynikiem GenEval 0,81, który ustępuje wynikowi 0,89 osiągniętemu przez co najmniej jeden model, który – zdaniem laboratorium – jest przez nie przewyższany. Nie ma niezależnej oceny, bo nie ma modelu, który można by ocenić. Wszystko, co dotyczy faktycznej jakości, pozostaje wyłącznie deklaracją, dopóki w tym pustym repozytorium Hugging Face nie pojawią się pliki safetensors.

Co robi warstwa routingu, gdy istnieje tylko jedna strona

To jedno z tych porównań, w których aspekt routingu naprawdę dotyczy czasu, a nie wyboru. Nie będziemy udawać, że OrcaRouter obsługuje InternLumina-U2 — nikt nie może, wagi nie zostały udostępnione — a Gemini Omni 1.1 Flash również nie ma w naszym katalogu; docierasz do niego przez własne API Google. Do czego więc tak naprawdę służy warstwa routingu w tej luce? Do utrzymywania otwartych opcji bez dwukrotnego przebudowywania pipeline’u. Mechanizmem jest model pass-through: gdy hostowany model dostawcy w końcu trafia do katalogu, cena katalogowa dostawcy jest przekazywana dalej z marżą 0%, więc stawka za sekundę publikowana przez dostawcę to dokładnie ta stawka za sekundę, którą płacisz za pomocą jednego klucza, a nie umowy z każdym dostawcą z osobna. A gdy w końcu pojawi się wydanie wag na licencji Apache-2.0, takie jak InternLumina-U2, racjonalnym posunięciem nie jest wyrywanie działającego stacku wideo — lecz postawienie nowego modelu na ścieżce testowej za automatycznym failover, tak aby za pierwszym razem, gdy niesprawdzony model dyfuzyjny zacznie zachowywać się nieprawidłowo, wywołanie wróciło do modelu, któremu już ufasz, bez zmiany kodu. Wypróbuj nowość tam, gdzie nie może ci zaszkodzić; kieruj ruch na to, co płaci rachunki.

Werdykt

Jeśli w tym miesiącu potrzebujesz wideo, decyzja zapadła za Ciebie: Gemini Omni 1.1 Flash jest realny, ma cenę i jest powszechnie dostępny, a InternLumina-U2 nie może zostać wywołany przez nikogo. Jeśli obserwujesz, dokąd zmierzają otwarte badania multimodalne, InternLumina-U2 jest ciekawszym artefaktem — rzadkim, w pełni dyskretnym zakładem multi-codebook złożonym przez duże laboratorium, na licencji Apache-2.0, z architekturą już publiczną i wagami, które prawdopodobnie niedługo się pojawią. Traktuj repozytorium jako zapowiedź kierunku badawczego, ogólnie dostępny model wideo jako narzędzie, na którym możesz budować już dziś, i nie pozwól, by wspólna etykieta „multimodalny” przekonała Cię, że konkurują o to samo zadanie.

© 2026 OrcaRouter

Dla dostawców

Prowadzisz platformę inferencyjną? Udostępnij swoje modele w OrcaRouter.

providers@orcarouter.ai

Dołącz do społeczności

Discordsupport@orcarouter.aiXGitHubYouTube