
MAGI-2-preview trafia do SGLang: co ujawnia nowy PR dotyczący serwowania.
- DeepSeekNOWOŚĆDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 za 1 mln tokenów
- z-aiNOWOŚĆZ.ai: GLM 5.32026-08-1860Inteligencja75Kod
- obsidianNOWOŚĆQwen3.8 27B2026-08-1552Inteligencja68Kod
- qwenNOWOŚĆQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekNOWOŚĆDeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligencja69Kod
- grokNOWOŚĆSpaceXAI: Grok 4.62026-08-1261Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0557Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligencja72Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligencja78Kod
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligencja69Kod
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligencja49Kod
- metaMeta: Muse Spark 1.12026-07-1653Inteligencja71Kod
- kimiMoonshotAI: Kimi K32026-07-1560Inteligencja76Kod
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligencja71Kod
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Inteligencja77Kod
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Inteligencja77Kod
MAGI-2-preview, należący do Sand.ai model generowania wideo typu mixture-of-experts o 114 miliardach parametrów, został udostępniony jako open-source 5 sierpnia 2026 roku — a jedenaście dni później pojawił się pierwszy sygnał, że wkrótce otrzyma infrastrukturę serwującą klasy produkcyjnej. 16 sierpnia w repozytorium SGLang otwarto pull request zatytułowany [diffusion][Model] Support MAGI-2-preview (sgl-project/sglang, PR #35014), a tytuł jest trafny: dodaje on natywne wsparcie serwowania tego modelu do stosu diffusion SGLang. Jednocześnie, w chwili pisania tego tekstu, to wciąż pull request — otwarty, oczekujący na przegląd właścicieli kodu, z nieudanymi kontrolami CI. Nic nie zostało scalone, więc niczego jeszcze nie można serwować. Ale dla każdego, kto rozważa, czy MAGI-2-preview może przejść z referencyjnej konfiguracji Docker-and-torchrun Sand.ai na standardowy runtime serwujący, ten PR to szczegółowa mapa drogowa.
Potraktuj to więc jako zestawienie tego, co wiemy do tej pory, a nie notę wydawniczą. Model jest prawdziwy i został wydany — miało to miejsce 5 sierpnia, z wagami na Hugging Face i kodem na GitHubie na licencji Apache-2.0. Tym, czego nie zweryfikowano, jest kwestia serwowania: integracja z SGLang to pojedynczy otwarty pull request, jego szczegóły mogą się zmienić w trakcie przeglądu, a dopóki nie zostanie scalony, SGLang nie może faktycznie uruchomić MAGI-2-preview. Wartość tkwi w tym, co PR ujawnia na temat modelu oraz ścieżki do uruchomienia go w prawdziwym środowisku uruchomieniowym.
Model, którego dotyczy PR, w jednym akapicie.
MAGI-2-preview to próba Sand.ai, by skalować generowanie wideo tak, jak skalowały się modele językowe — za pomocą mieszaniny ekspertów — i jest następcą open-source'owego MAGI-1 (autoregresyjnego modelu wideo o 24 mld parametrów z kwietnia 2025 r.). Nowy model ma łącznie około 114 mld parametrów, ale aktywuje tylko około 6 mld na token, wykorzystując ultradrobnoziarnistą wielogłowicową architekturę MoE: ukryty stan o wymiarowości 3072 jest dzielony na dwanaście głowic o wymiarowości 256, z których każda kieruje do sześciu z 256 ekspertów, co daje 3072 jednostek eksperckich na warstwę MoE i 72 ekspertów aktywowanych na token w 36 warstwach. To ujednolicony model audio-wideo o pojedynczym strumieniu — tekst, wideo i audio przechodzą przez ten sam transformer i wymieniają informacje poprzez self-attention na każdej warstwie, zamiast przez osobny potok cross-attention. Obsługuje generowanie wideo z tekstu i z obrazu oraz tworzy 10-sekundowe klipy — jedyny obsługiwany czas trwania — ze zsynchronizowaną ścieżką dźwiękową stereo generowaną w tej samej trajektorii odszumiania i multipleksowaną do pliku wyjściowego.
Generowanie przebiega w dwóch etapach. Etap magi2_preview odszumia w rozdzielczości 512×896, a następnie etap magi2_refiner zwiększa rozdzielczość do 1088×1920. Wersja podstawowa wykorzystuje 100 kroków odszumiania w preview i 5 w refiner; Sand.ai zapowiada wersję destylowaną ze znacznie mniejszą liczbą kroków. Zestaw checkpointów to pojedyncze repozytorium Hugging Face o rozmiarze około 307 GB, w skład którego wchodzą: etap preview (228 GB), enkoder tekstu Qwen3.5-27B, refiner (14 GB), audio VAE (5 GB), VAE wideo zapożyczone z Wan2.2-TI2V-5B oraz domyślnie używany destylowany dekoder turbo VAE. Wymagania sprzętowe to osiem GPU NVIDIA Hopper (klasa H100), a referencyjny launcher pozwala przenosić enkoder tekstu, preview, refiner i VAE między CPU a GPU w poszczególnych fazach.
W kwestii wydajności, podawane liczby są raportowane, a nie niezależnie zweryfikowane. Twierdzenia — wynik VBench na poziomie 86,54%, wyprzedzający Sorę 2 (84,37%) i Kling 2.0 (84,20%) w tych samych chińskich doniesieniach prasowych, oraz 6. miejsce w rankingu Artificial Analysis dla modeli image-to-video z Elo w okolicach 1106 — pochodzą od producenta i z relacji z premiery, a żadne z nich nie zostało niezależnie przetestowane przez stronę trzecią w ciągu jedenastu dni od wydania. Sand.ai podaje również koszt inferencji na około 0,5 juana (mniej więcej 0,07 USD) za 10-sekundowy klip 1080p na ośmiu H100, czyli około jednej dziesiątej tego, co kosztują mainstreamowe modele wideo. Traktuj to wszystko jako doniesienia producenta i prasy, dopóki ktoś tego nie zmierzy.

Dlaczego pull request dotyczący serwowania to prawdziwa nowość
Do tej pory istniał dokładnie jeden wspierany sposób uruchomienia MAGI-2-preview: autorski stack referencyjny Sand.ai, obraz Dockera plus torchrun, na ośmiu układach NVIDIA Hopper H100. To wykonalna, ale szyta na miarę ścieżka — dziedziczysz launcher Sand.ai, jego decyzje dotyczące offloadu i jego subiektywny sposób rozmieszczania enkodera tekstu, preview, refinera i VAE pomiędzy poziomami pamięci. Pull request dodający model do SGLang jest ważny, ponieważ SGLang to środowisko uruchomieniowe do serwowania, które duża część świata samodzielnie hostowanej generatywnej AI faktycznie wykorzystuje w produkcji. Wsparcie pierwszej klasy oznacza, że MAGI-2-preview można uruchomić w głównonurtowym środowisku uruchomieniowym z maszynerią SGLang za nim — równoległością sekwencji Ulysses, równoległością ekspertów, offloadem aktywacji, VAE, schedulerem i infrastrukturą etapów potoku. To jest różnica między „Mogę uruchomić to na ich stacku” a „Mogę uruchomić to na stacku, który mój zespół już obsługuje”.
Co właściwie buduje PR
Integracja opiera się na istniejących mechanizmach SGLang, a nie na referencyjnej ścieżce torchrun. PR dodaje wielogłową warstwę MoE, mechanikę attention-sink, lokalną uwagę w oknach blokowych dla etapu refiner oraz wielostrumieniowe hiperpołączenia — elementy architektury MagiMoE, których ogólne warstwy nie wyrażają. Wokół nich wykorzystuje istniejące komponenty SGLang: równoległość sekwencji Ulysses, równoległość ekspertów, offload, VAE, scheduler oraz komponenty etapów potoku. Dostarcza także dokumentację (stronę MAGI-2 cookbook w dokumentacji diffusion SGLang) oraz 47 testów jednostkowych niewymagających GPU, co dobrze świadczy o tym, jak dużą część zachowania modelu można zweryfikować bez wynajmowania ośmiu układów H100.
PR ujawnia również ograniczenia modelu:
Sprzęt — osiem układów NVIDIA Hopper H100, gdzie tryby offloadu cpu / gpu / roundtrip z referencyjnego stosu określają rozmieszczenie enkodera tekstu, podglądu, refinera i VAE pomiędzy fazami.
• Równoległość — --num-gpus musi dzielić każdą oś głowic, podczas gdy --tp-size, --ring-degree oraz --enable-cfg-parallel są odrzucane. To model z wieloma wymiarami routingu, a układ równoległości musi być z nimi zgodny.
• Wyniki — akceptowane są tylko rozdzielczości 1920×1088 i 896×512 oraz wyłącznie 10-sekundowe klipy; torch.compile nie jest obsługiwany.
Ten ostatni zestaw warto przeczytać dwa razy, jeśli planujesz wdrożenie: to model, który – przynajmniej na tym wczesnym etapie integracji – jest ograniczony do dwóch rozdzielczości i jednego czasu trwania.
![Screenshot of SGLang pull request #35014 titled '[diffusion][Model] Support MAGI-2-preview' showing the PR description, the branch merging 5 commits into sgl-project:main, 43 files changed, and the CI checks status, in the sgl-project/sglang repository.](https://cms.orcarouter.ai/api/media/file/3-297.png)
Co wciąż jest niezweryfikowane
Wszystko o pracy nad serwowaniem. PR jest otwarty, czeka na recenzje właścicieli kodu, a kontrole CI nie przechodziły na dzień 16 sierpnia. Pull request tej wielkości może czekać w recenzji dniami lub tygodniami; nie ma scalonego stanu, wydania ani ogłoszenia od SGLang. A twierdzenia dotyczące modelu — wynik VBench, ranking Artificial Analysis, koszt 0,5 juana — są raportowane przez dostawcę i prasę, a nie niezależnie powtórzone. Jeśli dziś zbudujesz przepływ pracy na tym PR, budujesz na mapie drogowej, a nie na runtime.
Co to oznacza dla rachunku kosztów
Powodem, dla którego MAGI-2-preview zwrócił na siebie uwagę, jest jego ekonomika. Model, który aktywuje 6B parametrów na token, dysponując 114B pojemności, jest tani w przeliczeniu na klip — Sand.ai podaje, że to około 0,5 juana za 10-sekundowy klip 1080p na ośmiu układach H100 — a to właśnie tego rodzaju liczba decyduje, czy małe zespoły w ogóle stać na generowanie wideo. Jednak te 0,5 juana zakłada referencyjny stos technologiczny, klaster H100 i zero narzutu serwerowego. Zwykłym sposobem, w jaki taki otwarty model staje się powszechnie użyteczny, jest zarządzane API: ktoś go hostuje, ustala cenę za klip, a ty nie wynajmujesz ośmiu układów H100.

Gdy istnieje hostowana trasa, kwestia routingu staje się istotna. Na platformie routingu płacisz dokładnie tyle, ile sprzedawca ustali jako cenę katalogową za klip MAGI-2-preview — OrcaRouter przekazuje ceny katalogowe dostawców bez żadnej marży, więc obniżka ceny sprzedawcy jest aktywna po naszej stronie tego samego dnia, w którym się pojawia, bez renegocjacji. A jedenastodniowy checkpoint o otwartych wagach, bez niezależnych benchmarków, to dokładnie ten typ modelu, który chcesz mieć za automatycznym przełączaniem awaryjnym: skieruj na niego trasę w celu ewaluacji, trzymaj sprawdzone rozwiązanie zapasowe na tym samym endpoincie, a gdy wczesny checkpoint utknie lub wygeneruje coś bezużytecznego, to wywołanie przełącza się awaryjnie, a nie twój pipeline. W ten sposób testujesz niesprawdzony model, nie stawiając na szali ścieżki produkcyjnej.
Co teraz oglądamy
• Czy PR zostanie scalony i jakie zmiany zostaną wprowadzone w przeglądzie. Lista ograniczeń — dwie rozdzielczości, jeden czas trwania, brak torch.compile — może nie być ostateczna.
• Zdestylowany punkt kontrolny. Sand.ai twierdzi, że wkrótce pojawią się wagi o mniejszej liczbie kroków; to właśnie sprawia, że kwota 0,5 juana z pomiaru laboratoryjnego staje się realistycznym kosztem na klip.
• Pierwsze niezależne benchmarki. Wyniki VBench i list rankingowych podają dostawca i prasa; niezależne przeprowadzenie testów rozstrzygnęłoby, czy twierdzenie o 6B-active się utrzymuje.
• To, czy inne środowiska uruchomieniowe pójdą w ślad za nim. SGLang jest pierwszym głównym środowiskiem uruchomieniowym do serwowania, które przyjęło MAGI-2-preview; vLLM i inne mogą nie pozostawać daleko w tyle.
• Czy pojawi się zarządzane API. Cała istota modelu to niski koszt przy dużej skali; w momencie, gdy pojawi się hostowana trasa, powyższa kalkulacja cen typu pass-through staje się realna.
Uczciwe podsumowanie: MAGI-2-preview to model open source mający jedenaście dni, którego struktura kosztów może mieć znaczenie, a pull request SGLang to najwyraźniejszy jak dotąd sygnał, że ekosystem traktuje go poważnie. Ale wsparcie serwowania to otwarty pull request, a nie wdrożona funkcjonalność. Traktuj mapę drogową jako realną, a środowisko uruchomieniowe jako jeszcze niegotowe — a gdy model w końcu trafi za prawdziwe API, podejście failover-first to sposób na jego wdrożenie bez opierania ścieżki produkcyjnej na punkcie kontrolnym, dla którego nikt nie przeprowadził niezależnych benchmarków.
