Karta tytułowa artykułu 'MAGI-2-preview is heading to SGLang' z podtytułem 'What the new serving PR reveals', przedstawiająca motyw taśmy filmowej przechodzący w czyste węzły serwerowe i sieciowe na białym tle z niebiesko-cyjanowymi akcentami gradientowymi, z logo OrcaRouter umieszczonym w prawym dolnym rogu.
Guides & Insights

MAGI-2-preview trafia do SGLang: co ujawnia nowy PR dotyczący serwowania.

Autor

Magnus Corvin

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

MAGI-2-preview, należący do Sand.ai model generowania wideo typu mixture-of-experts o 114 miliardach parametrów, został udostępniony jako open-source 5 sierpnia 2026 roku — a jedenaście dni później pojawił się pierwszy sygnał, że wkrótce otrzyma infrastrukturę serwującą klasy produkcyjnej. 16 sierpnia w repozytorium SGLang otwarto pull request zatytułowany [diffusion][Model] Support MAGI-2-preview (sgl-project/sglang, PR #35014), a tytuł jest trafny: dodaje on natywne wsparcie serwowania tego modelu do stosu diffusion SGLang. Jednocześnie, w chwili pisania tego tekstu, to wciąż pull request — otwarty, oczekujący na przegląd właścicieli kodu, z nieudanymi kontrolami CI. Nic nie zostało scalone, więc niczego jeszcze nie można serwować. Ale dla każdego, kto rozważa, czy MAGI-2-preview może przejść z referencyjnej konfiguracji Docker-and-torchrun Sand.ai na standardowy runtime serwujący, ten PR to szczegółowa mapa drogowa.

Potraktuj to więc jako zestawienie tego, co wiemy do tej pory, a nie notę wydawniczą. Model jest prawdziwy i został wydany — miało to miejsce 5 sierpnia, z wagami na Hugging Face i kodem na GitHubie na licencji Apache-2.0. Tym, czego nie zweryfikowano, jest kwestia serwowania: integracja z SGLang to pojedynczy otwarty pull request, jego szczegóły mogą się zmienić w trakcie przeglądu, a dopóki nie zostanie scalony, SGLang nie może faktycznie uruchomić MAGI-2-preview. Wartość tkwi w tym, co PR ujawnia na temat modelu oraz ścieżki do uruchomienia go w prawdziwym środowisku uruchomieniowym.

Model, którego dotyczy PR, w jednym akapicie.

MAGI-2-preview to próba Sand.ai, by skalować generowanie wideo tak, jak skalowały się modele językowe — za pomocą mieszaniny ekspertów — i jest następcą open-source'owego MAGI-1 (autoregresyjnego modelu wideo o 24 mld parametrów z kwietnia 2025 r.). Nowy model ma łącznie około 114 mld parametrów, ale aktywuje tylko około 6 mld na token, wykorzystując ultradrobnoziarnistą wielogłowicową architekturę MoE: ukryty stan o wymiarowości 3072 jest dzielony na dwanaście głowic o wymiarowości 256, z których każda kieruje do sześciu z 256 ekspertów, co daje 3072 jednostek eksperckich na warstwę MoE i 72 ekspertów aktywowanych na token w 36 warstwach. To ujednolicony model audio-wideo o pojedynczym strumieniu — tekst, wideo i audio przechodzą przez ten sam transformer i wymieniają informacje poprzez self-attention na każdej warstwie, zamiast przez osobny potok cross-attention. Obsługuje generowanie wideo z tekstu i z obrazu oraz tworzy 10-sekundowe klipy — jedyny obsługiwany czas trwania — ze zsynchronizowaną ścieżką dźwiękową stereo generowaną w tej samej trajektorii odszumiania i multipleksowaną do pliku wyjściowego.

Generowanie przebiega w dwóch etapach. Etap magi2_preview odszumia w rozdzielczości 512×896, a następnie etap magi2_refiner zwiększa rozdzielczość do 1088×1920. Wersja podstawowa wykorzystuje 100 kroków odszumiania w preview i 5 w refiner; Sand.ai zapowiada wersję destylowaną ze znacznie mniejszą liczbą kroków. Zestaw checkpointów to pojedyncze repozytorium Hugging Face o rozmiarze około 307 GB, w skład którego wchodzą: etap preview (228 GB), enkoder tekstu Qwen3.5-27B, refiner (14 GB), audio VAE (5 GB), VAE wideo zapożyczone z Wan2.2-TI2V-5B oraz domyślnie używany destylowany dekoder turbo VAE. Wymagania sprzętowe to osiem GPU NVIDIA Hopper (klasa H100), a referencyjny launcher pozwala przenosić enkoder tekstu, preview, refiner i VAE między CPU a GPU w poszczególnych fazach.

W kwestii wydajności, podawane liczby są raportowane, a nie niezależnie zweryfikowane. Twierdzenia — wynik VBench na poziomie 86,54%, wyprzedzający Sorę 2 (84,37%) i Kling 2.0 (84,20%) w tych samych chińskich doniesieniach prasowych, oraz 6. miejsce w rankingu Artificial Analysis dla modeli image-to-video z Elo w okolicach 1106 — pochodzą od producenta i z relacji z premiery, a żadne z nich nie zostało niezależnie przetestowane przez stronę trzecią w ciągu jedenastu dni od wydania. Sand.ai podaje również koszt inferencji na około 0,5 juana (mniej więcej 0,07 USD) za 10-sekundowy klip 1080p na ośmiu H100, czyli około jednej dziesiątej tego, co kosztują mainstreamowe modele wideo. Traktuj to wszystko jako doniesienia producenta i prasy, dopóki ktoś tego nie zmierzy.

Screenshot of the GitHub repository SandAI-org/MAGI-2-preview showing the README 'MAGI-2-preview: Scaling Video Generation Models Efficiently', 528 stars, 14 forks, and the repository file listing.

Dlaczego pull request dotyczący serwowania to prawdziwa nowość

Do tej pory istniał dokładnie jeden wspierany sposób uruchomienia MAGI-2-preview: autorski stack referencyjny Sand.ai, obraz Dockera plus torchrun, na ośmiu układach NVIDIA Hopper H100. To wykonalna, ale szyta na miarę ścieżka — dziedziczysz launcher Sand.ai, jego decyzje dotyczące offloadu i jego subiektywny sposób rozmieszczania enkodera tekstu, preview, refinera i VAE pomiędzy poziomami pamięci. Pull request dodający model do SGLang jest ważny, ponieważ SGLang to środowisko uruchomieniowe do serwowania, które duża część świata samodzielnie hostowanej generatywnej AI faktycznie wykorzystuje w produkcji. Wsparcie pierwszej klasy oznacza, że MAGI-2-preview można uruchomić w głównonurtowym środowisku uruchomieniowym z maszynerią SGLang za nim — równoległością sekwencji Ulysses, równoległością ekspertów, offloadem aktywacji, VAE, schedulerem i infrastrukturą etapów potoku. To jest różnica między „Mogę uruchomić to na ich stacku” a „Mogę uruchomić to na stacku, który mój zespół już obsługuje”.

Co właściwie buduje PR

Integracja opiera się na istniejących mechanizmach SGLang, a nie na referencyjnej ścieżce torchrun. PR dodaje wielogłową warstwę MoE, mechanikę attention-sink, lokalną uwagę w oknach blokowych dla etapu refiner oraz wielostrumieniowe hiperpołączenia — elementy architektury MagiMoE, których ogólne warstwy nie wyrażają. Wokół nich wykorzystuje istniejące komponenty SGLang: równoległość sekwencji Ulysses, równoległość ekspertów, offload, VAE, scheduler oraz komponenty etapów potoku. Dostarcza także dokumentację (stronę MAGI-2 cookbook w dokumentacji diffusion SGLang) oraz 47 testów jednostkowych niewymagających GPU, co dobrze świadczy o tym, jak dużą część zachowania modelu można zweryfikować bez wynajmowania ośmiu układów H100.

PR ujawnia również ograniczenia modelu:

Sprzęt — osiem układów NVIDIA Hopper H100, gdzie tryby offloadu cpu / gpu / roundtrip z referencyjnego stosu określają rozmieszczenie enkodera tekstu, podglądu, refinera i VAE pomiędzy fazami.

• Równoległość — --num-gpus musi dzielić każdą oś głowic, podczas gdy --tp-size, --ring-degree oraz --enable-cfg-parallel są odrzucane. To model z wieloma wymiarami routingu, a układ równoległości musi być z nimi zgodny.

• Wyniki — akceptowane są tylko rozdzielczości 1920×1088 i 896×512 oraz wyłącznie 10-sekundowe klipy; torch.compile nie jest obsługiwany.

Ten ostatni zestaw warto przeczytać dwa razy, jeśli planujesz wdrożenie: to model, który – przynajmniej na tym wczesnym etapie integracji – jest ograniczony do dwóch rozdzielczości i jednego czasu trwania.

Screenshot of SGLang pull request #35014 titled '[diffusion][Model] Support MAGI-2-preview' showing the PR description, the branch merging 5 commits into sgl-project:main, 43 files changed, and the CI checks status, in the sgl-project/sglang repository.

Co wciąż jest niezweryfikowane

Wszystko o pracy nad serwowaniem. PR jest otwarty, czeka na recenzje właścicieli kodu, a kontrole CI nie przechodziły na dzień 16 sierpnia. Pull request tej wielkości może czekać w recenzji dniami lub tygodniami; nie ma scalonego stanu, wydania ani ogłoszenia od SGLang. A twierdzenia dotyczące modelu — wynik VBench, ranking Artificial Analysis, koszt 0,5 juana — są raportowane przez dostawcę i prasę, a nie niezależnie powtórzone. Jeśli dziś zbudujesz przepływ pracy na tym PR, budujesz na mapie drogowej, a nie na runtime.

Co to oznacza dla rachunku kosztów

Powodem, dla którego MAGI-2-preview zwrócił na siebie uwagę, jest jego ekonomika. Model, który aktywuje 6B parametrów na token, dysponując 114B pojemności, jest tani w przeliczeniu na klip — Sand.ai podaje, że to około 0,5 juana za 10-sekundowy klip 1080p na ośmiu układach H100 — a to właśnie tego rodzaju liczba decyduje, czy małe zespoły w ogóle stać na generowanie wideo. Jednak te 0,5 juana zakłada referencyjny stos technologiczny, klaster H100 i zero narzutu serwerowego. Zwykłym sposobem, w jaki taki otwarty model staje się powszechnie użyteczny, jest zarządzane API: ktoś go hostuje, ustala cenę za klip, a ty nie wynajmujesz ośmiu układów H100.

A single-column scoreboard for MAGI-2-preview titled 'MAGI-2-preview — the scoreboard' listing total params 114B (MoE), active params ~6B per token, VBench 86.54% (vendor-reported), Artificial Analysis image-to-video #6 with Elo ~1106, cost ~0.5 yuan per 10s 1080p clip, and serving status 'SGLang PR open, unmerged', with a footer reading 'All figures vendor- or press-reported; not yet independently verified.'

Gdy istnieje hostowana trasa, kwestia routingu staje się istotna. Na platformie routingu płacisz dokładnie tyle, ile sprzedawca ustali jako cenę katalogową za klip MAGI-2-preview — OrcaRouter przekazuje ceny katalogowe dostawców bez żadnej marży, więc obniżka ceny sprzedawcy jest aktywna po naszej stronie tego samego dnia, w którym się pojawia, bez renegocjacji. A jedenastodniowy checkpoint o otwartych wagach, bez niezależnych benchmarków, to dokładnie ten typ modelu, który chcesz mieć za automatycznym przełączaniem awaryjnym: skieruj na niego trasę w celu ewaluacji, trzymaj sprawdzone rozwiązanie zapasowe na tym samym endpoincie, a gdy wczesny checkpoint utknie lub wygeneruje coś bezużytecznego, to wywołanie przełącza się awaryjnie, a nie twój pipeline. W ten sposób testujesz niesprawdzony model, nie stawiając na szali ścieżki produkcyjnej.

Co teraz oglądamy

• Czy PR zostanie scalony i jakie zmiany zostaną wprowadzone w przeglądzie. Lista ograniczeń — dwie rozdzielczości, jeden czas trwania, brak torch.compile — może nie być ostateczna.

• Zdestylowany punkt kontrolny. Sand.ai twierdzi, że wkrótce pojawią się wagi o mniejszej liczbie kroków; to właśnie sprawia, że kwota 0,5 juana z pomiaru laboratoryjnego staje się realistycznym kosztem na klip.

• Pierwsze niezależne benchmarki. Wyniki VBench i list rankingowych podają dostawca i prasa; niezależne przeprowadzenie testów rozstrzygnęłoby, czy twierdzenie o 6B-active się utrzymuje.

• To, czy inne środowiska uruchomieniowe pójdą w ślad za nim. SGLang jest pierwszym głównym środowiskiem uruchomieniowym do serwowania, które przyjęło MAGI-2-preview; vLLM i inne mogą nie pozostawać daleko w tyle.

• Czy pojawi się zarządzane API. Cała istota modelu to niski koszt przy dużej skali; w momencie, gdy pojawi się hostowana trasa, powyższa kalkulacja cen typu pass-through staje się realna.

Uczciwe podsumowanie: MAGI-2-preview to model open source mający jedenaście dni, którego struktura kosztów może mieć znaczenie, a pull request SGLang to najwyraźniejszy jak dotąd sygnał, że ekosystem traktuje go poważnie. Ale wsparcie serwowania to otwarty pull request, a nie wdrożona funkcjonalność. Traktuj mapę drogową jako realną, a środowisko uruchomieniowe jako jeszcze niegotowe — a gdy model w końcu trafi za prawdziwe API, podejście failover-first to sposób na jego wdrożenie bez opierania ścieżki produkcyjnej na punkcie kontrolnym, dla którego nikt nie przeprowadził niezależnych benchmarków.

© 2026 OrcaRouter

Dla dostawców

Prowadzisz platformę inferencyjną? Udostępnij swoje modele w OrcaRouter.

providers@orcarouter.ai

Dołącz do społeczności

Discordsupport@orcarouter.aiXGitHubYouTube