En titelbild för artikeln 'MAGI-2-preview är på väg till SGLang' med underrubriken 'Vad den nya serving-PR:n avslöjar', som visar ett filmremsemotiv som övergår i rena server- och nätverksnoder på en vit bakgrund med blå-cyan-gradientaccenter, med OrcaRouter-logotypen sammansatt i nedre högra hörnet.
Guides & Insights

MAGI-2-preview är på väg till SGLang: vad den nya serving-PR:en avslöjar

Författare

Magnus Corvin

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

MAGI-2-preview, Sand.ais videogenereringsmodell av typen mixture-of-experts med 114 miljarder parametrar, blev öppen källkod den 5 augusti 2026 – och elva dagar senare har det första tecknet på att den är på väg att få produktionsmogen serveringsinfrastruktur dykt upp. Den 16 augusti öppnades en pull request i SGLang-repot med titeln [diffusion][Model] Support MAGI-2-preview (sgl-project/sglang, PR #35014), och titeln är korrekt: den kopplar in inbyggt serveringsstöd för modellen i SGLangs diffusionstack. Den är också, när detta skrivs, fortfarande en pull request – öppen, i väntan på granskning av kodägare, med CI-kontroller som misslyckas. Inget har mergats, så inget är serverbart ännu. Men för den som överväger om MAGI-2-preview kan flyttas från Sand.ais referensinstallation med Docker och torchrun till en etablerad serveringskörtid, är pull requesten en detaljerad färdplan.

Så betrakta detta som en text om vad vi vet hittills, inte som en release note. Modellen är verklig och lanserad – det skedde den 5 augusti, med vikter på Hugging Face och kod på GitHub under en Apache-2.0-licens. Det som är overifierat är serveringsarbetet: SGLang-integrationen är en enda öppen pull request, dess detaljer kan ändras vid granskning, och tills den landar kan SGLang faktiskt inte köra MAGI-2-preview. Värdet ligger i vad PR:n avslöjar om modellen och om vägen till att köra den i en verklig körmiljö.

Modellen som PR:n gäller, i ett stycke

MAGI-2-preview är Sand.ai:s försök att skala videogenerering på samma sätt som språkmodeller skalades — med en blandning av experter — och det är efterträdaren till MAGI-1 med öppen källkod (en 24B autoregressiv videomodell från april 2025). Den nya modellen har totalt cirka 114B parametrar men aktiverar endast cirka 6B per token, med en ultra-finkornig multi-head MoE: ett 3,072-dimensionellt dolt tillstånd delas upp i tolv 256-dimensionella huvuden, som vart och ett dirigerar till sex av 256 experter, vilket innebär 3,072 expertenheter per MoE-lager och 72 experter aktiverade per token över 36 lager. Det är en enhetlig ljud-videomodell med en enda ström — text, video och ljud passerar genom samma transformer och utbyter information genom självuppmärksamhet i varje lager, istället för genom en separat korsuppmärksamhetspipeline. Den stöder text-till-video och bild-till-video, och genererar 10-sekundersklipp — den enda varaktighet som stöds — med ett synkroniserat stereoljudspår som genereras i samma avbrusningsbana och muxas in i utdatafilen.

Genereringen sker i två faser. En magi2_preview fas avbrusar vid 512×896, sedan en magi2_refiner fas skalar upp till 1088×1920. Basversionen använder 100 preview- och 5 refiner-denoisingsteg; Sand.ai säger att en destillerad version med betydligt färre steg är på väg. Checkpoint-uppsättningen är ett enda Hugging Face-repo på cirka 307 GB: preview-fasen på 228 GB, en Qwen3.5-27B-textkodare, refinern på 14 GB, en ljud-VAE på 5 GB, en video-VAE lånad från Wan2.2-TI2V-5B och en destillerad turbo-VAE-avkodare som används som standard. Hårdvarukraven är åtta NVIDIA Hopper-GPU:er (H100-klass), och referensstartaren låter dig flytta textkodaren, preview, refiner och VAE mellan CPU och GPU genom faserna.

Prestationsmässigt är siffrorna som cirkulerar rapporterade, inte oberoende verifierade. Påståendena — ett VBench-resultat på 86,54 %, före Sora 2 (84,37 %) och Kling 2.0 (84,20 %) i samma kinesiska pressbevakning, samt en 6:e-plats på Artificial Analysis bild-till-video-ledartavla med en Elo runt 1106 — kommer från leverantören och lanseringsbevakningen, och ingen av det har genomgått en oberoende tredjepartskörning under de elva dagarna sedan lanseringen. Sand.ai anger också inferenskostnaden till cirka 0,5 yuan (ungefär 0,07 USD) per 10-sekundersklipp i 1080p på åtta H100:or, eller ungefär en tiondel av vad vanliga videomodeller kostar. Ta allt som leverantörs- och pressrapporterat tills någon faktiskt mäter det.

Screenshot of the GitHub repository SandAI-org/MAGI-2-preview showing the README 'MAGI-2-preview: Scaling Video Generation Models Efficiently', 528 stars, 14 forks, and the repository file listing.

Varför en serving-pull request är den verkliga nyheten

Hittills har det funnits exakt ett sätt med officiellt stöd för att köra MAGI-2-preview: Sand.ai:s egen referensstack, en Docker-avbild plus torchrun, på åtta NVIDIA Hopper H100. Det är en fungerande men skräddarsydd väg — du ärver Sand.ai:s startprogram, dess offload-beslut och dess egensinniga sätt att placera textkodaren, previewn, förfinaren och VAE:n mellan minnesnivåer. En pull request som lägger till modellen i SGLang spelar roll, eftersom SGLang är den körningsmiljö för modellservering som en stor del av den självhostade generativa AI-världen faktiskt använder i produktion. Förstklassigt stöd innebär att MAGI-2-preview blir körbar i en mainstream-runtime med SGLang:s maskineri bakom sig — Ulysses-sekvensparallellism, expertparallellism, aktiveringsoffload, VAE:n, schemaläggaren och infrastrukturen för pipeline-steg. Det är skillnaden mellan ”jag kan köra det på deras stack” och ”jag kan köra det på den stack mitt team redan driver.”

Vad PR:n faktiskt bygger

Integrationen bygger på befintlig SGLang-machinery snarare än på referensvägen torchrun. PR:en lägger till ett multi-head MoE-lager, attention-sink-infrastruktur, blockfönster-lokal attention för refiner-steget och flerströms-hyperkopplingar – de arkitektoniska byggstenarna i MagiMoE som inte redan finns i generiska lager. Runt dem återanvänder den SGLang:s befintliga Ulysses-sekvensparallellism, expertparallellism, offload, VAE, schemaläggare och pipeline-stegskomponenter. Den levererar också dokumentation (en MAGI-2-receptsida för SGLang:s diffusionsdokumentation) och 47 GPU-fria enhetstester, vilket är ett gott tecken på hur mycket av modellens beteende som kan verifieras utan att hyra åtta H100.

PR:en tydliggör också modellens begränsningar:

• Hårdvara — åtta NVIDIA Hopper H100:or, med referensstackens cpu / gpu / roundtrip-offloadlägen som mappas till var textkodaren, förhandsgranskningen, förfinaren och VAE sitter mellan faserna.

• Parallelism — --num-gpus måste dela varje huvudaxel, medan --tp-size, --ring-degree och --enable-cfg-parallel avvisas. Detta är en modell med många routingdimensioner, och parallellismlayouten måste stämma överens med dem.

• Utdata — endast 1920×1088 och 896×512 upplösningar accepteras, och endast 10-sekundersklipp; torch.compile stöds inte.

Den där sista uppsättningen är värd att läsa två gånger om du planerar en driftsättning: det här är en modell som, åtminstone i den här tidiga integrationen, är låst till två upplösningar och en varaktighet.

Screenshot of SGLang pull request #35014 titled '[diffusion][Model] Support MAGI-2-preview' showing the PR description, the branch merging 5 commits into sgl-project:main, 43 files changed, and the CI checks status, in the sgl-project/sglang repository.

Vad är fortfarande overifierat

Allt om serveringsarbetet. Pull requesten är öppen, väntar på granskning från kodägare, och CI-kontrollerna misslyckades från och med 16 augusti. En pull request av den här storleken kan ligga i granskning i dagar eller veckor; det finns ingen sammanslagen version, ingen release och inget meddelande från SGLang. Och påståendena på modellsidan — VBench-poängen, Artificial Analysis-rankningen, kostnadssiffran på 0,5 yuan — är leverantörs- och pressrapporterade, inte oberoende reproducerade. Om du bygger ett arbetsflöde på den här pull requesten idag, bygger du på en färdplan, inte på en körbar runtime.

Vad det innebär för kostnadsberäkningen

Anledningen till att MAGI-2-preview väckte uppmärksamhet är dess ekonomi. En modell som aktiverar 6B parametrar per token samtidigt som den bär 114B kapacitet är billig att köra per klipp – Sand.ai sätter siffran till cirka 0,5 yuan per 10-sekunders 1080p-klipp på åtta H100 – och det är den typen av siffra som avgör om små team överhuvudtaget har råd med videogenerering. Men 0,5 yuan förutsätter referensstacken, H100-klustret och inga serving-omkostnader. Det vanliga sättet för en öppen modell som denna att bli allmänt användbar är genom ett hanterat API: någon hostar den, prissätter per klipp, och du hyr inte åtta H100.

A single-column scoreboard for MAGI-2-preview titled 'MAGI-2-preview — the scoreboard' listing total params 114B (MoE), active params ~6B per token, VBench 86.54% (vendor-reported), Artificial Analysis image-to-video #6 with Elo ~1106, cost ~0.5 yuan per 10s 1080p clip, and serving status 'SGLang PR open, unmerged', with a footer reading 'All figures vendor- or press-reported; not yet independently verified.'

När en hostad rutt finns, blir routingaspekten relevant. På en routingplattform är det listpriset som leverantören sätter för ett MAGI-2-förhandsvisningsklipp som du betalar – OrcaRouter skickar leverantörens listpriser vidare utan påslag, så en prissänkning från leverantören är live hos oss samma dag som den skickas, utan omförhandling. Och en elva dagar gammal checkpoint med öppna vikter utan oberoende riktmärken är exakt den typ av modell du vill ha bakom automatisk failover: peka en rutt mot den för utvärdering, behåll en beprövad reserv på samma slutpunkt, och i samma ögonblick som den tidiga checkpointen stannar upp eller producerar något oanvändbart, görs failover på samtalet i stället för på din pipeline. Så testar du en oprövad modell utan att satsa en produktionssökväg på den.

Vad vi tittar på nu

• Huruvida PR:n mergas, och vad som ändras i granskningen. Begränsningslistan — två upplösningar, en varaktighet, ingen torch.compile — kanske inte är slutgiltig.

• Den destillerade checkpointen. Sand.ai säger att vikter med färre steg är på väg; det är det som förvandlar siffran 0,5 yuan från ett labbmätningsvärde till en realistisk kostnad per klipp.

• Första oberoende riktmärken. VBench- och leaderboard-siffrorna är leverantörs- och pressrapporterade; en tredjepartskörning skulle avgöra hur 6B-active-påståendet håller.

Huruvida andra runtimes följer efter. SGLang är den första stora serving-runtime som tar in MAGI-2-preview; vLLM och andra kanske inte ligger långt efter.

• Huruvida ett hanterat API finns. Modellens hela säljargument är låg kostnad i stor skala; så snart en hostad rutt finns, blir pass-through-prissättningen ovan verklighet.

Den ärliga sammanfattningen: MAGI-2-preview är en elva dagar gammal öppen modell vars kostnadsstruktur kan spela roll, och SGLang PR är den tydligaste signalen hittills att ekosystemet tar den på allvar. Men serving-stödet är en öppen pull request, inte en lanserad funktion. Behandla färdplanen som verklig och runtime som inte riktigt där än — och när modellen väl landar bakom ett riktigt API, är failover-first-metoden hur du adopterar den utan att satsa en produktionsväg på en checkpoint som ingen har benchmarkat oberoende.

© 2026 OrcaRouter

För leverantörer

Driver du en inferensplattform? Få dina modeller på OrcaRouter.

providers@orcarouter.ai

Gå med i vår community

Discordsupport@orcarouter.aiXGitHubYouTube