
MAGI-2-preview is op weg naar SGLang: wat de nieuwe serving-PR onthult
- DeepSeekNIEUWDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1 mln tokens
- z-aiNIEUWZ.ai: GLM 5.32026-08-1860Intelligentie75Coderen
- obsidianNIEUWQwen3.8 27B2026-08-1552Intelligentie68Coderen
- qwenNIEUWQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekNIEUWDeepSeek: DeepSeek V4 Pro 08132026-08-1253Intelligentie69Coderen
- grokNIEUWSpaceXAI: Grok 4.62026-08-1261Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0557Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0358Intelligentie72Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligentie78Coderen
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligentie69Coderen
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligentie49Coderen
- metaMeta: Muse Spark 1.12026-07-1653Intelligentie71Coderen
- kimiMoonshotAI: Kimi K32026-07-1560Intelligentie76Coderen
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligentie71Coderen
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligentie77Coderen
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Intelligentie77Coderen
MAGI-2-preview, het videogeneratiemodel van Sand.ai met 114 miljard parameters en een mixture-of-experts-architectuur, werd op 5 augustus 2026 open-source — en elf dagen later is het eerste teken verschenen dat het productieklare serving-infrastructuur gaat krijgen. Op 16 augustus werd in de SGLang-repository een pull request geopend met de titel [diffusion][Model] Ondersteuning voor MAGI-2-preview (sgl-project/sglang, PR #35014), en de titel klopt: het integreert native serving-ondersteuning voor het model in de diffusion-stack van SGLang. Het is, op het moment van schrijven, ook nog steeds een pull request — open, wachtend op beoordeling door code-eigenaren, met falende CI-checks. Er is nog niets gemerged, dus er is nog niets serveerbaar. Maar voor iedereen die overweegt of MAGI-2-preview kan overstappen van de referentie-Docker-en-torchrun-opstelling van Sand.ai naar een gangbare serving-runtime, is de PR een gedetailleerde routekaart.
Beschouw dit dus als een stuk over wat we tot nu toe weten, niet als een release note. Het model is echt en is uitgebracht — dat gebeurde op 5 augustus, met de gewichten op Hugging Face en de code op GitHub onder een Apache-2.0-licentie. Wat niet geverifieerd is, is het serving-werk: de SGLang-integratie is een enkele open pull request, waarvan de details tijdens de review kunnen veranderen, en totdat die wordt gemerged, kan SGLang MAGI-2-preview niet daadwerkelijk draaien. De waarde zit in wat de PR onthult over het model en over het pad om het in een echte runtime te draaien.
Het model waar de PR voor is, in één alinea
MAGI-2-preview is Sand.ai's poging om videogeneratie op te schalen zoals taalmodellen dat deden — met een mix van experts, en het is de opvolger van het open-source MAGI-1 (een 24B autoregressief videomodel uit april 2025). Het nieuwe model telt in totaal ongeveer 114B parameters, maar activeert slechts ongeveer 6B per token, via een ultrafijnmazige multi-head MoE: een 3.072-dimensionale verborgen toestand wordt opgesplitst in twaalf 256-dimensionale heads, die elk naar zes van 256 experts routeren, wat neerkomt op 3.072 experteenheden per MoE-laag en 72 geactiveerde experts per token over 36 lagen. Het is een verenigd single-stream audio-videomodel — tekst, video en audio passeren dezelfde transformer en wisselen op elke laag informatie uit via self-attention, in plaats van via een aparte cross-attention-pijplijn. Het ondersteunt tekst-naar-video en beeld-naar-video, en genereert clips van 10 seconden — de enige ondersteunde duur — met een gesynchroniseerde stereogeluidstrack die in hetzelfde denoising-traject wordt gegenereerd en in het uitvoerbestand wordt gemultiplext.
Het genereren verloopt in twee fasen. Een magi2_preview-fase denoist op 512×896, en vervolgens een magi2_refiner-fase schaalt op naar 1088×1920. De basisrelease gebruikt 100 preview- en 5 refiner-denoisingstappen; Sand.ai zegt dat er een gedistilleerde versie met veel minder stappen aankomt. De checkpointset is een enkele Hugging Face-repo van ongeveer 307 GB: de preview-fase van 228 GB, een Qwen3.5-27B-tekstencoder, de refiner van 14 GB, een audio-VAE van 5 GB, een video-VAE die is overgenomen van Wan2.2-TI2V-5B, en een gedistilleerde turbo-VAE-decoder die standaard wordt gebruikt. De hardwarevereisten zijn acht NVIDIA Hopper-GPU's (H100-klasse), waarbij de referentielauncher je in staat stelt om de tekstencoder, preview, refiner en VAE gedurende de fasen tussen CPU en GPU te offloaden.
Wat prestaties betreft: de cijfers die rondgaan zijn gerapporteerd, niet onafhankelijk gereproduceerd. De beweringen — een VBench-score van 86,54%, vóór Sora 2 (84,37%) en Kling 2.0 (84,20%) in dezelfde Chinese persberichtgeving, en een 6e plaats op de Artificial Analysis-ranglijst voor image-to-video met een Elo rond de 1106 — komen van de leverancier en de berichtgeving rond de lancering, en geen daarvan is in de elf dagen sinds de release door een onafhankelijke derde partij gedraaid. Sand.ai noemt ook inferentiekosten van ongeveer 0,5 yuan (ruwweg $0,07) per 10-secondenclip van 1080p op acht H100's, oftewel ongeveer een tiende van wat reguliere videomodellen kosten. Beschouw dit alles als door leverancier en pers gerapporteerd totdat iemand het daadwerkelijk meet.

Waarom een serving pull request het echte nieuws is
Tot nu toe was er precies één ondersteunde manier om MAGI-2-preview te draaien: Sand.ai's eigen referentiestack, een Docker-image plus torchrun, op acht NVIDIA Hopper H100's. Dat is een werkbaar maar op maat gemaakt pad — je erft Sand.ai's launcher, de offload-beslissingen en de eigenzinnige manier waarop de tekstencoder, preview, refiner en VAE over geheugenlagen worden verdeeld. Een pull request die het model aan SGLang toevoegt, is belangrijk omdat SGLang de serving-runtime is die een groot deel van de self-hosted generatieve-AI-wereld daadwerkelijk in productie gebruikt. First-class ondersteuning betekent dat MAGI-2-preview draaibaar wordt in een gangbare runtime met SGLang's infrastructuur erachter — Ulysses-sequentieparallellisme, expert-parallellisme, activatie-offload, de VAE, de scheduler en pipeline-stage-infrastructuur. Dat is het verschil tussen "Ik kan het op hun stack draaien" en "Ik kan het draaien op de stack die mijn team al beheert."
Wat de PR daadwerkelijk bouwt
De integratie is gebouwd op bestaande SGLang-machinerie in plaats van op het referentie-torchrun-pad. De PR voegt een multi-head-MoE-laag, attention-sink-infrastructuur, lokale aandacht met blokvensters voor de refiner-fase en multi-stream-hyperverbindingen toe — de architectonische bouwstenen van MagiMoE die generieke lagen niet al bevatten. Daaromheen hergebruikt het de bestaande SGLang-componenten voor Ulysses-sequentieparallellisme, expertparallellisme, offload, VAE, scheduler en pipeline-fasen. Het levert ook documentatie mee (een MAGI-2-cookbookpagina voor SGLang's diffusiedocumentatie) en 47 GPU-vrije eenheidstests, wat een goed teken is voor hoeveel van het modelgedrag kan worden geverifieerd zonder acht H100's te huren.
De PR maakt ook de beperkingen van het model expliciet:
• Hardware — acht NVIDIA Hopper H100s, waarbij de cpu-/gpu-/roundtrip-offloadmodi van de referentiestack overeenkomen met waar de tekstencoder, preview, refiner en VAE zich tussen de fasen bevinden.
• Parallelisme — --num-gpus moet elke head-as delen, terwijl --tp-size, --ring-degree, en --enable-cfg-parallel worden afgewezen. Dit is een model met veel routeringsdimensies, en de parallelisme-layout moet hiermee overeenkomen.
• Uitvoer — alleen resoluties van 1920×1088 en 896×512 worden geaccepteerd, en alleen clips van 10 seconden; torch.compile wordt niet ondersteund.
Die laatste set is het waard om twee keer te lezen als je een implementatie plant: dit is een model dat, althans in deze vroege integratie, beperkt is tot twee resoluties en één duur.
![Screenshot of SGLang pull request #35014 titled '[diffusion][Model] Support MAGI-2-preview' showing the PR description, the branch merging 5 commits into sgl-project:main, 43 files changed, and the CI checks status, in the sgl-project/sglang repository.](https://cms.orcarouter.ai/api/media/file/3-297.png)
Wat is nog onbevestigd?
Alles over het serveerwerk. De PR staat open, wacht op beoordelingen van code-eigenaren, en CI-checks faalden per 16 augustus. Een pull request van deze omvang kan dagen of weken in review blijven; er is geen gemergde staat, geen release en geen aankondiging van SGLang. En de claims aan de modelzijde — de VBench-score, de Artificial Analysis-ranglijst, het kostencijfer van 0,5 yuan — komen van leveranciers en de pers, niet onafhankelijk gereproduceerd. Als je vandaag een workflow bouwt op deze PR, bouw je op een roadmap, niet op een runtime.
Wat het betekent voor de kostenberekening
De reden waarom MAGI-2-preview de aandacht trok, is de economie ervan. {{1}}Een model dat per token 6B parameters activeert terwijl het 114B aan capaciteit heeft, is goedkoop om per clip te draaien{{/1}} — Sand.ai schat het op ongeveer 0,5 yuan per 1080p-clip van 10 seconden op acht H100's — {{2}}en dat is het soort getal dat bepaalt of kleine teams videogeneratie überhaupt kunnen veroorloven{{/2}}. Maar die 0,5 yuan veronderstelt de referentiestack, het H100-cluster en geen serving-overhead. {{3}}De gebruikelijke manier waarop zo'n open model breed bruikbaar wordt, is via een beheerde API: iemand host het, rekent per clip af, en je hoeft geen acht H100's te huren.{{/3}}

Wanneer er een gehoste route bestaat, wordt de routeringshoek relevant. Op een routeringsplatform betaal je precies de catalogusprijs die de leverancier voor een MAGI-2-previewclip vaststelt — OrcaRouter geeft de catalogusprijzen van providers door zonder opslag, dus een prijsverlaging van de leverancier is bij ons live op de dag dat deze uitkomt, zonder heronderhandeling. En een elf dagen oud open-weight checkpoint zonder onafhankelijke benchmarks is precies het soort model dat je achter automatische failover wilt: wijs er een route aan toe voor evaluatie, houd een bewezen fallback op hetzelfde endpoint, en zodra het vroege checkpoint hapert of iets onbruikbaars produceert, valt de call over in plaats van je pipeline. Zo probeer je een onbewezen model uit zonder er een productiepad aan te wagen.
Wat we nu kijken
• Of de PR wordt gemerged, en wat er verandert in de review. De beperkingslijst — twee resoluties, één duur, geen torch.compile — is mogelijk niet definitief.
• Het gedistilleerde checkpoint. Sand.ai zegt dat er gewichten voor minder stappen aankomen; dat is wat het bedrag van 0,5 yuan van een labmeting omzet in realistische kosten per clip.
• Eerste onafhankelijke benchmarks. De VBench- en leaderboardcijfers zijn afkomstig van leveranciers en pers; een run door een derde partij zou uitwijzen hoe de 6B-actieve claim standhoudt.
• Of andere runtimes volgen. SGLang is de eerste grote serving-runtime die MAGI-2-preview adopteert; vLLM en anderen zullen mogelijk niet ver achterblijven.
• Of er een beheerde API verschijnt. De hele propositie van het model is lage kosten op schaal; zodra er een gehoste route bestaat, gaat de hierboven beschreven doorberekeningsprijsberekening live.
De eerlijke samenvatting: MAGI-2-preview is een elf dagen oud open model waarvan de kostenstructuur van belang zou kunnen zijn, en de SGLang PR is het duidelijkste signaal tot nu toe dat het ecosysteem het serieus neemt. Maar de serving-ondersteuning is een open pull request, geen uitgebrachte functionaliteit. Beschouw de roadmap als reëel en de runtime als nog niet aanwezig — en wanneer het model daadwerkelijk achter een echte API landt, is de failover-first-benadering de manier om het te adopteren zonder een productiepad te baseren op een checkpoint dat door niemand onafhankelijk is gebenchmarkt.
