Une carte de titre pour l'article 'MAGI-2-preview is heading to SGLang' avec le sous-titre 'What the new serving PR reveals', montrant un motif de pellicule de film se transformant en nœuds de serveur et de réseau épurés sur un fond blanc avec des accents dégradé bleu-cyan, avec le logo OrcaRouter composé en bas à droite.
Guides & Insights

MAGI-2-preview arrive sur SGLang : ce que révèle la nouvelle PR de serving

Auteur

Magnus Corvin

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

MAGI-2-preview, le modèle de génération vidéo à mélange d'experts de 114 milliards de paramètres de Sand.ai, est passé en open source le 5 août 2026 — et onze jours plus tard, le premier signe qu'il s'apprête à bénéficier d'une infrastructure de service de niveau production est apparu. Le 16 août, une pull request a été ouverte dans le dépôt SGLang intitulée [diffusion][Model] Support MAGI-2-preview (sgl-project/sglang, PR #35014), et le titre est exact : elle intègre la prise en charge native du modèle dans la pile diffusion de SGLang. Elle reste également, à l'heure où j'écris ces lignes, une simple pull request — ouverte, en attente de revue par les propriétaires du code, avec des contrôles CI en échec. Rien n'a été fusionné, donc rien n'est encore prêt à être servi. Mais pour quiconque évalue si MAGI-2-preview peut quitter la configuration de référence Docker-et-torchrun de Sand.ai et passer sur un runtime de service standard, cette PR constitue une feuille de route détaillée.

Considérez donc ceci comme un point sur ce que nous savons jusqu'à présent, et non comme une note de version. Le modèle est réel et a été publié — cela s'est produit le 5 août, avec les poids sur Hugging Face et le code sur GitHub sous licence Apache-2.0. Ce qui n'est pas vérifié, c'est le travail de serving : l'intégration SGLang est un unique pull request ouvert, dont les détails peuvent changer en cours de revue, et tant qu'il n'est pas fusionné, SGLang ne peut pas réellement exécuter MAGI-2-preview. La valeur réside dans ce que le PR révèle sur le modèle et sur le chemin pour l'exécuter dans un runtime réel.

Le modèle pour lequel la PR est destinée, en un paragraphe.

MAGI-2-preview est la tentative de Sand.ai de mettre à l'échelle la génération vidéo comme les modèles de langage l'ont fait — avec un mélange d'experts — et il succède au modèle open-source MAGI-1 (un modèle vidéo autorégressif de 24 milliards de paramètres datant d'avril 2025). Le nouveau modèle totalise environ 114 milliards de paramètres, mais n'en active qu'environ 6 milliards par jeton, grâce à un MoE multi-têtes ultra-granulaire : un état caché de 3 072 dimensions est divisé en douze têtes de 256 dimensions, chacune routant vers six des 256 experts, soit 3 072 unités expertes par couche MoE et 72 experts activés par jeton sur 36 couches. Il s'agit d'un modèle audio-vidéo unifié à flux unique — le texte, la vidéo et l'audio passent par le même transformateur et échangent des informations par auto-attention à chaque couche, plutôt que par un pipeline d'attention croisée séparé. Il prend en charge la génération texte-vers-vidéo et image-vers-vidéo, et produit des clips de 10 secondes — la seule durée prise en charge — avec une bande sonore stéréo synchronisée, générée dans la même trajectoire de débruitage et multiplexée dans le fichier de sortie.

La génération s'effectue en deux étapes. La première, magi2_preview, débruite à 512×896, puis la seconde, magi2_refiner, agrandit à 1088×1920. La version de base utilise 100 étapes de débruitage pour la preview et 5 pour le refiner ; Sand.ai annonce qu'une version distillée avec beaucoup moins d'étapes arrive bientôt. L'ensemble de checkpoints est un dépôt Hugging Face unique d'environ 307 Go : la preview de 228 Go, un encodeur de texte Qwen3.5-27B, le refiner de 14 Go, un VAE audio de 5 Go, un VAE vidéo emprunté à Wan2.2-TI2V-5B, et un décodeur VAE turbo distillé utilisé par défaut. La configuration matérielle requise est de huit GPU NVIDIA Hopper (classe H100), le lanceur de référence permettant de décharger l'encodeur de texte, la preview, le refiner et le VAE entre le CPU et le GPU au fil des phases.

En matière de performances, les chiffres qui circulent sont rapportés, non reproduits de manière indépendante. Les affirmations — un score VBench de 86,54 %, devant Sora 2 (84,37 %) et Kling 2.0 (84,20 %) dans la même couverture de presse chinoise, et une 6e place sur le classement image-vers-vidéo d'Artificial Analysis avec un Elo d'environ 1106 — proviennent du fournisseur et de la couverture de lancement, et rien de tout cela n'a fait l'objet d'un test indépendant par un tiers au cours des onze jours écoulés depuis la sortie. Sand.ai cite également un coût d'inférence d'environ 0,5 yuan (soit environ 0,07 $) par clip 1080p de 10 secondes sur huit H100, soit environ un dixième des modèles vidéo grand public. Prenez tout cela comme des déclarations du fournisseur et de la presse jusqu'à ce que quelqu'un le mesure.

Screenshot of the GitHub repository SandAI-org/MAGI-2-preview showing the README 'MAGI-2-preview: Scaling Video Generation Models Efficiently', 528 stars, 14 forks, and the repository file listing.

Pourquoi une pull request de service est la véritable nouvelle

Jusqu'à présent, il n'y avait qu'une seule façon prise en charge pour exécuter MAGI-2-preview : la pile de référence de Sand.ai, une image Docker plus torchrun, sur huit NVIDIA Hopper H100. C'est un chemin fonctionnel mais sur mesure — vous héritez du lanceur de Sand.ai, de ses décisions de déchargement, et de sa manière bien tranchée de répartir l'encodeur de texte, le preview, le refiner et le VAE entre les niveaux de mémoire. Une pull request ajoutant le modèle à SGLang est importante parce que SGLang est le runtime de service qu'une grande partie du monde de l'IA générative auto-hébergée déploie réellement en production. Un support de première classe signifie que MAGI-2-preview devient exécutable dans un runtime grand public avec les mécanismes de SGLang derrière lui — le parallélisme de séquence Ulysses, le parallélisme d'experts, le déchargement d'activations, le VAE, l'ordonnanceur et l'infrastructure des étapes de pipeline. C'est la différence entre « je peux l'exécuter sur leur pile » et « je peux l'exécuter sur la pile que mon équipe utilise déjà ».

Ce que la PR construit réellement

L'intégration repose sur les mécanismes existants de SGLang plutôt que sur le chemin de référence torchrun. La PR ajoute une couche MoE multi-têtes, la plomberie attention-sink, une attention locale à fenêtre par blocs pour l'étape de raffinement, et des hyper-connexions multi-flux — les éléments architecturaux de MagiMoE que les couches génériques n'expriment pas déjà. Autour d'eux, elle réutilise les composants existants de SGLang : parallélisme de séquence Ulysses, parallélisme d'experts, déchargement (offload), VAE, ordonnanceur et étages de pipeline. Elle fournit également de la documentation (une page de recettes MAGI-2 pour les documents de diffusion de SGLang) et 47 tests unitaires sans GPU, ce qui est un bon signe quant à la part du comportement du modèle qui peut être vérifiée sans louer huit H100.

La PR rend également explicites les contraintes du modèle :

• Matériel — huit NVIDIA Hopper H100, avec les modes de déchargement cpu / gpu / aller-retour de la pile de référence correspondant à l’emplacement de l’encodeur de texte, de l’aperçu, de l’affineur et du VAE entre les phases.

• Parallélisme — --num-gpus doit diviser chaque axe de tête, tandis que --tp-size, --ring-degree et --enable-cfg-parallel sont rejetés. Ce modèle possède de nombreuses dimensions de routage, et la configuration du parallélisme doit s'aligner sur elles.

• Sorties — seules les résolutions 1920×1088 et 896×512 sont acceptées, et uniquement des clips de 10 secondes ; torch.compile n'est pas pris en charge.

Ce dernier ensemble mérite d'être lu deux fois si vous planifiez un déploiement : il s'agit d'un modèle qui, du moins dans cette intégration précoce, est limité à deux résolutions et une seule durée.

Screenshot of SGLang pull request #35014 titled '[diffusion][Model] Support MAGI-2-preview' showing the PR description, the branch merging 5 commits into sgl-project:main, 43 files changed, and the CI checks status, in the sgl-project/sglang repository.

Qu'est-ce qui reste encore non vérifié ?

Tout ce qui concerne le travail de serving. La PR est ouverte, en attente des revues des code-owners, et les checks CI échouaient au 16 août. Une pull request de cette taille peut rester en revue pendant des jours ou des semaines ; il n'y a ni fusion, ni release, ni annonce de la part de SGLang. Et les affirmations côté modèle — le score VBench, le classement Artificial Analysis, le coût de 0,5 yuan — sont rapportées par le fournisseur et la presse, pas reproduites de manière indépendante. Si vous construisez un workflow sur cette PR aujourd'hui, vous construisez sur une roadmap, pas sur un runtime.

Ce que cela signifie pour le calcul des coûts.

La raison pour laquelle MAGI-2-preview a attiré l'attention, c'est son économie. Un modèle qui active 6B paramètres par token tout en portant une capacité de 114B est peu coûteux à exécuter par clip — Sand.ai avance un chiffre d'environ 0.5 yuan par clip 1080p de 10 secondes sur huit H100 — et c'est ce genre de chiffre qui décide si les petites équipes peuvent se permettre la génération vidéo du tout. Mais les 0.5 yuan supposent la pile de référence, le cluster H100 et aucun frais de service. La manière habituelle pour qu'un modèle ouvert comme celui-ci devienne largement utilisable passe par une API gérée : quelqu'un l'héberge, fixe un prix par clip, et vous n'avez pas à louer huit H100.

A single-column scoreboard for MAGI-2-preview titled 'MAGI-2-preview — the scoreboard' listing total params 114B (MoE), active params ~6B per token, VBench 86.54% (vendor-reported), Artificial Analysis image-to-video #6 with Elo ~1106, cost ~0.5 yuan per 10s 1080p clip, and serving status 'SGLang PR open, unmerged', with a footer reading 'All figures vendor- or press-reported; not yet independently verified.'

Lorsqu'une route hébergée existe, l'angle du routage devient pertinent. Sur une plateforme de routage, quel que soit le prix catalogue que le fournisseur fixe pour un clip d'aperçu MAGI-2, c'est ce que vous payez — OrcaRouter transmet les prix catalogue des fournisseurs sans aucune marge, si bien qu'une baisse de prix du fournisseur est en ligne de notre côté le jour même où elle est publiée, sans renégociation. Et un point de contrôle open-weight vieux de onze jours, sans benchmarks indépendants, est exactement le type de modèle que l'on veut derrière un basculement automatique : pointez une route dessus pour l'évaluation, gardez un repli éprouvé sur le même point de terminaison, et dès que le point de contrôle précoce cale ou produit quelque chose d'inutilisable, l'appel bascule au lieu de votre pipeline. C'est ainsi que l'on essaie un modèle non éprouvé sans miser un chemin de production dessus.

Ce que nous regardons maintenant

• Si la PR est fusionnée, et ce qui change lors de la revue. La liste des contraintes — deux résolutions, une durée, pas de torch.compile — n'est peut-être pas définitive.

• Le checkpoint distillé. Sand.ai annonce que des poids à étapes réduites arrivent ; c'est ce qui transforme le chiffre de 0,5 yuan d'une mesure de laboratoire en un coût réaliste par clip.

• Premiers benchmarks indépendants. Les chiffres de VBench et du leaderboard émanent du fournisseur et de la presse ; un test par un tiers permettrait de vérifier si l'affirmation des 6B actifs se tient.

• Que d'autres runtimes emboîtent le pas. SGLang est le premier runtime de serving majeur à prendre en charge MAGI-2-preview ; vLLM et d'autres ne devraient pas tarder à suivre.

• Le fait qu'une API managée apparaisse. Toute la proposition du modèle repose sur un faible coût à grande échelle ; dès l'instant où une route hébergée existe, les calculs de tarification en transparence ci-dessus s'appliquent.

Le résumé honnête : MAGI-2-preview est un modèle ouvert vieux de onze jours dont la structure de coûts pourrait compter, et la PR SGLang est le signe le plus clair à ce jour que l’écosystème le prend au sérieux. Mais le support de serving est une pull request ouverte, pas une capacité livrée. Traitez la feuille de route comme réelle et le runtime comme pas encore là — et lorsque le modèle arrivera enfin derrière une vraie API, l’approche failover-first est la façon de l’adopter sans engager un chemin de production sur un checkpoint que personne n’a benchmarké de manière indépendante.

© 2026 OrcaRouter

Pour les fournisseurs

Vous exploitez une plateforme d'inférence ? Proposez vos modèles sur OrcaRouter.

providers@orcarouter.ai

Rejoignez notre communauté

Discordsupport@orcarouter.aiXGitHubYouTube