Una title card per l'articolo 'MAGI-2-preview is heading to SGLang' con il sottotitolo 'What the new serving PR reveals', che mostra un motivo a strisce di pellicola che si trasforma in nodi di server e rete puliti su uno sfondo bianco con accenti in gradiente blu-ciano, con il logo OrcaRouter composto in basso a destra.
Guides & Insights

MAGI-2-preview arriva su SGLang: cosa rivela la nuova PR di serving

Autore

Magnus Corvin

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

MAGI-2-preview, il modello di generazione video mixture-of-experts da 114 miliardi di parametri di Sand.ai, è diventato open-source il 5 agosto 2026 — e undici giorni dopo è apparso il primo segno che sta per dotarsi di un'infrastruttura di serving di livello produttivo. Il 16 agosto è stata aperta una pull request nel repository SGLang intitolata [diffusion][Model] Support MAGI-2-preview (sgl-project/sglang, PR #35014), e il titolo è accurato: integra il supporto nativo per il serving del modello nello stack di diffusione di SGLang. Inoltre, al momento in cui scriviamo, è ancora una pull request — aperta, in attesa di revisione da parte dei code owner, con i controlli CI che falliscono. Non è stato fatto alcun merge, quindi nulla è ancora servibile. Ma per chiunque stia valutando se MAGI-2-preview possa spostarsi dalla configurazione di riferimento Docker-and-torchrun di Sand.ai a un runtime di serving mainstream, la PR è una roadmap dettagliata.

Quindi trattatelo come un articolo su ciò che sappiamo finora, non come una nota di rilascio. Il modello è reale ed è stato distribuito — è successo il 5 agosto, con i pesi su Hugging Face e il codice su GitHub con licenza Apache-2.0. Ciò che non è verificato è il lavoro di serving: l'integrazione SGLang è una singola pull request aperta, i suoi dettagli possono cambiare in fase di revisione e, finché non viene accettata, SGLang non può effettivamente eseguire MAGI-2-preview. Il valore sta in ciò che la PR rivela sul modello e sul percorso per eseguirlo in un runtime reale.

Il modello a cui si riferisce la PR, in un paragrafo.

MAGI-2-preview è il tentativo di Sand.ai di scalare la generazione video nello stesso modo in cui i modelli linguistici sono stati scalati — con una miscela di esperti — ed è il successore del modello open-source MAGI-1 (un modello video autoregressivo da 24B rilasciato ad aprile 2025). Il nuovo modello ha in totale circa 114 miliardi di parametri, ma ne attiva solo circa 6 miliardi per token, utilizzando un MoE multi-testa a grana finissima: uno stato nascosto a 3.072 dimensioni è suddiviso in dodici teste da 256 dimensioni, ciascuna delle quali instrada verso sei dei 256 esperti, il che equivale a 3.072 unità esperte per livello MoE e 72 esperti attivati per token su 36 livelli. È un modello audio-video unificato a flusso singolo: testo, video e audio passano attraverso lo stesso trasformatore e si scambiano informazioni tramite l'auto-attenzione a ogni livello, invece che attraverso un pipeline separato di attenzione incrociata. Supporta la generazione da testo a video e da immagine a video, e genera clip di 10 secondi — l'unica durata supportata — con una colonna sonora stereo sincronizzata generata nella stessa traiettoria di denoising e multiplexata nel file di output.

La generazione avviene in due fasi. Uno stadio denominato magi2_preview rimuove il rumore a 512×896, poi uno stadio denominato magi2_refiner porta la risoluzione a 1088×1920. La versione base usa 100 passi di denoising per la preview e 5 per il refiner; Sand.ai afferma che arriverà una versione distillata con molti meno passi. Il set di checkpoint è un singolo repository Hugging Face di circa 307 GB: lo stadio preview da 228 GB, un text encoder Qwen3.5-27B, il refiner da 14 GB, una VAE audio da 5 GB, una VAE video presa da Wan2.2-TI2V-5B e un decoder VAE turbo distillato usato di default. I requisiti hardware sono otto GPU NVIDIA Hopper (classe H100), con il launcher di riferimento che consente di trasferire il text encoder, la preview, il refiner e la VAE tra CPU e GPU nelle varie fasi.

Sul fronte delle prestazioni, le cifre in circolazione sono riportate, non verificate in modo indipendente. Le affermazioni — un punteggio VBench di 86,54%, davanti a Sora 2 (84,37%) e Kling 2.0 (84,20%) nella stessa copertura stampa cinese, e 6° posto nella classifica image-to-video di Artificial Analysis con un Elo di circa 1106 — provengono dal fornitore e dalla copertura del lancio, e nessuna di esse ha ricevuto una valutazione indipendente da terzi negli undici giorni trascorsi dal rilascio. Sand.ai cita inoltre un costo di inferenza di circa 0,5 yuan (circa $0,07) per clip 1080p di 10 secondi su otto H100, ovvero circa un decimo dei modelli video mainstream. Considerate tutto come riportato da fornitore e stampa finché qualcuno non lo misurerà.

Screenshot of the GitHub repository SandAI-org/MAGI-2-preview showing the README 'MAGI-2-preview: Scaling Video Generation Models Efficiently', 528 stars, 14 forks, and the repository file listing.

Perché una pull request per il serving è la vera notizia

Fino ad ora c'è stato esattamente un modo supportato per eseguire MAGI-2-preview: lo stack di riferimento di Sand.ai, un'immagine Docker più torchrun, su otto GPU NVIDIA Hopper H100. È un percorso funzionante ma su misura: erediti il launcher di Sand.ai, le sue decisioni di offload e il suo modo prescrittivo di distribuire l'encoder di testo, la preview, il refiner e la VAE tra i livelli di memoria. Una pull request che aggiunge il modello a SGLang è importante perché SGLang è il runtime di serving che gran parte del mondo di IA generativa self-hosted utilizza effettivamente in produzione. Un supporto di prima classe significa che MAGI-2-preview diventa eseguibile in un runtime mainstream con alle spalle i meccanismi di SGLang — parallelismo di sequenza di Ulysses, parallelismo degli esperti, offload delle attivazioni, la VAE, lo scheduler e l'infrastruttura degli stadi di pipeline. Questa è la differenza tra "posso eseguirlo sul loro stack" e "posso eseguirlo sullo stack che il mio team già gestisce."

Cosa costruisce in realtà la PR

L'integrazione è costruita sui meccanismi SGLang esistenti, non sul percorso torchrun di riferimento. La PR aggiunge un layer MoE multi-head, i meccanismi di attention sink, l'attenzione locale a finestra a blocchi per lo stadio di refiner e le iper-connessioni multi-stream — gli elementi architetturali di MagiMoE che i layer generici non esprimono già. Attorno a questi riutilizza i componenti esistenti di SGLang per il parallelismo di sequenza Ulysses, il parallelismo degli esperti, l'offload, il VAE, lo scheduler e gli stadi di pipeline. Include anche documentazione (una pagina cookbook MAGI-2 nella documentazione di diffusione di SGLang) e 47 test unitari senza GPU, un buon segno di quanto del comportamento del modello possa essere verificato senza noleggiare otto H100.

La PR rende anche espliciti i vincoli del modello:

• Hardware — otto NVIDIA Hopper H100, con le modalità di offload cpu / gpu / roundtrip dello stack di riferimento che mappano dove si collocano text encoder, preview, refiner e VAE tra le fasi.

• Parallelismo — --num-gpus deve dividere ogni asse delle teste, mentre --tp-size, --ring-degree, e --enable-cfg-parallel vengono rifiutati. Questo è un modello con molte dimensioni di routing, e il layout del parallelismo deve allinearsi a esse.

• Output — sono accettate solo le risoluzioni 1920×1088 e 896×512, e solo clip di 10 secondi; torch.compile non è supportato.

Quell'ultimo set vale la pena di leggerlo due volte se stai pianificando un deployment: questo è un modello che, almeno in questa integrazione iniziale, è vincolato a due risoluzioni e a una sola durata.

Screenshot of SGLang pull request #35014 titled '[diffusion][Model] Support MAGI-2-preview' showing the PR description, the branch merging 5 commits into sgl-project:main, 43 files changed, and the CI checks status, in the sgl-project/sglang repository.

Cosa è ancora non verificato

Tutto sul lavoro di serving. La PR è aperta, in attesa delle revisioni dei code-owner, e i controlli CI fallivano al 16 agosto. Una pull request di queste dimensioni può restare in revisione per giorni o settimane; non c'è alcuno stato di merge, nessuna release e nessun annuncio da parte di SGLang. E le affermazioni relative al modello — il punteggio VBench, la posizione su Artificial Analysis, il costo di 0,5 yuan — provengono dal vendor e dalla stampa, non sono state riprodotte in modo indipendente. Se oggi costruisci un workflow su questa PR, stai costruendo su una roadmap, non su un runtime.

Cosa significa per il calcolo dei costi

Il motivo per cui MAGI-2-preview ha attirato l'attenzione è la sua economia. Un modello che attiva 6 miliardi di parametri per token pur portando 114 miliardi di capacità è economico da eseguire per clip — Sand.ai stima il costo in circa 0,5 yuan per clip 1080p di 10 secondi su otto H100 — ed è quel tipo di numero che determina se i piccoli team possono permettersi la generazione video. Ma gli 0,5 yuan presuppongono lo stack di riferimento, il cluster H100 e nessun overhead di serving. Il modo abituale in cui un modello open come questo diventa ampiamente utilizzabile è tramite un'API gestita: qualcuno lo ospita, applica un prezzo per clip e tu non devi noleggiare otto H100.

A single-column scoreboard for MAGI-2-preview titled 'MAGI-2-preview — the scoreboard' listing total params 114B (MoE), active params ~6B per token, VBench 86.54% (vendor-reported), Artificial Analysis image-to-video #6 with Elo ~1106, cost ~0.5 yuan per 10s 1080p clip, and serving status 'SGLang PR open, unmerged', with a footer reading 'All figures vendor- or press-reported; not yet independently verified.'

Quando esiste una route ospitata, l'aspetto del routing diventa rilevante. Su una piattaforma di routing, qualunque sia il prezzo di listino che il fornitore imposta per un clip MAGI-2-preview, è quello che paghi — OrcaRouter trasmette i prezzi di listino dei fornitori senza alcun markup, quindi un taglio di prezzo del fornitore è attivo dalla nostra parte lo stesso giorno in cui viene rilasciato, senza rinegoziazione. E un checkpoint open-weight di undici giorni senza benchmark indipendenti è esattamente il tipo di modello che vuoi dietro il failover automatico: punti una route verso di esso per la valutazione, mantieni un fallback comprovato sullo stesso endpoint e, nel momento in cui il checkpoint iniziale va in stallo o produce qualcosa di inutilizzabile, la chiamata va in failover, non la tua pipeline. È così che provi un modello non collaudato senza puntarci un percorso di produzione.

Cosa stiamo guardando ora

• Se la PR viene mergiata, e cosa cambia in review. La lista dei vincoli — due risoluzioni, una durata, niente torch.compile — potrebbe non essere definitiva.

• Il checkpoint distillato. Sand.ai afferma che i pesi con meno step stanno arrivando; è questo che trasforma la cifra di 0,5 yuan da una misurazione di laboratorio in un costo realistico per clip.

• Primi benchmark indipendenti. Le cifre di VBench e della leaderboard sono riportate da fornitori e stampa; una run di terze parti stabilirebbe come regge l'affermazione sui 6B attivi.

Se altri runtime seguiranno. SGLang è il primo importante runtime di servizio ad adottare MAGI-2-preview; vLLM e altri potrebbero non essere molto indietro.

• Se appare un'API gestita. L'intera proposta del modello si basa sul basso costo su larga scala; nel momento in cui esiste una route ospitata, il calcolo dei prezzi pass-through di cui sopra diventa effettivo.

Il riepilogo onesto: MAGI-2-preview è un modello open source di undici giorni la cui struttura dei costi potrebbe essere rilevante, e la PR di SGLang è il segnale più chiaro finora che l'ecosistema lo prende sul serio. Ma il supporto per il serving è una pull request aperta, non una funzionalità già rilasciata. Tratta la roadmap come reale e il runtime come non ancora pronto — e quando il modello sarà finalmente disponibile dietro una vera API, l'approccio failover-first è il modo per adottarlo senza vincolare un percorso di produzione a un checkpoint che nessuno ha benchmarkato in modo indipendente.

© 2026 OrcaRouter

Per i provider

Gestisci una piattaforma di inferenza? Porta i tuoi modelli su OrcaRouter.

providers@orcarouter.ai

Unisciti alla community

Discordsupport@orcarouter.aiXGitHubYouTube