Um cartão de título para o artigo 'MAGI-2-preview is heading to SGLang' com o subtítulo 'What the new serving PR reveals', mostrando um motivo de tira de filme que se transforma em nós de servidor e rede limpos sobre um fundo branco com acentos de gradiente azul-ciano, com o logotipo da OrcaRouter composto no canto inferior direito.
Guides & Insights

MAGI-2-preview está chegando ao SGLang: o que o novo PR de serving revela

Autor

Magnus Corvin

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

MAGI-2-preview, o modelo de geração de vídeo mixture-of-experts de 114 bilhões de parâmetros da Sand.ai, tornou-se open-source em 5 de agosto de 2026 — e onze dias depois surgiu o primeiro sinal de que ele está prestes a receber infraestrutura de serving de nível de produção. Em 16 de agosto, um pull request foi aberto no repositório SGLang intitulado [diffusion][Model] Support MAGI-2-preview (sgl-project/sglang, PR #35014), e o título é preciso: ele integra suporte nativo de serving para o modelo na stack de diffusion do SGLang. Além disso, até o momento em que este texto é escrito, ainda é um pull request — aberto, aguardando revisão dos code owners, com as verificações de CI falhando. Nada foi mesclado, então nada ainda pode ser servido. Mas para quem está avaliando se o MAGI-2-preview pode sair da configuração de referência Docker-and-torchrun da Sand.ai e migrar para um runtime de serving mainstream, o PR é um roteiro detalhado.

Então trate isto como um texto do tipo "o que sabemos até agora", não como uma nota de lançamento. O modelo é real e foi lançado — isso aconteceu em 5 de agosto, com pesos no Hugging Face e código no GitHub sob licença Apache-2.0. O que não foi verificado é o trabalho de servir o modelo: a integração com o SGLang é um único pull request aberto, seus detalhes podem mudar durante a revisão e, até que seja incorporado, o SGLang não pode de fato executar o MAGI-2-preview. O valor está no que o PR revela sobre o modelo e sobre o caminho para executá-lo em um runtime real.

O modelo ao qual o PR se refere, em um parágrafo.

MAGI-2-preview é a tentativa da Sand.ai de escalar a geração de vídeo da mesma forma que os modelos de linguagem escalaram — com uma mistura de especialistas, e é o sucessor do MAGI-1 de código aberto (um modelo de vídeo autorregressivo de 24B de abril de 2025). O novo modelo totaliza aproximadamente 114B de parâmetros, mas ativa apenas cerca de 6B por token, usando um MoE multi-cabeça de granularidade ultra-fina: um estado oculto de 3.072 dimensões é dividido em doze cabeças de 256 dimensões, cada uma roteando para seis de 256 especialistas, o que resulta em 3.072 unidades especialistas por camada MoE e 72 especialistas ativados por token em 36 camadas. É um modelo unificado de áudio-vídeo de fluxo único — texto, vídeo e áudio passam pelo mesmo transformador e trocam informações por meio de autoatenção em todas as camadas, em vez de um pipeline separado de atenção cruzada. Ele faz texto-para-vídeo e imagem-para-vídeo, e gera clipes de 10 segundos — a única duração suportada — com uma trilha sonora estéreo sincronizada gerada na mesma trajetória de denoising e multiplexada no arquivo de saída.

A geração ocorre em duas etapas. Uma magi2_preview etapa remove ruído em 512×896, depois uma magi2_refiner etapa aumenta a resolução para 1088×1920. A versão base usa 100 etapas de remoção de ruído na preview e 5 no refiner; a Sand.ai afirma que uma versão destilada com muito menos etapas está por vir. O conjunto de checkpoints é um único repositório Hugging Face de cerca de 307 GB: a etapa preview de 228 GB, um codificador de texto Qwen3.5-27B, o refiner de 14 GB, um VAE de áudio de 5 GB, um VAE de vídeo emprestado do Wan2.2-TI2V-5B e um decodificador VAE turbo destilado usado por padrão. Os requisitos de hardware são oito GPUs NVIDIA Hopper (classe H100), com o lançador de referência permitindo descarregar o codificador de texto, a preview, o refiner e o VAE entre CPU e GPU ao longo das fases.

{{1}}Em termos de desempenho, os números em circulação são relatados, não reproduzidos de forma independente.{{/1}} As alegações — {{2}}uma pontuação VBench de 86,54%, à frente da Sora 2 (84,37%) e da Kling 2.0 (84,20%) na mesma cobertura da imprensa chinesa, e 6º lugar no ranking de imagem-para-vídeo da Artificial Analysis com um Elo em torno de 1106{{/2}} — vêm da fornecedora e da cobertura de lançamento, e nada disso passou por uma execução independente de terceiros nos onze dias desde o lançamento. {{3}}A Sand.ai também cita um custo de inferência de cerca de 0,5 yuan (aproximadamente US$ 0,07) por clipe de 10 segundos em 1080p em oito H100s,{{/3}} {{4}}ou cerca de um décimo dos modelos de vídeo convencionais.{{/4}} {{5}}Considere tudo isso como algo relatado pela fornecedora e pela imprensa até que alguém realmente meça.{{/5}}

Screenshot of the GitHub repository SandAI-org/MAGI-2-preview showing the README 'MAGI-2-preview: Scaling Video Generation Models Efficiently', 528 stars, 14 forks, and the repository file listing.

Por que um pull request de servir é a verdadeira notícia

Até agora, houve exatamente uma maneira suportada de executar o MAGI-2-preview: a stack de referência da própria Sand.ai, uma imagem Docker mais torchrun, em oito NVIDIA Hopper H100s. Esse é um caminho funcional, porém sob medida — você herda o launcher da Sand.ai, suas decisões de offload e sua forma opinativa de distribuir o text encoder, o preview, o refiner e o VAE entre camadas de memória. Um pull request que adiciona o modelo ao SGLang importa porque o SGLang é o runtime de serving que uma grande parcela do mundo de IA generativa auto-hospedada realmente implanta em produção. Suporte de primeira classe significa que o MAGI-2-preview se torna executável em um runtime mainstream com a maquinaria do SGLang por trás — paralelismo de sequência Ulysses, paralelismo de especialistas, offload de ativações, o VAE, o agendador e a infraestrutura de estágios de pipeline. Essa é a diferença entre "consigo executar na stack deles" e "consigo executar na stack que meu time já opera."

O que o PR realmente constrói

A integração é construída sobre os mecanismos existentes do SGLang, em vez do caminho de referência do torchrun. O PR adiciona uma camada MoE multi-cabeça, infraestrutura de attention-sink, atenção local com janela de blocos para o estágio refiner e hiperconexões multi-stream — as peças arquiteturais do MagiMoE que camadas genéricas ainda não expressam. Em torno delas, ele reutiliza o paralelismo de sequência Ulysses existente do SGLang, o paralelismo de especialistas, offload, VAE, agendador e componentes de estágio de pipeline. Ele também traz documentação (uma página de cookbook MAGI-2 para a documentação de difusão do SGLang) e 47 testes unitários sem GPU, o que é um bom sinal de quanto do comportamento do modelo pode ser verificado sem alugar oito H100s.

O PR também torna explícitas as restrições do modelo:

• Hardware — oito NVIDIA Hopper H100s, com os modos de offload de cpu / gpu / roundtrip da stack de referência mapeando onde o codificador de texto, a preview, o refiner e a VAE ficam entre as fases.

• Paralelismo — --num-gpus deve dividir cada eixo de cabeça, enquanto --tp-size, --ring-degree e --enable-cfg-parallel são rejeitados. Este é um modelo com muitas dimensões de roteamento, e o layout de paralelismo tem que se alinhar a elas.

• Saídas — apenas as resoluções 1920×1088 e 896×512 são aceitas, e apenas clipes de 10 segundos; torch.compile não é suportado.

Vale a pena ler esse último conjunto duas vezes se você está planejando uma implantação: este é um modelo que, pelo menos nesta integração inicial, está limitado a duas resoluções e uma duração.

Screenshot of SGLang pull request #35014 titled '[diffusion][Model] Support MAGI-2-preview' showing the PR description, the branch merging 5 commits into sgl-project:main, 43 files changed, and the CI checks status, in the sgl-project/sglang repository.

O que ainda não está verificado

Tudo sobre o trabalho de serving. O PR está aberto, aguardando revisões dos code-owners, e as verificações de CI estavam falhando em 16 de agosto. Um pull request desse tamanho pode ficar em revisão por dias ou semanas; não há merge concluído, não há release e não há anúncio da SGLang. E as alegações do lado do modelo — a pontuação VBench, a classificação da Artificial Analysis, o valor de custo de 0,5 yuan — são relatadas pelo fornecedor e pela imprensa, não reproduzidas de forma independente. Se você construir um workflow com base nesse PR hoje, estará construindo sobre um roadmap, não sobre um runtime.

O que isso significa para o cálculo de custos

A razão pela qual o MAGI-2-preview chamou a atenção é a sua economia. Um modelo que ativa 6B parâmetros por token enquanto carrega 114B de capacidade é barato de executar por clipe — a Sand.ai coloca o número em cerca de 0,5 yuan por clipe de 1080p de 10 segundos em oito H100s — e esse é o tipo de número que decide se pequenas equipes podem ou não arcar com geração de vídeo. Mas os 0,5 yuan pressupõem a stack de referência, o cluster H100 e nenhuma sobrecarga de servidor. A forma usual de um modelo aberto como este se tornar amplamente utilizável é por meio de uma API gerenciada: alguém o hospeda, define o preço por clipe, e você não precisa alugar oito H100s.

A single-column scoreboard for MAGI-2-preview titled 'MAGI-2-preview — the scoreboard' listing total params 114B (MoE), active params ~6B per token, VBench 86.54% (vendor-reported), Artificial Analysis image-to-video #6 with Elo ~1106, cost ~0.5 yuan per 10s 1080p clip, and serving status 'SGLang PR open, unmerged', with a footer reading 'All figures vendor- or press-reported; not yet independently verified.'

Quando uma rota hospedada existe, o ângulo de roteamento se torna relevante. Em uma plataforma de roteamento, o preço de tabela que o fornecedor define para um clipe MAGI-2-preview é o que você paga — a OrcaRouter repassa os preços de tabela dos provedores com margem zero, então uma redução de preço do fornecedor fica ativa no nosso lado no mesmo dia em que sai, sem renegociação. E um checkpoint de pesos abertos de onze dias, sem benchmarks independentes, é exatamente o tipo de modelo que você quer por trás do failover automático: aponte uma rota para ele para avaliação, mantenha um fallback comprovado no mesmo endpoint e, no momento em que o checkpoint inicial travar ou produzir algo inutilizável, a chamada entra em failover em vez do seu pipeline. É assim que você experimenta um modelo não comprovado sem apostar um caminho de produção nele.

O que estamos assistindo agora

• Se o PR é mergeado e o que muda na revisão. A lista de restrições — duas resoluções, uma duração, sem torch.compile — pode não ser final.

• O checkpoint destilado. A Sand.ai afirma que pesos com menos etapas estão a caminho; é isso que transforma o valor de 0,5 yuan de uma medição de laboratório em um custo realista por clipe.

• Primeiros benchmarks independentes. Os números do VBench e do leaderboard são relatados pelo fornecedor e pela imprensa; uma execução por terceiros resolveria se a alegação de 6B ativo se sustenta.

• Se outros runtimes o seguirão. SGLang é o primeiro grande runtime de inferência a adotar MAGI-2-preview; vLLM e outros podem não estar muito atrás.

• Se uma API gerenciada aparece. Toda a proposta do modelo é baixo custo em escala; no momento em que existe uma rota hospedada, a matemática de precificação de repasse acima entra em vigor.

O resumo honesto: MAGI-2-preview é um modelo aberto com onze dias de vida cuja estrutura de custos pode importar, e o PR do SGLang é o sinal mais claro até agora de que o ecossistema está levando-o a sério. Mas o suporte de serving é um pull request aberto, não uma capacidade já lançada. Trate o roadmap como real e o runtime como ainda não pronto — e quando o modelo finalmente chegar por trás de uma API real, a abordagem failover-first é como você o adota sem comprometer um caminho de produção num checkpoint que ninguém avaliou de forma independente.

© 2026 OrcaRouter

Para provedores

Opera uma plataforma de inferência? Traga seus modelos para o OrcaRouter.

providers@orcarouter.ai

Junte-se à comunidade

Discordsupport@orcarouter.aiXGitHubYouTube