
MAGI-2-preview se dirige a SGLang: lo que revela el nuevo PR de serving
- DeepSeekNUEVODeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 por 1M de tokens
- z-aiNUEVOZ.ai: GLM 5.32026-08-1860Inteligencia75Código
- obsidianNUEVOQwen3.8 27B2026-08-1552Inteligencia68Código
- qwenNUEVOQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekNUEVODeepSeek: DeepSeek V4 Pro 08132026-08-1253Inteligencia69Código
- grokNUEVOSpaceXAI: Grok 4.62026-08-1261Inteligencia77Código
- metaMeta: Muse Spark 1.22026-08-0557Inteligencia72Código
- qwenQwen: Qwen3.8 Max2026-08-0358Inteligencia72Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligencia69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligencia78Código
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligencia69Código
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligencia49Código
- metaMeta: Muse Spark 1.12026-07-1653Inteligencia71Código
- kimiMoonshotAI: Kimi K32026-07-1560Inteligencia76Código
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligencia71Código
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Inteligencia77Código
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Inteligencia77Código
MAGI-2-preview, el modelo de generación de video de mezcla de expertos de 114 mil millones de parámetros de Sand.ai, se lanzó como código abierto el 5 de agosto de 2026 — y once días después ha aparecido la primera señal de que está a punto de obtener infraestructura de servido de nivel de producción. El 16 de agosto, se abrió una pull request en el repositorio de SGLang titulada [diffusion][Model] Support MAGI-2-preview (sgl-project/sglang, PR #35014), y el título es preciso: integra soporte nativo de servido para el modelo en el stack de difusión de SGLang. Además, al momento de escribir esto, sigue siendo una pull request — abierta, a la espera de la revisión de los propietarios del código, con las comprobaciones de CI fallando. Nada se ha fusionado, así que todavía no se puede servir nada. Pero para cualquiera que esté sopesando si MAGI-2-preview puede dejar atrás la configuración de referencia de Docker y torchrun de Sand.ai y pasar a un runtime de servido convencional, la PR es una hoja de ruta detallada.
Así que traten esto como una pieza de lo que sabemos hasta ahora, no como una nota de lanzamiento. El modelo es real y se publicó — eso ocurrió el 5 de agosto, con pesos en Hugging Face y código en GitHub bajo una licencia Apache-2.0. Lo que no está verificado es el trabajo de serving: la integración con SGLang es una sola pull request abierta, sus detalles pueden cambiar durante la revisión, y hasta que se fusione, SGLang no puede ejecutar realmente MAGI-2-preview. El valor está en lo que la PR revela sobre el modelo y sobre el camino para ejecutarlo en un runtime real.
El modelo para el que es el PR, en un párrafo
MAGI-2-preview es el intento de Sand.ai de escalar la generación de video de la manera en que los modelos de lenguaje escalaron — con una mezcla de expertos, y es el sucesor del MAGI-1 de código abierto (un modelo de video autorregresivo de 24B de abril de 2025). El nuevo modelo tiene en total aproximadamente 114B de parámetros, pero activa solo unos 6B por token, usando un MoE multi-cabeza de grano ultra fino: un estado oculto de 3,072 dimensiones se divide en doce cabezas de 256 dimensiones, cada una enrutando a seis de 256 expertos, lo que resulta en 3,072 unidades expertas por capa MoE y 72 expertos activados por token a lo largo de 36 capas. Es un modelo unificado de audio-video de flujo único — el texto, el video y el audio pasan a través del mismo transformer e intercambian información mediante auto-atención en cada capa, en lugar de a través de un pipeline separado de atención cruzada. Hace texto-a-video e imagen-a-video, y genera clips de 10 segundos — la única duración soportada — con una banda sonora estéreo sincronizada generada en la misma trayectoria de denoising y multiplexada en el archivo de salida.
La generación se ejecuta en dos etapas. Una magi2_preview etapa reduce el ruido a 512×896, y luego una magi2_refiner etapa aumenta la resolución a 1088×1920. La versión base utiliza 100 pasos de reducción de ruido en la previsualización y 5 en el refinador; Sand.ai afirma que próximamente llegará una versión destilada con muchos menos pasos. El conjunto de checkpoints es un único repositorio de Hugging Face de unos 307 GB: la etapa de previsualización de 228 GB, un codificador de texto Qwen3.5-27B, el refinador de 14 GB, un VAE de audio de 5 GB, un VAE de video tomado de Wan2.2-TI2V-5B y un decodificador VAE turbo destilado que se usa de forma predeterminada. Los requisitos de hardware son ocho GPU NVIDIA Hopper (clase H100), y el lanzador de referencia permite descargar el codificador de texto, la previsualización, el refinador y el VAE entre la CPU y la GPU en las distintas fases.
Sobre el rendimiento, las cifras que circulan están reportadas, no verificadas de forma independiente. Las afirmaciones —una puntuación de 86,54 % en VBench, por delante de Sora 2 (84,37 %) y Kling 2.0 (84,20 %) según esa misma cobertura de prensa china, y el 6.º puesto en el ranking de imagen a video de Artificial Analysis con un Elo de alrededor de 1106— provienen del proveedor y de la cobertura del lanzamiento, y ninguna ha sido verificada mediante una ejecución independiente por terceros en los once días transcurridos desde su lanzamiento. Sand.ai también menciona un coste de inferencia de unos 0,5 yuanes (aproximadamente 0,07 USD) por clip de 10 segundos en 1080p en ocho H100, es decir, alrededor de una décima parte de los modelos de video convencionales. Considere todo esto como información reportada por el proveedor y la prensa hasta que alguien lo mida de forma independiente.

Por qué una solicitud de extracción de servicio es la noticia real
Hasta ahora ha habido exactamente una forma compatible de ejecutar MAGI-2-preview: la pila de referencia de Sand.ai, una imagen de Docker más torchrun, en ocho NVIDIA Hopper H100. Ese es un camino funcional pero hecho a medida: heredas el lanzador de Sand.ai, sus decisiones de descarga y su particular forma de distribuir el codificador de texto, el preview, el refinador y el VAE entre los niveles de memoria. Una pull request que añada el modelo a SGLang es importante porque SGLang es el runtime de servicio que una gran parte del mundo de la IA generativa autoalojada realmente despliega en producción. El soporte de primera clase significa que MAGI-2-preview se vuelve ejecutable en un runtime convencional con la maquinaria de SGLang detrás: paralelismo de secuencia Ulysses, paralelismo de expertos, descarga de activaciones, el VAE, el programador y la infraestructura de etapas de pipeline. Esa es la diferencia entre "puedo ejecutarlo en su pila" y "puedo ejecutarlo en la pila que mi equipo ya opera".
Lo que el PR realmente construye
La integración se construye sobre la maquinaria existente de SGLang, no sobre la ruta de referencia de torchrun. El PR añade una capa MoE de múltiples cabezas, canalización de atención-sink, atención local de ventana de bloques para la etapa de refinado e hiperconexiones de múltiples flujos — las piezas arquitectónicas de MagiMoE que las capas genéricas no expresan ya. Alrededor de ellas, reutiliza el paralelismo de secuencias Ulysses existente de SGLang, el paralelismo de expertos, la descarga, VAE, el programador y los componentes de etapas de canalización. También incluye documentación (una página de recetas MAGI-2 para la documentación de difusión de SGLang) y 47 pruebas unitarias sin GPU, lo cual es una buena señal de cuánto del comportamiento del modelo se puede verificar sin alquilar ocho H100.
El PR también hace explícitas las restricciones del modelo:
• Hardware — ocho NVIDIA Hopper H100, con los modos de descarga cpu / gpu / roundtrip de la pila de referencia según la ubicación entre fases del codificador de texto, la vista previa, el refinador y la VAE.
• Paralelismo — --num-gpus debe dividir cada eje de cabezas, mientras que --tp-size, y --ring-degree, y --enable-cfg-parallel son rechazados. Este es un modelo con muchas dimensiones de enrutamiento, y la disposición del paralelismo debe alinearse con ellas.
• Salidas: solo se aceptan resoluciones de 1920×1088 y 896×512, y solo clips de 10 segundos; torch.compile no es compatible.
Ese último conjunto vale la pena leerlo dos veces si planeas un despliegue: este es un modelo que, al menos en esta integración temprana, está limitado a dos resoluciones y una duración.
![Screenshot of SGLang pull request #35014 titled '[diffusion][Model] Support MAGI-2-preview' showing the PR description, the branch merging 5 commits into sgl-project:main, 43 files changed, and the CI checks status, in the sgl-project/sglang repository.](https://cms.orcarouter.ai/api/media/file/3-297.png)
¿Qué sigue sin verificar?
Todo sobre el trabajo de serving. El PR está abierto, a la espera de las revisiones de los code-owners, y las comprobaciones de CI estaban fallando a partir del 16 de agosto. Un pull request de este tamaño puede permanecer en revisión durante días o semanas; no hay estado fusionado, ni release, ni ningún anuncio de SGLang. Y las afirmaciones del lado del modelo — la puntuación de VBench, el puesto en Artificial Analysis, la cifra de 0,5 yuanes — provienen de informes del proveedor y de la prensa, no han sido reproducidas de forma independiente. Si construyes un flujo de trabajo sobre este PR hoy, estás construyendo sobre una hoja de ruta, no sobre un runtime.
Qué significa para el cálculo de costos
La razón por la que MAGI-2-preview llamó la atención es su economía. Un modelo que activa 6B de parámetros por token mientras tiene una capacidad de 114B es barato de ejecutar por clip — Sand.ai sitúa la cifra en unos 0.5 yuanes por clip de 1080p de 10 segundos en ocho H100 — y ese es el tipo de cifra que determina si los equipos pequeños pueden permitirse la generación de video. Pero los 0.5 yuanes asumen la pila de referencia, el clúster de H100 y sin overhead de servicio. La forma habitual de que un modelo abierto como este se vuelva ampliamente utilizable es mediante una API gestionada: alguien lo aloja, lo cobra por clip, y no alquilas ocho H100.

Cuando existe una ruta alojada, el ángulo de enrutamiento cobra relevancia. {{1}}En una plataforma de enrutamiento, el precio de lista que el proveedor fije para un clip de MAGI-2-preview es exactamente lo que pagas — OrcaRouter traslada los precios de lista del proveedor sin margen adicional, así que un recorte de precio del proveedor está activo en nuestro lado el mismo día en que se publica, sin renegociación.{{/1}} Y un checkpoint de pesos abiertos con once días de antigüedad y sin benchmarks independientes es exactamente el tipo de modelo que quieres detrás de una conmutación por error automática: {{2}}apunta una ruta hacia él para evaluación, mantén un respaldo probado en el mismo endpoint, y en el momento en que el checkpoint inicial se detenga o produzca algo inutilizable, la llamada conmuta por error en lugar de tu pipeline.{{/2}} Así es como se prueba un modelo no validado sin apostar una ruta de producción en él.
Lo que estamos viendo ahora
• Si el PR se fusiona y qué cambios hay en revisión. La lista de restricciones — dos resoluciones, una duración, sin torch.compile — puede no ser definitiva.
El checkpoint destilado. Sand.ai dice que los pesos con menos pasos están por llegar; eso es lo que convierte la cifra de 0,5 yuanes de una medición de laboratorio en un costo realista por clip.
• Primeros benchmarks independientes. Las cifras de VBench y del leaderboard provienen de informes del proveedor y de la prensa; una ejecución por un tercero resolvería si la afirmación de los 6B activos se sostiene.
• Si otros runtimes lo siguen. SGLang es el primer runtime de servicio importante en adoptar MAGI-2-preview; vLLM y otros pueden no quedarse atrás.
{{1}}Si aparece una API gestionada{{/1}}. Toda la propuesta del modelo es bajo costo a escala; {{2}}en el momento en que exista una ruta alojada{{/2}}, {{3}}se activan los cálculos de precios de traspaso descritos anteriormente{{/3}}.
El resumen honesto: MAGI-2-preview es un modelo abierto de once días cuya estructura de costos podría importar, y el PR de SGLang es la señal más clara hasta ahora de que el ecosistema se lo toma en serio. Pero el soporte de serving es un pull request abierto, no una capacidad ya disponible. Trata la hoja de ruta como real y el runtime como algo que aún no está listo — y cuando el modelo finalmente llegue detrás de una API real, el enfoque failover-first es como adoptarlo sin poner en juego una ruta de producción por un checkpoint que nadie ha evaluado de forma independiente.
