
MAGI-2-preview가 SGLang로 향하고 있습니다: 새로운 서빙 PR이 드러내는 내용
- DeepSeekNEWDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 100만 토큰당
- z-aiNEWZ.ai: GLM 5.32026-08-1860지능75코딩
- obsidianNEWQwen3.8 27B2026-08-1552지능68코딩
- qwenNEWQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekNEWDeepSeek: DeepSeek V4 Pro 08132026-08-1253지능69코딩
- grokNEWSpaceXAI: Grok 4.62026-08-1261지능77코딩
- metaMeta: Muse Spark 1.22026-08-0557지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0358지능72코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463지능78코딩
- googleGoogle: Gemini 3.6 Flash2026-07-2152지능69코딩
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137지능49코딩
- metaMeta: Muse Spark 1.12026-07-1653지능71코딩
- kimiMoonshotAI: Kimi K32026-07-1560지능76코딩
- openaiOpenAI: GPT-5.6 Luna2026-07-0952지능71코딩
- openaiOpenAI: GPT-5.6 Terra2026-07-0957지능77코딩
- openaiOpenAI: GPT-5.6 Sol2026-07-0961지능77코딩
MAGI-2-preview는 Sand.ai의 1,140억 파라미터 혼합 전문가(mixture-of-experts) 비디오 생성 모델로, 2026년 8월 5일 오픈소스로 공개되었으며, 11일 후 프로덕션급 서빙 인프라를 갖추게 될 것이라는 첫 신호가 나타났다. 8월 16일, SGLang 저장소에 [diffusion][Model] Support MAGI-2-preview라는 제목의 풀 리퀘스트가 열렸다 (sgl-project/sglang, PR #35014). 그리고 그 제목은 정확하다. 이 PR은 모델에 대한 네이티브 서빙 지원을 SGLang의 diffusion 스택에 연결한다. 또한 이 글을 작성하는 시점 기준으로, 이는 여전히 풀 리퀘스트 상태다 — 열려 있고, 코드 소유자의 리뷰를 기다리고 있으며, CI 검사는 실패하고 있다. 병합된 것은 없으므로 아직 서빙 가능한 것은 없다. 그러나 MAGI-2-preview가 Sand.ai의 참조 Docker-and-torchrun 설정에서 벗어나 주류 서빙 런타임으로 옮겨갈 수 있을지 저울질하는 사람에게 이 PR은 상세한 로드맵이다.
그러니 이것을 릴리스 노트가 아니라 지금까지 알려진 내용을 정리한 글로 봐 주세요. 모델은 실제로 존재하며 이미 출시되었습니다. 8월 5일에 이루어졌고, 가중치는 Hugging Face에, 코드는 Apache-2.0 라이선스로 GitHub에 공개되었습니다. 검증되지 않은 부분은 서빙 작업입니다. SGLang 통합은 아직 오픈된 단일 풀 리퀘스트일 뿐이며, 리뷰 과정에서 세부 사항이 변경될 수 있고, 병합되기 전까지는 SGLang이 실제로 MAGI-2-preview를 실행할 수 없습니다. 가치는 바로 그 PR이 모델과 실제 런타임에서 실행하는 경로에 대해 보여주는 바에 있습니다.
이 PR이 대상으로 하는 모델을 한 단락으로 설명하세요.
MAGI-2-preview는 Sand.ai가 언어 모델이 확장된 방식, 즉 전문가 혼합(mixture of experts)으로 비디오 생성의 규모를 확장하려는 시도이며, 오픈소스 MAGI-1(2025년 4월의 24B 자동회귀 비디오 모델)의 후속 모델입니다. 새 모델은 총 약 114B 파라미터를 가지지만 토큰당 약 6B만 활성화하고, 초세분화 멀티헤드 MoE를 사용합니다. 3,072차원의 은닉 상태는 12개의 256차원 헤드로 분할되고, 각 헤드는 256개의 전문가 중 6개로 라우팅되며, 이는 MoE 레이어당 3,072개의 전문가 유닛, 36개 레이어에 걸쳐 토큰당 72개의 전문가가 활성화되는 셈입니다. 이는 통합된 단일 스트림 오디오-비디오 모델로, 텍스트, 비디오, 오디오가 동일한 트랜스포머를 통과하고 별도의 교차 어텐션 파이프라인 대신 모든 레이어에서 셀프 어텐션을 통해 정보를 교환합니다. 텍스트-비디오 및 이미지-비디오 생성을 지원하며, 동일한 디노이징 궤적에서 생성되고 출력 파일에 먹싱되는 동기화된 스테레오 사운드트랙과 함께 10초 클립(유일하게 지원되는 길이)을 생성합니다.
생성은 두 단계로 실행됩니다. magi2_preview 단계는 512×896에서 노이즈를 제거한 다음, magi2_refiner 단계는 1088×1920으로 업스케일합니다. 기본 릴리스는 프리뷰 100회 및 리파이너 5회의 노이즈 제거 단계를 사용합니다. Sand.ai는 단계 수가 훨씬 적은 증류 버전이 곧 출시될 것이라고 밝혔습니다. 체크포인트 세트는 약 307 GB 규모의 단일 Hugging Face 저장소입니다. 구성 요소는 228 GB 프리뷰 단계, Qwen3.5-27B 텍스트 인코더, 14 GB 리파이너, 5 GB 오디오 VAE, Wan2.2-TI2V-5B에서 차용한 비디오 VAE, 그리고 기본적으로 사용되는 증류형 터보 VAE 디코더입니다. 하드웨어 요구 사항은 8개의 NVIDIA Hopper(H100급) GPU이며, 참조 런처를 사용하면 텍스트 인코더, 프리뷰, 리파이너, VAE를 여러 단계에 걸쳐 CPU와 GPU 간에 오프로드할 수 있습니다.
성능과 관련해 유통되는 수치는 보고된 수치일 뿐 독립적으로 재현된 것이 아니다. 동일한 중국 언론 보도에서 VBench 점수 86.54%로 Sora 2(84.37%)와 Kling 2.0(84.20%)을 앞섰고, Artificial Analysis 이미지-투-비디오 리더보드에서 Elo 약 1106으로 6위를 기록했다는 주장들은 공급업체와 출시 보도에서 나온 것이며, 출시 이후 11일 동안 그 어느 것도 독립적인 제3자 실행을 거치지 않았다. Sand.ai는 또한 H100 8대 기준 10초 분량의 1080p 클립당 추론 비용을 약 0.5위안(대략 $0.07), 즉 주류 비디오 모델의 약 10분의 1 수준으로 인용한다. 누군가 측정할 때까지 이 모든 것을 공급업체·언론 보도 수치로 간주하라.

왜 서빙 풀 리퀘스트가 진짜 뉴스인가?
지금까지 MAGI-2-preview를 실행하는 지원되는 방법은 정확히 하나뿐이었습니다: Sand.ai의 자체 레퍼런스 스택, 즉 Docker 이미지와 torchrun을 사용하여 NVIDIA Hopper H100 8개에서 실행하는 방법입니다. 이는 작동은 하지만 맞춤형 경로입니다. Sand.ai의 런처, 오프로드 결정, 그리고 텍스트 인코더, 프리뷰, 리파이너, VAE를 메모리 계층 간에 배치하는 독자적인 방식을 그대로 물려받게 됩니다. 모델을 SGLang에 추가하는 풀 리퀘스트가 중요한 이유는, SGLang이 셀프 호스팅 생성형 AI 세계의 상당 부분이 실제 프로덕션에서 배포하는 서빙 런타임이기 때문입니다. 일급 지원이란 MAGI-2-preview가 SGLang의 메커니즘, 즉 Ulysses 시퀀스 병렬 처리, 전문가 병렬 처리, 활성화 오프로드, VAE, 스케줄러, 파이프라인 스테이지 인프라를 뒤에 두고 주류 런타임에서 실행 가능해진다는 뜻입니다. 이는 "그들의 스택에서 실행할 수 있다"와 "우리 팀이 이미 운영하는 스택에서 실행할 수 있다"의 차이입니다.
PR이 실제로 무엇을 만드는지
{{1}}이 통합은 참조 torchrun 경로가 아닌 기존 SGLang 메커니즘을 기반으로 구축되었습니다.{{/1}} {{2}}이 PR은 멀티헤드 MoE 레이어, 어텐션 싱크 배선, 리파이너 단계를 위한 블록-윈도우 로컬 어텐션, 멀티스트림 하이퍼-커넥션 등 일반 레이어로는 표현할 수 없는 MagiMoE의 아키텍처 구성 요소를 추가합니다.{{/2}} {{3}}이와 함께 SGLang의 기존 Ulysses 시퀀스 병렬 처리, 전문가 병렬 처리, 오프로드, VAE, 스케줄러, 파이프라인 스테이지 구성 요소를 재사용합니다.{{/3}} {{4}}또한 문서(SGLang의 확산 모델 문서용 MAGI-2 쿡북 페이지)를 제공하며{{/4}} {{5}}GPU가 필요 없는 단위 테스트 47개도 포함합니다.{{/5}} {{6}}이는 H100 8대를 임대하지 않고도 모델 동작의 상당 부분을 검증할 수 있음을 보여주는 좋은 신호입니다.{{/6}}
또한 해당 PR은 모델의 제약 조건을 명시적으로 만듭니다:
• 하드웨어 — 8개의 NVIDIA Hopper H100. 참조 스택의 CPU/GPU/라운드트립 오프로드 모드는 단계 사이에 텍스트 인코더, 프리뷰, 리파이너, VAE가 위치하는 지점에 매핑됩니다.
• 병렬 처리 — --num-gpus는 모든 헤드 축을 나누어야 하며, --tp-size, --ring-degree, 그리고 --enable-cfg-parallel은 거부됩니다. 이 모델은 라우팅 차원이 많은 모델이며, 병렬 처리 레이아웃이 그 차원들과 일치해야 합니다.
• 출력 — 1920×1088 및 896×512 해상도만 허용되며, 10초 클립만 허용됩니다. torch.compile은 지원되지 않습니다.
마지막 세트는 배포를 계획 중이라면 두 번 읽어볼 가치가 있습니다: 적어도 이 초기 통합 단계에서는 두 가지 해상도와 하나의 지속 시간으로 고정된 모델입니다.
![Screenshot of SGLang pull request #35014 titled '[diffusion][Model] Support MAGI-2-preview' showing the PR description, the branch merging 5 commits into sgl-project:main, 43 files changed, and the CI checks status, in the sgl-project/sglang repository.](https://cms.orcarouter.ai/api/media/file/3-297.png)
아직 검증되지 않은 것은 무엇인가?
서빙 작업에 관한 모든 것입니다. PR은 열려 있으며 코드 소유자 리뷰를 기다리고 있고, CI 검사는 8월 16일 기준으로 실패하고 있었습니다. 이 정도 규모의 풀 리퀘스트는 며칠 또는 몇 주 동안 리뷰에 머물 수 있습니다. 병합된 상태도, 릴리스도, SGLang의 발표도 없습니다. 그리고 모델 측 주장(VBench 점수, Artificial Analysis 순위, 0.5위안 비용 수치)은 벤더와 언론이 보도한 것일 뿐, 독립적으로 재현된 것이 아닙니다. 오늘 이 PR 위에 워크플로우를 구축한다면, 런타임이 아닌 로드맵 위에 구축하는 것입니다.
비용 계산에 있어서의 의미
MAGI-2-preview가 주목을 받은 이유는 경제성 때문입니다. 토큰당 6B 파라미터만 활성화하면서 114B 용량을 갖춘 모델은 클립당 실행 비용이 저렴합니다. Sand.ai는 H100 8대에서 10초 1080p 클립당 약 0.5위안으로 추산하며, 이는 소규모 팀이 비디오 생성 모델을 아예 감당할 수 있는지를 결정짓는 수치입니다. 하지만 0.5위안은 레퍼런스 스택과 H100 클러스터, 그리고 서빙 오버헤드가 없다는 전제하의 값입니다. 이런 오픈 모델이 널리 사용 가능해지는 일반적인 경로는 관리형 API를 통해서입니다. 누군가 호스팅하고 클립당 가격을 책정하면, 여러분이 H100 8대를 임대할 필요가 없습니다.

호스팅된 라우트가 존재하면 라우팅 각도가 중요해집니다. 라우팅 플랫폼에서 벤더가 MAGI-2-preview 클립에 설정한 공시 가격이 곧 여러분이 지불하는 가격입니다. OrcaRouter는 제공업체의 공시 가격을 마크업 없이 그대로 전달하므로, 벤더의 가격 인하는 출시 당일에 즉시 반영되며 재협상이 필요 없습니다. 그리고 독립적인 벤치마크가 없는 11일 된 오픈 웨이트 체크포인트는 자동 장애 조치 뒤에 두기 좋은 모델입니다. 평가를 위해 그 체크포인트에 라우트를 지정하고, 검증된 폴백을 같은 엔드포인트에 유지하면, 초기 체크포인트가 지연되거나 사용할 수 없는 결과를 생성하는 순간 파이프라인이 멈추는 대신 호출이 장애 조치됩니다. 이것이 검증되지 않은 모델을 프로덕션 경로에 걸지 않고 시도하는 방법입니다.
지금 보고 있는 것
• PR이 병합되는지 여부와 리뷰에서 변경되는 사항. 제약 조건 목록(두 가지 해상도, 하나의 지속 시간, torch.compile 금지)은 최종적이지 않을 수 있습니다.
• 증류된 체크포인트. Sand.ai는 더 적은 스텝의 가중치가 곧 나올 것이라고 말합니다. 그것이 0.5위안이라는 수치를 실험실 측정값에서 현실적인 클립당 비용으로 바꿔주는 것입니다.
• 최초의 독립적 벤치마크. VBench 및 리더보드 수치는 공급업체와 언론이 보고한 것이며, 제3자 실행이 6B-active 주장이 유효한지 판가름할 것입니다.
• 다른 런타임들이 뒤따를지 여부. SGLang은 MAGI-2-preview를 채택한 최초의 주요 서빙 런타임이며, vLLM과 다른 런타임들도 머지않아 뒤따를 수 있습니다.
• 관리형 API가 등장하는지 여부. 이 모델의 핵심 장점은 대규모 환경에서의 저비용입니다. 호스팅된 경로가 존재하는 순간, 위의 통과형 가격 산정 방식이 적용됩니다.
솔직한 요약: MAGI-2-preview는 열한 날 된 오픈 모델로서 비용 구조가 중요할 수 있으며, SGLang PR은 생태계가 이를 진지하게 받아들이고 있다는 가장 분명한 신호입니다. 하지만 서빙 지원은 공개된 풀 리퀘스트일 뿐, 출시된 기능이 아닙니다. 로드맵은 실제로 보고, 런타임은 아직 준비되지 않은 것으로 취급하세요. 그리고 모델이 실제 API 뒤에 제공될 때, 페일오버 우선 접근 방식이야말로 독립적으로 벤치마크된 적 없는 체크포인트에 프로덕션 경로를 걸지 않고 채택하는 방법입니다.
