Титульная карточка для статьи «MAGI-2-preview направляется в SGLang» с подзаголовком «Что раскрывает новый serving PR», показывающая мотив киноплёнки, превращающийся в чистые серверные и сетевые узлы на белом фоне с сине-голубыми градиентными акцентами и логотипом OrcaRouter, размещённым в правом нижнем углу.
Guides & Insights

MAGI-2-preview направляется в SGLang: что раскрывает новый serving PR

Автор

Magnus Corvin

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

MAGI-2-preview, модель генерации видео от Sand.ai со 114 миллиардами параметров на основе смеси экспертов, стала open-source 5 августа 2026 года — и одиннадцать дней спустя появился первый признак того, что она вот-вот получит production-grade serving-инфраструктуру. 16 августа в репозитории SGLang был открыт pull request под названием [diffusion][Model] Support MAGI-2-preview (sgl-project/sglang, PR #35014), и название точное: он добавляет нативную поддержку обслуживания этой модели в diffusion-стек SGLang. На момент написания этого текста это всё ещё pull request — открытый, ожидающий ревью владельцев кода, с падающими CI-проверками. Ничего не смёржено, так что обслуживать пока невозможно. Но для тех, кто оценивает, сможет ли MAGI-2-preview перебраться с эталонной связки Docker и torchrun от Sand.ai на мейнстримный serving-рантайм, этот PR — подробная дорожная карта.

Так что относитесь к этому как к материалу «что мы знаем на данный момент», а не как к примечаниям к релизу. Модель настоящая и выпущена — это произошло 5 августа: веса на Hugging Face, код на GitHub под лицензией Apache-2.0. Что не подтверждено, так это работа по обслуживанию: интеграция SGLang — это один открытый pull request, его детали могут измениться в ходе ревью, и пока он не принят, SGLang не может фактически запускать MAGI-2-preview. Ценность в том, что этот PR раскрывает о модели и о пути к её запуску в реальном рантайме.

Модель, для которой предназначен PR, в одном абзаце.

MAGI-2-preview — это попытка Sand.ai масштабировать генерацию видео так же, как масштабировались языковые модели, — с помощью смеси экспертов, и он является преемником открытой модели MAGI-1 (авторегрессионной видеомодели на 24B параметров, выпущенной в апреле 2025 года). Новая модель насчитывает в сумме около 114B параметров, но активирует лишь примерно 6B на токен, используя сверхдетализированную многоголовую MoE: скрытое состояние размерностью 3 072 разбивается на двенадцать голов размерностью 256, каждая из которых направляет данные шести из 256 экспертов, что даёт 3 072 экспертных блока на слой MoE и 72 активируемых эксперта на токен на протяжении 36 слоёв. Это единая однопоточная аудио-видео модель: текст, видео и аудио проходят через один и тот же трансформер и обмениваются информацией через самовнимание на каждом слое, а не через отдельный конвейер перекрёстного внимания. Она поддерживает генерацию видео из текста и из изображения, а также создаёт 10-секундные клипы — единственную поддерживаемую длительность — с синхронизированной стереодорожкой, генерируемой в той же траектории шумоподавления и мультиплексируемой в выходной файл.

Генерация выполняется в два этапа. Этап magi2_preview выполняет денойзинг при 512×896, затем этап magi2_refiner повышает разрешение до 1088×1920. Базовый выпуск использует 100 шагов денойзинга для preview и 5 шагов для refiner; Sand.ai сообщает, что скоро появится дистиллированная версия с гораздо меньшим числом шагов. Набор чекпоинтов представляет собой единый репозиторий на Hugging Face объёмом около 307 ГБ: стадия preview на 228 ГБ, текстовый энкодер Qwen3.5-27B, refiner на 14 ГБ, аудио VAE на 5 ГБ, видео VAE, заимствованный из Wan2.2-TI2V-5B, и дистиллированный турбо-декодер VAE, используемый по умолчанию. Требования к оборудованию: восемь GPU NVIDIA Hopper (класс H100), а эталонный лаунчер позволяет перемещать текстовый энкодер, preview, refiner и VAE между CPU и GPU на разных фазах.

Что касается производительности, фигурирующие цифры являются заявленными, а не независимо воспроизведёнными. Утверждения — результат VBench 86,54%, опережающий Sora 2 (84,37%) и Kling 2.0 (84,20%) в тех же сообщениях китайской прессы, а также 6-е место в лидерборде image-to-video от Artificial Analysis с рейтингом Elo около 1106 — исходят от вендора и материалов запуска, и ни один из этих показателей не был независимо проверен третьей стороной за одиннадцать дней после релиза. Sand.ai также называет стоимость инференса около 0,5 юаня (примерно $0,07) за 10-секундный ролик в 1080p на восьми H100, что составляет примерно десятую часть стоимости обычных видеомоделей. Воспринимайте всё это как данные, сообщённые вендором и прессой, пока кто-нибудь не проведёт независимые замеры.

Screenshot of the GitHub repository SandAI-org/MAGI-2-preview showing the README 'MAGI-2-preview: Scaling Video Generation Models Efficiently', 528 stars, 14 forks, and the repository file listing.

Почему pull request для сервинга — это настоящая новость

{{1}}До сих пор существовал ровно один поддерживаемый способ запуска MAGI-2-preview: собственный эталонный стек Sand.ai — Docker-образ плюс torchrun — на восьми NVIDIA Hopper H100.{{/1}} {{2}}Это рабочий, но специализированный путь: вы получаете в наследство лаунчер Sand.ai, его решения по выгрузке и его своеобразный способ размещения текстового энкодера, превью, рефайнера и VAE между уровнями памяти.{{/2}} {{3}}Пул-реквест, добавляющий модель в SGLang, важен, потому что SGLang — это serving-рантайм, который значительная часть мира self-hosted генеративного ИИ реально использует в продакшене.{{/3}} {{4}}Поддержка первого класса означает, что MAGI-2-preview становится запускаемым в мейнстримном рантайме с механизмами SGLang за плечами — параллелизм последовательностей Ulysses, экспертный параллелизм, выгрузка активаций, VAE, планировщик и инфраструктура конвейерных стадий.{{/4}} {{5}}Это и есть разница между «я могу запустить это на их стеке» и «я могу запустить это на стеке, который моя команда уже эксплуатирует».{{/5}}

Что на самом деле создаёт PR

Интеграция построена на существующей инфраструктуре SGLang, а не на эталонном пути torchrun. PR добавляет многоголовочный слой MoE, механику attention-sink, блочно-оконное локальное внимание для стадии рефайнера и многопоточные гипер-связи — архитектурные компоненты MagiMoE, которые универсальные слои не выражают. Вокруг них переиспользуются существующие компоненты SGLang: последовательный параллелизм Ulysses, параллелизм экспертов, offload, VAE, планировщик и компоненты конвейерных стадий. Также прилагается документация (страница рецептов MAGI-2 для документации SGLang по диффузионным моделям) и 47 модульных тестов без GPU — хороший признак того, насколько поведение модели можно проверить без аренды восьми H100.

Этот PR также делает ограничения модели явными:

• Оборудование — восемь NVIDIA Hopper H100, при этом режимы выгрузки cpu / gpu / roundtrip эталонного стека соответствуют расположению кодировщика текста, предпросмотра, рефайнера и VAE между фазами.

• Параллелизм — --num-gpus должен делить каждую ось голов, тогда как --tp-size, --ring-degree и --enable-cfg-parallel отклоняются. Это модель со множеством измерений маршрутизации, и схема параллелизма должна согласовываться с ними.

• Выходные данные — принимаются только разрешения 1920×1088 и 896×512, и только 10-секундные клипы; torch.compile не поддерживается.

Тот последний набор стоит прочитать дважды, если вы планируете развертывание: это модель, которая, по крайней мере на этом раннем этапе интеграции, привязана к двум разрешениям и одной длительности.

Screenshot of SGLang pull request #35014 titled '[diffusion][Model] Support MAGI-2-preview' showing the PR description, the branch merging 5 commits into sgl-project:main, 43 files changed, and the CI checks status, in the sgl-project/sglang repository.

Что ещё не проверено

Всё, что касается работы по обслуживанию. PR открыт, ожидает ревью владельцев кода, а проверки CI по состоянию на 16 августа не проходили. Pull request такого размера может висеть на ревью дни или недели; нет ни мёржа, ни релиза, ни анонса от SGLang. А утверждения о самой модели — оценка VBench, рейтинг Artificial Analysis, цифра стоимости в 0,5 юаня — основаны на заявлениях вендора и прессы, а не на независимом воспроизведении. Если вы строите рабочий процесс на этом PR сегодня, вы строите на дорожной карте, а не на рабочем коде.

Что это значит для расчёта стоимости

Причина, по которой MAGI-2-preview привлёк внимание, — его экономика. Модель, активирующая 6B параметров на токен при ёмкости 114B, обходится дёшево в расчёте на клип — Sand.ai оценивает это примерно в 0,5 юаня за 10-секундный клип 1080p на восьми H100 — а это именно та цифра, которая определяет, могут ли маленькие команды вообще позволить себе генерацию видео. Но 0,5 юаня предполагают эталонный стек, кластер H100 и отсутствие накладных расходов на обслуживание. Обычный способ, которым такая открытая модель становится широко применимой, — это управляемый API: кто-то её размещает, назначает цену за клип, и вам не нужно арендовать восемь H100.

A single-column scoreboard for MAGI-2-preview titled 'MAGI-2-preview — the scoreboard' listing total params 114B (MoE), active params ~6B per token, VBench 86.54% (vendor-reported), Artificial Analysis image-to-video #6 with Elo ~1106, cost ~0.5 yuan per 10s 1080p clip, and serving status 'SGLang PR open, unmerged', with a footer reading 'All figures vendor- or press-reported; not yet independently verified.'

Когда существует размещённый маршрут, аспект маршрутизации становится актуальным. На платформе маршрутизации какую бы прейскурантную цену вендор ни установил для клипа MAGI-2-preview, вы платите именно её — OrcaRouter передаёт цены провайдеров из прайс-листа без наценки, поэтому снижение цены вендором отражается у нас в тот же день, когда оно вступает в силу, без пересмотра условий. А одиннадцатидневный чекпойнт с открытыми весами без независимых бенчмарков — это ровно та модель, которую вы хотите видеть за автоматическим фейловером: направьте на него маршрут для оценки, держите проверенный запасной вариант на той же конечной точке, и в тот момент, когда ранний чекпойнт зависает или выдаёт что-то непригодное, вызов переключается на резерв, а не ваш пайплайн. Именно так вы пробуете непроверенную модель, не ставя на кон производственный путь.

Что мы сейчас смотрим

• Сольется ли PR, и что изменится в ревью. Список ограничений — два разрешения, одна длительность, без torch.compile — может быть не окончательным.

• Дистиллированный чекпоинт. В Sand.ai говорят, что скоро появятся веса с меньшим количеством шагов; именно это превращает цифру в 0,5 юаня из лабораторного измерения в реалистичную стоимость за один клип.

• Первые независимые бенчмарки. Показатели VBench и лидерборда получены от вендоров и прессы; независимый сторонний прогон позволил бы установить, насколько обосновано заявление о 6B-активной модели.

• Последуют ли примеру другие среды выполнения. SGLang — первая крупная среда выполнения для обслуживания, которая приняла MAGI-2-preview; vLLM и другие, возможно, не отстанут.

• Появляется ли управляемый API. Весь посыл модели — низкая стоимость в масштабе; как только появляется хостируемый маршрут, описанная выше математика сквозного ценообразования вступает в силу.

Честное резюме: MAGI-2-preview — открытая модель одиннадцати дней от роду, и её структура затрат может иметь значение, а PR в SGLang — самый явный на сегодняшний день сигнал того, что экосистема воспринимает её всерьёз. Но поддержка сервинга — это открытый pull request, а не готовая функциональность. Относитесь к дорожной карте как к реальной, а к рантайму — как к ещё не готовому. И когда модель наконец появится за настоящим API, подход «сначала резервирование» (failover-first) — это способ внедрить её, не ставя производственный путь в зависимость от чекпоинта, который никто независимо не бенчмаркал.

© 2026 OrcaRouter

Провайдерам

Управляете инференс-платформой? Разместите свои модели на OrcaRouter.

providers@orcarouter.ai

Присоединяйтесь к сообществу

Discordsupport@orcarouter.aiXGitHubYouTube