
MAGI-2-preview направляется в SGLang: что раскрывает новый serving PR
- DeepSeekНОВИНКАDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 за 1 млн токенов
- z-aiНОВИНКАZ.ai: GLM 5.32026-08-1860Интеллект75Кодинг
- obsidianНОВИНКАQwen3.8 27B2026-08-1552Интеллект68Кодинг
- qwenНОВИНКАQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekНОВИНКАDeepSeek: DeepSeek V4 Pro 08132026-08-1253Интеллект69Кодинг
- grokНОВИНКАSpaceXAI: Grok 4.62026-08-1261Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0557Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0358Интеллект72Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Интеллект78Кодинг
- googleGoogle: Gemini 3.6 Flash2026-07-2152Интеллект69Кодинг
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Интеллект49Кодинг
- metaMeta: Muse Spark 1.12026-07-1653Интеллект71Кодинг
- kimiMoonshotAI: Kimi K32026-07-1560Интеллект76Кодинг
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Интеллект71Кодинг
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Интеллект77Кодинг
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Интеллект77Кодинг
MAGI-2-preview, модель генерации видео от Sand.ai со 114 миллиардами параметров на основе смеси экспертов, стала open-source 5 августа 2026 года — и одиннадцать дней спустя появился первый признак того, что она вот-вот получит production-grade serving-инфраструктуру. 16 августа в репозитории SGLang был открыт pull request под названием [diffusion][Model] Support MAGI-2-preview (sgl-project/sglang, PR #35014), и название точное: он добавляет нативную поддержку обслуживания этой модели в diffusion-стек SGLang. На момент написания этого текста это всё ещё pull request — открытый, ожидающий ревью владельцев кода, с падающими CI-проверками. Ничего не смёржено, так что обслуживать пока невозможно. Но для тех, кто оценивает, сможет ли MAGI-2-preview перебраться с эталонной связки Docker и torchrun от Sand.ai на мейнстримный serving-рантайм, этот PR — подробная дорожная карта.
Так что относитесь к этому как к материалу «что мы знаем на данный момент», а не как к примечаниям к релизу. Модель настоящая и выпущена — это произошло 5 августа: веса на Hugging Face, код на GitHub под лицензией Apache-2.0. Что не подтверждено, так это работа по обслуживанию: интеграция SGLang — это один открытый pull request, его детали могут измениться в ходе ревью, и пока он не принят, SGLang не может фактически запускать MAGI-2-preview. Ценность в том, что этот PR раскрывает о модели и о пути к её запуску в реальном рантайме.
Модель, для которой предназначен PR, в одном абзаце.
MAGI-2-preview — это попытка Sand.ai масштабировать генерацию видео так же, как масштабировались языковые модели, — с помощью смеси экспертов, и он является преемником открытой модели MAGI-1 (авторегрессионной видеомодели на 24B параметров, выпущенной в апреле 2025 года). Новая модель насчитывает в сумме около 114B параметров, но активирует лишь примерно 6B на токен, используя сверхдетализированную многоголовую MoE: скрытое состояние размерностью 3 072 разбивается на двенадцать голов размерностью 256, каждая из которых направляет данные шести из 256 экспертов, что даёт 3 072 экспертных блока на слой MoE и 72 активируемых эксперта на токен на протяжении 36 слоёв. Это единая однопоточная аудио-видео модель: текст, видео и аудио проходят через один и тот же трансформер и обмениваются информацией через самовнимание на каждом слое, а не через отдельный конвейер перекрёстного внимания. Она поддерживает генерацию видео из текста и из изображения, а также создаёт 10-секундные клипы — единственную поддерживаемую длительность — с синхронизированной стереодорожкой, генерируемой в той же траектории шумоподавления и мультиплексируемой в выходной файл.
Генерация выполняется в два этапа. Этап magi2_preview выполняет денойзинг при 512×896, затем этап magi2_refiner повышает разрешение до 1088×1920. Базовый выпуск использует 100 шагов денойзинга для preview и 5 шагов для refiner; Sand.ai сообщает, что скоро появится дистиллированная версия с гораздо меньшим числом шагов. Набор чекпоинтов представляет собой единый репозиторий на Hugging Face объёмом около 307 ГБ: стадия preview на 228 ГБ, текстовый энкодер Qwen3.5-27B, refiner на 14 ГБ, аудио VAE на 5 ГБ, видео VAE, заимствованный из Wan2.2-TI2V-5B, и дистиллированный турбо-декодер VAE, используемый по умолчанию. Требования к оборудованию: восемь GPU NVIDIA Hopper (класс H100), а эталонный лаунчер позволяет перемещать текстовый энкодер, preview, refiner и VAE между CPU и GPU на разных фазах.
Что касается производительности, фигурирующие цифры являются заявленными, а не независимо воспроизведёнными. Утверждения — результат VBench 86,54%, опережающий Sora 2 (84,37%) и Kling 2.0 (84,20%) в тех же сообщениях китайской прессы, а также 6-е место в лидерборде image-to-video от Artificial Analysis с рейтингом Elo около 1106 — исходят от вендора и материалов запуска, и ни один из этих показателей не был независимо проверен третьей стороной за одиннадцать дней после релиза. Sand.ai также называет стоимость инференса около 0,5 юаня (примерно $0,07) за 10-секундный ролик в 1080p на восьми H100, что составляет примерно десятую часть стоимости обычных видеомоделей. Воспринимайте всё это как данные, сообщённые вендором и прессой, пока кто-нибудь не проведёт независимые замеры.

Почему pull request для сервинга — это настоящая новость
{{1}}До сих пор существовал ровно один поддерживаемый способ запуска MAGI-2-preview: собственный эталонный стек Sand.ai — Docker-образ плюс torchrun — на восьми NVIDIA Hopper H100.{{/1}} {{2}}Это рабочий, но специализированный путь: вы получаете в наследство лаунчер Sand.ai, его решения по выгрузке и его своеобразный способ размещения текстового энкодера, превью, рефайнера и VAE между уровнями памяти.{{/2}} {{3}}Пул-реквест, добавляющий модель в SGLang, важен, потому что SGLang — это serving-рантайм, который значительная часть мира self-hosted генеративного ИИ реально использует в продакшене.{{/3}} {{4}}Поддержка первого класса означает, что MAGI-2-preview становится запускаемым в мейнстримном рантайме с механизмами SGLang за плечами — параллелизм последовательностей Ulysses, экспертный параллелизм, выгрузка активаций, VAE, планировщик и инфраструктура конвейерных стадий.{{/4}} {{5}}Это и есть разница между «я могу запустить это на их стеке» и «я могу запустить это на стеке, который моя команда уже эксплуатирует».{{/5}}
Что на самом деле создаёт PR
Интеграция построена на существующей инфраструктуре SGLang, а не на эталонном пути torchrun. PR добавляет многоголовочный слой MoE, механику attention-sink, блочно-оконное локальное внимание для стадии рефайнера и многопоточные гипер-связи — архитектурные компоненты MagiMoE, которые универсальные слои не выражают. Вокруг них переиспользуются существующие компоненты SGLang: последовательный параллелизм Ulysses, параллелизм экспертов, offload, VAE, планировщик и компоненты конвейерных стадий. Также прилагается документация (страница рецептов MAGI-2 для документации SGLang по диффузионным моделям) и 47 модульных тестов без GPU — хороший признак того, насколько поведение модели можно проверить без аренды восьми H100.
Этот PR также делает ограничения модели явными:
• Оборудование — восемь NVIDIA Hopper H100, при этом режимы выгрузки cpu / gpu / roundtrip эталонного стека соответствуют расположению кодировщика текста, предпросмотра, рефайнера и VAE между фазами.
• Параллелизм — --num-gpus должен делить каждую ось голов, тогда как --tp-size, --ring-degree и --enable-cfg-parallel отклоняются. Это модель со множеством измерений маршрутизации, и схема параллелизма должна согласовываться с ними.
• Выходные данные — принимаются только разрешения 1920×1088 и 896×512, и только 10-секундные клипы; torch.compile не поддерживается.
Тот последний набор стоит прочитать дважды, если вы планируете развертывание: это модель, которая, по крайней мере на этом раннем этапе интеграции, привязана к двум разрешениям и одной длительности.
![Screenshot of SGLang pull request #35014 titled '[diffusion][Model] Support MAGI-2-preview' showing the PR description, the branch merging 5 commits into sgl-project:main, 43 files changed, and the CI checks status, in the sgl-project/sglang repository.](https://cms.orcarouter.ai/api/media/file/3-297.png)
Что ещё не проверено
Всё, что касается работы по обслуживанию. PR открыт, ожидает ревью владельцев кода, а проверки CI по состоянию на 16 августа не проходили. Pull request такого размера может висеть на ревью дни или недели; нет ни мёржа, ни релиза, ни анонса от SGLang. А утверждения о самой модели — оценка VBench, рейтинг Artificial Analysis, цифра стоимости в 0,5 юаня — основаны на заявлениях вендора и прессы, а не на независимом воспроизведении. Если вы строите рабочий процесс на этом PR сегодня, вы строите на дорожной карте, а не на рабочем коде.
Что это значит для расчёта стоимости
Причина, по которой MAGI-2-preview привлёк внимание, — его экономика. Модель, активирующая 6B параметров на токен при ёмкости 114B, обходится дёшево в расчёте на клип — Sand.ai оценивает это примерно в 0,5 юаня за 10-секундный клип 1080p на восьми H100 — а это именно та цифра, которая определяет, могут ли маленькие команды вообще позволить себе генерацию видео. Но 0,5 юаня предполагают эталонный стек, кластер H100 и отсутствие накладных расходов на обслуживание. Обычный способ, которым такая открытая модель становится широко применимой, — это управляемый API: кто-то её размещает, назначает цену за клип, и вам не нужно арендовать восемь H100.

Когда существует размещённый маршрут, аспект маршрутизации становится актуальным. На платформе маршрутизации какую бы прейскурантную цену вендор ни установил для клипа MAGI-2-preview, вы платите именно её — OrcaRouter передаёт цены провайдеров из прайс-листа без наценки, поэтому снижение цены вендором отражается у нас в тот же день, когда оно вступает в силу, без пересмотра условий. А одиннадцатидневный чекпойнт с открытыми весами без независимых бенчмарков — это ровно та модель, которую вы хотите видеть за автоматическим фейловером: направьте на него маршрут для оценки, держите проверенный запасной вариант на той же конечной точке, и в тот момент, когда ранний чекпойнт зависает или выдаёт что-то непригодное, вызов переключается на резерв, а не ваш пайплайн. Именно так вы пробуете непроверенную модель, не ставя на кон производственный путь.
Что мы сейчас смотрим
• Сольется ли PR, и что изменится в ревью. Список ограничений — два разрешения, одна длительность, без torch.compile — может быть не окончательным.
• Дистиллированный чекпоинт. В Sand.ai говорят, что скоро появятся веса с меньшим количеством шагов; именно это превращает цифру в 0,5 юаня из лабораторного измерения в реалистичную стоимость за один клип.
• Первые независимые бенчмарки. Показатели VBench и лидерборда получены от вендоров и прессы; независимый сторонний прогон позволил бы установить, насколько обосновано заявление о 6B-активной модели.
• Последуют ли примеру другие среды выполнения. SGLang — первая крупная среда выполнения для обслуживания, которая приняла MAGI-2-preview; vLLM и другие, возможно, не отстанут.
• Появляется ли управляемый API. Весь посыл модели — низкая стоимость в масштабе; как только появляется хостируемый маршрут, описанная выше математика сквозного ценообразования вступает в силу.
Честное резюме: MAGI-2-preview — открытая модель одиннадцати дней от роду, и её структура затрат может иметь значение, а PR в SGLang — самый явный на сегодняшний день сигнал того, что экосистема воспринимает её всерьёз. Но поддержка сервинга — это открытый pull request, а не готовая функциональность. Относитесь к дорожной карте как к реальной, а к рантайму — как к ещё не готовому. И когда модель наконец появится за настоящим API, подход «сначала резервирование» (failover-first) — это способ внедрить её, не ставя производственный путь в зависимость от чекпоинта, который никто независимо не бенчмаркал.
