כרטיס כותרת למאמר 'MAGI-2-preview is heading to SGLang' עם כותרת המשנה 'What the new serving PR reveals', המציג מוטיב של רצועת סרט שהופך לשרתים נקיים וצמתי רשת על רקע לבן עם הדגשות שיפוע בכחול-ציאן, עם לוגו OrcaRouter מורכב בפינה הימנית התחתונה.
Guides & Insights

MAGI-2-preview מגיע ל-SGLang: מה חושף ה-PR החדש של השרת

מחבר

Magnus Corvin

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

MAGI-2-preview, מודל יצירת הווידאו מסוג mixture-of-experts של Sand.ai עם 114 מיליארד פרמטרים, הפך לקוד פתוח ב-5 באוגוסט 2026 — ואחד עשר ימים לאחר מכן הופיע הסימן הראשון לכך שהוא עומד לקבל תשתית הגשה ברמת ייצור. ב-16 באוגוסט, נפתחה בקשת משיכה (pull request) במאגר SGLang בשם [diffusion][Model] Support MAGI-2-preview (sgl-project/sglang, PR #35014), והכותרת מדויקת: היא מטמיעה תמיכת הגשה מקורית עבור המודל אל תוך מחסנית הדיפוזיה של SGLang. בנוסף, נכון לכתיבת שורות אלה, זו עדיין בקשת משיכה — פתוחה, ממתינה לסקירת בעל הקוד, עם בדיקות CI שנכשלות. שום דבר לא מוזג, ולכן שום דבר אינו ניתן להגשה עדיין. אבל עבור מי שבוחן האם MAGI-2-preview יכול לעבור מההתקנה ההתייחסותית של Docker-and-torchrun של Sand.ai אל סביבת ריצה מיינסטרימית להגשה, בקשת המשיכה הזו היא מפת דרכים מפורטת.

אז התייחסו לזה כמאמר של "מה ידוע עד כה", לא כהערת שחרור. המודל אמיתי ושוחרר — זה קרה ב-5 באוגוסט, עם משקלים ב-Hugging Face וקוד ב-GitHub תחת רישיון Apache-2.0. מה שלא אומת הוא עבודת השרת: האינטגרציה של SGLang היא בקשת משיכה אחת פתוחה, הפרטים שלה יכולים להשתנות בסקירה, ועד שהיא תתמזג, SGLang לא יכול בפועל להריץ את MAGI-2-preview. הערך הוא במה שה-PR חושף על המודל ועל הדרך להריץ אותו בסביבת ריצה אמיתית.

המודל שה-PR מתייחס אליו, בפסקה אחת.

MAGI-2-preview הוא הניסיון של Sand.ai להרחיב את יצירת הווידאו באותו אופן שבו הורחבו מודלי שפה — עם תערובת מומחים, והוא יורשו של MAGI-1 הפתוח (מודל וידאו אוטורגרסיבי של 24B מאפריל 2025). המודל החדש כולל בסך הכול כ-114B פרמטרים, אך מפעיל רק כ-6B לכל טוקן, תוך שימוש ב-MoE רב-ראשי בעל פירוט עדין במיוחד: מצב חבוי מממד 3,072 מחולק לשנים-עשר ראשים של 256 ממדים, כשכל ראש מנתב לשישה מתוך 256 מומחים, מה שמביא ל-3,072 יחידות מומחה לכל שכבת MoE ול-72 מומחים המופעלים לכל טוקן על פני 36 שכבות. זהו מודל אודיו-וידאו אחיד עם זרם אחד — טקסט, וידאו ואודיו עוברים דרך אותו טרנספורמר ומחליפים מידע באמצעות self-attention בכל שכבה, במקום דרך צינור cross-attention נפרד. הוא תומך בטקסט-ל-וידאו ותמונה-ל-וידאו, ומייצר קטעים באורך 10 שניות — משך הזמן היחיד הנתמך — עם פסקול סטריאו מסונכרן שנוצר באותו מסלול denoising וממוזג לקובץ הפלט.

הייצור מתבצע בשני שלבים. magi2_preview שלב מסיר רעשים ב-512×896, ולאחר מכן magi2_refiner שלב מגדיל ל-1088×1920. המהדורה הבסיסית משתמשת ב-100 שלבי דה-נויזינג ל-preview וב-5 שלבים ל-refiner; Sand.ai אומרת שגרסה מזוקקת עם הרבה פחות שלבים בדרך. ערכת ה-checkpoint היא מאגר Hugging Face יחיד של כ-307 ג'יגה-בייט: שלב ה-preview בגודל 228 ג'יגה-בייט, מקודד טקסט Qwen3.5-27B, שלב ה-refiner בגודל 14 ג'יגה-בייט, VAE אודיו בגודל 5 ג'יגה-בייט, VAE וידאו שהושאל מ-Wan2.2-TI2V-5B, ומפענח VAE טורבו מזוקק שנעשה בו שימוש כברירת מחדל. דרישות החומרה הן שמונה GPU מדגם NVIDIA Hopper (מחלקת H100), עם המשגר הייחוס שמאפשר לך, בין השלבים, להעביר את מקודד הטקסט, שלב ה-preview, שלב ה-refiner וה-VAE בין CPU ל-GPU.

בנוגע לביצועים, הנתונים שמסתובבים הם מדווחים, לא שוכפלו באופן בלתי תלוי. הטענות — ציון VBench של 86.54%, לפני Sora 2 (84.37%) ו-Kling 2.0 (84.20%) באותה סיקור עיתונות סיני, ומקום 6 בטבלת ה-image-to-video של Artificial Analysis עם Elo בסביבות 1106 — מגיעות מהספק ומסיקור ההשקה, ואף אחד מהם לא עבר ריצה בלתי תלויה של צד שלישי באחד-עשר הימים מאז ההשקה. Sand.ai גם מצטטת עלות הסקה של כ-0.5 יואן (בערך $0.07) לקליפ של 10 שניות ברזולוציית 1080p על שמונה H100, או כעשירית מהמודלים המרכזיים לווידאו. קחו את כל זה כמדווח על ידי ספק ועיתונות עד שמישהו ימדוד את זה.

Screenshot of the GitHub repository SandAI-org/MAGI-2-preview showing the README 'MAGI-2-preview: Scaling Video Generation Models Efficiently', 528 stars, 14 forks, and the repository file listing.

למה בקשת משיכה (pull request) משרתת היא החדשות האמיתיות

עד כה הייתה בדיוק דרך אחת נתמכת להריץ את MAGI-2-preview: מחסנית הייחוס של Sand.ai עצמה, תמונת Docker יחד עם torchrun, על שמונה כרטיסי NVIDIA Hopper H100. זהו נתיב ישים אבל ייעודי — אתה יורש את המשגר של Sand.ai, את החלטות ה-offload שלו, ואת הדרך הדוגמטית שלו לביים את מקודד הטקסט, ה-preview, ה-refiner וה-VAE בין שכבות הזיכרון. בקשת pull request שמוסיפה את המודל ל-SGLang חשובה כי SGLang הוא זמן הריצה (runtime) שחלק גדול מעולם ה-AI הגנרטיבי המתארח עצמאית פורס בפועל בייצור. תמיכה מלאה פירושה ש-MAGI-2-preview הופך לריץ בריצה מיינסטרימית עם המנגנון של SGLang מאחוריו — מקביליות רצף מסוג Ulysses, מקביליות מומחים, offload של אקטיבציות, ה-VAE, מתזמן, ותשתית שלבי הצינור. זה ההבדל בין "אני יכול להריץ את זה על המחסנית שלהם" לבין "אני יכול להריץ את זה על המחסנית שהצוות שלי כבר מפעיל".

מה שה-PR בעצם בונה

האינטגרציה בנויה על המנגנונים הקיימים של SGLang ולא על המסלול של torchrun הייחוס. ה-PR מוסיף שכבת MoE מרובת-ראשים, צנרת attention-sink, תשומת לב מקומית מסוג block-window לשלב ה-refiner, וחיבורי-על מרובי-זרמים — החלקים הארכיטקטוניים של MagiMoE ששכבות גנריות אינן מבטאות. סביבם הוא עושה שימוש חוזר ברכיבים הקיימים של SGLang: מקביליות הרצף של Ulysses, מקביליות מומחים, offload, VAE, scheduler, ושלבי pipeline. הוא גם כולל תיעוד (עמוד MAGI-2 cookbook בתיעוד ה-diffusion של SGLang) ו-47 בדיקות יחידה ללא GPU, וזה סימן טוב לכמה מהתנהגות המודל ניתן לאמת בלי לשכור שמונה H100.

ה-PR גם הופך את האילוצים של המודל למפורשים:

• חומרה — שמונה NVIDIA Hopper H100, עם מצבי ה-offload של cpu / gpu / roundtrip של מחסנית הייחוס, הממפים למקום שבו יושבים מקודד הטקסט, התצוגה המקדימה, המחדד וה-VAE בין השלבים.

• מקביליות — --num-gpus חייב לחלק כל ציר ראש, בעוד --tp-size, --ring-degree, ו --enable-cfg-parallel נדחים. זהו מודל עם הרבה ממדי ניתוב, ופריסת המקביליות חייבת להסתדר איתם.

• פלטים — רק רזולוציות 1920×1088 ו-896×512 מתקבלות, ורק קטעים של 10 שניות; torch.compile אינו נתמך.

הסט האחרון שווה קריאה כפולה אם אתם מתכננים פריסה: זה מודל שלפחות באינטגרציה המוקדמת הזו, מוגבל לשתי רזולוציות ומשך זמן אחד.

Screenshot of SGLang pull request #35014 titled '[diffusion][Model] Support MAGI-2-preview' showing the PR description, the branch merging 5 commits into sgl-project:main, 43 files changed, and the CI checks status, in the sgl-project/sglang repository.

מה שעדיין לא אומת

הכל בנוגע לעבודת ה-serving. ה-PR פתוח, ממתין לבדיקות של בעלי הקוד, ובדיקות ה-CI נכשלו נכון ל-16 באוגוסט. pull request בגודל כזה יכול להישאר בבדיקה במשך ימים או שבועות; אין מצב merged, אין release, ואין הכרזה רשמית מ-SGLang. והטענות בצד המודל — ציון ה-VBench, הדירוג של Artificial Analysis, נתון העלות של 0.5 יואן — מגיעות מדיווחי ספקים ועיתונות, ולא שוחזרו באופן בלתי-תלוי. אם אתה בונה workflow על ה-PR הזה היום, אתה בונה על מפת דרכים (roadmap), לא על runtime.

מה זה אומר לגבי חישוב העלויות

הסיבה ש-MAGI-2-preview משך תשומת לב היא הכלכלה שלו. מודל שמפעיל 6B פרמטרים לכל טוקן כשהוא נושא קיבולת של 114B הוא זול להרצה לכל קליפ — Sand.ai מעריכה את המספר בכ-0.5 יואן לקליפ בן 10 שניות ברזולוציית 1080p על שמונה H100 — וזה סוג המספר שמכריע אם צוותים קטנים יכולים להרשות לעצמם יצירת וידאו בכלל. אבל ה-0.5 יואן מניח את תצורת הייחוס, את אשכול ה-H100, והיעדר תקורת הגשה. הדרך הרגילה שבה מודל פתוח כזה הופך לשימושי באופן נרחב היא דרך API מנוהל: מישהו מארח אותו, גובה מחיר לכל קליפ, ואתה לא שוכר שמונה H100.

A single-column scoreboard for MAGI-2-preview titled 'MAGI-2-preview — the scoreboard' listing total params 114B (MoE), active params ~6B per token, VBench 86.54% (vendor-reported), Artificial Analysis image-to-video #6 with Elo ~1106, cost ~0.5 yuan per 10s 1080p clip, and serving status 'SGLang PR open, unmerged', with a footer reading 'All figures vendor- or press-reported; not yet independently verified.'

כאשר קיים מסלול מתארח, הזווית של הניתוב הופכת לרלוונטית. בפלטפורמת ניתוב, מחיר המחירון שהספק קובע עבור קליפ MAGI-2-preview הוא מה שאתה משלם — OrcaRouter מעביר את מחירי המחירון של הספקים ללא תוספת, כך שהנחת מחיר של ספק נכנסת לתוקף אצלנו באותו היום שבו היא יוצאת, ללא משא ומתן מחדש. וצ'קפוינט open-weight בן אחד-עשר יום ללא אמות מידה עצמאיות הוא בדיוק סוג המודל שאתה רוצה מאחורי failover אוטומטי: כוון מסלול אליו לצורך הערכה, שמור על גיבוי מוכח באותה נקודת קצה, וברגע שהצ'קפוינט המוקדם נתקע או מייצר משהו בלתי שמיש, הקריאה עוברת ל-failover במקום שה-pipeline שלך ייכשל. כך מנסים מודל לא מוכח בלי להמר על נתיב ייצור עליו.

מה אנחנו צופים בו עכשיו

• האם ה-PR מתמזג, ומה משתנה בסקירה. רשימת האילוצים — שתי רזולוציות, משך אחד, ללא torch.compile — עשויה שלא להיות סופית.

• ה-checkpoint המזוקק. Sand.ai אומרים שמשקלים עם פחות שלבים בדרך; זה מה שהופך את הנתון של 0.5 יואן ממדידה מעבדתית לעלות ריאלית לכל קליפ.

• אמות מידה בלתי תלויות ראשונות. נתוני VBench וטבלת המובילים מדווחים על ידי ספקים ועיתונות; ריצה של צד שלישי הייתה מיישבת כיצד הטענה של 6B-active מחזיקה מעמד.

• האם סביבות ריצה אחרות ילכו בעקבותיה. SGLang היא סביבת ההרצה המרכזית הראשונה שאימצה את MAGI-2-preview; vLLM ואחרות ככל הנראה לא יישארו הרחק מאחור.

• האם יופיע API מנוהל. כל הרעיון של המודל הוא עלות נמוכה בקנה מידה; ברגע שקיים מסלול מתארח, חישובי תמחור המעבר שלעיל נכנסים לפעולה.

הסיכום הכנה: MAGI-2-preview הוא מודל פתוח בן אחד-עשר יום שמבנה העלויות שלו יכול להיות משמעותי, וה-PR של SGLang הוא האות הברור ביותר עד כה לכך שהאקוסיסטם מתייחס אליו ברצינות. אבל תמיכת ה-serving היא בקשת משיכה פתוחה, לא יכולת שיושמה בפועל. התייחסו למפת הדרכים כאל אמיתית ולסביבת הריצה כאל לא-עדיין-קיימת — וכשהמודל אכן יגיע מאחורי API אמיתי, גישת ה-failover-ראשון היא הדרך לאמץ אותו מבלי לבסס נתיב ייצור על checkpoint שאיש לא ביצע עליו benchmark עצמאי.

© 2026 OrcaRouter

לספקים

מפעילים פלטפורמת הסקה (inference)? הציגו את המודלים שלכם ב-OrcaRouter.

providers@orcarouter.ai

הצטרפו לקהילה שלנו

Discordsupport@orcarouter.aiXGitHubYouTube