כרטיס כותרת שנוצר ועליו הכיתוב 'Kandinsky 6.0 Video מגיע ל-vLLM-Omni' עם כותרת המשנה 'צ׳קפוינט הופך לשירות', מעל שורת אייקונים שכותרתה 'יצירת וידאו', 'אודיו מסונכרן' ו'פריסת משקלים פתוחים'. הלוגו של OrcaRouter נמצא בפינה הימנית התחתונה.
Engineering & Research

Kandinsky 6.0 Video נוחת ב-vLLM-Omni: מה מוסיפה שכבת הגשה למודל פתוח

מחבר

Magnus Corvin

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים →
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

בקשת משיכה #8537 מוזגה אל vLLM-Omni בשעה 07:55 UTC הבוקר, והיא עושה דבר אחד בדיוק: היא הופכת את Kandinsky 6.0 Videoלניתנת להגשה. המודל עצמו הגיע ממעבדת Kandinsky של Sber באותו היום כזוג — Kandinsky 6.0 Video Proעם 29 מיליארד פרמטרים ו-Kandinsky 6.0 Video Liteעם 3 מיליארד — מפיק קליפים בני חמש שניות עם אודיו מסונכרן ב-44 קילו-הרץ, כולל סנכרון שפתיים, מתוך הנחיית טקסט או תמונת ייחוס, כשהקוד, המשקולות ואינטגרציית diffusers כולם תחת MIT. מה שלא היה לו עד הבוקר היה דרך להריץ אותו בתוך שרת הסקה במקום בשורת פקודה חד-פעמית.

ההבחנה הזו שווה יותר ממה שהיא נשמעת, והיא הסיבה שזה סיפור נפרד מהשחרור. צ'קפוינט פתוח שאפשר להריץ על הכרטיס שלך הוא ארטיפקט מחקרי; צ'קפוינט פתוח עם צינור עיבוד בצד השרת, נקודות כניסה משותפות ומתכון הגשה הוא משהו שאפשר לשים מאחורי תור. השחרור של השבוע נתן לך את הראשון. המיזוג של היום הוא ההתחלה של השני.

מה שהתמזג בפועל

ה-PR מוסיף טקסט-לווידאו-ואודיו ותמונה-ללווידאו-ואודיו ל-vLLM-Omni מנקודת הביקורת kandinskylab/Kandinsky-6.0-Pro-5s-Diffusers. הבחירות ההנדסיות הן החלק המעניין, כי הן אומרות לך איך הארכיטקטורה באמת נראית כשמישהו שאינו המחברים צריך לשרת אותה.

• DiT אחד מבצע דה־נויזינג לשתי המודאליות. ה־pipeline רשום כ־Kandinsky6TI2VAPipeline, ולטנטים של וידאו ולטנטים של אודיו עוברים דה־נויזינג במשותף על ידי טרנספורמר יחיד ולא על ידי שני מודלים שמופעלים ברצף. זה משקף את ה־CrossDiT הדו־זרימי של המאמר, שבו זרם וידאו מאומן מראש וזרם אודיו שנבנה מאפס מחוברים באמצעות קשב צולב דו־כיווני.

• המשקלים נטענים תיקייה אחר תיקייה. הצ'קפוינט של Hub נקרא בתור transformer/, vae/, text_encoder/, text_encoder_2/ ו-audio_vae/. השמות הפנימיים של הצ'קפוינט שפורסם — videoT ו-audioT — ממופים אל video_dec_block ו-audio_dec_block בזמן הטעינה, וזה מסוג הפרט שאוכל לך יום שלם אם אתה מגלה אותו בעצמך.

השמע פועל כברירת מחדל. הצינור מפיק AAC בקצב 44.1 קילוהרץ במקום להתייחס לשמע כדגל שיש להפעיל במפורש, כך שבקשה בלי פרמטרי שמע עדיין מוחזרת עם דיבור, מוזיקה או צלילי רקע מסונכרנים.

• קלט תמונה הוא פריים זנב ממוסך, לא מצב נפרד. התנייה בתמונת ייחוס מיושמת באמצעות מיסוך, וכך אותו צינור עיבוד משרת גם את T2AV וגם את I2AV ללא הסתעפות.

בדיקת העשן של המגיש היא רצפה שימושית: NVIDIA H100 80GB בודד עם FlashAttention-3, CPU offload פעיל, 864×480, 125 פריימים, 50 צעדים, CFG 5.0, seed 42. זהו קליפ בן 5 שניות, מעט מתחת ל-HD, לא רינדור Full HD, וה-PR אינו טוען אחרת.

נקודת ביקורת אינה שירות

הסיבה לאכפתיות ממיזוג כזה היא מה שהוא מסיר מהרשימה שלך. הרצת מימוש הייחוס פירושה לשבט את המאגר, להריץ רק setup, לתת לו לקמפל את SageAttention על כל דבר מתחת ל-Hopper, להוריד את ה-checkpoint לתיקיית מטמון ולהפעיל פקודת generate שהפלט שלה נוחת בתיקייה עם חותמת זמן. זה בסדר להצצה ראשונית ומגושם עבור מוצר.

vLLM-Omni נותן לך את המודל בתוך תהליך הגשה, עם אותן נקודות כניסה להסקה לא-מקוונת שבהן הפרויקט משתמש עבור שאר מודלי הדיפוזיה שלו (examples/offline_inference/text_to_video/text_to_video.py והאח המקביל שלו image-to-video) ומתכון הגשה ב-recipes/Kandinsky/Kandinsky6-TI2VA.md. מכאן נובעות שתי השלכות מעשיות. סיפור הפריסה שלך הופך לקונטיינר שמדבר ממשק HTTP במקום סקריפט שאתה מנהל, והמודל מפסיק להיות מקרה מיוחד בסטאק שלך — הוא יושב לצד כל דבר אחר שאתה מריץ בשרת הזה.

שימו לב למה זה לא. זה לא נקודת קצה מתארחת, זה לא מחיר, וזה לא מדידת איכות בלתי תלויה. זה עוד מקום שבו המודל יכול לרוץ, שנתרם בידי מישהו מחוץ למעבדה, שלושה ימים לאחר שהמשקולות הופיעו.

כמה עולה קליפ בן חמש שניות בזמן קיר, על כרטיסים אמיתיים

הטבלה של המאגר עצמו היא נקודת ההתחלה הכנה. אלו זמני העבודה של מודל הבסיס שאינו מזוקק עבור קליפ בודד של 5 שניות לאחר חימום, כאשר טעינת המשקולות וקידוד MP4 אינם נכללים. Full HD כאן משמעו שגם שלב הסופר-רזולוציה פועל.

• Full HD (Pro) — 402 שניות על H100, 765 שניות על RTX PRO 6000, 854 שניות על RTX 5090, 1,106 שניות על A100 80GB, 1,247 שניות על RTX 4090, ו-3,530 שניות על RTX 5060 Ti.

• Full HD (Lite) — 284 שניות על H100, 387 שניות על RTX PRO 6000, 406 שניות על RTX 5090, 664 שניות על A100 80GB, 578 שניות על RTX 4090, ו-1,774 שניות על RTX 5060 Ti.

• SD (Pro) — 356 שניות על H100 לעומת 936 שניות על RTX 4090, וזה המקום שבו קנס הביצועים של כרטיס צרכן הוא הקטן ביותר והכדאיות הכלכלית היא הפחות גרועה.

צורת הטבלה הזו חשובה יותר מכל תא בודד. H100 מהיר בערך פי שלושה מ-4090 ב-Pro Full HD, ומהיר בערך פי שישה מ-5060 Ti באותה משימה — אבל שלב ה-SR עולה אותו דבר בשני גדלי המודל, כ-64 שניות ב-HD וכ-96 שניות ב-Full HD על 5090. Lite לא מקנה לך מעבר סופר-רזולוציה קצר יותר, כי מודל ה-SR מאומן בנפרד ולא אכפת לו איזה מודל בסיס הזין אותו.

מסלול 16 GB, וההגדרה האחת שמשנה את התמונה שלך

שיא הזיכרון המוקצה בהרצת Pro SD מגיע ל-72.8 GiB, וזה מעבר לכל כרטיס צרכני. המאגר עונה עם העברת בלוקים (block offloading) — רק שני בלוקי transformer נמצאים בזיכרון ה-GPU בו-זמנית, והשאר מוזרם מזיכרון המארח — בתוספת שלושה פריסטים לכרטיסי 32 GB, 24 GB ו-16 GB. הפריסטים של 32 ו-24 GB זהים, מכיוון שמעל 24 GB מרווח הזיכרון הנוסף לא מתורגם למהירות.

ההסתייגות חבויה וכדאי לחזור עליה: בפריסט של 16 GB מקודד הטקסט עובר קוונטיזציה ל-NF4, והמאמר מפורש שזהו השינוי היחיד בפריסט שמשנה את הקליפ עצמו. ייצוג טקסטואלי שונה מפיק וידאו שונה. כל השאר — אורך מקטע, רצועות מרחביות, פריקת זיכרון — משנה את הפלט ברמת רעש עיגול, סביב 12% מהפיקסלים נבדלים ברמת בהירות אחת ב-PSNR של כ-57 dB. אם אתם משחזרים תוצאה של מישהו אחר בכרטיס 16 GB והיא לא תואמת, זה הדבר הראשון שכדאי לבדוק.

שלושה דברים שהערות השחרור אינן מיישבות

• חמש שניות הן התקרה, לא ברירת מחדל. המודל אומן על 121 פריימים ובקצב של 24 פריימים לשנייה, וגם המאמר וגם מתכון ההגשה בנויים סביב זה. אין מצב הארכה בגרסה. כל מה שארוך יותר הוא בעיית תפירה שאתה אחראי לה.

• הצ'קפוינט המזוקק הוא מה שבפועל תגיש, והוא נמדד כשווה בביצועים. האבלציה במאמר מציבה את המודל המזוקק כמועדף או בתיקו ברוב הקריטריונים, כאשר אף הבדל בודד אינו מגיע למובהקות, בהעדפה ממוצעת של 51% מול 49%. זהו המחיר שאתה משלם תמורת המהירות.

• יש במאמר שני מספרי שיעור שגיאות מילים (WER), והם אינם ניתנים להשוואה. ההפחתה של 47% ב-WER של דיבור מחולל שמלווה את שלב למידת החיזוק נמדדת באמצעות Whisper-large-v3, אחד ממודלי התגמול ב-RL; ה-WER המדווח לצד VABench משתמש ב-Qwen3-ASR-1.7B על תת-קבוצת הדיבור. המחברים אומרים זאת בעצמם. לצטט אחד בתור האחר היא הטעות הקלה ביותר לעשות עם מהדורה זו.

היכן ממוקם נתב בערימה כמו זו

OrcaRouter אינו מגיש את Kandinsky 6.0 Video, ואין לקרוא בדברים אלה כטענה שהוא כן — המודל הוא שלך להרצה מה-Hub, או נגיש דרך הממשקים של המעבדה עצמה. מה שפייפליין כמו זה צריך מנתב הוא הטקסט שסביבו. מעבר הרחבת הפרומפט שהופך תיאור שוט לכיתוב הארוך, הבינוני או הקצר שהמודל אומן עליו, עבודת הכיתוב והתמלול שמזינה מעבר מתמונה לווידאו, סיכומי הביקורת שמחליטים איזה מבין ארבעה דורות לשמור: אלה הן קריאות טקסט רגילות, והן פועלות על נקודת קצה אחת תואמת OpenAI על פני יותר מ-200 מודלים עם מחירי מחירון של ספקים המועברים בתוספת של 0%, כך ששינוי מחיר של ספק נכנס לתוקף באותו יום. מעבר אוטומטי לנתיב חלופי חשוב כאן יותר מהרגיל, מפני שרינדור של חמש דקות שנופל בשלב הכיתוב צריך לעבור לנתיב אחר במקום להפעיל מחדש את העבודה.

הדבר הבא שכדאי לשים לב אליו הוא לא עוד מיזוג, אלא מספר. ל-Kandinsky 6.0 Video Pro יש תוצאות שדווחו על ידי הספק ב-VABench והערכה אנושית שנערכה במעבדה מול Kling 2.6, Veo 3.1 Fast, MiniMax H3 ו-Seedance 2.0 — ועדיין אין ציון זירה עצמאי. כאשר יופיע אחד כזה, הטענה בדבר משקלים פתוחים מפסיקה להיות ויכוח על נגישות ומתחילה להיות ויכוח על איכות, וזו ההשוואה שקובעת אם זה מודל שצוותים מורידים או מודל שהם מעריצים.

A generated scoreboard titled 'Kandinsky 6.0 Video — the scoreboard' with a single column of six rows: 'Sizes: Pro 29B, Lite 3B', 'Clip length: 5s fixed', 'Audio: 44 kHz lip-sync', 'Resolution: Full HD plus SR', 'Licence: MIT' and 'Serving: vLLM-Omni day 0'. A footer reads 'All figures vendor-reported; no independent Elo yet. October 2026.' The OrcaRouter logo sits in the bottom-right corner.A screenshot of the GitHub repository page for kandinskylab/kandinsky-6, showing 11 commits, 35 stars and 4 forks, an MIT license badge, and a README titled 'Kandinsky 6.0: A family of diffusion models for Video + Audio Generation' with badges for KANDINSKYLAB, REPORT, DIFFUSERS and COMFYUI; recent commits include 'README update', 'Added source code', 'Some improvements for just generate' and 'Keep ComfyUI user documentation in README'.

המאגר כולל גם שני צמתי ComfyUI — kandinsky6 ו-kandinsky6-sr — הניתנים להתקנה דרך ComfyUI Manager, ושני Hugging Face Spaces: אחד עבור צ'קפוינט ה-distill של Pro ואחד עבור הדגמת הסופר-רזולוציה לווידאו. בין ה-CLI, צמתי ה-ComfyUI, חבילת ה-diffusers וכעת גם צינור vLLM-Omni, משטח הפריסה רחב יותר ביום השלישי ממה שרוב מודלי הווידאו הפתוחים מצליחים להשיג ברבעון. הרוחב הזה הוא הסיפור האמיתי של השבוע: Sber שחררה משפחה, לא מאמר עם דמו מצורף.

A screenshot of the Artificial Analysis AA-Video-T2V V2.0 leaderboard, ranking text-to-video models by Elo from human preference votes. Wan 3.0 is first at 1,156 over 8,300 samples and $12.00 per minute (Aug 2026); MiniMax H3 (768p) is fourth at 1,137 over 8,315 samples at $4.80 per minute (Jul 2026); grok-imagine-video-1.5 is eleventh at 1,045 over 4,056 samples at $15.00 per minute (May 2026); Wan2.7-260612 is thirteenth at 1,030 over 5,571 samples at $9.00 per minute (Jun 2026); Veo 3.1 is eighteenth at 962 over 2,998 samples at $24.00 per minute, Veo 3.1 Fast nineteenth at 961 over 4,325 samples at $7.20 per minute, and Veo 3.1 Lite twenty-first at 948 over 2,903 samples at $4.80 per minute.