
Kandinsky 6.0 Video נוחת ב-vLLM-Omni: מה מוסיפה שכבת הגשה למודל פתוח
- openaiחדשOpenAI: GPT-6.1 Sol2026-09-2952אינטליגנציה
- anthropicחדשAnthropic: Claude Sonnet 5.52026-09-2856אינטליגנציה
- typesafeחדשTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 לכל 1M טוקנים · 150 tok/s
- OpenAIחדשOpenAI: GPT-6 Luna2026-09-2238אינטליגנציה
- OpenAIחדשOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- AnthropicחדשAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- xAIGrok 4.72026-09-2146אינטליגנציה
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 לכל 1M טוקנים · 126 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- OpenAIOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- AnthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 לכל 1M טוקנים · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 250 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
בקשת משיכה #8537 מוזגה אל vLLM-Omni בשעה 07:55 UTC הבוקר, והיא עושה דבר אחד בדיוק: היא הופכת את Kandinsky 6.0 Videoלניתנת להגשה. המודל עצמו הגיע ממעבדת Kandinsky של Sber באותו היום כזוג — Kandinsky 6.0 Video Proעם 29 מיליארד פרמטרים ו-Kandinsky 6.0 Video Liteעם 3 מיליארד — מפיק קליפים בני חמש שניות עם אודיו מסונכרן ב-44 קילו-הרץ, כולל סנכרון שפתיים, מתוך הנחיית טקסט או תמונת ייחוס, כשהקוד, המשקולות ואינטגרציית diffusers כולם תחת MIT. מה שלא היה לו עד הבוקר היה דרך להריץ אותו בתוך שרת הסקה במקום בשורת פקודה חד-פעמית.
ההבחנה הזו שווה יותר ממה שהיא נשמעת, והיא הסיבה שזה סיפור נפרד מהשחרור. צ'קפוינט פתוח שאפשר להריץ על הכרטיס שלך הוא ארטיפקט מחקרי; צ'קפוינט פתוח עם צינור עיבוד בצד השרת, נקודות כניסה משותפות ומתכון הגשה הוא משהו שאפשר לשים מאחורי תור. השחרור של השבוע נתן לך את הראשון. המיזוג של היום הוא ההתחלה של השני.
מה שהתמזג בפועל
ה-PR מוסיף טקסט-לווידאו-ואודיו ותמונה-ללווידאו-ואודיו ל-vLLM-Omni מנקודת הביקורת kandinskylab/Kandinsky-6.0-Pro-5s-Diffusers. הבחירות ההנדסיות הן החלק המעניין, כי הן אומרות לך איך הארכיטקטורה באמת נראית כשמישהו שאינו המחברים צריך לשרת אותה.
• DiT אחד מבצע דה־נויזינג לשתי המודאליות. ה־pipeline רשום כ־Kandinsky6TI2VAPipeline, ולטנטים של וידאו ולטנטים של אודיו עוברים דה־נויזינג במשותף על ידי טרנספורמר יחיד ולא על ידי שני מודלים שמופעלים ברצף. זה משקף את ה־CrossDiT הדו־זרימי של המאמר, שבו זרם וידאו מאומן מראש וזרם אודיו שנבנה מאפס מחוברים באמצעות קשב צולב דו־כיווני.
• המשקלים נטענים תיקייה אחר תיקייה. הצ'קפוינט של Hub נקרא בתור transformer/, vae/, text_encoder/, text_encoder_2/ ו-audio_vae/. השמות הפנימיים של הצ'קפוינט שפורסם — videoT ו-audioT — ממופים אל video_dec_block ו-audio_dec_block בזמן הטעינה, וזה מסוג הפרט שאוכל לך יום שלם אם אתה מגלה אותו בעצמך.
השמע פועל כברירת מחדל. הצינור מפיק AAC בקצב 44.1 קילוהרץ במקום להתייחס לשמע כדגל שיש להפעיל במפורש, כך שבקשה בלי פרמטרי שמע עדיין מוחזרת עם דיבור, מוזיקה או צלילי רקע מסונכרנים.
• קלט תמונה הוא פריים זנב ממוסך, לא מצב נפרד. התנייה בתמונת ייחוס מיושמת באמצעות מיסוך, וכך אותו צינור עיבוד משרת גם את T2AV וגם את I2AV ללא הסתעפות.
בדיקת העשן של המגיש היא רצפה שימושית: NVIDIA H100 80GB בודד עם FlashAttention-3, CPU offload פעיל, 864×480, 125 פריימים, 50 צעדים, CFG 5.0, seed 42. זהו קליפ בן 5 שניות, מעט מתחת ל-HD, לא רינדור Full HD, וה-PR אינו טוען אחרת.
נקודת ביקורת אינה שירות
הסיבה לאכפתיות ממיזוג כזה היא מה שהוא מסיר מהרשימה שלך. הרצת מימוש הייחוס פירושה לשבט את המאגר, להריץ רק setup, לתת לו לקמפל את SageAttention על כל דבר מתחת ל-Hopper, להוריד את ה-checkpoint לתיקיית מטמון ולהפעיל פקודת generate שהפלט שלה נוחת בתיקייה עם חותמת זמן. זה בסדר להצצה ראשונית ומגושם עבור מוצר.
vLLM-Omni נותן לך את המודל בתוך תהליך הגשה, עם אותן נקודות כניסה להסקה לא-מקוונת שבהן הפרויקט משתמש עבור שאר מודלי הדיפוזיה שלו (examples/offline_inference/text_to_video/text_to_video.py והאח המקביל שלו image-to-video) ומתכון הגשה ב-recipes/Kandinsky/Kandinsky6-TI2VA.md. מכאן נובעות שתי השלכות מעשיות. סיפור הפריסה שלך הופך לקונטיינר שמדבר ממשק HTTP במקום סקריפט שאתה מנהל, והמודל מפסיק להיות מקרה מיוחד בסטאק שלך — הוא יושב לצד כל דבר אחר שאתה מריץ בשרת הזה.
שימו לב למה זה לא. זה לא נקודת קצה מתארחת, זה לא מחיר, וזה לא מדידת איכות בלתי תלויה. זה עוד מקום שבו המודל יכול לרוץ, שנתרם בידי מישהו מחוץ למעבדה, שלושה ימים לאחר שהמשקולות הופיעו.
כמה עולה קליפ בן חמש שניות בזמן קיר, על כרטיסים אמיתיים
הטבלה של המאגר עצמו היא נקודת ההתחלה הכנה. אלו זמני העבודה של מודל הבסיס שאינו מזוקק עבור קליפ בודד של 5 שניות לאחר חימום, כאשר טעינת המשקולות וקידוד MP4 אינם נכללים. Full HD כאן משמעו שגם שלב הסופר-רזולוציה פועל.
• Full HD (Pro) — 402 שניות על H100, 765 שניות על RTX PRO 6000, 854 שניות על RTX 5090, 1,106 שניות על A100 80GB, 1,247 שניות על RTX 4090, ו-3,530 שניות על RTX 5060 Ti.
• Full HD (Lite) — 284 שניות על H100, 387 שניות על RTX PRO 6000, 406 שניות על RTX 5090, 664 שניות על A100 80GB, 578 שניות על RTX 4090, ו-1,774 שניות על RTX 5060 Ti.
• SD (Pro) — 356 שניות על H100 לעומת 936 שניות על RTX 4090, וזה המקום שבו קנס הביצועים של כרטיס צרכן הוא הקטן ביותר והכדאיות הכלכלית היא הפחות גרועה.
צורת הטבלה הזו חשובה יותר מכל תא בודד. H100 מהיר בערך פי שלושה מ-4090 ב-Pro Full HD, ומהיר בערך פי שישה מ-5060 Ti באותה משימה — אבל שלב ה-SR עולה אותו דבר בשני גדלי המודל, כ-64 שניות ב-HD וכ-96 שניות ב-Full HD על 5090. Lite לא מקנה לך מעבר סופר-רזולוציה קצר יותר, כי מודל ה-SR מאומן בנפרד ולא אכפת לו איזה מודל בסיס הזין אותו.
מסלול 16 GB, וההגדרה האחת שמשנה את התמונה שלך
שיא הזיכרון המוקצה בהרצת Pro SD מגיע ל-72.8 GiB, וזה מעבר לכל כרטיס צרכני. המאגר עונה עם העברת בלוקים (block offloading) — רק שני בלוקי transformer נמצאים בזיכרון ה-GPU בו-זמנית, והשאר מוזרם מזיכרון המארח — בתוספת שלושה פריסטים לכרטיסי 32 GB, 24 GB ו-16 GB. הפריסטים של 32 ו-24 GB זהים, מכיוון שמעל 24 GB מרווח הזיכרון הנוסף לא מתורגם למהירות.
ההסתייגות חבויה וכדאי לחזור עליה: בפריסט של 16 GB מקודד הטקסט עובר קוונטיזציה ל-NF4, והמאמר מפורש שזהו השינוי היחיד בפריסט שמשנה את הקליפ עצמו. ייצוג טקסטואלי שונה מפיק וידאו שונה. כל השאר — אורך מקטע, רצועות מרחביות, פריקת זיכרון — משנה את הפלט ברמת רעש עיגול, סביב 12% מהפיקסלים נבדלים ברמת בהירות אחת ב-PSNR של כ-57 dB. אם אתם משחזרים תוצאה של מישהו אחר בכרטיס 16 GB והיא לא תואמת, זה הדבר הראשון שכדאי לבדוק.
שלושה דברים שהערות השחרור אינן מיישבות
• חמש שניות הן התקרה, לא ברירת מחדל. המודל אומן על 121 פריימים ובקצב של 24 פריימים לשנייה, וגם המאמר וגם מתכון ההגשה בנויים סביב זה. אין מצב הארכה בגרסה. כל מה שארוך יותר הוא בעיית תפירה שאתה אחראי לה.
• הצ'קפוינט המזוקק הוא מה שבפועל תגיש, והוא נמדד כשווה בביצועים. האבלציה במאמר מציבה את המודל המזוקק כמועדף או בתיקו ברוב הקריטריונים, כאשר אף הבדל בודד אינו מגיע למובהקות, בהעדפה ממוצעת של 51% מול 49%. זהו המחיר שאתה משלם תמורת המהירות.
• יש במאמר שני מספרי שיעור שגיאות מילים (WER), והם אינם ניתנים להשוואה. ההפחתה של 47% ב-WER של דיבור מחולל שמלווה את שלב למידת החיזוק נמדדת באמצעות Whisper-large-v3, אחד ממודלי התגמול ב-RL; ה-WER המדווח לצד VABench משתמש ב-Qwen3-ASR-1.7B על תת-קבוצת הדיבור. המחברים אומרים זאת בעצמם. לצטט אחד בתור האחר היא הטעות הקלה ביותר לעשות עם מהדורה זו.
היכן ממוקם נתב בערימה כמו זו
OrcaRouter אינו מגיש את Kandinsky 6.0 Video, ואין לקרוא בדברים אלה כטענה שהוא כן — המודל הוא שלך להרצה מה-Hub, או נגיש דרך הממשקים של המעבדה עצמה. מה שפייפליין כמו זה צריך מנתב הוא הטקסט שסביבו. מעבר הרחבת הפרומפט שהופך תיאור שוט לכיתוב הארוך, הבינוני או הקצר שהמודל אומן עליו, עבודת הכיתוב והתמלול שמזינה מעבר מתמונה לווידאו, סיכומי הביקורת שמחליטים איזה מבין ארבעה דורות לשמור: אלה הן קריאות טקסט רגילות, והן פועלות על נקודת קצה אחת תואמת OpenAI על פני יותר מ-200 מודלים עם מחירי מחירון של ספקים המועברים בתוספת של 0%, כך ששינוי מחיר של ספק נכנס לתוקף באותו יום. מעבר אוטומטי לנתיב חלופי חשוב כאן יותר מהרגיל, מפני שרינדור של חמש דקות שנופל בשלב הכיתוב צריך לעבור לנתיב אחר במקום להפעיל מחדש את העבודה.
הדבר הבא שכדאי לשים לב אליו הוא לא עוד מיזוג, אלא מספר. ל-Kandinsky 6.0 Video Pro יש תוצאות שדווחו על ידי הספק ב-VABench והערכה אנושית שנערכה במעבדה מול Kling 2.6, Veo 3.1 Fast, MiniMax H3 ו-Seedance 2.0 — ועדיין אין ציון זירה עצמאי. כאשר יופיע אחד כזה, הטענה בדבר משקלים פתוחים מפסיקה להיות ויכוח על נגישות ומתחילה להיות ויכוח על איכות, וזו ההשוואה שקובעת אם זה מודל שצוותים מורידים או מודל שהם מעריצים.


המאגר כולל גם שני צמתי ComfyUI — kandinsky6 ו-kandinsky6-sr — הניתנים להתקנה דרך ComfyUI Manager, ושני Hugging Face Spaces: אחד עבור צ'קפוינט ה-distill של Pro ואחד עבור הדגמת הסופר-רזולוציה לווידאו. בין ה-CLI, צמתי ה-ComfyUI, חבילת ה-diffusers וכעת גם צינור vLLM-Omni, משטח הפריסה רחב יותר ביום השלישי ממה שרוב מודלי הווידאו הפתוחים מצליחים להשיג ברבעון. הרוחב הזה הוא הסיפור האמיתי של השבוע: Sber שחררה משפחה, לא מאמר עם דמו מצורף.

