
كاندينسكي 6.0 فيديو يصل إلى vLLM-Omni: ما الذي تضيفه طبقة الخدمة إلى نموذج مفتوح
- openaiجديدOpenAI: GPT-6.1 Sol2026-09-2952الذكاء
- anthropicجديدAnthropic: Claude Sonnet 5.52026-09-2856الذكاء
- typesafeجديدTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 لكل مليون رمز · 150 tok/s
- OpenAIجديدOpenAI: GPT-6 Luna2026-09-2238الذكاء
- OpenAIجديدOpenAI: GPT-6 Sol2026-09-2248الذكاء
- AnthropicجديدAnthropic: Claude Opus 5.52026-09-2258الذكاء
- xAIGrok 4.72026-09-2146الذكاء
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 لكل مليون رمز · 126 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 لكل مليون رمز · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- OpenAIOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245الذكاء76البرمجة
- AnthropicAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 لكل مليون رمز · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز · 250 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 لكل مليون رمز · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
تم دمج طلب السحب رقم #8537 في vLLM-Omni عند الساعة 07:55 بالتوقيت العالمي المنسق صباح هذا اليوم، وهو يفعل شيئًا واحدًا بالضبط: فهو يجعل Kandinsky 6.0 Video قابلاً للتقديم كخدمة. وصل النموذج نفسه من مختبر Kandinsky التابع لـ Sber في اليوم نفسه كزوج — Kandinsky 6.0 Video Pro بـ 29 مليار معامل وKandinsky 6.0 Video Lite بـ 3 مليارات — لتوليد مقاطع مدتها خمس ثوانٍ مع صوت متزامن بتردد 44 كيلوهرتز، بما في ذلك مزامنة الشفاه، من وصف نصي أو صورة مرجعية، مع الشيفرة والأوزان وتكامل diffusers كلها تحت رخصة MIT. ما لم يكن لديه حتى صباح هذا اليوم هو طريقة لتشغيله داخل خادم استدلال بدلاً من سطر أوامر لمرة واحدة.
هذا التمييز يستحق أكثر مما يبدو، وهو السبب في أن هذه قصة منفصلة عن الإصدار. إن نقطة تحقق مفتوحة يمكنك تشغيلها على بطاقتك الخاصة هي نتاج بحثي؛ أما نقطة تحقق مفتوحة مزوّدة بخط معالجة من جهة الخادم، ونقاط دخول مشتركة، ووصفة تقديم، فهي شيء يمكنك وضعه خلف طابور. منحك إصدار هذا الأسبوع الأول. أما دمج اليوم فهو بداية الثاني.
ما الذي دُمج فعليًا؟
يضيف طلب السحب (PR) القدرة على تحويل النص إلى فيديو وصوت وتحويل الصورة إلى فيديو وصوت إلى vLLM-Omni من نقطة التحقق kandinskylab/Kandinsky-6.0-Pro-5s-Diffusers. الخيارات الهندسية هي الجزء المثير للاهتمام، لأنها تخبرك كيف تبدو البنية حقًا عندما يتعين على شخص غير المؤلفين تشغيلها.
• يقوم DiT واحد بإزالة الضوضاء من كلا النمطين. يُسجَّل خط الأنابيب باسم Kandinsky6TI2VAPipeline، وتُزال الضوضاء من الكامنات الخاصة بالفيديو والكامنات الخاصة بالصوت معًا بواسطة محوّل واحد بدلًا من نموذجين يُشغَّلان بالتتابع. وهذا يحاكي CrossDiT ثنائي المسار الوارد في الورقة البحثية، حيث يتصل مسار فيديو مُدرَّب مسبقًا ومسار صوتي مبني من الصفر عبر انتباه متقاطع ثنائي الاتجاه.
• تُحمَّل الأوزان مجلدًا بمجلد. تُقرأ نقطة حفظ Hub على هيئة transformer/ وvae/ وtext_encoder/ وtext_encoder_2/ وaudio_vae/. أما الأسماء الداخلية لنقطة الحفظ المنشورة — videoT وaudioT — فتُسقَط على video_dec_block وaudio_dec_block عند التحميل، وهو من التفاصيل التي تستهلك يومًا كاملًا إن اكتشفتها بنفسك.
• الصوت مُفعَّل افتراضيًا. يُخرج خط المعالجة الصوت بتردد 44.1 كيلوهرتز بدلًا من التعامل مع الصوت كعلامة اختيارية للتفعيل، لذا فإن الطلب الذي لا يحتوي على معاملات صوتية يعود رغم ذلك بكلام وموسيقى أو أصوات محيطة متزامنة.
• إدخال الصورة هو إطار ذيل مُقنّع، وليس وضعًا منفصلًا. يُطبَّق التكييف بالصورة المرجعية عبر التقنيع، وهكذا تخدم خط الأنابيب نفسه كلاً من T2AV وI2AV دون تفريع.
اختبار التحقق السريع الذي أجراه المُقدِّم هو حدّ أدنى مفيد: بطاقة NVIDIA H100 80GB واحدة مع FlashAttention-3، مع تشغيل CPU offload، و864×480، و125 إطارًا، و50 خطوة، وCFG 5.0، وبذرة 42. هذا مقطع مدته 5 ثوانٍ بدقة أقل بقليل من HD، وليس تصييرًا بدقة Full HD، ولا يدّعي الـ PR خلاف ذلك.
نقطة التفتيش ليست خدمة
سبب الاهتمام بدمج مثل هذا هو ما يزيله من قائمتك. تشغيل التنفيذ المرجعي يعني استنساخ المستودع، وتشغيل الإعداد فقط، وتركه يُجمّع SageAttention على أي شيء أدنى من Hopper، وتنزيل نقطة التحقق إلى مجلد تخزين مؤقت، واستدعاء أمر generate الذي تنتج مخرجاته في مجلد يحمل طابعًا زمنيًا. هذا جيد لإلقاء نظرة أولى، لكنه غير مناسب لمنتج.
يمنحك vLLM-Omni النموذج داخل عملية تقديم، مع نفس نقاط الدخول للاستدلال دون اتصال التي يستخدمها المشروع لنماذجه الانتشارية الأخرى (examples/offline_inference/text_to_video/text_to_video.py ونظيره الخاص بالصورة إلى الفيديو) ووصفة تقديم في recipes/Kandinsky/Kandinsky6-TI2VA.md. ويترتب على ذلك نتيجتان عمليتان. تصبح قصة النشر الخاصة بك عبارة عن حاوية تتحدث واجهة HTTP بدلًا من سكربت ترعاه، ويتوقف النموذج عن كونه حالة خاصة في حزمة التشغيل لديك — فهو يستقر إلى جانب أي شيء آخر تشغله في ذلك الخادم.
لاحظ ما ليس هذا: فهو ليس نقطة نهاية مستضافة، وليس سعرًا، وليس قياسًا مستقلًا للجودة. إنه مجرد مكان آخر يمكن للنموذج أن يعمل فيه، قدّمه شخص من خارج المختبر، بعد ثلاثة أيام من ظهور الأوزان.
ما تكلفة مقطع مدته خمس ثوانٍ من حيث الزمن الفعلي، على بطاقات حقيقية
جدول المستودع نفسه هو نقطة البداية الصادقة. هذه هي أوقات عمل النموذج الأساسي غير المقطّر لمقطع واحد مدته 5 ثوانٍ بعد الإحماء، مع استبعاد تحميل الأوزان وترميز MP4. ويعني Full HD هنا أن تمريرة الدقة الفائقة تعمل أيضًا.
• Full HD (Pro) — 402 ث على H100، و765 ث على RTX PRO 6000، و854 ث على RTX 5090، و1,106 ث على A100 80GB، و1,247 ث على RTX 4090، و3,530 ث على RTX 5060 Ti.
• Full HD (Lite) — 284 ثانية على H100، و387 ثانية على RTX PRO 6000، و406 ثانية على RTX 5090، و664 ثانية على A100 80GB، و578 ثانية على RTX 4090، و1,774 ثانية على RTX 5060 Ti.
• SD (Pro) — 356 ثانية على H100 مقابل 936 ثانية على RTX 4090، وهو الحال الذي تكون فيه عقوبة بطاقة المستهلك أصغر والجدوى الاقتصادية أقل سوءًا.
شكل هذا الجدول يهم أكثر من أي خلية بمفردها. إن H100 أسرع بنحو ثلاث مرات من 4090 في Pro Full HD، وأسرع بنحو ست مرات من 5060 Ti في المهمة نفسها — لكن تكلفة مرحلة SR نفسها متساوية في كلا حجمي الطراز: نحو 64 ثانية عند HD ونحو 96 ثانية عند Full HD على 5090. لا يوفر لك Lite تمريرة رفع دقة فائقة أقصر، لأن طراز SR يُدرَّب بشكل منفصل ولا يبالي بالطراز الأساسي الذي غذّاه.
مسار 16 غيغابايت، والإعداد الوحيد الذي يغيّر صورتك
تبلغ الذروة في الذاكرة المخصصة أثناء تشغيل Pro SD 72.8 GiB، وهو ما يتجاوز كل بطاقة استهلاكية. يرد المستودع على ذلك بتفريغ الكتل — بحيث لا تبقى على وحدة معالجة الرسوميات في المرة الواحدة سوى كتلتَي محوّل مقيمتين، بينما تُبثّ البقية من ذاكرة المضيف — إضافة إلى ثلاثة إعدادات مسبقة لبطاقات بسعة 32 GB و24 GB و16 GB. الإعدادان المسبقان لسعة 32 و24 GB متطابقان، لأن الحيز الإضافي فوق 24 GB لا يُترجم إلى سرعة.
التحذير مدفون ويستحق التكرار: في الإعداد المسبق 16 GB، يُكمَّم مشفّر النص إلى NF4، والورقة البحثية صريحة في أن هذا هو التغيير الوحيد في الإعداد المسبق الذي يغيّر المقطع نفسه. تمثيل نصي مختلف ينتج فيديو مختلفًا. كل ما عدا ذلك — طول المقطع، الشرائح المكانية، الإفراغ — يغيّر الناتج على مستوى ضوضاء التقريب، بنحو 12% من البكسلات تختلف بمستوى سطوع واحد عند PSNR يقارب 57 dB. إذا كنت تعيد إنتاج نتيجة شخص آخر على بطاقة 16 GB ولم تتطابق، فهذا أول شيء يجب التحقق منه.
ثلاثة أمور لا تحسمها ملاحظات الإصدار
• خمس ثوانٍ هي الحد الأقصى، وليست الوضع الافتراضي. تم تدريب النموذج على {{1}}121 إطارًا{{/1}} و{{2}}24 إطارًا في الثانية{{/2}}، وقد بُنيت كل من الورقة البحثية ووصفة التشغيل حول ذلك. لا يوجد وضع تمديد في الإصدار. أي مدة أطول تصبح مشكلة خياطة تقع على عاتقك.
• نقطة التحقق المقطَّرة هي ما ستقدّمه فعليًا، وقد قيست عند مستوى التكافؤ. ويضع اختبار الاستئصال في الورقة البحثية النموذج المقطَّر في خانة المفضَّل أو المتعادل في أغلب المعايير، دون أن يبلغ أي فرق فردي مستوى الدلالة، بمتوسط تفضيل 51% مقابل 49%. هذه هي المقايضة التي تقبلها مقابل السرعة.
• هناك رقمان لمعدل خطأ الكلمات في الورقة البحثية وهما غير قابلين للمقارنة. إن انخفاض بنسبة 47% في WER للكلام المُولَّد المصاحب لمرحلة التعلّم المعزّز يُقيَّم باستخدام Whisper-large-v3، أحد نماذج المكافأة في التعلّم المعزّز؛ أما WER المُبلَّغ عنه إلى جانب VABench فيستخدم Qwen3-ASR-1.7B على المجموعة الفرعية الخاصة بالكلام. ويقول المؤلفون ذلك بأنفسهم. إن الاستشهاد بأحدهما بدلاً من الآخر هو أسهل خطأ يمكن ارتكابه مع هذا الإصدار.
أين يقع الموجّه في مكدّس مثل هذا
لا يقدّم OrcaRouter نموذج Kandinsky 6.0 Video، ولا ينبغي قراءة أي شيء هنا على أنه ادعاء بذلك — فالنموذج متاح لك لتشغيله من Hub، أو يمكن الوصول إليه عبر واجهات المختبر نفسه. ما يحتاجه مسار معالجة كهذا من الموجّه هو النص المحيط به. تمريرة توسيع المطالبة التي تحوّل وصف اللقطة إلى التسمية التوضيحية الطويلة أو المتوسطة أو القصيرة التي دُرّب عليها النموذج، وعمل التسميات التوضيحية والنصوص المنسوخة الذي يغذّي تمريرة من الصورة إلى الفيديو، وملخصات المراجعة التي تقرّر أيًّا من التوليدات الأربعة يجب الاحتفاظ به: كلها نداءات نصية عادية، وهي تعمل على نقطة نهاية واحدة متوافقة مع OpenAI عبر أكثر من 200 نموذج مع أسعار القائمة لدى المزوّدين تُمرَّر بهامش ربح 0%، لذا يصبح تغيّر سعر المورّد ساريًا في اليوم نفسه. يكتسب التبديل التلقائي عند الفشل أهمية أكبر من المعتاد هنا، لأن عملية تصيير تستغرق خمس دقائق وتتعطل عند مرحلة التسمية التوضيحية ينبغي أن يُعاد توجيهها بدلًا من إعادة تشغيل المهمة.
الشيء التالي الذي يستحق المتابعة ليس عملية دمج أخرى، بل رقم. لدى Kandinsky 6.0 Video Pro نتائج مُبلَّغ عنها من المورّد على VABench وتقييم بشري أجراه مختبر مقابل Kling 2.6 وVeo 3.1 Fast وMiniMax H3 وSeedance 2.0 — ولا توجد بعد نتيجة ساحة مستقلة. عندما تظهر واحدة، يتوقف ادعاء الأوزان المفتوحة عن كونه جدالًا حول الوصول ويصبح جدالًا حول الجودة، وهو المقارنة التي تحدد ما إذا كان هذا نموذجًا تنزّله الفرق أم نموذجًا تُعجب به.


يوفّر المستودع أيضًا عقدتَي ComfyUI — {{1}}kandinsky6{{/1}} و{{2}}kandinsky6-sr{{/2}} — قابلتين للتثبيت عبر ComfyUI Manager، ومساحتَي Hugging Face: {{3}}واحدة{{/3}} لنقطة تفتيش Pro distill و{{4}}واحدة{{/4}} للعرض التوضيحي لتحسين الدقة الفائقة للفيديو. بين واجهة سطر الأوامر CLI، وعقد ComfyUI، وحزمة diffusers، والآن خط أنابيب vLLM-Omni، فإن نطاق النشر أوسع في اليوم الثالث مما تحققه معظم نماذج الفيديو المفتوحة خلال ربع عام. هذا الاتساع هو القصة الفعلية لهذا الأسبوع: فقد أطلقت Sber عائلة، وليس ورقة بحثية مرفقة بعرض توضيحي.

