بطاقة عنوان مُولّدة تحمل النص 'Kandinsky 6.0 Video يصل إلى vLLM-Omni' مع العنوان الفرعي 'تتحول نقطة تفتيش إلى خدمة'، فوق صف أيقونات مُعنون بـ 'توليد الفيديو' و'الصوت المتزامن' و'النشر بأوزان مفتوحة'. ويقع شعار OrcaRouter في الزاوية السفلية اليمنى.
Engineering & Research

كاندينسكي 6.0 فيديو يصل إلى vLLM-Omni: ما الذي تضيفه طبقة الخدمة إلى نموذج مفتوح

الكاتب

Magnus Corvin

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج →
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

تم دمج طلب السحب رقم #8537 في vLLM-Omni عند الساعة 07:55 بالتوقيت العالمي المنسق صباح هذا اليوم، وهو يفعل شيئًا واحدًا بالضبط: فهو يجعل Kandinsky 6.0 Video قابلاً للتقديم كخدمة. وصل النموذج نفسه من مختبر Kandinsky التابع لـ Sber في اليوم نفسه كزوج — Kandinsky 6.0 Video Pro بـ 29 مليار معامل وKandinsky 6.0 Video Lite بـ 3 مليارات — لتوليد مقاطع مدتها خمس ثوانٍ مع صوت متزامن بتردد 44 كيلوهرتز، بما في ذلك مزامنة الشفاه، من وصف نصي أو صورة مرجعية، مع الشيفرة والأوزان وتكامل diffusers كلها تحت رخصة MIT. ما لم يكن لديه حتى صباح هذا اليوم هو طريقة لتشغيله داخل خادم استدلال بدلاً من سطر أوامر لمرة واحدة.

هذا التمييز يستحق أكثر مما يبدو، وهو السبب في أن هذه قصة منفصلة عن الإصدار. إن نقطة تحقق مفتوحة يمكنك تشغيلها على بطاقتك الخاصة هي نتاج بحثي؛ أما نقطة تحقق مفتوحة مزوّدة بخط معالجة من جهة الخادم، ونقاط دخول مشتركة، ووصفة تقديم، فهي شيء يمكنك وضعه خلف طابور. منحك إصدار هذا الأسبوع الأول. أما دمج اليوم فهو بداية الثاني.

ما الذي دُمج فعليًا؟

يضيف طلب السحب (PR) القدرة على تحويل النص إلى فيديو وصوت وتحويل الصورة إلى فيديو وصوت إلى vLLM-Omni من نقطة التحقق kandinskylab/Kandinsky-6.0-Pro-5s-Diffusers. الخيارات الهندسية هي الجزء المثير للاهتمام، لأنها تخبرك كيف تبدو البنية حقًا عندما يتعين على شخص غير المؤلفين تشغيلها.

• يقوم DiT واحد بإزالة الضوضاء من كلا النمطين. يُسجَّل خط الأنابيب باسم Kandinsky6TI2VAPipeline، وتُزال الضوضاء من الكامنات الخاصة بالفيديو والكامنات الخاصة بالصوت معًا بواسطة محوّل واحد بدلًا من نموذجين يُشغَّلان بالتتابع. وهذا يحاكي CrossDiT ثنائي المسار الوارد في الورقة البحثية، حيث يتصل مسار فيديو مُدرَّب مسبقًا ومسار صوتي مبني من الصفر عبر انتباه متقاطع ثنائي الاتجاه.

• تُحمَّل الأوزان مجلدًا بمجلد. تُقرأ نقطة حفظ Hub على هيئة transformer/ وvae/ وtext_encoder/ وtext_encoder_2/ وaudio_vae/. أما الأسماء الداخلية لنقطة الحفظ المنشورة — videoT وaudioT — فتُسقَط على video_dec_block وaudio_dec_block عند التحميل، وهو من التفاصيل التي تستهلك يومًا كاملًا إن اكتشفتها بنفسك.

• الصوت مُفعَّل افتراضيًا. يُخرج خط المعالجة الصوت بتردد 44.1 كيلوهرتز بدلًا من التعامل مع الصوت كعلامة اختيارية للتفعيل، لذا فإن الطلب الذي لا يحتوي على معاملات صوتية يعود رغم ذلك بكلام وموسيقى أو أصوات محيطة متزامنة.

• إدخال الصورة هو إطار ذيل مُقنّع، وليس وضعًا منفصلًا. يُطبَّق التكييف بالصورة المرجعية عبر التقنيع، وهكذا تخدم خط الأنابيب نفسه كلاً من T2AV وI2AV دون تفريع.

اختبار التحقق السريع الذي أجراه المُقدِّم هو حدّ أدنى مفيد: بطاقة NVIDIA H100 80GB واحدة مع FlashAttention-3، مع تشغيل CPU offload، و864×480، و125 إطارًا، و50 خطوة، وCFG 5.0، وبذرة 42. هذا مقطع مدته 5 ثوانٍ بدقة أقل بقليل من HD، وليس تصييرًا بدقة Full HD، ولا يدّعي الـ PR خلاف ذلك.

نقطة التفتيش ليست خدمة

سبب الاهتمام بدمج مثل هذا هو ما يزيله من قائمتك. تشغيل التنفيذ المرجعي يعني استنساخ المستودع، وتشغيل الإعداد فقط، وتركه يُجمّع SageAttention على أي شيء أدنى من Hopper، وتنزيل نقطة التحقق إلى مجلد تخزين مؤقت، واستدعاء أمر generate الذي تنتج مخرجاته في مجلد يحمل طابعًا زمنيًا. هذا جيد لإلقاء نظرة أولى، لكنه غير مناسب لمنتج.

يمنحك vLLM-Omni النموذج داخل عملية تقديم، مع نفس نقاط الدخول للاستدلال دون اتصال التي يستخدمها المشروع لنماذجه الانتشارية الأخرى (examples/offline_inference/text_to_video/text_to_video.py ونظيره الخاص بالصورة إلى الفيديو) ووصفة تقديم في recipes/Kandinsky/Kandinsky6-TI2VA.md. ويترتب على ذلك نتيجتان عمليتان. تصبح قصة النشر الخاصة بك عبارة عن حاوية تتحدث واجهة HTTP بدلًا من سكربت ترعاه، ويتوقف النموذج عن كونه حالة خاصة في حزمة التشغيل لديك — فهو يستقر إلى جانب أي شيء آخر تشغله في ذلك الخادم.

لاحظ ما ليس هذا: فهو ليس نقطة نهاية مستضافة، وليس سعرًا، وليس قياسًا مستقلًا للجودة. إنه مجرد مكان آخر يمكن للنموذج أن يعمل فيه، قدّمه شخص من خارج المختبر، بعد ثلاثة أيام من ظهور الأوزان.

ما تكلفة مقطع مدته خمس ثوانٍ من حيث الزمن الفعلي، على بطاقات حقيقية

جدول المستودع نفسه هو نقطة البداية الصادقة. هذه هي أوقات عمل النموذج الأساسي غير المقطّر لمقطع واحد مدته 5 ثوانٍ بعد الإحماء، مع استبعاد تحميل الأوزان وترميز MP4. ويعني Full HD هنا أن تمريرة الدقة الفائقة تعمل أيضًا.

• Full HD (Pro) — 402 ث على H100، و765 ث على RTX PRO 6000، و854 ث على RTX 5090، و1,106 ث على A100 80GB، و1,247 ث على RTX 4090، و3,530 ث على RTX 5060 Ti.

• Full HD (Lite) — 284 ثانية على H100، و387 ثانية على RTX PRO 6000، و406 ثانية على RTX 5090، و664 ثانية على A100 80GB، و578 ثانية على RTX 4090، و1,774 ثانية على RTX 5060 Ti.

• SD (Pro) — 356 ثانية على H100 مقابل 936 ثانية على RTX 4090، وهو الحال الذي تكون فيه عقوبة بطاقة المستهلك أصغر والجدوى الاقتصادية أقل سوءًا.

شكل هذا الجدول يهم أكثر من أي خلية بمفردها. إن H100 أسرع بنحو ثلاث مرات من 4090 في Pro Full HD، وأسرع بنحو ست مرات من 5060 Ti في المهمة نفسها — لكن تكلفة مرحلة SR نفسها متساوية في كلا حجمي الطراز: نحو 64 ثانية عند HD ونحو 96 ثانية عند Full HD على 5090. لا يوفر لك Lite تمريرة رفع دقة فائقة أقصر، لأن طراز SR يُدرَّب بشكل منفصل ولا يبالي بالطراز الأساسي الذي غذّاه.

مسار 16 غيغابايت، والإعداد الوحيد الذي يغيّر صورتك

تبلغ الذروة في الذاكرة المخصصة أثناء تشغيل Pro SD ‏72.8 GiB، وهو ما يتجاوز كل بطاقة استهلاكية. يرد المستودع على ذلك بتفريغ الكتل — بحيث لا تبقى على وحدة معالجة الرسوميات في المرة الواحدة سوى كتلتَي محوّل مقيمتين، بينما تُبثّ البقية من ذاكرة المضيف — إضافة إلى ثلاثة إعدادات مسبقة لبطاقات بسعة 32 GB و24 GB و16 GB. الإعدادان المسبقان لسعة 32 و24 GB متطابقان، لأن الحيز الإضافي فوق 24 GB لا يُترجم إلى سرعة.

التحذير مدفون ويستحق التكرار: في الإعداد المسبق 16 GB، يُكمَّم مشفّر النص إلى NF4، والورقة البحثية صريحة في أن هذا هو التغيير الوحيد في الإعداد المسبق الذي يغيّر المقطع نفسه. تمثيل نصي مختلف ينتج فيديو مختلفًا. كل ما عدا ذلك — طول المقطع، الشرائح المكانية، الإفراغ — يغيّر الناتج على مستوى ضوضاء التقريب، بنحو 12% من البكسلات تختلف بمستوى سطوع واحد عند PSNR يقارب 57 dB. إذا كنت تعيد إنتاج نتيجة شخص آخر على بطاقة 16 GB ولم تتطابق، فهذا أول شيء يجب التحقق منه.

ثلاثة أمور لا تحسمها ملاحظات الإصدار

• خمس ثوانٍ هي الحد الأقصى، وليست الوضع الافتراضي. تم تدريب النموذج على {{1}}121 إطارًا{{/1}} و{{2}}24 إطارًا في الثانية{{/2}}، وقد بُنيت كل من الورقة البحثية ووصفة التشغيل حول ذلك. لا يوجد وضع تمديد في الإصدار. أي مدة أطول تصبح مشكلة خياطة تقع على عاتقك.

• نقطة التحقق المقطَّرة هي ما ستقدّمه فعليًا، وقد قيست عند مستوى التكافؤ. ويضع اختبار الاستئصال في الورقة البحثية النموذج المقطَّر في خانة المفضَّل أو المتعادل في أغلب المعايير، دون أن يبلغ أي فرق فردي مستوى الدلالة، بمتوسط تفضيل 51% مقابل 49%. هذه هي المقايضة التي تقبلها مقابل السرعة.

• هناك رقمان لمعدل خطأ الكلمات في الورقة البحثية وهما غير قابلين للمقارنة. إن انخفاض بنسبة 47% في WER للكلام المُولَّد المصاحب لمرحلة التعلّم المعزّز يُقيَّم باستخدام Whisper-large-v3، أحد نماذج المكافأة في التعلّم المعزّز؛ أما WER المُبلَّغ عنه إلى جانب VABench فيستخدم Qwen3-ASR-1.7B على المجموعة الفرعية الخاصة بالكلام. ويقول المؤلفون ذلك بأنفسهم. إن الاستشهاد بأحدهما بدلاً من الآخر هو أسهل خطأ يمكن ارتكابه مع هذا الإصدار.

أين يقع الموجّه في مكدّس مثل هذا

لا يقدّم OrcaRouter نموذج Kandinsky 6.0 Video، ولا ينبغي قراءة أي شيء هنا على أنه ادعاء بذلك — فالنموذج متاح لك لتشغيله من Hub، أو يمكن الوصول إليه عبر واجهات المختبر نفسه. ما يحتاجه مسار معالجة كهذا من الموجّه هو النص المحيط به. تمريرة توسيع المطالبة التي تحوّل وصف اللقطة إلى التسمية التوضيحية الطويلة أو المتوسطة أو القصيرة التي دُرّب عليها النموذج، وعمل التسميات التوضيحية والنصوص المنسوخة الذي يغذّي تمريرة من الصورة إلى الفيديو، وملخصات المراجعة التي تقرّر أيًّا من التوليدات الأربعة يجب الاحتفاظ به: كلها نداءات نصية عادية، وهي تعمل على نقطة نهاية واحدة متوافقة مع OpenAI عبر أكثر من 200 نموذج مع أسعار القائمة لدى المزوّدين تُمرَّر بهامش ربح 0%، لذا يصبح تغيّر سعر المورّد ساريًا في اليوم نفسه. يكتسب التبديل التلقائي عند الفشل أهمية أكبر من المعتاد هنا، لأن عملية تصيير تستغرق خمس دقائق وتتعطل عند مرحلة التسمية التوضيحية ينبغي أن يُعاد توجيهها بدلًا من إعادة تشغيل المهمة.

الشيء التالي الذي يستحق المتابعة ليس عملية دمج أخرى، بل رقم. لدى Kandinsky 6.0 Video Pro نتائج مُبلَّغ عنها من المورّد على VABench وتقييم بشري أجراه مختبر مقابل Kling 2.6 وVeo 3.1 Fast وMiniMax H3 وSeedance 2.0 — ولا توجد بعد نتيجة ساحة مستقلة. عندما تظهر واحدة، يتوقف ادعاء الأوزان المفتوحة عن كونه جدالًا حول الوصول ويصبح جدالًا حول الجودة، وهو المقارنة التي تحدد ما إذا كان هذا نموذجًا تنزّله الفرق أم نموذجًا تُعجب به.

A generated scoreboard titled 'Kandinsky 6.0 Video — the scoreboard' with a single column of six rows: 'Sizes: Pro 29B, Lite 3B', 'Clip length: 5s fixed', 'Audio: 44 kHz lip-sync', 'Resolution: Full HD plus SR', 'Licence: MIT' and 'Serving: vLLM-Omni day 0'. A footer reads 'All figures vendor-reported; no independent Elo yet. October 2026.' The OrcaRouter logo sits in the bottom-right corner.A screenshot of the GitHub repository page for kandinskylab/kandinsky-6, showing 11 commits, 35 stars and 4 forks, an MIT license badge, and a README titled 'Kandinsky 6.0: A family of diffusion models for Video + Audio Generation' with badges for KANDINSKYLAB, REPORT, DIFFUSERS and COMFYUI; recent commits include 'README update', 'Added source code', 'Some improvements for just generate' and 'Keep ComfyUI user documentation in README'.

يوفّر المستودع أيضًا عقدتَي ComfyUI — {{1}}kandinsky6{{/1}} و{{2}}kandinsky6-sr{{/2}} — قابلتين للتثبيت عبر ComfyUI Manager، ومساحتَي Hugging Face: {{3}}واحدة{{/3}} لنقطة تفتيش Pro distill و{{4}}واحدة{{/4}} للعرض التوضيحي لتحسين الدقة الفائقة للفيديو. بين واجهة سطر الأوامر CLI، وعقد ComfyUI، وحزمة diffusers، والآن خط أنابيب vLLM-Omni، فإن نطاق النشر أوسع في اليوم الثالث مما تحققه معظم نماذج الفيديو المفتوحة خلال ربع عام. هذا الاتساع هو القصة الفعلية لهذا الأسبوع: فقد أطلقت Sber عائلة، وليس ورقة بحثية مرفقة بعرض توضيحي.

A screenshot of the Artificial Analysis AA-Video-T2V V2.0 leaderboard, ranking text-to-video models by Elo from human preference votes. Wan 3.0 is first at 1,156 over 8,300 samples and $12.00 per minute (Aug 2026); MiniMax H3 (768p) is fourth at 1,137 over 8,315 samples at $4.80 per minute (Jul 2026); grok-imagine-video-1.5 is eleventh at 1,045 over 4,056 samples at $15.00 per minute (May 2026); Wan2.7-260612 is thirteenth at 1,030 over 5,571 samples at $9.00 per minute (Jun 2026); Veo 3.1 is eighteenth at 962 over 2,998 samples at $24.00 per minute, Veo 3.1 Fast nineteenth at 961 over 4,325 samples at $7.20 per minute, and Veo 3.1 Lite twenty-first at 948 over 2,903 samples at $4.80 per minute.