
Kandinsky 6.0 Video مقابل Grok Imagine Video: انقلبت لوحة الصدارة
- openaiجديدOpenAI: GPT-6.1 Sol2026-09-2952الذكاء
- anthropicجديدAnthropic: Claude Sonnet 5.52026-09-2856الذكاء
- typesafeجديدTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 لكل مليون رمز · 150 tok/s
- OpenAIجديدOpenAI: GPT-6 Luna2026-09-2238الذكاء
- OpenAIجديدOpenAI: GPT-6 Sol2026-09-2248الذكاء
- AnthropicجديدAnthropic: Claude Opus 5.52026-09-2258الذكاء
- xAIGrok 4.72026-09-2146الذكاء
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 لكل مليون رمز · 126 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 لكل مليون رمز · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- OpenAIOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245الذكاء76البرمجة
- AnthropicAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 لكل مليون رمز · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز · 250 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 لكل مليون رمز · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
في يناير 2026، عندما Grok Imagine Video أُطلِق، تصدّر ساحة فيديو Artificial Analysis في كلا الوضعين. اليوم، تضع لوحة الصدارة نفسها إصداره الحالي في المرتبة الحادية عشرة أو الثانية عشرة في التحويل من النص إلى الفيديو. هذه ليست فضيحة وليست فشلاً — بل هو ما يحدث لفئة سريعة الحركة خلال تسعة أشهر، وهو السبب الصادق لمقارنة نموذج التوليد لدى xAI بـKandinsky 6.0 Video الآن. أحدهما خدمة مُحسَّنة لمدى سرعة إنتاجك مقطعاً آخر؛ والآخر نقطة حفظ مرخّصة بموجب MIT، بـ29 مليار معامل في إصدار Pro و3 مليارات في إصدار Lite، أصدرها مختبر Kandinsky التابع لـSber في الأسبوع الأول من أكتوبر 2026، وتولّد خمس ثوانٍ من الفيديو مع صوت متزامن بتردد 44 كيلوهرتز ومزامنة شفاه. السؤال المثير للاهتمام ليس أيهما متقدم على لوحة الصدارة — بل ما يستطيع كل منهما بنيوياً فعله بعد ذلك.
اللوح الذي تحرك تحته
Grok Imagine Video هو نموذج التوليد الخاص بـ xAI، صدر لأول مرة في 29 يناير 2026 ومستقر عند الإصدار 1.5 منذ 16 يونيو. على لوحة المتصدرين للنص إلى فيديو الخاصة بـ Artificial Analysis، يحتل إصداره 1.5 المركزين الحادي عشر والثاني عشر بتصنيف Elo 1,045 (±9) من أصل 4,056 صوتًا، ومُدرج بسعر 15.00 دولارًا للدقيقة. الإصدار الأصلي غير موجود على تلك اللوحة.
تحويل الصور إلى فيديو هو المجال الذي تكون فيه العائلة أقوى، وهو النقطة التي يفترق عندها الإصداران بطريقة تستحق قراءة متأنية:
• grok-imagine-video-1.5 — من السابع إلى التاسع، إيلو 1,098 (±8)، 5,267 صوتًا، 8.40 دولار/دقيقة.
• grok-imagine-video (إصدار يناير) — الترتيب 12–17، إيلو 1,072 (±7)، 14,371 صوتًا، 4.20 دولار/دقيقة.
• على سبيل القياس، تتصدّر MiniMax H3 Max لوحة I2V تلك عند Elo 1,195 (±9) بعد 5,894 صوتًا، بينما يأتي Wan 3.0 في المركز السادس عند 1,164.
فيما يلي قراءتان، وكلتاهما صحيحة. البناء الأحدث من xAI متقدم حقًا على سابقه في تحويل الصور إلى فيديو، بمقدار 26 Elo، ويكلف ضعف ذلك في الدقيقة ليكون كذلك. وقصة أسبوع الإطلاق — نموذج وصل إلى القمة — لم تصمد: تحرك الميدان، وجمعت الساحة عشرات الآلاف من الأصوات عبر اثني عشر نظامًا أحدث، وموقع في منتصف الجدول هو ما تضع فيه تسعة أشهر من المنافسة مولّدًا سريعًا متعدد الأغراض.
لا يملك Kandinsky 6.0 Video أي تصنيف Elo على أي لوحة صدارة. أدلته هي تشغيل VABench وتقييم بشري أجراه المختبر، وكلاهما نشرته Sber، ولم يُعَد إنتاجهما خارجها. إن وضع نموذج مفتوح غير مدقَّق إلى جانب نموذج تجاري مُقيَّم هو بالضبط المقارنة التي ينبغي التعامل معها بحذر: فموقع النموذج المُقيَّم حقيقي وغير مُجمِّل، وموقع النموذج غير المُقيَّم مجهول. "المجهول" ليس "أفضل".
نوعان من السرعة، وواحد منهما فقط يُقاس بالثواني.
هدف تصميم Grok Imagine Video هو الإنتاجية لكل منشئ. إنه مدمج في X، ويعيد مقطعًا نهائيًا مع الصوت، ومجموعة ميزاته تبدو وكأنها قائمة بالأشياء التي يفعلها الناس فعليًا في التدفق: نسب أبعاد متعددة، حركة الكاميرا، إضافة الكائن وإزالته وتبديله، نقل النمط، التوليد المشروط بالمراجع من عدة صور لاتساق الشخصية، صوت أصلي مع حوار ومؤثرات وموسيقى. يصل طول المقطع إلى خمس عشرة ثانية، ويبلغ الحد الأقصى للدقة 1080p. المنتج بأكمله مبني بحيث تكلفك المحاولة الثانية بضع دقائق وبضعة سنتات.
Kandinsky 6.0 Video سريع بمعنى مختلف — ليس لكل محاولة، بل لكل وحدة ملكية. لا شيء فيه فوري. إن أوقات التشغيل الخاصة بالمستودع نفسه للنموذج غير المقطّر، بعد الإحماء وباستثناء تحميل الأوزان وترميز MP4، تضع مقطع Pro Full HD مدته خمس ثوانٍ عند نحو 402 ثانية على H100، و854 على RTX 5090، و1,247 على RTX 4090، و3,530 على RTX 5060 Ti. ويبلغ Lite Full HD 284 ثانية على H100. الأداة التي تجعل ذلك محتملاً هي نقطة التحقق المقطّرة، التي قاستها الورقة البحثية على قدم المساواة مع النموذج الكامل — مُفضَّلة أو متعادلة في أغلبية المعايير، بمتوسط تفضيل 51% مقابل 49%، دون أن يبلغ أي فرق فردي دلالة إحصائية. ما تحصل عليه مقابل التصيير البطيء هو نموذج على قرصك الخاص دون أي عدّاد لكل مقطع يعمل على الإطلاق.
هذا هو الشكل الحقيقي لهذه المواجهة. يُحسّن Grok Imagine Video تكلفة المحاولة العاشرة. أما Kandinsky 6.0 Video فيُحسّن تكلفة المحاولة رقم عشرة آلاف، ويفرض عليك الثمن عتادًا وصبرًا مقابل المحاولة الأولى.
كلاهما يولّدان الصوت — وهما ليسا الادعاء نفسه
هذا هو المحور الذي قد تقول فيه مقارنة كسولة "تعادل" وتكون مخطئة.
ينتج Grok Imagine Video صوتًا أصليًا مع الحوار والمؤثرات والموسيقى كواحدة من بين ميزات عديدة. إنه مُولِّد متعدد الأغراض يتضمن الصوت ضمنًا.
تتمحور Kandinsky 6.0 Video حول الصوت. تقوم المعمارية على CrossDiT ثنائي التيار، يقرن مسار فيديو مُهيأ من Kandinsky 5.0 Video بمسار صوتي دُرّب من الصفر على مجموعات صوتية كبيرة، ويربط بينهما انتباه تقاطعي ثنائي الاتجاه، ويُدرّبان معًا. المخرجات بتردد 44 كيلوهرتز مع مزامنة شفاه صريحة، ويُقال إن مرحلة التعلم المعزز في الورقة البحثية تخفض معدل خطأ الكلمات في الكلام المُولَّد بنسبة 47% — مقيسًا بـ Whisper-large-v3، وهو أحد نماذج المكافأة في التعلم المعزز، وهو تفصيل مهم لأن الورقة تُبلغ عن معدل خطأ كلمات ثانٍ غير قابل للمقارنة إلى جانب VABench باستخدام Qwen3-ASR-1.7B. الكلام هو ما دُرّب عليه النموذج في مرحلة التدريب اللاحق.
في المقابل، تتسم دراسة Sber الخاصة بالصراحة بشأن مواضع خسارتها. في التقييم المقارن جنبًا إلى جنب الذي أجراه المختبر، يُفضَّل MiniMax H3 وDreamina Seedance 2.0 وفق المعايير البصرية بفوارق كبيرة، ويوصف النموذج بأنه منافس لا متقدم. أما الادعاء الذي يستحق الأخذ به بجدية فهو أضيق نطاقًا وأكثر فائدة: ففي مواجهة Kling 2.6 وVeo 3.1 Fast، تتبادل النتائج الأفضلية معيارًا بمعيار، ويظل Kandinsky 6.0 Video منافسًا في جودة الكلام والمزامنة بين الصوت والصورة، حيث تنتهي نسبة كبيرة من المقارنات بالتعادل.
خمس عشرة ثانية مقابل خمس، وما تكلفة الوصول إلى كل منهما
• الحد الأقصى للمقطع — {{1}}Grok Imagine Video{{/1}}: حتى 15 ثانية. {{2}}Kandinsky 6.0 Video{{/2}}: 5 ثوانٍ ثابتة، 121 إطارًا بمعدل 24 إطارًا في الثانية، لا يوجد وضع تمديد في الإصدار.
• الدقة — Grok Video: حتى 1080p. Kandinsky 6.0: SD وHD وFull HD عبر نموذج مخصص للدقة الفائقة، مع رفع دقة خمسة مقاطع بمقدار x4 أو x2.25.
• مدخل مرجعي — Grok Imagine Video: توليد مشروط بالمرجع من عدة صور لاتساق الشخصية، بالإضافة إلى إضافة/إزالة/استبدال الكائنات. Kandinsky 6.0 Video: صورة واحدة، تُطبَّق كإطار ذيل مقنّع.
• التسعير — Grok Imagine Video: لكل ثانية من الإخراج، بدءًا من الطرف الأدنى للنطاق وصولًا إلى 0.30 دولار/ثانية بدقة 1080p، مع رسوم إضافية لكل صورة مُدخَلة؛ والوصول المجاني يقع خلف مستويات اشتراك X. Kandinsky 6.0 Video: لا شيء — لا خدمة، ولا سعر، فقط وقت GPU الذي توفره.
• الأوزان — Grok Imagine Video: لا. Kandinsky 6.0 Video: MIT، وPro وLite، مع تكامل diffusers.
العلاوة الخاصة بإصدار Grok الأحدث هي الرقم الذي يستحق وضع دائرة حوله. الانتقال من إصدار يناير إلى 1.5 يكلف ضعف المبلغ لكل دقيقة على لوحة تحويل الصورة إلى فيديو، ويحقق 26 نقطة إيلو. هذا تحسن حقيقي بسعر حقيقي، وهي نفس المقايضة التي يطلب كل مورّد فيديو من المشترين القيام بها الآن.
أين يتناسب جهاز التوجيه، وأين لا يتناسب
لا يقدّم OrcaRouter خدمة Grok Imagine Video أو Kandinsky 6.0 Video، ولا يدّعي أي شيء هنا خلاف ذلك: أما Kandinsky فهو لك لتنزيله وتشغيله، ويُوصَل إلى Grok Imagine Video عبر واجهات xAI الخاصة. وكل ما يحتاجه أي خط أنابيب مبني على أي من هذين النموذجين من الموجّه هو النص المحيط بعملية التصيير — قائمة اللقطات، وتوسيع المطالبة الذي يحوّل فكرة إلى الوصف الطويل أو القصير الذي دُرّبت عليه هذه النماذج، وأعمال وضع التعليقات والنسخ، وملخصات المراجعة التي تحدد أي عملية توليد يتم الاحتفاظ بها. تعمل هذه على نقطة نهاية واحدة متوافقة مع OpenAI عبر أكثر من 200 نموذج نصي بسعر قائمة المزوّد مع هامش ربح 0%، لذا يكون أي تخفيض من المزوّد فعّالاً على المفتاح نفسه في اليوم الذي يصدر فيه، مع تحويل تلقائي عند الفشل بحيث يُعاد توجيه استدعاء فاشل في منتصف قائمة انتظار التصيير بدلاً من تعطيل الدفعة. إن التنسيق حول نموذج فيديو يمثل مشكلة توجيه حتى عندما لا يكون نموذج الفيديو نفسه قابلاً للتوجيه، وهذا هو الحال بالنسبة لكليهما اليوم.
أيّ واحد، ولأيّ غرض؟
اختر Grok Imagine Video عندما يكون العمل قائمًا على الكمّ: مقاطع للسوشيال ميديا، وتكرارات سريعة، ولقطة ستعيد توليدها ست مرات قبل أن تصل إلى الصورة الصحيحة، وموعد نهائي لا يقبل التمديد. سعرها لكل محاولة هو المنتج نفسه، وكونها الآن في منتصف الجدول لا في قمته هو الثمن الطبيعي لفئة تتحرك بهذه السرعة.
الجأ إلى Kandinsky 6.0 Video عندما يكون العمل مسار معالجة: وحدة ثابتة مدتها خمس ثوانٍ يمكنك معالجتها بالدفعات، وتمريرة من صورة إلى فيديو حيث تكون مطابقة صورة ساكنة مقدمة هي ما يهم، وكلامًا تريد أن يكون مفهومًا، وناتجًا نهائيًا تفضّل ألا تستأجره. خصّص ميزانية للتصيير، وتوقّع أن يكون بطيئًا على أي عتاد استهلاكي، وتعامل مع كل رقم جودة في هذا النص على أنه خاص بـ Sber حتى يقيّمه شخص من خارج المختبر.


ما يجعل هذه المواجهة جديرة بالمتابعة هو أيّهما قادر على استيعاب ربع سيئ. إذا تراجع Grok Imagine Video أكثر في الساحة، فالجواب هو نموذج أفضل وسعر جديد — هكذا تعمل هذه الفئة، وقد أظهرت xAI بالفعل أنها ستطلق واحدًا. إذا اتضح أن Kandinsky 6.0 Video في منتصف الجدول بعد تقييمه، فنقطة التحقق لا تزال موجودة، ولا تزال تعمل، ولا يزال بالإمكان ضبطها ضبطًا دقيقًا؛ ولا يتغير أي شيء في الترخيص مع الرقم. هذان نوعان مختلفان من المتانة، وواحد فقط منهما يقيسه Elo.

