
Qwen3.8-Omni-Flash مقابل Gemini Omni 1.1 Flash: أحدهما يشاهد الفيديو، والآخر يصنعه
- OrcaجديدOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 لكل مليون رمز
- orcaجديدOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 لكل مليون رمز
- deepseekجديدDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- openaiOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- googleGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245الذكاء76البرمجة
- anthropicAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 لكل مليون رمز
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236الذكاء69البرمجة
- grokSpaceXAI: Grok 4.62026-08-1244الذكاء77البرمجة
- metaMeta: Muse Spark 1.22026-08-0540الذكاء72البرمجة
- qwenQwen: Qwen3.8 Max2026-08-0345الذكاء76البرمجة
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134الذكاء69البرمجة
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 لكل مليون رمز
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
إجابة مختصرة: هذان ليسا بديلين أحدهما عن الآخر، ولا تصبح المقارنة ذات معنى إلا حين تتوقف عن التعامل مع "omni" كفئة قائمة بذاتها.Qwen3.8-Omni-Flash، الذي أتاحه المزوّد لعملاء واجهة البرمجة (API) في 18 سبتمبر 2026، يستقبل النص والصورة والصوت والفيديو ويُعيد نصًا — إنه نموذج لقراءة ساعة كاملة من اجتماع أو من لقطات مصوّرة وإخبارك بما جرى. Gemini Omni 1.1 Flash، الذي طرحه المزوّد في 27 أغسطس 2026، يستقبل نصًا أو صورة كطلب ويُعيد فيديو مع صوت متزامن — إنه نموذج لصناعة اللقطات. أحدهما يستهلك الوسائط والآخر ينتجها. وإذا كان خط المعالجة لديك يحتاج كليهما، فأنت تحتاج كليهما، والسؤال الصادق ليس أيّهما يفوز، بل أيّهما ينقصك فعلاً.
لا يعدّ أيٌّ من النموذجين مفتوح الأوزان، ولا يمكن توجيه أيٍّ منهما عبر OrcaRouter، وكلاهما مسعَّر على محاور لا يمكن تحويل بعضها إلى بعض — التوكنات من جهة، وثواني الفيديو المولَّد من جهة أخرى. أما حيث يتداخلان فعلًا فهو أضيق مما توحي به صياغة «omni مقابل omni»، ويستحق هذا التداخل أن يُحدَّد بدقة قبل حسابات السعر، لأن حسابات السعر هي الموضع الذي يُقارَن فيه بينهما على نحو خاطئ في أغلب الأحيان.
الخطأ الفئوي الجدير بالتوضيح أولًا
تقيس مواد إطلاق AlibabaQwen3.8-Omni-FlashمقابلGemini 3.8 Flash، وقد اختزل قدر كبير من التغطية التي تلت ذلك في عبارة "يتفوق على Gemini". ذلك نموذج Google مختلف عن Gemini Omni 1.1 Flash، وهما ليسا نقطتي مرجع قابلتين للتبادل: Gemini 3.8 Flash هو النموذج متعدد الوسائط للأغراض العامة، وGemini Omni 1.1 Flash هو نموذج توليد الفيديو بقائمة أسعار منفصلة وواجهة API منفصلة. كل رقم من أرقام Qwen مقابل Gemini المتداولة منذ الإطلاق — WildClawBench-MM 71.0 مقابل 58.9، وSpotSoundBench 67.2 مقابل 39.7، وAgenticVBench 36.8 مقابل 45.0 — هو مقابل Gemini 3.8 Flash، وليس مقابل نموذج Omni للفيديو، ولا شيء منها مستقل في أي حال. إذا وصلت إلى هنا وأنت تحمل لوحة نتائج تضع النموذجين المذكورين في هذا المقال على المحور نفسه، فمن شبه المؤكد أن النموذج الخاطئ من Google هو الموجود في العمود الأيمن.
ما الذي يفعله كل واحد منها فعليًا
• ما الذي يستقبله — يقبل Qwen3.8-Omni-Flash النص والصورة والصوت والفيديو، بما في ذلك الصوت المجسم والصوت المكاني رباعي القنوات؛ ويقبل Gemini Omni 1.1 Flash مطالبات نصية وصورية، بالإضافة إلى ما يصل إلى ثلاث ثوانٍ من الفيديو المرجعي.
• ما الذي يعيده — لا يعيد Qwen3.8-Omni-Flash سوى النص؛ أما Gemini Omni 1.1 Flash فيعيد فيديو مع صوت متزامن أصلاً، في مشاهد قابلة للتمديد حتى 40 ثانية بزيادات قدرها عشر ثوانٍ.
• سطح التحكم — تتيح Qwen3.8-Omni-Flash السياق وأخذ العينات ووضعًا وكيليًا يقرر بنفسه ما ينظر إليه؛ وتتيح Gemini Omni 1.1 Flash التحكم بالإطار الأول والإطار الأخير، واسترجاعًا لمدة عشر ثوانٍ للاستمرارية، وطبقة مسودة بدقة 360p تصفها Google بأنها بنحو ثلث التكلفة وأسرع بنحو 60%.
• الدقة والتشطيب — ليس لـ Qwen3.8-Omni-Flash دقة إخراج لأنه لا ينتج أي وسائط؛ أما Gemini Omni 1.1 Flash فيُخرج بدقة 720p و1080p و4K.
• السياق والمدة — يحمل Qwen3.8-Omni-Flash مليون رمز وما يصل إلى ساعة من الصوت والفيديو المتواصلين في استدعاء واحد؛ أما Gemini Omni 1.1 Flash فيحدّه المقطع الذي يولّده، وليس نافذة الإدخال.
• كيف تدفع — يتم احتساب Qwen3.8-Omni-Flash لكل توكن: $0.15 لكل مليون إدخال، $0.016 مخزّن مؤقتًا، $0.47 إخراج على القائمة الدولية؛ يتم فوترة Gemini Omni 1.1 Flash لكل ثانية من الفيديو المُنشأ، مع السعر المعلن من Google عند $0.10 لكل ثانية لدقة 720p.
• الانفتاح — مُغلق من الجانبين. لا تتوفر أوزان لأي من النموذجين، ولا يتوفر أيٌّ منهما للتوجيه عبر واجهة API الخاصة بنا اليوم.

التداخل هو فهم الفيديو، وهو غير متماثل.
المكان الوحيد الذي يمكن للمشتري أن يضع فيه هذين الاثنين جنبًا إلى جنب بشكل معقول هو مسار معالجة يجب أن يفهم اللقطات وينتجها في الوقت نفسه — مثل مساعد تحرير يقرأ تسجيلًا طويلًا، ويعثر على اللحظات التي تستحق الإبقاء عليها، ويولّد نسخة مقطوعة. وفي جانب الفهم، Qwen3.8-Omni-Flashمصمَّم لهذا تحديدًا: ساعة من الصوت والفيديو المتواصلين في كل استدعاء، وفصل المتحدثين، ووضع وكيلي يرفع الدقة في OmniVideoBench التابع للبائع من 63.4 إلى 67.8 مع خفض الرموز في كل استعلام من 145,736 إلى 79,117. وفي جانب الإنتاج، Gemini Omni 1.1 Flashهو النموذج القادر على توليد المقطع الناتج مع صوت متزامن، بينما لا يستطيع نموذج Qwen إنتاج إطار فيديو واحد على الإطلاق.
اللا تماثل يسير في الاتجاه المعاكس أيضًا، ومن الأسهل إغفاله. إن قبضة نموذج توليد الفيديو على الفهم أداتية — فهو يحتاج إلى قدر كافٍ من المشهد للحفاظ على اتساق اللقطة عبر تمديد مدته عشر ثوانٍ، وهو مطلب مختلف عن الإجابة عن سؤال حول ما قيل في الساعة الثالثة من اجتماع. سجل نموذج Google أطول في جودة التوليد وأقصر في التحليل الطويل؛ ونموذج علي بابا لديه العكس. إذا كانت مهمتك هي "العثور على الدقائق الثلاث المهمة في هذا التسجيل"، فإن نموذج التوليد ليس الأداة. وإذا كانت مهمتك هي "إنتاج مقطع مدته ثلاثون ثانية يطابق هذا الموجز"، فإن نموذج الفهم ليس الأداة أيضًا.
لماذا تستمر مقارنة الأسعار في الخطأ
معدل لكل ثانية ومعدل لكل رمز لا يمكن التحويل بينهما، ومحاولة التحويل بينهما تنتج الخطأين اللذين يسيطران على هذه المقارنة. الأول هو مقارنة مقطع مُولَّد كامل بمعدل إدخال لكل رمز واستنتاج أن نموذج الفيديو أغلى بمئات المرات — وهو صحيح ولا معنى له، لأنهما لا يبيعان الشيء نفسه. الثاني هو مقارنة أسعار الإدخال فقط وإغفال أن خصم Alibaba الصوتي بنسبة 98% ينطبق على ساعات الصوت المُدخلة، بينما ينطبق معدل Google على ثواني الفيديو المُخرجة، لذا فإن "الخصمين" ليسا حتى على نفس الجانب من العداد.
ما يمكن قوله بصدق هو هذا. وفق منهجية علي بابا نفسها — عيّنة مدتها دقيقتان مضروبة في ثلاثين، فيديو بدقة 720p وبمعدل إطار واحد في الثانية — فإن ساعة من المدخلات الصوتية والمرئية المجمّعة إلى Qwen3.8-Omni-Flash يُسعَّر بنحو 0.20 دولار، انخفاضًا من 3.27 دولار مقارنةً بالجيل السابق. توليد أربعين ثانية من فيديو 720p باستخدام Gemini Omni 1.1 Flash بتكلفة 0.10 دولار للثانية المنشورة من جوجل يكلّف 4.00 دولارات، وإنتاج الأربعين ثانية نفسها بدقة 360p يبلغ نحو 1.20 دولار وفق تقدير جوجل القائم على ثلث التكلفة. مجموعتا الأرقام مُبلَّغ عنهما من البائعين، ولم يُعَد إنتاج أيٍّ منهما بشكل مستقل. الاستنتاج المفيد ليس أي الرقمين أصغر، بل أن تحليل ساعة من اللقطات وتوليد أربعين ثانية منها يقعان في المرتبة نفسها من حيث الحجم — وهو السبب الحقيقي في أن خط إنتاج يقوم بالأمرين يحتاج إلى نموذج تكلفة، لا إلى فائز.
وهذه أيضًا هي الحجة للإبقاء على الاثنين على مفتاح واحد بدلًا من عقدين. لا يمكن توجيه أي من نموذجَي omni عبر OrcaRouter اليوم: Qwen3.8-Omni-Flash يعمل فقط على منصات Alibaba الخاصة، ولم تفتح Google واجهة Omni video API للتوجيه من أطراف ثالثة، لذا لا نستضيف أيًا منهما ولن ندّعي غير ذلك. وما هو متاح فعليًا في كتالوجنا هو النموذج الشقيق لكل عائلة — Qwen3.8-Flash وGemini 3.8 Flash — وكلاهما قابل للاستدعاء اليوم عبر نقطة نهاية واحدة بسعر القائمة لدى المزوّد بهامش ربح 0%، وهذا ما يجعل إجراء اختبار A/B مقابل أرقام أي من المورّدين مسألة تغيير في الإعدادات لا تكاملًا ثانيًا.

أين يتفوق كل واحد، بعبارة واضحة
Qwen3.8-Omni-Flash يتفوق في أي شيء يُقاس بساعات الإدخال: نسخ الاجتماعات وتمييز المتحدثين، وتلخيص التسجيلات الطويلة، والاستخدام الوكيلي للأدوات المعتمِد بكثافة على الصوت، والتكلفة لكل ساعة من الوسائط المعالَجة. نتائجه الصوتية المُبلَّغ عنها من المورّد قوية، ونقطة ضعفه تكمن حيث لم يكن النموذج موجَّهًا إليه أصلًا — لوحات الاستدلال المكثفة، حيث وضعته أولى عمليات التشغيل التي أجرتها أطراف ثالثة في المئين الثامن والعشرين في الاستدلال مع رقم سرعة في المئين الحادي والعشرين، على عينة صغيرة بما يكفي لأن تُعامَل الأرقام كدعوة للاختبار لا كحكم نهائي.
Gemini Omni 1.1 Flash يتفوق في المخرجات: توليد اللقطات مع صوت متزامن، والاستمرارية عبر المشاهد الممتدة، والتحكم على مستوى الإطار، ولمسة 4K النهائية التي قد تتطلبها خط إنتاج التسليم ببساطة. ميزته ليست نتيجة اختبار قياسي — بل إن النموذج الآخر لا يستطيع أداء المهمة على الإطلاق. وأما موطن ضعفه فهو أي شيء يتطلب الاحتفاظ بساعة كاملة من السياق، لأنه غير مصمم لذلك.
القرار، والشيء الذي يجب مراقبته
إذا كنت تختار بينهما، فالسؤال هو أي نصف من خط المعالجة غير مخدوم. الفريق الذي يولّد الفيديو بالفعل ويحتاج إلى فهم التسجيلات الطويلة ينبغي أن يختبر Qwen3.8-Omni-Flash على الصوت الخاص به هذا الأسبوع؛ والفريق الذي يحلل الوسائط ويحتاج إلى إنتاجها ينبغي أن يختبر Gemini Omni 1.1 Flash. الفريق الذي يحتاج إلى كليهما يتعامل مع مورّدين اثنين، ونموذجَي فوترة، وتكامُلين اثنين، وهي الحالة التي تتوقف فيها طبقة توجيه واحدة عن كونها وسيلة راحة وتبدأ في أن تكون الشيء الذي يحافظ على وضوح نموذج التكلفة.
هناك أمران قد يغيّران هذا التقييم. تقييم مستقل لـ Qwen3.8-Omni-Flash سيستبدل كل رقم من أرقام المورّد أعلاه برقم مماثل — لا يوجد أي منها حتى الآن، وغيابه هو أكبر فجوة منفردة في هذه المقارنة. كما أن نشر سعر لمخرجات 1080p و4K من Google سيجعل الحسابات الخاصة بالفئة العليا قابلة للتحقق؛ فاليوم لا تنتشر تلك الأرقام إلا كتقديرات سوقية لا كقائمة أسعار خاصة بـ Google.

ملاحظة ختامية حول التأطير. لم يعد "Omni" يعني شيئًا دقيقًا — فهو الآن يغطي نموذجًا يقرأ ساعة من تسجيلات الاجتماعات الصوتية، ونموذجًا يُنتج مقطعًا مدته أربعون ثانية مع صوت، والتعامل مع الكلمة كفئة هو ما يؤدي بالمشترين إلى مقارنة سعر لكل رمز بسعر لكل ثانية واستخلاص استنتاج من ذلك. النموذجان مكمّلان لبعضهما بتداخل ضيق، والموقف الصحيح تجاه كليهما، بعد خمسة أيام وأربعة أسابيع من إصدار كل منهما على التوالي، هو نفسه: قِسْهما على موادك الخاصة، وأبقِ مسارًا ثانيًا مفتوحًا.
مقارنات في هذه المقالة2
مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا
