
Qwen3.8-Omni-Flash بعد خمسة أيام: باب واحد، بلا أوزان، وأول النتائج التي ليست من Alibaba
- OrcaجديدOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 لكل مليون رمز
- orcaجديدOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 لكل مليون رمز
- deepseekجديدDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- openaiOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- googleGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245الذكاء76البرمجة
- anthropicAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 لكل مليون رمز
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236الذكاء69البرمجة
- grokSpaceXAI: Grok 4.62026-08-1244الذكاء77البرمجة
- metaMeta: Muse Spark 1.22026-08-0540الذكاء72البرمجة
- qwenQwen: Qwen3.8 Max2026-08-0345الذكاء76البرمجة
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134الذكاء69البرمجة
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 لكل مليون رمز
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
بعد خمسة أيام من فتح المورّد Qwen3.8-Omni-Flash لعملاء API، لا يزال النموذج لديه منزل واحد فقط. يعمل على منصة Qianwen الخاصة بالمورّد وعلى خدمته السحابية Bailian؛ الإدراجات من طرف ثالث التي ظهرت منذ الإطلاق هي وكلاء أمام نفس نقاط النهاية هذه، وليس مكانًا ثانيًا يعيش فيه النموذج. لم يتم إصدار أي أوزان. أرقام يوم الإطلاق — خفض بنسبة 98% في تكلفة ساعة من الصوت، ومكسب متوسط بنسبة 26% على Qwen3.5-Omni-Plus، ومليون رمز من السياق، ومخرجات نصية فقط — تبقى ملكًا للمورّد وغير معاد إنتاجها. ما تغير فعليًا في خمسة أيام ليس النموذج بل الأرضية من حوله: ظهرت طبقة رقيقة من درجات طرف ثالث، ووصل دعم الأطر في اليوم صفر، والمقارنة التي يسعى إليها الجميع هي ضد Gemini 3.8 Flash بدلاً من Qwen3.8-Flash الذي بُني هذا النموذج إلى جانبه. كل من هذه الأمور يستحق نظرة أقرب مما أعطته تغطية الإطلاق.
الباب باب جيد، وهو الوحيد
لقد اتّسع التوفّر من دون أن يصبح متعدّدًا. يستجيب النموذج لطلب على غرار OpenAI من دون تغيير، ما يعني أن شيفرة العميل الموجودة تعمل في الغالب؛ لكن الشيء الذي يتعطّل هو نقطة النهاية، لأن المضيف الدولي ومضيف البر الرئيسي خدمتان منفصلتان بفوترة منفصلة. الشيفرة الموجّهة إلى الإعداد الافتراضي إما أن تفشل وإما أن تُفوتر بعملة خاطئة، وقصة السعر لكل ساعة لا تصح إلا على الجانب الدولي. لقد قدّمت مكتبات العميل مفتوحة المصدر دعمًا للنموذج منذ اليوم الأول، وهو أمر مفيد حقًا وليس أيضًا مزوّدًا ثانيًا: فالمكتبة التي تتخاطب مع Bailian هي غلاف تسهيلي حول المصدر الواحد نفسه للتوريد.
هذا هو الخطر الهيكلي الذي يجدر تسميته. النموذج أحادي المصدر لا يملك مسارًا بديلًا عند الفشل. إذا فرضت نقطة النهاية حدًا على معدل الطلبات، أو تدهور أداؤها، أو أظلمت منطقة بأكملها، فلا يوجد مكان تلجأ إليه، ولا يغيّر ذلك أي قدر من الدعم في مكتبة العميل. وهو أيضًا سبب تصريحنا بموقفنا بوضوح بدلًا من التلميح بخلافه: Qwen3.8-Omni-Flash ليس في كتالوجنا. نحن لا نستضيفه، وأي قارئ يسجّل متوقعًا توجيهه سيكون قد ضُلّل. أما ما يمكن توجيهه فهو بقية العائلة — Qwen3.8-Flash وQwen3.8-Max كلاهما متاحان على واجهتنا البرمجية — وتمرّر OrcaRouter سعر قائمة المزوّد كما هو دون أي هامش ربح (0%)، لذا عندما يتغيّر تسعير النموذج الشامل (omni) لدى علي بابا، أو في اليوم الذي يصبح فيه النموذج الشامل متاحًا للتوجيه، يصل التغيير إلى العملاء في اليوم نفسه بدلًا من موعد تجديد العقد التالي.

أولى النتائج التي لا تعود إلى Alibaba هزيلة، وهي غير مُواتية.
لا يوجد شيء على Artificial Analysis لهذا النموذج، وهذا الغياب هو العنوان الصادق بعد خمسة أيام: فلوحات الصدارة التي يستشهد بها الجميع للنماذج المجاورة ليس لديها بعد صف خاص بنموذج omni. وقد ملأت هذه الفجوة شيء آخر. بدأت منصة تقييم تابعة لطرف ثالث بنشر اختبارات على النموذج، وملخصها يستحق القراءة تحديدًا بسبب كمية ما لا يقوله. فهي تُبلغ عن تصنيف البريد الإلكتروني بدقة 99.0% (المئين 86)، والأخلاقيات بنسبة 95.0% (المئين 23)، والاستدلال بنسبة 56.0%، وهو ما تضعه في المئين 28 وتصفه بأنه ضعف ملحوظ؛ أما السرعة فتحل في المئين 21، والتكلفة في المئين 58، مع معدل نجاح إجمالي يبلغ 89%.
تعامل مع هذه النقاط بحذر شديد، وليس فقط لأن العينة صغيرة. فالصفحة نفسها تؤرخ إطلاق النموذج في 20 سبتمبر، أي بعد يومين من إطلاق Alibaba له، ولا تقدّم أي تواريخ تشغيل لأي من النتائج، وتعرض جدول معايير فارغًا تحت ملخص يصف أرقامًا لا يحتويها الجدول. هذا هو نمط أداة اختبار مبكرة وخفيفة الإشراف، لا تقييم محسوب، والقراءة الصادقة هي أن هذه أول نقاط بيانات لا تأتي من المورّد، وليست أول نقاط موثوقة. إنها سبب لاختبار النموذج بنفسك، لا سبب للاستنتاج أي شيء. غير أن الاتجاه يتسق مع ما توحي به مواد المورّد نفسه عبر الإغفال: فهذا نموذج إدراك ووسائط طويلة، وليست لوحات الاستدلال الثقيلة هي ما وُجّه إليه.
هناك أيضًا فخ في نتائج البحث سيوقع الناس خلال الأسابيع القليلة المقبلة. Qwen 3.8، النموذج النصي، يحمل مؤشر الذكاء من Artificial Analysis في نطاق الأربعينيات، وقد اقتُبس هذا الرقم في أكثر من ملخّص وكأنه يصف النموذج الشامل. لكنه ليس كذلك. إنهما نموذجان مختلفان بمهام مختلفة، ولا يملك النموذج الشامل أي مؤشر على الإطلاق حتى الآن.

لا يزال جدول المقارنة المرجعية مجرد مورّد واحد يقارن نفسه بنفسه
رقم الإطلاق — بمتوسط تحسّن يزيد على 26% عبر نحو ثلاثين تقييمًا — يُقاس بالكامل مقابل Qwen3.5-Omni-Plus. هذا يخبرك أن العائلة تحرّكت. لكنه لا يخبرك أين يقف النموذج بالمقارنة مع أي شيء قد تكون تدفع مقابله بالفعل، كما أن المقارنات الانتقائية التي انتشرت إلى جانبه لا تسدّ الفجوة أيضًا. الصورة التي أبلغ عنها المورّد مقابل Gemini 3.8 Flash هي فوز حقيقي في لوحات الصوت وخسارة في تلك التي تقيس عمل الفيديو الوكيلي: WildClawBench-MM 71.0 مقابل 58.9 وSpotSoundBench 67.2 مقابل 39.7 من جهة، وAgenticVBench 36.8 مقابل 45.0 وOmniGAIA 74.0 مقابل 78.6 من الجهة الأخرى. ولغة الملخص الخاصة بعلي بابا — أداء الصوت والفيديو "يقترب" من Gemini، بينما أداء الصوت الإجمالي يتجاوزه — أكثر حذرًا من العناوين التي أنتجتها، والنسخة الحذرة هي النسخة الدقيقة.
• السياق — 1M توكن، مع حدٍّ أقصى للمدخلات يبلغ نحو 991K (حوالي 983K في وضع التفكير) و131K كحدٍّ أقصى للمخرجات.
• الوسائط — نص وصورة وصوت وفيديو كمدخلات؛ نص كمخرجات فقط. لا يوجد توليد كلام في النموذج الأساسي.
• المدة — حتى ساعة واحدة من الصوت أو الصوت والفيديو المتواصل لكل مكالمة، وهو ما يجعل العمل على الاجتماعات والوسائط الطويلة ممكنًا دون تقطيع.
• تغطية اللغات — التعرّف على 74 لغة إضافةً إلى 39 لهجة صينية في مواد الإطلاق، مع أرقام أوسع (113 لغة ولهجة) واردة في مواضع أخرى للإدخال الصوتي.
• تفصيل المدخلات — يُقبل الصوت المكاني المجسَّم ورباعي القنوات، مع وصف نسخة Realtime بأنها أول نموذج متعدد الوسائط كليًّا قادر على تحديد هدف ما عبر صوته.
• السعر — 0.15 دولار لكل مليون رمز إدخال، و0.016 دولار للمخزّنة مؤقتًا، و0.47 دولار للإخراج على الجانب الدولي، وقائمة أسعار منفصلة للبر الرئيسي غير قابلة للمقارنة.
الـ98% حقيقية، وهي ليست فاتورتك
وفق منهجية Alibaba نفسها — عيّنة مدتها دقيقتان مضروبة في ثلاثين، مع أخذ عينات الفيديو بدقة 720p وبمعدل إطار واحد في الثانية — تنخفض ساعة من الإدخال الصوتي من 0.28 دولار إلى أقل من 0.01 دولار، وتنخفض ساعة من الإدخال الصوتي والمرئي معًا من 3.27 دولار إلى 0.20 دولار. هذه تخفيضات كبيرة ومحددة ومُبلَّغ عنها من المورّد، وهي تخفيضات على بند واحد. الحساب المهم هو ما نصيب هذا البند من عبء العمل لديك. إن خط أنابيب يستهلك معظم رموزه في الإخراج، أو في السياق المخزّن مؤقتًا، أو في إطارات فيديو تُؤخذ بعينات أكثف من إطار واحد في الثانية، سيرى نسبة تحرك أصغر بكثير على الفاتورة مما تَعِد به العناوين الرئيسية، والعنوان الرئيسي يتعلق بالإدخال الصوتي، لا بالمجموع. أضف الإخراج النصي فقط، وتتسع الفجوة مرة أخرى: أي شيء يجب أن يرد صوتيًا يحتاج إلى نموذج ثانٍ، ويُفوتَر ذلك النموذج بشكل منفصل.
هذا هو الجزء من الصورة حيث يثبت التوجيه جدواه. قيمة الموجّه المارِّر ليست في الخصم — بل في أن قائمة أسعار المورّد نفسه هي ما تدفعه، وأنه يمكن توزيع عبء العمل عبر عدة نماذج بحيث يصبح النموذج أحادي المصدر مكوّنًا لا تبعية. أما النموذج الشامل الذي يكون الشيء الوحيد الذي يمكنك استدعاؤه فهو نقطة فشل واحدة على مستوى التوافر والتسعير معًا.

ما الذي قد تخبرك به خمسة أيام من الإنتاج فعليًا؟
ثلاثة أمور ستحسم الأسئلة المفتوحة. قياس مستقل لنتيجة تحديد المتحدثين في AliMeeting — معدل خطأ ينخفض من 88.11 إلى 3.35 وcpWER من 89.61 إلى 17.18 — سيُظهر ما إذا كان ذلك يعود إلى النموذج أم إلى تحديد المتحدثين والهندسة الأمامية الملتفّة حوله، وهو ما ينسب إليه تحليل تقني صيني واحد على الأقل معظم المكسب. اختبار مُعاد إجراؤه لتقليل الرموز في الوضع الوكيلي، حيث ارتفعت الدقة من 63.4 إلى 67.8 على OmniVideoBench بينما انخفض عدد الرموز لكل استعلام من 145,736 إلى 79,117، سيؤكد الادعاء الوحيد الأكثر فائدة في الإصدار: أن النموذج يمكن أن يصبح أفضل وأرخص في الوقت نفسه. وسطر في Artificial Analysis أو arena سيحوّل كل رقم مورّد مذكور أعلاه إلى شيء قابل للمقارنة، وهو الشرط المسبق لأن يُختار النموذج بدلاً من أن يُجرَّب.
حتى ذلك الحين، فإن الموقف المنطقي هو ذاك الذي ينطبق على أي نموذج عمره خمسة أيام وله مضيف واحد ولا يوجد تقييم مستقل: يستحق القياس على الصوت والفيديو الخاصين بك، لكنه لا يستحق أن يكون المسار الوحيد عبر خط أنابيبك. إذا كان عبء عملك هو اجتماعات طويلة أو تحليل وسائط بالصينية أو الإنجليزية، وكانت تكاليفك يغلب عليها ساعات الإدخال بدلًا من رموز الإخراج، فإن الجدوى الاقتصادية هنا قوية بما يكفي لتبرير اختبار هذا الأسبوع. أما إذا كان عبء عملك يحتاج إلى إعادة الكلام منطوقًا، أو يحتاج إلى بديل احتياطي عندما يتراجع مزوّد ما، فإن النموذج كما هو عليه اليوم لا يمكن أن يكون الجواب الكامل — ولا يغيّر ذلك أي قدر من الدعم المبكر من الأطر.
مقارنات في هذه المقالة2
مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا
