
Qwen3.8-Omni-Flash وصل: سياق بمليون رمز، صوت أرخص بنسبة 98%، إخراج نصي فقط
- OrcaجديدOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 لكل مليون رمز
- orcaجديدOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 لكل مليون رمز
- deepseekجديدDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- openaiجديدOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- googleGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245الذكاء76البرمجة
- anthropicAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 لكل مليون رمز
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236الذكاء69البرمجة
- grokSpaceXAI: Grok 4.62026-08-1244الذكاء77البرمجة
- metaMeta: Muse Spark 1.22026-08-0540الذكاء72البرمجة
- qwenQwen: Qwen3.8 Max2026-08-0345الذكاء76البرمجة
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135الذكاء69البرمجة
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 لكل مليون رمز
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
أتاح الإطلاق Qwen3.8-Omni-Flash لعملاء API اليوم، 18 سبتمبر 2026، والرقم الذي تصدّر به هو فاتورة لا نتيجة. لكل ساعة من مدخلات الصوت، تقول Qwen إن النموذج الجديد يكلّف أقل بنسبة 98% من سابقه Qwen3.5-Omni-Plus؛ ولكل ساعة من الصوت والفيديو معًا، أقل بنسبة 93%. كل ما عدا ذلك في الإعلان يتبع هذا التأطير. Qwen3.8-Omni-Flash هو نموذج شامل متعدد الوسائط أصلي — نص، وصورة، وصوت، وفيديو كمدخلات، وسياق من مليون توكن، وما يصل إلى ساعة كاملة من الصوت والفيديو المتواصلين داخل استدعاء واحد — وتبيعه Alibaba لا كواصف أفضل للوسائط بل كأول نموذج Qwen مبني لكي يتصرف بناءً عليه. الشعار هو "حواس شاملة. تنفيذ وكيلي." والمأخذ، المذكور بوضوح في المواد نفسها، هو أن النموذج لا يجيب إلا بالنص: يسمع ويرى، لكنه لا يتحدث.
لم يُعَد إنتاج أي مما يلي بشكل مستقل. عمر النموذج ساعات، ولا يوجد بعد أي تقييم له من طرف ثالث، وكل رقم من أرقام المعايير القياسية والأسعار في مواد الإطلاق هو من Alibaba نفسها. وحين يكون الرقم مُبلَّغًا به من البائع، يذكر هذا المقال ذلك في الجملة التي تتضمنه؛ وحين تأتي قراءة من ناقد لا من البائع، تُنسب إليه. الشيء الوحيد الذي هو قابل للتحقق منه بشكل مستقل اليوم — أن النموذج متاح على منصات Alibaba وليس في كتالوج أي جهة أخرى — هو الشيء الذي يبدي الإطلاق أقل اهتمام بالحديث عنه.
ما الذي تم شحنه فعليًا
ورقة المواصفات نظيفة بشكل غير معتاد لإطلاق نموذج شامل للوسائط، وهذا بحد ذاته هو القصة: الجيل السابق من النماذج الشاملة للوسائط في هذه العائلة كان يُجمَّع من مُرمِّزات إدراك منفصلة تُركَّب على نموذج لغوي كبير نصي، وهذا النموذج مبني مباشرة على Qwen3.8-Flash خط المعمارية، مع معالجة الوسائط بشكل أصلي بدل تطعيمها.
• المدخلات — نص وصورة وصوت وفيديو، مع قبول الصوت المكاني الاستيريو ورباعي القنوات؛ والمخرجات نصية فقط.
• السياق — مليون توكن، مع حد أقصى للإدخال يبلغ نحو 991K (حوالي 983K في وضع التفكير)، وحد أقصى للإخراج يبلغ 131K، وميزانية استدلال تصل إلى 262K.
• المدة — حتى ساعة واحدة من الصوت أو الصوت والفيديو المستمر لكل مكالمة، وهو الرقم الذي يجعل حالات استخدام الاجتماعات ومقاطع الفيديو الطويلة ممكنة دون تقسيم.
• تغطية الكلام — التعرّف عبر 74 لغة وتوليد الكلام عبر 29 لغة في الأدوات المحيطة؛ ويذكر أحد التقارير المكتوبة بالصينية عن الإصدار 113 لغة ولهجة للإدخال الصوتي.
• الإتاحة — منصة Qianwen AI وAlibaba Cloud Model Studio (Bailian)، تحت معرّف API qwen3-8-omni-flash. لا يتم إصدار الأوزان. تُوصف نسخة Realtime بأنها أول نموذج متعدد الوسائط كليًا مع تحديد موقع مصدر الصوت.

ادعاء الـ98% هو ادعاء يتعلق بالتكلفة، والحسابات الكامنة وراءه تستحق الاطلاع
خفض بنسبة 98% في تكلفة ساعة من الصوت هو رقم أكبر بكثير من خفض بنسبة 98% في سعر التوكن، والفجوة بين هذين الأمرين هي حيث يؤدي الإعلان عمله. يُشتق الرقم لكل ساعة عبر تسعير عيّنة مدتها دقيقتان وضربها في ثلاثين، مع أخذ عينات الفيديو عند 720p وبمعدل إطار واحد في الثانية. هذه طريقة مشروعة لتسعير عبء عمل إنتاجي، وهي أيضًا وصف لما يُطلب من النموذج أن ينظر إليه: إطار واحد في الثانية يكفي لمعرفة ما قيل وما حدث تقريبًا على الشاشة، وهو أبعد ما يكون عن الكفاية لفحص العمليات على مستوى الإطار، أو الحكم على جودة المونتاج، أو التقاط عيب في إطار واحد. هناك تغييران يُضربان معًا — انخفاض حقيقي في سعر الوحدة، وسياسة أخذ عينات أكثر عدوانية بكثير — وأولهما فقط هو تحسين للنموذج.
أسعار الوحدة نفسها محددة. التسعير الدولي معلن عند 0.15 دولار لكل مليون توكن إدخال، 0.016 دولار لكل مليون توكن إدخال مخزّن مؤقتًا، و0.47 دولار لكل مليون توكن إخراج. تسعير Bailian المحلي معلن عند 0.8 يوان لكل مليون للمدخلات متعددة الوسائط، انخفاضًا من نحو 18 يوانًا. لاحظ أن نظامي الفوترة الدولي والخاص بالبر الرئيسي منفصلان، والأرقام غير قابلة للتبادل؛ أي شخص يقارن بينها مباشرة سيحصل على إجابة خاطئة.
هذا هو الجزء من الإصدار الذي يكون فيه التوجيه أكثر أهمية من المعتاد. يمرر OrcaRouter سعر قائمة المزوّد كما هو عند هامش ربح 0%، لذا يصل خفض سعر من أحد المورّدين من هذا النوع إلى عملائنا في يوم تطبيقه بدلًا من موعد تجديد العقد التالي. توجد بالفعل مقارنة واحدة قابلة للتحقق بحق في كتالوجنا الخاص: Qwen3.8-Flash، النموذج متعدد الوسائط الذي بُني هذا النموذج بالتوازي معه، قابل للتوجيه اليوم بسعر 0.15 دولار لكل مليون توكن إدخال و0.47 دولار لكل مليون توكن إخراج — وهو نفس سعر القائمة الذي تعلنه Alibaba للنموذج الشامل الجديد — وقد حمل 2.47 مليار توكن من حركة المرور عبر API لدينا خلال الأيام السبعة التي سبقت كتابة هذا، وهو مقياس عادل لمدى الإقبال الذي تحظى به هذه الفئة بالفعل. النموذج الشامل نفسه ليس في كتالوجنا بعد، وإلى أن يصبح كذلك، فإنه يعمل على منصات Alibaba الخاصة بها ولا مكان آخر. لن نتظاهر بخلاف ذلك.
كل معيار في الإطلاق يقارن شيئًا واحدًا
العنوان الرئيسي هو تحسن متوسط قدره أكثر من 26% عبر نحو 30 تقييمًا — وكل واحد من هذه التقييمات هو مقابل Qwen3.5-Omni-Plus. هذا هو خط الأساس الصحيح لإطلاق، وهو خط أساس ضيق: فهو يخبرك أن العائلة تحركت، وليس أين استقرت مقارنة بأي شيء قد تكون تدفع مقابله بالفعل.
الأرقام الفردية، وجميعها مُبلَّغ عنها من الشركة المُصنِّعة: WildClawBench-MM 71.0، بزيادة 36.5 نقطة، وهو أكبر تحرّك منفرد في المجموعة؛ UniClawBench 69.6؛ AgenticVBench بزيادة 22.3 نقطة ليصل إلى 36.8؛ LongAudioSpan 82.7، بزيادة 8.3؛ OmniVideoBench 63.4، بزيادة 9.6؛ OmniCap-IF 28.2. وأكثر زوج مثير للانتباه هو تمييز المتحدثين على AliMeeting، حيث ينخفض معدل الخطأ من 88.11 إلى 3.35 و cpWER من 89.61 إلى 17.18 — قفزة كبيرة بما يكفي لتستحق التدقيق لا التصفيق. وتحليل تقني صيني لإطلاق النموذج يذهب إلى هذا تحديدًا، عازيًا التحسّن بدرجة كبيرة إلى هندسة الواجهة الأمامية وتمييز المتحدثين الملفوفة حول النموذج لا إلى استدلال النموذج نفسه، ومحذّرًا من أن النظام يبدو متخصصًا في السمع مع ضعف نسبي في الاستدلال العميق على الفيديو. هذه قراءة ناقد لا تكرار مُقاس، لكن حجم الفارق هو سبب إبقائه في الاعتبار.

الرقم الآخر الجدير بالاحتفاظ به ليس نتيجة على الإطلاق. فيما تسميه علي بابا وضع Agentic Understanding، يقرر النموذج بنفسه ما ينظر إليه ويستمع إليه بدلاً من معالجة كل إطار، ويجمع الأدلة في جولات من الخشن إلى الدقيق. على OmniVideoBench، يرفع ذلك الوضع الدقة من 63.4 إلى 67.8 بينما يقلل الرموز لكل استعلام من 145,736 إلى 79,117 — انخفاض بنسبة 45.7%. ارتفاع الدقة وانخفاض التكلفة في الوقت نفسه هو أقوى ادعاء في الإصدار، وهو الأكثر دعمًا مباشرة للطرح الوكيلي.
مقارنة Gemini أضيق مما توحي به التغطية.
تتمثل رؤية علي بابا في أن قدرة الصوت والفيديو "تقترب" من Gemini 3.8 Flash بينما يتفوق الأداء الصوتي العام عليه. وبعد تجريد الأمر من التهويم، تبدو المقارنات التي أوردها المورّد على النحو التالي. WildClawBench-MM: 71.0 مقابل 58.9. SpotSoundBench: 67.2 مقابل 39.7. MMAU: 81.8 مقابل 76.9. DailyOmni: 85.1 مقابل 84.0. هذه فروقات حقيقية في الصوت واستخدام الأدوات التي تتمحور حول الصوت. وهي أيضاً انتقائية. ففي AgenticVBench، لوحة استدلال الفيديو الخالص، ينعكس الترتيب — Gemini عند 45.0 مقابل 36.8 لـ Qwen — كما يعترف تقرير علي بابا نفسه بأن Gemini لا يزال متقدماً في عدة اختبارات لفهم الفيديو. ويمكن تلخيص الأمر بصورة معقولة بأن Qwen قد تفوّق في النصف الصوتي من القدرات الشاملة ولا يزال متأخراً في النصف المرئي، وهو ادعاء مختلف عن ذلك الذي حملته العناوين الرئيسية.
"أول نموذج شامل متعدد الوسائط من Qwen" يحتاج إلى مُقيِّد
الطرح القائل بأن Qwen3.8-Omni-Flash هو أول نموذج متعدد الوسائط من Qwen انتشر على نطاق واسع اليوم ويجدر بنا أن نكون دقيقين، لأن العائلة لديها إدخال سابق له ادعاء مشروع بهذا اللقب. Qwen2.5-Omni، وهو نموذج مفتوح الأوزان بحجم 7B صدر في مارس 2025 بمعمارية Thinker-Talker، استقبل أيضًا النص والصورة والصوت والفيديو كمدخلات — وأنتج الكلام بالإضافة إلى النص. ما هو الأول حقًا هنا هو أصالة التعددية الشاملة: نموذج واحد مبني على Qwen3.8-Flash كأساس بدلاً من نموذج لغوي نصي مع ملحقات إدراكية، بالإضافة إلى تصميم يركز على الوكيل. كلا البيانين صحيحان؛ واحد فقط منهما هو الذي تم تكراره. إذا كنت تقيّم النموذج على افتراض أنه لم يكن هناك نموذج Qwen شامل قبل هذا الأسبوع، فسوف تسيء تسعير مسار الترقية من Qwen2.5-Omni، وهي مقارنة كتبناها بشكل منفصل.
الأدوات هي حيث يكمن فعليًا الادّعاء الوكيلي
صدر شيئان إلى جانب النموذج، وهما أهم مما توحي به بطاقة النموذج، لأنهما ما يحوّل الإدراك إلى تسليم. Qwen-MM-Plugins هي مجموعة إضافات متعددة الوسائط لمنظومات تشغيل الوكلاء، تمنح وكيلًا خارجيًا فهم الصور والصوت والفيديو والمستندات، إضافة إلى ذاكرة الفيديو الطويل وتحرير الفيديو؛ وتعلن دعمها لـ Codex وClaude Code وQwen Code وGemini CLI وعدة غيرها، وتتضمن أدوات مسمّاة من بينها Video2Note، الذي يحوّل ساعات من الفيديو إلى ملاحظات PDF مصوّرة. Qwen-Live Harness هو بيئة تشغيل مفتوحة المصدر للتفاعل الشامل متعدد الوسائط والمستمر في الوقت الفعلي، ويعمل كطبقة جدولة حيث يتحدث المستخدم مباشرة ويفوّض الأعمال الأثقل إلى وكلاء في الخلفية. وهناك تحفّظ من تغطية يوم الإطلاق: كانت صفحة Qwen-Live Harness على GitHub تُرجع خطأ 404 عندما تحققت منها Gigazine، لذا تعامل مع الأدوات على أنها مُعلَنة لا مُتحقَّق منها حتى تصبح المستودعات متاحة.
الجملة التي يدفنها الإطلاق: إنها لا تنطق
بالنسبة لنموذجٍ ولّد سلفه الكلام، فإن حقيقة أن Qwen3.8-Omni-Flash مدخلاته متعددة الوسائط ومخرجاته نصية هي السطر الأكثر أهمية في المواصفات، ويظهر ذلك في المواد إلى حد كبير كحاشية. وهذا يعني أن النموذج لا يمكن إدراجه في منتج يحوّل الكلام إلى كلام بمفرده. أي دبلجة أو وكيل صوتي أو محادثة فورية مبنية عليه تحتاج إلى مرحلة خارجية لتحويل النص إلى كلام، وبالنسبة للفيديو، إلى محرك عرض خارجي — وهذا بالتحديد هو سبب وجود مجموعة الإضافات وأداة الاختبار المباشر. النتيجة العملية هي مسار يحتوي على أجزاء متحركة أكثر من «نموذج شامل واحد»، وزمن استجابة يجب توزيعه على جميعها.
ثمة عرض أنيق للفجوة، ولما يصلح له النموذج، مدفون في الإصدار. في تجربة «نموذج يُحسّن نموذجًا»، حسّن Qwen3.8-Omni-Flash ذاتيًا التعرف على لهجة سيتشوان لدى Qwen2.5-Omni-3B، خافضًا معدل خطأ الأحرف من 25.79% إلى 15.30% خلال اثنتي عشرة ساعة وبناء 3,413 عينة تدريبية عبر أربع جولات. النموذج القادر على تشخيص وإصلاح طريقة تعامل نموذج شقيق أصغر مع اللهجات يفعل شيئًا لا تستطيعه واجهة برمجة تطبيقات النسخ الصوتي. هذا، وليس جدول التقييمات، هو أوضح حجة على ما يُفترض أن تعنيه كلمة «agentic» هنا.

ما الذي قد يغيّر قراءتنا؟
الوضع الصادق للأمور هو أن هذا إطلاق مُحدد بدقة بسرد سعري جذاب، دون أي تقييم مستقل، ومع قيد بنيوي واحد على الأقل يهوّن الإعلان من شأنه. ثلاثة أمور كفيلة بحسم الأمر. إدراج في Artificial Analysis أو LMArena سيحوّل أرقام المورّد إلى أرقام قابلة للمقارنة، ولا يوجد أي منهما بعد. واختبار من طرف ثالث لخفض الرموز بنسبة 45.7% — الادعاء بأن الدقة ترتفع بينما تنخفض التكلفة — سيؤكد النتيجة الأكثر فائدة والأقل بريقًا في الإصدار. وسيُظهر قياس مستقل لفصل المتحدثين في AliMeeting ما إذا كان الانخفاض البالغ 88 نقطة يعود إلى النموذج أم إلى البنية المحيطة به.
حتى ذلك الحين، فإن التوجه المعقول هو ذاك الذي ينطبق على أي نموذج في يومه الأول: يستحق الاختبار، ولا يستحق المراهنة عليه كمسار إنتاجي. إذا كنت تمرر بالفعل عبر OrcaRouter، فإن الخطوة العملية هي الإبقاء على عبء العمل على النماذج التي قمت بقياسها، واعتبر Qwen3.8-Omni-Flash مرشحاً لاختباره مقابلها على الصوت والفيديو الخاصين بك، بدلاً من جدول معايير أي من الموردين. إذا كانت حالة الاستخدام لديك تتعلق باجتماعات طويلة أو تحليل وسائط بالصينية والإنجليزية، فإن اقتصاديات الرموز هنا قوية بما يكفي لتبرير الاختبار الآن.
مقارنات في هذه المقالة2
مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا
