
Qwen3.8-Omni-Flash مقابل Qwen2.5-Omni: بعد 18 شهرًا، فقدت الترقية صوتها
- OrcaجديدOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 لكل مليون رمز
- orcaجديدOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 لكل مليون رمز
- deepseekجديدDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- openaiجديدOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- googleGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245الذكاء76البرمجة
- anthropicAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 لكل مليون رمز
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236الذكاء69البرمجة
- grokSpaceXAI: Grok 4.62026-08-1244الذكاء77البرمجة
- metaMeta: Muse Spark 1.22026-08-0540الذكاء72البرمجة
- qwenQwen: Qwen3.8 Max2026-08-0345الذكاء76البرمجة
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135الذكاء69البرمجة
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 لكل مليون رمز
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
إليك الحقيقة التي تجعل هذه المقارنة أكثر إثارة للاهتمام من مجرد تحديث جيلي. فالطراز الأقدم يستطيع الكلام، أما الأحدث فلا.Qwen2.5-Omni، الذي صدر في مارس 2025، كان يستقبل النص والصور والصوت والفيديو كمدخلات، ويرد بالنص أو بكلام طبيعي متدفق، ضمن نموذج واحد شامل من الطرف إلى الطرف يمكنك تنزيله.Qwen3.8-Omni-Flash، الذي صدر في 18 سبتمبر 2026، فيستقبل الوسائط الأربع نفسها عبر نافذة سياق أكبر بثلاثين ضعفًا، ويستوعب ساعة كاملة من الصوت والفيديو المتواصل حيث كان سلفه يتعامل مع ثوانٍ معدودة، ولا يعيد سوى النص. ثمانية عشر شهرًا من العمل اشترت مدخلات أوسع بكثير، وتخلّت عن قناة الإخراج. وسواء كان ذلك تقدمًا أم مقايضة، فهو يتوقف كليًا على الغرض الذي كنت تستخدم فيه الطراز القديم — والجواب ينقسم بوضوح إلى شقين.
أرقام Qwen2.5-Omni هي أرقام البائع، من مواد إصداره في مارس 2025، وقد أثبتت ثمانية عشر شهرًا من الانتشار الواسع صحتها جزئيًا. أرقام Qwen3.8-Omni-Flash هي أيضًا من علي بابا، من مواد الإطلاق المنشورة قبل ساعات من كتابة هذا، ولم يتم إعادة إنتاج أي شيء منها بشكل مستقل. وعندما يأتي ادعاء من ناقد وليس من البائع، فإنه يُنسب إلى الناقد. الحقيقة الهيكلية الوحيدة التي لا تحتاج إلى تحقق هي أيضًا الأكثر أهمية: Qwen2.5-Omni مفتوح الأوزان وقابل للتنزيل، وQwen3.8-Omni-Flash ليس كذلك.
ما كان Qwen2.5-Omni، ولماذا كان مهمًا
عند إطلاقه في 26 مارس 2025، Qwen2.5-Omni كان أول نموذج شامل متعدد الوسائط من البداية إلى النهاية في العائلة — وقد صوّره الإصدار كإجابة لمشكلة «حديقة المتخصصين»، حيث كان كل من النسخ النصي والرؤية والصوت بحاجة إلى نموذج منفصل وطبقة ربط منفصلة. تعامل نموذج 7B مع وسائط الإدخال الأربع جميعها ومع إخراج النص والكلام معاً، وادّعى تحقيق نتائج متقدمة على معيار الدمج OmniBench متقدماً على Gemini-1.5-Pro، وأفاد بدرجة جودة توليد كلام بلغت 4.51 وصفها Alibaba بأنها بمستوى بشري. واتبعت نسخة 3B البنية نفسها.
تستحق الهندسة التي جعلته يعمل أن تُسمّى، لأن النموذج الجديد لا يستخدمها. Thinker-Talkerقسّم المهمة إلى قسمين: دمج محوّل Thinker مشفّري الصوت والصورة وأنتج الدلالات والنص، بينما بثّ Talker رموز الكلام من الحالات المخفية لدى Thinker، مع مشاركة تاريخ المحادثة الكامل. شبكت تقنية RoPE متعددة الوسائط والمُحاذاة زمنيًا (TMRoPE) مواضع الفيديو والصوت بحيث بقي التدفقان متزامنين. أتاح البث القائم على الكتل للمشفّرات القيام بالإدراك بينما تعامل نموذج اللغة مع التسلسلات الطويلة، وهو ما جعل الردود المنطوقة منخفضة زمن الاستجابة ممكنة. وقد طُرح معه صوتان ثابتان: Chelsie وEthan.
كانت القيود حقيقية بالقدر نفسه. كان السياق 32,768 رمزًا. كانت الذاكرة هي القيد الحاكم أكثر بكثير من الحوسبة: فجداول علي بابا نفسها تضع استدلال BF16 مع FlashAttention-2 عند نحو 31GB من ذاكرة GPU لفيديو مدته 15 ثانية، و42GB لمدة 30 ثانية، و60GB لدقيقة كاملة. دقيقة من الفيديو، على نموذج 7B، على واحدة من أكبر وحدات GPU الفردية التي يمكن استئجارها. هذا هو الرقم الذي ينبغي إبقاؤه في الاعتبار، لأنه الرقم الذي بُني نموذج 2026 ليدمّره.
ما هو Qwen3.8-Omni-Flash
النموذج الجديد أصلي متعدد الوسائط بالكامل وليس مُجمّعًا — مبنيّ مباشرةً على Qwen3.8-Flash خط المعمارية بدلاً من أن يكون نموذجًا لغويًا نصيًا مع مُشفِّرات إدراك مُثبّتة عليه، وهو فرق هيكلي وليس مجرد تسمية جيل. يقبل النص والصورة والصوت والفيديو، بما في ذلك الصوت الاستريو والصوت المكاني رباعي القنوات، ويعيد النص عبر سياق مليون رمز مع حد أقصى للإدخال يبلغ حوالي 991 ألفًا، وحد أقصى للإخراج 131 ألفًا، وميزانية تفكير 262 ألفًا. يتعامل مع حتى ساعة واحدة من الصوت والفيديو المتواصل في كل استدعاء . يغطي التعرف على الكلام 74 لغة، بينما يتم توليد الكلام عبر 29 لغة في الأدوات المحيطة وليس بواسطة النموذج. وهو متاح على منصة Qianwen AI وAlibaba Cloud Model Studio تحت المعرف qwen3-8-omni-flash، بسعر 0.15 دولار لكل مليون رمز إدخال و0.47 دولار لكل مليون رمز إخراج، مع إدخال مخبأ بسعر 0.016 دولار.

ثمانية عشر شهرًا، بُعدًا بُعدًا
• السياق — Qwen2.5-Omni بـ 32,768 رمزًا مقابل Qwen3.8-Omni-Flash بمليون، أي زيادة بنحو ثلاثين ضعفًا.
• مدة الوسائط — ثوانٍ من الفيديو، محدودة بذاكرة وحدة معالجة الرسومات (GPU)، مقابل ساعة واحدة من الصوت والفيديو المستمر في مكالمة مستضافة واحدة.
• الإخراج — نص بالإضافة إلى كلام طبيعي متدفق على النموذج القديم؛ نص فقط على النموذج الجديد.
• النشر — Qwen2.5-Omni مفتوح الأوزان بموجب Apache-2.0، وقابل للتنزيل من Hugging Face وModelScope؛ أما Qwen3.8-Omni-Flash فهو متاح عبر API فقط دون أي إعلان عن إصدار أوزان.
• العتاد — 7 مليارات معامل تحتاج إلى ما يصل إلى ~60 غيغابايت من ذاكرة GPU مقابل دقيقة من الفيديو، في مقابل نقطة نهاية مستضافة لا تقوم بتجهيزها على الإطلاق.
• السعر — الطراز القديم يكلّفك وحدة GPU؛ أما الجديد فيكلّف 0.15 دولار لكل مليون توكن إدخال، وتزعم Alibaba أن إدخال الصوت لكل ساعة أرخص بنسبة 98% من جيل Qwen3.5-Omni-Plus الذي يحل محله.
• توليد الكلام — صوتان ثابتان في 2025، مقابل 29 لغة لتوليد الكلام في أدوات 2026، ولا شيء من ذلك ينتجه النموذج نفسه.
الصفقة التي لم يعلن عنها أحد
اقرأ صفحتَي المواصفات معًا وستتضح صورة الأشهر الثمانية عشر الماضية. أنفقت Alibaba هذه الفترة في حل الاستيعاب — كم من الوسائط يستطيع النموذج أن يستوعب، وبأي ثمن زهيد، وكم من اتخاذ القرار يستطيع أن يقوم به بنفسه. Qwen3.8-Omni-Flash انتصار على هذا المحور. فوضع «Agentic Understanding»، الذي يختار فيه النموذج ما يعاينه بدلًا من معالجة كل إطار، يقلّص عدد الرموز لكل استعلام من 145,736 إلى 79,117 مع رفع دقة OmniVideoBench من 63.4 إلى 67.8، ويفيد المورّد بأن خطأ تمييز المتحدثين في AliMeeting ينهار من 88.11 إلى 3.35.
ما لم تُعطِها الفترة الأولوية هو المخرجات. السمة الفارقة لنموذج 2025 — نموذج واحد يسمعك ويجيب بصوت مسموع، من البداية إلى النهاية، دون مُركِّب كلام منفصل — ليس لها خليفة هنا. إذا كنت قد بنيت وكيلاً صوتياً، أو خط دبلجة، أو أداة وصول على Qwen2.5-Omni's Talker، فإن نموذج 2026 ليس ترقية له؛ بل هو مكوّن سيتعين عليك إضافة مرحلة جديدة لتحويل النص إلى كلام إليه، مما يضيف زمن استجابة ومورّداً إلى خط معالجة لم يكن لديه أي منهما سابقاً. المواد الإطلاقية صادقة بشأن هذا إذا قرأت سطر النمطية عن كثب، لكنه ليس العنوان الرئيسي، وأي شخص يرحّل على افتراض أن "omni" تعني الشيء نفسه في كلا الإصدارين سيكتشف الفرق في الإنتاج.

لماذا لا يزال طراز 2025 يؤدي دورًا؟
ثلاثة أسباب، ولا شيء منها حنينٌ إلى الماضي. الأول هو الصوت، كما سبق. والثاني هو الأوزان المفتوحة: سياق بسعة 32 ألفًا وبصمة 7B سيعملان على عتاد تتحكم به أنت، دون اتصال، من دون أن تغادر أي بيانات المبنى، ومن دون عدّاد لكل رمز — وهو الخيار الوحيد إذا كان صوتك خاضعًا لقاعدة إقامة البيانات أو كانت ميزانية زمن الاستجابة لديك تمنع رحلة ذهاب وإياب. والثالث هو التكلفة عند الحجم المنخفض جدًا. وحدة معالجة الرسومات التي تملكها بالفعل مجانية على الهامش؛ أما سعر النموذج المستضاف البالغ 0.15 دولار لكل مليون رمز فهو رخيص لكنه ليس صفرًا، والتكلفة الثابتة لتجهيز البنية المقابلة له حقيقية بالنسبة لعبء عمل يعمل مرتين في الأسبوع.
الحجة المضادة هي أن قيود النموذج القديم تزداد وطأة كل عام. إن دقيقة من الفيديو، و32 ألفًا من السياق، وغياب استدعاء الأدوات أو الإخراج المنظم في عالم أصبح فيه الوكلاء شكل النشر الافتراضي يشكل نطاقًا ضيقًا. وبالنسبة لخط أنابيب يجب أن يستوعب الاجتماعات المسجلة، Qwen3.8-Omni-Flash ليس أفضل فحسب — بل هو الفرق بين الممكن وغير الممكن، لأن نموذج 2025 لا يستطيع فعليًا استيعاب المدخلات.
يجدر بنا أن نكون محددين بشأن مقدار العمر المتبقي في الأوزان القديمة، لأن كلمة «إرث» تبخّس من قدرها. أما Qwen2.5-Omni-7B، فقد سجّل المستودع 343,676 عملية تنزيل في الشهر الماضي عندما تحققنا منه في 18 سبتمبر 2026، مع نحو مئة من Spaces المجتمعية وعشرات من عمليات الضبط الدقيق والمحولات والتكميمات المبنية على أساسه. ومهما فعل النموذج الرائد، فلا يزال عدد كبير من الناس ينشرون على نموذج 2025 — والجدير بالذكر أن Hugging Face لم تُدرج أي مزوّد استدلال ينشره، ما يعني أن كل هذا الاستخدام تقريبًا مستضاف ذاتيًا.
النموذج الجديد يحسّن النموذج القديم
أغرب التفاصيل وأكثرها إقناعًا في الإطلاق مدفونٌ قرب نهاية المواد. في تجربة تصفها Alibaba بأنها نموذج يحسّن نموذجًا، Qwen3.8-Omni-Flash حسّن بشكل مستقل التعرف على الكلام باللهجة السيتشوانية لدى Qwen2.5-Omni-3B — الشقيق الصغير للنموذج الذي يحلّ محله اسميًا — خافضًا معدل خطأ الأحرف من 25.79% إلى 15.30% خلال اثنتي عشرة ساعة وبناء 3,413 عيّنة تدريبية على مدى أربع جولات.
تلك حجة أقوى لصالح النموذج الأحدث من أي معيار أداء في الإصدار، وهي تعيد تأطير العلاقة بين الاثنين. نموذج 2026 ليس مجرد بديل لنموذج 2025؛ بل هو أداة تجعل أوزان 2025 أفضل. إذا كنت تشغّل Qwen2.5-Omni في الإنتاج للغة أو لهجة يتعامل معها بشكل ضعيف، فقد يكون المسار العملي هو الإبقاء على النشر واستخدام النموذج الجديد لبناء بيانات التدريب، بدلاً من ترحيل عبء العمل. مع ذلك، لاحظ أن هذا عرض توضيحي مُبلَّغ عنه من المورّد دون منهجية منشورة، وينبغي التعامل معه كواقعة مشجعة لا كوصفة قابلة لإعادة الإنتاج.

إذا كنت تقوم بالترحيل
نادرًا ما يقتصر القرار على نموذج واحد. الفريق الذي يترك نموذج omni المستضاف ذاتيًا يختار بين ثلاثة أشكال: البقاء على الأوزان المفتوحة والاستمرار في التزويد، أو الانتقال إلى API مورّد والتخلي عن التحكم، أو تقسيم عبء العمل بحيث لا يذهب إلى النموذج المستضاف إلا الجزء الذي يحتاج إلى استقبال مليون رمز. عادةً ما يكون الخيار الثالث هو الصحيح، وهو أيضًا الخيار الذي يتجاهله الناس، لأنه يبدو أكثر عملًا مما هو عليه في الواقع — فالضبط الدقيق للهجة الذي أمضيت شهرًا في إعداده لا يجب أن يُهدر لمجرد أن مرحلة تلخيص الاجتماعات انتقلت.
تكمن فائدة التوجيه عند نقاط الوصل. يمنحك OrcaRouter مفتاحًا واحدًا عبر أكثر من 200 نموذج بهامش ربح 0% على سعر قائمة المزوّد، مع تجاوز تلقائي عند الفشلإذا تدهورت نقطة نهاية، ما يعني أن النصف المستضاف من مسار معالجة مقسَّم لا يحتاج إلى عقد خاص به، ولا شيفرة عميل خاصة به، ولا مراقبة خاصة به قبل أن تعرف ما إذا كان عبء العمل يبرّر أيًا من ذلك. وللتوضيح بشأن ما لا نقوم به: لا يوجد أي من نموذجَي omni في كتالوجنا — فكلاهما يعمل على منصات Alibaba أو على أجهزتك الخاصة — لذا فإن هذا قرار توجيه تتخذه حول النماذج، وليس من خلالنا.
من ينبغي أن يتحرك، ومن لا ينبغي له ذلك
انتقل إذا كان عبء عملك صوتًا أو فيديو طويل المدة، أو إذا كان سياق بحجم 32K هو ما يمنع وجود خط أنابيب، أو إذا كنت تحتاج إلى سلوك وكيلي على الوسائط، أو إذا كان فصل المتحدثين على نطاق واسع هو المشكلة التي تواجهها. ابقَ إذا كنت تحتاج إلى أن يتحدث النموذج، أو إذا كان صوتك لا يستطيع مغادرة بنيتك التحتية، أو إذا كنت تعتمد على أوزان Qwen2.5-Omni المحددة التي ضبطتها بالفعل، أو إذا كان حجم مكالماتك منخفضًا بما يكفي بحيث تتفوق وحدة معالجة رسومات تملكها على عداد.
الخلاصة غير المريحة هي أن هذا ليس بديلًا بقدر ما هو تفرّع في خط الإنتاج. لقد أمضت علي بابا ثمانية عشر شهرًا في بناء أفضل نموذج إدخال ممكن، ولم تبنِ خلفًا للنصف الخاص بالإخراج. إذا كان عملك يقع على جانب الإدخال، فإن الترقية شبه إلزامية. وإذا كان يقع على جانب الإخراج، فإن طراز 2025 لا يزال أحدث شيء يؤدي ما تحتاجه — وهذا أمر يستحق معرفته قبل أن تخطط لترحيل قد يحذف بهدوء قدرة تعتمد عليها.
