
Qwen3.8-27B Text+Video قادم إلى CPU: ما الذي تغيّره PR الخاصة بـ torchcodec من SGLang
- z-aiجديدZ.ai: GLM 5.32026-08-1860الذكاء75البرمجة
- obsidianجديدQwen3.8 27B Uncensored (Aggressive)2026-08-1552الذكاء68البرمجة
- qwenجديدQwen: Qwen3.8 27B (free)2026-08-1341 tok/s
- deepseekجديدDeepSeek: DeepSeek V4 Pro 08132026-08-1253الذكاء69البرمجة
- grokجديدSpaceXAI: Grok 4.62026-08-1261الذكاء77البرمجة
- metaجديدMeta: Muse Spark 1.22026-08-0557الذكاء72البرمجة
- qwenQwen: Qwen3.8 Max2026-08-0358الذكاء72البرمجة
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152الذكاء69البرمجة
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 لكل مليون رمز · 237 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463الذكاء78البرمجة
- googleGoogle: Gemini 3.6 Flash2026-07-2152الذكاء69البرمجة
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137الذكاء49البرمجة
- metaMeta: Muse Spark 1.12026-07-1653الذكاء71البرمجة
- kimiMoonshotAI: Kimi K32026-07-1560الذكاء76البرمجة
- openaiOpenAI: GPT-5.6 Luna2026-07-0952الذكاء71البرمجة
- openaiOpenAI: GPT-5.6 Terra2026-07-0957الذكاء77البرمجة
- openaiOpenAI: GPT-5.6 Sol2026-07-0961الذكاء77البرمجة
- grokxAI: Grok 4.52026-07-0856الذكاء72البرمجة
يوجد حاليًا طلب سحب مسودة في SGLang بعنوان “[CPU] Support Qwen3.8 text+video: adding torchcodec, ffmpeg and removing pin_memory.” وبعد إزالة التفاصيل التقنية، يبدو كخارطة طريق: Qwen3.8-27B — نموذج Alibaba للرؤية واللغة برخصة Apache-2.0 ويضم 27 مليار معامل، تم فتح مصدره قبل خمسة أيام — يُدمج الآن بحيث يعمل وضع النص والفيديو على أجهزة لا تحتوي على GPU. هذه أول إشارة ملموسة إلى أن النموذج متعدد الوسائط 27B يحصل على مسار تقديم عبر CPU حقيقي في إحدى بيئات تشغيل الاستدلال التي تنشرها الفرق فعليًا، وهو أمر مهم لأي شخص كان ينتظر تشغيل فهم الفيديو محليًا دون شراء بطاقة سعة 48 جيجابايت.
لا يوجد أي شيء مدمج في ذلك الـ PR بعد — إنه مسودة، CI حمراء، وإصدارات الحزم لا تزال متحركة. لكن هذا بالضبط سبب استحقاقه للقراءة بعناية. النموذج الذي يقف خلفه حقيقي ومُطلق، والنظام البيئي للخدمة قد لحق به بالفعل على GPU، وهذا الـ PR يُظهر إلى أين يتجه مسار عدم استخدام GPU. إليك ما يفعله التغيير فعليًا، ولماذا يُعد استدلال الفيديو على CPU لنموذج بحجم 27B أمرًا أكبر مما يبدو، وما هو مؤكد حول Qwen3.8-27B، وأين يمكنك استخدامه اليوم.
النموذج في فقرة واحدة
Qwen3.8-27B هو الإصدار مفتوح الأوزان بحجم 27B من جيل Qwen 3.8: نموذج رؤية-لغة كثيف يضم نحو 27.8 مليار معامل (64 طبقة، حجم مخفي 5,120) مع برج رؤية مخصص، صدر بموجب رخصة Apache 2.0 على Hugging Face وModelScope مساء 14 أغسطس 2026 (بتوقيت بكين). يقبل النصوص والصور والفيديو ويعيد نصًا — بشكل أصيل، وليس عبر محوّل خارجي ملحق — مع نافذة سياق أصلية تبلغ 262,144 رمزًا، قابلة للتوسيع إلى نحو مليون عبر YaRN. الترخيص من النوع المتساهل: الاستخدام التجاري والضبط الدقيق وإعادة التوزيع مسموح بها، دون حد أدنى للإيرادات ودون اتفاقية تجارية منفصلة، خلافًا لشروط نقطة التحقق الرئيسية.
هناك تفصيلان معماريان أكثر أهمية للمُطبِّق من المواصفات الرئيسية. الأول هو الانتباه الهجين: معظم الطبقات تستخدم انتباه Gated DeltaNet الخطي وربعها فقط يحتفظ بذاكرة تخزين مؤقت كاملة لـ KV، لذا فإن ذاكرة السياق الطويل تمثل جزءًا صغيرًا مما يحتاجه نموذج كثيف تقليدي بـ64 طبقة — وهي الحيلة نفسها التي تجعل نافذة سياق {{1}}...{{/1}} بمقدار 262 ألفًا واقعية داخل بطاقة رسوميات استهلاكية واحدة. الثاني هو التنبؤ متعدد الرموز (MTP)، الذي يوفّر نقطة التحقق مع رأس تخمين استدلالي خاص به، ويُسرّع فك الترميز بشكل ملحوظ عندما تستخدمه بنية الخدمة.
وهي أيضًا النسخة القادرة على معالجة الفيديو ضمن العائلة. النموذج المفتوح الرئيسي، Qwen3.8-2.4T-A95B، يقتصر فعليًا على النص في صورته القابلة للتنزيل، بينما تضيف واجهة برمجة التطبيقات المستضافة Qwen3.8-Max رؤية حاسوبية فوق تلك الأوزان. أما إصدار 27B فهو الوزن الذي يمكنك بالفعل تنزيله وتشغيله، وهو يدعم النص والصور والفيديو مباشرةً دون إعدادات إضافية — ولهذا السبب فإن مسار وحدة المعالجة المركزية لوضع الفيديو الخاص به يستحق المتابعة.
ما الذي يغيّره PR الخاص بـ SGLang فعليًا
طلب السحب (sgl-project/sglang #35492) ضيّق وواضح. وصفه الخاص: «يهدف هذا الطلب إلى دعم Qwen3.8 للنص+الفيديو، بإضافة torchcodec وffmpeg وإزالة pin_memory.» عمليًا، هذه ثلاث خطوات.
• torchcodec — وهي مكتبة فك تشفير الفيديو المعتمدة على ffmpeg من PyTorch — إلى الحزمة، بحيث يمكن فك تشفير إطارات الفيديو لنموذج Qwen3.8 للنصوص والفيديو ومعالجتها مسبقًا على وحدة المعالجة المركزية للمضيف. يثبّت طلب السحب (PR) torchcodec 0.12.0 مع torch 2.12، ويشير إلى أن ffmpeg يجب أن يبقى دون الإصدار 9.
• تمت إزالة pin_memory من المسار متعدد الوسائط. pin_memory هو تحسين لنقل البيانات عبر GPU يثبّت مخازن المضيف المؤقتة لنسخ غير متزامن سريع إلى الجهاز؛ إن إسقاطه في مسار يعتمد على CPU فقط هو المؤشر على أن العتاد المستهدف لا يحتوي على مسرّع منفصل في مسار البيانات.
• يُشغّل أمر إعادة الإنتاج النموذج الفعلي — Qwen/Qwen3.8-27B — عبر sglang.launch_server على CPU مع تفعيل مسار إدخال النص+الفيديو.
اقرأ تسميات الحالة قبل أن تبني أي شيء عليه: طلب السحب (PR) ما زال مسودة، وكلتا عمليتي التكامل المستمر (CI) تفشلان، ولا يزال بانتظار مراجعة مالكي كود SGLang حتى اليوم. إنه اتجاه، وليس إصدارًا. السياق المهم هو أن SGLang يشغّل بالفعل Qwen3.8-27B على GPU — يغطي الدليل H200 وRTX PRO 6000 وRTX 5090 وDGX Spark، مع صورة مخصصة lmsysorg/sglang:qwen38-27b — لذا فإن مسار النص+الفيديو على CPU هو العنصر الجديد حقًا.
![A screenshot of the draft SGLang pull request #35492 titled '[CPU] Support Qwen3.8 text+video: adding torchcodec, ffmpeg and removing pin_memory', showing the description quoting torchcodec 0.12.0 against torch 2.12 and ffmpeg below 9, a reproduce command launching Qwen/Qwen3.8-27B with --device cpu, and the note that an approving review is required before the pull request can merge.](https://cms.orcarouter.ai/api/media/file/2-375.png)
لماذا معالجة النصوص والفيديو بوحدة المعالجة المركزية (CPU) أكثر أهمية مما يبدو
وضعت Alibaba طراز 27B للذكاء الاصطناعي الطرفي منذ اليوم الأول — كيّفته MediaTek ليعمل على رقائق Dimensity للهواتف المحمولة وقمرة القيادة C-X1 للسيارات في نفس اليوم الذي أُطلقت فيه الأوزان. عززت قصة النشر المحلي ذلك: تكميم Q4_K_M يبلغ حوالي 17.1 جيجابايت، وهو ما يناسب وحدة معالجة رسومات استهلاكية بسعة 24 جيجابايت أو جهاز Mac بمعالج Apple Silicon مع 32 جيجابايت من الذاكرة الموحدة. الشيء الوحيد الذي لم تستطع تلك القصة فعله هو تشغيل الفيديو على جهاز لا يحتوي على وحدة معالجة رسومات على الإطلاق. هذه هي الفجوة التي يعالجها هذا الـ PR.
مسار نص+فيديو عبر وحدة المعالجة المركزية يجعل فهم الفيديو قابلاً للنشر على أجهزة CPU عادية — أجهزة افتراضية، خوادم صغيرة، وحدات رفوف محلية، بوابات حافة — حيث يكون عبء العمل غير متزامن وتكون الإنتاجية أهم من زمن الاستجابة. إن إنشاء التسميات التوضيحية للفيديو، ومراجعة المحتوى، وتحليل المستندات والرسوم البيانية، والاسترجاع دون اتصال من التسجيلات: هذه هي بالضبط المهام المجمّعة التي لا تحتاج إلى GPU، وما زالت تفترض وجودها اليوم لأي VLM يدخل الفيديو.
المفاضلة الصادقة هي أن Qwen3.8-27B نموذج يضم 27 مليار معامل، ولا يوجد أي مسار CPU يجعل نموذج 27B سريعًا. توقّع معدلًا يتراوح بين 1 و9 رموز في الثانية على خادم جاد من فئة AVX مع إطارات فيديو في السياق — وهذا قابل للتطبيق للمعالجة المجمّعة والوظائف الليلية، وليس للمحادثة التفاعلية عبر الفيديو. الهدف من مسار CPU هو أن الخيار موجود أصلًا: يمكن لنشر بدون GPU تشغيل وضع الفيديو للنموذج نفسه بدلًا من النزول إلى نموذج رؤية أصغر أو إرسال كل إطار إلى GPU سحابي.
أين يعمل Qwen3.8-27B اليوم
لحق النظام البيئي بالنموذج بسرعة. على جانب الاستضافة الذاتية، لديك llama.cpp وLM Studio مع حزم GGUF حتى حجم يقارب 10.7 جيجابايت بكمية 2-بت، وOllama لأمر سطر واحد، وvLLM وSGLang للخدمة المناسبة. معظم ذلك هو نص أو صورة اليوم؛ مسار الفيديو على وحدة المعالجة المركزية هو الجزء الذي ما زال قيد البناء.
إذا كنت تفضل عدم تشغيل نموذج 27B بنفسك، فالمسار المُستضاف موجود بالفعل: يقدّم OrcaRouter qwen/qwen3.8-27b مع إدخالات نصية وصور وفيديو، ونافذة سياق يبلغ حجمها 262,144 رمزًا، ومخرجات نصية، بسعر 0.33 دولارًا لكل مليون رمز إدخال و2.40 دولارًا لكل مليون رمز إخراج. وهو خلف نفس نقطة النهاية المتوافقة مع OpenAI مثل كل نموذج آخر على المنصة — مفتاح API واحد، دون عقد ثانٍ — وتنطبق ميزة التبديل التلقائي ولغة التوجيه (DSL) الخاصة بالمنصة على أكثر من 200 نموذج يحمل هذا المفتاح. نموذج عمره خمسة أيام وبمسار CPU غير مثبت هو الحالة النموذجية لاستخدام التوجيه بدلاً من الربط المباشر: يمكنك تجربة Qwen3.8-27B على أعباء عمل حقيقية خلف مسار توجيه دون المراهنة على مسار الاستدعاء بالكامل على حزمة خدمة واحدة، والتبديل بين النسخ المستضافة ذاتيًا والمستضافة دون تغيير الكود.

الأرقام — المبلغ عنها من البائع، وتستحق التحقق
كل رقم رئيسي أدناه هو من إعداد Alibaba نفسه، من بطاقة النموذج ومواد الإطلاق. عمر النموذج خمسة أيام فقط، والاستنساخ المستقل بدأ للتو في الظهور، لذا تعامل مع هذه الأرقام كادعاءات ذات اتجاه واضح وليس كأحكام نهائية. بالنسبة لنموذج 27B، فإن نتائج البرمجة والوكيل هي ما يلفت الانتباه:
• SWE-bench Pro — 61.7 (كما ورد عن Alibaba؛ ويُظهر جدولها الخاص أن Claude Opus 4.6 Max عند 53.4)
• Terminal-Bench 2.1 — 73.0 (البرمجة الطرفية الوكلائية)
OSWorld-Verified — 84.3 (مهام وكلاء استخدام الكمبيوتر)
• AndroidWorld — 81.9
• DeepSWE 1.1 — 42.2، أي ما يقارب ثلاثة أضعاف 13.3 الذي حققه النموذج المفتوح السابق 27B.
على صعيد الرؤية — وهو الجانب الذي تركز عليه هذه المقالة فعليًا — تعلن Alibaba عن تحقيق {{1}}VideoMME 87.0 لفهم الفيديو وMathVision 90.0 للاستدلال البصري{{/1}} دون استخدام أدوات. تُشير التقييمات المبكّرة من Artificial Analysis إلى وضع النموذج عند 52 على مؤشر الذكاء و51 على مؤشر الوكلاء، {{2}}وهو مستوى تنافسي مع نماذج مغلقة أكبر حجمًا في بعض إعدادات الاستدلال{{/2}}؛ تظل هذه نتائج مبكرة مقارنةً بنموذج لم يتجاوز عمره خمسة أيام.

تحذير واحد مهم بشكل غير متناسب لأي شخص يشغّل النموذج محليًا أو على وحدة المعالجة المركزية (CPU)، وهو مؤشر الاستدلال. يأتي Qwen3.8-27B مع وضع التفكير مفعّلًا وإعداد reasoning_effort لكل طلب (low / medium / xhigh). الوضع الافتراضي xhigh يبالغ في التفكير بشكل سيئ: التشغيل الأول الذي أصبح مشهورًا الآن لملف GGUF بحجم 17GB استغرق حوالي 21 دقيقة و22,000 رمز استدلال لرسم صورة بسيطة. على وحدة المعالجة المركزية خاصةً، اضبط reasoning_effort عمدًا — الفرق بين التفاعلي وغير القابل للاستخدام هو معامل واحد.
ماذا تشاهد
ثلاثة أشياء ستخبرك ما إذا كان مسار وحدة المعالجة المركزية يصبح حقيقيًا:
• هل يتم دمج PR #35492. إنها مسودة بحالة CI حمراء اليوم. والنسخة المدمجة الخضراء التي تصل إلى إصدار هي النقطة التي يصبح عندها مسار النص+الفيديو لوحدة المعالجة المركزية قابلاً للتشغيل لبقية المستخدمين.
• معايير مستقلة. أرقام 61.7 SWE-bench Pro و87.0 VideoMME هي أرقام مقدمة من البائع. عمليات تشغيل LMArena وArtificial Analysis خلال الأسبوعين المقبلين ستُظهر كم سيبقى خارج بيئة الاختبار الخاصة بـ Alibaba.
• ما إذا كانت النسخة المستضافة بسياق 1M ستتحقق.السياق الأصلي بـ262K كبير بالفعل؛ أما الوضع متعدد الوسائط بمليون رمز فهو حيث تثبت وفورات ذاكرة التخزين المؤقت للانتباه الهجين جدواها.
في الوقت الحالي، القرار بسيط. إذا كان لديك العتاد المناسب، فإن إصدار 17GB Q4 GGUF مع SGLang أو llama.cpp يشغّل النموذج اليوم، ويُظهر طلب السحب (PR) الخاص بتشغيل النص والفيديو على CPU إلى أين يتجه مسار العمل بدون GPU. أما إذا لم يكن لديك، فيمكن استدعاء Qwen3.8-27B عبر OrcaRouter بسعر 0.33 دولار لكل مليون رمز إدخال و2.40 دولار لكل مليون رمز إخراج باستخدام مفتاح واحد. على أي حال، فإن النموذج المفتوح 27B القادر على معالجة الفيديو هو النموذج الأكثر إثارة للاهتمام للمتابعة في جيل Qwen 3.8 — وعمره خمسة أيام فقط.
