بطاقة عنوان رئيسية مُولّدة تحمل النص «Gemini 3.1 Pro vs Qwen3.8-27B»، مع عنوان فرعي «معاينة لسبعة أشهر مقابل نقطة تفتيش يمكنك تنزيلها»، مع بطاقتين: Gemini 3.1 Pro، في المعاينة منذ 19 فبراير 2026، بسعر 2.00 دولار للمدخلات و12.00 دولار للمخرجات لكل مليون رمز ومؤشر الذكاء Artificial Analysis Intelligence Index بقيمة 29.7، مقابل Qwen3.8-27B، أوزان مفتوحة منذ 14 أغسطس 2026، بسعر 0.50 دولار للمدخلات و3.00 دولار للمخرجات لكل مليون رمز ومؤشر بقيمة 33.7، مع ميدالية VS بينهما وشعار OrcaRouter في أسفل اليمين. تذييل: «Artificial Analysis Intelligence Index v4.3.2، تم التقاطه في 2026-09-23؛ الأسعار هي أسعار قائمة المزودين.»
Guides & Insights

Gemini 3.1 Pro مقابل Qwen3.8-27B: معاينة تسبق موعدها بسبعة أشهر مقابل نقطة تحقق يمكنك تنزيلها

الكاتب

Magnus Corvin

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

في 18 سبتمبر 2026، بدأ المستخدمون في منتدى مطوّري الذكاء الاصطناعي الخاص بالبائع يبلغون بأن Gemini 3.1 Pro قد اختفى من محدد النماذج في AI Studio — بما في ذلك الحسابات المدفوعة، بغض النظر عن مسح ذاكرة التخزين المؤقت ونوافذ التصفح المتخفي. كان الموضوع الذي يطلب من البائع تحديد ما إذا كان "خطأ أم مقصودًا" لا يزال نشطًا في 21 سبتمبر. لا يوجد إشعار بإهمال، ولا مسار ترحيل، ولا رد من الموظفين. وفي الوقت نفسه Qwen3.8-27B، الذي أطلقه المختبر مفتوح المصدر في 14 أغسطس بموجب Apache 2.0، لا يمكن سحبه من أي شخص قام بتنزيله. هذا التباين — وليس فجوة المعايير، التي هي حقيقية ولكن متواضعة — هو ما تعتمد عليه هذه المواجهة فعليًا، وهو السبب في أن النموذجين لا يتنافسان حقًا على نفس المكان حتى لو وضعتهما جداول المقارنة جنبًا إلى جنب.

في ما يلي المواجهة المباشرة حول الأرقام الموجودة، مع تصنيف كل منها: أرقام Artificial Analysis من عمليات الالتقاط التي تمت في 23 سبتمبر 2026، وبطاقة الطراز الخاصة بـ Alibaba، ومنشور الإطلاق الخاص بـ Google، وبيانات التتبع Telemetry الخاصة بتوجيهنا، مع الإبقاء عليها منفصلة طوال الوقت. وحيثما لم يتم قياس أي شيء، توضح هذه الصفحة ذلك بدلًا من التخمين.

ما الذي حدث هذا الأسبوع، وما يعنيه وما لا يعنيه

التقارير محددة وتأتي من منتدى Google نفسه لا من مدونة منافس. موضوع بعنوان «Gemini 3.1 Pro مفقود من AI Studio منذ 2026-09-18 — خلل أم أمر مقصود؟» يصف مستخدمين يدفعون وهم يفقدون الوصول إلى الطراز دون أي إعلان، ودعم Google One يقدم خطوات لاستكشاف الأخطاء غير ذات صلة، وصفحة حالة Google لا تُظهر أي مشكلة. وهناك موضوع ثانٍ بعنوان «طراز Gemini 3.1 Pro Preview غير متاح في AI Studio لبناء تطبيق» يجمع الشكوى نفسها، بما في ذلك من مستخدم بُني مساعده البرمجي على الإصدار التجريبي Preview لأشهر ويقول إن Flash «ينتج كودًا رديئًا» على قاعدة الكود لديه.

ثلاث تحفظات صادقة. إنه اختفاء من وحدة تحكم المطوّرين، وليس انقطاعًا مؤكدًا في واجهة برمجة التطبيقات: لا يزال Gemini 3.1 Pro مُدرجًا وقابلًا للتوجيه في كتالوجنا الخاص، حيث عالج 94.7 مليون رمز في الأيام السبعة الماضية. وهو أمر مُبلَّغ عنه من المستخدمين — لم تقل Google شيئًا، لذا لا يمكن لأحد خارج Google أن يفصل بين "التقاعد الصامت" و"مشكلة في السعة" و"خلل في وحدة التحكم". والتوقيت ليس مُشرفًا نظرًا لأن هذا النموذج ظل في معاينة منذ 19 فبراير 2026 — سبعة أشهر، دون نشر تاريخ للتوفر العام، بينما أطلقت Google سلسلة من نماذج Flash تحته. وبشكل منفصل، أوقف GitHub Copilot دعم Gemini 3.1 Pro في 1 سبتمبر 2026 مع إشعار قبل 30 يومًا، وهو حدث مختلف وغير مرتبط، لكنه يشير في الاتجاه نفسه: نقطة نهاية معاينة بلا التزام بالتوفر العام هي تبعية يحق لك أن تقلق بشأنها.

ثمة رقم من جانبنا يستحق أن يوضع بجوار ذلك السياق، لأننا لا نستطيع تفسيره ونفضّل أن نقول ذلك صراحةً. تُظهر بيانات القياس عن بُعد لدينا لمدة سبعة أيام على مدخل كتالوج Gemini 3.1 Pro معدل خطأ يبلغ 80.5%؛ أما النماذج المجاورة التي تحققنا منها في الصباح نفسه — Qwen3.8-Max وClaude Fable 5.1 — فتستقر عند 5.9% و6.9%. لا نعرف ما إذا كانت هذه هي المشكلة ذاتها التي يبلّغ عنها المنتدى، أم أسبوعًا سيئًا لمزوّد واحد في المنبع، أم نتيجة زائفة من أدوات القياس. تعامل معها كسبب لتشغيل اختبار كناري قبل أن تلتزم، لا كحكم نهائي على النموذج.

نفس المسطرة، نتيجتان مختلفتان

هذا هو الجزء الذي تخطئ فيه معظم صفحات المقارنة، لذا يستحق عناية. تقيّم Artificial Analysis كلا هذين النموذجين على Intelligence Index v4.3.2. التقطنا كلا الصفحتين في 23 سبتمبر 2026، وكلتاهما تحملان المراجعة نفسها — لذا وخلافًا لمعظم ادعاءات المؤشرات العابرة للنماذج، هذه المقارنة من اللقطة نفسها، والفارق حقيقي.

• Qwen3.8-27B (xhigh) — مؤشر الذكاء 33.7

• Gemini 3.1 Pro Preview — مؤشر الذكاء 29.7

يتصدّر Qwen بفارق أربع نقاط على المسطرة الحالية. السؤال الأصعب هو ماذا يعني ذلك، لأن المسطرة نفسها تحرّكت ثلاث مرات على الأقل هذا العام. في فبراير، نشرت Artificial Analysis مقالًا وصفت فيه Gemini 3.1 Pro Preview بأنه «الرائد الجديد في الذكاء الاصطناعي»، بفارق أربع نقاط عن Claude Opus 4.6، وذكرت التغطية الصحفية آنذاك نتيجة 57 على ما كان يُعرف حينها بـ Index v4.0. أما على v4.3.2 فهي 29.7. أعلنت Artificial Analysis عن v4.3 في 7 سبتمبر 2026، بعد أربعة أيام من v4.2، واستبدلت المراجعة Terminal-Bench 2.1 بـ Terminal-Bench 4.0 الأصعب بكثير والمكوّن من 66 مهمة، وحلّت AutomationBench-AA محل τ³-Banking. كانت مواطن قوة Gemini 3.1 Pro في فبراير تكمن في تقييمات ألغاها المؤشر الجديد أو أعاد ترجيحها. إذن: لم يصبح النموذج أسوأ، بل أصبح الامتحان أصعب. لكن إذا كنت تختار نموذجًا اليوم، فإن رقم اليوم هو ما يمكنك التصرف بناءً عليه فعلاً، ورقم اليوم يرجّح كفة Qwen.

حيث يختلف الاثنان اختلافًا حقيقيًا

تخفي الدرجات الإجمالية شكل الفرق، والشكل هو الجزء المفيد. كل رقم أدناه مأخوذ من نفس لقطة 23 سبتمبر لصفحات v4.3.2 الخاصة بـ Artificial Analysis لكلا النموذجين، في المراجعة نفسها.

• الاستدلال والمعرفة — يتقدم Gemini بوضوح. GPQA Diamond 94.1 مقابل 90.5؛ Humanity's Last Exam 47.0 مقابل 33.9؛ SciCode 58.7 مقابل 46.6؛ CritPt 17.7 مقابل 5.4.

• المهام المهنية في العالم الحقيقي — يتصدر Qwen، وبفارق كبير. GDPval المُعاير 45.4% مقابل 13.8%.

• الخدمات المصرفية والمعاملات القائمة على الوكلاء — Qwen في الصدارة. τ-Banking 48.0 مقابل 21.4 لـ Gemini.

• استخدام الأدوات الوكيلية على معيار عام — يتقدم Gemini حيث لم يتم قياس Qwen. τ²-Bench 95.6 لـ Gemini؛ لا يوجد رقم لـ Qwen3.8-27B.

• عمل الطرفية — متقارب، وكلاهما سيئ في المعيار الجديد. Terminal-Bench 2.1: Qwen 79.8، Gemini 73.8. Terminal-Bench 4.0: Qwen 5.6%، Gemini 4.0% — كلاهما رقم أحادي.

• المعايرة — أكثر التباينات حدة على أي من الصفحتين. في AA-Omniscience، يسجل Gemini 31.9 بدقة 54.9% ومعدل هلوسة 50.9%؛ ويسجل Qwen −10.0 بدقة 15.6% ومعدل هلوسة 30.3%. يعرف Gemini أكثر ويختلق أكثر من نصف الوقت؛ بينما كثيرًا ما يرفض Qwen الإجابة ويهلوس في نحو ثلث ما يجيب عنه.

• السياق الطويل — متعادلان تمامًا في استدعاء السياق الطويل، 82.0 لكل منهما. في استدعاء السياق الطويل متعدد الوسائط، Qwen 21.7% مقابل Gemini 15.6%.

اقرأ إدخالات «غير مُقاس» على حقيقتها. لا يملك Gemini أي رقم معياري منشور لـGDPval-AA في مقابل نسبة Qwen البالغة 45.4%، ولا يملك Qwen أي رقم في τ²-Bench أو IFBench أو Terminal-Bench Hard أو ITBench-SRE في مقابل أرقام Gemini البالغة 77.1 و53.8 و30.3. كل واحد من تلك الفراغات هو موضع كان بإمكان جدول ملخّص أن يزرع فيه فائزًا بهدوء.

A generated two-column scoreboard headed 'Gemini 3.1 Pro vs Qwen3.8-27B — the scoreboard', with the same six dimension labels in both columns. Gemini 3.1 Pro: AA Index 29.7, price per 1M $2.00 input and $12.00 output, context 1M tokens, output speed 116.5 tokens per second, open weights no (preview API), cost to run the index $1,310. Qwen3.8-27B: AA Index 33.7, price per 1M $0.50 input and $3.00 output, context 262K native, output speed 41.3 tokens per second, open weights yes (Apache 2.0), cost to run the index $1,336. Footer: 'Artificial Analysis Intelligence Index v4.3.2, captured 2026-09-23; prices are provider list rates.'

التباين الذي يحدد الميزانيات: التكلفة نفسها لتشغيل المؤشر

Qwen3.8-27B أرخص بشكل كبير لكل رمز. بناءً على أرقام السوق التي تنشرها Artificial Analysis، يبلغ سعره 0.50 دولار لكل مليون رمز إدخال و3.00 دولارات لكل مليون رمز إخراج، مع خصم تخزين مؤقت بنسبة 80% ومعدل مدمج بنسبة 7:2:1 قدره 0.47 دولار. أما Gemini 3.1 Pro Preview فيبلغ سعره 2.00 دولار و12.00 دولارًا — أي أربعة أضعاف سعر الإدخال وأربعة أضعاف سعر الإخراج — مع خصم تخزين مؤقت بنسبة 90% ومعدل مدمج قدره 1.74 دولار.

ثم يأتي الرقم الذي لا ينشره أحد: حساب Artificial Analysis نفسه يضع تكلفة تشغيل مؤشر الذكاء بالكامل عند 1,310.21 دولارًا لـ Gemini 3.1 Pro Preview و1,335.92 دولارًا لـ Qwen3.8-27B. Qwen ليس أرخص في التشغيل. بل أغلى بقليل جدًا، لأنه يستغرق وقتًا أطول للوصول إلى هناك. من فاتورة مخرجات Qwen، كان 512.36 دولارًا رموز استدلال مقابل 82.51 دولارًا من الإجابة الفعلية؛ ومن فاتورة Gemini، كان 691.82 دولارًا استدلالًا مقابل 113.08 دولارًا من الإجابة. سعر الرمز الواحد معدّل، وليس فاتورة.

هناك حقيقتان إضافيتان بشأن التسعير تُغفلهما جداول المقارنة. أولاً، سعر Gemini 3.1 Pro متدرّج حسب حجم مُدخل كل طلب: 2.00 دولار/12.00 دولارًا حتى 200 ألف رمز مُدخل، ثم 4.00 دولارات/18.00 دولارًا فوق ذلك، مع تضاعف قراءات الذاكرة المؤقتة من 0.20 دولار إلى 0.40 دولار. نافذة السياق البالغة مليون رمز حقيقية، لكن آخر 800,000 رمز منها تكلّف ضعف السعر. ثانيًا، إدخال كتالوجنا الخاص بـ Qwen3.8-27B — يُقدَّم بتقنية block-FP8، وبرج الرؤية بدقة كاملة — يدرج 0.40 دولار للإدخال و4.21 دولارات للإخراج، وهو أرخص في الإدخال وأغلى في الإخراج من رقم السوق أعلاه، ولا ينشر أي سعر للرموز المخزّنة مؤقتًا على الإطلاق. مزوّدون مختلفون، وتقسيم مختلف. تحقق من السعر الذي ستُفَاتَر به فعليًا.

يمكن الوصول إلى كلا الطرازين عبر مفتاح OrcaRouter واحد بسعر قائمة المزوّد وبهامش ربح 0%، لذا يصل تغيير سعر المورّد إلى جهتنا في اليوم نفسه بدلًا من أن يمر بدورة إعادة تسعير — وهذا يهم أكثر من المعتاد عندما يكون حدّ الطبقة لدى أحد الطرازين عند 200K توكن.

زمن الاستجابة: أسرع أول رمز ينتمي إلى النموذج الأبطأ

هذا هو أكثر زوج من الأرقام تضليلاً في المقارنة بأكملها، وهو الأكثر احتمالاً أن يتصرف القارئ بناءً عليه على نحو خاطئ.

• الوقت المستغرق حتى أول جزء — Qwen‏ 4.04 ثانية مقابل Gemini‏ 28.37 ثانية. يبدو أن Qwen أسرع بسبع مرات.

• الوقت حتى الإجابة الفعلية — Gemini 28.37 ثانية مقابل Qwen 52.52 ثانية. تتفوق Gemini بنحو 1.8 مرة، لأن Qwen تقضي 48.48 ثانية في التفكير بين المقطع الأول ورمز الإجابة الأول.

• سرعة الإخراج — Gemini ‏116.5 رمزًا في الثانية مقابل Qwen ‏41.3. Gemini أسرع بمقدار 2.8 مرة بمجرد أن يبدأ الكتابة، مقابل وسيط المقارنة الذي تقدّره Artificial Analysis عند 95.4 رمزًا في الثانية. وتصف صفحة Qwen الخاصة به بأنه «بطيء بشكل ملحوظ».

إذا كان منتجك يبث أول رمز إلى المستخدم، فإن زمن الاستجابة الرئيسي لـ Qwen هو كذبة ستقولها لنفسك مرة واحدة. إذا كان منتجك ينتظر إجابة كاملة، فإن Gemini هو النموذج الأسرع. كلا الرقمين هما قياسان من Artificial Analysis؛ تم أخذهما عند إعداد Qwen xhigh، وهو إعداد الجهد الافتراضي لبطاقة النموذج.

هذا الوضع الافتراضي شكوى حية بين الممارسين، وبطاقة النموذج تعترف بذلك جزئيًا. Qwen3.8-27B تكشف عن معامل reasoning_effort بثلاثة مستويات — xhigh (الافتراضي، "للمهام المعقدة التي تتطلب تحليلًا شاملًا")، medium، وlow. وتشير كتابات المجتمع حتى سبتمبر إلى أن xhigh ينتج مراحل تفكير طويلة جدًا، وتوصي بالانتقال إلى medium أو low وتقييد ميزانية الاستدلال. وتحذر بطاقة علي بابا نفسها من أن خفض الجهد في العمل الوكيلي متعدد الأدوار "لا يقلل دائمًا من زمن إنجاز المهمة الإجمالي" — وهو أمر صريح بالنسبة لبطاقة نموذج، وتحذير من أن الإصلاح البديهي ليس دائمًا هو الإصلاح.

السياق: 1M مقابل 262K، وما يناسب فعليًا

تحمل Gemini 3.1 Pro نافذة سياق بسعة 1,000,000 رمز، مع حد أقصى للإخراج يبلغ 65,536 رمزاً. أما Qwen3.8-27B فتحمل 262,144 رمزاً بشكل أصلي، وقابلة للتوسيع إلى 1,000,000 باستخدام تحجيم YaRN، مع التوصية بميزانيات منفصلة داخلها: محتوى الاستدلال حتى 262,144 والاستجابة النهائية حتى 131,072.

حاشيتان أمينتان. يسرد جدول المواصفات لدى Artificial Analysis نافذة Qwen على أنها 256,000، بينما يقول نص الأسئلة الشائعة الخاص بـ Qwen نفسه 260K وتقول بطاقة النموذج 262,144 — هذه فروق تقريب على الرقم نفسه، لكن اذكر 262,144 لأن هذا ما تقوله البطاقة. والتمديد إلى 1M هو تقنية توسيع، وليس الشيء نفسه كنافذة أصلية بمليون رمز: استرجاع السياق الطويل عند 1M على نموذج موسّع بـ YaRN ليس ما يقيسه رقم 82.0 في AA-LCR. لم ينشر أحد درجة استرجاع لسياق 1M بالنسبة إلى Qwen3.8-27B. تعامل مع نافذة Gemini بوصفها النافذة ذات السلوك المقيس عند الطول الكامل، ومع نافذة Qwen بوصفها النافذة التي ينبغي أن تختبرها بنفسك قبل التصميم بناءً عليها — وتذكّر أنه عند تجاوز 200K من رموز الإدخال، يتضاعف سعر Gemini.

العمل الوكيلي واستدعاء الأدوات

هنا يكون التنافس غير محسوم حقًا، وهنا سيكون اختلاق فائز أمرًا سهلًا وخاطئًا. لدى Qwen3.8-27B درجات وكيلية مقيسة تفتقر إليها Gemini، والعكس صحيح.

تستند حجة Qwen إلى رقم مستقل قوي ورقم قوي من المورّد. الرقم المستقل هو τ-Banking عند 48.0 مقابل 21.4 لدى Gemini — أكثر من الضعف، على المراجعة نفسها، على معيار يتعلق باستخدام الأدوات متعدد الخطوات داخل بيئة مصرفية. أما رقم المورّد فهو بطاقة Alibaba الخاصة، التي تُدرج OSWorld-Verified 84.3، وWebArena-Verified 64.8، وAndroidWorld 81.9، وCoWorkBench 70.7، وJobBench 33.4، وAgents' Last Exam 20.4 Pass@1. تلك تقييمات Alibaba، لم يُعِد تشغيلها أي طرف آخر، وهي تقع تحديدًا في الفئات التي تشير فيها نتيجة GDPval المقيسة استقلاليًا (45.4% مُطبّعة مقابل 13.8%) إلى الاتجاه نفسه.

حجة Gemini هي أنه يمتلك الرقم الوكيلي المطلق المرتفع الوحيد في المقارنة — τ²-Bench 95.6 — بينما لا يمتلك Qwen أي نتيجة في τ²-Bench على الإطلاق. كما يمتلك IFBench 77.1 لاتباع التعليمات، وهو فراغ آخر في جانب Qwen. ويمتلك سجل إنتاجي يمتد سبعة أشهر لا يمتلكه إصدار مفتوح الأوزان عمره خمسة أسابيع.

عامل كسر التعادل ليس درجة، بل هو الطوبولوجيا الخاصة بك. تُقاس ميزة Qwen الوكيلية على معايير أداء يعمل فيها النموذج داخل نظام برمجي كبير قائم مسبقًا لم يصممه. وتُقاس ميزة Gemini على معايير أداء يتعين على النموذج فيها أن يتبع التعليمات بدقة لفترة طويلة. هاتان مهارتان مختلفتان، وكلتاهما حقيقية.

A screenshot of the Artificial Analysis comparison page for Gemini 3.1 Pro Preview against Qwen3.8-27B, showing an Intelligence Index of 29.7 for Gemini 3.1 Pro Preview and 33.7 for Qwen3.8-27B on revision v4.3.2, with blended price rows of $1.74 and $0.47 per 1M tokens, cost per task of $1.01 and $0.67, cost to run the full Intelligence Index of $1,310 and $1,336, and the output-token breakdown beneath.

البرمجة

تنقسم البرمجة بالطريقة نفسها، ولهذا فإن سؤال "أيهما أفضل في البرمجة" ليس له إجابة واضحة هنا. يتصدر Gemini الجانب الخاص بالحوسبة العلمية — SciCode 58.7 مقابل 46.6 — كما أن مؤشره AA Coding Index البالغ 68.8 على صفحة الكتالوج الخاصة بنا يقع ضمن هامش خطأ التقريب من مؤشر Qwen البالغ 68.1، وهو داخل أي فترة ثقة تستحق الاقتباس. في العمل الطرفي الوكيلي، يكون الاثنان متقاربين في المعيار الأقدم، Qwen 79.8 مقابل Gemini 73.8 في Terminal-Bench 2.1، ولا يمكن التمييز بينهما في المعيار الأحدث، حيث ينخفض كلاهما إلى أرقام أحادية.

تدّعي بطاقة Alibaba أكثر من ذلك بكثير — SWE-bench Pro 61.7، وLiveCodeBench v6 90.3، وQwenSWEBench 79.0 — لكنها أرقام يبلّغ عنها المزوّد، وتشير الحواشي في البطاقة إلى أن SWE-bench Pro وQwenSWEBench شُغِّلا في بيئة اختبار Claude Code، وهي ليست بيئة الاختبار التي كان رقم منافس سيُستخدم بها. القول الآمن هو أنه في معيار البرمجة الوحيد الذي قاست فيه جهة ثالثة نماذج كلا المختبرين، يفصل بينهما أربع نقاط في Terminal-Bench 2.1 و1.6 نقطة في Terminal-Bench 4.0، وكلاهما ضعيفان في الأصعب.

الأوزان المفتوحة مقابل نقطة نهاية للمعاينة

هذا هو المحور الذي لا يمكن المقارنة بينهما فيه على الإطلاق، وهو ذو الأثر العملي الأكبر.

Qwen3.8-27B هو Apache 2.0، بـ27B معاملًا كثيفًا، و64 طبقة، مع مزيج هجين من الانتباه الخطي Gated DeltaNet والانتباه الكامل بنسبة 3:1 تقريبًا — التصميم الذي يجعل نافذة 262K ميسورة التكلفة للخدمة. إنه يعمل. عند تكميمه إلى 4 بتات، يتسع في نحو 17GB، أي ما يعادل وحدة معالجة رسومات استهلاكية واحدة؛ وقد نشأت منظومة ضغط كاملة حوله خلال خمسة أسابيع، من تكميمات Dynamic V3 من Unsloth، بما في ذلك بناء 1-بت تقول Unsloth إنه يعمل في 8GB بدقة تبلغ نحو 77% من الدقة الأصلية، وصولًا إلى Ternary Bonsai 2 27B من PrismML في منتصف سبتمبر. يمكنك ضبطه الدقيق، ويمكنك تدقيقه، ويمكنك تشغيله على حاسوب محمول والشبكة غير موصولة.

Gemini 3.1 Pro هو نقطة نهاية معاينة مغلقة، عمرها سبعة أشهر، بلا موعد للإتاحة العامة (GA)، وبطاقة نموذج تحذّر صراحةً من أن المعاينات قد تفتقر إلى الاستقرار والتوافر والدعم الموجود في إصدار مستقر، و—اعتبارًا من هذا الأسبوع—لوحة تحكم للمطورين يبدو أنه غادرها بهدوء. لا يمكنك تنزيله، ولا يمكنك تثبيت إصدار معيّن، ولا يمكنك التحويل الاحتياطي إلى نفسك.

إذا كنت تريد إجابة التوجيه الصادقة بدلًا من حُكم: فإن وجود نقطة التفتيش المفتوحة هو ما يجعل الاعتماد على Gemini قابلًا للاستمرار. ضَع Qwen3.8-27B خلف مسار محلي أو مُستضاف ذاتيًا كخيار احتياطي، وأبقِ Gemini 3.1 Pro على المسار الأساسي للعمل المكثّف في الاستدلال الذي يتفوق فيه بشكل قابل للقياس، وضع كليهما خلف نقطة نهاية واحدة مع تجاوز فشل تلقائي، بحيث يكون الاختفاء الصامت من لوحة تحكم شخص آخر حادثًا تمتصّه طبقة التوجيه لديك بدلًا من أن يكون انقطاعًا يراه مستخدموك. هذا ليس عرضًا ترويجيًا لمنتج — بل هو التكوين الوحيد الذي لا تجعل فيه أخبار هذا الأسبوع الأمر يكلّفك عطلة نهاية أسبوع.

اختر Gemini 3.1 Pro إذا

• أصعب أعمالك هو الاستدلال المكثّف معرفيًا وليس استخدام الأدوات على المدى الطويل — فهو يتصدّر GPQA Diamond بنتيجة 94.1 مقابل 90.5، وHumanity's Last Exam بنتيجة 47.0 مقابل 33.9، وSciCode بنتيجة 58.7 مقابل 46.6، وCritPt بنتيجة 17.7 مقابل 5.4.

• أنت بحاجة إلى مُدخلات طويلة حقًا. نافذةٌ بمليون رمز مقيسة فعليًا، مُختبَرٌ سلوكُ استدعائها على المدى الطويل، تتفوّق على نافذةٍ من 262 ألف رمز مُوسَّعة بالحيل التقنية — بشرط أن تتحمّل مضاعفة السعر بعد تجاوز 200 ألف رمز إدخال.

• زمن الحصول على الإجابة كاملة يهمّ أكثر من زمن الحصول على أول رمز، وأنت تريد 116.5 رمزًا في الثانية لا 41.3.

• أنت بحاجة إلى تعددية وسائط واسعة اليوم: إدخال الصوت والملفات والصور والنصوص والفيديو مقابل النصوص والصور والفيديو من Qwen.

• أنت على استعداد لقبول مخاطر المعاينة، ولديك خطة بديلة تحت سيطرتك.

اختر Qwen3.8-27B إذا

• تعمل وكلاؤك داخل أنظمة قائمة ضخمة — ويمثّل كل من τ-Banking من 48.0 إلى 21.4، وGDPval من 45.4% إلى 13.8% بعد التطبيع، أكبر ميزتين لنموذج واحد في أي مكان في هذه المقارنة.

• تحتاج إلى إجابة تكون صادقة لا واثقة. إن نسبة هلوسة تبلغ 30.3% مقابل 50.9% لدى Gemini هي نوع مختلف من المنتجات.

• الترخيص أو قواعد إقامة البيانات يحول دون استخدام واجهة برمجية مغلقة، أو أنك بحاجة إلى الضبط الدقيق على بياناتك الخاصة.

• تريد فاتورة لكل توكن تعادل ربع فاتورة Gemini، وتقبل أنك ستنفق الفارق على توكنات التفكير — فتكلفة تشغيل الفهرس متساوية على كليهما.

• أنت مستعد لضبط reasoning_effort نحو الأسفل من قيمته الافتراضية xhigh بدلاً من إصداره كما هو.

ما لم نتمكن من التحقق منه

للعلم، ولأن صفحة المقارنة لا تكون ذات قيمة إلا بقدر ما تُظهره من فراغات: لم يُنشر أي تقييم مستقل لـ Qwen3.8-27B عند جهد استدلال مُخفَّض، لذا فإن المقايضة بين السرعة والجودة لديه عند متوسط ومنخفض غير مقيسة. لا توجد أي درجة لاستدعاء السياق الطويل لإعداد 1M الممتد بـ YaRN. لا توجد لـ Gemini 3.1 Pro أي درجة معيارية منشورة لـ GDPval-AA، ولا توجد لـ Qwen3.8-27B أي درجة لـ τ²-Bench أو IFBench أو ITBench-SRE. ولم يقل أحد — بمن فيهم Google — لماذا غادر Gemini 3.1 Pro محدد AI Studio في 18 سبتمبر. سنحدّث هذه الصفحة عندما يتغير أي من ذلك.

A screenshot of the OrcaRouter model page for Qwen3.8 27B (obsidian/qwen3.8-27b), showing Vision, Tools, JSON and Reasoning badges, a 2026-08-15 catalogue date, a 262K-token context window, list pricing of $0.40 input and $4.21 output per 1M tokens with no cached-token rate published, a p50 time to first token of 3.92s and a p95 of 10.00s over seven days, 1023.1M tokens of traffic in the same window, and a description noting the model is served in block-FP8 with the vision tower kept at full precision.

مقارنات في هذه المقالة2

مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا