بطاقة عنوان مُولَّدة تحمل نص "Ember-1 vs Qwen3.8-Max" مع عنوان فرعي "مشتقّ مقتصد في الرموز في مواجهة الطراز الرائد"، وفوق بطاقتين: Ember-1 — "يُدّعى توفير 40% من الرموز" و"لا سعر معلن"؛ Qwen3.8-Max — "دولاران للإدخال، 6 دولارات للإخراج" و"سياق بمليون رمز".
Guides & Insights

إيمبر-1 مقابل Qwen3.8-Max: المشتق المقتصد في الرموز ضد الرائد

الكاتب

Alistair Wren

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

كلا النموذجين في هذه المواجهة يمتلكان رقمًا حقيقيًا على نفس المعيار، ومع ذلك لا يحسم أي شيء. Ember-1 هو مشتق متخصص من Fireworks Research للنموذج Kimi K3 من Moonshot AI، نُشر في 23 سبتمبر 2026، ويُبلغ عن 82.0% على Terminal Bench 2.1 مع ما يقرب من نصف الرموز التي ينفقها نموذجه الأساسي. Qwen3.8-Max هو النموذج الرائد لـ Aliba​ba — نموذج خليط خبراء متناثر بحوالي 2.4 تريليون معامل مع حوالي 95 مليار نشط لكل رمز — متاح عمومًا منذ 3 أغسطس 2026، ويُبلغ عن 86.6% على نفس المعيار. كلا الرقمين مُبلغ عنهما من قبل المورّد، وكلا المختبرين شغّل منصة التقييم الخاصة بهما، وفجوة 4.6 نقطة بين إعدادي تقييم غير منشورين ليست حكمًا. ما يمكن مقارنته هو المال، وهنا تصبح هذه المواجهة مثيرة للاهتمام: أطروحة أحد النموذجين بالكامل هي أنه لا ينبغي لك الدفع مقابل الرموز التي لا تحتاجها، والآخر هو نموذج رائد بسعر 2 دولار لكل مليون مدخل و6 دولارات لكل مليون مخرج.

ما هو كل نموذج في الواقع

Ember-1 ليس نموذجًا جديدًا من أي ناحية معمارية. إنه Kimi K3 أُعيد تدريبه ليفكر بشكل أكثر إيجازًا، وقد بنته Fireworks Research عبر أكثر من 50 تجربة تدريبية وأكثر من 200 تقييم على منصة التدريب الخالية من الخوادم الخاصة به. يدّعي المختبر أن استدلال K3 أطول مما تتطلبه المهام وأن الفائض يمكن إزالته دون تغيير الإجابات — فقد انخفض طول الاستدلال بنسبة 35–50% دون فقدان الدقة عبر سبعة معايير واختبارين A/B في بيئة إنتاج العملاء. وهو متاح كمعاينة بحثية على منصة البائع الخاصة الخالية من الخوادم، دون نشر الأوزان ودون نشر السعر.

Qwen3.8-Max شيء مختلف تمامًا. فهو الطبقة الرائدة لدى Alibaba، متعدد الوسائط بشكل أصلي للنص والصورة والفيديو كمدخلات، ويحمل نافذة سياق بسعة مليون توكن، وجرى تحديثه مرتين منذ إطلاقه: تحديث بعد التدريب في 2 سبتمبر 2026 موجّه إلى البرمجة والعمل المكتبي الاحترافي، وطبقة خدمة أسرع أُعلن عنها في 22 سبتمبر 2026. وتضع Alibaba في مواجهة GPT-5.5 وClaude Opus 4.7 وGemini 3.1 Pro، وتعكس ورقة التقييم المنشورة لها ذلك الطموح — GPQA Diamond 92.6، وOSWorld-Verified 86.1، وSWE-bench Pro 67.7، وPaperBench 93.0، وIFBench 82.8، وHumanity's Last Exam عند 43.6، وكلها مُبلَّغ عنها من المورّد.

A two-column scoreboard titled "Ember-1 vs Qwen3.8-Max — the scoreboard" comparing six dimensions. Ember-1: input/output price not published, computed from Kimi K3 rates of $3 and $15; context not published, base model carries 1M; text input; Terminal Bench 2.1 82.0% vendor-reported; research preview with a two-week window; not routed on OrcaRouter. Qwen3.8-Max: $2.00 in and $6.00 out per 1M tokens; 1,000,000-token context; text, image and video input; Terminal Bench 2.1 86.6% vendor-reported; generally available and priced; routed on OrcaRouter. The footer notes both Terminal Bench figures are vendor-reported and were produced on different harnesses.

بطاقات الأسعار، جنبًا إلى جنب

أحد هذين له ثمن والآخر ليس له، وهو أول لا تماثل عملي.

• المدخلات — Ember-1: لم يُنشر أي منها؛ ورقة المعايير المرجعية تحسب الدولارات من قائمة أسعار Kimi K3. Qwen3.8-Max: 2.00 دولار لكل مليون رمز على OrcaRouter.

• المخرجات — Ember-1: لم يُنشر أي منها. Qwen3.8-Max: 6.00 دولارات لكل مليون رمز.

• إدخال مخزّن مؤقتًا — Ember-1: {{1}}غير منطبق{{/1}}. Qwen3.8-Max: 0.25 دولار لكل مليون رمز لقراءات الذاكرة المؤقتة، وهو ما يعادل ثُمن سعر الإدخال، ويُحدث فرقًا هائلًا في حلقات الوكيل حيث يُعاد إرسال السياق نفسه في كل جولة.

• نافذة السياق — Ember-1: لم تُنشر للمعاينة؛ يحمل نموذجها الأساسي 1,048,576 رمزًا. Qwen3.8-Max: 1,000,000 رمز.

• تعدد الوسائط — Ember-1: نص. Qwen3.8-Max: نص وصورة وفيديو كمدخلات، ونص كمخرجات.

• الأوزان — Ember-1: لا شيء. Qwen3.8-Max: يوجد إصدار مفتوح الأوزان، لكنه نصي فقط ويفتقر إلى نافذة السياق الكاملة وإدخال الرؤية التي توفرها نقطة النهاية المخدومة.

• الوصول — Ember-1: معاينة بحثية، نافذة بلا خوادم لمدة أسبوعين، والاستمرارية مرتبطة بالطلب. Qwen3.8-Max: متاح عمومًا ومسعّر.

لاحظ أمرًا واحدًا بشأن أسعار Qwen3.8-Max قبل إجراء أي نمذجة: لقد عدّلت Alibaba باقات تسعير هذا الطراز مرارًا منذ إطلاقه، ولم تتطابق بطاقة الأسعار الدولية دائمًا مع السعر الرئيسي المعلن في أغسطس. اعتبر 2.00 دولار و6.00 دولار سعر المسار الحالي على منصتنا — الذي يمرّر سعر قائمة المزوّد كما هو دون أي هامش ربح، لذا يظهر أي تغيير من المورّد في اليوم نفسه — وتحقق من البطاقة قبل أن تخصص لها ميزانية.

لماذا لا تعمل مقارنة المعايير

نسبة Ember-1 البالغة 82.0% ونسبة Qwen3.8-Max البالغة 86.6% كلتاهما على Terminal Bench 2.1، ما يجعلهما تبدوان قابلتين للمقارنة، لكنه لا يجعلهما كذلك. تُبلّغ ورقة Ember-1 عن رقمه مقابل متغيّرات Kimi K3 التي قيّمتها Fireworks Research، على 89 عيّنة، مع فروق الرموز والتكلفة مرفقة. أما رقم Qwen3.8-Max فيأتي من ورقة التقييم الخاصة بـ Aliba​ba. مختبرات مختلفة، وأدوات تقييم مختلفة، وهياكل وكلاء مختلفة، وفي معيار تتحرك درجاته عدة نقاط بمجرد اختيار الهيكل وحده، فإن فجوة قدرها 4.6 نقاط تقع ضمن حدّ الضوضاء في المنهجية.

ما يمكنك قراءته من ورقة Ember-1 هو عمود الرموز، وهو الشيء الوحيد الذي دُرّب النموذج على تغييره. مقارنةً بقاعدته الخاصة، يستهلك Ember-1 رموزًا أقل بنسبة 51.9% على Terminal Bench 2.1، و32.5% أقل على SWE-Interact، و23.7% أقل على DeepSWE 1.1، و5.9% فقط أقل على τ-2 Bench Airline. هذا التفاوت هو الخلاصة الصادقة. النموذج الذي يقلّص التروي يستحق الكثير على المقاييس التي يفرط فيها النموذج الأساسي في التفكير، ولا يكاد يستحق شيئًا حيث لا يفعل ذلك، ولا يمكنك معرفة نوع عبء العمل الذي لديك دون قياس عبئك الخاص.

التكلفة لكل مهمة مكتملة، محسوبة بالتفصيل

إليك الحساب الذي يحسم هذا فعليًا، باستخدام أسعار Kimi K3 المنشورة كبديل عن تكلفة Ember-1، بما أنه لا تتوفر لدى Ember-1 أي أسعار. Kimi K3 بسعر 3.00 دولارات لكل مليون رمز إدخال، و0.30 دولار للمخزّن مؤقتًا، و15.00 دولارًا للإخراج — تمامًا قائمة الأسعار التي استخدمتها Fireworks Research في مقارنتها الخاصة. Qwen3.8-Max بسعر 2.00 دولار للإدخال و6.00 دولارات للإخراج، مع قراءات الذاكرة المؤقتة بسعر 0.25 دولار.

من جهة الإدخال، Qwen3.8-Max أرخص بالفعل بمقدار الثلث. ومن جهة الإخراج، إنه أرخص 2.5 مرة لكل رمز. هذا يعني أن تقليص Ember-1 للرموز لا ينافس فاتورة ثابتة — بل ينافس نموذجًا رائدًا أرخص لكل رمز قبل حدوث أي عمل على الكفاءة. أظهر اختبار A/B الإنتاجي الخاص بـ Fireworks Research انخفاض رموز الإخراج من 49.3K إلى 29.9K، أي خفض إجمالي بنسبة 39%؛ وطبّق ذلك على سعر إخراج Qwen3.8-Max وستحصل على التوفير نفسه بنسبة 39%، وهو مكسب مطلق أصغر من النسبة نفسها مطبقة على سعر K3 البالغ 15 دولارًا.

لذا فإن حجة الكفاءة لصالح Ember-1 تكون في أقوى صورها عند قياسها مقابل نموذجه الأساسي الخاص، وهي بالضبط الحجة التي يطرحها الإصدار. أما مقابل Qwen3.8-Max، تنتقل المقارنة إلى القدرة مقابل الدولار، حيث تكون السياق الأكبر للنموذج الرائد، والمدخلات متعددة الوسائط، والتوافر بسعر هي الحجج المضادة — وحيث لم ينشر أحد مقارنة وجهاً لوجه تحسم الأمر.

A screenshot of OrcaRouter's model page for Qwen3.8 Max, showing the qwen/qwen3.8-max listing priced at $2.00 per 1M input tokens and $6.00 per 1M output tokens, a p50 time-to-first-token of 1.98s, 33.3M tokens of traffic over seven days, a 1M-token context window accepting text, image and video, and a Python snippet calling api.orcarouter.ai/v1.

ما تُظهره بيانات التوجيه الخاصة بنا

اثنان من النماذج الثلاثة المعنية هنا هما مساران نشطان على OrcaRouter، ما يمنح رؤية لا تحتوي عليها أي ورقة معايير. يُقدَّم Qwen3.8-Max بسياق يبلغ 1,000,000 رمز، مع وسيط زمن كمون أول رمز يبلغ نحو 2.0 ثانية ونحو 52.7 رمز إخراج في الثانية خلال الأيام السبعة الماضية، وبمعدل خطأ يبلغ نحو 4.2%. يعمل Kimi K3 — النموذج الأساسي لـ Ember-1، والنقطة المرجعية لكل توفير تدّعيه Ember-1 — بسياق يبلغ 1,048,576 رمزًا، ووسيط زمن كمون قريب من 8.0 ثوانٍ، ونحو 43.6 رمز إخراج في الثانية، ومعدل خطأ يبلغ نحو 0.27%، على حركة مرور أعلى بشكل جوهري. أما Ember-1 نفسه فليس على OrcaRouter.

هذه الأرقام تعيد تأطير القرار. إن Kimi K3 أبطأ بدرجة كبيرة في الوصول إلى أول رمز، وأغلى بنحو الضعف لكل رمز ناتج مقارنةً بـ Qwen3.8-Max، في حين يحمل معدل خطأ أقل بكثير تحت حمل أثقل بكثير. إن نسخة مشتقة مقتصدة في الرموز من K3 تضيّق فجوة التكلفة لكنها لا تسدّ فجوة زمن الاستجابة، لأن تقصير الاستدلال يقصّر مرحلة التوليد، لا قائمة الانتظار. إذا كان عبء العمل لديك حساسًا لزمن الاستجابة أكثر من كونه حساسًا للفاتورة، فإن الطراز الرائد هو المسار الأفضل اليوم، وحديث الكفاءة ليس في صلب الموضوع.

أي واحد يجب توجيهه؟

وجّه إلى Qwen3.8-Max عندما تحتاج إلى نافذة السياق، والمدخلات متعددة الوسائط، وسعر منشور، وخدمة يمكنك رصد ميزانية لها. إنه الأكثر أمانًا من بين الاثنين بحكم بنيته: متاح للعموم، ومسعّر، ومحدَّث مرتين خلال شهرين من قِبل مورّد لديه سجل حافل في إبقاء نقطة النهاية محدَّثة.

جرّب Ember-1 عندما تهيمن رموز الاستدلال في حلقات الوكلاء الطويلة على فاتورتك، وتعمل مقابل نموذج مستضاف بدلًا من عتادك الخاص. الاختبار الصحيح هو الأسبوعان اللذان تمنحك إياهما المعاينة، بتشغيلهما في الظل مقابل حركة مرور الإنتاج، وقياس الرموز لكل مهمة مكتملة بدلًا من الرموز لكل طلب. ما ينبغي ألا تفعله هو استبداله كبديل مكافئ لنموذج رائد استنادًا إلى رقم 40% الذي يتراوح بين 6% و52% حسب عبء العمل.

إذا كان السؤال الحقيقي هو ما إذا كان ينبغي الاستمرار في تشغيل Kimi K3 أصلاً، فإنك تستطيع الإجابة عن هذا السؤال اليوم دون أي معاينة: فكلٌّ من Kimi K3 وQwen3.8-Max متاحان على OrcaRouter خلف مفتاح واحد، بسعر قائمة المزوّد دون أي هامش ربح، مع تحويل تلقائي عند الفشل بين المزوّدين. إن مقارنة تكلفة عبء العمل لديك على كليهما هي تغيير في التوجيه، لا مشروع شراء — وهي تمنحك خط الأساس الذي يجعل أي ادعاء عن كفاءة Ember-1 قابلاً للقياس بأرقامك الخاصة بدلاً من أرقام المختبر.

A screenshot of OrcaRouter's model page for Kimi K3, showing the MoonshotAI Kimi K3 listing priced at $3.00 per 1M input tokens and $15.00 per 1M output tokens, a p50 time-to-first-token of 8.00s, 749.2M tokens of traffic over seven days, a 1M-token context window and a Python snippet calling api.orcarouter.ai/v1.

الخلاصة الصادقة هي أن هذين النموذجين مُحسّنان في مواجهة قيود مختلفة. Qwen3.8-Max مصمم ليكون أكثر ما هو متاح قدرةً ويُسعَّر وفقًا لذلك؛ أما Ember-1 فمصمم لجعل نموذج مكلف أصلًا أرخص في التشغيل. كلاهما مشروع، وسببُ مقاومة هذه المواجهة لحكم قاطع هو أن وفورات النموذج المشتق تُعرَّف نسبةً إلى قائمة أسعار يخفض النموذج الرائد سعرَها بدرجة كبيرة.

مقارنات في هذه المقالة1

مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا