بطاقة عنوان مُولَّدة تحمل نص "Ember-1" مع عنوان فرعي: "جودة Kimi K3 مع عدد رموز استدلال أقل بنحو 40%"، وثلاث بطاقات: تقليل الاستدلال بنسبة 35-50%، وTerminal Bench 2.1 بنسبة 82.0%، وإصدار معاينة بحثية. ويقرأ سطر تذييل: أرقام مُبلَّغ عنها من Fireworks، غير مُعاد إنتاجها؛ نُشر في 23 سبتمبر 2026.
Guides & Insights

Ember-1 يقلّص استدلال Kimi K3 بنسبة 40% — والقصة كلها في التفاصيل الدقيقة

الكاتب

Alistair Wren

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

الرقم الذي سيُقتبس هو 40%. نشرت Fireworks Research نموذج Ember-1 في 23 سبتمبر 2026، واصفةً إياه بأنه مشتق متخصص من Kimi K3 التابع لـ Moonshot AI، يحافظ على دقة K3 مع استهلاك نحو 40% توكنات أقل للوصول إلى ذلك. هذا ادعاء حقيقي ومحدد بشكل غير معتاد، ويأتي مصحوبًا بثلاثة أشياء: ورقة قياس كاملة مع أعمدة تقليل التوكنات، واختباري A/B لعملاء من حركة برمجة إنتاجية، وحالة إصدار ليست التوفر العام. صدر Ember-1 كمعاينة بحثية، على منصة البائع الخاصة بلا خوادم، مع نافذة وصول مدتها أسبوعان وقرار استمرارية يعتمد على الطلب. إن فهم أي جزء من هذا هو منتج تم شحنه وأي جزء هو نتيجة بحثية قوية الحجة هو التمرين بأكمله.

هناك أيضًا تضارب في الأسماء يجدر توضيحه قبل أي شيء آخر. فقد أمضى مشروع بحثي مفتوح منفصل يُدعى Ember (الإصدار 0.1.5، من Slow Lit Labs) عام 2026 في نشر تقييمات للاتساق بعيد المدى، وهو لا يرتبط بهذا النموذج بأي شكل. وأي شيء تقرأه عن فشل Ember في التغلب على Qwen3-8B ضمن إعدادات استدلال متطابقة يتعلق بذلك المشروع. أما Ember-1، موضوع الحديث هنا، فهو مشتق من Kimi K3 من Fireworks Research.

ما هو Ember-1 في الواقع

Ember-1 ليس بنية جديدة وليس نموذجًا أساسيًا جديدًا. إنه Kimi K3، أُعيد تدريبه ليستدل بشكل أكثر إيجازًا. أجرت Fireworks Research أكثر من 50 تجربة تدريب وأكثر من 200 تقييم على منظومة التدريب اللاخادمية الخاصة بها، عبر الرياضيات والبرمجة واتباع التعليمات والمحادثة والبحث واستخدام الأدوات وهندسة البرمجيات، بهدف صريح هو إزالة الاستدلال الذي لا يغيّر الإجابة. يقول المختبر إن طول الاستدلال يمكن تقليصه بنسبة 35–50% دون خسارة في الدقة عبر سبعة معايير ومجموعتي حركة إنتاج خاصتين بالعملاء. كل رقم من هذه الأرقام مُبلَّغ عنه من المورّد ولم يُعَد إنتاجه بشكل مستقل؛ ولم ينشر أي طرف ثالث تشغيلًا لـ Ember-1 حتى وقت كتابة هذا النص.

تكتسب طريقة الطرح أهمية لأن البديل الواضح كان موجودًا بالفعل. يأتي Kimi K3 مزوّدًا بإعدادات جهد الاستدلال، والطريقة الأسهل لاستهلاك رموز أقل هي خفض مستوى الجهد. تقول Fireworks Research إنها جرّبت ذلك، وأن الإعداد المنخفض أهدر قدرًا كبيرًا من الجودة — وهي نتيجة مألوفة لدى أي شخص ضبط مستويات الجهد على نموذج استدلالي. وتزعم Ember-1 أن مقبض ضبط الجهد خشن، وأن إعادة التدريب هي الحل الأمثل.

A single-column scoreboard titled "Ember-1 — the scoreboard": base model Kimi K3 (Moonshot AI); what changed, shorter reasoning with the same answers; token reduction claimed 35-50% across seven benchmarks; Terminal Bench 2.1 82.0% against K3 Max 80.9%; SWE-bench Verified 92.2% against K3 Max 93.2%; weights and price, none published — research preview. The footer states every figure is Fireworks-reported and unreproduced.

لماذا تستحق توكنات الاستدلال كل هذا الجهد

فاتورة نموذج الاستدلال لا يهيمن عليها جوابه. تشير Fireworks Research إلى أن K3 قد ينفق أكثر من 90% من الرموز التي يولّدها على الاستدلال الداخلي قبل أن يكتب أي شيء يراه المستخدم. في طلب واحد، لا يعدو ذلك كونه مكلفًا فحسب. أما في حلقة وكيل متعددة الأدوار، فإن التكلفة تتراكم، لأن كل دور يعيد تشغيل المحادثة السابقة، فتُقرأ آثار الاستدلال من الأدوار السابقة مرة أخرى ويُعاد احتساب تكلفتها في كل استدعاء لاحق. وتصف Fireworks Research نمو السياق بشكل تربيعي تقريبًا مع عدد الأدوار. هذا هو الهدف الفعلي من هذا الإصدار، ولهذا يكون المقياس الأبرز انخفاض عدد الرموز بنحو 40% بدلًا من قفزة في الجودة.

تفسّر الآلية الخطر أيضًا. فالضغط الذي يزيل تفكيرًا متأنّيًا مهدورًا مجاني؛ أما الضغط الذي يزيل خطوة كان النموذج يحتاجها فليس كذلك. ونمط الفشل المُبلَّغ عنه على نطاق واسع لتقليص الاستدلال المفرط في العدوانية هو نموذج يتخطى فحصًا وسيطًا ويقفز إلى استنتاج، وهو ما يظهر في وكيل لاحقًا كاستدعاء أداة خاطئ لا كجملة خاطئة. ويُقرأ التشديد المتكرر من Fireworks Research على الجودة المكافئة كردّ على هذا القلق، وأرقام A/B هي أقرب شيء إلى دليل عليه — مع التحفظ المعتاد بأن مجموعات الاختبار ومعايير النجاح وأحجام العينات اختارها جميعًا الطرف الذي يقدّم الادعاء.

ورقة القياس المرجعي، مع إرفاق مصدرها.

هذه أرقام Fireworks Research، غير معاد إنتاجها. العمود الأيمن هو الجزء الذي يستحق القراءة المتأنية: فهو يقرن كل نتيجة بعدد الرموز والدولارات التي استهلكتها نسبةً إلى K3 Max.

• Terminal Bench 2.1 (n=89) — Ember-1 82.0% مقابل K3 Max 80.9%، وK3 High 77.6%، وK3 Low 76.4%؛ رموز أقل بنسبة 51.9%، و23.10 دولارًا أقل لكل مهمة.

• SWE-bench Verified (n=500) — Ember-1 ‏92.2% مقابل K3 Max ‏93.2%؛ رموز أقل بنسبة 15.5%، و68.10 دولارًا أقل لكل مهمة.

• SWE-Interact (n=75) — Ember-1 20.0% مقابل K3 Max 21.3%، وK3 High 13.3%، وK3 Low 6.7%؛ رموز أقل بنسبة 32.5%.

• DeepSWE 1.1 ‏(n=113) — Ember-1 ‏75.2% مقابل K3 Max ‏66.4%؛ رموز أقل بنسبة 23.7%، و‏126.90 دولارًا أقل لكل مهمة.

• τ-2 Bench Airline (n=50) — Ember-1 66% مقابل K3 Max 64%، وK3 High وLow كلاهما 64%؛ رموز أقل بنسبة 5.9%، و0.30 دولار أقل لكل مهمة.

ثمة أمران يبرزان. أولًا، يفوز Ember-1 فوزًا صريحًا في Terminal Bench 2.1 وDeepSWE 1.1 بينما يخسر بفارق ضئيل في SWE-bench Verified وSWE-Interact — وهو نمط يتسق مع نموذج لم يفقد قدرته بقدر ما غيّر المهام التي ينفق فيها التأمل. ثانيًا، التوفير في التوكنات غير متساوٍ بشكل صارخ: 51.9% في Terminal Bench مقابل 5.9% في τ-2 Airline. ومهما تعلّمه Ember-1، فهو ليس تقليصًا موحّدًا بنسبة 40% في التفكير. إن عبارة "نحو 40%" الواردة في العنوان تمثّل متوسطًا عبر نطاق يمتد من نحو 6% إلى نحو 52%، ولا ينبغي لفريق يشبه عبء عمله τ-2 Airline أن يتوقع أن يشعر بذلك.

اختبارات A/B الإنتاجية هي الدليل الأكثر إقناعًا، تحديدًا لأنها لم تُصمم لتكون معايير قياس. في عبء عمل برمجي لأحد العملاء، سجّل Ember-1 نتيجة 0.753 مقابل 0.751 لـ K3، واستغرق 21.4 خطوة مقابل 23.8، وأنتج 29.9 ألف رمز إخراج مقابل 49.3 ألف — انخفاض بنسبة 71.3% في رموز الاستدلال و39% في إجمالي الرموز، مع جودة متكافئة تقريبًا. وشهد عميل ثانٍ انخفاضًا بنحو 35% في الرموز لكل مهمة عند جودة مماثلة، وتقول Fireworks Research إنها نفّذت التحويل على حركة البرمجة والعمل التعاوني الداخلية الخاصة بها أولًا، مع النتيجة المُبلَّغ عنها أنه لم يلاحظها أحد. تعامل مع كل ذلك باعتباره مُبلَّغًا من البائع، لكن تعامل معه كأقوى شكل من الأشكال المُبلَّغ عنها من البائع: بيانات تفضيل A/B وإكمال المهام أصعب في التلاعب من لوحة الصدارة.

هناك تقييم آخر، على Doximity's Bedside Bench — 500 حالة سريرية مصادق عليها من قبل أطباء عبر عشر فئات — حيث تدّعي Fireworks Research أن Ember-1 وضع حدًا جديدًا لباريتو من حيث التكلفة لكل مهمة، مقارنةً بنماذج مفتوحة ومغلقة تشمل GPT-5.6 Sol وGPT-6 Astra وClaude Opus 5. هذا ادّعاء من مورّد حول موقع على حدود باريتو، وهو ادّعاء حول مقايضة ثنائية الأبعاد وليس حول نتيجة واحدة، ولا يكون أفضل من الافتراضات المتعلقة بالتكلفة التي يقوم عليها. جاءت تلك الافتراضات من بطاقة أسعار API العامة الخاصة بـ Kimi K3. وهو ما يقودنا إلى الجزء من القصة الذي يمكن للقارئ التحقق منه فعليًا اليوم.

A screenshot of OrcaRouter's model page for Kimi K3, showing the MoonshotAI Kimi K3 listing priced at $3.00 per 1M input tokens and $15.00 per 1M output tokens, a p50 time-to-first-token of 8.00s, 749.2M tokens of traffic over seven days, a 1M-token context window, and a Python snippet calling the model at api.orcarouter.ai/v1.

النموذج الأساسي هو الجزء الذي يمكنك توجيهه بالفعل.

حجة التكلفة بأكملها الخاصة بـ Ember-1 تُقاس مقابل الأسعار المنشورة لـ Kimi K3. أصبح Kimi K3 متاحًا مباشرةً على OrcaRouter بسعر 3.00 دولارات لكل مليون رمز إدخال، و0.30 دولار لكل مليون رمز إدخال مخزّن مؤقتًا، و15.00 دولارًا لكل مليون رمز إخراج، مع نافذة سياق تبلغ 1,048,576 رمزًا. هذه هي نفس بطاقة الأسعار التي تستخدمها مقارنة Fireworks Research، ومن المفيد أن تعرف أن التوفيرات في أعمدة تقليل الرموز تُحسب مقابل أرقام يمكنك رؤيتها بنفسك بدلًا من مقابل نموذج تكلفة داخلي خاص بأحد المورّدين.

Ember-1 نفسه ليس على OrcaRouter. وهو متاح فقط عبر منصة المورّد الخاصة بدون خادم، كمعاينة بحثية، ولم تنشر Fireworks Research سعرًا له — لذا فإن الأرقام بالدولار في جدول القياس مستمدة من أسعار K3 وعدد الرموز، وليس من بطاقة أسعار Ember-1 موجودة. إذا كانت الحسابات هي ما يهمك، فإن التسلسل الصادق هو تسعير عبء العمل على مسار K3 اليوم، وأخذ نسب تقليل الرموز كحد أعلى لما قد يوفره التحويل، وانتظار سعر منشور قبل نمذجة التوفير كمال.

ما يقدّمه OrcaRouter فعلًا هنا هو التحوط. المعاينة البحثية بنافذة وصول مدتها أسبوعان هي بالضبط نوع النموذج الذي تريد تجربته دون المراهنة عليه بمسار إنتاجي، والطريقة لفعل ذلك دون عقد ثانٍ هي وضعه خلف نفس نقطة النهاية مثل كل ما تستدعيه. تقدّم OrcaRouter أكثر من 200 نموذج خلف واجهة API واحدة مع تجاوز فشل تلقائي، لذا فإن نموذج معاينة يتبيّن أنه غير متاح الشهر المقبل يصبح تغييرًا في التوجيه بدلًا من عملية ترحيل. لا شيء في Ember-1 يفرض ذلك — لكن لا شيء في نافذة مدتها أسبوعان يدفع ضد ذلك أيضًا.

ماذا نفعل بهذا الإصدار

إذا كنت تشغّل Kimi K3 بالفعل في حلقة وكيل، فإن أرقام Ember-1 تصف فاتورتك. مشكلة إعادة التشغيل متعددة الأدوار حقيقية، وهي التكلفة المهيمنة في تشغيلات الوكلاء الطويلة، والنموذج الذي يختصر تتبعاته الخاصة دون تغيير إجاباته يستحق وقت التقييم. الاختبار الصحيح ليس جدول المعايير القياسية؛ بل هو حركة المرور الخاصة بك، تُشغَّل في الظل — أرسل نسبة من الطلبات الحقيقية إلى كلا النموذجين، وقارن المخرجات، واترك النتائج الحية دون مساس لمدة أسبوع أو أسبوعين قبل تغيير أي شيء. هذه أيضًا هي النصيحة التي يقدمها القراء النقديون للإصدار نفسه، وهي سليمة.

إذا شغّلت حمل عمل منخفض التروّي، أو حملًا تهيمن عليه نداءات قصيرة أحادية الدور، فإن الوفورات تتبخر إلى حد كبير ويصبح صف τ-2 Airline هو توقعك الواقعي. وإذا كنت بحاجة إلى التزام بمستوى الإنتاج — سعر، ومستوى خدمة، وضمان بوجود نقطة النهاية بعد ستة أشهر — فإن Ember-1 لا يقدّم ذلك بعد. إنه معاينة بحثية يربط Fireworks Research صراحةً استمراريته بالطلب. والسؤال المثير للاهتمام خلال الشهر المقبل هو ما إذا كانت نافذة الأسبوعين ستصبح خيار تقديم دائم، وما إذا كان طرف ثالث سيعيد إنتاج أي من الأرقام. وإلى أن يحدث أحد هذين الأمرين، فهذه نتيجة قوية للقراءة ونتيجة سيئة لبناء ميزانية عليها.

A screenshot of OrcaRouter's model catalogue headed "Models — 203 models · 15 providers · one API, one bill", with filter panels for input modalities, context length and input price, a "How to call any model" panel showing a POST to api.orcarouter.ai/v1/chat/completions, and model cards for OpenAI GPT-6 Luna, OpenAI GPT-6 Sol, Anthropic Claude Opus 5 and Grok 4.7 with their per-million-token rates.

لا ينبغي أن يُفهَم أيٌّ من ذلك على أنه انتقاصٌ من العمل. إن إزالة الاستدلال دون إزالة الدقة مشكلةٌ أصعب من إضافته، والقيام بذلك فوق نموذجٍ حدودي يملكه آخرون بدلًا من تدريب نموذجك الخاص هو الشكل الذي اتخذته كثيرٌ من أعمال القدرات في 2026. و«Ember-1» هو أول إصدار في ما تقول «Fireworks Research» إنه سيكون سلسلةً مستمرة، والقالب — خُذ نموذجًا جيدًا أصلًا، وأعد تدريب محورٍ واحد من سلوكه، وبِع الفارق بالتوكنات — جديرٌ بالمتابعة بغض النظر عن الكيفية التي ستُستقبَل بها هذه المعاينة بعينها.