بطاقة عنوان مُولَّدة تحمل "Ember-1 مقابل LFM2.5 2.6B Base" مع العنوان الفرعي "سلوك مكتمل مقابل ركيزة خام"، فوق بطاقتين: Ember-1 — "Kimi K3 أُعيد تدريبه" و"مُقدَّم كخدمة، وليس مُنزَّلاً"؛ LFM2.5 2.6B Base — "نقطة تفتيش كثيفة 2.69B" و"بدون ضبط تعليمات".
Guides & Insights

Ember-1 مقابل LFM2.5 2.6B Base: سلوك مكتمل مقابل ركيزة خام

الكاتب

Alistair Wren

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

لا يُعد Ember-1 ولا LFM2.5 2.6B Base نموذجًا يمكنك التقاطه واستخدامه مباشرةً، وهما غير قابلين للاستخدام لسببين متعاكسين. Ember-1، الذي نشرته Fireworks Research في 23 سبتمبر 2026، هو نسخة مشتقة متخصصة من Kimi K3 التابع لـ Moonshot AI، أعاد المختبر تدريبها لتصل إلى دقة K3 باستخدام نحو 40% أقل من الرموز — سلوك مكتمل، متاح فقط كمعاينة بحثية على منصة المورّد نفسها عديمة الخوادم، دون أوزان ودون سعر معلن. LFM2.5 2.6B Base، الذي نشرته Liquid AI في 4 أغسطس 2026، هو نقطة تفتيش مدربة مسبقًا بمعاملات 2.69B بموجب LFM Open License v1.0، لم تُضبط بالتعليمات إطلاقًا، وسيكمل نصّك بدلًا من الإجابة عن سؤالك — ركيزة خام، قابلة للتنزيل اليوم، وغير مكتملة عمدًا. قراءتهما جنبًا إلى جنب طريقة جيدة لرؤية الحجتين المطروحتين بشأن من أين تأتي مكاسب الكفاءة الآن.

السؤال الذي يجيب عليه كلا النموذجين

يفترض كلا الإصدارين الفرضية نفسها: أن المكاسب السهلة الناتجة عن تكبير النموذج قد حُصّلت إلى حد كبير، وأن العمل المثير قد انتقل إلى كيفية إنفاق النموذج لما يملكه بالفعل. ويجيب المختبران عن ذلك بشكل مختلف. أخذت Fireworks Research نموذجًا حدوديًا موجودًا وغيّرت سلوكه. وبنت Liquid AI نموذجًا صغيرًا من الصفر وغيّرت النطاق. لا تمثّل أي منهما قصة معمارية جديدة، ولا يسعى أي منهما إلى تصدّر لوحة الصدارة.

جواب Ember-1: الإبقاء على النموذج، وإعادة تدريب السلوك

يترك Ember-1 بنية Kimi K3 دون تغيير ويهاجم أحد أوجه القصور المحددة. يمكن لنماذج الاستدلال أن تحرق أكثر من 90% من الرموز التي تولّدها في تفكير داخلي، وفي حلقة وكيل متعددة الجولات تُعاد هذه الآثار وتُحتسب تكلفتها من جديد في كل جولة لاحقة — تصف Fireworks Research نمو السياق الناتج بأنه تربيعي تقريبًا في عدد الجولات. ويدّعي المختبر أن استدلال K3 أطول مما تتطلبه المهمة وأن الفائض يمكن إزالته دون تغيير الإجابات. ويذكر أنه أجرى أكثر من 50 تجربة تدريب وأكثر من 200 تقييم على حزمة التدريب الخاصة به التي تعمل دون خوادم، ويقول إن طول الاستدلال انخفض بنسبة 35–50% دون خسارة في الدقة عبر سبعة معايير ومجموعتي بيانات لحركة إنتاج العملاء. كل ذلك مُبلَّغ عنه من المورّد ولم يُعَد إنتاجه.

النتائج متفاوتة على نحو يخفيه الرقم الرئيسي. تتراوح نسب تقليل الرموز لدى Ember-1 من 51.9% في Terminal Bench 2.1 إلى 5.9% في τ-2 Bench Airline. وفي اختبار A/B لكتابة الشيفرة في بيئة إنتاجية لدى أحد العملاء، انخفضت رموز الإخراج من 49.3 ألف إلى 29.9 ألف بينما ظلّت النتيجة عند 0.753 مقابل 0.751 — أي انخفاض بنسبة 71.3% في رموز الاستدلال. هذا تأثير كبير على شكل حمل عمل واحد وتأثير يكاد لا يُرى على آخر، وهو ما تتوقعه من نموذج دُرِّب على التوقف عن الإفراط في التفكير بدلًا من التفكير بدرجة أقل.

A two-column scoreboard titled "Ember-1 vs LFM2.5 2.6B Base — the scoreboard" comparing six dimensions. Ember-1: a retrained Kimi K3 derivative; parameters undisclosed; no published weights; context not published (base model 1M); published evaluation is seven benchmarks plus two A/B tests, vendor-run; obtained only as a serving preview. LFM2.5 2.6B Base: a pretrained base checkpoint with no instruction tuning; 2.69B dense parameters; weights under the LFM Open License v1.0; 131,072-token context; no published evaluation, by design; obtained by downloading and fine-tuning.

إجابة LFM2.5 2.6B Base: غيّر المقياس، واحتفظ بالوصفة

LFM2.5 2.6B Base رهان من نوع مختلف. إنه البنية الهجينة من Liquid AI على نطاق صغير: 30 طبقة، منها 22 كتلة التفاف قصير ثنائية البوابة و8 طبقات انتباه بالاستعلامات المجمّعة، مُدرَّبة على نحو 34 تريليون رمز عبر 16 لغة، بنافذة سياق تبلغ 131,072 رمزًا. وتبلغ نقطة التحقق كاملةً 2.69 مليار معامل كثيف — صغيرة بما يكفي لكي تتوقف المحادثة عن التكلفة عن كونها عن الرموز وتبدأ في كونها عن أي GPU واحد لديك فائض.

ما يجعله غير معتاد هو ما يتجنب فعله عمدًا. لا يوجد ضبط بالتعليمات، وهذا هو المغزى كله من لاحقة "Base": أعطِه سؤالًا، وسيواصل النص على نمط السؤال بدلًا من الإجابة عنه. توصي بطاقة النموذج الخاصة بـ Liquid AI نفسها به للمهام التي تتطلب ضبطًا دقيقًا مكثفًا. كذلك لا يوجد تقييم منشور له، وهذا ليس سهوًا — فتقييم نقطة تحقق أساسية على معايير اتباع التعليمات لن يقيس شيئًا، لأن السلوك الذي يجري قياسه لم يُدرَّب عليه بعد.

التباين، سطر واحد لكل بُعد

• ما هو — Ember-1: نسخة مشتقة معاد تدريبها من Kimi K3 مع استدلال مختصر. LFM2.5 2.6B Base: نقطة تحقق مدربة مسبقًا من الصفر دون ضبط بالتعليمات.

• المعلمات — Ember-1: غير معلنة؛ موروثة من Kimi K3. LFM2.5 2.6B Base: ‏2.69B كثيف.

• الأوزان — Ember-1: لم يُنشر أي منها. LFM2.5 2.6B Base: متاحة بموجب LFM Open License v1.0.

• السعر — Ember-1: لا يوجد سعر منشور؛ تُحتسب دولارات القياس المرجعي وفق بطاقة أسعار Kimi K3. LFM2.5 2.6B Base: مجاني للتنزيل؛ وأنت توفّر العتاد.

• السياق — Ember-1: لم يُنشر للمعاينة. LFM2.5 2.6B Base: 131,072 رمزًا.

• تقييم منشور — Ember-1: سبعة اختبارات مرجعية واختباران A/B، جميعها أجراها المورّد. LFM2.5 2.6B Base: لا شيء، بحكم التصميم.

• ما تحصل عليه في النهاية — Ember-1: نقطة نهاية تُنتج استدلالًا أقصر بدقة على مستوى K3. LFM2.5 2.6B Base: نقطة انطلاق يكون سلوكها أياً كان ما تدرّبه فيها.

نوعان مختلفان من الاشتياق

الفجوات في هذين الإصدارين تبدو متناظرة، لكنها ليست كذلك. غياب التقييم في LFM2.5 2.6B Base سمة من سمات الأصل نفسه: فنقطة التحقق الأساسية لا سلوك لها يمكن تقييمه، وغياب الضبط بالتعليمات ميزة موثّقة لا نقص. وهذا الغياب لا يخلق عدم يقين تجاري، لأن ما تشتريه هو ملف مرفق بترخيص، ويكتمل المُسلَّم لحظة انتهاء التنزيل.

الأجزاء المفقودة من Ember-1 غير محلولة حقًا. لا يوجد سعر منشور، لذا فإن ادعاء التكلفة هو عملية حسابية على بطاقة أسعار Kimi K3 وليس سعرًا يمكنك وضع ميزانية بناءً عليه. لا يوجد إصدار أوزان، لذا لا يمكن للنموذج أن يعيش أطول من قرار المورد بمواصلة تقديمه. ونافذة الوصول موصوفة بأنها مؤقتة: تصف Fireworks Research إصداراتها البحثية بأنها نوافذ بدون خادم لمدة أسبوعين يعتمد استمرارها على طلب المجتمع. إن معاينة قد لا تكون موجودة الشهر المقبل هي أمر مختلف عن معاينة غير مثبتة فقط، واختبار A/B الثاني للعميل في الإعلان — حوالي 35% رموز أقل لكل مهمة — يخبرك بما يتوقعه المختبر، وليس بما سيبقى متاحًا في نوفمبر.

هذا التفاوت هو الجواب الصادق على سؤال «أيّ هذين أكثر جاهزية». لا أحدهما جاهز بمعنى أن يكون تبعية إنتاجية يمكن استخدامها مباشرة. LFM2.5 2.6B Base مكتمل كمادة خام وغير مكتمل كنموذج. Ember-1 مكتمل كنموذج وغير مكتمل كخدمة.

A screenshot of the Hugging Face model card for LiquidAI/LFM2.5-2.6B-Base, showing 16,541 downloads in the last month, a safetensors model size of 3B parameters in BF16, the LFM1.0 licence, 16 languages, and a Model Details table listing LFM2.5-2.6B-Base as the pre-trained base model for fine-tuning alongside LFM2.5-2.6B for post-trained agentic workloads.

ما الذي يجب فعله مع كل منها هذا الربع

إذا كانت لديك خط أنابيب للضبط الدقيق ومهمة ضيقة بتسميات نظيفة، فإن LFM2.5 2.6B Base هو الأكثر قابلية للتنبؤ من بين الاثنين. نقطة الحفظ صغيرة، والترخيص متساهل، والمعمارية مصممة لتكون فعّالة عند الاستدلال، والعمل على تحويله إلى شيء مفيد — ضبط دقيق بإشراف، ومجموعة تقييم، وحزمة تقديم — هو عمل تملكه بالفعل من البداية إلى النهاية. ستجري تقييماتك الخاصة في كل الأحوال، لأن Liquid AI لم تنشر أيًا منها.

إذا كانت لديك عبء عمل لوكيل مستضاف تهيمن رموز الاستدلال على فاتورته، فإن Ember-1 يعالج بندًا حقيقيًا في معادلة تكلفتك، ويستحق أسبوعين من الجهد. الاختبار الصحيح هو حركة ظلّية مقابل نظامك الحالي: أرسل حصة من الطلبات الحقيقية إلى كليهما، وقارن المخرجات، واترك النتائج الحية دون تغيير. وهذه أيضًا هي النصيحة التي قدّمتها تغطية نقدية مستقلة للإصدار، إلى جانب تحذير منصف — فمضغ التفكير ينطوي على خطر فقدان خطوة كان النموذج يحتاجها، وفي وكيل يظهر ذلك لاحقًا كاستدعاء أداة خاطئ لا كجملة خاطئة.

لا يوجد أي من النموذجين على OrcaRouter. إذا أردت اختبار النمط بدلًا من هذين الكيانين — نموذج صغير قابل للضبط الدقيق ونموذج استدلال كبير مُستضاف في خط أنابيب واحد — فهذا بالضبط ما صُممت له لغة التوجيه DSL: ركّب عدة نماذج في استدعاء واحد ودع كل واحد منها يتولى الجزء الذي يتقنه، خلف مفتاح واحد وفاتورة واحدةتستحق هذه المقارنة أن تُعقد على مستوى البنية حتى مع بقاء كلتا نقطتي النهاية المحددتين بعيدتَي المنال.

الصفقة، المُعلنة مرة واحدة

يبيع Ember-1 يقين السلوك وعدم يقين التوريد: نموذج يُدافَع عن جودته بعناية وتكون إتاحته مشروطة صراحةً. ويبيع LFM2.5 2.6B Base يقين التوريد وعدم يقين السلوك: ملف ستمتلكه دائمًا وتكون كفاءته بالكامل دالةً على التدريب الذي تُدخله فيه. الفرق التي تواجه مشكلة في الخدمة ولا تملك قدرة على التدريب ينبغي أن تراقب النسخة التجريبية وتأمل أن تصبح دائمة. والفرق التي تملك قدرة على التدريب ومهمة ضيقة ينبغي أن تنزّل النسخة الأساسية وتتوقف عن انتظار خارطة طريق أي أحد.

A screenshot of OrcaRouter's model page for Kimi K3, showing the MoonshotAI Kimi K3 listing priced at $3.00 per 1M input tokens and $15.00 per 1M output tokens, a p50 time-to-first-token of 8.00s, 749.2M tokens of traffic over seven days, a 1M-token context window and a Python snippet calling api.orcarouter.ai/v1.

ما يُظهره هذا الاقتران حقًا هو أن «الكفاءة» لم تعد تعني شيئًا واحدًا. فبالنسبة إلى Ember-1، تعني رموزًا أقل بالجودة نفسها على عتاد شخص آخر. وبالنسبة إلى LFM2.5 2.6B Base، تعني نموذجًا صغيرًا بما يكفي بحيث لم يعد العتاد عتاد شخص آخر على الإطلاق. هاتان إجابتان جيدتان ولا يمكن استبدال إحداهما بالأخرى.