
TwIL-LM3-Pro مقابل LFM2.5 2.6B Base: أحدهما مُكتمل، والآخر نقطة انطلاق
- openaiجديدOpenAI: GPT-6.1 Sol2026-09-2952الذكاء
- anthropicجديدAnthropic: Claude Sonnet 5.52026-09-2856الذكاء
- typesafeجديدTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 لكل مليون رمز · 219 tok/s
- OpenAIجديدOpenAI: GPT-6 Luna2026-09-2238الذكاء
- OpenAIجديدOpenAI: GPT-6 Sol2026-09-2248الذكاء
- AnthropicجديدAnthropic: Claude Opus 5.52026-09-2258الذكاء
- xAIجديدGrok 4.72026-09-2146الذكاء
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 لكل مليون رمز · 118 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 لكل مليون رمز · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- OpenAIOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245الذكاء76البرمجة
- AnthropicAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 لكل مليون رمز · 47 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 لكل مليون رمز · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
أكثر ما يكشف بشأن المقارنة المنشورة بين TwIL-LM3-Pro و LFM2.5 2.6B Base هو أن webAI لم تنشر أي مقارنة ضد 2.6B على الإطلاق. تضع جداول المسار A والمسار B الخاصة بـ webAI متخصصها في المنطق الصوري بحجم 3.66B في مواجهة مجموعة من أذرع المقارنة — نموذج Granite الأساسي الخاص بها، وVibeThinker-3B، وQwen3-8B، وQwen3.5-4B، وLlama-3.2-3B، وgpt-oss-120b — والمدخل الذي اختاروه من Liquid AI هو LFM2.5-8B-A1B، وليس 2.6B. أما 2.6B الذي يظهر فعلاً في الجدول فهو `LFM2-2.6B`، الجيل السابق، وهو نموذج مختلف له عملية تدريب مسبق مختلفة. هذا الإغفال ليس سهواً. إن LFM2.5 2.6B Base نقطة تفتيش مدربة مسبقًا بدون ضبط بالتعليمات، واختبارات اتباع التعليمات ليست اختبارًا بُني لخوضه.
إذن تقارن هذه الصفحة بين منتج نهائي ومادة خام. التأطير على نمط Aion — أحد النموذجين له نتيجة والآخر لا — ينطبق، لكن السبب أكثر تحديدًا وأكثر إثارة للاهتمام: أحدهما خضع للتدريب اللاحق ثم دُمج، والآخر يتوقف عمدًا قبل التدريب اللاحق، والوثيقتان اللتان تصفانهما تجيبان عن أسئلة مختلفة عن قصد.
عددان لمعلمتين لا يمثلان القياس نفسه
TwIL-LM3-Pro هو نموذج كثيف بمعاملات يبلغ عددها 3.66 مليار، وكلها مُفعّلة عند كل رمز. وهو ينحدر من `ibm-granite/granite-4.2-3b` عبر الضبط الدقيق باستخدام LoRA، والتقطير متعدد المسارات، ودمج نقاط التحقق، ودمج WiSE-FT عائدًا نحو الأساس، ومرحلة GRPO الموزونة بالإنتروبيا — والناتج الذي أطلقته webAI هو السياسة المدموجة، وليس محول LoRA، لذا يعمل بشكل مستقل.
LFM2.5 2.6B Base هو نموذج يبلغ 2.69 مليار معامل عبر 30 طبقة: 22 كتلة التفاف قصير مزدوجة البوابة متداخلة مع 8 طبقات انتباه استعلامات مجمّعة. هذا التصميم الهجين بين الالتفاف والانتباه هو معمارية Liquid على الجهاز، وهو السبب وراء كون أرقام الإنتاجية لدى العائلة كما هي عليه، بدلًا من كونها مجرد دالة على عدد المعاملات وحده. دُرّب على 34 تريليون رمز مع مفردات من 128,000 رمز، ويحمل نافذة سياق تبلغ 131,072 رمزًا.
لا يفصل بين العددين سوى نحو 36%، وقد جرى التوصل إليهما عبر معماريات مختلفة كليًا؛ لذا لا يعني أيٌّ من «3.66B يتفوق على 2.69B» ولا عكسه شيئًا بوصفه ادعاءً بالجودة. وتشير بطاقة النموذج الخاصة بـ webAI نفسها إلى هذه النقطة بشكل غير مباشر حين تمتنع عن مقارنة حيرة المجموعة النصية بين المُرمِّزات — فمفردات TwIL-LM3-Pro تبلغ 100,352، ومفردات LFM2.5-2.6B تبلغ 128,000، والحيرة تُحسب لكل توكن.
ما الذي يزيله "Base"، ولماذا يغيّر لوحة النتائج
تنشر Liquid AI نموذج LFM2.5 2.6B في صيغتين: نقطة الحفظ المدرَّبة لاحقًا، والمضبوطة لأحمال العمل الوكيلية في أُطُر الوكلاء الشائعة، ونموذج Base، الموصوف في بطاقته الخاصة بأنه «نقطة الحفظ النصية المُدرَّبة مسبقًا، المستخدَمة لإنشاء جميع متغيرات LFM2.5-2.6B». إن Base هو مُدخَل الضبط الدقيق، لا منتج. فهو لا يمتلك ضبطًا بالتعليمات، ولا قالب محادثة يستحق الذكر، ولا تقييمًا منشورًا — لأن تقييم نموذج أساسي على مهام اتباع التعليمات يقيس الشيء الخطأ.
موقف TwIL-LM3-Pro هو العكس. قيمته كلها تكمن في حزمة ما بعد التدريب: يذكر webAI أنه على منصة الاختبار الخاصة به، رفع خط الأنابيب بوابة الماكرو داخل النطاق من 0.4313 لدى نموذجه الأساسي إلى 0.5539، مع بقاء متوسط الماكرو لـ10 مجموعات بيانات محتجزة على مستواه (من 0.7942 إلى 0.7901) بدلاً من الانهيار. إن الحفاظ على الأداء على البيانات المحتجزة هو الجزء الصعب في التدريب اللاحق المتخصص، وهو الجزء الذي لا يستطيع Base الإجابة عنه.
وهنا أيضًا تُثمر مقارنة الأحجام في جداول webAI. يُذكر أن TwIL-LM3-Pro متقدم على LFM2.5-8B-A1B في كلا المقياسين الكليين المحجوزين — 0.7901 مقابل 0.7884 على مجموعة العشر مجموعات، و0.7425 مقابل 0.7378 على الأربع عشرة — بأقل من نصف عدد معاملات نموذج MoE ذاك. وهذه نتيجة مكافئة حقيقية، وهي متاحة تحديدًا لأن LFM2.5-8B-A1B نموذج مُدرَّب لاحقًا يمكن تشغيله عبر إطار تعليمات. أما النموذج الأساسي فلا يمكن، ولهذا لم يحصل 2.6B أبدًا على عمود.
الأبعاد التي تستحق المواءمة
• المعاملات — TwIL-LM3-Pro 3.66B كثيف مقابل LFM2.5 2.6B Base 2.69B (30 طبقة: 22 التفاف + 8 GQA).
• التدريب اللاحق — LoRA SFT، والتقطير، ودمج WiSE-FT، وGRPO عند الخطوة 2580 مقابل عدمه؛ إن Base هو ناتج التدريب المسبق بحكم التصميم.
• نافذة السياق — 131,072 رمزًا لكليهما، موروثة من قاعدتيهما الأساسيتين.
• المفردات — 100,352 رمزًا مقابل 128,000، ولهذا السبب لا يمكن المقارنة بين حيرتهما.
• اللغات — الإنجليزية فقط مقابل سبعة عشر لغة، بما في ذلك العربية والصينية واليابانية والكورية والإسبانية والتايلاندية.
• تنسيق التفكير — يُصدر TwIL-LM3-Pro كتلة `<think>` افتراضيًا ويسترسل في الاستدلال (بمتوسط 1,902 رمزًا داخل النطاق، مع بلوغ 24.2٪ من عمليات التوليد سقف الطول) مقابل نقطة تحقق أساسية بدون أي تنسيق تعليمات على الإطلاق.
• رخصة — رخصة webAI غير التجارية الإصدار 1.0 مقابل رخصة Liquid's LFM المفتوحة الإصدار 1.0.
• ما الغرض منه — نقطة نهاية استدلال بالمنطق الصوري مقابل نقطة انطلاق للضبط الدقيق.
تستحق سطور السياق حاشيةً يقدّمها كلا النموذجين: يحمل كلٌّ منهما 131,072 رمزًا موروثةً من التدريب المسبق، ولم يتحقق أيٌّ من المورّدين من سلوك السياق الطويل — وتقول بطاقة TwIL-LM3-Pro إن كل نتيجة منشورة قيست داخل نافذة من 8,192 رمزًا. الأرقام المتطابقة هنا موروثة، لا مُبرهَن عليها.
الرخصة، وما الغرض القانوني لكل واحدة منها
يسمح ترخيص webAI Non-Commercial الخاص بـ TwIL-LM3-Pro بالاستخدام الشخصي ويتطلب اتفاقًا منفصلًا مع webAI للنشر الذي يولّد إيرادات. يُطرح LFM2.5 2.6B Base بموجب ترخيص LFM Open License v1.0 الخاص بـ Liquid، الذي تُبلغ عنه واجهة Hugging Face API باسم `license: other` بدلًا من معرّف SPDX قياسي — اقرأ ملف الترخيص قبل التخطيط بناءً عليه، لأن الشروط خاصة بـ Liquid وليست قالبًا معترفًا به.
ليس أي من الترخيصين هو Apache 2.0، ومن الخطأ التعامل مع "الأوزان المفتوحة" كمرادف لـ "متساهل تجارياً". الفرق العملي بينهما يكمن في ما يحميه الترخيصان: فباحث غير تجاري يمكنه استخدام كليهما، وشركة تبني منتجًا تحتاج إلى التحقق من كليهما، والغرض الكامل لـ Base — أن يُضبط بدقة ليصبح منتجًا لشخص آخر — يجعل شروطه الدقيقة أكثر أهمية مما تبدو.
أين يقع كل واحد في المكدس
يُعدّ {{Base}} الخيار الصحيح عندما تنوي التدريب. إذا كانت مشكلتك مهمة توسيم ضيقة النطاق، أو رأس تصنيف خاص بمجال معيّن، أو ضبطًا دقيقًا على بضعة آلاف من الأمثلة الموسومة، فإن الانطلاق من نقطة تحقق مُدرَّبة مسبقًا بحجم 2.69B ذات مفردات متعددة اللغات واسعة ومعمارية التفافية هجينة مصمَّمة للإنتاجية يُعدّ قرارًا هندسيًا سليمًا، وتكلفة التدريب اللاحق الذي ستتخطاه هي التكلفة التي تدفعها عمدًا بدلًا منه.
TwIL-LM3-Pro هو الخيار الصحيح عندما لا تنوي التدريب وتكون المهمة بالفعل منطقًا صوريًا. تسميات الاستلزام، وصياغة عبارات Lean، والتحليلات الدلالية، ونقد البراهين هي المهام التي استهدفتها خط أنابيبها بالكامل، والبدء من نقطة تحقق خضعت بالفعل لمرحلتي الدمج والتعزيز يوفّر عليك الجزء الوحيد من هذا الذي يصعب حقًا إعادة إنتاجه — الحفاظ على مستوى المجموعة المحجوزة مع تحقيق مكاسب داخل النطاق.
الخطأ هو قراءة "متخصص بحجم 3.66B بعد التدريب" على أنه أفضل بشكل صارم من "نقطة تحقق أساسية بحجم 2.69B". فهما في مرحلتين مختلفتين من خط الإنتاج ذاته.
خدمتهم، أو الخدمة من حولهم
لا يمثل أي من النموذجين مسارًا في كتالوج OrcaRouter اليوم، والسبب يختلف في كل حالة. TwIL-LM3-Pro مرخّص لأغراض غير تجارية وليس له نقطة نهاية مستضافة؛ أما LFM2.5 2.6B Base فهو ناتج ضبط دقيق لا يقدّمه أحد كنقطة نهاية استدلال عن قصد. المكان الذي يستحقه الموجّه هو طبقة أعلى، في العمل المحيط بنموذج متخصص: توليد بيانات التدريب التي ستضبط Base عليها وتصفيتها، وتوسيع المطالبات التي ستغذي بها نموذجًا للمنطق الصوري، وتقييم المخرجات. تلك نداءات نصية، وهي تعمل عبر نقطة نهاية واحدة متوافقة مع OpenAI مقابل أكثر من 200 نموذج بسعر قائمة المزوّد مع هامش مضاف بنسبة 0%، لذا يسري تخفيض سعر المزوّد في اليوم نفسه، ويكون الاستبدال من نموذج توليد بيانات إلى آخر مجرد تعديل إعدادات بدلًا من علاقة مورّد ثانية.
يُعد تجاوز الفشل التلقائي أكثر أهمية من المعتاد في مسار الضبط الدقيق، لأن مهمة دفعية تتعطل عند 80% تهدر التشغيل بأكمله. إن مفتاحًا واحدًا عبر نماذج التوليد، مع بديل يعيد الطلب عند خطأ من المزوّد، يمثل قطعة بنية تحتية أصغر من ثلاث عمليات تكامل API.

أي واحد، تحدده نيتك.
إذا كنت تُدرِّب، فاختر Base. وإذا كنت تستنتج على منطق صوري ويسمح ترخيصك باستخدامك، فاختر TwIL-LM3-Pro. وإذا كنت تحتاج اليوم إلى نموذج صغير يتبع التعليمات ولا يناسبك أيٌّ من القيدين، فاستخدم النموذج الشقيق المُدرَّب بعد التدريب لـ LFM2.5 2.6B — النموذج الذي تنشره Liquid فعلاً لهذا الغرض — واترك Base للضبط الدقيق الذي كنت تخطط له على أي حال.


