بطاقة عنوان مُولَّدة تحمل النص 'FrogNano-4B-2609 vs LFM2.5 2.6B Base' مع عنوان فرعي 'وكيل 4B مكتمل في مواجهة نقطة تحقق مُدرَّبة مسبقًا بحجم 2.69B'، وثلاث شرائح تحمل النصوص 'اكتمل التدريب اللاحق بالتعلم المعزز'، و'التدريب المسبق فقط، 2.69B كثيف في 30 طبقة' و'دون ضبط بالتعليمات'، وتذييل يحمل النص 'كلا العمودين مُبلَّغ عنه من المورّد؛ لم يُقيّم أي طرف ثالث أيًّا من النموذجين'، وشعار OrcaRouter مُركَّب في الزاوية السفلى اليمنى.
Engineering & Research

FrogNano-4B-2609 مقابل LFM2.5 2.6B Base: متخصص مكتمل وكيس من الأوزان المُدرَّبة مسبقًا

الكاتب

Elias Hawthorne

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج →
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

اكتب سؤالًا في LFM2.5 2.6B Base وسوف يكمل جملتك بدلاً من الإجابة عليها. هذا ليس عيبًا — نشرت Liquid AI هذا كنقطة تفتيش مدربة مسبقًا تحت عائلة LFM2.5، مع ترك ضبط التعليمات عمدًا إلى شقيقه غير الأساسي، وتقول البطاقة بصراحة إنه مخصص للضبط الدقيق المكثف. FrogNano-4B-2609 من مايكروسوفت هو ما تبدو عليه النهاية الأخرى لذلك المسار: نفس النوع من نماذج اللغة الصغيرة، التي مرت بخمس تكرارات من التعلم المعزز على مهام مستودعات اصطناعية حتى تصدر استدعاءات أدوات منظمة وتصحيحات مرشحة من خلال حزمة من خمس أدوات. لا يوجد لأي منهما معيار مستقل منشور. الفرق هو أن أحدهم قد اكتمل تدريبه اللاحق، ومعرفة أيهما هو القرار بأكمله.

أرقام FrogNano الواردة أدناه مستمدة من بطاقة نموذج Microsoft وتقريره الفني. أما أرقام LFM فمستمدة من بطاقة Liquid AI، وملف إعدادات معماريتها، وملف ترخيصها. كل رقم يُنسب إلى أي من المورّدين مُوسَم بأنه مُبلَّغ عنه من المورّد، ولم يخضع أي من هذين النموذجين لتقييم طرف ثالث — وبالنسبة إلى LFM2.5 2.6B Base، فإن ذلك مقصود إلى حد كبير، لأن نقطة حفظ بلا ضبط بالتعليمات ليست هدفًا عادلًا لمعيار محادثة.

لا تصح المقارنة إلا إذا كنت تعرف ما الذي تقارنه.

ضع الورقتين الفنيتين جنبًا إلى جنب، وأول ما يظهر من خلل هو عدد المعاملات. إن LFM2.5 2.6B Base هو 2.69 مليار معامل كثيف موزّعة على 30 طبقة — 22 كتلة التفاف قصير مزدوجة البوابة و8 طبقات انتباه بالاستعلامات المجمّعة، دُرِّب على نحو 34 تريليون رمز عبر 16 لغة، بمفردات من 128,000 رمز وسياق من 131,072 رمزًا. ويبلغ حجم بنيته المُكمَّمة نحو 1.67 غيغابايت بصيغة Q4_K_M.

تعرض بطاقة FrogNano-4B-2609 حقل المعاملات الخاص بها على أنه النطاق "500M-5B"، ويصفه ملخص النموذج بأنه يقارب 4.66 مليار. يحسم التنزيل الجدل: شاردتان من safetensors بإجمالي 9.32 غيغابايت من أوزان BF16، و738 موترًا، ضمن مكدس موروث كثيف هجين من 32 طبقة يجمع بين Gated DeltaNet والانتباه المُبوَّب. ويوجد برج رؤية من 24 طبقة داخل نقطة التحقق ولم يخضع لأي تدريب لاحق قط.

إذن، نسبة الحجم تقريبًا 1.7 إلى واحد، ونسبة الذاكرة أقرب إلى 5.6 إلى واحد بمجرد أن يصبح التكميم مطروحًا على الطاولة. هذه الفجوة تهم أكثر من سطر المعاملات، لأن هذين النموذجين كليهما مرشحان للاستضافة الذاتية وليسا نقاط نهاية — وهذا هو السبب الوحيد لوجودهما في نفس المقال.

• الاستخدام المقصود — LFM2.5 2.6B Base هو مادة خام لعملية ضبط دقيق. FrogNano-4B-2609 سياسة نهائية لهندسة البرمجيات على مستوى المستودع داخل Leaf harness.

• اتباع التعليمات — لا يمتلك LFM2.5 2.6B Base أيًا منه جاهزًا للاستخدام مباشرةً؛ وتوصي بطاقة Liquid AI باستخدامه للمهام التي تتطلب ضبطًا دقيقًا مكثفًا. يتبع FrogNano-4B-2609 وصف المهمة ويصدر استدعاءات أدوات مُهيكلة، لأن هذا بالضبط ما دُرِّب عليه هدف التعلم المعزز (RL) الخاص به.

• السياق — 131,072 رمزًا لـ LFM2.5 2.6B Base، مقابل نحو 131 ألف رمز مجمّعة لإعداد FrogNano المُقيَّم. متطابقان اسميًا، لكن نافذة FrogNano عليها أن تستوعب نتائج الأدوات ومخرجات shell وسجلات الاختبار، وليس مجرد مطالبة.

• الحد الأقصى للإخراج — تتيح تهيئة FrogNano المُتحقَّق منها توليد 8,192 رمزًا لكل دور من أدوار المساعد. ولا تنشر LFM2.5 2.6B Base ما يعادلها، لأنها لم تُبنَ لإنهاء إجابة.

• النمط — كلاهما نصي فقط. مكوّنات الرؤية في FrogNano موروثة وغير مدعومة صراحةً؛ أما LFM2.5 2.6B Base فهو نصّي إدخالًا وإخراجًا بحكم بنيته.

• الترخيص — يخضع LFM2.5 2.6B Base لترخيص LFM Open License v1.0، وهو مجاني إذا كانت الإيرادات السنوية أقل من 10 ملايين دولار، ويتطلب ترخيصًا منفصلًا عند هذا الحد أو أعلى منه، مع توريث الأعمال المشتقة لهذا السقف. وتقول بطاقة FrogNano إن الترخيص MIT في مقدمتها وApache 2.0 في متنها.

الشيء الذي دفعت Microsoft ثمنه، والشيء الذي سيتعين عليك أن تدفع ثمنه بنفسك.

هذا هو القسم المحوري، لأنه القسم الذي تُضلّل فيه مقارنة المواصفات.

القيمة المضافة الكاملة لـ FrogNano-4B-2609 هي التدريب اللاحق، وقد نشرت Microsoft الطريقة. ابدأ من Qwen3.5-4B، الذي سجّل 39.4% في SWE-bench Verified عبر إطار Leaf كنموذج عام. ولّد مهام مستودعات مرشحة من لقطات حقيقية، ونفّذ عمليات rollout من نقطة التفتيش الحالية للعثور على مهام يحلها أحيانًا، واحتفظ بها، ودرّب، وكرّر — خمس تكرارات، ونحو 1,500 بيئة اصطناعية مُتحقّق منها إجمالًا، ودون أي تقطير من نموذج أكبر في أي مرحلة. النتيجة على بطاقة Microsoft الخاصة هي 61.5% في SWE-bench Verified، و37.6% في SWE-bench Pro، و31.1% في Terminal-Bench 2.0، و47.3% في PatchEval-Verified. ويذكر ملحق الكفاءة في الورقة الصعود نفسه بنسب 48.2% و53.4% و58.3% و58.6% و61.6% عبر التكرارات، وهو تذكير مفيد بأن حتى جدولي المختبر نفسه للتجربة نفسها لا يتفقان على درجات السلم.

الآن اقرأ ذلك مقارنةً بـ LFM2.5 2.6B Base. إنه نقطة الحفظ التي تسبق بداية ذلك العمل. توصية بطاقته الخاصة — اضبطه ضبطًا دقيقًا — هي بالضبط المهمة التي توثّقها FrogNano: بيئة مهمة، ومكافأة قابلة للتنفيذ، ومنظومة تشغيل أطول خدمة، وعدة تكرارات تدريبية في مواجهة سياسة متحركة. لا تدّعي الورقة أن ذلك سهل. وتُفيد بأن تدريب نقاط الحفظ الوسيطة أصبح أكثر كلفة بشكل متزايد مع طول مسارات الاستدلال، وأنه كان لا بد من إضافة عقوبة طول السجل لإيقاف الانحراف، وأن التكرارات اللاحقة فقدت القدرة على استدعاء الأدوات بالتوازي التي كان يتمتع بها النموذج الأساسي، لتنتهي بمعدل استدعاء متزامن قدره 1.71%. وعلى أي شخص يخطط لتشغيل وصفة FrogNano على قاعدة 2.6B مختلفة أن يرصد ميزانية لتلك المشكلات الثلاث تحديدًا.

ما يوفره LFM2.5 2.6B Base هو نوع مختلف من الانطلاقة: ميزانية تدريب مسبق تبلغ 34 تريليون توكن، وبنية هجينة موثّقة، ونسخة مُكمَّمة موجودة، وسياق موثّق يبلغ 131,072 توكن، وكل ذلك بحجم يعمل على عتاد لا يمكن لنقطة تحقق BF16 بحجم 9.32 GB أن تتسع عليه. إذا كانت مهمتك ضيقة بما يكفي بحيث يتفوق ضبط دقيق صغير على نموذج عام، فهذا موقع حقيقي — وإن لم تكن كذلك، فقد وفّرت على نفسك جولة تدريب.

A generated two-column scoreboard titled 'FrogNano-4B-2609 vs LFM2.5 2.6B Base'. The left column reads State RL post-training complete, Params approx 4.66B with the card saying 500M-5B, Weights 9.32 GB BF16, Context about 131K evaluated, Licence MIT in front matter and Apache 2.0 in body, Independent scores none. The right column reads State pretrained checkpoint only, Params 2.69B dense, Weights 1.67 GB in Q4_K_M, Context 131,072 tokens, Licence LFM Open License v1.0, Independent scores none. A footer reads 'Both columns vendor-reported; no third party has scored either model.'

ما يتعيّن عليك بناؤه في كل الأحوال

لا يُعدّ أيٌّ من هذين استدعاءً عبر الشبكة، وهذا ما يصوغ المقارنة العملية أكثر من أيّ صفٍّ في المواصفات.

يحتاج LFM2.5 2.6B Base إلى بيئة تشغيل للاستدلال وجولة تدريب. تسرد بطاقة Liquid AI إصدارات بالصيغة الأصلية وGGUF وONNX وMLX، لذا فإن نصف الخدمة مغطى جيدًا — llama.cpp على حاسوب محمول خيار حقيقي لنقطة الحفظ المكمّمة. أما نصف التدريب فهو لك: البيانات، والهدف، والتقييم، وطريقة لمعرفة ما إذا كانت النتيجة قد تحسّنت أم صارت مختلفة فحسب.

يريد FrogNano-4B-2609 نقطة نهاية متوافقة مع OpenAI مزوّدة بالمحلّلات الصحيحة، وعنقود Kubernetes بإذن لإدارة الـ pods وسياسات الشبكة. ويوضّح README الخاص بـ Microsoft، بصراحة غير معتادة، أن أداة التقييم تعد تبعية وليست مجرد وسيلة راحة، وتذكر بطاقة النموذج أن الدرجات المتطابقة تتطلب نقطة حفظ ومُجزِّئ رموز وإعداد تقديم وصور مهام وبروتوكول تقييم متطابقة. الإعداد ليس تفصيلاً ثانويًا هنا — قدّمه من دون محلّل استدلال Qwen3 ومحلّل استدعاء أدوات Qwen3 coder، وسيكتب النموذج نصًا نثريًا حيث تتوقع أداة التقييم استدعاء أداة.

هذا هو شكل هذه المواجهة: على جانب، مشروع تدريب لديه مشكلة خدمة صغيرة؛ وعلى الجانب الآخر، مشروع خدمة لديه مشكلة تقييم كبيرة ولم يتبقَّ فيه أي تدريب للقيام به. كلاهما أمسيات من العمل. واحد فقط منهما هو أمسيات من العمل التي يمكن أن تنتهي بعبارة «النموذج ليس جيدًا بما يكفي» دون أي خطأ منك.

A screenshot of the Hugging Face model card for microsoft/FrogNano-4B-2609 showing the model summary table with the Parameters row reading 500M-5B, the Context length row reading approximately 131K tokens in the evaluated coding-agent configuration, the Training Dates row reading Jun 2026 to Aug 2026, the Release date row reading 22-SEP-2026, the License row reading Apache License 2.0, the Qwen/Qwen3.5-4B model dependency, and the model overview naming the dense 32-layer hybrid Gated DeltaNet and gated-attention architecture.

أين يثبت الراوتر جدارته في تجميعة كهذه

ينتهي كلا هذين النموذجين داخل خط معالجة يستدعي أيضًا شيئًا مستضافًا. منصة التقييم الخاصة بـ FrogNano هي الدليل: فأداة الاختبار Leaf تتواصل مع نقطة نهاية متوافقة مع OpenAI، ما يعني أن النموذج الخاضع للاختبار وأي نموذج تقارنه به يتم الوصول إليهما عبر الواجهة نفسها. هذا نمط يستحق التقليد حتى عندما يكون السبب مجرد النظافة، وهنا تفعل نقطة نهاية واحدة شيئًا ملموسًا.

يوفّر OrcaRouter أكثر من 200 نموذج خلف مفتاح واحد متوافق مع OpenAI بهامش ربح 0%، لذا تمر أسعار قوائم المزوّدين كما هي دون تغيير، ويصبح أي تغيير في سعر أحد المورّدين ساريًا على جهتنا في اليوم نفسه — وهو الرقم الذي يتحرك فعليًا عندما تقرر ما إذا كان نموذج متخصص مستضاف ذاتيًا يتفوق على نموذج عام مستضاف من حيث التكلفة لكل مهمة. التحويل التلقائي عند الفشل يغطي الجانب المستضاف من تلك المقارنة، وليس نقطة التحقق التي تخدمها بنفسك. نحن لا نستضيف FrogNano-4B-2609 أو LFM2.5 2.6B Base؛ فكلاهما تنزيلان. ما تزيله طبقة التوجيه هو التكامل الثاني في كل مرة يتغير فيها الجانب المستضاف من معيارك المرجعي.

اختيار واحد، بصراحة

اختر LFM2.5 2.6B Base إذا كانت مهمتك ضيقة، وعتادك صغيرًا، وكنت مستعدًا لتحمّل مسؤولية تشغيل التدريب — فالترخيص مجاني إذا كانت الإيرادات أقل من 10 ملايين دولار، والنسخة المُكمَّمة بحجم 1.67 GB، وتوصي به بطاقة Liquid AI الخاصة لهذا الغرض تحديدًا. المقابل هو أنك تحصل على نقطة انطلاق، لا على قدرة: لا شيء في الإصدار يخبرك بالنتيجة التي قد يحققها تشغيل تعلم معزز على غرار FrogNano فوقه، ولم ينشر أحد ذلك.

اختر FrogNano-4B-2609 إذا كانت المهمة هندسة برمجيات على مستوى المستودع، وكنت تريد أن تكون مرحلة ما بعد التدريب قد أُنجزت مسبقًا. إن نسب 61.5% و37.6% و31.1% و47.3% هي نتائج حقيقية منشورة من مختبر وصف منهجه بالتفصيل — وهي أيضًا، في هذه اللحظة، حلقة مغلقة: المختبر نفسه، وأداة الاختبار نفسها، وخط الأساس نفسه للنموذج الأساسي. إن تنزيل 9.32 GB، والاعتماد على أداة الاختبار، والترخيص المركّب هي الثمن الذي تدفعه مقابل تجاوز مشروع تدريب كان عليك لولا ذلك تشغيله.

A generated pipeline card headed 'The same pipeline, two positions' showing three stages connected by arrows: 'Pretrained checkpoint' captioned LFM2.5 2.6B Base, 'RL on synthetic tasks, 5 iterations' captioned Microsoft's loop, and 'Finished agent' captioned FrogNano-4B-2609, with a footer reading 'Neither model has been independently evaluated; both appear as vendor-reported figures only.'

إعادة التأطير المفيدة هي أن هذين ليسا متنافسين. يقع LFM2.5 2.6B Base في المنبع من عملية أنتجت شيئًا مثل FrogNano-4B-2609. وإذا وجدت نفسك تختار بينهما، فالسؤال الحقيقي هو ما إذا كانت مشكلتك تستحق أن تدير من أجلها عملية تدريب — وإن كان الجواب لا، فإن نقطة الحفظ 4B مع إطار الاختبار، والمنهج المنشور، وسلّم SWE-bench المبلَّغ عنه من المورّد، هي التي تصل جاهزة.