بطاقة عنوان مُولَّدة تحمل النص «FrogNano-4B-2609 vs Gemma 4 12B» مع عنوان فرعي «وكيل مستودعات بحجم 4B مقابل نموذج عامّ متعدد الوسائط بحجم 11.95B»، وثلاث شرائح تحمل «61.5% SWE-bench، بحسب المورّد»، و«72.0% LiveCodeBench، بحسب المورّد»، و«لا معيار مشترك»، وتذييل يحمل «معايير مختلفة دون تداخل؛ وكلا لوحتي النتائج مُبلَّغ عنهما من المورّد»، وشعار OrcaRouter مركّب في الزاوية اليمنى السفلى.
Guides & Insights

FrogNano-4B-2609 مقابل Gemma 4 12B: 61.5% على SWE-bench ولم يتحقق أحد من ذلك

الكاتب

Elias Hawthorne

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج →
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

التابع لمايكروسوفتFrogNano-4B-2609هو وكيل برمجة من فئة الأربعة مليارات، مشتق من Qwen3.5-4B، ويُبلّغ عن 61.5% على SWE-bench Verified. Gemma 4 12B هو نموذج متعدد الوسائط بلا مُشفِّر من DeepMind بـ11.95 مليار معامل، وتُبلّغ بطاقته عن 72.0% على LiveCodeBench v6. هذان هما الرقمان اللذان سيضعهما مشترٍ جنبًا إلى جنب، ووضعهما جنبًا إلى جنب هو الخطأ. إنهما يأتيان من معايير قياس مختلفة، وأدوات تقييم مختلفة، ومختبرات مختلفة، والأهم من ذلك، أن واحدًا منهما فقط لديه منهجية تقييم منشورة اطّلع عليها شخص خارجي. وكل ما عدا ذلك في هذه المواجهة هو سؤال عن ماهية كل نموذج في الواقع، والجواب هو أنهما ليسا من الفئة نفسها من الأشياء على الإطلاق.

الأرقام الواردة أدناه لـ FrogNano مستمدة من بطاقة نموذج Microsoft وتقريرها الفني، وكلاهما متاح للعموم منذ سبتمبر، ولم يُعِد إنتاجهما أحد من خارج المختبر. أما أرقام Gemma 4 12B فمستمدة من بطاقة نموذج Google، وهي أيضًا وثيقة مورّد — والفرق أن خلف أرقام Gemma عشرين أسبوعًا ونحو 2.6 مليون تنزيل من التدقيق، بينما لم يمضِ على FrogNano سوى أسبوعين، وعدّاد تنزيلاته لم يتخطَّ بعد خانة الآحاد.

ما الغرض من كل نموذج

هذا هو الجزء الذي تخفيه ورقة المواصفات. FrogNano-4B-2609 ليس نموذجًا عامًا يصادف أنه جيد في البرمجة. إنه نقطة تحقق كان تدريبها اللاحق بالكامل هندسة برمجيات على مستوى المستودعات، وهي مصممة لتُدار بواسطة أداة تشغيل بدلًا من التحدث إليها.

أدواته الخمس هي Read، Write، Edit، Glob و Bash. وهو يصدر استدعاءات إليها، وتنفذها بيئة معزولة وتعيد المخرجات، وتستمر الحلقة حتى يتوقف النموذج عن الطلب. الإعداد المُقيَّم هو 150 خطوة تفاعل ضمن ما يقارب 131 ألف رمز إجمالي، وقد أنتج رقعة مرشحة لكل مهمة. توضح بطاقة Microsoft صراحةً أن النموذج مخصص للمستودعات المكتوبة بالإنجليزية والشديدة الاعتماد على Python، ذات بيئات قابلة لإعادة الإنتاج ومجموعات اختبار قابلة للتنفيذ، وأن مكونات الصور والفيديو الموروثة من النموذج الأساسي لم تخضع لأي تدريب لاحق وليست مدعومة.

Gemma 4 12B هو الشكل المعاكس. إنه نموذج موحّد مكوّن من 48 طبقة بسياق 256K، ولا يحتوي على مشفّر منفصل للرؤية أو الصوت — إذ تُسقَط رقع الصور الخام والموجات الصوتية مباشرةً في فضاء تضمين المفكّك الواحد عبر طبقات خطية خفيفة. يستقبل النص والصورة والصوت ويُخرج نصًا. لديه وضع تفكير يُفعَّل بواسطة رمز في موجه النظام، واستدعاء دوال أصلي، وتحرص بطاقة Google على إدراج سير العمل الوكيلي ضمن استخداماته المقصودة.

إذن فالسؤال الحقيقي ليس أيهما أذكى، بل ما إذا كنت تريد مكوّنًا متخصصًا لا يعمل إلا داخل منظومة يجب عليك تشغيلها، أم نموذجًا عامًا يؤدي دورًا جيدًا في أشياء كثيرة ويمكن لأي شيء استدعاؤه.

A screenshot of the google/gemma-4-12B-it model card on Hugging Face showing the Gemma 4 12B Unified heading, the Any-to-Any, Transformers, Safetensors and image-text-to-text tags, the Apache 2.0 license line credited to Google DeepMind, and the model overview explaining that text, audio, image and video inputs are handled without separate encoders.

سطرًا بسطر، حيث تختلف فعليًا

• المعاملات — ينشر FrogNano-4B-2609 نطاقًا، "500M-5B"، على بطاقة ينص وصفها الخاص على نحو 4.66 مليار؛ ويحسم التنزيل ذلك عند 9.32 غيغابايت من أوزان BF16. Gemma 4 12B هو 11.95B، مذكور مرة واحدة ودون أي تحفظ. النسبة نحو 2.6 إلى واحد، وهي تظهر مباشرةً في ما يتعين عليك استئجاره.

• السياق — يبلغ التكوين المُقيَّم لـ FrogNano نحو 131 ألف رمز مجمّعة، حيث يتقاسم الاستدلال ومخرجات الأدوات الميزانية. يستوعب Gemma 4 12B عدد 256,000 رمز، وهو في صف السياق الطويل الخاص به يسجّل 43.4% على MRCR v2 بثماني إبر عند 128K. أي ما يقارب ضعف النافذة، والرقم الثاني قياس منشور وليس ادّعاءً بقدرة.

• الوسائط — FrogNano-4B-2609 مدخلاته نص ومخرجاته نص، على الرغم من برج الرؤية الموجود في نقطة التحقق الخاصة به. Gemma 4 12B مدخلاته نص وصورة وصوت.

• سقف الإخراج — تسمح إعدادات FrogNano المعتمدة بتوليد 8,192 رمزًا لكل دور للمساعد، وتشير بطاقته إلى أن إعداد تدريب RL استخدم الحد الأقصى نفسه. لا تنشر Gemma 4 12B سقفًا مكافئًا لدور واحد؛ فالقيد هناك هو نافذة 256K.

• واجهة وكيلية — يصدر FrogNano استدعاءات Leaf مهيكلة ويحتاج إلى إطار تنفيذ لتنفيذها. تأتي Gemma 4 12B مزوّدةً باستدعاء الدوال الأصلي في صيغتها المدرّبة على التعليمات، ويمكن استدعاؤها مباشرةً.

• الترخيص — Gemma 4 12B مرخّص بموجب Apache 2.0 وفقًا لشروط Gemma 4 من Google، وهذا مذكور بوضوح. بطاقة FrogNano هي MIT في مقدمتها وApache 2.0 في متنها نفسه، وهو نوع الغموض الذي ينتهي به المطاف في مراجعة قانونية بدلًا من حاشية.

• الأرقام — يُبلِغ FrogNano عن 61.5% في SWE-bench Verified، و37.6% في SWE-bench Pro، و31.1% في Terminal-Bench 2.0، و47.3% في PatchEval-Verified. يُبلِغ Gemma 4 12B عن 77.2% في MMLU Pro، و72.0% في LiveCodeBench v6، وتصنيف Codeforces ELO البالغ 1659، و78.8% في GPQA Diamond، و69.0% في Tau2. لا تنشر بطاقة Google صف SWE-bench، ولا تنشر بطاقة Microsoft LiveCodeBench. لا يوجد أي تداخل بين لوحتي النتائج على الإطلاق.

تلك النقطة الأخيرة هي التي ينبغي أن تضع حدًّا لغريزة المقارنة بالأرقام. فلا يظهر أي معيار أداء على كلتا البطاقتين. والقارئ الذي يضع 61.5 في مقابل 72.0 إنما يقارن معدّل حلّ المستودعات بمعدّل النجاح في البرمجة التنافسية، وهذا أشبه ما يكون بمقارنة زمن ماراثون بزمن سباق مئة متر لمجرد أن كليهما بالثواني.

لماذا لا يُعد صمت Google بشأن SWE-bench إشارة تحذيرية

الاستنتاج المغري من القائمة النقطية هو أن FrogNano لديها رقم SWE-bench حقيقي وGem ليس لديها، لذا تفوز FrogNano في مسألة البرمجة. هذا لا يتبع، لسبب يستحق الدقة بشأنه.

يُبلّغ Gemma 4 12B عن نتيجة 69.0% في Tau2 — وهو معيار لتقييم استخدام الأدوات الوكيلية عبر ثلاث جولات — إلى جانب دعمه لاستدعاء الدوال وتموضعه الصريح تجاه سير العمل الوكيلي. النموذج الذي يحقق 69.0 في Tau2 ليس نموذجًا عاجزًا عن أداء العمل الوكيلي؛ بل هو نموذج اختار مورده الإبلاغ عن أداء استخدام الأدوات بدلًا من حلّ المشكلات في المستودعات. كما لا تُدرج Google صفوف SWE-bench الخاصة بالطرازين 26B أو 31B، وهو خيار تحريري على مستوى العائلة بأكملها وليس ضعفًا في 12B.

في المقابل، النتيجة المخالفة للحدس في ورقة مايكروسوفت نفسها هي نتيجة ينبغي لمشتري Gemma أن يقرأها بعناية. يبدأ FrogNano من Qwen3.5-4B، وهو نموذج عام، وقد حقق 39.4% على SWE-bench Verified عبر منصة Leaf. ونقلته خمس جولات من التعلم المعزز على نحو 1,500 مهمة اصطناعية إلى 61.5%. العبرة ليست "النماذج الصغيرة لا تستطيع البرمجة" — بل إن نموذجًا عامًا بحجم 4B عند 39.4% كان بالفعل يحل أكثر من ثلث مجموعة مسائل صعبة مُتحقق منها بشريًا عندما شغّله أحدهم داخل حلقة وكيل كفؤة. Gemma 4 12B ثلاثة أضعاف هذا الحجم وأنضج بعشرين أسبوعًا. لم يشغّله أحد عبر Leaf، وإلى أن يفعل أحدهم ذلك، فإن "Gemma ليس وكيل مستودعات" افتراض لا نتيجة.

ضريبة أداة الاختبار، التي تخفيها لوحات الصدارة تمامًا

إليك عدم التماثل العملي، وهو العامل الذي يحسم قرار الشراء.

Gemma 4 12B نموذج. نزّل 11.95 مليار من الأوزان، ووجّه Transformers أو vLLM أو SGLang إليها، وأرسل نصًا، واحصل على نص. تنشر Google مسار الخدمة، والترخيص لا لبس فيه، وقد واجه بالفعل ما يعادل 2.6 مليون تنزيل من الأشخاص المشكلات البسيطة ووثّقوها. إذا كانت المهمة هي "لخّص تتبّع المكدّس هذا"، أو "اقرأ لقطة الشاشة هذه وأخبرني ما المعطوب"، أو "استدعِ هذه الدالة بهذه الوسائط"، فإنه يعمل اليوم.

FrogNano-4B-2609 هو نموذج بالإضافة إلى أداة اختبار، ويجعل ملف README الخاص بمايكروسوفت نفسه أداة الاختبار غير اختيارية. المستودع على github.com/microsoft/FrogNano هو منصة تقييم Leaf، وليس كود التدريب — فهو يحتاج إلى عنقود Kubernetes، وnamespace موجود، وأذونات لإدارة الـ pods وسياسات الشبكة، ووصول سحب إلى صور حاويات المعايير، ونقطة نهاية متوافقة مع OpenAI مُهيأة بمحللات الاستدلال واستدعاء الأدوات الصحيحة. وتنص بطاقة مايكروسوفت على شرط المطابقة بصراحة: تتطلب الدرجات المتطابقة تطابق checkpoint وtokenizer وتكوين الخدمة وصور المهام وبروتوكول التقييم. إن نصف الإصدار الذي يولّد الدرجة هو النصف الذي تشير إليه البطاقة عبر رابط GitHub.

ثمة قيمة حقيقية في ذلك، وتستحق أن تُذكر بالاسم بدلًا من أن تُستهان بها. إسهام FrogNano هو حلقة تخليق مهام تعيد توليد مسائل التدريب بما يوازي قدرة السياسة الحالية — وادعاء الورقة البحثية هو أنه يمكن تدريب وكيل صغير ليصل إلى مستوى تنافسي على مهام اصطناعية دون أي تقطير على الإطلاق، وهذا يفتح مسارًا لكل من لا يستطيع تحمّل تكلفة معلّم رائد. واجهة برمجة التطبيقات الخاصة به متاحة للعموم. وطرائقه قابلة لإعادة الإنتاج من حيث المبدأ. وهذا إسهام أقوى من نقطة تحقق تدريجية أخرى، وهو أيضًا عمل أكثر مما توقّعته معظم الفرق التي تلتزم به.

A generated two-column scoreboard titled 'FrogNano-4B-2609 vs Gemma 4 12B'. The left column reads Parameters approx 4.66B with the card saying 500M-5B, Context about 131K evaluated, Input text only, Harness required Leaf with 5 tools, SWE-bench Verified 61.5% vendor, and Independent evals none. The right column reads Parameters 11.95B, Context 256,000 tokens, Input text, image, audio, Harness none required, LiveCodeBench v6 72.0% vendor, and Independent evals widely run. A footer reads 'Different benchmarks, no overlap; both scoreboards vendor-reported.'

إذا كنت تختار واحدًا، فاختر حسب المهمة.

اختر Gemma 4 12B إذا كان العمل يمزج بين وسائط متعددة، أو إذا كان أي شيء يحتاج إلى رؤية صورة أو سماع صوت، أو إذا كان السياق يجب أن يستوعب شجرة ملفات كبيرة ونصًا طويلًا في الوقت نفسه، أو إذا كنت تريد نموذجًا يمكن لأي إطار عمل تحميله دون نظام ثانٍ خلفه. إن درجته 69.0 في Tau2 واستدعاء الدوال الأصلي يجعلان منه خيارًا يمكن الدفاع عنه لخطوط أنابيب الوكلاء، ولا يحتاج أحد إلى تصديق كلام مختبر — فقد قيّم آلاف الأشخاص النموذج، والنتائج ليست سرًا.

خُذ FrogNano-4B-2609 إذا كنت تشغّل بالفعل وكيل مستودع داخل بيئة معزولة وكنت تريد نقطة تفتيش من فئة 4B لتُسقطها فيه، وإذا كان تنزيل بحجم 9.32 GB يتّسع لعتاد متواضع هو القيد الذي يوجّه القرار. كن صافي البصيرة بشأن التسلسل: أنت لا تشتري درجة، بل تراهن على طريقة، وأول ما ستكتشفه هو ما إذا كانت حلقة الاستطلاع لديك ومحلل استدعاء الأدوات لديك يشبهان Leaf بدرجة كافية. بعض الفرق ستحصل على سلوك قريب من 61.5% في عصر اليوم الثالث، وبعضها سيقضي أسبوعين ليكتشف أن مجموعة التقييم الخاصة به كانت أسهل من SWE-bench Verified، ولا يمكن لأحد خارج المختبر أن يخبرك بعد أيّ الفريقين أنت.

إذا كان القرار قريبًا حقًا، فإن التجربة الرخيصة هي تشغيل كليهما داخل نفس أداة الاختبار على مشكلاتك الخاصة بدلًا من الجدال حول أرقام منشورة لا تشترك في أي معيار قياس. يحمل OrcaRouter أكثر من 200 نموذج خلف مفتاح واحد متوافق مع OpenAI بهامش ربح 0%، لذا تمر أسعار القائمة لدى المزودين دون تغيير — مما يجعل من الممكن وضع نموذج عام مستضاف وبقية مجموعة المرشحين لديك خلف نقطة نهاية واحدة وسطر فواتير واحد بينما تقرر. FrogNano ليس أحد مساراتنا ولا يوجد موعد له؛ الأوزان عبارة عن تنزيل تستضيفه بنفسك. ما يمكننا إزالته هو الاحتكاك على الجانب الآخر من المقارنة: تبديل النماذج المرشحة في أداة الاختبار الخاصة بك دون عقد ثانٍ، أو SDK ثانٍ، أو مجموعة ثانية من بيانات الاعتماد.

A generated timeline card headed 'Two releases, twenty weeks apart' showing an upper bar labelled Gemma 4 12B uploaded 23 May 2026 with 2.6 million downloads across the family, and a lower bar labelled FrogNano-4B-2609 uploaded 17 September 2026 with no announcement, with a span marker of 20 weeks between them and a footer reading 'Download figures from Hugging Face on 3 October 2026.'

الملخص الصادق هو أن رقم 61.5 عمل حقيقي أنجزه المختبر الذي أنتجه، وأنه حالياً السبب الوحيد لتفضيل FrogNano في البرمجة. عندما يعيد شخص من خارج مايكروسوفت إنتاج 61.5 على المهام الـ500 نفسها — أو يفشل في ذلك — تحصل هذه المواجهة على إجابة حقيقية. وحتى ذلك الحين، فإن الخيار الافتراضي الأكثر أماناً لمعظم الفرق هو نموذج 11.95B ذو الترخيص النظيف، وقياس السياق الطويل المنشور، وعشرون أسبوعاً من أخطاء الآخرين استُوعبت بالفعل في وثائقه.