بطاقة عنوان مُولّدة تحمل النص 'FrogNano-4B-2609 مقابل Qwen 3.8' مع عنوان فرعي 'وكيل 4B على وحدة معالجة الرسومات الخاصة بك في مواجهة نموذج رائد مستضاف بحجم 2.4T'، وثلاث شرائح تحمل النصوص 'تنزيل بحجم 9.32 GB' و'$2 إدخال / $6 إخراج لكل مليون' و'حتى 150 خطوة لكل مهمة'، وتذييل يحمل النص 'أرقام FrogNano وفقًا لـ Microsoft؛ أسعار Qwen3.8-Max وفقًا لـ Alibaba. لا شيء هنا مستقل'، وشعار OrcaRouter مُركّب في الزاوية السفلية اليمنى.
Guides & Insights

FrogNano-4B-2609 مقابل Qwen 3.8: ما تكلفة وكيل البرمجة عندما تكون الأوزان ملكك

الكاتب

Magnus Corvin

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج →
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

microsoft/FrogNano-4B-2609 هو وكيل مستودع من فئة الأربعة مليارات، مشتق من Qwen3.5-4B، تقوم بتنزيله وتشغيله بنفسك. Qwen3.8-Max هو النموذج الرائد المستضاف — نموذج خليط خبراء متناثر بمعاملات تبلغ 2.4 تريليون، مع نحو 95 مليار معامل نشط لكل رمز، ونافذة متعددة الوسائط بمليون رمز، وقائمة أسعار تبلغ 2.00 دولار لكل مليون رمز إدخال و6.00 دولار لكل مليون رمز إخراج — يمكن الوصول إليه بمفتاح API منذ 3 أغسطس 2026. أحدهما يكلف وحدة معالجة رسومات وبعد ظهر. والآخر لا يكلف شيئًا حتى تستخدمه، ثم يحاسبك حسب الرمز على أطول المسارات الشائعة الاستخدام. هذه المقايضة، وليس جدول المعايير، هي المواجهة الحقيقية.

أرقام FrogNano هنا مستمدة من بطاقة نموذج Microsoft وتقريره الفني؛ أما أرقام Qwen3.8-Max فمستمدة من تسعير Alibaba المنشور وسجل النموذج في كتالوجنا الخاص، مع وسم الدرجات المستقلة كأرقام Artificial Analysis حيثما ظهرت. لاحظ التسمية بعناية: Qwen3.8، إصدار الأوزان المفتوحة، قد أُعلن عنه لكن لم يُطرح بعد، بينما Qwen3.8-Max متاح فعليًا ومسعّر اليوم. وكل ما يمكن استدعاؤه في هذه المقالة هو الأخير.

الحساب الذي يحدد المقارنة

ابدأ بتكلفة مهمة واحدة، فهي ليست واضحة وليست صغيرة.

أجرت تقييمات FrogNano كل مسار بميزانية قدرها 150 خطوة ضمن نحو 131 ألف رمز إجمالي، وبما يصل إلى 8,192 رمزًا مُولَّدًا لكل دور من أدوار المساعد، وسقف زمني قدره 10,800 ثانية. اضرب الحدّين المنشورين تحصل على سقف يبلغ نحو 1.23 مليون رمز مُولَّد لمسار واحد في أسوأ الحالات — وهو، بسعر Qwen3.8-Max البالغ 6.00 دولارات لكل مليون رمز إخراج، نحو 7.38 دولارات لمهمة واحدة استمرت حتى نهاية ميزانيتها. هذا حساب على رقمين منشورين، وليس قياسًا: فالمسارات الحقيقية تتوقف مبكرًا، والمتوسط أدنى بكثير من السقف، وتُحتسب نتائج الأدوات ومخرجات الصدفة بسعر الإدخال الأرخص لا بسعر الإخراج. لكنه يوضّح شكل الأمر. وكيل البرمجة لا ينفق بضع مئات من الرموز على سؤال؛ بل ينفق محادثة طويلة مليئة بالاستدلال مع نفسه، وكل رمز في تلك المحادثة يكون مُولَّدًا.

الآن ضع الجانب الآخر من السجل بجانبه. FrogNano-4B-2609 هو ‏9.32 جيجابايت من أوزان BF16 في جزأين، قابل للتنزيل دون بوابة. تتطلب خدمته SGLang مع محلل استدلال Qwen3 ومحلل استدعاء أدوات Qwen3 coder، إضافةً إلى بيئة معزولة للأدوات الخمس. بعد ذلك، تصبح التكلفة الحدية للمسار هي الكهرباء، والذاكرة التي يشغلها هي ما ينمو إليه سياقك لا ما تزنه الأوزان.

• نموذج التكلفة — FrogNano-4B-2609 تكلفة عتاد ثابتة وتكلفة هامشية شبه معدومة. Qwen3.8-Max تكلفة ثابتة صفرية وفوترة لكل رمز، مع تقسيم $2.00 / $6.00 لا يفرض أي تكلفة مقدماً ويفرض كل التكلفة بمعدل الإخراج.

• ما الذي يشتريه المال — وكيل من فئة 4B على شرائحك الخاصة، مقابل نموذج بمقياس الحدود المتقدمة لا يتعين عليك أبدًا التخطيط لسعته.

• نقطة التعادل — تُبلَغ عندما يتجاوز حجم مساراتك الشهرية مضروبًا في متوسط فاتورة الرموز لكل مسار تكلفةَ وحدة GPU التي كنت ستستأجرها لولا ذلك. وبالنسبة لفريق يشغّل بضع مهام مستودعات يوميًا، فإن هذه النقطة بعيدة جدًا، ويفوز النموذج المستضاف بمجرد الراحة.

نموذجان لا يؤدّيان المهمة نفسها

مقارنة التكلفة لا تكون عادلة إلا إذا كانت المخرجات قابلة للمقارنة، وهي هنا ليست كذلك، وهذا هو الجزء الذي تدفنه معظم أوراق المواصفات.

تم تدريب FrogNano-4B-2609 لاحقًا حصريًا على هندسة البرمجيات على مستوى المستودعات. واجهته بالكامل هي حلقة من خمس أدوات — Read، Write، Edit، Glob وBash — ينفذها إطار Leaf في بيئة اختبار معزولة، ويكرر حتى يتوقف النموذج عن الاستدعاء. تذكر بطاقة Microsoft أن لغته المدعومة هي الإنجليزية ومجاله البرمجي المعتمد هو Python، وتقول صراحة إن مكونات الصور والفيديو في نقطة التحقق لم تُدرَّب لاحقًا ولا تحظى بالدعم. وهو لا يستنتج حول بنيتك المعمارية، ولا يجيب عن أسئلة حول عملك، ولا يقرأ لقطة شاشة.

Qwen3.8-Max هو نموذج عام. يمنحه سجل كتالوج Alibaba إدخال نص وصورة وفيديو مع إخراج نصي ونافذة سياق تبلغ 1,000,000 رمز. إنه يستدل، ويكتب، ويقرأ المستندات، ويجري محادثة، واستدعاء الدوال فيه سمة لنموذج عام بدلاً من أن تكون الهدف الكامل من نقطة التحقق. أرقامه في Artificial Analysis، المقروءة من السجل في 2 سبتمبر 2026، هي Intelligence Index بقيمة 45.4 وCoding Index بقيمة 76.2.

• المدخل — FrogNano-4B-2609 نصي فقط. أما Qwen3.8-Max فيتعامل مع النصوص والصور والفيديو.

• السياق — ما يقرب من 131 ألف رمز مجتمعة لتهيئة FrogNano المُقيَّمة، مقابل 1,000,000 لـ Qwen3.8-Max. وهذا يعني معاملًا قدره سبعة ونصف، وهو الأكثر أهمية تحديدًا بالنسبة للمدخلات بحجم المستودع التي يحصل عليها وكيل البرمجة.

• الإخراج لكل دور — يضع إعداد FrogNano المُتحقَّق منه حدًّا أقصى لدور المساعد الواحد عند 8,192 رمزًا. ولا تنشر Qwen3.8-Max أي حدّ أقصى مكافئ لكل استجابة.

• تنسيق الإخراج — يُصدر FrogNano استدعاءات أدوات Leaf مهيكلة ويحتاج إلى إطار تنفيذ لتشغيلها. أما Qwen3.8-Max فيعيد نصًا نثريًا أو استدعاء دالة إلى أي عميل لديك بالفعل.

• تقييمات مستقلة — لا يوجد أي منها لـ FrogNano-4B-2609 خارج بطاقته الخاصة؛ أرقام Qwen3.8-Max الواردة أعلاه هي من طرف ثالث، من Artificial Analysis.

• المعلمات — حوالي 4.66 مليار لـ FrogNano وفقًا لوصف بطاقته الخاصة، مقابل إجمالي 2.4 تريليون ونحو 95 مليار نشط لـ Qwen3.8-Max.

A screenshot of the OrcaRouter model page for Qwen3.8 Max showing the breadcrumb Home, Models, Qwen; the model name and the qwen/qwen3.8-max model id; the FEATURED badge with Vision, Tools, JSON and Reasoning capability chips; the 1M-token context, text, image and video input and text output row; the $2.00 and $6.00 per-million price cards with the p50 TTFT figure; the byline 'by Qwen, 2026-08-03'; the on-page section list for Code samples, Pricing, Performance, Public benchmarks, Community buzz, How it compares and FAQ; and the opening of the long description describing Qwen3.8-Max as Alibaba's newest flagship.

حيث يستحق 4B مكانه فعلاً

ثمة محور واحد يتفوّق فيه وكيل بحجم 4B على نموذج رائد تفوّقًا ساحقًا، وهو ليس الدقة.

تبدأ ورقة FrogNano من Qwen3.5-4B، الذي سجّل 39.4% على SWE-bench Verified عبر إطار Leaf بوصفه نموذجًا عامًا بسيطًا. وقد رفعته خمس تكرارات من التعلم المعزز على نحو 1500 مهمة اصطناعية إلى 61.5%، مع الإشارة في ملحق الورقة نفسها إلى التقدّم عبر التكرارات على النحو التالي: 48.2% و53.4% و58.3% و58.6% و61.6%. والطريقة — توليد مهام مُعايَرة على حدود قابلية التعلّم للسياسة الحالية، دون تقطير من نموذج أقوى — هي الإسهام، وهي السبب الذي يجعل مجموعة بحثية لا تملك ميزانية نموذج من الطراز الحدّي تهتم بالأمر.

اقرأ ما يعنيه ذلك بالنسبة إلى المقارنة. بطاقة Microsoft صريحة في أن FrogNano ليس أفضل على نحو موحد من النموذج الذي انحدر منه: فمعدل استدعاء الأدوات المتوازية لديه هو 1.71%، لأن التكرارات اللاحقة فقدت القدرة على إطلاق استدعاءات متزامنة، وأضاف الفريق مرحلة دمج لمحاولة استعادتها. النموذج الذي يحل مشكلات أكثر بينما يصبح أسوأ في سلوك واحد محدد هو نتاج هندسي حقيقي بدرزات ظاهرة، وبطاقته تقول ذلك بدلاً من طمره.

ورقم SWE-bench هو حلقة مغلقة. فخط الأساس للنموذج الأساسي، وأداة التقييم، والنتيجة النهائية كلها تأتي من المختبر نفسه، كما أن الجدولين في الورقة البحثية نفسها يعطيان سلّمين مختلفين للتجربة نفسها. أما رقم البرمجة الخاص بـ Qwen3.8-Max، في المقابل، فقد أنتجته Artificial Analysis وليس Alibaba — وهو نوع مختلف من الأدلة، ومستوى مختلف من الثقة، ولا ينبغي أبدًا طرح أحدهما من الآخر.

الـ4B الذي لا يمكنك بعد أن تخطط بشأنه تمامًا

ثمة أمران يقفان بين FrogNano-4B-2609 ومكان في الإنتاج، وكلاهما في توثيقه الخاص وليس في رأي أي مراجع.

الأول هو العتاد. تُقدّر البطاقة متطلبات أوزان BF16 بنحو 9.3 غيغابايت، ثم تضيف أن الذاكرة «تزداد بشكل كبير كلما اقترب السياق المُدمج من 131 ألف توكن تقريبًا»، قبل أن تذكر أن الحد الأدنى الدقيق لطراز GPU، وتكوين VRAM، وإصدارات وقت التشغيل، وملف تعريف الأداء «يجب أن تظل بحاجة إلى التحقق قبل الإصدار» — وهي عبارة تظهر على نموذج قابل للتنزيل بالفعل. لم ينشر أحد قيمة VRAM للتكوين المُقيَّم، ولا تحتوي البطاقة على أي رقم من هذا القبيل.

الثاني هو وضعية السلامة. تقول ملاحظة المحاذاة الخاصة بـ Microsoft نفسها إن التدريب اللاحق الخاص بالوكيل لم يستخدم أي مجموعات بيانات خاصة بتفضيلات السلامة أو الرفض أو المحتوى الضار أو المجموعات الخصومية، وإنه حُسّن بدلًا من ذلك من أجل الصحة الوظيفية وتجنب الانحدار، وإن النموذج "يجب ألا يُعتبر متوافقًا أمنيًا بشكل مستقل للنشر الذاتي غير المقيّد". وتُختتم البطاقة بتسمية المخاطر الملموسة: فقد تكون الرقع غير صحيحة أو غير آمنة رغم اجتيازها اختباراتها، والأداء حساس لجودة تلك الاختبارات، وكل رقعة مرشحة تحتاج إلى مراجعة بشرية مؤهلة وإلى اختبارات انحدار وأمنية مستقلة قبل الاستخدام. ولا يحمل نموذج مستضاف عام أيًّا من تلك التحذيرات المحددة، كما أنه لن ينفّذ أمر shell في مستودعك.

مفتاح واحد لأي جانب تختاره

الشيء المفيد في إجراء هذه المقارنة عمليًا هو أن نصفها فقط يُعدّ تنزيلًا. Qwen3.8-Max، والنماذج العامة التي قد تقيس عليها أداء وكيل مُستضاف ذاتيًا، كلها يمكن الوصول إليها عبر نقطة نهاية واحدة متوافقة مع OpenAI على OrcaRouter بهامش ربح 0% — سعر القائمة من المزوّد يُمرَّر كما هو، لذا فإن أي تغيير في سعر المورّد يصل إلى جانبنا في اليوم نفسه، وهو الرقم الذي يتحرك فعليًا عندما تكون فاتورة رموز الإخراج لوكيل برمجة هي ما تحاول التحكم فيه. وهذا أيضًا يجعل مسألة التبديل عند الفشل بسيطة: إذا تدهور النصف المُستضاف من مسارك، فإن إعادة المحاولة تلقائية وتستمر التجربة.

FrogNano-4B-2609 ليس أحد مساراتنا، ولا يوجد تاريخ له. الأوزان ملكك لتقديم الخدمة بها، وبطاقته صادقة في أن إعداد التشغيل لم يُتحقق منه بالكامل. ما يمكننا فعله هو أن نجعل الجانب الآخر من المقارنة لا يكلّف شيئًا لإعداده، حتى يصبح السؤال الذي تجيب عنه في النهاية هو السؤال الحقيقي — هل يتفوق وكيل SWE-bench بنسبة 61.5% كما أبلغ عنه المورّد، على وحدة معالجة الرسومات الخاصة بك، على نموذج رائد يُحاسَب حسب الاستخدام في مهامك الخاصة، وبحجمك الخاص.

A generated two-column scoreboard titled 'FrogNano-4B-2609 vs Qwen3.8-Max'. The left column reads Cost your GPU, electricity; Output tool calls and patches; Context about 131K evaluated; Input text only; Published score 61.5% SWE-bench Verified, vendor, unreproduced; Turn cap 8,192 tokens. The right column reads Cost $2.00 in / $6.00 out per million; Output prose or function call; Context 1,000,000 tokens; Input text, image, video; Published score AA Intelligence 45.4 and AA Coding 76.2, third-party; Turn cap not published. A footer reads 'FrogNano figures per Microsoft; Qwen3.8-Max scores per Artificial Analysis. Different benchmarks; not comparable.'

أي واحد تختار؟

توجّه إلى Qwen3.8-Max عندما يكون العمل عامًا، أو عندما ينبغي لفريق عمليات تابع لجهة أخرى أن يتحمل سعة التشغيل، أو عندما قد يحتوي الإدخال على صورة أو مستند طويل، أو عندما تحتاج إلى إجابة اليوم بدلًا من حزمة تقديم بحلول الجمعة. تعني تقييماتها الصادرة عن أطراف ثالثة أنك تستطيع التنبؤ تقريبًا بما تشتريه، وفاتورتها لكل رمز هي تكلفة متغيرة يمكنك رؤيتها قبل الالتزام. وبالنسبة لفريق ينفذ عددًا متواضعًا من مهام المستودعات شهريًا، فالنتيجة الحسابية ليست متقاربة.

اختر FrogNano-4B-2609 عندما يكون الحجم مرتفعًا بما يكفي بحيث تصبح الفوترة لكل توكن على المسارات الطويلة هي القيد، أو عندما لا تستطيع البيانات مغادرة بنيتك التحتية، أو عندما يكون السؤال البحثي — هل يمكن تدريب وكيل صغير ليصل إلى كفاءة على مستوى المستودعات دون معلّم — هو ما تختبره فعليًا. ادخل إلى هذا وأنت تعلم ثلاثة أمور: نسبة 61.5% هي قياس المختبر نفسه على منصة اختبار يديرها المختبر، ولم ينشر أحد رقمًا لمقدار VRAM الخاص بالتهيئة المُقيَّمة، وبطاقة النموذج نفسها تقول إن إعداد الخدمة لم يُتحقق من صحته بعد.

ما يجعل هذه الثنائية جديرة بالكتابة عنها هو أنهما يتشاركان سلفًا مشتركًا قبل جيلين. ينحدر FrogNano من Qwen3.5-4B — وهو نموذج عام من الشركة نفسها التي يقع نموذجها الرائد البالغ 2.4 تريليون معامل على الجانب الآخر من هذه الصفحة. أخذت Microsoft النموذج الصغير، وأنفقت خمس تكرارات من التعلم المعزز على مستودعات اصطناعية، وحصلت على متخصص. سلكت Alibaba الطريق المعاكس وتوسعت. كلا الإجابتين منشورتان، والفجوة بين تكلفة التنزيل وتكلفة واجهة برمجة التطبيقات (API) هي الطريقة الصادقة للاختيار بينهما.

A screenshot of the microsoft/FrogNano GitHub repository README showing the description that FrogNano evaluates coding agents with the Leaf harness in isolated Kubernetes sandboxes against OpenAI-compatible endpoints and five tools Read, Write, Edit, Glob and Bash; the requirements list naming a Kubernetes cluster with pod and network-policy permissions and an OpenAI-compatible endpoint with reasoning and tool-call parsers configured for Qwen3.5; the frognano-eval run commands; and the benchmark table listing SWE-bench Verified at 500 tasks with an 8,192-token cap, SWE-bench Pro at 731 with 32,000, Terminal-Bench 2.0 Verified at 89 with 32,000 and PatchEval Verified at 230 with 8,192.

مقارنات في هذه المقالة1

مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا