כרטיס כותרת שנוצר שעליו הכיתוב "FrogNano-4B-2609 מול Qwen 3.8", עם כתובית המשנה "סוכן 4B על ה-GPU שלך מול דגל מתארח בנפח 2.4T", שלושה צ׳יפים שעליהם הכיתוב "הורדה של 9.32 GB", "$2 in / $6 out למיליון" ו"עד 150 צעדים למשימה", כותרת תחתונה שעליה הכיתוב "נתוני FrogNano לפי Microsoft; תמחור Qwen3.8-Max לפי Alibaba. אין כאן שום דבר עצמאי", והלוגו של OrcaRouter משולב בפינה הימנית התחתונה.
Guides & Insights

FrogNano-4B-2609 לעומת Qwen 3.8: כמה עולה סוכן קידוד כשהמשקולות שלך

מחבר

Magnus Corvin

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים →
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

microsoft/FrogNano-4B-2609 הוא סוכן מאגרים בדרגת ארבעה מיליארד פרמטרים, הנגזר מ-Qwen3.5-4B, שאותו אתה מוריד ומארח בעצמך. Qwen3.8-Max הוא דגל האירוח — מודל תערובת מומחים דלילה עם 2.4 טריליון פרמטרים, שכ-95 מיליארד מהם פעילים לכל טוקן, חלון מולטימודלי של מיליון טוקנים, ומחירון של 2.00 דולר למיליון טוקני קלט ו-6.00 דולר למיליון טוקני פלט — נגיש עם מפתח API מאז 3 באוגוסט 2026. אחד מהם עולה GPU ואחר צהריים. האחר לא עולה דבר עד שתשתמש בו, ואז מחייב לפי טוקן במסלולים הארוכים ביותר בשימוש נפוץ. העסקה הזו, ולא טבלת הבנצ'מרקים, היא ההתמודדות האמיתית.

הנתונים של FrogNano כאן מגיעים מכרטיס המודל והדוח הטכני של מיקרוסופט; הנתונים של Qwen3.8-Max מגיעים מהתמחור המפורסם של אליבאבא ומרשומת המודל בקטלוג שלנו, כאשר הציונים העצמאיים מסומנים כמספרי Artificial Analysis בכל מקום שבו הם מופיעים. שימו לב היטב לשמות: Qwen3.8, מהדורת המשקלים הפתוחים, הוכרזה אך טרם שוחררה, ואילו Qwen3.8-Max פעילה ומתומחרת היום. כל מה שניתן להפעיל במאמר זה הוא האחרון.

האריתמטיקה שמכריעה את ההשוואה

התחל במה שעולה משימה בודדת, כי זה לא מובן מאליו וזה לא קטן.

ההערכות של FrogNano הריצו כל מסלול עם תקציב של 150 צעדים בתוך כ-131K טוקנים משולבים, עד 8,192 טוקנים מיוצרים בכל תור של העוזר, ותקרה של 10,800 שניות. הכפילו את שתי המגבלות שפורסמו ותקבלו תקרה של כ-1.23 מיליון טוקנים מיוצרים עבור מסלול אחד במקרה הגרוע ביותר — אשר בתעריף של $6.00 למיליון טוקני פלט של Qwen3.8-Max מסתכם בכ-$7.38 עבור משימה בודדת שהגיעה עד תום התקציב שלה. זהו חישוב אריתמטי על שני מספרים שפורסמו, לא מדידה: מסלולים אמיתיים נעצרים מוקדם, הממוצע נמוך בהרבה מהתקרה, ותוצאות כלים ופלט מעטפת מחויבים בתעריף הקלט הזול יותר ולא בתעריף הפלט. אבל זה ממחיש את צורת הדבר. סוכן קידוד לא מוציא כמה מאות טוקנים על שאלה; הוא מוציא שיחה ארוכה ועתירת הסקה עם עצמו, וכל טוקן בשיחה הזו מיוצר.

כעת הנח את הצד השני של המאזן לצידו. FrogNano-4B-2609 הוא 9.32 ג'יגה-בייט של משקולות BF16 בשני מקטעים, הניתנים להורדה ללא שער גישה. הגשתו דורשת SGLang עם מנתח חשיבה של Qwen3 ומנתח קריאות-כלים של Qwen3 coder, ובנוסף ארגז חול מבודד עבור חמשת הכלים. לאחר מכן, העלות השולית של מסלול היא חשמל, והזיכרון שהוא תופס הוא מה שההקשר שלך גדל אליו, ולא מה שהמשקולות שוקלות.

• מודל עלויות — ‏FrogNano-4B-2609 הוא עלות חומרה קבועה ועלות שולית כמעט אפסית. ‏Qwen3.8-Max הוא עלות קבועה אפסית וחיוב לפי טוקנים, עם פיצול של $2.00 / $6.00 שלא מקדים דבר ומעמיס את הכול בקצב הפלט.

• מה הכסף קונה — סוכן בדרגת 4B על הסיליקון שלכם, מול מודל בקנה מידה חזיתי שלעולם לא תצטרכו לתכנן עבורו קיבולת.

• נקודת איזון — היא מושגת כאשר נפח המסלולים החודשי שלך כפול חשבון הטוקנים הממוצע לכל מסלול עולה על עלות ה-GPU שאחרת היית שוכר. עבור צוות שמריץ קומץ משימות מאגר ביום, הקו הזה רחוק מאוד, והמודל המתארח מנצח בזכות הנוחות בלבד.

שני מודלים שאינם מבצעים את אותה עבודה

השוואת העלויות הוגנת רק אם התפוקות ברות השוואה, וכאן הן אינן, וזה החלק שרוב דפי המפרט קוברים.

FrogNano-4B-2609 עבר אימון־המשך אך ורק על הנדסת תוכנה ברמת מאגר. הממשק כולו הוא לולאה של חמישה כלים — Read, Write, Edit, Glob ו־Bash — המופעלת על ידי רתמת Leaf בארגז חול מבודד, תוך איטרציות עד שהמודל מפסיק לקרוא. הכרטיס של Microsoft מציין שהשפה הנתמכת היא אנגלית ותחום התכנות המאומת הוא Python, ואומר במפורש שרכיבי תמונה ווידאו בנקודת הביקורת מעולם לא עברו אימון־המשך ואינם נתמכים. הוא אינו מנמק בנוגע לארכיטקטורה שלך, אינו עונה על שאלות על העסק שלך ואינו קורא צילום מסך.

Qwen3.8-Max הוא מודל כללי. רשומת הקטלוג של Alibaba מספקת לו קלט טקסט, תמונה ווידאו עם פלט טקסט וחלון הקשר של 1,000,000 טוקנים. הוא מנמק, כותב, קורא מסמכים ומנהל שיחה, וקריאה לפונקציות היא תכונה של מודל כללי ולא כל מטרת נקודת הבדיקה. הנתונים שלו מ-Artificial Analysis, כפי שנקראו מהרשומה ב-2 בספטמבר 2026, הם מדד אינטליגנציה של 45.4 ומדד קידוד של 76.2.

• קלט — FrogNano-4B-2609 הוא טקסט בלבד. Qwen3.8-Max מקבל טקסט, תמונות ווידאו.

• הקשר — כ־131K טוקנים משולבים בתצורה הנמדדת של FrogNano, לעומת 1,000,000 עבור Qwen3.8-Max. זהו גורם של שבעה וחצי, והוא חשוב ביותר בדיוק עבור קלטים בהיקף של מאגר קוד שסוכן קידוד מקבל.

• פלט לכל תור — התצורה המאומתת של FrogNano מגבילה תור עוזר בודד ל-8,192 טוקנים. Qwen3.8-Max אינה מפרסמת תקרה מקבילה לכל תגובה.

• פורמט פלט — FrogNano פולט קריאות כלים מובנות של Leaf וזקוק למנגנון הרצה כדי להריץ אותן. Qwen3.8-Max מחזיר טקסט חופשי או קריאת פונקציה לכל לקוח שכבר יש לך.

• ציונים בלתי־תלויים — אין כאלה עבור FrogNano-4B-2609 מעבר לכרטיס שלו עצמו; הנתונים של Qwen3.8-Max שלמעלה הם של צד שלישי, מ-Artificial Analysis.

• פרמטרים — כ-4.66 מיליארד עבור FrogNano לפי תיאור כרטיס המודל שלה עצמו, לעומת 2.4 טריליון בסך הכול וכ-95 מיליארד פעילים עבור Qwen3.8-Max.

A screenshot of the OrcaRouter model page for Qwen3.8 Max showing the breadcrumb Home, Models, Qwen; the model name and the qwen/qwen3.8-max model id; the FEATURED badge with Vision, Tools, JSON and Reasoning capability chips; the 1M-token context, text, image and video input and text output row; the $2.00 and $6.00 per-million price cards with the p50 TTFT figure; the byline 'by Qwen, 2026-08-03'; the on-page section list for Code samples, Pricing, Performance, Public benchmarks, Community buzz, How it compares and FAQ; and the opening of the long description describing Qwen3.8-Max as Alibaba's newest flagship.

איפה ה-{{1}}...{{/1}}

יש ציר אחד שעליו סוכן 4B גובר על מודל חזיתי באופן מוחלט, וזה לא דיוק.

המאמר של FrogNano יוצא מ-Qwen3.5-4B, שהשיג 39.4% ב-SWE-bench Verified דרך תשתית Leaf כמודל כללי רגיל. חמישה סבבי למידת חיזוק על כ-1,500 משימות סינתטיות העלו אותו ל-61.5%, כאשר הנספח של אותו מאמר מדווח על ההתקדמות לפי סבב: 48.2%, 53.4%, 58.3%, 58.6% ו-61.6%. השיטה — יצירת משימות המכוילות לחזית הלמידה של המדיניות הנוכחית, ללא זיקוק ממודל חזק יותר — היא התרומה, והסיבה שקבוצת מחקר ללא תקציב למודל חזיתי תתעניין.

קראו מה זה מרמז לגבי ההשוואה. הכרטיס של Microsoft מציין בכנות ש-FrogNano אינו טוב באופן אחיד מהמודל שממנו הוא בא: שיעור הקריאות המקבילות לכלים שלו הוא 1.71%, מפני שאיטרציות מאוחרות יותר איבדו את היכולת לבצע קריאות במקביל, והצוות הוסיף שלב איחוד כדי לנסות להשיב אותה. מודל שפותר יותר בעיות ובמקביל נעשה גרוע יותר בהתנהגות אחת ספציפית הוא תוצר הנדסי אמיתי עם תפרים גלויים, והכרטיס שלו אומר זאת במקום לקבור את זה.

והנתון של SWE-bench הוא לולאה סגורה. קו הבסיס של מודל הבסיס, ההרנס והציון הסופי — כולם מגיעים מאותה מעבדה, ושתי הטבלאות באותו מאמר נותנות שני סולמות שונים לאותו ניסוי. הנתון של Qwen3.8-Max בתחום הקידוד, לעומת זאת, הופק על ידי Artificial Analysis ולא על ידי Alibaba — סוג אחר של ראיות, סוג אחר של ביטחון, ואסור לגרוע את השניים זה מזה.

ה-4B שאתה עדיין לא ממש יכול לתכנן סביבו

שני דברים עומדים בין FrogNano-4B-2609 לבין משבצת בייצור, ושניהם נמצאים בתיעוד של עצמו ולא בדעתו של שום סוקר.

הראשון הוא חומרה. הכרטיס מציין את דרישת המשקלים ב-BF16 ככ-9.3 GB, ואז מוסיף שהזיכרון "גדל באופן ניכר כאשר ההקשר המשולב מתקרב לכ-131K טוקנים", לפני שהוא קובע שדגם ה-GPU המינימלי המדויק, תצורת ה-VRAM, גרסאות ה-runtime ופרופיל הביצועים "עדיין חייבים להיות מאומתים לפני השחרור" — משפט שמופיע על מודל שכבר ניתן להורידו. איש לא פרסם נתון VRAM עבור התצורה שנבחנה, והכרטיס אינו מכיל נתון כזה.

הנקודה השנייה היא עמדת בטיחות. הערת היישור של מיקרוסופט עצמה אומרת שהפוסט-אימון הייעודי לסוכן לא השתמש במערכי נתונים של העדפות בטיחות, סירוב או תוכן מזיק, ואף לא במערכי נתונים עוינים, שהוא כוונן במקום זאת לנכונות פונקציונלית ולהימנעות מרגרסיות, ושאין לראות במודל "מיושר בטיחות באופן עצמאי לפריסה אוטונומית ללא הגבלה". הכרטיס מסתיים בציון הסיכונים המוחשיים: תיקונים עשויים להיות שגויים או לא מאובטחים אף שעברו את הבדיקות שלהם, הביצועים רגישים לאיכותן של בדיקות אלה, וכל תיקון מועמד זקוק לסקירה אנושית מוסמכת ולבדיקות רגרסיה ואבטחה עצמאיות לפני השימוש. מודל מתארח כללי אינו כולל אף אחת מההסתייגויות הספציפיות הללו, והוא גם לא יריץ פקודת מעטפת במאגר שלך.

מפתח אחד לכל צד שתבחר

הדבר המועיל בהרצת ההשוואה הזו בפועל הוא שרק חצי אחד ממנה הוא הורדה. Qwen3.8-Max, והמודלים הכלליים שמולם הייתם בוחנים סוכן בהתארחות עצמית, כולם נגישים דרך נקודת קצה אחת תואמת OpenAI ב-OrcaRouter בתוספת של 0% — מחיר המחירון של הספק מועבר כפי שהוא, כך ששינוי מחיר של ספק נוחת אצלנו באותו יום, וזה המספר שבאמת זז כשחשבון אסימוני הפלט של סוכן קידוד הוא הדבר שאתם מנסים לשלוט בו. זה גם הופך את שאלת המעבר לגיבוי לפשוטה: אם החצי המתארח של הצינור שלכם נפגע, הניסיון החוזר אוטומטי והניסוי ממשיך.

FrogNano-4B-2609 אינו אחד מהמסלולים שלנו ואין לו תאריך. המשקולות שלך להגשה, והכרטיס כנה בכך שתצורת ההגשה טרם אומתה במלואה. מה שאנחנו יכולים לעשות הוא להפוך את הצד השני של ההשוואה לעלות אפסית בהקמה, כך שהשאלה שאליה תגיע בסופו של דבר תהיה השאלה האמיתית — האם סוכן SWE-bench עם 61.5% לפי דיווח הספק על ה-GPU שלך גובר על מודל חזית בתשלום לפי שימוש על המשימות שלך, בנפח שלך.

A generated two-column scoreboard titled 'FrogNano-4B-2609 vs Qwen3.8-Max'. The left column reads Cost your GPU, electricity; Output tool calls and patches; Context about 131K evaluated; Input text only; Published score 61.5% SWE-bench Verified, vendor, unreproduced; Turn cap 8,192 tokens. The right column reads Cost $2.00 in / $6.00 out per million; Output prose or function call; Context 1,000,000 tokens; Input text, image, video; Published score AA Intelligence 45.4 and AA Coding 76.2, third-party; Turn cap not published. A footer reads 'FrogNano figures per Microsoft; Qwen3.8-Max scores per Artificial Analysis. Different benchmarks; not comparable.'

איזה מהם לבחור

פנו אל Qwen3.8-Max כשהעבודה כללית, כשצוות התפעול של מישהו אחר אמור לשאת בנטל הקיבולת, כשהקלט עשוי להכיל תמונה או מסמך ארוך, או כשאתם זקוקים לתשובה היום ולא למערך הגשה עד יום שישי. הציונים שלו מצדדים שלישיים מאפשרים לחזות בערך מה אתם קונים, והחיוב שלו לפי טוקן הוא עלות משתנה שאפשר לראות לפני שמתחייבים. עבור צוות שמריץ מספר צנוע של משימות מאגר בחודש, ההשוואה החשבונית רחוקה מלהיות צמודה.

פנו אל FrogNano-4B-2609 כאשר הנפח גבוה מספיק לכך שחיוב לפי טוקן על מסלולים ארוכים הוא האילוץ, כאשר הנתונים אינם יכולים לצאת מהתשתית שלכם, או כאשר שאלת המחקר — האם ניתן לאמן סוכן קטן לכשירות ברמת ריפוזיטורי בלי מורה — היא הדבר שאתם בעצם בודקים. גשו לכך בידיעה של שלושה דברים: ה-61.5% הוא מדידה של המעבדה עצמה על הרנס המתוחזק במעבדה, איש לא פרסם נתון VRAM עבור התצורה שנבחנה, והכרטיס עצמו אומר שמערך ההגשה טרם אומת.

מה שהופך את הזיווג הזה לראוי לכתיבה הוא שהם חולקים אב קדמון שני דורות אחורה. FrogNano צאצא של Qwen3.5-4B — דגם כללי מאותה חברה שדגם הדגל שלה בעל 2.4 טריליון פרמטרים נמצא בצד האחר של העמוד הזה. מיקרוסופט לקחה את הקטן, השקיעה חמש איטרציות של RL במאגרים סינתטיים, וקיבלה מומחה. עליבאבא הלכה לכיוון ההפוך והגדילה את קנה המידה. שתי התשובות מפורסמות, והפער בין מה שההורדה עולה לבין מה שה-API עולה הוא הדרך הכנה לבחור ביניהן.

A screenshot of the microsoft/FrogNano GitHub repository README showing the description that FrogNano evaluates coding agents with the Leaf harness in isolated Kubernetes sandboxes against OpenAI-compatible endpoints and five tools Read, Write, Edit, Glob and Bash; the requirements list naming a Kubernetes cluster with pod and network-policy permissions and an OpenAI-compatible endpoint with reasoning and tool-call parsers configured for Qwen3.5; the frognano-eval run commands; and the benchmark table listing SWE-bench Verified at 500 tasks with an 8,192-token cap, SWE-bench Pro at 731 with 32,000, Terminal-Bench 2.0 Verified at 89 with 32,000 and PatchEval Verified at 230 with 8,192.

השוואות במאמר הזה1

זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית