
FrogNano-4B-2609 לעומת Qwen 3.8: כמה עולה סוכן קידוד כשהמשקולות שלך
- openaiחדשOpenAI: GPT-6.1 Sol2026-09-2952אינטליגנציה
- anthropicחדשAnthropic: Claude Sonnet 5.52026-09-2856אינטליגנציה
- typesafeחדשTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 לכל 1M טוקנים · 219 tok/s
- OpenAIחדשOpenAI: GPT-6 Luna2026-09-2238אינטליגנציה
- OpenAIחדשOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- AnthropicחדשAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- xAIחדשGrok 4.72026-09-2146אינטליגנציה
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 לכל 1M טוקנים · 114 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- OpenAIOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- AnthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 לכל 1M טוקנים · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
microsoft/FrogNano-4B-2609 הוא סוכן מאגרים בדרגת ארבעה מיליארד פרמטרים, הנגזר מ-Qwen3.5-4B, שאותו אתה מוריד ומארח בעצמך. Qwen3.8-Max הוא דגל האירוח — מודל תערובת מומחים דלילה עם 2.4 טריליון פרמטרים, שכ-95 מיליארד מהם פעילים לכל טוקן, חלון מולטימודלי של מיליון טוקנים, ומחירון של 2.00 דולר למיליון טוקני קלט ו-6.00 דולר למיליון טוקני פלט — נגיש עם מפתח API מאז 3 באוגוסט 2026. אחד מהם עולה GPU ואחר צהריים. האחר לא עולה דבר עד שתשתמש בו, ואז מחייב לפי טוקן במסלולים הארוכים ביותר בשימוש נפוץ. העסקה הזו, ולא טבלת הבנצ'מרקים, היא ההתמודדות האמיתית.
הנתונים של FrogNano כאן מגיעים מכרטיס המודל והדוח הטכני של מיקרוסופט; הנתונים של Qwen3.8-Max מגיעים מהתמחור המפורסם של אליבאבא ומרשומת המודל בקטלוג שלנו, כאשר הציונים העצמאיים מסומנים כמספרי Artificial Analysis בכל מקום שבו הם מופיעים. שימו לב היטב לשמות: Qwen3.8, מהדורת המשקלים הפתוחים, הוכרזה אך טרם שוחררה, ואילו Qwen3.8-Max פעילה ומתומחרת היום. כל מה שניתן להפעיל במאמר זה הוא האחרון.
האריתמטיקה שמכריעה את ההשוואה
התחל במה שעולה משימה בודדת, כי זה לא מובן מאליו וזה לא קטן.
ההערכות של FrogNano הריצו כל מסלול עם תקציב של 150 צעדים בתוך כ-131K טוקנים משולבים, עד 8,192 טוקנים מיוצרים בכל תור של העוזר, ותקרה של 10,800 שניות. הכפילו את שתי המגבלות שפורסמו ותקבלו תקרה של כ-1.23 מיליון טוקנים מיוצרים עבור מסלול אחד במקרה הגרוע ביותר — אשר בתעריף של $6.00 למיליון טוקני פלט של Qwen3.8-Max מסתכם בכ-$7.38 עבור משימה בודדת שהגיעה עד תום התקציב שלה. זהו חישוב אריתמטי על שני מספרים שפורסמו, לא מדידה: מסלולים אמיתיים נעצרים מוקדם, הממוצע נמוך בהרבה מהתקרה, ותוצאות כלים ופלט מעטפת מחויבים בתעריף הקלט הזול יותר ולא בתעריף הפלט. אבל זה ממחיש את צורת הדבר. סוכן קידוד לא מוציא כמה מאות טוקנים על שאלה; הוא מוציא שיחה ארוכה ועתירת הסקה עם עצמו, וכל טוקן בשיחה הזו מיוצר.
כעת הנח את הצד השני של המאזן לצידו. FrogNano-4B-2609 הוא 9.32 ג'יגה-בייט של משקולות BF16 בשני מקטעים, הניתנים להורדה ללא שער גישה. הגשתו דורשת SGLang עם מנתח חשיבה של Qwen3 ומנתח קריאות-כלים של Qwen3 coder, ובנוסף ארגז חול מבודד עבור חמשת הכלים. לאחר מכן, העלות השולית של מסלול היא חשמל, והזיכרון שהוא תופס הוא מה שההקשר שלך גדל אליו, ולא מה שהמשקולות שוקלות.
• מודל עלויות — FrogNano-4B-2609 הוא עלות חומרה קבועה ועלות שולית כמעט אפסית. Qwen3.8-Max הוא עלות קבועה אפסית וחיוב לפי טוקנים, עם פיצול של $2.00 / $6.00 שלא מקדים דבר ומעמיס את הכול בקצב הפלט.
• מה הכסף קונה — סוכן בדרגת 4B על הסיליקון שלכם, מול מודל בקנה מידה חזיתי שלעולם לא תצטרכו לתכנן עבורו קיבולת.
• נקודת איזון — היא מושגת כאשר נפח המסלולים החודשי שלך כפול חשבון הטוקנים הממוצע לכל מסלול עולה על עלות ה-GPU שאחרת היית שוכר. עבור צוות שמריץ קומץ משימות מאגר ביום, הקו הזה רחוק מאוד, והמודל המתארח מנצח בזכות הנוחות בלבד.
שני מודלים שאינם מבצעים את אותה עבודה
השוואת העלויות הוגנת רק אם התפוקות ברות השוואה, וכאן הן אינן, וזה החלק שרוב דפי המפרט קוברים.
FrogNano-4B-2609 עבר אימון־המשך אך ורק על הנדסת תוכנה ברמת מאגר. הממשק כולו הוא לולאה של חמישה כלים — Read, Write, Edit, Glob ו־Bash — המופעלת על ידי רתמת Leaf בארגז חול מבודד, תוך איטרציות עד שהמודל מפסיק לקרוא. הכרטיס של Microsoft מציין שהשפה הנתמכת היא אנגלית ותחום התכנות המאומת הוא Python, ואומר במפורש שרכיבי תמונה ווידאו בנקודת הביקורת מעולם לא עברו אימון־המשך ואינם נתמכים. הוא אינו מנמק בנוגע לארכיטקטורה שלך, אינו עונה על שאלות על העסק שלך ואינו קורא צילום מסך.
Qwen3.8-Max הוא מודל כללי. רשומת הקטלוג של Alibaba מספקת לו קלט טקסט, תמונה ווידאו עם פלט טקסט וחלון הקשר של 1,000,000 טוקנים. הוא מנמק, כותב, קורא מסמכים ומנהל שיחה, וקריאה לפונקציות היא תכונה של מודל כללי ולא כל מטרת נקודת הבדיקה. הנתונים שלו מ-Artificial Analysis, כפי שנקראו מהרשומה ב-2 בספטמבר 2026, הם מדד אינטליגנציה של 45.4 ומדד קידוד של 76.2.
• קלט — FrogNano-4B-2609 הוא טקסט בלבד. Qwen3.8-Max מקבל טקסט, תמונות ווידאו.
• הקשר — כ־131K טוקנים משולבים בתצורה הנמדדת של FrogNano, לעומת 1,000,000 עבור Qwen3.8-Max. זהו גורם של שבעה וחצי, והוא חשוב ביותר בדיוק עבור קלטים בהיקף של מאגר קוד שסוכן קידוד מקבל.
• פלט לכל תור — התצורה המאומתת של FrogNano מגבילה תור עוזר בודד ל-8,192 טוקנים. Qwen3.8-Max אינה מפרסמת תקרה מקבילה לכל תגובה.
• פורמט פלט — FrogNano פולט קריאות כלים מובנות של Leaf וזקוק למנגנון הרצה כדי להריץ אותן. Qwen3.8-Max מחזיר טקסט חופשי או קריאת פונקציה לכל לקוח שכבר יש לך.
• ציונים בלתי־תלויים — אין כאלה עבור FrogNano-4B-2609 מעבר לכרטיס שלו עצמו; הנתונים של Qwen3.8-Max שלמעלה הם של צד שלישי, מ-Artificial Analysis.
• פרמטרים — כ-4.66 מיליארד עבור FrogNano לפי תיאור כרטיס המודל שלה עצמו, לעומת 2.4 טריליון בסך הכול וכ-95 מיליארד פעילים עבור Qwen3.8-Max.

איפה ה-{{1}}...{{/1}}
יש ציר אחד שעליו סוכן 4B גובר על מודל חזיתי באופן מוחלט, וזה לא דיוק.
המאמר של FrogNano יוצא מ-Qwen3.5-4B, שהשיג 39.4% ב-SWE-bench Verified דרך תשתית Leaf כמודל כללי רגיל. חמישה סבבי למידת חיזוק על כ-1,500 משימות סינתטיות העלו אותו ל-61.5%, כאשר הנספח של אותו מאמר מדווח על ההתקדמות לפי סבב: 48.2%, 53.4%, 58.3%, 58.6% ו-61.6%. השיטה — יצירת משימות המכוילות לחזית הלמידה של המדיניות הנוכחית, ללא זיקוק ממודל חזק יותר — היא התרומה, והסיבה שקבוצת מחקר ללא תקציב למודל חזיתי תתעניין.
קראו מה זה מרמז לגבי ההשוואה. הכרטיס של Microsoft מציין בכנות ש-FrogNano אינו טוב באופן אחיד מהמודל שממנו הוא בא: שיעור הקריאות המקבילות לכלים שלו הוא 1.71%, מפני שאיטרציות מאוחרות יותר איבדו את היכולת לבצע קריאות במקביל, והצוות הוסיף שלב איחוד כדי לנסות להשיב אותה. מודל שפותר יותר בעיות ובמקביל נעשה גרוע יותר בהתנהגות אחת ספציפית הוא תוצר הנדסי אמיתי עם תפרים גלויים, והכרטיס שלו אומר זאת במקום לקבור את זה.
והנתון של SWE-bench הוא לולאה סגורה. קו הבסיס של מודל הבסיס, ההרנס והציון הסופי — כולם מגיעים מאותה מעבדה, ושתי הטבלאות באותו מאמר נותנות שני סולמות שונים לאותו ניסוי. הנתון של Qwen3.8-Max בתחום הקידוד, לעומת זאת, הופק על ידי Artificial Analysis ולא על ידי Alibaba — סוג אחר של ראיות, סוג אחר של ביטחון, ואסור לגרוע את השניים זה מזה.
ה-4B שאתה עדיין לא ממש יכול לתכנן סביבו
שני דברים עומדים בין FrogNano-4B-2609 לבין משבצת בייצור, ושניהם נמצאים בתיעוד של עצמו ולא בדעתו של שום סוקר.
הראשון הוא חומרה. הכרטיס מציין את דרישת המשקלים ב-BF16 ככ-9.3 GB, ואז מוסיף שהזיכרון "גדל באופן ניכר כאשר ההקשר המשולב מתקרב לכ-131K טוקנים", לפני שהוא קובע שדגם ה-GPU המינימלי המדויק, תצורת ה-VRAM, גרסאות ה-runtime ופרופיל הביצועים "עדיין חייבים להיות מאומתים לפני השחרור" — משפט שמופיע על מודל שכבר ניתן להורידו. איש לא פרסם נתון VRAM עבור התצורה שנבחנה, והכרטיס אינו מכיל נתון כזה.
הנקודה השנייה היא עמדת בטיחות. הערת היישור של מיקרוסופט עצמה אומרת שהפוסט-אימון הייעודי לסוכן לא השתמש במערכי נתונים של העדפות בטיחות, סירוב או תוכן מזיק, ואף לא במערכי נתונים עוינים, שהוא כוונן במקום זאת לנכונות פונקציונלית ולהימנעות מרגרסיות, ושאין לראות במודל "מיושר בטיחות באופן עצמאי לפריסה אוטונומית ללא הגבלה". הכרטיס מסתיים בציון הסיכונים המוחשיים: תיקונים עשויים להיות שגויים או לא מאובטחים אף שעברו את הבדיקות שלהם, הביצועים רגישים לאיכותן של בדיקות אלה, וכל תיקון מועמד זקוק לסקירה אנושית מוסמכת ולבדיקות רגרסיה ואבטחה עצמאיות לפני השימוש. מודל מתארח כללי אינו כולל אף אחת מההסתייגויות הספציפיות הללו, והוא גם לא יריץ פקודת מעטפת במאגר שלך.
מפתח אחד לכל צד שתבחר
הדבר המועיל בהרצת ההשוואה הזו בפועל הוא שרק חצי אחד ממנה הוא הורדה. Qwen3.8-Max, והמודלים הכלליים שמולם הייתם בוחנים סוכן בהתארחות עצמית, כולם נגישים דרך נקודת קצה אחת תואמת OpenAI ב-OrcaRouter בתוספת של 0% — מחיר המחירון של הספק מועבר כפי שהוא, כך ששינוי מחיר של ספק נוחת אצלנו באותו יום, וזה המספר שבאמת זז כשחשבון אסימוני הפלט של סוכן קידוד הוא הדבר שאתם מנסים לשלוט בו. זה גם הופך את שאלת המעבר לגיבוי לפשוטה: אם החצי המתארח של הצינור שלכם נפגע, הניסיון החוזר אוטומטי והניסוי ממשיך.
FrogNano-4B-2609 אינו אחד מהמסלולים שלנו ואין לו תאריך. המשקולות שלך להגשה, והכרטיס כנה בכך שתצורת ההגשה טרם אומתה במלואה. מה שאנחנו יכולים לעשות הוא להפוך את הצד השני של ההשוואה לעלות אפסית בהקמה, כך שהשאלה שאליה תגיע בסופו של דבר תהיה השאלה האמיתית — האם סוכן SWE-bench עם 61.5% לפי דיווח הספק על ה-GPU שלך גובר על מודל חזית בתשלום לפי שימוש על המשימות שלך, בנפח שלך.

איזה מהם לבחור
פנו אל Qwen3.8-Max כשהעבודה כללית, כשצוות התפעול של מישהו אחר אמור לשאת בנטל הקיבולת, כשהקלט עשוי להכיל תמונה או מסמך ארוך, או כשאתם זקוקים לתשובה היום ולא למערך הגשה עד יום שישי. הציונים שלו מצדדים שלישיים מאפשרים לחזות בערך מה אתם קונים, והחיוב שלו לפי טוקן הוא עלות משתנה שאפשר לראות לפני שמתחייבים. עבור צוות שמריץ מספר צנוע של משימות מאגר בחודש, ההשוואה החשבונית רחוקה מלהיות צמודה.
פנו אל FrogNano-4B-2609 כאשר הנפח גבוה מספיק לכך שחיוב לפי טוקן על מסלולים ארוכים הוא האילוץ, כאשר הנתונים אינם יכולים לצאת מהתשתית שלכם, או כאשר שאלת המחקר — האם ניתן לאמן סוכן קטן לכשירות ברמת ריפוזיטורי בלי מורה — היא הדבר שאתם בעצם בודקים. גשו לכך בידיעה של שלושה דברים: ה-61.5% הוא מדידה של המעבדה עצמה על הרנס המתוחזק במעבדה, איש לא פרסם נתון VRAM עבור התצורה שנבחנה, והכרטיס עצמו אומר שמערך ההגשה טרם אומת.
מה שהופך את הזיווג הזה לראוי לכתיבה הוא שהם חולקים אב קדמון שני דורות אחורה. FrogNano צאצא של Qwen3.5-4B — דגם כללי מאותה חברה שדגם הדגל שלה בעל 2.4 טריליון פרמטרים נמצא בצד האחר של העמוד הזה. מיקרוסופט לקחה את הקטן, השקיעה חמש איטרציות של RL במאגרים סינתטיים, וקיבלה מומחה. עליבאבא הלכה לכיוון ההפוך והגדילה את קנה המידה. שתי התשובות מפורסמות, והפער בין מה שההורדה עולה לבין מה שה-API עולה הוא הדרך הכנה לבחור ביניהן.

השוואות במאמר הזה1
זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית
