
FrogNano-4B-2609 מול Gemma 4 12B: 61.5% ב-SWE-bench ואיש לא בדק את זה
- openaiחדשOpenAI: GPT-6.1 Sol2026-09-2952אינטליגנציה
- anthropicחדשAnthropic: Claude Sonnet 5.52026-09-2856אינטליגנציה
- typesafeחדשTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 לכל 1M טוקנים · 219 tok/s
- OpenAIחדשOpenAI: GPT-6 Luna2026-09-2238אינטליגנציה
- OpenAIחדשOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- AnthropicחדשAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- xAIחדשGrok 4.72026-09-2146אינטליגנציה
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 לכל 1M טוקנים · 114 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- OpenAIOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- AnthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 לכל 1M טוקנים · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
של מיקרוסופטFrogNano-4B-2609 הוא סוכן קידוד בדרגת ארבעה מיליארד שנגזר מ־Qwen3.5-4B שמדווח על 61.5% ב-SWE-bench Verified. Gemma 4 12B הוא מודל מולטימודלי נטול מקודד של DeepMind עם 11.95 מיליארד פרמטרים, והכרטיס שלו מדווח על 72.0% ב-LiveCodeBench v6. אלה שני המספרים שקונה יעמיד זה לצד זה, והצבתם זה לצד זה היא הטעות. הם מגיעים מבנצ'מרקים שונים, ממערכות הרצה שונות, ממעבדות שונות, ו—חשוב יותר—רק לאחד מהם יש מתודולוגיית הערכה שפורסמה ושאותה קרא אדם זר. כל השאר בהשוואה הזו הוא שאלה של מה כל מודל באמת, והתשובה היא שהם כלל לא אותה קטגוריה של דבר.
הנתונים של FrogNano שלהלן מגיעים מכרטיס המודל של Microsoft ומהדוח הטכני שלה, ושניהם פומביים מאז ספטמבר ואף אחד מחוץ למעבדה לא שחזר אותם. הנתונים של Gemma 4 12B מגיעים מכרטיס המודל של Google, שגם הוא מסמך של ספק — ההבדל הוא שלמספרים של Gemma עומדים מאחוריהם עשרים שבועות ובערך 2.6 מיליון הורדות של בחינה מדוקדקת, ול-FrogNano יש שבועיים ומונה הורדות שעדיין לא עבר לספרות כפולות.
מה נועד כל דגם
זה החלק שדף מפרט מסתיר. FrogNano-4B-2609 אינו מודל כללי שבמקרה טוב בקוד. זהו צ׳קפוינט שכל תהליך הפוסט-אימון שלו היה הנדסת תוכנה ברמת ריפוזיטורי, והוא מיועד לפעול באמצעות מסגרת הרצה ולא לשוחח איתו.
חמשת הכלים שלו הם Read, Write, Edit, Glob ו-Bash. הוא פולט קריאות אליהם, ארגז חול מריץ אותן ומחזיר פלט, והלולאה רצה עד שהמודל מפסיק לבקש. התצורה המוערכת היא 150 צעדי אינטראקציה בתוך כ-131K אסימונים משולבים, והיא הפיקה תיקון מועמד לכל משימה. הכרטיס של Microsoft מבהיר במפורש שהמודל מיועד למאגרים באנגלית, עתירי Python, עם סביבות ברות שחזור וסוויטות בדיקה ברות הרצה, ושמרכיבי התמונה והווידאו שירשו מהמודל הבסיסי מעולם לא עברו אימון פוסט ואינם נתמכים.
ל-Gemma 4 12B מבנה הפוך. זהו מודל מאוחד בעל 48 שכבות עם הקשר של 256K וללא מקודד ראייה או אודיו נפרד — טלאי תמונה גולמיים וצורות גל אודיו מוקרנים ישירות אל מרחב ההטמעה של המפענח היחיד דרך שכבות לינאריות קלות. הוא קולט טקסט, תמונה ואודיו ומוציא טקסט. יש לו מצב חשיבה שמופעל על ידי טוקן בהנחיית המערכת, קריאה נייטיבית לפונקציות, והכרטיס של Google מקפיד למנות זרימות עבודה סוכניות בין השימושים המיועדים שלו.
אז השאלה האמיתית היא לא איזה מהם חכם יותר. היא אם אתה רוצה רכיב מומחה שפועל רק בתוך מערכת שאתה צריך להפעיל, או מודל כללי שעושה עבודה סבירה בהרבה דברים וכל דבר יכול לקרוא לו.

שורה אחר שורה, היכן שהם באמת שונים
• פרמטרים — FrogNano-4B-2609 מפרסם טווח, "500M-5B", על כרטיס שהתיאור שלו עצמו מציין כ־4.66 מיליארד; ההורדה מעמידה אותו על 9.32 GB של משקולות BF16. Gemma 4 12B הוא 11.95B, נאמר פעם אחת ולעולם לא מסויג. היחס הוא בערך 2.6 לאחד, והוא ניכר ישירות במה שאתם צריכים לשכור.
• הקשר — תצורת ההערכה של FrogNano היא כ־131K אסימונים משולבים, כאשר ההסקה ופלט הכלים חולקים את התקציב. ל-Gemma 4 12B יש 256,000 אסימונים, ובשורת ההקשר הארוך שלה בלבד היא משיגה 43.4% ב-MRCR v2 עם שמונה מחטים ב־128K. כמעט פי שניים מהחלון, והמספר השני הוא מדידה שפורסמה ולא טענת יכולת.
• מודאליות — FrogNano-4B-2609 הוא קלט טקסט, פלט טקסט, על אף שמגדל הראייה נמצא בצ'קפוינט שלו. Gemma 4 12B הוא קלט טקסט, תמונה ושמע.
• תקרת פלט — תצורת FrogNano המאומתת מאפשרת 8,192 אסימונים מיוצרים לכל תור של העוזר, ובכרטיס שלה מצוין שתצורת אימון ה-RL השתמשה באותה תקרה. Gemma 4 12B אינה מפרסמת תקרת תור בודד מקבילה; האילוץ שם הוא חלון ה-256K.
• ממשק אג'נטי — FrogNano פולט קריאות Leaf מובנות וזקוק להרנס כדי להריץ אותן. Gemma 4 12B מגיע עם קריאה לפונקציות נייטיבית בצורתו המכווננת להוראות, וניתן לקרוא לו ישירות.
• רישיון — Gemma 4 12B הוא Apache 2.0 לפי התנאים של Gemma 4 מבית Google, וכך נאמר במפורש. הכרטיס של FrogNano הוא MIT בחומר המקדים שלו ו-Apache 2.0 בגוף הכרטיס עצמו — סוג כזה של עמימות מגיע לבדיקה משפטית ולא להערת שוליים.
• מספרים — FrogNano מדווח 61.5% SWE-bench Verified, 37.6% SWE-bench Pro, 31.1% Terminal-Bench 2.0 ו-47.3% PatchEval-Verified. Gemma 4 12B מדווחת 77.2% MMLU Pro, 72.0% LiveCodeBench v6, דירוג Codeforces ELO של 1659, 78.8% GPQA Diamond ו-69.0% ב-Tau2. הכרטיס של Google לא מפרסם שורת SWE-bench, והכרטיס של Microsoft לא מפרסם LiveCodeBench. אין חפיפה כלל בין שני לוחות התוצאות.
התבליט האחרון הוא זה שאמור לשים קץ לאינסטינקט של השוואה לפי מספרים. אף מבחן אחד אינו מופיע בשני הכרטיסים. קורא שמעמיד את 61.5 מול 72.0 השווה שיעור פתרון מאגרי קוד לשיעור מעבר בתכנות תחרותי, וזה בערך כמו להשוות זמן ריצת מרתון לזמן ריצת מאה מטר רק משום ששניהם נמדדים בשניות.
מדוע השתיקה של Google בנוגע ל-SWE-bench אינה דגל אדום
המסקנה המפתה מהנקודה היא של-FrogNano יש מספר SWE-bench אמיתי ולג'מה אין, ולכן FrogNano מנצח בשאלה. זה לא נובע מכך, מסיבה שכדאי לדייק בה.
Gemma 4 12B מדווח על Tau2 ב-69.0% — מדד לשימוש בכלי סוכני על פני שלוש הרצות — לצד תמיכתו בקריאה לפונקציות והמיצוב המפורש שלו לתהליכי עבודה סוכניים. מודל שמקבל 69.0 ב-Tau2 אינו מודל שאינו מסוגל לבצע עבודה סוכנית; זהו מודל שהספק שלו בחר לדווח על ביצועי שימוש בכלים ולא על פתרון מאגרי קוד. כמו כן, Google אינה מדווחת על שורות SWE-bench עבור ה-26B או ה-31B, וזו בחירה עריכתית ברמת המשפחה ולא חולשה של ה-12B.
בינתיים, התוצאה המנוגדת לאינטואיציה במאמר של Microsoft עצמה היא אחת שכל קונה של Gemma צריך לקרוא בעיון. FrogNano מתחיל מ-Qwen3.5-4B, מודל כללי, שהשיג 39.4% ב-SWE-bench Verified דרך ה-harness של Leaf. חמישה סבבים של למידת חיזוק על כ-1,500 משימות סינתטיות העלו אותו ל-61.5%. הלקח אינו ש"מודלים קטנים לא מסוגלים לתכנת" — אלא שצ'קפוינט כללי של 4B עם 39.4% כבר פתר יותר משליש ממערך בעיות קשה ומאומת על ידי בני אדם כשמישהו הריץ אותו בתוך לולאת סוכן מוכשרת. Gemma 4 12B גדול פי שלושה מכך ובוגר יותר בעשרים שבועות. איש לא הריץ אותו דרך Leaf, ועד שמישהו יעשה זאת, הקביעה ש"Gemma אינו סוכן ריפו" היא הנחה ולא ממצא.
מס הרתמה, שלוחות התוצאות מסתירים אותו לחלוטין
הנה האסימטריה המעשית, והיא זו שמכריעה את הרכישה.
Gemma 4 12B הוא מודל. הורד 11.95B של משקלות, הפנה את Transformers, vLLM או SGLang אליהם, שלח טקסט, קבל טקסט. Google מפרסמת את נתיב ההגשה, הרישיון חד-משמעי, וכבר 2.6 מיליון הורדות של אנשים נתקלו בקצוות המחוספסים ותיעדו אותם. אם המשימה היא "סכם את ה-stack trace הזה", "קרא את צילום המסך הזה ותגיד לי מה שבור", או "קרא לפונקציה הזו עם הארגומנטים האלה", זה עובד היום.
FrogNano-4B-2609 הוא מודל בתוספת רתמה, וה-README של מיקרוסופט עצמה הופך את הרתמה לבלתי-אופציונלית. המאגר בכתובת github.com/microsoft/FrogNano הוא מערכת ההערכה Leaf, לא קוד האימון — היא זקוקה לאשכול Kubernetes, מרחב שמות קיים, הרשאות לניהול פודים ומדיניות רשת, גישה למשיכת תמונות מכולה של בנצ'מרק, ונקודת קצה תואמת OpenAI המוגדרת עם מנתחי הסקה וקריאה לכלים המתאימים. הכרטיס של מיקרוסופט מציין את תנאי ההתאמה באופן בוטה: ציונים זהים מחייבים נקודת ביקורת, טוקנייזר, תצורת הגשה, תמונות משימה ופרוטוקול הערכה תואמים. המחצית של הגרסה שמייצרת את הציון היא המחצית שהכרטיס מפנה אליה בקישור ל-GitHub.
יש בכך ערך אמיתי, וראוי לתת לכך שם במקום לבטל אותו. תרומתה של FrogNano היא לולאת סינתזת־משימות שמחוללת מחדש בעיות אימון כנגד יכולת המדיניות הנוכחית — טענת המאמר היא שסוכן קטן יכול להתאמן לרמה תחרותית על משימות סינתטיות בלי דיסטילציה כלל, וזה פותח נתיב לכל מי שאינו יכול להרשות לעצמו מורה מהחזית. ה-API שלה ציבורי. השיטות שלה ניתנות לשחזור עקרונית. זו תרומה חזקה יותר מעוד צ׳קפוינט מצטבר, והיא גם דורשת יותר עבודה ממה שרוב הצוותים שמצטרפים לכך לוקחים על עצמם.

אם אתה בוחר אחד, בחר לפי העבודה
בחר ב-Gemma 4 12B אם העבודה משלבת מודאליות, אם משהו צריך לראות תמונה או לשמוע אודיו, אם ההקשר צריך להכיל עץ קבצים גדול ותמלול ארוך בו-זמנית, או אם אתה רוצה מודל שכל פריימוורק יכול לטעון בלי מערכת שנייה מאחוריו. ציון Tau2 של 69.0 וקריאה לפונקציות נייטיבית הופכים אותו לבחירה מוצדקת לפייפליינים סוכניים, ואף אחד לא צריך להאמין למעבדה על המילה — המודל הוערך על ידי אלפי אנשים והתוצאות אינן סוד.
קח את FrogNano-4B-2609 אם אתה כבר מריץ סוכן מאגר בארגז חול ואתה רוצה צ'קפוינט בדרגת 4B להכניס לתוכו, ואם הורדה של 9.32 GB שנכנסת בחומרה צנועה היא האילוץ שמניע את ההחלטה. היה מפוכח לגבי סדר הדברים: אתה לא קונה ציון, אתה מהמר על שיטה, והדבר הראשון שתגלה הוא אם לולאת ה-polling שלך ומנתח קריאות הכלים שלך נראים דומים מספיק ל-Leaf. יש צוותים שיקבלו התנהגות בסמוך ל-61.5% אחר הצהריים של היום השלישי, ויש שיבזבזו שבועיים עד שיגלו שמערך ההערכה שלהם היה קל יותר מ-SWE-bench Verified, ואף אחד מחוץ למעבדה עדיין לא יכול לומר לך איזה משני המקרים אתה.
אם ההחלטה באמת צמודה, הניסוי הזול הוא להריץ את שניהם בתוך אותה הרנס (harness) על הבעיות שלכם, במקום להתווכח על מספרים שפורסמו ושאין להם בנצ'מרק משותף. OrcaRouter מאחסנת יותר מ-200 מודלים מאחורי מפתח יחיד תואם OpenAI בתוספת של 0%, כך שמחירי המחירון של הספקים עוברים כמו שהם — מה שמאפשר להעמיד מודל כללי מתארח ואת שאר סט המועמדים שלכם מאחורי נקודת קצה אחת ושורת חיוב אחת בזמן שאתם מחליטים. FrogNano אינו אחד מהמסלולים שלנו ואין תאריך עבורו; המשקלים הם הורדה שאתם מארחים בעצמכם. מה שאנחנו יכולים להסיר הוא החיכוך בצד השני של ההשוואה: החלפת מודלים מועמדים בהרנס שלכם בלי חוזה שני, בלי SDK שני, ובלי סט שני של הרשאות.

הסיכום הכנה הוא שמספר 61.5 הוא עבודה אמיתית של המעבדה שיצרה אותו, ושהוא כרגע הסיבה היחידה להעדיף את FrogNano בקידוד. כשמישהו מחוץ ל-Microsoft ישחזר את 61.5 על אותם 500 משימות — או ייכשל בכך — ההשוואה הזו תקבל תשובה אמיתית. עד אז ברירת המחדל הבטוחה יותר עבור רוב הצוותים היא מודל 11.95B עם הרישיון הנקי, מדידת ההקשר הארוך שפורסמה, ועשרים שבועות של טעויות של אחרים שכבר נספגו לתוך התיעוד שלו.
