כרטיס כותרת שנוצר שעליו כתוב 'FrogNano-4B-2609' עם כותרת המשנה 'סוכן קידוד 4B על בסיס Qwen3.5-4B', שלושה צ'יפים שעליהם כתוב '59.6B בתים של משקלים', 'הכרטיס אומר 22-SEP-2026' ו'אין פוסט השקה', כותרת תחתונה שעליה כתוב 'נתונים לפי כרטיס המודל והדוח הטכני של Microsoft; שום דבר כאן אינו משוחזר באופן עצמאי', והלוגו של OrcaRouter מורכב בפינה הימנית התחתונה.
Engineering & Research

FrogNano-4B-2609: Microsoft שלחה סוכן קידוד 4B ל-Hugging Face ומעולם לא הודיעה על כך

מחבר

Alistair Wren

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים →
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

המאגר עלה ב-17 בספטמבר 2026 עם ה-commit הראשוני, והצ'קפוינט עצמו נחת ארבע דקות לאחר מכן. ואז כלום. אין ציוץ מ-Microsoft AI, אין רשומה בבלוג של Microsoft Research, אין דף השקה. שבעה שבועות לאחר מכן microsoft/FrogNano-4B-2609 — סוכן קוד ברמת ארבעה מיליארד פרמטרים הבנוי על Qwen3.5-4B — עדיין אין מאחוריו שום הכרזה, והשקט הזה הוא העובדה החשובה ביותר היחידה בנוגע לפרסום של המודל הזה. מה שכן יש לו הוא כרטיס מודל שמתיימר להצביע על מאמר ועל harness, מאגר GitHub שמתברר שהוא ה-harness ולא המאמר, ו-createdAt של 17 בספטמבר שיושב תחת כרטיס שאומר "תאריך הפצה 22-SEP-2026". שני התאריכים מאולתרים; אף אחד מהם אינו שגוי; הם סותרים זה את זה.

מה למעשה מפורסם

כל מה שלהלן ניתן לבדיקה ב-hub ממש עכשיו, וכל נתון בקטע הזה מגיע מהכרטיס של Microsoft עצמה או מספירת הבתים במאגר עצמו. שום דבר לא שוחזר על ידי צד שלישי — אין רשומה של Artificial Analysis, אין דירוג arena, ואין הערכה עצמאית של FrogNano בשום מקום.

• משקלים — מאגר ציבורי אחד תחת ארגון Microsoft, ללא הגבלה, מתויג MIT ב-hub, 15 קבצים, ללא שער הורדה וללא הסכם לחתום עליו.

• משקלים בדיסק — 9.32 GB על פני שני שארדים של safetensors, 59.6 מיליארד בתים של נתוני מאגר כולל מערך הקבצים ללא אופטימיזר, 738 טנסורים באינדקס.

• ארכיטקטורה — Qwen3_5ForConditionalGeneration, המחסנית ההיברידית הצפופה בת 32 השכבות שעברה בירושה מ-Qwen3.5-4B, עם מגדל ראייה בן 24 שכבות שכרטיס המודל מציין כי עבר בירושה ומעולם לא עבר אימון-המשך.

• שדה הפרמטר של הכרטיס עצמו — "500M-5B". זהו טווח, לא מספר, והקובץ המורד הוא המסמך המדויק יותר.

• רישיון — החלק הפותח של הכרטיס אומר MIT. הגוף של הכרטיס עצמו אומר רישיון Apache 2.0, וההרנס של GitHub אכן כולל קובץ LICENSE של MIT. שתי ההצהרות האלה עוסקות בארטיפקטים שונים באותה מהדורה.

• הכרזה — אין. לא בבלוג של Microsoft Research, לא באתר המחקר של הצוות עצמו, ולא בפיד הארגון של Hugging Face בשום צורה שאינה רשומת מאגר.

השורה האחרונה היא זו שאמורה לעצב את עמדת הקורא להמשך היצירה הזו. צ'קפוינט שהועלה בשקט אינו ארטיפקט פחות ערך מזה שהוכרז — הכרטיס שלו לעיתים קרובות ארוך יותר, כי איש אינו מקצר אותו לקראת הודעה לעיתונות. אבל הוא לא עבר את המסננת האחת ששחרור מוכרז זוכה לה בחינם: אנשים אחרים שמסתכלים עליו.

A screenshot of Microsoft's Hugging Face model card for FrogNano-4B-2609 showing the model summary table with rows for Developer (Microsoft Corporation), Description, Model architecture, Parameters (500M-5B), Inputs, Outputs, Context length (approximately 131K tokens in the evaluated coding-agent configuration), Training Dates (Jun 2026 to Aug 2026), Release date (22-SEP-2026), License (Apache License 2.0), the Qwen/Qwen3.5-4B model dependency, the 'Technical report;' and 'Leaf harness.' asset links, and the section 1 Model overview naming Qwen3.5-4B and the dense 32-layer hybrid Gated DeltaNet and gated-attention architecture.

הציונים, ומי הפיק כל אחד מהם.

מיקרוסופט מדווחת ש-FrogNano משיג 61.5% ב-SWE-bench Verified, 37.6% ב-SWE-bench Pro, 31.1% ב-Terminal-Bench 2.0, ו-47.3% ב-PatchEval-Verified, כולם כשיעורי פתרון Avg@3 הנמדדים באמצעות ה-Leaf harness. אותו כרטיס נותן את נקודת ההתחלה: Qwen3.5-4B קיבל 39.4% ב-SWE-bench Verified תחת אותו harness ותקציב. חמש איטרציות של למידת חיזוק הובילו אותו דרך 49.1%, 53.1%, 56.7%, 59.1% ו-61.5% — 22.1 נקודות מעל מודל הבסיס, אשר הניסוח של מיקרוסופט עצמה מעגל לכ-56% שיפור יחסי.

שני דברים בסולם הזה שווה להתעכב עליהם, כי אלה מקומות שבהם סיכום עלול להשתבש, ולא מקומות שבהם הספק השתבש.

הראשון הוא אי-ההתאמה ב-Iter 5. הטבלה הראשית של הכרטיס אומרת 61.5% עבור האיטרציה האחרונה; נספח היעילות של המאמר עצמו מדווח על אותה התקדמות של חמש נקודות ביקורת כ-48.2%, 53.4%, 58.3%, 58.6% ו-61.6%. רק המספר האחרון קרוב, ורק המספר האחרון הוא זה שמצטטים. התייחס לנתון הסופי כתוצאה היציבה ולמדרגות הביניים כמדידה של דברים שונים, משום שבצבירה שונה הם בבירור מדידות של דברים שונים.

הנקודה השנייה היא ש-FrogNano אינו טוב יותר באופן אחיד מהמודל שממנו התחיל בכל ציר. שיעור קריאות הכלים המקבילות המפורסם שלו הוא 1.71%. הכרטיס מציין בכנות שאיטרציות מאוחרות יותר איבדו את היכולת לשגר מספר קריאות כלים בתור בודד, ושעבודת הגיבוש של הצוות קיימת בחלקה כדי לשחזר אותה. מודל שפותר יותר בעיות אך כמעט אינו מבצע קריאות מקבילות הוא פשרה הנדסית אמיתית, ולא הערת שוליים.

A generated two-column scoreboard reading 'Microsoft reports' on the left with rows Qwen3.5-4B base 39.4%, Iter 2 49.1%, Iter 4 59.1% and Iter 5 61.5%, and 'What is not verified' on the right with rows Independent evaluation: none, Parallel tool calls: 1.71%, Repository size: 59.6B bytes, Card release date: 22-SEP-2026 and Hub created: 17-SEP-2026, with a footer reading 'All scores vendor-reported through the Leaf harness; no third party has reproduced any of them.'

הרתמה היא המוצר, והמאגר הוא הרתמה

FrogNano לא פועל מעצמו. הוא פולט קריאות מובנות לחמישה כלים — Read, Write, Edit, Glob וBash — ומשהו צריך להריץ אותן בסביבה מבודדת ולהחזיר את הפלט. הדבר הזה הוא Leaf, וכאן השביל עושה משהו קצת יוצא דופן.

שורת "נכסים קשורים נוספים" בכרטיס המודל מקשרת לדוח טכני בכתובת aka.ms/frognano-tech-report ולמעטפת הרצה בכתובת github.com/microsoft/FrogNano. הקישור aka.ms אינו מפנה ל-PDF; הוא מפנה ישירות לעמוד התקציר ב-arXiv, וזה המקום שבו נמצא הדוח עצמו. מאגר ה-GitHub, לעומת זאת, אינו מכיל קוד אימון, מתכון ל-RL או צ'קפוינטים. קובץ ה-README של המאגר עצמו מתאר מעטפת הערכה שמריצה סוכני קוד בארגזי חול של Kubernetes מול נקודת קצה תואמת OpenAI, ומפנה בחזרה למאמר ב-arXiv לצורך סיפור האימון. אם כך, שני קישורי הנכסים בכרטיס הם הפניה למאמר והפניה לתגובה של המאמר, והשם הוא שם משותף.

זה חשוב לכל מי שמתכנן להשתמש במודל, מסיבה מעשית. מתכון ההגשה המתועד הוא SGLang עם --reasoning-parser qwen3 ו--tool-call-parser qwen3_coder, וההרנס רוצה נקודת קצה שכבר מדברת קריאות כלים והסקה. די לטעות קלות בתצורת הפענוח כדי שהמודל יפיק טקסט במקום שבו ההרנס מצפה ל-JSON, וזה, במבט מבחוץ, נראה בדיוק כמו מודל גרוע ולא כמו תצורה גרועה. הכרטיס מפורש בכך שכל ציון תואם מחייב צ'קפוינט תואם, טוקנייזר, תצורת הגשה, תמונות משימה ופרוטוקול הערכה — כלומר הספק אומר לך שההרנס הוא חצי מהתוצאה.

כדאי גם לומר בבירור לכל מי שמחשב גדלים של חומרה: צ'קפוינט בנפח 9.32 GB בהקשר המוערך של הכרטיס אינו בעיית הסקה בנפח 9.32 GB. ההערכות רצו בכ-131K טוקנים משולבים עם תקציב של 150 צעדים. הזיכרון מתאים את עצמו לגודל ההקשר, לא למשקולות, והכרטיס אומר שתצורת ה-GPU המינימלית עדיין "חייבת להיות מאומתת לפני ההפצה" — ביטוי שמופיע על מודל שכבר ניתן להוריד.

מה שהאימון בעצם עשה, בפסקה אחת

התרומה של המאמר אינה המודל, אלא הלולאה. TaskPilot מייצר משימות הנדסת תוכנה מועמדות מתוך תמונות מצב אמיתיות של מאגרי קוד, מריץ רולאאוטים מהצ'קפוינט הנוכחי כנגדן, שומר את אלה שנמצאות סמוך לגבול מה שהמדיניות מסוגלת לפעמים לפתור, ופוסל מועמדים שהם טריוויאליים לצמיתות או בלתי אפשריים לצמיתות. הקבוצה שהתקבלה מאמנת את הצ'קפוינט הבא. הצ'קפוינט הבא מכייל אז את סבב יצירת המשימות הבא, כך שהתפלגות המשימות נעה יחד עם המדיניות. בסך הכול כ-1,500 סביבות מאומתות. אין זיקוק: הכרטיס מציין במפורש שפוסט-אימון ייעודי לסוכן לא עשה שימוש במסלולי פתרון, בפעולות, בעקבות היסק או ביעדי תיקון של מודלים חזקים יותר. מודלים חזקים יותר כותבים משימות; הם אינם מדגימים תשובות.

Microsoft הריצה את הלולאה הזו במשך חמישה איטרציות ומדווחת על רווח של 8.7 נקודות לפני כל איחוד, כאשר באמצע הריצה נוסף קנס על אורך הלוג משום שעקבות החשיבה גדלו מהר יותר משהן השתפרו.

כרטיס המודל ישיר באופן יוצא דופן לגבי המקומות שבהם כל הגישה שברירית. נתוני האימון עתירי פייתון ובעיקר אנגלית; מערך השפות הטבעיות הנתמכות המוצהר בכרטיס הוא אנגלית ולא דבר אחר, כאשר הכיסוי הרב-לשוני הרחב יותר של מודל הבסיס אינו נכלל במפורש בטענות. הביצועים רגישים לרתמת הבדיקות ולאיכות הבדיקות. טלאים שנוצרו "עשויים להיות שגויים או לא מאובטחים למרות שהם עוברים את הבדיקות הזמינות". כרטיס המודל של 4B חותם את הפסקה הזו במשפט שכל קורא צריך לקחת איתו: אין להשתמש בו ללא סקירה אנושית מוסמכת ובדיקות רגרסיה ואבטחה בלתי תלויות. זוהי הצהרה של ספק על תוצר של ספק, והיא משפט שימושי יותר מכל אחת משורות לוח הניקוד שמעליו.

מה זה אומר לקונה, ואיפה הנתב משתלב

FrogNano אינו מודל שאתה קורא לו. אין API של צד ראשון, אין נקודת קצה מתארחת, ואין תמונת serverless. זהו צ'קפוינט, ושימוש בו פירושו להקים פריסת SGLang משלך מאחורי ארגז חול המתארח ב-Kubernetes, או להעריך אותו כרכיב בתוך מחסנית סוכנים שאתה כבר מפעיל. זהו כל מסלול האימוץ היום, ושום הכרזה לא הייתה משנה את צורתו.

מה ששכבת ניתוב יכולה בכנות לעשות כאן הוא דבר צר יותר ממה שזה נשמע במבט ראשון. אם התוכנית היא להשוות FrogNano בהארחה עצמית מול מודל קידוד מתארח בתוך הארנס שלכם, החצי המתארח הוא החצי שנהנה מלהיות מאחורי מפתח אחד במקום חוזה שני: OrcaRouter מציג למעלה מ-200 מודלים מאחורי נקודת קצה אחת תואמת OpenAI במרווח של 0%, כלומר מחירי המחירון של הספקים עוברים ללא שינוי ושינוי מחיר של ספק נכנס לתוקף אצלנו באותו היום. זה חשוב להשוואה תחרותית שתוצאתה נקבעת לפי עלות לכל בעיה שנפתרה ולא לפי מספר בנצ'מרק בודד. אנחנו לא מארחים את FrogNano ואין תאריך לכך; המשקלים ועבודת ההגשה הם באחריותכם.

A generated timeline card headed 'One model, three dates' with three markers: 17 September 2026 labelled 'Hugging Face creation timestamp', 22 September 2026 labelled 'Release date printed on the model card', and 2 October 2026 labelled 'Most recent file update', with a footer reading 'No announcement accompanied any of the three. Dates read from the Hugging Face repository history on 3 October 2026.'

שלושת הדברים שיכריעו את זה

ראשית, שחזור בלתי תלוי. כל מספר במאמר הזה — 61.5, 37.6, 31.1, 47.3 — הופק על ידי המעבדה שאימנה את המודל, על גבי מערכת בדיקה שאותה מעבדה מתחזקת, מול נתון של מודל בסיס שאותה מעבדה מדדה. זו תמונה מלאה ועקבית פנימית, והיא גם לולאה סגורה. המבחן השימושי הוא אם מישהו ללא אינטרס משחזר את הקפיצה מ-39.4 ל-61.5 על אותן 500 משימות בלי עבודת הכיול של Microsoft על סט המשימות.

שנית, מישהו צריך לבדוק את טענת מערך הבדיקות מקצה לקצה. המאגר ציבורי, וזה יותר ממה שהרבה מהדורות מצליחות להשיג, אבל זהו מערך ההערכה. אם חמשת הכלים ובידוד ארגז החול הם באמת מנגנון הביצועים, צד שלישי שמריץ את התצורה שפורסמה אמור להגיע קרוב למספרים שפורסמו. אם לא, הפער הוא הממצא האמיתי.

שלישית, וזו התשובה הזולה ביותר: מיקרוסופט צריכה לומר אם מדובר במוצר או בארטיפקט על הנייר. סעיף ההפצה של הכרטיס מתייחס למשקלים, לכרטיס ולההרנס בתור התוצר, מה שנקרא כמו פרסום ולא כמו השקה. "תאריך שחרור 22-SEP-2026" נקרא כמו השקה. מודל שהוכרז היה פותר את העמימות הזו במשפט הראשון של פוסט בבלוג, ואין פוסט בבלוג.

עד אז, העמדה הנכונה היא זו שהשחרור עצמו מרמז עליה. FrogNano-4B-2609 הוא צ'קפוינט אמיתי, להורדה, עם רישיונות MIT ו-Apache ואולי לא, עם כרטיס מודל יסודי במיוחד, רתמת הערכה אמיתית, רעיון מתודולוגי אמיתי, ולוח תוצאות שמעולם לא נגע בו איש בלי כתובת Microsoft. עבור מעבדה, זהו ארטיפקט שלם ומעניין. עבור צוות שעומד להעמיד סוכן מול מאגר קוד בשעה שלוש לפנות בוקר, זהו קצה חוט ששווה לעקוב אחריו, ועדיין לא החלטה ששווה לקבל.