כרטיס כותרת שנוצר עם הכיתוב 'FrogNano-4B-2609 vs LFM2.5 2.6B Base' וכותרת משנה 'סוכן 4B מוגמר מול צ'קפוינט קדם-מאומן של 2.69B', שלושה צ'יפים עם הכיתוב 'פוסט-אימון RL הושלם', 'קדם-אימון בלבד, 2.69B צפוף ב-30 שכבות' ו'ללא כיוונון הוראות', כותרת תחתונה עם הכיתוב 'שתי העמודות לפי דיווח הספק; אף צד שלישי לא דירג אף אחד מהמודלים', והלוגו של OrcaRouter מורכב בפינה הימנית התחתונה.
Engineering & Research

FrogNano-4B-2609 לעומת LFM2.5 2.6B Base: מומחה מוגמר ושק של משקולות מאומנות מראש

מחבר

Elias Hawthorne

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים →
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

הקלד שאלה אל תוך LFM2.5 2.6B Base והוא ימשיך את המשפט שלך במקום לענות עליו. זה אינו פגם — Liquid AI פרסמה אותו כצ'קפוינט מאומן מראש שמתחת למשפחת LFM2.5, כאשר כוונון ההוראות הושאר במכוון לאחיו שאינו Base, והכרטיס אומר בפשטות שהוא מיועד לכוונון עדין כבד. FrogNano-4B-2609 של Microsoft הוא איך שנראה הקצה השני של אותו צינור: אותו סוג של מודל שפה קטן, שעבר חמישה סבבים של למידת חיזוק על משימות מאגר סינתטיות עד שהוא פולט קריאות כלים מובנות וטלאים מועמדים דרך רתמת חמישה כלים. לאף אחד מהם אין בנצ'מרק בלתי תלוי מפורסם. ההבדל הוא שאצל אחד מהם הושלם האימון שאחרי האימון המוקדם, ולדעת איזה מהם — זו כל ההחלטה.

המספרים של FrogNano שלהלן מגיעים מכרטיס המודל ומהדוח הטכני של Microsoft. המספרים של LFM מגיעים מהכרטיס של Liquid AI, מקובץ התצורה של הארכיטקטורה שלה ומקובץ הרישיון שלה. כל מספר המיוחס לאחד מהספקים מסומן כמדווח על ידי הספק, ואף אחד מהמודלים האלה לא עבר הערכה של צד שלישי — במקרה של LFM2.5 2.6B Base, הדבר נובע בעיקרו מבחירה מכוונת, שכן צ'קפוינט ללא כיוונון הוראות אינו מטרה הוגנת לבנצ'מרק צ'אט.

ההשוואה עובדת רק אם אתה יודע למה אתה משווה

הצב את שני דפי המפרט זה לצד זה, והדבר הראשון שמשתבש הוא מספר הפרמטרים. LFM2.5 2.6B Base הוא 2.69 מיליארד פרמטרים צפופים ב-30 שכבות — 22 בלוקים של קונבולוציה קצרה עם שער כפול ו-8 שכבות קשב עם שאילתות מקובצות, שאומן על כ-34 טריליון טוקנים ב-16 שפות, עם אוצר מילים של 128,000 טוקנים והקשר של 131,072 טוקנים. הגרסה המכומתת שלו עומדת על כ-1.67 GB ב-Q4_K_M.

הכרטיס של FrogNano-4B-2609 מציין את שדה הפרמטרים שלו כטווח "500M-5B", וסיכום המודל מתאר אותו ככ-4.66 מיליארד. ההורדה מכריעה את הוויכוח: שני רסיסי safetensors בסך כולל של 9.32 GB של משקולות BF16, 738 טנסורים, על גבי מחסנית היברידית צפופה בת 32 שכבות שעברה בירושה, של Gated DeltaNet ושל קשב-שער (gated-attention). מגדל ראייה בן 24 שכבות נמצא בצ'קפוינט ומעולם לא עבר אימון-המשך.

אז יחס הגודל הוא בערך 1.7 לאחד, ויחס הזיכרון קרוב יותר ל-5.6 לאחד ברגע שקוונטיזציה נכנסת לתמונה. הפער הזה חשוב יותר משורת הפרמטרים, כי שני המודלים האלה הם מועמדים להרצה עצמית ולא נקודות קצה — וזו הסיבה היחידה שהם שייכים לאותו מאמר.

• שימוש מיועד — LFM2.5 2.6B Base הוא חומר גלם לריצת כוונון עדין. FrogNano-4B-2609 היא מדיניות מוגמרת להנדסת תוכנה ברמת מאגר בתוך תשתית Leaf.

• מעקב אחר הוראות — ל-LFM2.5 2.6B Base אין זאת באופן מובנה; הכרטיס של Liquid AI ממליץ עליו למשימות הדורשות כיוונון עדין כבד. FrogNano-4B-2609 עוקב אחר תיאור משימה ופולט קריאות כלים מובנות, כי בדיוק על כך אומנה מטרת ה-RL שלו.

• הקשר — 131,072 טוקנים עבור LFM2.5 2.6B Base, לעומת בערך 131K טוקנים משולבים עבור התצורה המוערכת של FrogNano. זהה לכאורה, אך החלון של FrogNano צריך להכיל תוצאות כלים, פלט מעטפת ויומני בדיקות, לא רק פרומפט.

• תקרת פלט — התצורה המאומתת של FrogNano מאפשרת 8,192 אסימונים שנוצרו לכל תור של העוזר. LFM2.5 2.6B Base אינה מפרסמת שווה ערך, מכיוון שהיא לא נבנתה לסיים תשובה.

• מודאליות — שניהם טקסט בלבד. רכיבי הראייה של FrogNano הם בירושה ואינם נתמכים במפורש; LFM2.5 2.6B Base הוא טקסט-נכנס, טקסט-יוצא מעצם תכנונו.

• רישיון — LFM2.5 2.6B Base כפוף ל-LFM Open License v1.0, שהוא חינמי מתחת ל-$10M בהכנסה שנתית ודורש רישיון נפרד ברף זה ומעלה, כאשר יצירות נגזרות יורשות את התקרה. הכרטיס של FrogNano מציין MIT בחלק המקדים שלו ו-Apache 2.0 בגוף שלו.

הדבר ש-Microsoft שילמה עבורו, והדבר שתצטרך לשלם עבורו בעצמך

זהו החלק הנושא את העומס, משום שזה החלק שבו השוואת מפרטים מטעה.

כל הערך המוסף של FrogNano-4B-2609 הוא פוסט-אימון, ומיקרוסופט פרסמה את השיטה. מתחילים מ-Qwen3.5-4B, שהשיג 39.4% ב-SWE-bench Verified דרך רתמת Leaf כמודל כללי. יוצרים משימות מועמדות במאגרי קוד מתוך תמונות מצב אמיתיות, מריצים הרצות rollout מנקודת הביקורת הנוכחית כדי למצוא משימות שהוא פותר לפעמים, שומרים אותן, מאמנים וחוזרים על התהליך — חמש איטרציות, כ-1,500 סביבות סינתטיות מאומתות בסך הכול, ובלי דיסטילציה ממודל גדול יותר בשום שלב. התוצאה בכרטיס המודל של מיקרוסופט עצמה היא 61.5% ב-SWE-bench Verified, 37.6% ב-SWE-bench Pro, 31.1% ב-Terminal-Bench 2.0 ו-47.3% ב-PatchEval-Verified. נספח היעילות במאמר מדווח על אותה עלייה כערכים 48.2%, 53.4%, 58.3%, 58.6% ו-61.6% לאורך האיטרציות, וזו תזכורת מועילה שאפילו שתי הטבלאות של המעבדה עצמה של אותו ניסוי אינן מסכימות על השליבות.

כעת קרא את זה אל מול LFM2.5 2.6B Base. זהו הצ'קפוינט שלפני שהעבודה הזו מתחילה. ההמלצה של הכרטיס שלו עצמו — לכוונן אותו — היא בדיוק העבודה ש-FrogNano מתעד: סביבת משימה, תגמול שאפשר להריץ, הרנס שמשרת לאורך זמן, וכמה איטרציות אימון מול מדיניות משתנה. המאמר לא טוען שזה קל. הוא מדווח שצ'קפוינטים ביניים נעשו יקרים יותר ויותר לאימון ככל שעקבות ההיסק התארכו, שנאלצו להוסיף קנס על אורך הלוג כדי לעצור את הסחיפה, ושהאיטרציות המאוחרות יותר איבדו את יכולת קריאת הכלים במקביל שהייתה למודל הבסיס, והגיעו לשיעור קריאות מקבילות של 1.71%. כל מי שמתכנן להריץ את המתכון של FrogNano על בסיס 2.6B אחר צריך לתקצב במיוחד עבור שלוש הבעיות האלה.

מה ש-LFM2.5 2.6B Base מקנה הוא סוג אחר של יתרון התחלתי: תקציב אימון מקדים של 34 טריליון טוקנים, ארכיטקטורה היברידית מתועדת, גרסה מכומתת קיימת, וחלון הקשר מתועד של 131,072 טוקנים — הכול בגודל שרץ על חומרה שצ'קפוינט BF16 בנפח 9.32 GB לא היה נכנס אליה. אם המשימה שלך צרה מספיק כך שכיוונון עדין קטן מנצח מודל כללי, זו עמדה אמיתית — ואם לא, חסכת לעצמך ריצת אימון.

A generated two-column scoreboard titled 'FrogNano-4B-2609 vs LFM2.5 2.6B Base'. The left column reads State RL post-training complete, Params approx 4.66B with the card saying 500M-5B, Weights 9.32 GB BF16, Context about 131K evaluated, Licence MIT in front matter and Apache 2.0 in body, Independent scores none. The right column reads State pretrained checkpoint only, Params 2.69B dense, Weights 1.67 GB in Q4_K_M, Context 131,072 tokens, Licence LFM Open License v1.0, Independent scores none. A footer reads 'Both columns vendor-reported; no third party has scored either model.'

מה שעליך לבנות בכל מקרה

אף אחד מהשניים אינו קריאת רשת, וזה מעצב את ההשוואה המעשית יותר מכל שורת מפרט.

LFM2.5 2.6B Base זקוק לסביבת הרצה להסקה ולהרצת אימון. הכרטיס של Liquid AI מפרט בניות בפורמט מקורי, GGUF, ONNX ו-MLX, כך שחצי ההגשה מכוסה היטב — llama.cpp על מחשב נייד הוא אפשרות ממשית עבור הצ'קפוינט המכומת. חצי האימון הוא באחריותך: נתונים, מטרה, הערכה, ודרך לדעת אם התוצאה השתפרה או רק השתנתה.

FrogNano-4B-2609 רוצה נקודת קצה תואמת OpenAI עם המנתחים הנכונים ואשכול Kubernetes עם הרשאה לניהול פודים ומדיניות רשת. ה-README של Microsoft ישיר באופן יוצא דופן בכך שה-harness הוא תלות ולא עניין של נוחות, והכרטיס מציין שציונים זהים מחייבים צ'קפוינט תואם, טוקנייזר, תצורת הגשה, תמונות משימה ופרוטוקול הערכה. התצורה אינה פרט כאן — הגישו אותו בלי מנתח הסקה של Qwen3 ומנתח קריאות כלים של Qwen3 Coder, והמודל כותב פרוזה במקום שבו ה-harness מצפה לקריאה לכלי.

זו הצורה של ההתמודדות הזו: מצד אחד, פרויקט אימון עם בעיית סרווינג קטנה; מצד שני, פרויקט סרווינג עם בעיית הערכה גדולה ולא נותר עוד אימון לעשות. שניהם ערבים של עבודה. רק אחד מהם הוא ערבים של עבודה שיכול להסתיים ב"המודל לא טוב מספיק" שלא באשמתך.

A screenshot of the Hugging Face model card for microsoft/FrogNano-4B-2609 showing the model summary table with the Parameters row reading 500M-5B, the Context length row reading approximately 131K tokens in the evaluated coding-agent configuration, the Training Dates row reading Jun 2026 to Aug 2026, the Release date row reading 22-SEP-2026, the License row reading Apache License 2.0, the Qwen/Qwen3.5-4B model dependency, and the model overview naming the dense 32-layer hybrid Gated DeltaNet and gated-attention architecture.

היכן שהראוטר מצדיק את מקומו בבנייה כזו

שני המודלים האלה מוצאים את עצמם בתוך צינור עיבוד שקורא גם למשהו מתארח. מערך ההערכה של FrogNano עצמו הוא ההוכחה: רתמת Leaf מדברת עם נקודת קצה תואמת OpenAI, מה שאומר שהמודל הנבחן וכל מודל שאתה משווה אותו אליו נגישים דרך אותו ממשק. זהו דפוס ששווה להעתיק גם כשהסיבה היא רק היגיינה, וזה המקום שבו נקודת קצה אחת עושה משהו מוחשי.

OrcaRouter נושא יותר מ-200 מודלים מאחורי מפתח יחיד תואם OpenAI ב-0% תוספת מחיר, כך שמחירי המחירון של הספקים עוברים ללא שינוי, ושינוי מחיר של ספק נכנס לתוקף אצלנו באותו יום — וזה הנתון שבאמת משתנה כשאתם מחליטים אם מומחה מתארח בעצמכם עדיף על מודל כללי מתארח מבחינת עלות לכל משימה. מעבר אוטומטי לגיבוי מכסה את החצי המתארח של ההשוואה הזו, לא את הצ'קפוינט שאתם מריצים בעצמכם. איננו מארחים את FrogNano-4B-2609 או LFM2.5 2.6B Base; שניהם הורדות. מה ששכבת ניתוב מסירה הוא האינטגרציה השנייה בכל פעם שהצד המתארח של הבנצ'מרק שלכם משתנה.

לבחור אחד, בכנות

בחרו ב-LFM2.5 2.6B Base אם המשימה שלכם צרה, החומרה שלכם קטנה, ואתם מוכנים לקחת בעלות על ריצת האימון — הרישיון חופשי מתחת ל-10 מיליון דולר בהכנסות, הבילד המקוונט הוא 1.67 GB, וכרטיס המודל של Liquid AI עצמה ממליץ עליו בדיוק למטרה הזו. העסקה היא שאתם מקבלים נקודת התחלה, לא יכולת: שום דבר במהדורה לא מספר לכם איזה ציון תשיג ריצת RL בצורת FrogNano מעליו, ואף אחד לא פרסם אחת כזו.

בחר ב-FrogNano-4B-2609 אם המשימה היא הנדסת תוכנה ברמת מאגר ואתה רוצה שה-post-training כבר ייעשה. 61.5%, 37.6%, 31.1% ו-47.3% הם תוצאות אמיתיות שפורסמו ממעבדה שתיארה את השיטה שלה בפירוט — והם גם, ברגע זה, לולאה סגורה: אותה מעבדה, אותו הרנס, אותו בייסליין של מודל בסיס. הורדת 9.32 GB, התלות בהרנס והרישוי המרוכב הם המחיר של דילוג על פרויקט אימון שאחרת היית צריך להריץ.

A generated pipeline card headed 'The same pipeline, two positions' showing three stages connected by arrows: 'Pretrained checkpoint' captioned LFM2.5 2.6B Base, 'RL on synthetic tasks, 5 iterations' captioned Microsoft's loop, and 'Finished agent' captioned FrogNano-4B-2609, with a footer reading 'Neither model has been independently evaluated; both appear as vendor-reported figures only.'

המסגור המועיל הוא שהם אינם מתחרים. LFM2.5 2.6B Base נמצא במעלה הזרם של תהליך שיצר משהו כמו FrogNano-4B-2609. אם אתה מוצא את עצמך בוחר ביניהם, השאלה האמיתית היא האם הבעיה שלך מצדיקה בעלות על ריצת אימון — ואם התשובה היא לא, נקודת הבידוק 4B עם ההרנס, השיטה שפורסמה וסולם ה-SWE-bench המדווח על ידי הספק היא זו שמגיעה מוכנה.