
FrogNano-4B-2609 מול Intern Decision 4B: מודל בסיס אחד, שני הימורים שונים לחלוטין
- openaiחדשOpenAI: GPT-6.1 Sol2026-09-2952אינטליגנציה
- anthropicחדשAnthropic: Claude Sonnet 5.52026-09-2856אינטליגנציה
- typesafeחדשTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 לכל 1M טוקנים · 219 tok/s
- OpenAIחדשOpenAI: GPT-6 Luna2026-09-2238אינטליגנציה
- OpenAIחדשOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- AnthropicחדשAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- xAIחדשGrok 4.72026-09-2146אינטליגנציה
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 לכל 1M טוקנים · 114 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- OpenAIOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- AnthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 לכל 1M טוקנים · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
שתי מעבדות לקחו את אותו צ'קפוינט, Qwen3.5-4B, ודחפו אותו לכיוונים שאינם דומים זה לזה. microsoft/FrogNano-4B-2609 עבר אימון-המשך בלמידת חיזוק על כ-1,500 סביבות סינתטיות של הנדסת תוכנה, עד שיכל לפלוט קריאות כלים מובנות ותיקונים רב-קובציים דרך מסגרת בת חמישה כלים. internlm/Intern-Decision-4B עבר כיוונון עדין כדי לא לפלוט טקסט כלל — הוא מקבל מצב בתוספת סכימה של שאלות בעלות שמות ומחזיר הסתברות מכוילת עבור כל אפשרות במעבר קדימה בודד. האחד כותב קוד. האחר מסרב לכתוב דבר ומחזיר התפלגות. השוואה ביניהם על בסיס איכות היא חסרת משמעות; השוואה ביניהם לפי מה שהם עולים לך להרצה ובמה ניתן לתת בהם אמון היא התרגיל ההוגן.
שניהם שוחררו ללא הכרזה, וזה הדבר הנוסף המשותף להם. לאף אחד מהם אין רשומה ב-Artificial Analysis, דירוג ארנה, או הערכה עצמאית אחת. כל נתון שלהלן — סולם ה-SWE-bench מצד אחד, שורות הכיול Brier ו-ECE מצד שני — הופק על ידי המעבדה שאימנה את המודל, על מערכת הבדיקה של אותה מעבדה, ומעולם לא פגש מערך בדיקה שלא הגיע ממנה.
הפיצול התרחש לפני שאף אחד משני המודלים היה קיים.
נקודת הביקורת הבסיסית היא מודל היברידי צפוף בן 32 שכבות מסוג Gated DeltaNet וקשב שער, ושתי הנגזרות יורשות את השלד שלו. לאחר מכן, לשני צינורות העיבוד שלאחר האימון אין דבר במשותף.
הפייפליין של מיקרוסופט הוא לולאה סגורה. TaskPilot מייצר משימות מאגר מועמדות מתמונות מצב אמיתיות, מריץ רולאאוטים מהצ'קפוינט הנוכחי כדי למצוא כאלה שהמדיניות פותרת לפעמים, שומר את אלה, ומאמן. חמש איטרציות, כשכל אחת מכוילת מול המדיניות של האיטרציה הקודמת, ומסתיימות ב-61.5% ב-SWE-bench Verified וב-37.6% ב-SWE-bench Pro. ללא דיסטילציה — הכרטיס מציין שלא נעשה שימוש במסלולים, פעולות או עקבות חשיבה של מודל חזק יותר כיעדים.
הצינור של InternLM הוא מטרה מפוקחת יחידה על צורת משימה קבועה. המודל מקבל הנחיית מערכת, מצב, סכימת החלטה, ושלד JSON מלא של העוזר עם ממלא מקום אחד לכל שדה. הוא מבצע מעבר קדמי סיבתי אחד, קורא את הלוגיטים בכל עמדת ממלא מקום, ומבצע softmax רק על סמלי המועמדים המותרים של אותו שדה. הכרטיס של InternLM אומר זאת במפורש: נתיב זה "אינו קורא ל-generate() או דוגם טקסט חופשי."
ההבדל הזה אינו הבדל בקנה מידה. זהו הבדל במה שהארטיפקט בכלל הוא. FrogNano-4B-2609 הוא סוכן שיכול לטעות במאה דרכים מעניינות ושאותו ניתן לתקן באמצעות בדיקות. Intern-Decision-4B הוא מנקד שאופן הכשל שלו הוא מספר בטוח.
שני חוזים, ואף אחד מהם אינו "לשלוח פרומפט"
החוזה של FrogNano הוא לולאה. המודל פולט קריאות אל Read, Write, Edit, Glob ו-Bash; רתמת Leaf מבצעת אותן בתוך ארגז חול מבודד של מאגר ומחזירה את הפלט; הלולאה ממשיכה עד שהמודל מפסיק לקרוא. ההערכות רצו ב-150 צעדים בתוך כ-131K אסימונים משולבים, עם עד 8,192 אסימונים מיוצרים לכל תור של העוזר. הגשה דורשת SGLang עם מנתח חשיבה של Qwen3 ומנתח קריאות כלים של Qwen3 coder — אם טועים בזה, המודל מייצר פרוזה במקום שבו הרתמה מצפה ל-JSON, מה שמבחוץ נראה בדיוק כמו מודל שבור.
החוזה של Intern-Decision-4B הוא ניסיון אחד עם גבול נוקשה. שאלות ואפשרויות שומרות על סדרן. אפשרויות ממופות לסמלים של אסימון בודד — A עד Z, ואז a עד z, ואז 0 עד 9, וזו הסיבה האריתמטית ששאלה מגיעה למקסימום של 62 אפשרויות. התקרה של המעטפת היא 8,192 אסימונים והכרטיס של InternLM מפורש שקלטים ארוכים יותר נדחים ללא חיתוך. שלושה סוגי שאלות נתמכים: בחירה עם מפת קריטריונים מסודרת, ניקוד עם רשימה או מפה עם מפתחות מספריים, ו-נול, בינארי. מותרות עד שמונה תמונות והאסימונים שלהן נספרים כנגד אותם 8,192.
• מבנה הפלט — FrogNano-4B-2609 מפיק קריאות לכלים, טקסט הסקה וטלאי. Intern-Decision-4B מפיק סמל אחד לכל שדה ולא דבר אחר.
• דטרמיניזם — FrogNano דוגם בטמפרטורה 0.6 על פני שלושה זרעים, ולכן הוא הסתברותי מעצם תכנונו. ה-argmax של Intern-Decision-4B קבוע על ידי מעבר קדימה; הטמפרטורה המותאמת משנה רק את הביטחון שלו.
• משטח כשל — FrogNano עלול להזות API, להרחיב עריכה יתר על המידה, או לעבור בדיקות תוך הכנסת פגיעוּת, שכולם נקובים בשמות בכרטיס המודל. Intern-Decision-4B לא יכול להזות תשובה, כי הוא יכול לבחור רק מבין אפשרויות שסיפקת — הוא יכול רק להיות לא מכויל.
• תקרת קלט — כ-131K טוקנים משולבים עבור FrogNano בתצורת ההערכה שלו, לעומת 8,192 קשיח עבור Intern-Decision-4B, שזה פי שישה עשר ואין דרך לעקוף זאת.
• מבנה העלות — FrogNano מחייבת לפי המסלול, והמסלולים ארוכים. ל-Intern-Decision-4B אין בכלל טוקני פלט לחייב עליהם.
• פרמטרים — כרטיס FrogNano מציג טווח "500M-5B" ומתאר בקירוב 4.66B, עם הורדה של 9.32 GB BF16; Intern-Decision-4B מצוין כ-4.54B עם מגדל חזותי בנפח 612 MB ומקרן בנפח 54 MB לצד רסיסי השפה שלו.
המספר שקובע את ההתאמה הזו
הכרטיס של InternLM מציב את Intern-Decision-4B על 44.16 ms השהיה ממוצעת ו-44.03 ms חציון על RTX 4090 בודד דרך נתיב Hugging Face המקומי, עם P95 של 44.60 ms. קראו שוב את הפער הזה: מהחציון ועד הזנב זה הרבה פחות ממילישנייה, כי למעבר קדימה בצורה קבועה אין כמעט מה להשתנות. זה כל הטיעון בעד הארכיטקטורה.
הנתון המקביל של FrogNano אינו נמדד באלפיות שנייה. ההערכות שלו אפשרו תקציב של 150 צעדים עם תקרת סוכן של 10,800 שניות לכל משימה. אלה אינן יחידות ברות-השוואה ולעולם אין להציג אותן באותו משפט עם טענת השהיה — אבל הן כן מלמדות אותך מהי צורת הפשרה. מודל אחד עונה להחלטה בארבעים וארבעה אלפיות שנייה, והאחר מבלה דקות של קריאות לכלים במרדף אחר תיקון. אם הבעיה שלך היא "נתב את הפנייה הזו לאחד משישה תורים ותגיד לי עד כמה אתה בטוח", הראשון אינו גרסה זולה יותר של השני, הוא מכונה אחרת.
שתי המעבדות מדדו את עצמן בקפידה, ושתי מערכות המדידות צריכות להיקרא ככוונות ולא כתוצאות. InternLM מדווחת על ממוצע של שבע קבוצות של 90.02 עם ציון Brier של 0.347 ושגיאת כיול צפויה של 0.065, מותאמת בטמפרטורה של 1.99241824 על 1,728 מקרי כיול מוגדרים. Microsoft מדווחת על עלייה של חמש איטרציות מ-39.4% ל-61.5% ב-SWE-bench Verified, ונספח של אותו מאמר מדווח על אותה התקדמות כ-48.2%, 53.4%, 58.3%, 58.6% ו-61.6% — תזכורת לכך שאפילו בתוך מעבדה אחת, אותה עובדה שנמדדת בשתי דרכים מייצרת שני סולמות.

הסימן טמון במה שכל קלף בוחר להזהיר אותך מפניו.
שני הכרטיסים כנים באופן יוצא דופן, והכנות מצביעה לכיוונים מנוגדים — וזה הדבר השימושי ביותר בהשוואה הזו.
הקטע של Microsoft על מגבלות ידועות נקרא כמו אזהרת פריסה. אנגלית ו-Python בלבד. הביצועים רגישים להרנס ולאיכות הבדיקות. תיקונים שעשויים להיות שגויים או לא מאובטחים למרות שהם עוברים את הבדיקות שלהם. המשפט של הכרטיס עצמו הוא ש-FrogNano "אין לראות בו כמי שמיושר בטיחותית באופן עצמאי לפריסה אוטונומית בלתי מוגבלת", והוא מציין את הפער הספציפי: האימון המשלים הספציפי לסוכן לא השתמש בנתוני העדפות בטיחות, סירוב או יריביים, משום שבמקום זאת הוא מיטב לנכונות פונקציונלית ולהימנעות מרגרסיות. הוא גם מציין ביוזמתו את שיעור הקריאות המקבילות לכלים של 1.71%, כלומר המודל כמעט אף פעם לא מפעיל שני כלים בתור אחד למרות שההרנס מאפשר זאת — רגרסיה ממשית ביכולות לעומת מודל הבסיס, שהצוות הוסיף שלב איחוד כדי לנסות לשחזר.
הכרטיס של InternLM מזהיר מפני הקטגוריה ההפוכה של הדברים. אין משטח הזיות שעליו להזהיר, ולכן ההסתייגויות עוסקות בקלטים: דחיית 8,192, תקרת 62 האפשרויות, העובדה שמגדל הטקסט הבסיסי מצהיר על מגבלת מיקום של 262,144 טוקנים שהמעטפת ששוחררה מסרבת להשתמש בה. הסיכון טמון בכך שמספר בעל ביטחון זוכה לאמון רב מכפי שמגיע לו, והכרטיס גלוי לב בכך שהכיול מצמצם פער מול קו הבסיס של Jev בלי לסגור אותו בכל פרוסה.
קריאה משותפת שלהם מתארת שתי עמדות אמון שונות. FrogNano זקוק לפיקוח משום שהוא פועל. Intern-Decision-4B זקוק לביקורת משום שהוא נותן ציון — ומספר שמניע החלטת ייצור הוא בדיוק סוג הפלט שאף אחד לא חושב לבדוק.
איפה נתב משתלב, והערה כנה על שניהם
אף אחד מהמודלים אינו נקודת קצה מתארחת. FrogNano מגיע כמשקלים בתוספת רתמת הערכה של Kubernetes; Intern-Decision-4B מגיע כמחלקת Python שמייבאים לאחר הורדת ארבעה רסיסים. עבור צוות שרוצה לנסות אחד מהשניים מול משהו אמיתי, התבנית הבטוחה זהה לשניהם והיא לא זוהרת: הצב את הרכיב הניסיוני מאחורי גיבוי כך שמסלול גרוע או יום לא מכויל יעלה ניסיון חוזר במקום תקלה.
התבנית הזאת היא בדיוק מה ששכבת ניתוב נועדה לו. OrcaRouter מריץ יותר מ-200 מודלים מאחורי מפתח אחד תואם OpenAI ב-0% תוספת — מחיר המחירון של הספק מועבר כמו שהוא, כך ששינוי מחיר של ספק נוחת אצלנו באותו יום — ומנגנון ה-failover שלו יושב לפני המודל הכללי שאליו אתה נופל חזרה, ולא לפני שני אלה. אם לומר בפשטות: אנחנו לא מציעים את FrogNano-4B-2609 או Intern-Decision-4B, ואין תאריך לאף אחד מהם. מה שנקודת קצה אחת קונה לך כאן הוא שההשוואה עצמה נעשית זולה — אישור גישה אחד, שורת חיוב אחת, ואין אינטגרציה שנייה בכל פעם שאתה מחליף את המודל הכללי שאתה משווה את המודל המתמחה מולו.

איזה מהם, ומתי
השתמש ב-Intern-Decision-4B כאשר התשובה כבר נמצאת בפרומפט שלך ואתה צריך שהיא תיבחר, עם ציון ביטחון מצורף, בקצב של אלפים בשנייה. ניתוב בטקסונומיה קבועה, ניקוד לפי מחוון, חילוץ מוגבל בסכמה, מודרציה מול סט תוויות סגור. מעבר קדימה של 44 מילישניות ועלות אפס של אסימוני פלט הם המוצר, והכיול הוא הדבר שצריך לבקר לפני שסומכים עליו.
קח את FrogNano-4B-2609 כשהתשובה עדיין אינה קיימת וצריכה להתקבל על ידי קריאת מאגר והרצת הבדיקות שלו. זהו תהליך שאורך דקות, מבודד בסביבת ארגז חול וניתן לבדיקה, וה-61.5% ב-SWE-bench Verified — כפי שדווח על ידי הספק, ללא שחזור — הוא הראיה הטובה ביותר כרגע לכך שצ'קפוינט של 4B מסוגל לעשות זאת בכלל.
מה שאסור שיעבור כך או כך הוא ההרגל להשוות ביניהם את הציונים. ממוצע של 90.02 על פני שבע ערכות וקצב של 61.5 ב-SWE-bench Verified הם מדידות של שתי שאלות שונות, שהופקו בשתי מעבדות, על גבי שתי מערכות הרצה, ואף אחד משני המספרים לא עבר דרך ידיים של צד שלישי. יש להם אב קדמון משותף אחד, וזה הכול.

התחזית השימושית היחידה שבאמת מגיעה מהאב הקדמון המשותף: מכיוון ששני המודלים יוצאים מאותו צ'קפוינט 4B, ההבדל ביניהם הוא כמעט כולו בשלב שלאחר האימון, מה שאומר שהשאלה המעניינת לכל מי שבונה על Qwen3.5-4B היא איזה משני מבני התגמול האלה עובר לתחום שלו. לולאת משימות סינתטיות שמכיילת מול המדיניות של עצמה, או ראש ניקוד בעל צורה קבועה עם טמפרטורה מותאמת. אלה שני מתכונים, שניהם פורסמו, שניהם ממעבדות שעדיין לא אפשרו לאף אחד אחר להריץ אותם. זהו מצב נדיר, וכדאי לעקוב אחריו במקום לקנות אותו.
