כרטיס כותרת ראשי עבור 'MiniCPM5-2B לעומת Granite 4.2 3B', עם כותרת המשנה 'מודל 2.5B שאומן לעבודת סוכנים נכנס לזירה מול מומחה ההסקה של IBM בגודל 3B', שלושה תגים שעליהם כתוב 'מחסנית סוכנים לעומת מודל הסקה', 'Apache-2.0 משני הצדדים' ו'המשקלים עולים לאוויר ב-6–7 בספטמבר', ורצועה עליונה 'קרב המשקלים הפתוחים · ספטמבר 2026'.
Guides & Insights

MiniCPM5-2B לעומת Granite 4.2 3B: מומחה ההסקה בגודל 3B מול מחסנית הסוכנים החדשה בגודל 2.5B

מחבר

Rowan Sterling

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

ModelBest הכניסה את Granite 4.2 3B ללוח התוצאות של MiniCPM5-2B לפני שמישהו ביקש זאת. כרטיס המודל של MiniCPM5-2B, שפרסמה OpenBMB כשהמשקולות הפכו לזמינות בשקט ב-Hugging Face, כולל את מודל ההיגיון הקטן ביותר של IBM בין קווי הבסיס להשוואה, ובמבחן הזה MiniCPM5-2B משיג ממוצע של 53.9 לעומת 42.7 של Granite 4.2 3B. זוהי תוצאת ההתמודדות הראש בראש היחידה שמי מהספקים פרסם עבור הצמד הזה, ולכן זהו המקום הטבעי להתחיל בו — והמקום הטבעי לנהוג בזהירות. שני המודלים קטנים, ברישיון Apache-2.0, והם הפצות open-weights לאירוח עצמי המיועדות לאותה משימה של סוף 2026; הם פשוט ניגשים אליה משני קצוות מנוגדים — אחד אומן לנמק ואחד אומן לפעול.

שני המהדורות הללו דומות זו לזו יותר ממה שמרמז השיווק של הספקים שלהן. MiniCPM5-2B נחשף בוועידת הבינה המלאכותית העולמית ב-19 ביולי כמוצר הדגל למכשירים ניידים של ModelBest ו-OpenBMB — מודל צפוף ברמת 2B שמוצב כבסיס לסוכני בינה עבור טלפונים, מחשבים אישיים וקוקפיטים חכמים — והמשקולות שלו הופיעו ב-6 וב-7 בספטמבר ללא אירוע השקה כלשהו, תחת רישיון Apache-2.0, לצד GGUF, MLX, GPTQ, ונקודות ביקורת מסוג base, SFT ו-draft, כולל נתוני האימון שמאחוריהן. Granite 4.2 3B הוא מודל ההיגיון בגודל מחשב נייד של IBM, שמשקולותיו הגיעו ל-Hugging Face בתחילת אוגוסט, וכרטיס המודל והבלוג הטכני שלו פורסמו ב-25 באוגוסט. אף אחד מהם לא נבדק עדיין במבחן בלתי תלוי, ולכן תוויות המקור שלהלן חשובות יותר מהמספרים.

שני שחרורים שמתחרזים

Granite 4.2 3B הוא מודל חשיבה צפוף (dense) עצמאי, שנוצר בפוסט-אימון (post-training) מ-Granite-4.1-3B-Base. יש לו 40 שכבות עם grouped-query attention, חלון קונטקסט מקורי של 128K ש-IBM מרחיבה ל-512K בשלב חמישי של אימון מקדים, ושלושה מצבי חשיבה לכל שאילתה: חשיבה מלאה כברירת מחדל, מצב במאמץ נמוך, ומסלול ללא חשיבה. כרטיס המודל שלו מבהיר במפורש מה הוא לא: בניגוד לגרסאות האחיות 8B ו-30B של Granite 4.2, גרסת ה-3B דילגה במכוון על הבלוק הייעודי ללמידת חיזוק אגנטית (agentic) שאומן בסביבות SWE-agent, טרמינל וחיפוש; לכן IBM אינה מציגה תוצאת SWE-bench ומתארת את המודל כמומחה חשיבה, לא כסוכן. ניתן לשרת אותו באמצעות vLLM, SGLang, Transformers, GGUF ו-Ollama (granite4.2:3b); הוא רץ בכ-6-8GB ב-bfloat16 או בפחות מ-2GB בגרסה מכומתת, ואין לו API מתארח. הנתונים הבולטים שלו — AIME 2025: 78.33, GPQA: 54.80, LiveCodeBench v6: 69.71, MMLU-Pro: 67.84 — מדווחים על-ידי IBM וטרם שוחזרו באופן בלתי תלוי נכון להיום.

Screenshot of the Hugging Face model card for ibm-granite/granite-4.2-3b, showing the model summary table — developer Granite Team, IBM, 'Decoder-only Dense Transformer (Reasoning)', base model Granite-4.1-3B-Base, 3B parameters, context 'Natively Supports 128K (Long-context extension to 512K)', bfloat16 precision, tested languages, built-in think chain-of-thought — and the Apache-2.0 license tag (captured September 7, 2026).

MiniCPM5-2B הוא מודל מוגמר ומכוון־סוכן. הכרטיס מתאר טרנספורמר דחוס (dense transformer) עם סך של 2.52B פרמטרים (1.98B שאינם של embedding), 42 שכבות ברוחב חבוי 2048, קשב מקובץ־לפי־קבוצות (grouped-query attention) עם 16 ראשי שאילתה ושני ראשי KV, וארכיטקטורת LlamaForCausalLM סטנדרטית ללא קרנלים מותאמים אישית. מסר ההשקה הדגיש יכולות סוכן — הכשרת ביניים של סוכן בהיקף 200B, סט SFT סוכן גדול, ויישור RL של סוכן, והסתיים בזיקוק על־מדיניות (On-Policy Distillation) שמקפל ששה־עשר מודלי מומחי RL בחזרה לרשת דחוסה אחת קטנה — בתוספת תמיכה מקורית בקונטקסט ארוך ומצבי תגובה היברידיים מהירים/מחושבים. התצורה ששוחררה מציבה חלון קונטקסט של 131,072 טוקנים (חומרי יולי הבליטו 512K; התצורה ששוחררה אינה כוללת זאת), והכרטיס טוען לקריאות כלים בסגנון XML עם מפענח SGLang מובנה. בטבלת ההערכה שלו הוא מדווח על ממוצע פנימי של 53.9 על פני ערכת ההשוואה שנבחרה על ידי הספק, AIME 2025/2026 של 86.5, MATH-500 של 94.6, ו־46.4 בהרצת ספק על SWE-bench Verified, נתון שהיה ראוי לציון עבור מודל דחוס של 2.5B אילו היה עומד בבדיקות בלתי תלויות.

Screenshot of the Hugging Face repository page for openbmb/MiniCPM5-2B, showing the OpenBMB org header, the Text Generation tag with Transformers and Safetensors and English and Chinese language tags, and the top of the model card reading 'We are releasing MiniCPM5-2B, the second model in the MiniCPM5 series, following MiniCPM5-1B. It is a dense 2B Transformer ... reaching 2B-class open-source SOTA' (captured September 7, 2026).

ההשוואה הישירה שמישהו כבר הדפיס

{{1}}מכיוון שלוחות תוצאות של ספקים שונים הם ברובם השוואה בין תפוחים לתפוזים, המסמך השימושי ביותר בהתמודדות הזאת הוא זה ש-ModelBest הדפיסה בעצמה:{{/1}} {{2}}הכרטיס של MiniCPM5-2B מפרט את granite-4.2-3B בין קווי הבסיס שלו ומדווח ש-MiniCPM5-2B משיג ממוצע של 53.9 לעומת 42.7 של Granite בסדרת המבחנים ההיא.{{/2}} {{3}}קראו אותו בדיוק כמו שהוא — ספק אחד שהריץ את שני הדגמים על סדרה אחת שהוא בחר, שתוצאותיה לא שוחזרו, כשלספק יש כל אינטרס שהדגם שלו ינצח.{{/3}} {{4}}זה אינו פסק דין.{{/4}} {{5}}מה שאפשר ללמוד ממנו הוא ש-ModelBest הייתה בטוחה בעצמה דיה כדי לשים דגם 3B של מתחרה על הכרטיס שלה, והפער שהיא טוענת לו גדול ביותר דווקא היכן שהושקע האימון שלה: בשורות ה-agentic וההקשר הארוך.{{/5}} {{6}}התייחסו אליו כאל טענה כיוונית, ושקלו גם את הטענות בכרטיס הנפרד של IBM עצמה לפני שתחליטו משהו על סמך זה.{{/6}}

לוח התוצאות, מסומן בכנות

• שחרור — MiniCPM5-2B: הוכרז ב-19 ביולי 2026; המשקלים יהיו זמינים ב-6-7 בספטמבר, בשקט. Granite 4.2 3B: משקלים בתחילת אוגוסט; כרטיס ובלוג טכני ב-25 באוגוסט 2026.

• תפקיד — MiniCPM5-2B: דגש על סוכן על-המכשיר ושימוש בכלים, לפי ModelBest. Granite 4.2 3B: מומחה חשיבה, במתכוון אינו סוכני, לפי IBM.

• גודל — MiniCPM5-2B: 2.52B פרמטרים בסך הכול / 1.98B שאינם אמבדינג, 42 שכבות. Granite 4.2 3B: ~3B פרמטרים צפופים, 40 שכבות.

• הקשר — MiniCPM5-2B: 131,072 אסימונים בתצורה הנשלחת. Granite 4.2 3B: 128K מקורי, עם הרחבה ל-512K.

• אימון-אחר — MiniCPM5-2B: SFT לחשיבה עמוקה, RL ייעודי, זיקוק על-מדיניות (On-Policy Distillation). Granite 4.2 3B: SFT להיגיון, RL מסוג GRPO ו-RLHF; ללא בלוק RL סוכני.

• עדויות — MiniCPM5-2B: טענות מכרטיס ModelBest, ללא ריצה עצמאית. Granite 4.2 3B: טענות מכרטיס IBM, לא שוחזרו; AIME 2025 78.33, GPQA 54.80, LiveCodeBench v6 69.71.

A comparison scoreboard titled 'MiniCPM5-2B vs Granite 4.2 3B — the scoreboard', with left column rows 'What it is: Agent-tuned 2.5B for on-device', 'Params: 2.52B total · 42 layers', 'Context: 128K in shipped config', 'Post-training: Deep-thinking SFT + RL + OPD', 'Card headline: Internal avg 53.9 on own suite', 'Release: Announced Jul 19 · weights Sep 6-7', and right column rows 'What it is: IBM's smallest reasoning 3B', 'Params: ~3B dense · 40 layers', 'Context: 128K native → 512K ext', 'Post-training: Reasoning SFT + GRPO + RLHF', 'Card headline: AIME '25 78.33 · GPQA 54.80', 'Release: Weights Aug · card Aug 25', with a footer reading 'Both vendor-reported and unreproduced; the 53.9-vs-42.7 head-to-head is on ModelBest's own card.'

לוח התוצאות שלמעלה מבוסס על אותם מקורות כמו הטקסט: כל נתון בו מדווח על ידי הספק, וההשוואה היחידה באותה חבילת בדיקות שמי מהספקים פרסם היא זו שעל הכרטיס של ModelBest עצמו.

מומחה חשיבה לעומת סטאק סוכנים

לפני שנגיע לציונים, החליטו איזה סוג של מודל קטן דורשת העבודה שלכם, כי שני אלה עונים על שאלות שונות. {{1}}Granite 4.2 3B מיועד לחשיבה ולקונטקסט ארוך על חומרה מוגבלת:{{/1}} חלון קונטקסט מקורי של 128K שמתרחב ל-512K, שלושה מצבי חשיבה, טביעת רגל שמתאימה למחשב נייד, והחלטה מפורשת לדלג על אימון אייג'נטי. {{2}}אם העבודה שלכם היא ניתוח מסמכים ארוכים, קונטקסט בהיקף מאגר קוד, או חשיבה רב-שלבית אמינה על מכונה קטנה, זו התאמה קוהרנטית,{{/2}} וההחלטה של IBM להשאיר את הטענות האייג'נטיות מחוץ ל-3B היא סיבה לסמוך על הכרטיס שלו, לא פער בו. {{3}}MiniCPM5-2B מיועד לדגש ההפוך:{{/3}} התנהגות אייג'נטית ושימוש בכלים על-גבי מכשיר — פייפליין האימון נראה כמו רשימה של דברים ש-Granite 4.2 3B השאיר במכוון בחוץ. {{4}}אם העבודה שלכם היא לולאת אייג'נט על-גבי מכשיר שמפעילה כלים, מנהלת שיחות ארוכות ועוברת בין תגובות מהירות למחושבות, זה הסטאק שמכוון אליכם,{{/4}} והוא נושא עמו את אי-הוודאות הנוספת של צ'קפוינט בן שבוע עם כרטיס שלא אומת.

הנתונים ש-OpenBMB פתחה, IBM לא.

ההבדל הפחות נוצץ הוא דווקא זה שחשוב ביותר לצוותים שרוצים לכוונן. OpenBMB שחררה את מאגרי האימון של MiniCPM5-2B לצד משקולות המודל — משפחת UltraData, כולל Ultra-FineWeb, UltraX, UltraData-Code, UltraData-Math ומערכי ה-SFT וה-RL של הסוכן — כולם תחת רישיון Apache-2.0. זה הופך את ה-2B מקופסה שחורה למתכון בר-שחזור: אפשר לראות על מה נבנה הפוסט-אימון הסוכני ולהמשיך אותו בתחום שלכם. IBM שחררה בקוד פתוח את המשקולות של Granite 4.2 3B וסיפקה תיאור טכני מפורט של איך המודל נבנה, אבל לא את נתוני האימון. עבור ארגון שרוצה להחזיק במודל ולא לשכור אותו, האסימטריה הזו אמיתית. ו-MiniCPM5-2B מגיעה עם סיפור פריסה ש-Granite לא יכול להשתוות אליו בגודל הזה: התאמה מיום האפס על פני תשע משפחות שבבים דרך קהילת FlagOS של ModelBest — מ-Huawei Ascend ל-NVIDIA ולמגוון מאיצים מקומיים, ובנוסף ARM. זהו איתות לכך ש-ModelBest מצפה שה-2B יפעל אי-שם שאינו GPU של NVIDIA.

מציאות הניתוב

אף אחד מהמודלים אינו יושב כיום בקטלוג מתארח, כך שההשוואה הזו מתקיימת בעולם האחסון העצמי — אבל דווקא שם שכבת הניתוב עדיין מוכיחה את ערכה כרשת ביטחון ולא כמנגנון אספקה. כאשר צוות רוצה לבחון מודל 2B סוכני (agentic) בן שבוע מול מודל 3B להנמקה (reasoning) על עומס עבודה שהצוות כבר משרת, המהלך ההפיך הוא להפנות נתיב בדיקה אל build של MiniCPM5-2B באחסון עצמי דרך API אחד עם העברה אוטומטית (failover), בעוד שהייצור נשאר על המודל המוכח — הסטאק החדש יכול להיתקע בלי להפיל שום דבר, ומחירי המחירון של הספקים עבור המודלים המתארחים שאליהם אתה משווה מועברים הלאה ללא תוספת מחיר (0% markup), כך שמבחן ה-A/B נשאר זול. השכבה אינה מארחת אף אחד מהמודלים; היא הופכת את הניסוי לבטוח להרצה וקל לביטול.

איזה מודל קטן באמת כדאי לך להריץ?

הרץ את Granite 4.2 3B אם עומס העבודה שלך הוא חשיבה על הקשר ארוך (long-context reasoning) על מחשב ברמת לפטופ, ואתה רוצה שלושה מצבי חשיבה, תקרה של 512K וכרטיס מודל כן שאומר לך בדיוק למה ה־3B לא אומן. הרץ את MiniCPM5-2B אם העבודה שלך היא סוכן אינטראקטיבי על־המכשיר שקורא לכלים (tool-calling), ושם דגם של 2.5B מתאים לתקציב הזיכרון שלך — אבל הקדש זמן לשחזור המספרים הבולטים שלו לפני שתיתן בו אמון, כי ממוצע 53.9 וטענת 46.4 ב־SWE-bench הם של הספק בלבד, ואף אחד אחר לא אימת אותם עדיין. שני דברים יכריעו את ההשוואה הזו מהר יותר מכל דעה: הרצה בלתי־תלויה של MiniCPM5-2B שתאשר או תפריך את הטענות בנוגע ליכולות הסוכנות (agentic), והישרדות של מספרי החשיבה של IBM בשחזור קהילתי. עד שאחד מהדברים הללו יקרה, Granite 4.2 3B הוא הדגם הקטן הבטוח יותר והמתועד טוב יותר כיום, ואילו MiniCPM5-2B הוא ההימור המעניין יותר.