
MiniCPM5-2B לעומת Granite 4.2 3B: מומחה ההסקה בגודל 3B מול מחסנית הסוכנים החדשה בגודל 2.5B
- OrcaחדשOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 לכל 1M טוקנים
- orcaחדשOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים
- deepseekחדשDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- openaiOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- googleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- anthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0540אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0345אינטליגנציה76כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
ModelBest הכניסה את Granite 4.2 3B ללוח התוצאות של MiniCPM5-2B לפני שמישהו ביקש זאת. כרטיס המודל של MiniCPM5-2B, שפרסמה OpenBMB כשהמשקולות הפכו לזמינות בשקט ב-Hugging Face, כולל את מודל ההיגיון הקטן ביותר של IBM בין קווי הבסיס להשוואה, ובמבחן הזה MiniCPM5-2B משיג ממוצע של 53.9 לעומת 42.7 של Granite 4.2 3B. זוהי תוצאת ההתמודדות הראש בראש היחידה שמי מהספקים פרסם עבור הצמד הזה, ולכן זהו המקום הטבעי להתחיל בו — והמקום הטבעי לנהוג בזהירות. שני המודלים קטנים, ברישיון Apache-2.0, והם הפצות open-weights לאירוח עצמי המיועדות לאותה משימה של סוף 2026; הם פשוט ניגשים אליה משני קצוות מנוגדים — אחד אומן לנמק ואחד אומן לפעול.
שני המהדורות הללו דומות זו לזו יותר ממה שמרמז השיווק של הספקים שלהן. MiniCPM5-2B נחשף בוועידת הבינה המלאכותית העולמית ב-19 ביולי כמוצר הדגל למכשירים ניידים של ModelBest ו-OpenBMB — מודל צפוף ברמת 2B שמוצב כבסיס לסוכני בינה עבור טלפונים, מחשבים אישיים וקוקפיטים חכמים — והמשקולות שלו הופיעו ב-6 וב-7 בספטמבר ללא אירוע השקה כלשהו, תחת רישיון Apache-2.0, לצד GGUF, MLX, GPTQ, ונקודות ביקורת מסוג base, SFT ו-draft, כולל נתוני האימון שמאחוריהן. Granite 4.2 3B הוא מודל ההיגיון בגודל מחשב נייד של IBM, שמשקולותיו הגיעו ל-Hugging Face בתחילת אוגוסט, וכרטיס המודל והבלוג הטכני שלו פורסמו ב-25 באוגוסט. אף אחד מהם לא נבדק עדיין במבחן בלתי תלוי, ולכן תוויות המקור שלהלן חשובות יותר מהמספרים.
שני שחרורים שמתחרזים
Granite 4.2 3B הוא מודל חשיבה צפוף (dense) עצמאי, שנוצר בפוסט-אימון (post-training) מ-Granite-4.1-3B-Base. יש לו 40 שכבות עם grouped-query attention, חלון קונטקסט מקורי של 128K ש-IBM מרחיבה ל-512K בשלב חמישי של אימון מקדים, ושלושה מצבי חשיבה לכל שאילתה: חשיבה מלאה כברירת מחדל, מצב במאמץ נמוך, ומסלול ללא חשיבה. כרטיס המודל שלו מבהיר במפורש מה הוא לא: בניגוד לגרסאות האחיות 8B ו-30B של Granite 4.2, גרסת ה-3B דילגה במכוון על הבלוק הייעודי ללמידת חיזוק אגנטית (agentic) שאומן בסביבות SWE-agent, טרמינל וחיפוש; לכן IBM אינה מציגה תוצאת SWE-bench ומתארת את המודל כמומחה חשיבה, לא כסוכן. ניתן לשרת אותו באמצעות vLLM, SGLang, Transformers, GGUF ו-Ollama (granite4.2:3b); הוא רץ בכ-6-8GB ב-bfloat16 או בפחות מ-2GB בגרסה מכומתת, ואין לו API מתארח. הנתונים הבולטים שלו — AIME 2025: 78.33, GPQA: 54.80, LiveCodeBench v6: 69.71, MMLU-Pro: 67.84 — מדווחים על-ידי IBM וטרם שוחזרו באופן בלתי תלוי נכון להיום.

MiniCPM5-2B הוא מודל מוגמר ומכוון־סוכן. הכרטיס מתאר טרנספורמר דחוס (dense transformer) עם סך של 2.52B פרמטרים (1.98B שאינם של embedding), 42 שכבות ברוחב חבוי 2048, קשב מקובץ־לפי־קבוצות (grouped-query attention) עם 16 ראשי שאילתה ושני ראשי KV, וארכיטקטורת LlamaForCausalLM סטנדרטית ללא קרנלים מותאמים אישית. מסר ההשקה הדגיש יכולות סוכן — הכשרת ביניים של סוכן בהיקף 200B, סט SFT סוכן גדול, ויישור RL של סוכן, והסתיים בזיקוק על־מדיניות (On-Policy Distillation) שמקפל ששה־עשר מודלי מומחי RL בחזרה לרשת דחוסה אחת קטנה — בתוספת תמיכה מקורית בקונטקסט ארוך ומצבי תגובה היברידיים מהירים/מחושבים. התצורה ששוחררה מציבה חלון קונטקסט של 131,072 טוקנים (חומרי יולי הבליטו 512K; התצורה ששוחררה אינה כוללת זאת), והכרטיס טוען לקריאות כלים בסגנון XML עם מפענח SGLang מובנה. בטבלת ההערכה שלו הוא מדווח על ממוצע פנימי של 53.9 על פני ערכת ההשוואה שנבחרה על ידי הספק, AIME 2025/2026 של 86.5, MATH-500 של 94.6, ו־46.4 בהרצת ספק על SWE-bench Verified, נתון שהיה ראוי לציון עבור מודל דחוס של 2.5B אילו היה עומד בבדיקות בלתי תלויות.

ההשוואה הישירה שמישהו כבר הדפיס
{{1}}מכיוון שלוחות תוצאות של ספקים שונים הם ברובם השוואה בין תפוחים לתפוזים, המסמך השימושי ביותר בהתמודדות הזאת הוא זה ש-ModelBest הדפיסה בעצמה:{{/1}} {{2}}הכרטיס של MiniCPM5-2B מפרט את granite-4.2-3B בין קווי הבסיס שלו ומדווח ש-MiniCPM5-2B משיג ממוצע של 53.9 לעומת 42.7 של Granite בסדרת המבחנים ההיא.{{/2}} {{3}}קראו אותו בדיוק כמו שהוא — ספק אחד שהריץ את שני הדגמים על סדרה אחת שהוא בחר, שתוצאותיה לא שוחזרו, כשלספק יש כל אינטרס שהדגם שלו ינצח.{{/3}} {{4}}זה אינו פסק דין.{{/4}} {{5}}מה שאפשר ללמוד ממנו הוא ש-ModelBest הייתה בטוחה בעצמה דיה כדי לשים דגם 3B של מתחרה על הכרטיס שלה, והפער שהיא טוענת לו גדול ביותר דווקא היכן שהושקע האימון שלה: בשורות ה-agentic וההקשר הארוך.{{/5}} {{6}}התייחסו אליו כאל טענה כיוונית, ושקלו גם את הטענות בכרטיס הנפרד של IBM עצמה לפני שתחליטו משהו על סמך זה.{{/6}}
לוח התוצאות, מסומן בכנות
• שחרור — MiniCPM5-2B: הוכרז ב-19 ביולי 2026; המשקלים יהיו זמינים ב-6-7 בספטמבר, בשקט. Granite 4.2 3B: משקלים בתחילת אוגוסט; כרטיס ובלוג טכני ב-25 באוגוסט 2026.
• תפקיד — MiniCPM5-2B: דגש על סוכן על-המכשיר ושימוש בכלים, לפי ModelBest. Granite 4.2 3B: מומחה חשיבה, במתכוון אינו סוכני, לפי IBM.
• גודל — MiniCPM5-2B: 2.52B פרמטרים בסך הכול / 1.98B שאינם אמבדינג, 42 שכבות. Granite 4.2 3B: ~3B פרמטרים צפופים, 40 שכבות.
• הקשר — MiniCPM5-2B: 131,072 אסימונים בתצורה הנשלחת. Granite 4.2 3B: 128K מקורי, עם הרחבה ל-512K.
• אימון-אחר — MiniCPM5-2B: SFT לחשיבה עמוקה, RL ייעודי, זיקוק על-מדיניות (On-Policy Distillation). Granite 4.2 3B: SFT להיגיון, RL מסוג GRPO ו-RLHF; ללא בלוק RL סוכני.
• עדויות — MiniCPM5-2B: טענות מכרטיס ModelBest, ללא ריצה עצמאית. Granite 4.2 3B: טענות מכרטיס IBM, לא שוחזרו; AIME 2025 78.33, GPQA 54.80, LiveCodeBench v6 69.71.

לוח התוצאות שלמעלה מבוסס על אותם מקורות כמו הטקסט: כל נתון בו מדווח על ידי הספק, וההשוואה היחידה באותה חבילת בדיקות שמי מהספקים פרסם היא זו שעל הכרטיס של ModelBest עצמו.
מומחה חשיבה לעומת סטאק סוכנים
לפני שנגיע לציונים, החליטו איזה סוג של מודל קטן דורשת העבודה שלכם, כי שני אלה עונים על שאלות שונות. {{1}}Granite 4.2 3B מיועד לחשיבה ולקונטקסט ארוך על חומרה מוגבלת:{{/1}} חלון קונטקסט מקורי של 128K שמתרחב ל-512K, שלושה מצבי חשיבה, טביעת רגל שמתאימה למחשב נייד, והחלטה מפורשת לדלג על אימון אייג'נטי. {{2}}אם העבודה שלכם היא ניתוח מסמכים ארוכים, קונטקסט בהיקף מאגר קוד, או חשיבה רב-שלבית אמינה על מכונה קטנה, זו התאמה קוהרנטית,{{/2}} וההחלטה של IBM להשאיר את הטענות האייג'נטיות מחוץ ל-3B היא סיבה לסמוך על הכרטיס שלו, לא פער בו. {{3}}MiniCPM5-2B מיועד לדגש ההפוך:{{/3}} התנהגות אייג'נטית ושימוש בכלים על-גבי מכשיר — פייפליין האימון נראה כמו רשימה של דברים ש-Granite 4.2 3B השאיר במכוון בחוץ. {{4}}אם העבודה שלכם היא לולאת אייג'נט על-גבי מכשיר שמפעילה כלים, מנהלת שיחות ארוכות ועוברת בין תגובות מהירות למחושבות, זה הסטאק שמכוון אליכם,{{/4}} והוא נושא עמו את אי-הוודאות הנוספת של צ'קפוינט בן שבוע עם כרטיס שלא אומת.
הנתונים ש-OpenBMB פתחה, IBM לא.
ההבדל הפחות נוצץ הוא דווקא זה שחשוב ביותר לצוותים שרוצים לכוונן. OpenBMB שחררה את מאגרי האימון של MiniCPM5-2B לצד משקולות המודל — משפחת UltraData, כולל Ultra-FineWeb, UltraX, UltraData-Code, UltraData-Math ומערכי ה-SFT וה-RL של הסוכן — כולם תחת רישיון Apache-2.0. זה הופך את ה-2B מקופסה שחורה למתכון בר-שחזור: אפשר לראות על מה נבנה הפוסט-אימון הסוכני ולהמשיך אותו בתחום שלכם. IBM שחררה בקוד פתוח את המשקולות של Granite 4.2 3B וסיפקה תיאור טכני מפורט של איך המודל נבנה, אבל לא את נתוני האימון. עבור ארגון שרוצה להחזיק במודל ולא לשכור אותו, האסימטריה הזו אמיתית. ו-MiniCPM5-2B מגיעה עם סיפור פריסה ש-Granite לא יכול להשתוות אליו בגודל הזה: התאמה מיום האפס על פני תשע משפחות שבבים דרך קהילת FlagOS של ModelBest — מ-Huawei Ascend ל-NVIDIA ולמגוון מאיצים מקומיים, ובנוסף ARM. זהו איתות לכך ש-ModelBest מצפה שה-2B יפעל אי-שם שאינו GPU של NVIDIA.
מציאות הניתוב
אף אחד מהמודלים אינו יושב כיום בקטלוג מתארח, כך שההשוואה הזו מתקיימת בעולם האחסון העצמי — אבל דווקא שם שכבת הניתוב עדיין מוכיחה את ערכה כרשת ביטחון ולא כמנגנון אספקה. כאשר צוות רוצה לבחון מודל 2B סוכני (agentic) בן שבוע מול מודל 3B להנמקה (reasoning) על עומס עבודה שהצוות כבר משרת, המהלך ההפיך הוא להפנות נתיב בדיקה אל build של MiniCPM5-2B באחסון עצמי דרך API אחד עם העברה אוטומטית (failover), בעוד שהייצור נשאר על המודל המוכח — הסטאק החדש יכול להיתקע בלי להפיל שום דבר, ומחירי המחירון של הספקים עבור המודלים המתארחים שאליהם אתה משווה מועברים הלאה ללא תוספת מחיר (0% markup), כך שמבחן ה-A/B נשאר זול. השכבה אינה מארחת אף אחד מהמודלים; היא הופכת את הניסוי לבטוח להרצה וקל לביטול.
איזה מודל קטן באמת כדאי לך להריץ?
הרץ את Granite 4.2 3B אם עומס העבודה שלך הוא חשיבה על הקשר ארוך (long-context reasoning) על מחשב ברמת לפטופ, ואתה רוצה שלושה מצבי חשיבה, תקרה של 512K וכרטיס מודל כן שאומר לך בדיוק למה ה־3B לא אומן. הרץ את MiniCPM5-2B אם העבודה שלך היא סוכן אינטראקטיבי על־המכשיר שקורא לכלים (tool-calling), ושם דגם של 2.5B מתאים לתקציב הזיכרון שלך — אבל הקדש זמן לשחזור המספרים הבולטים שלו לפני שתיתן בו אמון, כי ממוצע 53.9 וטענת 46.4 ב־SWE-bench הם של הספק בלבד, ואף אחד אחר לא אימת אותם עדיין. שני דברים יכריעו את ההשוואה הזו מהר יותר מכל דעה: הרצה בלתי־תלויה של MiniCPM5-2B שתאשר או תפריך את הטענות בנוגע ליכולות הסוכנות (agentic), והישרדות של מספרי החשיבה של IBM בשחזור קהילתי. עד שאחד מהדברים הללו יקרה, Granite 4.2 3B הוא הדגם הקטן הבטוח יותר והמתועד טוב יותר כיום, ואילו MiniCPM5-2B הוא ההימור המעניין יותר.
