
MiniCPM5-2B-DSpark לעומת Granite 4.2 3B: שתי השקות שקטות ברישיון Apache-2.0 להרצה קטנה, מהירה ובאירוח עצמי
- OrcaחדשOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 לכל 1M טוקנים
- orcaחדשOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים
- deepseekחדשDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- openaiOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- googleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- anthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0540אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0345אינטליגנציה76כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
אוגוסט ותחילת ספטמבר 2026 יצרו שתי מהדורות שקטות, ברישיון Apache-2.0, שמטרתן הייתה זהה — מודלים קטנים שאתם מריצים בעצמכם — והן ניגשו אליה משני קצוות מנוגדים. Granite 4.2 3B הוא מודל החשיבה בגודל מחשב נייד של IBM, שמשקולותיו הופיעו ב-Hugging Face בתחילת אוגוסט, וכרטיס המודל והבלוג הטכני שלו פורסמו ב-25 באוגוסט 2026. MiniCPM5-2B-DSpark אינו מודל במובן הרגיל: הוא checkpoint ראשוני של DSpark עם 323.8M פרמטרים, ש-OpenBMB פרסמה ב-6 בספטמבר 2026 ללא כל הודעה, ונועד לגרום ל-MiniCPM5-2B — המודל הצפוף של 2.52B פרמטרים לקצה המכשיר, ש-ModelBest הכריזה עליו ב-WAIC ב-19 ביולי 2026 — לייצר טוקנים מהר יותר באמצעות פענוח ספקולטיבי. מהדורה אחת היא מודל חשיבה קטן עצמאי; השנייה היא אביזר האצה למודל קטן. שתיהן תחת Apache-2.0, שתיהן מיועדות לאירוח עצמי בלבד, ואף אחת מהן לא נבחנה עדיין על ידי benchmark עצמאי.
אם מקלפים את שכבת השיווק, השאלה המעשית שצוות ניצב בפניה היא פשוטה: עבור עומס עבודה קטן של סרווינג באחסון עצמי בסוף 2026, האם לבחור במומחה ההסקה 3B של IBM או במחסנית מוכוונת-הסוכנים 2B של ModelBest עם טיוטה חינמית שמחוברת אליה? הראיות דלות יותר מכפי שגיליונות המפרט של שני הספקים מרמזים, ולכן מאמר זה עובר על עובדות ההשקה, על סט המדדים היחיד מאותה סוויטה שבאמת קיים, ועל ההבדל בעומס העבודה שאמור להנחות את הבחירה.
שתי המהדורות, מה שניתן לדעת
Granite 4.2 3B הוא דגם ההסקה הקטן ביותר של IBM, שאומן מחדש על בסיס Granite-4.1-3B-Base. הוא דגם צפוף וטקסטואלי בלבד — 40 שכבות, קשב מקובץ-קבוצות (grouped-query attention), הקשר מקורי של 128K שמתרחב ל־512K בשלב אימון מוקדם חמישי, ושלושה מצבי הסקה: חשיבה מלאה כברירת מחדל, מצב מאמץ נמוך, ונתיב ללא חשיבה. הכרטיס של IBM מציין במפורש שה־3B דילג במכוון על בלוק הלמידה החיזוקית הסוכנית (agentic reinforcement learning) שקיבלו דגמי Granite 4.2 הגדולים יותר, ולכן הוא אינו מפרט תוצאות SWE-Bench והוא דגם הסקה ולא דגם סוכן. הוא זמין דרך vLLM, SGLang, Transformers, GGUF ו־Ollama (granite4.2:3b), ואין לו API מתארח. המספרים המרכזיים בכרטיס שלו — 78.33 ב־AIME 2025, 54.80 ב־GPQA, 69.71 ב־LiveCodeBench v6 — מדווחים על ידי הספק ולא שוחזרו על ידי גורמים בלתי תלויים נכון להיום.

הכרטיס של ibm-granite/granite-4.2-3b שלמעלה הוא הפנים הציבוריות של אותה המהדורה: דגם 3B מכוונן לחשיבה עם נרטיב של קונטקסט ארוך, וללא טענות על יכולות סוכנות.
MiniCPM5-2B-DSpark, לעומת זאת, קיים אך ורק כדי לשרת את מודל היעד שלו. מודל הטיוטה כולל חמש שכבות קשב מלא, עם 323,776,001 פרמטרים וגודל בלוק של שבעה טוקנים מועמדים לכל מעבר קדימה, והוא אומן במשך שישה אפוקים על 7.05 מיליארד טוקנים של תגובות שייצר MiniCPM5-2B. במאגר שלו מדווח על אורך הקבלה — 5.52 טוקנים שהתקבלו בממוצע לכל שלב אימות בפענוח חמדן, ו-6.11 בקוד — אך ללא נתון של טוקנים לשנייה. מודל היעד שהוא מאיץ, MiniCPM5-2B, הוא המוצר המעניין יותר: מודל צפוף בגודל 2.52B, עם 42 שכבות והקשר של 128K, שחומרי ההשקה שלו מדגישים יכולות סוכניות — אימון ביניים של סוכן בהיקף 200B, מערך SFT גדול לסוכנים ויישור סוכנים עם RL, לפי הכרזת ModelBest מיולי — וכן תמיכה מקורית בהקשר ארוך ומצבים היברידיים של מהיר/מעמיק. בסוויטת ההשוואה של ModelBest עצמה, מודל היעד משיג ממוצע של 53.9 מול מודלים פתוחים באותה קטגוריה. כל אחד מהמספרים האלה הוא של הספק.

הכרטיס openbmb/MiniCPM5-2B-DSpark שלמעלה הוא כל משטח השחרור: כרטיס מודל, קונפיגורציה, קובץ Safetensors אחד, וללא הכרזה.
ההשוואה היחידה שקיימת באותה סוויטה
לוחות ציונים בין-ספקיים הם ברובם השוואה בין תפוחים לתפוזים, אבל יש מקום אחד שבו Granite 4.2 3B ו-MiniCPM5-2B נמדדו יחד: טבלת ההערכה של ModelBest עצמה עבור MiniCPM5-2B, שכוללת את granite-4.2-3B בין קווי הבסיס. בסוויטה ההיא, MiniCPM5-2B משיג ממוצע של 53.9 לעומת 42.7 של Granite 4.2 3B. קרא את המספר הזה בדיוק כפי שהוא: ספק אחד שהריץ את שני המודלים על סוויטה אחת, התוצאה לא שוחזרה, והסוויטה נבחרה כדי לגרום למודל שלו להיראות טוב. זו לא פסיקה. מה שזה כן אומר לך הוא ש-ModelBest הייתה בטוחה מספיק כדי לשים מודל 3B של מתחרה על הכרטיס, והפער שהיא טוענת לו הוא הגדול ביותר בדיוק במקום שבו השקיעה באימון שלה: שורות של הקשר ארוך וסוכנים. התייחס לזה כאל טענה כיוונית, אמת אותה על הנתונים שלך, ושקול את הטענות הנפרדות של IBM בכרטיס שלה לפני שתחליט משהו על סמך זה.
לוח התוצאות, מסומן בכנות
• מה שיוצא — MiniCPM5-2B-DSpark: טיוטת 324M עבור MiniCPM5-2B (יעד צפוף של 2.52B), לא עצמאי. Granite 4.2 3B: מודל הנמקה צפוף עצמאי של ~3B.
• תפקיד — מחסנית MiniCPM5-2B: דגש על סוכן על-המכשיר ושימוש בכלים, לפי ModelBest. Granite 4.2 3B: מומחה חשיבה, לא-סוכני במתכוון.
• הקשר — MiniCPM5-2B יעד: 128K מקורי. Granite 4.2 3B: 128K מקורי, מתרחב ל-512K.
• האצה — MiniCPM5-2B-DSpark: DSpark חיצוני כ-draft, שבעה טוקנים לכל מעבר, קבלה חמדנית ~5.5 לכל צעד (כפי שדווח במאגר). Granite 4.2 3B: לא כלול במהדורה זו.
• רישיון — שניהם Apache-2.0.
• עדויות — נתוני MiniCPM הם הצהרות מכרטיס המודל של ModelBest (הסוויטה שלו: 53.9 לעומת 42.7 של Granite); נתוני Granite הם הצהרות מכרטיס המודל של IBM (AIME 2025: 78.33, GPQA: 54.80). לא קיימת הרצה בלתי-תלויה של אף אחד מהם.

לוח התוצאות שלמעלה מסתמך על אותם מקורות כמו הטקסט: כל נתון בו מדווח על ידי הספק, והמספר היחיד מאותה סוויטה שמי מהספקים פרסם הוא זה של ModelBest עצמו.
ההבדל שעוקף כל מדד
לפני הציונים, החליטו איזה סוג של מודל קטן עומס העבודה שלכם דורש, כי שתי הגרסאות עונות על שאלות שונות. Granite 4.2 3B בנוי לחשיבה ולהקשר ארוך על חומרה מוגבלת: חלון מקורי של 128K שנמתח ל-512K, שלושה מצבי חשיבה לפי שאילתה, טביעת רגל שרצה על מחשב נייד, והחלטה מפורשת לדלג על אימון סוכני. אם העבודה שלכם היא ניתוח מסמכים ארוכים, הקשר בקנה מידה של מאגר קוד, או חשיבה אמינה על מכונה קטנה, זו התאמה קוהרנטית. MiniCPM5-2B בנוי לדגש ההפוך: התנהגות סוכנית ושימוש בכלים על המכשיר — עצם קיומה של טיוטה מאותת ש-ModelBest מצפה שיעד זה יוגש אינטראקטיבית, ורוצה לקבל בחזרה את קצב האסימונים לשנייה. אם העבודה שלכם היא לולאת סוכן על המכשיר שקוראת לכלים ומנהלת שיחות ארוכות, זו המחסנית שמכוונת אליכם.
{{1}}הדראפט משנה את הכלכלה של הבחירה השנייה ההיא בדרך שהמהדורה של Granite אינה מטפלת בה.{{/1}} {{2}}MiniCPM5-2B הוא מודל צפוף, ופענוח ספקולטיבי משתלם ביותר דווקא במשטר הצפוף, שבו הזיכרון הוא צוואר הבקבוק — מודל קטן קבוע שמציע טוקנים למודל קבוע גדול במעט.{{/2}} {{3}}דראפטר חיצוני שמוסיף כ-650MB של משקלי BF16 למודל מטרה של כ-5GB, עם מסלול שירות מתועד של SGLang ושיעור קבלה בשיטת greedy של כחמישה וחצי טוקנים לכל שלב אימות, הוא מנוף תפוקה סביר למודל שאתה משרת ב-concurrency של בקשה יחידה.{{/3}} {{4}}אבל אי אפשר לחמוק מההסתייגות: OpenBMB לא פרסמה שום מדידת האצה מקצה לקצה, ולכן המנוף אינו מכויל.{{/4}} {{5}}IBM לא כוללת דראפטר חיצוני מקביל עבור Granite 4.2 3B כחלק מהמהדורה הזו — אתה מריץ אותו כמודל צפוף, ומבחינת מהירות הסיפור פשוט: ה-3B קטן.{{/5}}
מי צריך להריץ מה
• הריצו את Granite 4.2 3B אם עומס העבודה שלכם הוא נימוק בהקשר ארוך על מחשב נייד — מסמכים, מאגרי קוד, ניתוח חד-תהלילוני מעמיק — ואתם רוצים שלושה מצבי חשיבה ותקרה של 512K על מודל ברישיון Apache-2.0 שאתם שולטים בו לחלוטין. קבלו את העובדה שאין מאחוריו אימון אייג'נטי ואין API מתארח.
• הפעל את מחסנית MiniCPM5-2B עם טיוטת ה-DSpark שלה אם עומס העבודה שלך הוא סוכן על-המכשיר אינטראקטיבי שמפעיל כלים, שבו היעד מתאים לתקציב הזיכרון שלך ואתה רוצה את התפוקה שטיוטה יכולה להחזיר. הקצה זמן למדידת ההאצה האמיתית של הטיוטה על ה-build שלך של SGLang, מכיוון שלא פורסם אף מספר עבורה.
• הרץ את שניהם מאחורי שכבת ניתוב אם אינך באמת בטוח. אף אחד מהמודלים אינו בקטלוג מארח כיום, כולל OrcaRouter — בשני המקרים מדובר באירוח עצמי — אך נתב שממוקם מול נקודות הקצה שלך עם מעבר אוטומטי במקרה תקלה מאפשר למחסנית הטיוטה החדשה להישאר בנתיב בדיקה בזמן שהייצור ממשיך על המוכחת, והעברת העלות ללא רווח (0%) על המודלים המארחים שמסביב שומרת על מחירה הנמוך של השוואת A/B. הנקודה היא ההפיכות: החלף שם מודל, מדוד, וחזור אחורה אם נקודת הביקורת בת־היום נתקעת.
מה לצפות בהמשך
שני דברים יכריעו את ההתמודדות הזו מהר יותר מכל דעה. ראשית, ריצה עצמאית של MiniCPM5-2B שתאשר או תפריך את הממוצע 53.9 ואת הטענות בנוגע ליכולות הסוכן — ציון של 2B כל כך גבוה במשימות בסגנון SWE-Bench יהווה נקודת נתונים חדשה באמת עבור המחלקה של מכשירי הקצה. שנית, שהמספרים של מודל ההיגיון של IBM עצמו ישרדו שכפול קהילתי; ה-78.33 של ה-3B ב-AIME 2025 הוא סוג הטענה שמשתנה כשמישהו אחר מריץ אותה. עד שאחד מאלה ינחת, העמדה הכנה היא: Granite 4.2 3B הוא המודל הקטן הבטוח והמתועד יותר טוב כיום, ומחסנית MiniCPM5-2B היא ההימור המעניין יותר — סוכן מהיר יותר על המכשיר אם הטענות שלו עומדות, עם טיוטה שגם הספק עצמו עדיין לא מדד את התמורה שלה.
