
MiniCPM5-2B-DSpark לעומת Gemma 4 12B: שתי דרכים לניסוח, שתי מחלקות משקל של בינה מלאכותית מקומית
- OrcaחדשOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 לכל 1M טוקנים
- orcaחדשOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים
- deepseekחדשDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- openaiOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- googleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- anthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0540אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0345אינטליגנציה76כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
הדרך המהירה ביותר להבין מדוע MiniCPM5-2B-DSpark ו-Gemma 4 12B שייכים לאותו דף היא להתעלם לרגע מהגודל שלהם ולראות איך כל אחד מהם כותב משפט. שניהם מרמים את אפיק הזיכרון באמצעות דראפטר: מודל קטן מציע כמה טוקנים עוקבים בבת אחת, והמודל האמיתי מאמת את הבלוק במעבר בודד — כך שהשבב משלם את עלות טעינת המשקלים פעם אחת לכל בלוק במקום פעם אחת לכל טוקן. MiniCPM5-2B-DSpark הוא הדראפטר ש-OpenBMB העלתה בשקט ל-Hugging Face ב-6 בספטמבר 2026 — צ'קפוינט מלווה בעל 323.8 מיליון פרמטרים שמאיץ את MiniCPM5-2B, המודל הצפוף בגודל 2.52 מיליארד פרמטרים לריצה על גבי המכשיר, ש-ModelBest הכריזה עליו בכנס WAIC ב-19 ביולי 2026. Gemma 4 12B הוא המודל הגנרליסטי הרב-מודאלי של גוגל, ללא אנקודר, בגודל 11.95 מיליארד פרמטרים, שהושק ב-3 ביוני 2026 עם דראפטרים מובנים משלו וחלון קונטקסט של 256K. האחד משווק את הדראפטר כצ'קפוינט נפרד תחת רישיון Apache-2.0 שאתה טוען בעצמך; השני מסתיר טריק דומה בתוך מודל גדול אחד שאתה פשוט מריץ.
הערת הכנות שמעצבת את צורת המאמר הזה: MiniCPM5-2B-DSpark אינו מודל שניתן לתת לו פרומפט. אין לו טוקנייזר, אין לו תבנית צ׳אט, ואין לו פלט עצמאי — זהו כרטיס שמציג רק model.safetensors, config ו-README. מדובר באביזר שכבת-Serving עבור יעד ממחלקת 2B, וההשוואה האמיתית שהקורא עושה היא בין שתי מחלקות משקל של AI מקומי: ערימת 2B בגודל טלפון שמפיקה את הטוקנים שלה, לעומת מודל גנרליסט 12B בנפח 16 גיגה-בייט שמפיק את הטוקנים שלו. כל מה שמופיע בהמשך הוא אותה החלטה, כשהיא הופכת לקונקרטית.
מה זה MiniCPM5-2B-DSpark באמת
כרטיס המודל הוא כל המשטח הציבורי של המהדורה, ולכן זה כל מה שניתן לדעת ממנו. MiniCPM5-2B-DSpark הוא צ׳קפוינט דראפט (draft) מבוסס DSpark: חמש שכבות קשב מלאות (full attention), 323,776,001 פרמטרים, grouped-query attention עם 16 ראשי שאילתה (query heads) ו־2 ראשי KV, וגודל בלוק של שבע — הוא מציע עד שבעה token-ים מועמדים בכל מעבר forward, כדי שמודל היעד MiniCPM5-2B יאמת אותם. הקונפיגורציה מצהירה על ארכיטקטורת Qwen3DSparkModel עם auto-map של DSparkDraftModel, והצ׳קפוינט מגיע כשראש הביטחון (confidence head) וראש ה־Markov משיטת DSpark (arXiv 2607.05147, המאמר של DeepSeek מיולי 2026) עדיין מופעלים — הווריפייר המודע-לעומס (load-aware) שמחליט מתי סיומת (suffix) לא שווה בדיקה. המודל אומן במשך שש אפוקות על 7.05 מיליארד token-ים של תגובות שנוצרו על־ידי MiniCPM5-2B על פני prompt-ים כלליים, מתמטיים ושל קוד.

הכרטיס של openbmb/MiniCPM5-2B-DSpark שלמעלה הוא מלוא מה שנשלח: כרטיס מודל, קונפיג, קובץ Safetensors אחד, וללא הודעה, ללא פוסט בבלוג, ללא הודעה לעיתונות — שחרור משקולות שקט, בן יום אחד בזמן הכתיבה.
מה שהכרטיס אינו כולל חשוב לא פחות ממה שהוא כולל. הוא מדווח על אורך קבלה — בהערכת המאגר עצמו, ממוצע של 5.52 טוקנים מאושרים לכל שלב אימות בפענוח חמדני, כאשר במתמטיקה הנתון הוא 6.05 ובקוד 6.11 מתוך תקרה של שבעה טוקנים — אך הוא אינו מפרסם האצת זמן-שעון, אינו מציג נתון של טוקנים לשנייה, ואינו כולל אמת מידה בלתי-תלויה. מנוע ה-DSPARK של SGLang הוא נתיב השרתת המתועד, והדראפט נטען לצד מודל היעד MiniCPM5-2B. במילים אחרות: איכות הדראפט כומתה, התמורה ממנו עדיין לא, וכל מי שמאמץ אותו צריך למדוד לפני שיאמין.
מה Gemma 4 12B מביא לצד השני
Gemma 4 12B הוא הילד האמצעי של משפחת Gemma 4 של גוגל, והוא יושב בנקודה שונה לחלוטין על עקומת ה‑AI המקומית. זהו מודל צפוף יחיד בגודל 11.95B, שמקבל כקלט טקסט, תמונה, אודיו וווידאו ללא מקודדים נפרדים, מבצע קריאות לכלים ישירות מהקופסה, ומצמיד הקשר טבעי של 256K עם דראפטרים של חיזוי רב‑טוקנים, שמשרתים את אותו טריק של אפיק זיכרון באופן פנימי – אבל מתוך נקודת הבידוק (checkpoint), כך שאין לך שום דבר נוסף להוריד או לחבר. הוא ברישיון Apache 2.0, רץ בפועל על לפטופ עם 16GB, והגיע עם כל המנגנון של גוגל: הערכות השקה, כרטיסי מודל לגרסאות הבסיס וההוראות, תמיכה אקוסיסטמית ב‑Model Garden, LM Studio ו‑Ollama. מאחוריו חודשים של פריסה קהילתית – מה שאין לטיוטת MiniCPM בת היום.

כרטיס המודל של גוגל עבור Gemma 4 12B שלמעלה הוא הניגוד בפריים אחד: גנרליסט רב־מודאלי בוגר, שמנסחיו הם חלק מתכונת המהדורה עצמה, לא מאגר נפרד.
המפרטים, מסומנים בכנות
קראו את אלה מתוך מחשבה על מקורות הנתונים: הנתונים של MiniCPM5-2B הם טענות מכרטיס המודל של ModelBest, שלא שוחזרו; הנתונים של Gemma 4 12B הם של גוגל עצמה, וחשופים לשימוש קהילתי מזה זמן רב.
• מה שאתה מריץ — MiniCPM5-2B-DSpark: דראפט של 324M שפועל רק לצד MiniCPM5-2B (2.52B dense, 42 שכבות). Gemma 4 12B: מודל dense עצמאי יחיד בגודל 11.95B.
• הקשר — MiniCPM5-2B: יעד 128K מקורי. Gemma 4 12B: 256K מקורי.
• מודאליות — מחסנית MiniCPM5-2B: טקסט בלבד. Gemma 4 12B: קלט טקסט, תמונה, אודיו ווידאו, ללא מקודד.
• ניסוח טיוטה — MiniCPM5-2B-DSpark: טיוטת DSpark חיצונית, שבעה טוקנים לכל pass, מנוע SGLang DSPARK. Gemma 4 12B: מגשרי חיזוי רב-טוקנים פנימיים, אין צורך בהתקנה.
• טביעת רגל — MiniCPM5-2B יעד של כ-5GB ב-BF16 בתוספת קובץ טיוטה של ~650MB; Gemma 4 12B כ-18GB ב-BF16, פרקטי על חומרה מסוג 16GB עם קוונטיזציה.
• עדויות — MiniCPM5-2B-DSpark: נתוני אורך קבלה במאגר בלבד, בני יום אחד. Gemma 4 12B: הערכות השקה בתוספת חודשי פריסה קהילתית.

לוח התוצאות שלמעלה הוא אותו דיוקן בשש שורות: שתי העמודות חולקות על כמעט הכל, מלבד האסטרטגיה ששתיהן משתמשות בה כדי לכתוב מהר.
איזו קטגוריית משקל מתאימה לסיליקון שיש לך בפועל
מכיוון ש-MiniCPM5-2B-DSpark אינו מודל, ההבחנה המשמעותית היא בין מחלקת המשקל של מודל היעד לבין זו של Gemma 4 12B — וההבחנה הזאת היא בעיקר שאלת חומרה. טלפון, לוח קוקפיט חכם או התקן קצה קטן עם כמה גיגה־בייטים של DRAM לא יכול להריץ מודל של 11.95B במהירות שימושית; אפיק הזיכרון הוא בדיוק הצוואר־בבקבוק שיחנוק אותו. זהו העולם שעבורו נבנתה ערימת MiniCPM5-2B — מודל צפוף של 2B שמשקליו נכנסים לזיכרון המכשיר, עם טיוטה (draft) שחוברה אליו כדי להחזיר חלק מה־tokens-per-second שמודלים קטנים וצפופים מוותרים עליהם. פענוח ספקולטיבי (speculative decoding) יעיל ביותר דווקא במשטר הצפוף הזה, שמוגבל על ידי הזיכרון, ולכן הטיוטה היא החלק המעניין בהוצאה ולא תחבולה.
Gemma 4 12B הוא התשובה במחלקת משקל אחת גבוהה יותר. אם למכונה שלך יש 16GB או יותר — מחשב נייד, תחנת עבודה, שרת קצה חזק — אתה יכול להריץ את הגנרליסט הרב-מודאלי, ומקבל שלושה דברים שסטאק ה-2B לא יכול להציע: קלט של תמונה, אודיו ווידאו ללא מקודדים או צינור עיבוד שני; חלון של 256K לעבודה בקנה מידה של מאגר קוד או מסמך; ובשלות שלטיוטה בת יום אחד פשוט אין. אתה מוותר על היכולת לרוץ על המכשירים הקטנים ביותר ומשלם בערך פי שלושה על טביעת הזיכרון.
מציאות הניתוב עבור שניהם
אף אחד מהצדדים בהשוואה הזאת לא נמצא כיום בקטלוג מתארח — כולל OrcaRouter. MiniCPM5-2B-DSpark הוא, בהגדרתו, רכיב הגשה לאירוח עצמי: אתה מריץ את מחסנית SGLang בעצמך, והדראפט קיים רק בפריסה המקומית שלך. Gemma 4 12B הוא מודל במשקלים פתוחים, אז אתה מגיש אותו או משתמש בו בפלטפורמות שבהן הוא כבר זמין. וזה בדיוק המצב שבו שכבת ניתוב מצדיקה את קיומה כרשת ביטחון ולא כמנגנון אספקה: כשאתה בוחן גרסת דראפט חדשה לגמרי מול עומס עבודה שאתה כבר מגיש, הכוונת נתיב הבדיקה דרך API אחד עם העברה אוטומטית (failover) פירושה שמחסנית לא מוכחת יכולה להיתקע בלי להפיל את הייצור — ומחירי הספקים סביבה עוברים הלאה בתוספת של 0%, כך ששינוי מחיר בכל מודל מתארח שאתה משווה אליו יופיע באותו יום. ואולם, לגבי ההשוואה עצמה, התוכנית הכנה לשני המודלים היא זהה: אתה מארח בעצמך, ולכן ה-benchmark שמשנה הוא זה שאתה מריץ על החומרה שלך.
פסק הדין
MiniCPM5-2B-DSpark ו-Gemma 4 12B אינם מתחרים זה בזה בשום מובן של תחרות ישירה — הם שתי קטגוריות משקל של בינה מלאכותית מקומית שבמקרה חולקות טריק. בחר במחסנית ה-MiniCPM5-2B עם הטיוטה DSpark שלה כאשר המכשיר שלך אינו יכול לשאת דגם 12B ואתה רוצה מודל המסוגל לטקסט, ברישיון Apache-2.0, מונחה-סוכנים, שמתאים לזיכרון המכשיר; הטיוטה היא האצה חינמית מבטיחה, אך מדוד אותה על בניית ה-SGLang שלך לפני שתסמוך עליה, משום שהתמורה שלה עדיין אינה כמותית. בחר ב-Gemma 4 12B כאשר לחומרה שלך יש מרווח ראש ואתה רוצה מודל מולטי-מודאלי אחד עם חלון של 256K ומערכת אקולוגית מאחוריו. השאלה אינה איזה מודל חכם יותר — אלא איזה מהם הסיליקון שלך יכול באמת להזין.
