כרטיס כותרת ראשי להשוואת 'MiniCPM5-2B-DSpark לעומת Gemma 4 12B', עם כותרת המשנה 'שתי דרכים לנסח, שתי מחלקות משקל של בינה מלאכותית מקומית', המציג שבב קטן שמתויג 'draft של 324M' המזין בלוק שמתויג 'יעד על-המכשיר של 2.5B' בצד שמאל, ופאנל רחב יותר שמתויג 'גנרליסט רב-מודאלי של 11.95B' בצד ימין, עם קו זרימה של שבבי טוקנים מעל שמתויג 'טיוטה ואז אימות', ולוגו OrcaRouter בפינה הימנית התחתונה.
Guides & Insights

MiniCPM5-2B-DSpark לעומת Gemma 4 12B: שתי דרכים לניסוח, שתי מחלקות משקל של בינה מלאכותית מקומית

מחבר

Alistair Wren

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

הדרך המהירה ביותר להבין מדוע MiniCPM5-2B-DSpark ו-Gemma 4 12B שייכים לאותו דף היא להתעלם לרגע מהגודל שלהם ולראות איך כל אחד מהם כותב משפט. שניהם מרמים את אפיק הזיכרון באמצעות דראפטר: מודל קטן מציע כמה טוקנים עוקבים בבת אחת, והמודל האמיתי מאמת את הבלוק במעבר בודד — כך שהשבב משלם את עלות טעינת המשקלים פעם אחת לכל בלוק במקום פעם אחת לכל טוקן. MiniCPM5-2B-DSpark הוא הדראפטר ש-OpenBMB העלתה בשקט ל-Hugging Face ב-6 בספטמבר 2026 — צ'קפוינט מלווה בעל 323.8 מיליון פרמטרים שמאיץ את MiniCPM5-2B, המודל הצפוף בגודל 2.52 מיליארד פרמטרים לריצה על גבי המכשיר, ש-ModelBest הכריזה עליו בכנס WAIC ב-19 ביולי 2026. Gemma 4 12B הוא המודל הגנרליסטי הרב-מודאלי של גוגל, ללא אנקודר, בגודל 11.95 מיליארד פרמטרים, שהושק ב-3 ביוני 2026 עם דראפטרים מובנים משלו וחלון קונטקסט של 256K. האחד משווק את הדראפטר כצ'קפוינט נפרד תחת רישיון Apache-2.0 שאתה טוען בעצמך; השני מסתיר טריק דומה בתוך מודל גדול אחד שאתה פשוט מריץ.

הערת הכנות שמעצבת את צורת המאמר הזה: MiniCPM5-2B-DSpark אינו מודל שניתן לתת לו פרומפט. אין לו טוקנייזר, אין לו תבנית צ׳אט, ואין לו פלט עצמאי — זהו כרטיס שמציג רק model.safetensors, config ו-README. מדובר באביזר שכבת-Serving עבור יעד ממחלקת 2B, וההשוואה האמיתית שהקורא עושה היא בין שתי מחלקות משקל של AI מקומי: ערימת 2B בגודל טלפון שמפיקה את הטוקנים שלה, לעומת מודל גנרליסט 12B בנפח 16 גיגה-בייט שמפיק את הטוקנים שלו. כל מה שמופיע בהמשך הוא אותה החלטה, כשהיא הופכת לקונקרטית.

מה זה MiniCPM5-2B-DSpark באמת

כרטיס המודל הוא כל המשטח הציבורי של המהדורה, ולכן זה כל מה שניתן לדעת ממנו. MiniCPM5-2B-DSpark הוא צ׳קפוינט דראפט (draft) מבוסס DSpark: חמש שכבות קשב מלאות (full attention), 323,776,001 פרמטרים, grouped-query attention עם 16 ראשי שאילתה (query heads) ו־2 ראשי KV, וגודל בלוק של שבע — הוא מציע עד שבעה token-ים מועמדים בכל מעבר forward, כדי שמודל היעד MiniCPM5-2B יאמת אותם. הקונפיגורציה מצהירה על ארכיטקטורת Qwen3DSparkModel עם auto-map של DSparkDraftModel, והצ׳קפוינט מגיע כשראש הביטחון (confidence head) וראש ה־Markov משיטת DSpark (arXiv 2607.05147, המאמר של D​eepSeek מיולי 2026) עדיין מופעלים — הווריפייר המודע-לעומס (load-aware) שמחליט מתי סיומת (suffix) לא שווה בדיקה. המודל אומן במשך שש אפוקות על 7.05 מיליארד token-ים של תגובות שנוצרו על־ידי MiniCPM5-2B על פני prompt-ים כלליים, מתמטיים ושל קוד.

A screenshot of the Hugging Face model page for openbmb/MiniCPM5-2B-DSpark (captured September 7, 2026) showing the model title, the description 'a DSpark draft checkpoint trained for exact pairing with MiniCPM5-2B and its tokenizer', and the Model Specification table listing Target model MiniCPM5-2B, five draft layers, 323,776,001 draft parameters, and a block size of seven.

הכרטיס של openbmb/MiniCPM5-2B-DSpark שלמעלה הוא מלוא מה שנשלח: כרטיס מודל, קונפיג, קובץ Safetensors אחד, וללא הודעה, ללא פוסט בבלוג, ללא הודעה לעיתונות — שחרור משקולות שקט, בן יום אחד בזמן הכתיבה.

מה שהכרטיס אינו כולל חשוב לא פחות ממה שהוא כולל. הוא מדווח על אורך קבלה — בהערכת המאגר עצמו, ממוצע של 5.52 טוקנים מאושרים לכל שלב אימות בפענוח חמדני, כאשר במתמטיקה הנתון הוא 6.05 ובקוד 6.11 מתוך תקרה של שבעה טוקנים — אך הוא אינו מפרסם האצת זמן-שעון, אינו מציג נתון של טוקנים לשנייה, ואינו כולל אמת מידה בלתי-תלויה. מנוע ה-DSPARK של SGLang הוא נתיב השרתת המתועד, והדראפט נטען לצד מודל היעד MiniCPM5-2B. במילים אחרות: איכות הדראפט כומתה, התמורה ממנו עדיין לא, וכל מי שמאמץ אותו צריך למדוד לפני שיאמין.

מה Gemma 4 12B מביא לצד השני

Gemma 4 12B הוא הילד האמצעי של משפחת Gemma 4 של גוגל, והוא יושב בנקודה שונה לחלוטין על עקומת ה‑AI המקומית. זהו מודל צפוף יחיד בגודל 11.95B, שמקבל כקלט טקסט, תמונה, אודיו וווידאו ללא מקודדים נפרדים, מבצע קריאות לכלים ישירות מהקופסה, ומצמיד הקשר טבעי של 256K עם דראפטרים של חיזוי רב‑טוקנים, שמשרתים את אותו טריק של אפיק זיכרון באופן פנימי – אבל מתוך נקודת הבידוק (checkpoint), כך שאין לך שום דבר נוסף להוריד או לחבר. הוא ברישיון Apache 2.0, רץ בפועל על לפטופ עם 16GB, והגיע עם כל המנגנון של גוגל: הערכות השקה, כרטיסי מודל לגרסאות הבסיס וההוראות, תמיכה אקוסיסטמית ב‑Model Garden, LM Studio ו‑Ollama. מאחוריו חודשים של פריסה קהילתית – מה שאין לטיוטת MiniCPM בת היום.

A screenshot of the Hugging Face model page for google/gemma-4-12B-it (captured August 31, 2026, reused from a published sibling) showing the model title, the Any-to-Any and image-text-to-text tags, the Transformers and Safetensors libraries, and the Apache 2.0 license.

כרטיס המודל של גוגל עבור Gemma 4 12B שלמעלה הוא הניגוד בפריים אחד: גנרליסט רב־מודאלי בוגר, שמנסחיו הם חלק מתכונת המהדורה עצמה, לא מאגר נפרד.

המפרטים, מסומנים בכנות

קראו את אלה מתוך מחשבה על מקורות הנתונים: הנתונים של MiniCPM5-2B הם טענות מכרטיס המודל של ModelBest, שלא שוחזרו; הנתונים של Gemma 4 12B הם של גוגל עצמה, וחשופים לשימוש קהילתי מזה זמן רב.

• מה שאתה מריץ — MiniCPM5-2B-DSpark: דראפט של 324M שפועל רק לצד MiniCPM5-2B (2.52B dense, 42 שכבות). Gemma 4 12B: מודל dense עצמאי יחיד בגודל 11.95B.

• הקשר — MiniCPM5-2B: יעד 128K מקורי. Gemma 4 12B: 256K מקורי.

• מודאליות — מחסנית MiniCPM5-2B: טקסט בלבד. Gemma 4 12B: קלט טקסט, תמונה, אודיו ווידאו, ללא מקודד.

• ניסוח טיוטה — MiniCPM5-2B-DSpark: טיוטת DSpark חיצונית, שבעה טוקנים לכל pass, מנוע SGLang DSPARK. Gemma 4 12B: מגשרי חיזוי רב-טוקנים פנימיים, אין צורך בהתקנה.

• טביעת רגל — MiniCPM5-2B יעד של כ-5GB ב-BF16 בתוספת קובץ טיוטה של ~650MB; Gemma 4 12B כ-18GB ב-BF16, פרקטי על חומרה מסוג 16GB עם קוונטיזציה.

• עדויות — MiniCPM5-2B-DSpark: נתוני אורך קבלה במאגר בלבד, בני יום אחד. Gemma 4 12B: הערכות השקה בתוספת חודשי פריסה קהילתית.

A two-column scoreboard for MiniCPM5-2B-DSpark vs Gemma 4 12B: left column MiniCPM5-2B-DSpark with 'What you run: 324M draft for a 2.52B target', text-only modality, 128K target window, external DSpark drafting at 7 tokens per pass, ~5GB target plus 650MB draft footprint, and an unannounced Hugging Face release September 6 2026; right column Gemma 4 12B with a standalone 11.95B model, text/image/audio/video input, 256K native context, internal MTP drafters, ~18GB BF16, and Google's June 3 2026 launch, with a footer reading 'MiniCPM figures from the model card, unreproduced; Gemma specs per Google' and the OrcaRouter logo in the bottom-right corner.

לוח התוצאות שלמעלה הוא אותו דיוקן בשש שורות: שתי העמודות חולקות על כמעט הכל, מלבד האסטרטגיה ששתיהן משתמשות בה כדי לכתוב מהר.

איזו קטגוריית משקל מתאימה לסיליקון שיש לך בפועל

מכיוון ש-MiniCPM5-2B-DSpark אינו מודל, ההבחנה המשמעותית היא בין מחלקת המשקל של מודל היעד לבין זו של Gemma 4 12B — וההבחנה הזאת היא בעיקר שאלת חומרה. טלפון, לוח קוקפיט חכם או התקן קצה קטן עם כמה גיגה־בייטים של DRAM לא יכול להריץ מודל של 11.95B במהירות שימושית; אפיק הזיכרון הוא בדיוק הצוואר־בבקבוק שיחנוק אותו. זהו העולם שעבורו נבנתה ערימת MiniCPM5-2B — מודל צפוף של 2B שמשקליו נכנסים לזיכרון המכשיר, עם טיוטה (draft) שחוברה אליו כדי להחזיר חלק מה־tokens-per-second שמודלים קטנים וצפופים מוותרים עליהם. פענוח ספקולטיבי (speculative decoding) יעיל ביותר דווקא במשטר הצפוף הזה, שמוגבל על ידי הזיכרון, ולכן הטיוטה היא החלק המעניין בהוצאה ולא תחבולה.

Gemma 4 12B הוא התשובה במחלקת משקל אחת גבוהה יותר. אם למכונה שלך יש 16GB או יותר — מחשב נייד, תחנת עבודה, שרת קצה חזק — אתה יכול להריץ את הגנרליסט הרב-מודאלי, ומקבל שלושה דברים שסטאק ה-2B לא יכול להציע: קלט של תמונה, אודיו ווידאו ללא מקודדים או צינור עיבוד שני; חלון של 256K לעבודה בקנה מידה של מאגר קוד או מסמך; ובשלות שלטיוטה בת יום אחד פשוט אין. אתה מוותר על היכולת לרוץ על המכשירים הקטנים ביותר ומשלם בערך פי שלושה על טביעת הזיכרון.

מציאות הניתוב עבור שניהם

אף אחד מהצדדים בהשוואה הזאת לא נמצא כיום בקטלוג מתארח — כולל OrcaRouter. MiniCPM5-2B-DSpark הוא, בהגדרתו, רכיב הגשה לאירוח עצמי: אתה מריץ את מחסנית SGLang בעצמך, והדראפט קיים רק בפריסה המקומית שלך. Gemma 4 12B הוא מודל במשקלים פתוחים, אז אתה מגיש אותו או משתמש בו בפלטפורמות שבהן הוא כבר זמין. וזה בדיוק המצב שבו שכבת ניתוב מצדיקה את קיומה כרשת ביטחון ולא כמנגנון אספקה: כשאתה בוחן גרסת דראפט חדשה לגמרי מול עומס עבודה שאתה כבר מגיש, הכוונת נתיב הבדיקה דרך API אחד עם העברה אוטומטית (failover) פירושה שמחסנית לא מוכחת יכולה להיתקע בלי להפיל את הייצור — ומחירי הספקים סביבה עוברים הלאה בתוספת של 0%, כך ששינוי מחיר בכל מודל מתארח שאתה משווה אליו יופיע באותו יום. ואולם, לגבי ההשוואה עצמה, התוכנית הכנה לשני המודלים היא זהה: אתה מארח בעצמך, ולכן ה-benchmark שמשנה הוא זה שאתה מריץ על החומרה שלך.

פסק הדין

MiniCPM5-2B-DSpark ו-Gemma 4 12B אינם מתחרים זה בזה בשום מובן של תחרות ישירה — הם שתי קטגוריות משקל של בינה מלאכותית מקומית שבמקרה חולקות טריק. בחר במחסנית ה-MiniCPM5-2B עם הטיוטה DSpark שלה כאשר המכשיר שלך אינו יכול לשאת דגם 12B ואתה רוצה מודל המסוגל לטקסט, ברישיון Apache-2.0, מונחה-סוכנים, שמתאים לזיכרון המכשיר; הטיוטה היא האצה חינמית מבטיחה, אך מדוד אותה על בניית ה-SGLang שלך לפני שתסמוך עליה, משום שהתמורה שלה עדיין אינה כמותית. בחר ב-Gemma 4 12B כאשר לחומרה שלך יש מרווח ראש ואתה רוצה מודל מולטי-מודאלי אחד עם חלון של 256K ומערכת אקולוגית מאחוריו. השאלה אינה איזה מודל חכם יותר — אלא איזה מהם הסיליקון שלך יכול באמת להזין.