כרטיס כותרת ראשי להשוואה 'MiniCPM5-2B-DSpark לעומת Qwen3-8B', עם כותרת המשנה 'מחסנית ה-2.5B החדשה להרצה על-גבי המכשיר מול סוס העבודה בעל המשקלים הפתוחים'. הכרטיס מציג קו מתאר של טלפון בצד שמאל, ובו שבב קטן עם התווית '2.5B + draft', ומתלה שרתים בצד ימין עם התווית '8B workhorse', כשביניהם מד רוחב-פס זיכרון, ולוגו OrcaRouter בפינה הימנית-התחתונה.
Guides & Insights

MiniCPM5-2B-DSpark מול Qwen3-8B: סטאק ה-2.5B החדש להרצה על‑גבי המכשיר, ומולו סוס העבודה בעל המשקולות הפתוחות

מחבר

Rowan Sterling

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

כל השוואת מודלים מחביאה בתוכה שאלת חומרה, וההשוואה בין MiniCPM5-2B-DSpark ל-Qwen3-8B היא אותה שאלה מחופשת לבנצ'מרק. Qwen3-8B הוא סוס העבודה בעל המשקלים הפתוחים של אליבאבא מאפריל 2025 — כ-8.2 מיליארד פרמטרים צפופים, 119 שפות, חלון הקשר מקורי של 32K הניתן להרחבה ל-131K, מצבי חשיבה היברידיים, ושישה-עשר חודשים של עדויות מהקהילה מאחוריו. MiniCPM5-2B-DSpark אינו מודל עצמאי שאפשר להניח לצידו: הוא נקודת הבידוק (checkpoint) של דראפט DSpark, בעלת 323.8 מיליון פרמטרים, ש-OpenBMB פרסמה בשקט ב-Hugging Face ב-6 בספטמבר 2026 כדי להאיץ את MiniCPM5-2B, המודל הצפוף להרצה על-גבי המכשיר בעל 2.52 מיליארד הפרמטרים ש-ModelBest הכריזה עליו ב-WAIC ב-19 ביולי 2026. חברו את השניים יחד והשאלה האמיתית עולה: האם עומס העבודה שרץ כיום על 8B צריך לרוץ על חומרה שיכולה לשאת רק 2B — והאם מודל 2.5B עם דראפט חינמי טוב מספיק כדי לבצע את המעבר?

התשובה הקצרה היא שעדיין לא עבור רוב העומסים, אבל הסיבות צרות יותר ממה שפער הגדלים מרמז, ויש סוג אחד של פריסה שבו ל-8B אין תשובה כלל. כל מה שכמותי במאמר זה הוא דיווח של הספק — המספרים של MiniCPM הם של ModelBest עצמה, ללא אימות חוזר; אלה של Qwen3-8B הם של Alibaba, שהיו חשופים לשימוש קהילתי מזה זמן רב — כך שהתוויות חשובות יותר מהספרות.

שני מודלים במקומות שונים על עקומת הזיכרון.

MiniCPM5-2B הוא טרנספורמר סיבתי צפוף בגודל שליש מ-8B — 42 שכבות, מנגנון קשב מקובץ-שאילתות (GQA), Apache-2.0 — שנבנה עבור מחלקת המכשירים שמודל גדול אינו יכול להגיע אליהם: טלפונים, תאי טייס חכמים ותיבות קצה קטנות שבהן אפיק הזיכרון ייחנק משמונה מיליארד משקולות. חומרי ההשקה שלו שמים את הדגש על עבודה סוכנותית והקשר ארוך ולא על רוחב גולמי: 128K הקשר טבעי, וטענת ModelBest שבסביבת ההערכה שלה המודל משיג ממוצע של 53.9 — SOTA בקוד פתוח במחלקת ה-2B, לפי הספק, כולל 46.4 שנמדדה על ידי הספק ב-SWE-bench Verified, תוצאה שתהיה יוצאת דופן עבור מודל 2B אם היא תשרוד בדיקות עצמאיות. מודל הטיוטה DSpark הוא תשובת התפוקה להתנגדות המובנת מאליה שמודל צפוף קטן מהיר לטעינה אבל איטי בייצור, משום שכל טוקן סוחב את המשקולות שלו על פני אפיק הזיכרון. הטיוטה מציעה עד שבעה טוקנים בבת אחת שהמטרה תאמת, והמאגר מדווח על קבלה חמדנית של 5.52 טוקנים לכל שלב אימות בממוצע המצרפי — 6.11 בקוד. המספר הזה הוא איכות הטיוטה; ההאצה שלה טרם נמדדה, ואף נתון של טוקנים לשנייה לא פורסם.

A screenshot of the Hugging Face model page for openbmb/MiniCPM5-2B-DSpark (captured September 7, 2026) showing the model title, the 'DSpark draft checkpoint trained for exact pairing with MiniCPM5-2B' description, and the Model Specification table listing the MiniCPM5-2B target, five draft layers, and a block size of seven.

כרטיס ה-openbmb/MiniCPM5-2B-DSpark שלמעלה הוא כל המשטח הציבורי של השחרור השקט מ-6 בספטמבר: אביזר שרת המדווח על אורך קליטה, ללא הכרזה וללא האצת זמן-שעון.

Qwen3-8B הוא מאותה משפחה ארכיטקטונית, גדול פי שלושה ומבוגר בששה-עשר חודשים. הוא טרנספורמר סיבתי (causal) צפוף עם קשב מבוסס שאילתות מקובצות, שאומן על קורפוס רב-לשוני בן 36 טריליון טוקנים, ברישיון Apache-2.0, ואחד מדגמי ה-8B בעלי האירוח וההרצה העצמית הנפוצים ביותר בעולם המודלים במשקולות פתוחות. חותמת ההיכר שלו היא מצב החשיבה ההיברידי של Qwen3 — חשיבה דולקת או כבויה לכל בקשה — והפרופיל שלו רחב במכוון: MMLU בשנות ה-70 הגבוהות, תוצאות חזקות ב-GSM8K ובקידוד, ו-119 שפות. הוא זקוק ל-GPU אמיתי או למכשיר קצה חזק: בקוונטיזציה מעשית הוא רץ בג'יגה-בייטים בודדים, בנוחות על כרטיס בינוני אחד, אבל לא על טלפון.

A screenshot of the Hugging Face model page for Qwen/Qwen3-8B (reused from a published sibling) showing Alibaba's Apache-2.0 generalist model card with its 8.2B parameters, 119 languages, and hybrid thinking mode.

כרטיס המודל של Alibaba עבור Qwen3-8B שלמעלה הוא פניו של המכהן: שישה עשר חודשים של התנהגות מתועדת, שנבחנה על ידי הקהילה, ב-119 שפות.

איפה שה-8B עדיין מנצח

כשיורדים מחלקת משקל אחת, מוותרים על שלושה דברים קונקרטיים. ראשית, שפות: Qwen3-8B מכסה 119 שפות; כרטיס המודל ומערכי הנתונים של MiniCPM5-2B ממוקדים באנגלית ובסינית, ולא נטען רוחב רב-לשוני כלשהו. עבור מוצר שמשרת זנב ארוך של שפות, זהו קיר קשיח, לא רך. שנית, ראיות: המספרים של Qwen3-8B נבדקו, קיבלו קוונטיזציה, עברו כוונון עדין והוגשו בקנה מידה במשך שישה עשר חודשים; מצבי הכשל שלו ידועים, הגרסאות המכוונטות שלו קיימות, והאקוסיסטם שלו פרוש בכל מקום. MiniCPM5-2B הוא גרסה מיולי 2026 עם לוח תוצאות המנוהל בידי הספק וללא שחזור בלתי-תלוי, והטיוטה בת יום אחד. שלישית, סטאק ההגשה: כל מה שכבר מדבר עם Qwen3-8B — vLLM, SGLang, llama.cpp, אלף מודלים מכווננים — מדבר עם יעד בוגר, בעוד שטיוטת ה-MiniCPM דורשת בנייה של מנוע פענוח ספקולטיבי (אלגוריתם DSPARK של SGLang) שהמאגר מתעד אבל האקוסיסטם הרחב עדיין לא אימץ.

כאשר מחסנית ה-2B היא האפשרות היחידה

כל זה לא משנה בסוג המכשירים שבו 8B פשוט לא נכנס. בטלפון או בלוח מחשוב קצה עם כמה ג'יגה-בייט של DRAM, Qwen3-8B לא מתחרה ב-MiniCPM5-2B — הוא בכלל לא ניתן לפריסה במהירות שימושית. זו כל הסיבה ששכבת ה-2B קיימת, וזו הסיבה שהטיוטה היא החלק נושא העומס של המהדורה הזאת, ולא קישוט. פענוח ספקולטיבי הוא היעיל ביותר דווקא במשטר הצפוף ותלוי-הזיכרון שבו חי מודל קטן על סיליקון קטן: מודל טיוטה קומפקטי מציע בלוק, מודל המטרה מאמת אותו במעבר אחד, ועלות טעינת המשקולות משולמת פעם אחת לכל בלוק במקום פעם אחת לכל טוקן. שיטת DSpark שמקורה ב-DeepSeek (arXiv 2607.05147) תוכננה למערכות הגשה בעלות קונקורנטיות גבוהה, אבל המכניקה שלה — ונתוני הקבלה במאגר הזה — הם המנוף הרלוונטי עבור דגם 2B שחייב להרגיש אינטראקטיבי על חומרה מוגבלת. רק אל תאבדו מהעין את ההסתייגות הכנה: הצוות של OpenBMB מדד את שיעור הקבלה של הטיוטה, לא את ההאצה שהיא מספקת, כך שהרווח בפועל בטוקנים לשנייה במכשיר היעד שלכם הוא עדיין משהו שעליכם למדוד בעצמכם.

לוח התוצאות, מסומן בכנות

• שחרור — MiniCPM5-2B: 19 ביולי 2026 (הוכרז); MiniCPM5-2B-DSpark: 6 בספטמבר 2026, בשקט. Qwen3-8B: אפריל 2025, הוכרז.

• גודל — MiniCPM5-2B: 2.52B פרמטרים צפופים, ועוד דראפט של 324M. Qwen3-8B: ~8.2B פרמטרים צפופים.

• הקשר — MiniCPM5-2B: 128K מקורי. Qwen3-8B: 32K מקורי, 131K באמצעות YaRN.

• שפות — MiniCPM5-2B: ממוקד אנגלית/סינית. Qwen3-8B: 119.

• חשיבה — MiniCPM5-2B: מצבי מהיר/מעמיק היברידיים לפי חומרי ההשקה. Qwen3-8B: חשיבה פעילה או כבויה לפי בקשה.

• ראיות — הנתונים של MiniCPM הם טענות מכרטיס המודל של ModelBest (ממוצע 53.9 בסוויטה שלהם; ללא ריצה עצמאית). נתוני Qwen3-8B דווחו על ידי Alibaba, והם חשופים לקהילה מזה שישה עשר חודשים.

A two-column scoreboard for MiniCPM5-2B-DSpark vs Qwen3-8B: left column MiniCPM5-2B-DSpark with 'Release: Jul 19 + Sep 6 2026', size 2.52B plus 324M draft, 128K native context, English and Chinese centered languages, hybrid fast-and-deliberate reasoning, and own-suite average 53.9; right column Qwen3-8B with 'Release: April 2025', ~8.2B dense, 32K native / 131K YaRN context, 119 languages, thinking on or off, and 16 months of community-exposed evidence, with a footer reading 'MiniCPM figures vendor-reported; Qwen figures Alibaba-reported' and the OrcaRouter logo in the bottom-right corner.

לוח התוצאות שלמעלה הוא אי-ההתאמה שמוצגת בכנות: העמודות שונות כמעט בכל דבר, פרט לרישיון ה־Apache-2.0 הפתוח, ומחלקת המכשיר שאליה אתה שולח קובעת איזו עמודה אתה בכלל רשאי לבחור.

מציאות הניתוב

אף אחד מהמודלים אינו יושב בקטלוג מתארח על OrcaRouter כיום, ולכן ההשוואה כולה מתרחשת בעולם האירוח העצמי — אבל דווקא שם שכבת ניתוב עדיין מצדיקה את קיומה. Qwen3-8B מוגש על ידי הספק שלו ועל ידי כמה פלטפורמות של צד שלישי; MiniCPM5-2B ומודל הדראפט שלו הם מודלים שאתה מריץ בעצמך. כשצוות רוצה לבדוק אם מחסנית 2.5B יכולה לשאת חלק מעומס עבודה של 8B, המהלך ההפיך הוא לכוון נתיב בדיקה אל build עצמי של SGLang שמשלב MiniCPM5-2B עם דראפט, דרך API אחד עם failover אוטומטי — הייצור נשאר על המערכת הקיימת, המחסנית החדשה יכולה להיתקע בלי להפיל שום דבר, ומחירי המחירון של הספקים לאורך כל ההשוואה מועברים ב-0% תוספת, כך שמבחן ה-A/B הוא זול והפיך, לא הימור. השכבה אינה מארחת אף אחד מהמודלים; היא רק הופכת את הניסוי לבטוח.

מי צריך לזוז, ומי צריך לחכות

הישארו על Qwen3-8B לכל מה שדורש רב־לשוניות, לכל מה שצריך שישה־עשר חודשים של התנהגות מוכרת, או לכל עומס עבודה שכבר מטופל על ידי חומרה שנושאת 8B בנוחות — פער הגודל אינו סיבה לנדוד, ופער הראיות פועל נגדו. בחנו לעומק את הסטאק של MiniCPM5-2B עם מודל הטיוטה DSpark שלו רק אם התקן היעד שלכם לא מסוגל לשאת את ה-8B בכלל, או אם מודל 2.5B שעומד בקצב בעבודה אג'נטית ובהקשרים ארוכים יאפשר לכם לחסוך בזיכרון ובחשמל על חומרה שאתם כבר משווקים. ולפני שמתחייבים לטיוטה, הריצו את המדידה ש-OpenBMB לא פרסם: אורך הקבלה אינו חביון, והרווח בטוקנים לשנייה על ההתקן שלכם הוא המספר שבאמת קובע אם הצ'קפוינט הקטן והשקט ב-Hugging Face היה שווה את ההורדה.