
MiniCPM5-2B-DSpark מול Qwen3-8B: סטאק ה-2.5B החדש להרצה על‑גבי המכשיר, ומולו סוס העבודה בעל המשקולות הפתוחות
- OrcaחדשOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 לכל 1M טוקנים
- orcaחדשOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים
- deepseekחדשDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- openaiOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- googleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- anthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0540אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0345אינטליגנציה76כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
כל השוואת מודלים מחביאה בתוכה שאלת חומרה, וההשוואה בין MiniCPM5-2B-DSpark ל-Qwen3-8B היא אותה שאלה מחופשת לבנצ'מרק. Qwen3-8B הוא סוס העבודה בעל המשקלים הפתוחים של אליבאבא מאפריל 2025 — כ-8.2 מיליארד פרמטרים צפופים, 119 שפות, חלון הקשר מקורי של 32K הניתן להרחבה ל-131K, מצבי חשיבה היברידיים, ושישה-עשר חודשים של עדויות מהקהילה מאחוריו. MiniCPM5-2B-DSpark אינו מודל עצמאי שאפשר להניח לצידו: הוא נקודת הבידוק (checkpoint) של דראפט DSpark, בעלת 323.8 מיליון פרמטרים, ש-OpenBMB פרסמה בשקט ב-Hugging Face ב-6 בספטמבר 2026 כדי להאיץ את MiniCPM5-2B, המודל הצפוף להרצה על-גבי המכשיר בעל 2.52 מיליארד הפרמטרים ש-ModelBest הכריזה עליו ב-WAIC ב-19 ביולי 2026. חברו את השניים יחד והשאלה האמיתית עולה: האם עומס העבודה שרץ כיום על 8B צריך לרוץ על חומרה שיכולה לשאת רק 2B — והאם מודל 2.5B עם דראפט חינמי טוב מספיק כדי לבצע את המעבר?
התשובה הקצרה היא שעדיין לא עבור רוב העומסים, אבל הסיבות צרות יותר ממה שפער הגדלים מרמז, ויש סוג אחד של פריסה שבו ל-8B אין תשובה כלל. כל מה שכמותי במאמר זה הוא דיווח של הספק — המספרים של MiniCPM הם של ModelBest עצמה, ללא אימות חוזר; אלה של Qwen3-8B הם של Alibaba, שהיו חשופים לשימוש קהילתי מזה זמן רב — כך שהתוויות חשובות יותר מהספרות.
שני מודלים במקומות שונים על עקומת הזיכרון.
MiniCPM5-2B הוא טרנספורמר סיבתי צפוף בגודל שליש מ-8B — 42 שכבות, מנגנון קשב מקובץ-שאילתות (GQA), Apache-2.0 — שנבנה עבור מחלקת המכשירים שמודל גדול אינו יכול להגיע אליהם: טלפונים, תאי טייס חכמים ותיבות קצה קטנות שבהן אפיק הזיכרון ייחנק משמונה מיליארד משקולות. חומרי ההשקה שלו שמים את הדגש על עבודה סוכנותית והקשר ארוך ולא על רוחב גולמי: 128K הקשר טבעי, וטענת ModelBest שבסביבת ההערכה שלה המודל משיג ממוצע של 53.9 — SOTA בקוד פתוח במחלקת ה-2B, לפי הספק, כולל 46.4 שנמדדה על ידי הספק ב-SWE-bench Verified, תוצאה שתהיה יוצאת דופן עבור מודל 2B אם היא תשרוד בדיקות עצמאיות. מודל הטיוטה DSpark הוא תשובת התפוקה להתנגדות המובנת מאליה שמודל צפוף קטן מהיר לטעינה אבל איטי בייצור, משום שכל טוקן סוחב את המשקולות שלו על פני אפיק הזיכרון. הטיוטה מציעה עד שבעה טוקנים בבת אחת שהמטרה תאמת, והמאגר מדווח על קבלה חמדנית של 5.52 טוקנים לכל שלב אימות בממוצע המצרפי — 6.11 בקוד. המספר הזה הוא איכות הטיוטה; ההאצה שלה טרם נמדדה, ואף נתון של טוקנים לשנייה לא פורסם.

כרטיס ה-openbmb/MiniCPM5-2B-DSpark שלמעלה הוא כל המשטח הציבורי של השחרור השקט מ-6 בספטמבר: אביזר שרת המדווח על אורך קליטה, ללא הכרזה וללא האצת זמן-שעון.
Qwen3-8B הוא מאותה משפחה ארכיטקטונית, גדול פי שלושה ומבוגר בששה-עשר חודשים. הוא טרנספורמר סיבתי (causal) צפוף עם קשב מבוסס שאילתות מקובצות, שאומן על קורפוס רב-לשוני בן 36 טריליון טוקנים, ברישיון Apache-2.0, ואחד מדגמי ה-8B בעלי האירוח וההרצה העצמית הנפוצים ביותר בעולם המודלים במשקולות פתוחות. חותמת ההיכר שלו היא מצב החשיבה ההיברידי של Qwen3 — חשיבה דולקת או כבויה לכל בקשה — והפרופיל שלו רחב במכוון: MMLU בשנות ה-70 הגבוהות, תוצאות חזקות ב-GSM8K ובקידוד, ו-119 שפות. הוא זקוק ל-GPU אמיתי או למכשיר קצה חזק: בקוונטיזציה מעשית הוא רץ בג'יגה-בייטים בודדים, בנוחות על כרטיס בינוני אחד, אבל לא על טלפון.

כרטיס המודל של Alibaba עבור Qwen3-8B שלמעלה הוא פניו של המכהן: שישה עשר חודשים של התנהגות מתועדת, שנבחנה על ידי הקהילה, ב-119 שפות.
איפה שה-8B עדיין מנצח
כשיורדים מחלקת משקל אחת, מוותרים על שלושה דברים קונקרטיים. ראשית, שפות: Qwen3-8B מכסה 119 שפות; כרטיס המודל ומערכי הנתונים של MiniCPM5-2B ממוקדים באנגלית ובסינית, ולא נטען רוחב רב-לשוני כלשהו. עבור מוצר שמשרת זנב ארוך של שפות, זהו קיר קשיח, לא רך. שנית, ראיות: המספרים של Qwen3-8B נבדקו, קיבלו קוונטיזציה, עברו כוונון עדין והוגשו בקנה מידה במשך שישה עשר חודשים; מצבי הכשל שלו ידועים, הגרסאות המכוונטות שלו קיימות, והאקוסיסטם שלו פרוש בכל מקום. MiniCPM5-2B הוא גרסה מיולי 2026 עם לוח תוצאות המנוהל בידי הספק וללא שחזור בלתי-תלוי, והטיוטה בת יום אחד. שלישית, סטאק ההגשה: כל מה שכבר מדבר עם Qwen3-8B — vLLM, SGLang, llama.cpp, אלף מודלים מכווננים — מדבר עם יעד בוגר, בעוד שטיוטת ה-MiniCPM דורשת בנייה של מנוע פענוח ספקולטיבי (אלגוריתם DSPARK של SGLang) שהמאגר מתעד אבל האקוסיסטם הרחב עדיין לא אימץ.
כאשר מחסנית ה-2B היא האפשרות היחידה
כל זה לא משנה בסוג המכשירים שבו 8B פשוט לא נכנס. בטלפון או בלוח מחשוב קצה עם כמה ג'יגה-בייט של DRAM, Qwen3-8B לא מתחרה ב-MiniCPM5-2B — הוא בכלל לא ניתן לפריסה במהירות שימושית. זו כל הסיבה ששכבת ה-2B קיימת, וזו הסיבה שהטיוטה היא החלק נושא העומס של המהדורה הזאת, ולא קישוט. פענוח ספקולטיבי הוא היעיל ביותר דווקא במשטר הצפוף ותלוי-הזיכרון שבו חי מודל קטן על סיליקון קטן: מודל טיוטה קומפקטי מציע בלוק, מודל המטרה מאמת אותו במעבר אחד, ועלות טעינת המשקולות משולמת פעם אחת לכל בלוק במקום פעם אחת לכל טוקן. שיטת DSpark שמקורה ב-DeepSeek (arXiv 2607.05147) תוכננה למערכות הגשה בעלות קונקורנטיות גבוהה, אבל המכניקה שלה — ונתוני הקבלה במאגר הזה — הם המנוף הרלוונטי עבור דגם 2B שחייב להרגיש אינטראקטיבי על חומרה מוגבלת. רק אל תאבדו מהעין את ההסתייגות הכנה: הצוות של OpenBMB מדד את שיעור הקבלה של הטיוטה, לא את ההאצה שהיא מספקת, כך שהרווח בפועל בטוקנים לשנייה במכשיר היעד שלכם הוא עדיין משהו שעליכם למדוד בעצמכם.
לוח התוצאות, מסומן בכנות
• שחרור — MiniCPM5-2B: 19 ביולי 2026 (הוכרז); MiniCPM5-2B-DSpark: 6 בספטמבר 2026, בשקט. Qwen3-8B: אפריל 2025, הוכרז.
• גודל — MiniCPM5-2B: 2.52B פרמטרים צפופים, ועוד דראפט של 324M. Qwen3-8B: ~8.2B פרמטרים צפופים.
• הקשר — MiniCPM5-2B: 128K מקורי. Qwen3-8B: 32K מקורי, 131K באמצעות YaRN.
• שפות — MiniCPM5-2B: ממוקד אנגלית/סינית. Qwen3-8B: 119.
• חשיבה — MiniCPM5-2B: מצבי מהיר/מעמיק היברידיים לפי חומרי ההשקה. Qwen3-8B: חשיבה פעילה או כבויה לפי בקשה.
• ראיות — הנתונים של MiniCPM הם טענות מכרטיס המודל של ModelBest (ממוצע 53.9 בסוויטה שלהם; ללא ריצה עצמאית). נתוני Qwen3-8B דווחו על ידי Alibaba, והם חשופים לקהילה מזה שישה עשר חודשים.

לוח התוצאות שלמעלה הוא אי-ההתאמה שמוצגת בכנות: העמודות שונות כמעט בכל דבר, פרט לרישיון ה־Apache-2.0 הפתוח, ומחלקת המכשיר שאליה אתה שולח קובעת איזו עמודה אתה בכלל רשאי לבחור.
מציאות הניתוב
אף אחד מהמודלים אינו יושב בקטלוג מתארח על OrcaRouter כיום, ולכן ההשוואה כולה מתרחשת בעולם האירוח העצמי — אבל דווקא שם שכבת ניתוב עדיין מצדיקה את קיומה. Qwen3-8B מוגש על ידי הספק שלו ועל ידי כמה פלטפורמות של צד שלישי; MiniCPM5-2B ומודל הדראפט שלו הם מודלים שאתה מריץ בעצמך. כשצוות רוצה לבדוק אם מחסנית 2.5B יכולה לשאת חלק מעומס עבודה של 8B, המהלך ההפיך הוא לכוון נתיב בדיקה אל build עצמי של SGLang שמשלב MiniCPM5-2B עם דראפט, דרך API אחד עם failover אוטומטי — הייצור נשאר על המערכת הקיימת, המחסנית החדשה יכולה להיתקע בלי להפיל שום דבר, ומחירי המחירון של הספקים לאורך כל ההשוואה מועברים ב-0% תוספת, כך שמבחן ה-A/B הוא זול והפיך, לא הימור. השכבה אינה מארחת אף אחד מהמודלים; היא רק הופכת את הניסוי לבטוח.
מי צריך לזוז, ומי צריך לחכות
הישארו על Qwen3-8B לכל מה שדורש רב־לשוניות, לכל מה שצריך שישה־עשר חודשים של התנהגות מוכרת, או לכל עומס עבודה שכבר מטופל על ידי חומרה שנושאת 8B בנוחות — פער הגודל אינו סיבה לנדוד, ופער הראיות פועל נגדו. בחנו לעומק את הסטאק של MiniCPM5-2B עם מודל הטיוטה DSpark שלו רק אם התקן היעד שלכם לא מסוגל לשאת את ה-8B בכלל, או אם מודל 2.5B שעומד בקצב בעבודה אג'נטית ובהקשרים ארוכים יאפשר לכם לחסוך בזיכרון ובחשמל על חומרה שאתם כבר משווקים. ולפני שמתחייבים לטיוטה, הריצו את המדידה ש-OpenBMB לא פרסם: אורך הקבלה אינו חביון, והרווח בטוקנים לשנייה על ההתקן שלכם הוא המספר שבאמת קובע אם הצ'קפוינט הקטן והשקט ב-Hugging Face היה שווה את ההורדה.
