
MiniCPM5-2B-DSpark: OpenBMB חושפת בשקט את משקלי MiniCPM5-2B עם מודל טיוטה שנבנה למהירות
- deepseekחדשDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- openaiחדשOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- googleחדשGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- qwenחדשQwen: Qwen3.8 Max (0902)2026-09-0240אינטליגנציה72כתיבת קוד
- anthropicחדשAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0540אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0340אינטליגנציה72כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451אינטליגנציה78כתיבת קוד
- googleGoogle: Gemini 3.6 Flash2026-07-2134אינטליגנציה69כתיבת קוד
לפני שישה שבועות MiniCPM5-2B היה הבטחה. הוא נחשף בכנס WAIC בשנחאי ב-2026-07-19 כמודל עם פחות מ-4B פרמטרים שיושב בראש מדד ה-Artificial Analysis, והגיע עם הערה במפת הדרכים שמשקולות פתוחות יגיעו "בקרוב". "בקרוב" הגיע השבוע, בלי שום התרוממות רוח. ב-2026-09-06 OpenBMB דחפה את מאגר הדגל MiniCPM5-2B ל-Hugging Face תחת רישיון Apache-2.0, ועשרים ואחת דקות לאחר מכן דחפה את MiniCPM5-2B-DSpark — checkpoint מוקדם (draft) בעל 323.8 מיליון פרמטרים שתפקידו היחיד הוא לגרום ל-MiniCPM5-2B לפענח מהר יותר תחת אלגוריתם ה-speculative decoding של DSpark. build מסוג GPTQ הגיע אחריו ב-2026-09-07. נכון לכתיבת שורות אלה, לא מצאנו שום הכרזה, פוסט השקה או רשומת changelog; השחרור צץ כשמאגרים הפכו לציבוריים בשקט במשך חלון של אחד עשר ימים.
זוהי כתבה שמרכזת את מה שידוע עד כה, והמסגור חשוב. MiniCPM5-2B-DSpark אינו צ'אטבוט עצמאי ואינו מודל דגל חדש — הוא מאיץ: מודל קטן ומהיר שמציע טוקנים לפני MiniCPM5-2B, שמאמת אותם במקביל. ללא היעד שלו הוא חסר תועלת, והיעד הוא הסיבה שיש לשים לב אליו. שחרור המשקלים הפתוחים של MiniCPM5-2B, ש-OpenBMB הבטיחה ביולי, נמצא עכשיו בפועל ב-Hugging Face, ומודל הטיוטה ששוחרר יחד איתו הוא המנגנון שהיצרן ממליץ עליו כדי להריץ את מודל היעד במהירות שימושית. כל מה שלא מיוחס במפורש בהמשך נקרא ישירות משני כרטיסי המודלים ומהמאגרים שלהם.
מה שוחרר, ומתי
משפחת 2B נחשפה לציבור כהשקה מתגלגלת ללא הודעה מוקדמת, כשהפריטים החדשים ביותר מופיעים ראשונים:
• 2026-08-27 — MiniCPM5-2B-Base ו-MiniCPM5-2B-SFT מופיעים, נקודות הביקורת הגולמיות של אימון מקדים וכיוונון עדין מפוקח.
• 2026-09-01 — MiniCPM5-2B-Midtrain, שלב אמצע האימון הסוכני.
• 2026-09-05 — MiniCPM5-2B-MLX ו-MiniCPM5-2B-GGUF, הפורמטים של Apple-Silicon ו-llama.cpp.
• 2026-09-06 — מאגר הדגל MiniCPM5-2B, ולאחר מכן MiniCPM5-2B-DSpark כעבור עשרים ואחת דקות.
2026-09-07 — MiniCPM5-2B-GPTQ, פורמט ההגשה הקוונטי.
כולם נושאים את רישיון Apache-2.0 שבו ModelBest השתמשה עבור משפחת MiniCPM5-1B עוד בחודש מאי, והצ'קפוינטים המוקדמים יותר ברצף עדיין מציגים אות קהילתי אפסי למעשה — קומץ הורדות ולייקים לכל אחד. זהו סימן ההיכר של שחרור משקלים שנמצא בתהליך, ולא של השקה מתואמת: הארטיפקטים מופיעים בסדר תלותי (base ו-SFT ראשונים, פורמטים מקוונטטים ו-draft אחרונים), ללא יום יחיד המשמש כתאריך השחרור.
מה זה MiniCPM5-2B-DSpark באמת
פענוח ספקולטיבי מפצל את תהליך יצירת הטקסט למציע זול ולמאמת יקר. מודל טיוטה קטן מנחש את הטוקנים הבאים; המודל הגדול בודק את כל הניחושים במעבר קדימה יחיד ומקבל את אלה שהוא מסכים איתם. כשהטיוטה מכווננת היטב, מקבלים את הפלט של המודל הגדול בשבריר מהעלות; וכשהיא שגויה, מבזבזים רק שלב אימות אחד. DSpark הוא מתכון ספציפי לרעיון זה, מתוך מאמר שפורסם ב-2026-07-06 (arXiv 2607.05147, "פענוח ספקולטיבי עם תזמון ביטחון ויצירה חצי־אוטורגרסיבית"). שתי בחירות עיצוביות מבדילות אותו: הוא מצמיד עמוד שדרה שמנסח במקביל עם מודול רציף קל משקל, כך שהטוקנים בתוך בלוק מוצע תלויים זה בזה במקום שדיוקם ידעך ככל שמתקרבים לסוף הבלוק; והוא מתאים את גודל כל ריצת אימות לבקשה לפי הערכות ביטחון ותפוקת המנוע, במקום לאמת תמיד בלוק באורך קבוע.
טיוטת ה‑DSpark ש‑OpenBMB פרסמה היא טרנספורמר בעל חמש שכבות עם 323.8M פרמטרים ב‑BF16 (כ־648MB). היא משתייכת למשפחת Qwen3, אך כוללת תוספות ייחודיות ל‑DSpark: מקרין (projector) הקורא את המצבים החבויים של MiniCPM5-2B מחמש מהשכבות של מודל המטרה (1, 10, 20, 30 ו־39), ראש ביטחון (confidence head), וראש מרקוב קטן שמנבא את התפלגות הטוקן הבא. התצורה שלה מציעה בלוק של שבעה טוקנים לכל מעבר קדימה. עם כשמינית מ־2.5 מיליארד הפרמטרים של MiniCPM5-2B, מדובר באחד ממודלי הטיוטה הקטנים ביותר ששוחררו עבור checkpoint פתוח מיינסטרימי — וזו בדיוק הנקודה במודל מוכוון קצה (edge-oriented), שבו הטיוטה חייבת להיות זולה מספיק כדי שהרצת שני מודלים על מכשיר אחד עדיין תנצח את הרצת מודל אחד.

המאגר שלעיל הוא כל מה שחושף מודל הטיוטה בפומבי: קובץ README, קובץ תצורה, קובץ safetensors יחיד, וכרטיס מודל שתיאור האימון שלו מציג 1,959,525 רצפים (7.05B טוקנים) שנוצרו על ידי MiniCPM5-2B מפרומפטים כלליים, מתמטיים וקוד, שאומן במשך שישה אפוקים עם מטרה משולבת של cross-entropy, L1 וביטחון. אין שימוש בצ'קפוינט כמודל גנרטיבי בפני עצמו.
המספרים ש-OpenBMB פרסמו, מסומנים בכנות
הכרטיס של מודל הדראפט מדווח על נתון אחד שחשוב — אורך הקבלה, המספר הממוצע של טוקנים מוצעים שהמודל המטרה מקבל מתוך כל בלוק של שבעה טוקנים. ההערכה בוצעה על פלטים של MiniCPM5-2B בשלושה תחומים, עד 4,096 טוקנים שנוצרו:
• Math — 6.05 טוקנים התקבלו בממוצע בגרידי (T=0); 4.61 בדגימה עם T=1.0.
• קוד — 6.11 חמדן; 4.44 מדוגם.
• כללי — 4.16 חמדן; 3.10 בדגימה.
• מצטבר — 5.52 greedy; 4.05 sampled, מתוך מקסימום של שבע.
הנתונים האלה מדווחים על ידי הספק מכרטיס המודל, ולא שוחזרו באופן עצמאי. הם מתארים גם את שיעור הפגיעה של מודל הטיוטה, לא האצת זמן-שעון: מהירות היא מדידה הנעשית במערכת ההגשה, ותלויה בעלותו של מעבר האימות של מודל המטרה לעומת מעבר ההצעה של הטיוטה, בתפוסת האצווה, ובקיצור אורך האימות על ידי מתזמן הביטחון של DSpark. OpenBMB לא פרסמו אף נתון של אסימונים לשנייה עבור צמד המודלים. כדי להבין היכן נמצאת תקרת השיטה, מאמר DSpark מדווח על יצירה מהירה ב-60–85% לכל משתמש בתפוקה זהה, לעומת קו הבסיס MTP-1 במערכת ההגשה החיה של DeepSeek — נקודת ייחוס שימושית למה שהאלגוריתם השיג במקומות אחרים, לא טענה לגבי MiniCPM5-2B על החומרה שלך.

לוח התוצאות שלמעלה הוא גיליון המפרט של המהדורה עצמה. יש לקרוא את נתון הקבלה כשיעור פגיעות של טיוטה; המכפיל על התפוקה בפועל הוא מה שריצת SGLang עצמאית עדיין צריכה למדוד.
המודל שהטיוטה מאיצה
MiniCPM5-2B הוא טרנספורמר צפוף בעל 2.5 מיליארד פרמטרים — 2,516,756,480 בסך הכול — עם 42 שכבות, 16 ראשי שאילתה ו-2 ראשי KV, אוצר מילים של 130,560 טוקנים וחלון הקשר של 131,072 טוקנים, בפורמט BF16 ובנפח של כ-5GB. מבחינה ארכיטקטונית הוא משעמם בכוונה: LlamaForCausalLM סטנדרטי, ללא קרנלים מותאמים אישית וללא פיצול של קוד המודל — וזו בדיוק הסיבה שהוא נייד כל כך בקרב סביבות ריצה ויעדי שבבים רבים. בחבילת הבדיקות הפנימית של OpenBMB, כרטיס המודל מקנה לו ממוצע של 53.9 במשימות של חשיבה, היענות להוראות, ידע, הקשר ארוך, שימוש בכלים, כתיבת קוד ומשימות סוכן-חיפוש — לפני Qwen3.5-4B עם 51.1 ו-granite-4.2-3B עם 42.7 באותה טבלה, כאשר כמה תאים (GPQA-Diamond 70.2, HLE 8.9, ושורות שונות של הקשר ארוך ומשימות סוכנים) מסומנים כמגיעים מ-Artificial Analysis ולא כתוצאות ששוחזרו באופן פנימי. תאי המשימה הבולטים כוללים MATH-500 עם 94.6, AIME 2025 ו-2026 עם 86.5, IFEval עם 86.7, MMLU-Pro עם 70.8, ו-SWE-bench Verified עם 46.4. אלה הם הנתונים של היצרן על חבילת הבדיקות של היצרן, והכרטיס מציין במפורש שחלק מהשורות מגיעות ממקור של צד שלישי; יש להתייחס לשילוב בהתאם.

בחשיפת יולי, חומרי ההשקה של ModelBest ציינו מדד Artificial Analysis של 17 – ראשון בין מודלים מתחת ל-4B פרמטרים – וסיקור מיולי התייחס לחלון של 512K טוקנים. ה-checkpoints שנשלחו בפועל קובעים הקשר של 131,072 טוקנים. במקום שבו נתון שיווקי מיום ההשקה ותצורה שנשלחה בפועל אינם תואמים, התצורה היא המספר שמכתיב מה ניתן להריץ, וכדאי לדעת על הפער לפני שמתכננים עומס עבודה ארוך-הקשר סביב הנתון השיווקי.
הרצת MiniCPM5-2B עם הדראפט שלו
הנתיב המיועד הוא SGLang, אשר תומך באלגוריתם DSpark במעלה הזרם (upstream) מאז v0.5.16 — גרסת המינימום שכרטיס המודל דורש. פקודת ה-serving המלאה מתוך הכרטיס:
python -m sglang.launch_server --model-path openbmb/MiniCPM5-2B --speculative-algorithm DSPARK --speculative-draft-model-path openbmb/MiniCPM5-2B-DSpark --speculative-dspark-block-size 7
תחת פענוח חמדן (T=0), האימות של DSpark הוא ללא אובדן: הפלט זהה להרצת MiniCPM5-2B לבדו, מה שהופך את הטיוטה ליתרון השהיה טהור. כאשר דגימה מופעלת, ברירת המחדל של DSpark ב‑SGLang היא דגימה מהמטרה בלבד, עם אפשרות לדגימת דחייה. OpenBMB גם מתעדת טעינת Transformers פשוטה (transformers ≥ 5.6) והגשת vLLM ≥ 0.21 של המטרה לבדה, בתוספת מנתח קריאות‑כלים של minicpm5 לעומסי עבודה סוכניים; המסלול הספקולטיבי של DSPARK ספציפית הוא של SGLang.
החשבונייה החומרתית היא הסיפור האמיתי עבור זוג ברמת קצה: כ-5GB עבור MiniCPM5-2B בפורמט BF16 בתוספת כ-0.65GB עבור מודל הטיוטה. השילוב של טיוטה פלוס מודל מטרה מתאים בנוחות בכל מקום שבו מודל ה-2B לבדו כבר היה בר-ביצוע, וזו בדיוק הסיבה שבגללה שולחים טיוטה כה קטנה במקום מודל שני וגדול יותר.
מה שלא אושר
• לא נמצאה כל הודעה רשמית שמצאנו — לא בלוג של OpenBMB או ModelBest, לא פוסט במדיה חברתית באנגלית או בסינית. התיאור "הושק בשקט" הוא פשוטו כמשמעו, והמשטח הציבורי היחיד הוא אוסף Hugging Face.
• אין הערכה בלתי תלויה. אורכי הקבלה של הטיוטה וממוצע הסוויטה 53.9 של MiniCPM5-2B הם דיווחי ספק שלא שוחזרו באופן בלתי תלוי; התאים המסומנים AA הם של צד שלישי, אך הם ערכי תמונת מצב, לא הרצות של משקלים מדויקים אלה.
• לא מצאנו API מתארח בשום מקום, כך שאימוץ הטכנולוגיה היום משמעותו הרצת נקודות הביקורת בעצמך. מראת ModelScope, שהובטחה בסיקור החשיפה ביולי, לא הייתה גלויה נכון למועד כתיבת שורות אלה.
• אין נתון האצה לפי שעון־קיר עבור צמד DSPARK. אורך הקבלה של 5.52 הוא אחוז פגיעה גבוה, אבל "כמה פעמים יותר מהיר" על GPU נתון הוא בדיוק המספר ש־OpenBMB לא פרסמה.
• העמימות שלעיל בנושא חלון ההקשר: חומרי השיווק ציינו 512K, התצורה שסופקה מציינת 131,072, ואין שום דבר במאגרי הקוד שמגשר בין השניים.
היכן שחרור שקט של מודל open-weight משתלב בערימה הטכנולוגית
הקריאה הכנה של MiniCPM5-2B כיום היא שמדובר בהימור: מספרים חזקים מצד הספק, אפס ריצות עצמאיות, אין היסטוריית סרווינג, ומודל טיוטה שההאצה שלו בעולם האמיתי לא נמדדה. זו בדיוק הסיטואציה שלשמה קיימת שכבת ניתוב. צוות שרוצה לבדוק אם הפלט של מודל פתוח קטן יכול להחליף מודל מתארח שהוא כבר קורא לו, יכול להריץ את ההשוואה הזו דרך API אחד — OrcaRouter חושף 200+ מודלים מתארחים במחיר המחירון של הספק, ללא תוספת מחיר, כך שהקמת שבוע הערכה לא עולה כלום, ו-failover אוטומטי פירושו שצ'קפוינט בן ימים ספורים לעולם לא צריך להחזיק נתיב ייצור כבן ערובה בזמן שהוא מוכיח את עצמו. שום דבר מזה לא דורש ש-MiniCPM5-2B יתארח איפשהו; OrcaRouter מהווה את רשת הביטחון סביב המודלים שכבר תלויים בהם, בזמן שאתם מחליטים אם 2B באירוח עצמי שווה את ה-GPU.
שימו לב, לפי סדר חשיבות: הרצה עצמאית של SGLang DSPARK שתדווח על קצב אסימונים אמיתי לשנייה עבור הצמד, שכן אורך הקבלה הוא מדד חלופי בלבד, לא מדד ביצועים אמיתי; הודעה רשמית או מראת ModelScope שתאשר שהשחרור סופי; וספק אירוח שיאמץ את MiniCPM5-2B — אם אכן יהיה כזה, המחיר שתשלמו דרכנו הוא מחיר המחירון של הספק, באותו היום, כי זו המשמעות של pass-through. בינתיים, מודל הטיוטה הוא התוצר המעניין יותר מבין השניים. מודל מציע בעל חמש שכבות, שמודל המטרה מקבל ממנו חמישה וחצי אסימונים מתוך שבעה — זה ההבדל בין מודל קצה קטן שמרגיש קטן, לבין מודל שמרגיש כמו מודל גדול יותר שרץ על אותו מכשיר.
