
משקלי MiniCPM5-2B שוחררו: המודל הקטן שתפס את כתר ה-Sub-4B הופך לקוד פתוח
- openaiחדשOpenAI: GPT-6 Astra2026-09-0455אינטליגנציה77כתיבת קוד
- googleחדשGoogle: Gemini 3.8 Flash2026-09-0247אינטליגנציה76כתיבת קוד
- qwenחדשQwen: Qwen3.8 Max (0902)2026-09-0247אינטליגנציה72כתיבת קוד
- anthropicחדשAnthropic: Claude Fable 5.12026-09-0157אינטליגנציה82כתיבת קוד
- AlibabaחדשQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים
- z-aiחדשZ.ai: GLM 5.3 Flash2026-08-2646אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.32026-08-1849אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1541אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1242אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1251אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0547אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0347אינטליגנציה72כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3141אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2454אינטליגנציה78כתיבת קוד
- googleGoogle: Gemini 3.6 Flash2026-07-2140אינטליגנציה69כתיבת קוד
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2128אינטליגנציה49כתיבת קוד
המודל עצמו בן שבעה שבועות בלבד. MiniCPM5-2B נחשף בוועידת הבינה המלאכותית העולמית 2026 ב-19 ביולי, שם ModelBest ו-OpenBMB כינו אותו המודל המדורג ראשון מבין הדגמים מתחת ל-4B פרמטרים בלוח התוצאות של Artificial Analysis, והבטיחו כי משקלי המודל יגיעו "בעתיד הקרוב". מה שקרה בסוף השבוע הזה הוא שהעתיד הקרוב הגיע ללא כל חגיגות השקה: המאגר של MiniCPM5-2B עלה לאוויר ב-Hugging Face ב-6 בספטמבר, ויומן העדכונים של OpenBMB מציין את פרסום הגרסה ב-7 בספטמבר, תחת רישיון Apache-2.0, עם החבילה המלאה — משקלי BF16, GGUF, קוונטיזציות MLX ו-GPTQ, נקודות ביקורת בסיסיות ו-SFT, מודל טיוטה DSpark לפענוח ספקולטיבי, ומערכי האימון שעומדים מאחוריהם.
לא נלווה אליו הודעה לעיתונות ולא נערך אירוע השקה. הוא פשוט הופיע: מאגר Hugging Face ביום אחד, שורת changelog ביום שלאחר מכן. זה הופך את הטקסט הזה לסקירת "מה שאנחנו יודעים עד כה" — עם עדכון מוקדם אחד. המאגר מספר לנו רבות: המודל אכן ניתן להורדה ולהרצה כבר היום, וגיליון המפרט פומבי. וכבר הגיע ניקוד חיצוני: Artificial Analysis מציג את MiniCPM5-2B במדד האינטליגנציה שלו v4.2 עם ציון 15, התוצאה הגבוהה ביותר במשקלים פתוחים מתחת ל-4B פרמטרים בסך הכול במדד זה, כך שהדירוג מתחת ל-4B כבר אינו נשען על דברי הספק בלבד. מה שעדיין לא אומת הוא נתוני הכותרת של כרטיס המודל, ש-OpenBMB שחזרה במערך הבדיקות שלה ואיש מחוץ למעבדה לא הריץ שוב. הנה מה שניתן לדעת מהמאגר, מה שנמדד כעת באופן בלתי תלוי, ומה עדיין מצריך אימות לפני שתבנו עליו.
מה בדיוק קרה?
MiniCPM5-2B הוא הדגם השני בסדרת MiniCPM5, אחרי MiniCPM5-1B, ש-OpenBMB שחררה כקוד פתוח ב-19 במאי. כאשר ה-2B הושק כמוצר ב-WAIC, הסיפור היה סיפור על שבבים לא פחות מאשר סיפור על מודל. ModelBest הציגה אותו כבסיס לסוכן על-גבי המכשיר עבור טלפונים, מחשבים אישיים וקוקפיטים חכמים, וציינה תשעה שבבים עם תמיכה מיום ההשקה באמצעות קהילת FlagOS שלה, מ-Huawei Ascend ועד NVIDIA ועד למגוון מאיצים מקומיים. שחרור הקוד הפתוח הוצג כקרב ובא. חלפו שבעה שבועות.
ב-6 בספטמבר הופיע מאגר openbmb/MiniCPM5-2B. נכון למועד כתיבת שורות אלו, כרטיס המודל הוא הכרזת השחרור, והוא שלם במידה יוצאת דופן עבור שחרור שקט:
• משקלים — נקודת הביקורת הסופית שאומנה עם RL + OPD בפורמט BF16, ברישיון Apache-2.0, וללא הגבלת גישה — כל אחד יכול להוריד אותה.
• נקודות ביקורת נלוות — MiniCPM5-2B-SFT, -Midtrain ו--Base למי שרוצה את המודל לפני RL/OPD, ובנוסף -GGUF, -MLX, -GPTQ ומודל דראפט -DSpark, כולן מופיעות באוסף MiniCPM5 שבאתר Hugging Face.
• נתונים — קורפוסי האימון פתוחים גם הם, ושוחררו כחלק ממשפחת UltraData: Ultra-FineWeb, UltraX, UltraData-Code, UltraData-Math, UltraData-SFT-Agent-2609 ו-UltraData-RL-2609.
מראות — קובץ ה-README מפנה גם ל-Hugging Face וגם ל-ModelScope.
השורה האחת בכרטיס חשובה יותר ממה שהיא נראית: "אין קרנלים מותאמים אישית, אין פיצול קוד מודל." MiniCPM5-2B משתמש בארכיטקטורת LlamaForCausalLM הסטנדרטית, ולכן כל מנוע שכבר משרת מודלים ממשפחת Llama יכול לטעון אותו מבלי להמתין למימוש ייעודי.
למה מודל 2.5B ראוי למבט שני
המצגת ב-WAIC הייתה מצגת דירוגים. ModelBest הצהירה ש-MiniCPM5-2B קיבל ציון 17 במדד Artificial Analysis Intelligence Index, מה שממקם אותו במקום הראשון מבין המודלים עם פחות מ-4B פרמטרים בלוח הדירוגים של AA בעת ההשקה. שני סייגים צריכים להתלוות למספר הזה. ראשית, ציוני מדד ניתנים להשוואה רק בתוך גרסת מתודולוגיה אחת: הציון הקודם 17.9 של MiniCPM5-1B הגיע מתמונת מצב קודמת של AA, ולכן הוא אינו ראיה לכך שהמודל הקטן יותר "משיג ציון גבוה יותר", ובאותה מידה ציון חדש יותר במתודולוגיה חדשה יותר אינו נסיגה. שנית, הנתונים של AA מזינים את כרטיס המודל, אך ממוצע הכותרת של הכרטיס הוא של OpenBMB עצמה, ומופק במערכת הבדיקות של OpenBMB עצמה. ההבחנה הזו חשובה כי מאז, AA עברה למתודולוגיה חדשה יותר ופרסמה ציון עדכני — הבדיקה החיצונית הראשונה של הטענה מאז פרסום המשקולות הפתוחות.
מספר חיצוני הגיע באותו שבוע שבו הגיעו המשקולות. ב-4 בספטמבר שילחה Artificial Intelligence את Intelligence Index v4.2, עדכון מתודולוגיה שמעלה את המשקל של מבחנים פרטיים חסויים ל-40% ומוסיף שני רכיבים חדשים — AA-Briefcase, הערכה אייג’נטית, ו-GDP.pdf של Surge, משימת חשיבה על מסמך ארוך-הקשר. ערך המדד של AA עבור MiniCPM5-2B נושא כעת ציון v4.2 של 15: התוצאה הגבוהה ביותר מבין דגמים עם משקולות פתוחות מתחת ל-4B פרמטרים בסך הכול, והראשון מבין 47 הדגמים הפתוחים בקטגוריית גודל זו ברשימה של AA. זה שומר את המודל במקום שבו המיצוב של יולי הבטיח אותו, הפעם על מתודולוגיה שקשה יותר לשחק איתה ועם משקולות שכל אחד יכול להוריד ולבדוק שוב. הציון 15 אינו דומה ל-17 של עידן ההשקה, שהגיע מ-v4.1 — המתודולוגיה מחמירה יותר, לא שהמודל חלש יותר — והמדד המשולב אינו מאמת מחדש את השורות הבודדות בגיליון הנתונים, את רובן OpenBMB שחזרה בסביבת הבדיקה שלה. מה שהוא עושה הוא לרדת בדיוק על שני הצירים ש-OpenBMB אומרת שהיא מטיבה עבורם: v4.2 נשען חזק יותר על משימות אייג’נטיות, ומעקב המלל של AA מראה ש-MiniCPM5-2B מייצר 57M טוקני פלט במשימות המדד, המודל התמציתי ביותר בקטגוריה שלו לעומת חציון של 72M. OpenBMB הודתה ל-AA על ההרצה והציגה אותה בדיוק במונחים אלה — ביצועים אייג’נטיים ויעילות טוקנים ב-2.6B, כך אמרה, הם מה שהמודל עבר אופטימיזציה עבורו.
הטענה המהותית הייתה יכולת סוכנית בחבילה קטנה: קריאת כלים מובנית, חיפוש עמוק ויצירת קוד, שאומנו מהיסוד ולא חוברו כהדבקה חיצונית. הכרטיס מתאר צנרת תלת-שלבית — אימון בסיס, אימון ביניים, ולאחר מכן אימון עוקב של SFT על {{1}}400B{{/1}} טוקנים של נתוני חשיבה עמוקה, מורים מיוחדים ל-RL, וזיקוק מדיניות-על (OPD) הממזג ששה-עשר מודלי מומחה של RL, חמישה מהם סוכניים, בחזרה לתוך רשת צפופה קטנה אחת. OpenBMB מייחסת לשלב ה-RL + OPD רווח ממוצע של {{2}}10.96{{/2}} נקודות במשימות חשיבה ומשימות כלליות ו-{{3}}6.96{{/3}} נקודות במשימות סוכניות — דלתות פנימיות, אך הן מסבירות את הצורה החריגה של מודל זה: רשת של {{4}}2.5B{{/4}} פרמטרים הבנויה כמו מודל חשיבה ומכוונת לשימוש בכלים.

מה הריפו מכיל בפועל
גיליון המפרט אינו משאיר מקום לספק, משום שהוא קובץ התצורה עצמו. ל-MiniCPM5-2B יש 2,516,756,480 פרמטרים, מתוכם 1,981,982,720 הם פרמטרים שאינם של שכבת ההטבעה — וספקים סופרים את הנתון של הפרמטרים שאינם שכבת הטבעה כשהם אומרים "מחלקת 2B." זהו טרנספורמר צפוף עם 42 שכבות בגודל חבוי של 2048, קשב מקובץ-שאילתות עם 16 ראשי שאילתות ו-2 ראשי מפתח/ערך בלבד, אוצר מילים בן 130,560, וטנזורים בפורמט BF16. כל העניין נשלח כקובץ safetensors יחיד, קטן דיו כדי להוריד אותו בחיבור מחשב נייד ולהריץ אותו על GPU בינוני בודד או על NPU ברמה של טלפון.
• פרמטרים — 2,516,756,480 בסך הכול; 1,981,982,720 שאינם embedding.
• {{1}}ארכיטקטורה{{/1}} — {{2}}LlamaForCausalLM צפוף{{/2}}, {{3}}42 שכבות{{/3}}, {{4}}ממד חבוי 2048{{/4}}, {{5}}GQA 16 ראשי שאילתה / 2 ראשי KV{{/5}}, {{6}}אוצר מילים 130,560{{/6}}.
• הקשר — 131,072 טוקנים מוגדרים (max_position_embeddings), ללא קנה מידה של RoPE בתצורה (config).
• רישיון — Apache-2.0, הן עבור המודל והן עבור נתוני האימון שפורסמו.
• פורמט — BF16; מלווי GGUF, MLX ו-GPTQ פורסמו בנפרד.

מספר אחד מהמצגת של יולי אינו מופיע בנקודת הבידוק. חומרי WAIC שיווקו חלון הקשר של 512K טוקנים; התצורה שפורסמה מגדירה את max_position_embeddings ל־131,072 (128K) ללא רשומת rope_scaling. ייתכן שהנתון 512K נועד להיות מושג באמצעות הרחבה בזמן הסקה, בדרך שבה כמה מודלים קטנים מותחים את חלון ההקשר שלהם — אך כפי שנשלח, המאגר מתעד 131,072, וזה המספר שצריך לתכנן לפיו עד ש־OpenBMB תפרסם מתכון הרחבה.
המספרים, ממוינים לפי מי שמדד אותם
כרטיס המודל מקפיד על מקורות הנתונים, וכדאי לקרוא את הערות השוליים. הציונים שהוא מסמן בסימן פגיון (†) "מגיעים מהמהדורה הרשמית של Artificial Analysis" — שורות כגון GPQA-Diamond 70.2, HLE 8.9, AA-LCR 59.0, Terminal-Bench v2.1 8.6 ו-GDPval-AA v2 19.6. כל השאר מתואר כ"שוחזר פנימית", כלומר OpenBMB הריצה את ההערכות הללו במערך הבדיקות שלה. בקטגוריה זו נכללים המספרים שמושכים את העין: ממוצע פנימי של 53.9 על פני קבוצת ההשוואה של הכרטיס, AIME 2025/2026 עם 86.5, MATH-500 עם 94.6, LiveCodeBench v6 עם 69.1, SWE-bench Verified עם 46.4, BFCL v4 עם 66.6, τ²-Bench Telecom עם 97.1, GAIA (Text-103) עם 88.7 ו-MMLU-Pro עם 70.8.
שלושה דברים שומרים על אמינותם של המספרים האלה. הממוצע 53.9 הוא ציון יחסי, לא מוחלט — הכרטיס מנרמל כל ציר מכ"ם כך שהמודל הטוב ביותר בהשוואה מקבל 100. קבוצת ההשוואה נבחרה על-ידי הספק: מודלים פתוחים נוספים בטווח 2B-4B, כולל Qwen3.5-2B, Qwen3.5-4B, Gemma-4-E2B-it, granite-4.2-3B, LFM2.5-2.6B ו-LFM2.5-8B-A1B. בתוך קבוצה זו הכרטיס מראה את MiniCPM5-2B עוקף את המודל הבא אחריו, Qwen3.5-4B עם 51.1 — תוצאה מפתיעה במיוחד עבור מודל בגודל חצי, ובדיוק סוג התוצאה שדורש שכפול בלתי תלוי לפני שבונים עליה. וכמה מהשורות הבודדות קשות ליישוב עם השיווק: ציון SWE-bench Verified של 46.4 ממודל צפוף של 2.5B יהיה מדהים אם הוא אכן משתכפל, ואילו HLE של 8.9 הוא תזכורת לכך ש"מוביל מתחת ל-4B" ו"חזיתי" הם ליגות שונות. אף אחד מאלה אינו סותר את המאגר, והציון המשולב v4.2 של AA אישר מאז את מיקומו הכולל של המודל בראש קטגוריית המשקולות הפתוחות מתחת ל-4B — אבל השורות הספציפיות האלה הן של OpenBMB עצמה, וטרם אומתו בידי גורם מחוץ למעבדה.
מריץ את MiniCPM5-2B היום
בגלל שהארכיטקטורה היא Llama פשוטה, מנועים מרכזיים טוענים אותה ישירות. ה-README של OpenBMB מספק מדריכי התחלה מהירה עבור vLLM (0.21 ואילך), SGLang (0.5.16 ואילך) ו-Transformers (5.6 ואילך), עם דגימת sampling מומלצת בטמפרטורה של 1.0 ו-top-p של 0.95, ו-enable_thinking מופעל כשאתם רוצים את מעבר החשיבה. הגרסאות הנלוות של GGUF ו-MLX מכסות את llama.cpp, Ollama, LM Studio ו-Apple Silicon; הכרטיס גם מציג את סביבת ההרצה של ArcLight ואת ערימות ה-fine-tuning הרגילות (TRL + PEFT, LLaMA-Factory, ms-swift, unsloth).
יש שני פרטי פריסה שכדאי לדעת לפני שמתחילים. כשמדובר ב-tool calling ו-function calling, SGLang הוא ה-backend המומלץ: המודל פולט קריאות לכלים בסגנון XML, והמפרש המובנה minicpm5 של SGLang ממיר אותן ישירות ל-tool_calls תואמי OpenAI — כלומר, לקוחות סטנדרטיים ל-tool calling עובדים בלי shim מותאם אישית. ומודל הטיוטה DSpark נועד להוזיל את שלב החשיבה: כשהוא מופעל ב-SGLang עם אלגוריתם הפענוח הספקולטיבי DSPARK, הוא מאיץ את הפענוח תוך השארת פלטי מודל היעד ללא שינוי — וזה מסוג הדברים שמכריעים אם לולאת סוכן עם חלון הקשר של 128K על לפטופ היא שמישה או רק אפשרית.

אם אתה מעדיף להעריך קבוצת מודלים פתוחים קטנים במקום לכוונן אחד ידנית, שכבת הניתוב מוכיחה את עצמה כאן: כשספק מציג את MiniCPM5-2B, ראוטר הוא הדרך הזולה לבצע A/B בינו לבין Qwen3.5-2B ושאר הצ'קפוינטים הפתוחים מתחת ל-4B על אותה משימה, בלי אינטגרציה נוספת. ב-OrcaRouter זה אומר API אחד ל-200+ מודלים, מחירי הרשימה של הספקים מועברים עם 0% markup, ו-failover אוטומטי אם צ'קפוינט חדש לגמרי נתקע או נכנס ללולאה בנתיב ייצור. הריפו בקושי בן יומיים, ועדיין אין API מתארח שאנחנו יכולים להפנות אליו שמפרט את MiniCPM5-2B — אז ברירת המחדל הכנה היום היא להתייחס אליו כאל ניסוי אירוח עצמי (self-host), לא כתלות.
מי צריך למשוך את המשקולות האלה?
הורידו אותם היום אם העבודה שלכם היא על סוכנים על-המכשיר, קריאת כלים בקצה, או ניסויי קידוד וחשיבה עם מודלים קטנים, ואתם רוצים את האפשרות בקטגוריית ה-2B שאומנה בצורה האגרסיבית ביותר על הפרק. רישיון ה-Apache-2.0 ונתוני האימון הפתוחים מסירים את שתי הסיבות שרוב הצוותים מהססים לגבי מודל קטן ממעבדה סינית — ללא הגבלת שימוש מסחרי, וללא קורפוס בלתי-שקוף. הורידו אותם בזהירות אם אתם בוחרים מודל לייצור על סמך טבלת אמות-המידה בלבד: שורות הכותרת בכרטיס הן שכפולים של OpenBMB עצמה, והציון המורכב של AA בגרסת v4.2 — המדידה החיצונית היחידה עד כה — אינו מאשר אותן. מודל 2.5B שלפי הדיווחים עולה על Qwen3.5-4B הוא טענה שראויה לשעתיים שנדרשות כדי לשחזר את SWE-bench בעצמכם.
למה לשים לב בהמשך. מאגר הקוד הוא בן יומיים בקושי, כך שהאותות לטווח הקרוב הם עדיין מכניים: האם llama.cpp וספריית Ollama יאמצו את ה‑GGUF, האם מראת ModelScope ובניות השבבים של FlagOS יעלו לאוויר בצורה חלקה, והאם API מתארח יציע את MiniCPM5‑2B — זה הרגע שבו הוא מפסיק להיות דגם להרצה עצמית בלבד. האות המהותי שהכתבה הזו סימנה כחסר — ריצה עצמאית של Artificial Analysis או מעבדה אוניברסיטאית — התממש עכשיו בדמות ציון מדד v4.2, והוא משאיר את MiniCPM5‑2B בראש רשימת הדגמים בעלי המשקלים הפתוחים מתחת ל‑4B. מה שעדיין חסר הוא אימות ברמת השורות: אף אחד מחוץ ל‑OpenBMB לא שחזר את המספרים הפנימיים של כרטיס המודל, ובראשם ציון SWE‑bench Verified שעומד על 46.4 והממוצע הפנימי 53.9. עד שיריצו את השורות הספציפיות האלה מחדש, התייחסו אל MiniCPM5‑2B כמו שהייתם מתייחסים לכל דגם ששוחרר בשקט עם כרטיס מרשים: כהשערה מבטיחה ביותר שאפשר להריץ מקומית כבר הערב, וכדגם שהמספרים הבולטים שלו כדאי לאמת לפני שמפקידים בידיו עבודה אמיתית.
