"כרטיס כותרת ראשי עבור 'MiniCPM5-2B מול Gemma 4 12B', עם כתובית 'מוביל דירוג המודלים מתחת ל-4B פוגש את הגנרליסט הרב-מודאלי של גוגל (12B)', שלושה שבבים עם הכיתוב '2.5B מול 11.95B', 'חלון הקשר 128K מול 256K' ו-'AA Index 17 — #1 מתחת ל-4B', ורצועה עליונה 'עימות משקלים פתוחים · ספטמבר 2026'."
Guides & Insights

MiniCPM5-2B לעומת Gemma 4 12B: מוביל דירוגי ה-Sub-4B לעומת הגנרליסט 12B של גוגל

מחבר

Magnus Corvin

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

חומרי ההשקה של MiniCPM5-2B כוללים משפט אחד שנשמע כאילו הוא מיישב כל ויכוח בטרם החל: בוועידת הבינה המלאכותית העולמית ב-19 ביולי, ModelBest ו-OpenBMB הגדירו את המודל כמודל המדורג ראשון מתחת ל-4B פרמטרים בלוח המובילים של Artificial Analysis, ומשקלי הפתיחה שלו (open weights) עלו כעת בשקט ל-Hugging Face. Gemma 4 12B הוא התשובה של גוגל ממחלקת משקל שונה לחלוטין — מודל כללי מולטימודאלי צפוף ונטול מקודד (encoder-free) בגודל 11.95B פרמטרים, שיצא ב-3 ביוני, שמקבל קלט של טקסט, תמונה, אודיו וווידאו, וצבר מאחוריו חודשים של פריסה קהילתית. ההשוואה ביניהם אינה תרגיל של השוואת גיליונות מפרטים; זוהי החלטה לגבי המכשיר שאליו אתם משגרים את המוצר, שכן מודל שמוביל את מחלקת הגודל שלו ומודל שפשוט גדול יותר עונים על שאלות חומרה שונות.

התזמון הוא הסיבה שההשוואה הזו קיימת בכלל. MiniCPM5-2B הוצג ב-WAIC ביולי כמוצר — סיפור של שבב לא פחות מאשר סיפור של מודל, עם תשעה שותפי סיליקון כבר מיום ההשקה מקהילת ה-FlagOS שלו — והמשקלים הובטחו "בעתיד הקרוב". שבעה שבועות לאחר מכן, מאגר openbmb/MiniCPM5-2B הופיע ב-Hugging Face (יומן השינויים של OpenBMB מתארך את השחרור ל-7 בספטמבר), תחת רישיון Apache-2.0, ללא הגבלת גישה, כשהצ'קפוינט BF16, GGUF, MLX, GPTQ, צ'קפוינטים בסיסיים ו-SFT ומערכי האימון נמצאים כולם באותו האוסף. ללא הודעה לעיתונות, ללא אירוע השקה. נכון לכתיבת שורות אלה, כרטיס המודל הוא ההכרזה, ועדיין לא פורסם אף ריצת benchmark עצמאית — כל הנתונים הכמותיים על ה-2B להלן הם או שכפול עצמי של ModelBest, או שאובים מתמונת המצב של Artificial Analysis שהיא מצטטת. Gemma 4 12B, לעומת זאת, הושקה דרך המנגנון הרגיל של גוגל והורדה מיליוני פעמים. פער הראיות הזה הוא חלק מההשוואה, לא הערת שוליים לה.

מה בדיוק השתנה בכל צד

MiniCPM5-2B הוא הדגם השני בסדרת MiniCPM5, אחרי MiniCPM5-1B ש-OpenBMB שחררו כקוד פתוח ב-19 במאי. כרטיס המודל מתאר טרנספורמר צפוף עם סך של 2,516,756,480 פרמטרים (מתוכם 1,981,982,720 שאינם פרמטרי embedding — הנתון שמקנה לו את התווית "מחלקת 2B"), 42 שכבות בגודל חבוי של 2048, attention מקובץ-לפי-שאילתה (grouped-query) עם 16 ראשי שאילתה ו-2 ראשי KV בלבד, ואוצר מילים של 130,560. זוהי ארכיטקטורת LlamaForCausalLM פשוטה — הכרטיס מציין במפורש שאין צורך בקרנלים מותאמים אישית או בפיצול של קוד המודל — והמשקולות (checkpoint) כולו מסופק כנתח safetensors יחיד בפורמט BF16. הבחירה העיצובית המעניינת היא בשלב שלאחר האימון: SFT (כוונון עדין מפוקח) על 400 מיליארד טוקנים של נתוני חשיבה עמוקה, ולאחר מכן זיקוק על-מדיניות (On-Policy Distillation) שמקפל ששה-עשר מודלי מומחה מבוססי RL, חמישה מהם סוכניים (agentic), בחזרה לרשת צפופה קטנה אחת. הכרטיס מייחס לשילוב של RL ו-OPD רווח ממוצע של 10.96 נקודות במשימות חשיבה וכלליות ו-6.96 נקודות במשימות סוכניות — הפרשים פנימיים, אבל הם מסבירים את הצורה של המודל הזה: מודל 2B שנבנה כדי לשמש סוכן על-גבי המכשיר, הפולט קריאות לכלים בסגנון XML באופן טבעי.

Screenshot of the Hugging Face repository page for openbmb/MiniCPM5-2B, showing the OpenBMB org header, the Text Generation tag with Transformers and Safetensors and English and Chinese language tags, and the top of the model card reading 'We are releasing MiniCPM5-2B, the second model in the MiniCPM5 series, following MiniCPM5-1B. It is a dense 2B Transformer ... reaching 2B-class open-source SOTA' (captured September 7, 2026).

Gemma 4 12B תופס עמדה שונה במערך של Google. הוא הדגם האמצעי במשפחת Gemma 4 — מעל דגמי E2B ו-E4B הממוקדים בקצה, ומתחת ל-MoE של 26B ול-31B המוביל — והוא החבר היחיד הבנוי על עיצוב ללא מקודד: פאצ'ים גולמיים של תמונה וצורות גל של אודיו מוקרנים ישירות למרחב הטוקנים, כך שמודל צפוף אחד מטפל בקלט של טקסט, תמונה, אודיו ווידאו, ללא מגדל מקודד נפרד. הוא מציע חלון הקשר של 256K, קריאה לכלים מובנית, מעבר חשיבה אופציונלי ודראפטרים של חיזוי רב-טוקני שמאיצים את הפענוח מתוך הצ'קפוינט. הוא ברישיון Apache-2.0, פרקטי על חומרה ברמת 16GB (כ-8GB ב-4-bit), ובעמוד Hugging Face שלו נרשמים מיליוני הורדות בחודש.

Screenshot of the Hugging Face model card for google/gemma-4-12B-it, showing Google DeepMind as author, the Apache-2.0 license tag, Transformers and Safetensors tags, 'Model size 12B params', and the opening text describing the Gemma 4 12B Unified model's native text, audio, image and video input with no separate encoders (captured September 7, 2026).

טענת הדירוג, וקטגוריית הגודל שהיא משמיטה

הנתון המוביל של ModelBest עבור MiniCPM5-2B הוא מדד אינטליגנציה של Artificial Analysis בגובה 17, {{1}}הראשון בקרב מודלים מתחת ל-4B פרמטרים בעת ההשקה{{/1}}. {{2}}שתי הסתייגויות חייבות לעמוד לצד הנתון הזה{{/2}}. {{3}}הציון משקף את תמונת המצב v4.1 של AA ואינו בר-השוואה ישירה לערכי מדד מתמונות מצב קודמות{{/3}}, {{4}}והוא נתון של רגע ההשקה שהספק ציטט לפני כל ריצה חוזרת עצמאית{{/4}}. {{5}}הקריאה הכנה מצטמצמת ועדיין מרשימה{{/5}}: {{6}}במועד השקתו, לפי המתודולוגיה של AA באותה עת, מודל ה-2.5B הזה הוביל את כל קטגוריית הגודל שלו{{/6}}. {{7}}Gemma 4 12B אינו נכלל בקטגוריה זו{{/7}}, {{8}}ובדפים של Artificial Analysis עצמו הוא מדורג כיום גבוה יותר{{/8}} — {{9}}כ-22 לגרסת ה-reasoning ו-13 למודל ה-instruct שאינו מבוסס reasoning{{/9}}, {{10}}כששניהם "מעל הממוצע במידה ניכרת"{{/10}} ביחס לקבוצת ההשוואה שלהם. {{11}}מדדים מתמונות מצב שונות אינם מתיישרים זה עם זה באופן מושלם{{/11}}, {{12}}לכן התייחסו לכך כאל כיוון, לא כאל דיוק{{/12}}: {{13}}המודל הכלל-תכליתי בעל 12B נבחן כמודל המסוגל יותר{{/13}}, {{14}}בעוד המודל בעל 2B נבחן כמודל המסוגל ביותר בגודלו{{/14}}. {{15}}אלה טענות שונות, ושתיהן יכולות להיות נכונות{{/15}}.

לוח התוצאות, מסומן בכנות

קרא את השורות האלה עם מקור הנתונים בראש: הנתונים של MiniCPM5-2B הם {{1}}טענות מכרטיס המודל של ModelBest{{/1}}, {{2}}בני שבוע אחד{{/2}} ו{{3}}ללא אימות חוזר{{/3}}; הנתונים של Gemma 4 12B {{4}}מדווחים על ידי גוגל{{/4}} ו{{5}}חשופים זה מכבר לשימוש הקהילה{{/5}}:

• גודל — MiniCPM5-2B: 2.52B סה״כ / 1.98B לא-הטמעה, צפוף. Gemma 4 12B: 11.95B, צפוף.

• מודאליות — MiniCPM5-2B: טקסט בלבד. Gemma 4 12B: קלט טקסט, תמונה, אודיו ווידאו, ללא אנקודר.

• הקשר — MiniCPM5-2B: 131,072 טוקנים בתצורת ברירת המחדל. Gemma 4 12B: תמיכה מקורית ב־256K (חלק מתצורות ההגשה נועלות על 128K).

• שפות — MiniCPM5-2B: כרטיס ונתונים ממוקדים באנגלית ובסינית. Gemma 4 12B: 140+ שפות.

• שחרור — MiniCPM5-2B: הוכרז ב-19 ביולי 2026; המשקלים עלו לאוויר ב-6–7 בספטמבר, בשקט. Gemma 4 12B: הושק ב-3 ביוני 2026, עם הערכות השקה מלאות.

• עדויות — MiniCPM5-2B: כרטיס ספק פלוס AA v4.1 (אינדקס 17, #1 תת-4B); עדיין אין ריצה עצמאית. Gemma 4 12B: הערכות השקה פלוס חודשים של פריסה קהילתית וכ-3.3 מיליון הורדות חודשיות.

A comparison scoreboard titled 'MiniCPM5-2B vs Gemma 4 12B — the scoreboard', with left column rows 'Params: 2.52B total · 1.98B non-emb', 'Modality: Text only', 'Context: 128K (config 131,072)', 'Languages: English / Chinese', 'AA Index: 17 — #1 sub-4B at launch', 'Evidence: Vendor card · no independent run', and right column rows 'Params: 11.95B dense', 'Modality: Text + image + audio + video', 'Context: 256K native', 'Languages: 140+', 'AA Index: 22 reasoning · 13 instruct', 'Evidence: Google evals + months of use', with a footer labeling both sides' sourcing.

טבלת התוצאות שלמעלה היא אותו דיוקן בשש שורות: שני המודלים חולקים זה על זה כמעט בכל ממד, והעמודות שמכריעות את הבחירה — מודאליות, שפות, מחלקת התקן — הן אלה ששום ממוצע מדדים לא לוכד.

איפה שה-12B מנצח: הדברים ש-2B טקסטואלי בלבד לא יכול לזייף

נתחיל במודאליות. Gemma 4 12B מקבל אודיו, תמונות ווידאו באופן מובנה; MiniCPM5-2B הוא טקסט בלבד. כל מוצר שמתמלל, מסתכל על מסך או צופה בווידאו זקוק לצינור עיבוד שני לצד ה-2B, ובנקודה זו היתרון של “המודל הקטן” מתפוגג בחלקו. השפות מהוות את הקיר השני: 140+ שפות לעומת שחרור שמרוכז באנגלית ובסינית. עבור מוצר המשרת זנב ארוך של שפות, ה-2B אינו מועמד כלל. ואז יש גם את עניין הראיות. Gemma 4 12B הורד מיליוני פעמים, עבר קוונטיזציה וכוונון עדין, והופעל בסביבת ייצור במשך שלושה חודשים; מצבי הכשל שלו מתועדים, והמערכת האקולוגית שלו מקיפה את llama.cpp, Ollama, LM Studio, MLX, vLLM ו-SGLang. MiniCPM5-2B הוא מאגר קוד בן שבוע, שהמספרים המרכזיים שלו — כולל ציון 46.4 שהריץ הספק על SWE-bench Verified, ציון שיהיה יוצא דופן עבור מודל dense בגודל 2.5B אם יעמוד בבדיקות עצמאיות — לא אומתו על ידי אף אחד מחוץ למעבדה. על סמך בשלות בלבד, הבחירה אינה קרובה.

כאשר ה-2B הוא האפשרות היחידה

כל זה לא משנה במחלקת המכשירים שבהם 12B פשוט לא נכנס. טלפון, לוח קוקפיט חכם או קופסת edge קטנה עם כמה גיגה־בייט של DRAM לא יכולים להעביר משקלים של מודל 11.95B על פני אפיק הזיכרון במהירות שימושית — זה בדיוק הצוואר־בקבוק שהיה חונק אותו. MiniCPM5-2B נבנה בשביל העולם הזה: משקלים שנכנסים לזיכרון המכשיר, חלון של 128K לסשנים ארוכים של סוכן, תמיכה מקורית בקריאת כלים שנועדה לפעול אינטראקטיבית, והתאמה מיום אפס על פני תשע משפחות שבבים ובנוסף ARM. אם היעד שלך הוא NPU בדרגת טלפון או לוח משובץ, Gemma 4 12B לא מתחרה ב־MiniCPM5-2B; הוא בכלל לא ניתן לפריסה שם. ואם היעד שלך יכול לשאת 12B אבל רק בקושי — מחשב נייד עם 16GB — ה־2B קונה לך מרווח נשימה: השהיה מהירה יותר לכל token, צריכת חשמל נמוכה יותר, ואפשרות להריץ מודל שני באותה טביעת רגל.

איך לגלות אילו תביעות שורדות

מכיוון ששני הצדדים הם בעלי משקלים פתוחים וניתנים לאירוח עצמי, הצעד ההגון הבא הוא מדידה על החומרה שלך במקום עוד קריאה של המפרטים. אם אתה שוקל MiniCPM5-2B מול Gemma 4 12B על עומס עבודה שאתה כבר משרת, כאן גם שכבת ניתוב מצדיקה את קיומה: לכוון את נתיב הבדיקה אל checkpoint מתארח עצמי חדש דרך API אחד עם העברה אוטומטית למקרה תקלה פירושו שפלטפורמה לא מוכחת יכולה להיתקע או להסתובב בלולאה בלי להפיל את הסביבה היצרנית, בעוד שמחירי הרשימה של הספקים עבור מה שאתה משווה מולו עוברים ישירות ב-0% תוספת. הדגם עצמו הוא מאגר קוד בן יום, אז ברירת המחדל היא להתייחס אליו כאל ניסוי — אבל הניסוי זול להרצה, והשעתיים שנדרשות לשחזר SWE-bench או חלק ממערך ההערכה שלך על הדגם 2B הן בדיוק הראיה שחסרה להתמודדות הזו.

פסק הדין

בחרו ב-Gemma 4 12B כאשר לחומרה שלכם יש מרווח ראש ועומס העבודה שלכם כולל יותר מאשר טקסט — מוצר מולטימודלי, קהל רב־לשוני, או כל דבר שבו שלושה חודשים של התנהגות מוכחת על־ידי הקהילה חשובים יותר מכתר דירוגים. בחרו ב-MiniCPM5-2B כאשר המכשיר שלכם אינו מסוגל כלל לשאת דגם 12B, או כאשר דגם 2.5B בעל יכולות טקסט ומוכוון־סוכנים, על שבב בדרגת טלפון, יאפשר לכם להשיק מוצר שדגם גדול יותר הופך אותו לבלתי־אפשרי. מוביל הדירוגים מתחת ל־4B הוא הישג אמיתי, ושחרור משקלותיו בגישה פתוחה מאפשר לבחון אותו כבר היום; אולם, לאור הראיות הקיימות, הוא פשוט אינו מהווה תחליף לדגם גנרליסטי בגודל 12B בכל מקום שבו דגם 12B יכול לפעול בפועל.