
Intern-Decision-2B מול MiniCPM5-2B: שני צ'ק-פוינטים של 2B, בהפרש עשרים יום, דרכים הפוכות לנצל את הפרמטרים
- typesafeחדשTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 לכל 1M טוקנים · 584 tok/s
- openaiחדשOpenAI: GPT-6 Luna2026-09-2237אינטליגנציה
- openaiחדשOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- anthropicחדשAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- grokחדשGrok 4.72026-09-2146אינטליגנציה
- OrcaחדשOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 לכל 1M טוקנים · 187 tok/s
- orcaחדשOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- openaiOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- googleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- anthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0540אינטליגנציה72כתיבת קוד
internlm/Intern-Decision-2Bו־openbmb/MiniCPM5-2B הם באותו גודל, שוחררו בהפרש של עשרים ימים, ברישיון זהה, ונבנו למשהו שאינו דומה כלל לאותה עבודה. הצ'קפוינט של InternLM הוא 2,213,241,664 פרמטרים של מנקד החלטות: הוא מקבל מצב ושאלות עם טיפוסים, מריץ מעבר קדימה אחד, ומחזיר הסתברויות מכוילות בלי לייצר טוקן, ומסרב לכל קלט מעבר ל-8,192 טוקנים. הצ'קפוינט של OpenBMB הוא 2,516,756,480 פרמטרים של כללן צפוף: Llama בעל 42 שכבות שנגזר ממתכון MiniCPM5, עם חלון הקשר של 131,072 טוקנים, שכותב קוד, קורא לכלים ועושה מתמטיקה, עם Artificial Analysis Intelligence Index של 12.5 ו-726,518 הורדות בחודש שעבר. העלות שלהם להורדה זהה, אבל הם קונים דברים שונים לחלוטין.
החלק המעניין בזיווג הזה אינו פער המדדים — בקושי קיים מדד חופף להשוות ביניהם. הוא במה שאפשר להקצות תקציב של 2.2 מיליארד ו-2.5 מיליארד פרמטרים לכל אחד מהם, ובמה שהבחירה מספרת לך על איזה משניהם גמור. MiniCPM5-2B הוא המודל השני בסדרה שלו, אחרי MiniCPM5-1B ממאי, והוא הגיע עם מערך שחרור מלא. Intern-Decision-2B הוא האמצעי מבין שלושה גדלים ש-InternLM העלתה ל-Hugging Face בשעה 05:36 UTC ב-26 בספטמבר 2026 בלי שום הודעה, ומערך השחרור שלו — בסיס קוד לאימון, חבילת הערכה מאומתת בגיבוב, ומדד כיול בן 96 מקרים — הפך לציבורי רק הבוקר בשעה 08:58 UTC.
לאן הלכו שני התקציבים
שני המודלים הם כיוונונים עדינים של הארכיטקטורה של מישהו אחר, ושניהם מכילים בערך 2.5 מיליארד פרמטרים. כאן נגמר הדמיון.

MiniCPM5-2B הוא Transformer צפוף עם 42 שכבות, גודל מוסתר 2,048, 16 ראשי קשב, גודל ביניים של 6,144, אוצר מילים של 130,560 טוקנים וחלון הקשר של 131,072 טוקנים, שאומן על תערובת של קורפוסים פתוחים ש-OpenBMB פרסמה לצידו: UltraX עבור אימון מקדים על נתוני רשת, UltraData-Code עם ניהול קוד מדורג L0–L3, UltraData-Math, ו-500,000 דוגמאות SFT של סוכנים עם למעלה מ-80,000 דוגמאות RL ב-UltraData-RL-2609. שלב האימון שאחרי האימון המקדים מריץ SFT, ואחר כך מורים ממוקדי RL במתמטיקה, בקוד ובמשימות סוכנים, ואז זיקוק on-policy בחזרה למודל אחד. זהו מודל לשימוש כללי שכל תקציב הפרמטרים שלו נחשף כיכולת שאפשר להנחות באמצעות פרומפט.
Intern-Decision-2B הוא Qwen3_5ForConditionalGeneration עם 24 שכבות — דפוס חוזר של שלוש שכבות קשב לינארי לשכבת קשב מלא אחת — גודל מוסתר 2,048, 8 ראשי שאילתה מול 2 ראשי מפתח-ערך, ממד ראש 256, שכבת חיזוי מרובת טוקנים נשמרת ותקרת שיבוץ של 262,144 עמדות. הוא מגיע עם מגדל ראייה בנפח 612.5 MB ומקרן בנפח 50.3 MB. כמעט שום דבר מתקציב זה אינו זמין לך כפרומפט: המודל עונה על סכמה קבועה של שאלות, והארכיטקטורה שלו היא מנגנון האספקה של softmax, לא מחולל טקסט.
פרט אחד מהמאגר שפורסם זה עתה של InternLM שווה להבליט, משום שהוא ממסגר מחדש את התגית הרב-מודלית בכרטיס המודל. כיוונון ההחלטות "מבצע כיוונון עדין של עמוד השדרה הלשוני של Qwen3.5 תוך הקפאת מגדל הראייה והמקרן." גם צ'קפוינט ההחלטות של 2B וגם זה של 4B מכילים שרד ראייה בגודל של בדיוק 612,517,440 בתים — אותו גודל בשניהם — מה שתואם את ההנחה שרכיבים אלה עברו בירושה מבסיס Qwen ולא אומנו. נתיב התמונות אמיתי והוא שמיש, אבל זה לא מה שכיוונון ההחלטות של InternLM השקיע בו את מאמציו. אם עומס העבודה שלך הוא ניקוד החלטות טקסטואלי בלבד, כ-660 MB מתוך ההורדה של 4.46 GB לא עושים בשבילך דבר.
לוח תוצאות

• פרמטרים — Intern-Decision-2B 2,213,241,664 ב-BF16 בתוספת כ-660 MB של מגדל ראייה ומקרן, כ-4.46 GB של מאגר; MiniCPM5-2B 2,516,756,480 ב-BF16, קובץ safetensors אחד בגודל 5.03 GB.
• הקשר — 8,192 טוקנים עבור Intern-Decision-2B, נדחה ללא חיתוך מעל לכך; 131,072 טוקנים עבור MiniCPM5-2B.
• פלט — התפלגות מכוילת בתוספת argmax לכל שדה, ללא טקסט כלל; טקסט שנוצר, טוקן אחר טוקן.
• אימון — כיוונון החלטות של שלד Qwen3.5-2B עם מגדל ראייה קפוא, ונתוני האימון לא נחשפו; מעבר קדם־אימון מלא, אימון־ביניים ו-SFT של חשיבה מעמיקה בהיקף 400 מיליארד טוקנים, שלאחריו RL וזיקוק על־מדיניות, כשהקורפוסים פורסמו לצדם.
• עדויות שפורסמו — טבלת ספק בת שבע חבילות בדיקה עם ממוצע 84.68, Brier 0.437 ו-ECE 0.100, שלא שוחזרה על ידי שום צד שלישי, לייק אחד ואפס הורדות; כרטיס OpenBMB עם ממוצע 53.9 בתוך קבוצת ההשוואה של עצמו ומדד Artificial Analysis Intelligence Index עצמאי של 12.5, עם 726,518 הורדות בחודש האחרון.
• רישיון — Apache-2.0 כאשר תנאי Qwen במעלה הזרם נשמרים בשם LICENSE-QWEN, ובמאגר הקוד לא צוין רישיון כלל; Apache-2.0 לאורך כל הדרך, כולל הקוד.
במה כל אחד מהם למעשה טוב יותר, וזה לא צמוד
ההשוואה א-סימטרית עד כדי טעות קטגוריאלית, ולכן מועיל יותר לנקוב בשמות המשרות.
MiniCPM5-2B מנצח בכל דבר שדורש הפקת תשובה ולא בחירת אחת. הוא כותב קוד; ל-Intern-Decision-2B אין נתיב קוד. הוא מתמודד עם הקשר של 131,072 טוקנים; Intern-Decision-2B עוצר ב-8,192 ונכשל בקול רם. הוא מפעיל כלים, עם ציון BFCL v4 של 66.6 בטבלה של OpenBMB עצמה, והוא עוסק במתמטיקה, עם MATH-500 ב-94.6 ו-GPQA-Diamond ב-70.2 — נתונים מהכרטיס של הספק, כששורת GPQA כוללת הערת שוליים שהכרטיס עצמו מספק. הוא משיג 70.8 ב-MMLU-Pro ו-84.7 ב-MMLU-Redux. הוא פועל ב-llama.cpp וב-MLX, מופץ בגרסאות GGUF, GPTQ ו-DSpark, ויש לו Space הדגמה ב-Hub שהוא ציבורי, שלא כמו ה-401 שאליו מפנה הכרטיס של Intern-Decision.
Intern-Decision-2B מנצח בדיוק בשני דברים, והם הסיבה לקיומו. ראשית, החלטה בקבוצה סגורה עם סכימה שאתה כותב מחזירה הסתברות שאפשר להחיל עליה סף, במעבר קדימה יחיד, בכ-33 מילישניות, ללא מנתח וללא דגימה — צורה ש-MiniCPM5-2B לא יכול להפיק אלא על ידי יצירת טקסט וקיווי שהמספר שבתוכו מתנהג היטב. שנית, זהו ארטיפקט ניתן לשחזור: המאגר מכיל כעת את מטרת האימון, את שבע חבילות הדיוק עם גיבובי SHA-256 וספירת שורות לכל חבילה, את קוד הניקוד, את תסריטי התאמת הטמפרטורה והריפליי, ואת בנצ'מרק כיול התפלגות בן 96 מקרים עם המחולל וכלי הניקוד הלא־מקוון שלו. מדריך ההערכה של InternLM מציין שהפריסטים ששוחררו כבולים ל-backend של XTuner ושעל תוצאות HF יש לדווח כהגדרת הרצה שונה — וזה בדיוק סוג ההסתייגות שערכת שחזור קיימת כדי להפוך לניתנת לבדיקה.

מי צריך להוריד מה
אם יש לך משימה שכרוכה בקריאה של משהו ארוך, בכתיבה של משהו, או במענה על שאלה שאת האפשרויות שלה לא מנית מראש, MiniCPM5-2B הוא המודל ואין החלטה שצריך לקבל. הוא ג'נרליסט מוגמר בדרגת 2B עם אקוסיסטם אמיתי, נתונים פתוחים מאחוריו ורישום הערכה עצמאי, ולנסות אותו לא עולה דבר — בניות GGUF ו-MLX כבר נמצאות ב-Hub.
אם יש לך משימה שהיא באמת בחירה בין תשובות ידועות — ניתוב כרטיס, סיווג דואר אלקטרוני תמיכה, תיוג מועמד, ניקוד כוונה בסולם אורדינלי — אז מודל גנרטיבי הוא הכלי הלא נכון, ו-Intern-Decision-2B הוא המעניין מבין השניים למרות שכמעט אף אחד לא הריץ אותו. הסתברות שאתה יכול לסף אותה זולה יותר להפעלה, קלה יותר לביקורת ובלתי אפשרית להזיה, והעובדה שהצ'קפוינט הגיע עם ערכת שחזור ולא עם פוסט לוח תוצאות הופכת אותו למתועד יותר מבין השניים בציר שחשוב כשאתה צריך להגן על הבחירה.
אף אחד מהמודלים לא נמצא ב-OrcaRouter. דף המודל שלנו עבור Intern-Decision-2B מחזיר 404 ואין נתיב ל-MiniCPM5-2B; שום דבר כאן אינו טענת זמינות, ושניהם פירושם הרצת הסקה משלך. המקום שבו קיימת החלופה המעשית הוא במודלי ההחלטה המתארחים: TypeSafe's Jev 1.13, המודל ש-InternLM השוותה את כל המשפחה שלה אליו, נמצא בקטלוג במחיר של $0.042 למיליון טוקני קלט עם חלון הקשר של 65K וזמן P50 לטוקן ראשון של 178 מ"ש. ואם מה שאתה באמת צריך הוא מודל כללי באותה מחלקת גודל כמו MiniCPM5-2B בלי העבודה התפעולית, נתיב ה-Qwen המתארח הקטן ביותר שלנו הוא גדול פי כמה אבל הוא מפתח אחד מבין יותר מ-200 מודלים, במחיר מחירון של הספק ללא תוספת וכשל אוטומטי מאחוריו.
המספר היחיד שמכריע את זה
זה לא 84.68 מול 53.9. שני הממוצעים האלה מגיעים מחבילות שונות, נמדדו במעבדות שונות, ובמקרה אחד — על ידי מעבדה שהמספרים שלה מעולם לא נבדקו. המספר שמכריע הוא 8,192. אם המצב שלך נכנס בתוך שמונת אלפי טוקנים והתשובה שלך היא כבר רשימה, Intern-Decision-2B הוא מכשיר מדויק עם ערכת שחזור ואנומליית כיול שכדאי שתהיה מודע לה — שגיאת הכיול הצפויה שלו, 0.100, היא הגרועה מבין שלושת הגדלים ש-InternLM פרסמה, לעומת 0.066 עבור המודל שחצי מגודלו, אז התאם טמפרטורה משלך לפני שאתה סומך על ערך ביטחון. אם המצב שלך לא נכנס, השאלה נגמרת לפני שהבנצ'מרקים מתחילים, ו-MiniCPM5-2B הוא התשובה.
השוואות במאמר הזה1
זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית
