כרטיס כותרת ראשי שנוצר, שעליו הכיתוב 'Solar Mini 4 vs Granite 4.2 3B', עם כותרת המשנה 'מודל שאתם קוראים לו וצ׳קפוינט שאתם מורידים' ושתי תגיות שעליהן הכיתוב 'כ־3 מיליארד פרמטרים פעילים לכל טוקן, בכל אחד' ו'האחד מחייב לפי טוקן, האחר לפי ואט'.
Guides & Insights

Solar Mini 4 מול Granite 4.2 3B: מודל שאתם קוראים לו וצ'קפוינט שאתם מורידים

מחבר

Gideon Frost

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים →
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

הציבו את Solar Mini 4 לצד Granite 4.2 3B, והמספר המעניין אינו פער הביצועים במבחנים. אלא ש-Granite 4.2 3B, מודל החשיבה של IBM ברישיון Apache-2.0 שיצא ב-25 באוגוסט 2026, ירוץ הלילה על מחשב נייד בחינם, בעוד Solar Mini 4, המודל הקנייני של Upstage שיצא ב-22 בספטמבר 2026, לא ירוץ בשום מקום שבבעלותכם וגובה 0.10 דולר למיליון אסימוני קלט ו-0.40 דולר למיליון אסימוני פלט כדי לענות על שאלה. שניהם מפעילים בערך שלושה מיליארד פרמטרים של מחשוב לכל אסימון. האחד הוא קובץ. האחר הוא מונה.

ההבדל הזה מכריע כמעט כל דבר אחר בהשוואה הזו, כולל אילו בנצ'מרקים בכלל ראויים להצבה זה לצד זה. ל-Granite 4.2 3B הייתה הערכה עצמאית זמן רב לפני של-Solar Mini 4 — Artificial Analysis מעניק לו ציון 9 במדד Intelligence Index v4.3.2, מתוך אותה חבילת הערכה ואותו ארגון שמעניק ל-Solar Mini 4 ציון 24. המשמעות היא שפער חמש-עשרה הנקודות כאן מבוסס היטב באופן יוצא דופן: מעבדה אחת, מתודולוגיה אחת, ושני מודלים שאיש לא נדרש לקבל באמונה עיוורת.

המפרט, בממדים שבאמת מבדילים ביניהם

• ארכיטקטורה — Solar Mini 4 הוא תערובת מומחים דלילה (sparse mixture-of-experts): 35B פרמטרים בסך הכול, 3B פעילים לכל טוקן, לפי Upstage. Granite 4.2 3B הוא צפוף (dense), כ-3B פרמטרים עם כ-4B בסך הכול כולל אמבדינגים לפי המטא-נתונים של safetensors. אותו תקציב הפעלה, שתי דרכים שונות להשתמש בו.

• משקלים — Solar Mini 4 הוא קנייני וסגור. Granite 4.2 3B מופץ תחת Apache 2.0 עם מתכון אימון מתועד עד לפרופורציות הנתונים.

• הקשר — Upstage מתעדת 512K טוקנים עם פלט של עד 128K; Artificial Analysis מפרטת 1.0M עבור אותו מודל, ולכן יש להתייחס לתקרה כלא־מוחלטת. Granite 4.2 3B פועל באופן מקורי עם 131,072 טוקנים, ומורחב ל־512K באמצעות שלב קדם־אימון חמישי.

• מחיר — Solar Mini 4 במחיר $0.10 / $0.01 במטמון / $0.40 למיליון טוקנים, כעת בהנחה של 50% עד 22 באוקטובר 2026. ל-Granite 4.2 3B אין מחירון ספק כי אין מה לשכור; נקודות הקצה המתארחות ש-Artificial Analysis עוקבת אחריהן מתמחרות אותו בסביבות $0.03 / $0.12, ואירוח עצמי עולה בחשמל.

• Intelligence Index — 24 עבור Solar Mini 4, 9 עבור Granite 4.2 3B, שניהם מ-Artificial Analysis v4.3.2.

• מהירות — 204 אסימוני פלט בשנייה עבור Solar Mini 4 ו-223 עבור Granite 4.2 3B, שניהם נמדדו על ידי אותה מעבדה, עם זמן עד לנתח הראשון של 1.5 שניות ו-0.5 שניות בהתאמה. המודל הצפוף הוא המהיר יותר בשני המדדים.

ממה מורכב בעצם פער חמש עשרה הנקודות

A two-column comparison scoreboard titled 'Solar Mini 4 vs Granite 4.2 3B', subtitled 'Same activation budget, two different ways of spending it'. Solar Mini 4: parameters 35B total / 3B active; weights proprietary, no download; context 512K claimed and 1.05M listed; price per 1M $0.10 / $0.01 / $0.40; Intelligence Index 24.05; cost per index task $0.36; output per task 88,300 tokens at 204 tok/s; non-hallucination 64.2%. Granite 4.2 3B: parameters 3.66B dense; weights Apache 2.0 on Hugging Face; context 131,072 native; price per 1M about $0.03 / $0.12 hosted; Intelligence Index 9.06; cost per index task $0.006; output per task 18,600 tokens at 223 tok/s; non-hallucination 73.7%.

הערכות בודדות מספרות סיפור פחות מחמיא מאשר הכותרת עבור Granite 4.2 3B, וסיפור מורכב יותר עבור Solar Mini 4. במבחן AA-LCR v1.1, בנצ'מרק ההסקה בהקשר ארוך, Solar Mini 4 משיג 83% ו-Granite 4.2 3B משיג 24%. הערכה בודדת זו מהווה חלק עצום מהפער במדד, וזה לא מקרה של קנה מידה — זה מה שאתה קונה עם 512K עד 1M טוקנים של הקשר והאימון להשתמש בו. החלון של Granite 4.2 3B מגיע באופן מקורי עד 131K; שלב 512K המורחב קיים, אבל המודל לא כוונן להסיק לאורכו כפי ש-Solar Mini 4 כוון.

בידע כללי הפער מצטמצם ואז מתהפך באופיו. Granite 4.2 3B מקבל 55.9% ב-GPQA, ול-Solar Mini 4 אין כלל נתון GPQA; ב-Humanity's Last Exam השניים הם 6.6% ו-25.8% בהתאמה, שזו ההשוואה הישירה יותר וזו שפער הגודל מנבא. מה ש-Granite 4.2 3B לא עושה, לפי Artificial Analysis, הוא להמציא: שיעור אי-ההזיה של AA-Omniscience שלו הוא 73.7%, גבוה מ-64.2% של Solar Mini 4. המודל הקטן יותר נוטה פחות להמציא תשובה שאין לו.

קידוד סוכני הוא המקום שבו שני המודלים נכשלים, ושבו חשוב לקרוא את המספרים. Solar Mini 4 משיג 1% ב-Terminal-Bench 4.0 ו-22.3% ב-AutomationBench-AA. Granite 4.2 3B משיג 0% ב-Terminal-Bench 4.0, 13.9% ב-Terminal-Bench 2.1 הישן יותר ו-5.6% ב-τ³-Banking. אף אחד מהמודלים אינו הכלי המתאים לעבודה מסופית אוטונומית. חברי ה-8B וה-30B במשפחת Granite 4.2 קיבלו את למידת החיזוק הסוכנית של IBM ומציגים תוצאות של SWE-Bench ו-Terminal-Bench; ה-3B דילג במפורש על בלוק האימון הזה, והמודל של Upstage מתומחר עבור אחזור, מבנה ויישום מדיניות ולא עבור הפעלת מעטפת פקודה.

איפה Granite 4.2 3B הוא עדיין התשובה הנכונה

שבעה ושליש ג'יגה-בייט של משקולות ב-bfloat16, פחות מארבעה ג'יגה-בייט בקוונטיזציה מעשית, ורישיון Apache 2.0 שמאפשר לכם לכוונן אותו על הנתונים שלכם ולשחרר את התוצאה בלי לבקש מאף אחד. סטודנט עם כרטיס גרפי צרכני אחד, בית חולים שלא יכול לשלוח טקסט של מטופל לצד שלישי, מוצר שצריך לעבוד בכלי טיס או במרתף של מפעל, צוות שרוצה להחזיק במודל במקום לשכור נקודת קצה — כל אחד מהמקרים האלה בוחר ב-Granite 4.2 3B ולא מביט לאחור. המנוע פועל דרך vLLM, SGLang, Transformers ו-GGUF, ו-Ollama מפרטת build של granite4.2:3b.

המספרים שדווחו על ידי הספק שלה ראויים לזהירות הרגילה. הכרטיס של IBM מצהיר על 78.33 ב-AIME 2025, 66.67 ב-HMMT פברואר 2025 ו-69.71 ב-LiveCodeBench v6 — כולם לא שוחזרו על ידי שום צד שלישי, ועבור מודל צפוף בנפח 3B נתון ה-AIME נמצא הרבה מעבר לטווח ההיסטורי. הציון 9 במדד Artificial Analysis מציג את המודל כשימושי באמת ורחוק מאוד מהחזית, וזה האות האמין יותר בדיוק משום ש-IBM לא פרסמה אותו.

כאשר Solar Mini 4 היא התשובה הנכונה

כל דבר שבו העבודה היא מסמך ארוך, חילוץ מובנה חוזר, או מדיניות שצריכה להיות מיושמת בעקביות בהיקף גדול — ושבו השהיה של תשעים שניות מקובלת. הפרופיל של Solar Mini 4 הוא פרופיל של מומחה: 83% בהסקה בהקשר ארוך, 48% בכתיבת קוד מדעי, 64% באי-הזיה, ונטייה מתועדת להימנע מלהשיב במקום לנחש. הוא גם דובר קוריאנית כשפה ממדרגה ראשונה לצד אנגלית ויפנית, ובעבור פריסה לשוק הקוריאני זה אינו הערת שוליים.

מה שהקונים לא צריכים לעשות הוא להשוות בין שני מחירי האסימונים ולהגיע למסקנה ש-Solar Mini 4 יקר פי שלושה. Artificial Analysis מדדה את Solar Mini 4 ב-$0.36 לכל משימת Intelligence Index שהושלמה — ועל אותה סדרה, את Granite 4.2 3B ב-$0.006. זהו פקטור של שישים, הנובע מאותם דברים שמנפחים את Solar Mini 4 לעומת GPT-6 Luna (max): 88,300 אסימוני פלט לכל משימה לעומת 18,600 של Granite, ומבנה עלויות שבו כתיבות מטמון הפרומפט מהוות $0.30 מתוך $0.36 של Solar Mini 4 לעומת $0.0006 מתוך $0.006 של Granite. מחיר פלט זול במודל עתיר מילים אינו משימה זולה.

A screenshot of the Hugging Face model card for ibm-granite/granite-4.2-3b showing the model summary table: developer Granite Team at IBM, a decoder-only dense transformer, base model Granite-4.1-3B-Base, 3B parameters, context length natively 128K with long-context extension to 512K, bfloat16 precision, twelve tested languages including Korean, a built-in chain-of-thought thinking mode, and an Apache-2.0 licence, with the model tree showing three finetunes and the base model ibm-granite/granite-4.1-3b-base.

אף אחד מהמודלים אינו נמצא ב-OrcaRouter — אנחנו לא מנתבים לא את Granite ולא את Upstage — כך שאם אתם רוצים את Granite 4.2 3B הוא מגיע מ-Hugging Face, ואם אתם רוצים את Solar Mini 4 הוא מגיע מה-API של Upstage עצמה ומפלטפורמות צד שלישי. אבל תבנית שני המודלים שההשוואה הזו מרמזת עליה היא בדיוק מה שנתבים נבנו עבורו, וזו הסיבה ש-OrcaRouter מעמיד יותר מ-200 מודלים מאחורי מפתח בודד בתוספת של 0% על מחיר המחירון של הספק: הריצו את עבודת המסמכים הארוכים והעבודה בשפה הקוריאנית מול המודל שבאמת מצדיק את העלות שלו, השאירו את שלבי החילוץ הדטרמיניסטיים על משהו שאתם מארחים בעצמכם, ותנו לניתוב ולמעבר לגיבוי להעביר בקשה ביניהם לפי קריאה ולא לפי חוזה.

A screenshot of the Artificial Analysis comparison page headed 'Granite 4.2 3B Intelligence, Performance & Price Analysis', marked as an IBM open-weights model released August 2026, with an overall speed of 223.4 output tokens per second, a 131k-token context window, and the summary line that Granite 4.2 3B scores 9 on the Artificial Analysis Intelligence Index, placing it above average among comparable models with a median of 6.

הערה אחרונה על המספרים שלמעלה. כל נתון של Solar Mini 4 שמגיע מ-Artificial Analysis הוא מדידה בלתי תלויה; כל נתון של Granite 4.2 3B מכרטיס המודל של IBM הוא טענת ספק שאף צד שלישי לא שיחזר. ציוני האינדקס 24 ו-9 של Artificial Analysis הם שני המספרים היחידים כאן שהופקו על ידי אותה מעבדה תחת אותם תנאים — ואלה השניים שעליהם יש לבסס החלטה.