כרטיס כותרת הירו שנוצר עבור Solar Mini 4, שכותרתו הראשית 'Solar Mini 4 — הריצה העצמאית', עם כתובית המשנה 'מדד האינטליגנציה 24, ובערך פי חמישה מהעלות לכל משימה של GPT-6 Luna', ושתי תגיות שבהן כתוב 'שוחרר ב-22 בספטמבר 2026' ו'הערכת צד שלישי ראשונה, 30 בספטמבר 2026'.
Guides & Insights

Solar Mini 4 השיג ציון 24 במדד Artificial Analysis — ועלותו לכל משימה גבוהה פי חמישה מזו של GPT-6 Luna

מחבר

Alistair Wren

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים →
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

Solar Mini 4 גובה אותו מחיר לכל טוקן קלט כמו GPT-6 Luna, ובערך פי חמישה להשלמת משימה בפועל. זה כל הסיפור של ההערכה העצמאית הראשונה של המודל החדש של Upstage, וזה לא הסיפור שחומרי ההשקה סיפרו. Solar Mini 4 הושק ב-22 בספטמבר 2026 כתערובת מומחים דלילה (sparse mixture-of-experts) בת 35 מיליארד פרמטרים, שמפעילה כ-3 מיליארד פרמטרים לכל טוקן, במחיר של $0.10 למיליון טוקני קלט ו-$0.40 למיליון טוקני פלט. GPT-6 Luna, שכבת היעילות של OpenAI, מתומחר ב-$0.10 ו-$0.50, עם שכבת הקשר ארוך מעל 272,000 טוקנים שמכפילה בערך את שניהם. במחירון הם נראים כמו אותה רכישה. במדד האינטליגנציה של Artificial Analysis, שבו שני המודלים הורצו דרך אותה חבילת עשר הערכות, Solar Mini 4 עולה $0.36 לכל משימה שהושלמה לעומת $0.07 עבור GPT-6 Luna (max) — גורם של 5.4 שנובע כולו מהאופן שבו שני המודלים מתנהגים במהלך משימה ולא ממה שהם גובים עבור טוקן.

ב-30 בספטמבר 2026, Artificial Analysis פרסמה את הסקירה שלה על המודל, אשר קיבל ציון 24במדד ה-Intelligence Index v4.3.2. כל מה במאמר זה שמיוחס ל-Artificial Analysis הוא מדידה של אותו ארגון עצמו; כל מה שמיוחס ל-Upstage הוא טענת הספק. ההבחנה חשובה כאן יותר מהרגיל, משום ששתי קבוצות המספרים לא תמיד תואמות.

מה שההרצה העצמאית בעצם אומרת

A scoreboard titled 'Solar Mini 4 — the scoreboard' with the rows: Intelligence Index 24.05 against a median of 12; Cost per index task $0.36 against GPT-6 Luna (max) at $0.07; Rate card $0.10 in / $0.01 cached / $0.40 out per 1M; Output per index task 88,300 tokens, 71,600 of them reasoning; Output speed 204 tokens per second and 430 seconds per index task; Context Upstage says 512K while Artificial Analysis lists 1.05M; Weakest result Terminal-Bench 4.0 at 1%.

Solar Mini 4 מגיע ל-24.05 במדד Intelligence Index, לעומת חציון של 12 בקרב מודלי החשיבה בקטגוריית המחיר שלו. זה ממקם אותו הרבה מעל הממוצע בקטגוריית המשקל שלו, והניסוח של Upstage עצמה — "הציון הכולל הגבוה ביותר מבין המודלים עם 3B פרמטרים פעילים בהשוואת Artificial Analysis Intelligence Index" — עומד בבדיקות עצמאיות בנקודה הספציפית הזו. Qwen3.6 35B A3B, שגם מפעיל 3B פרמטרים, משיג 18.2 באותו מדד. K2 Horizon MoVA 36B A4B, עם 4B פעילים, משיג 25.3 — והוא עושה זאת בהקשר קצר יותר, 524K טוקנים לעומת 1.05M של Solar Mini 4. מול Inkling, מודל MoE עם משקולות פתוחות בן 975 מיליארד פרמטרים שיצא ביולי, Solar Mini 4 מגיע ל-24.1 לעומת 25.0 — במרחק של פחות מנקודה ממודל שגדול ממנו כמעט פי שלושים ושעולה $1.00/$4.05 למיליון טוקנים.

הפרופיל שבתוך הציון ההוא אינו אחיד, ואי-האחידות היא החלק המועיל:

• הסקה בהקשר ארוך היא החוזק היחסי. Solar Mini 4 משיג 83% ב-AA-LCR v1.1, באותה רמה כמו MiniMax-M3 ו-GPT-6 Luna (max), ומקדים את Gemini 3.8 Flash (high) ואת GPT-6 Astra (max), שעומדים על 81%.

• קידוד מדעי מחזיק מעמד. 48% ב-SciCode, נקודה אחת לפני MiniMax-M3 ו-Inkling (xhigh).

• קידוד אג'נטי קורס. 1% ב-Terminal-Bench 4.0. לא "חלש" — 1%. ב-AutomationBench-AA, שמריץ תהליכי עבודה רב-שלביים על פני אפליקציות SaaS אמיתיות, 22.3%.

• דיוק הידע נמוך, אבל המודל יודע שהוא מנחש. AA-Omniscience מחזיר −11 עם דיוק של 18%; המודל נמנע מלהשיב על בערך מחצית מהשאלות שהוא נשאל עליהן. שיעור אי-ההזיה שלו הוא 64%, גבוה בהרבה מזה של Inkling (xhigh), שעומד על 32%, ושל GPT-6 Luna (max), שעומד על 23%. מודל שאומר "אני לא יודע" במחצית מהפעמים וצודק בשני שלישים מהפעמים שבהן הוא כן עונה הוא כלי שונה ממודל שמבדה בביטחון.

בעבודת ידע סוכנית, הנתונים הם 1072 Elo ב-GDPval-AA ו-872 Elo ב-AA-Briefcase, שניהם קרובים ל-Inkling (xhigh).

המספר פי חמישה, מפורק

הנתון של עלות לכל משימה מבית Artificial Analysis הוא זה שיכריע את רוב שיחות הרכש, וראוי לקרוא אותו כפירוט ולא לצטט אותו ככותרת ראשית. שני דברים מניעים אותו.

ראשית, נפח. Solar Mini 4 מפיק כ-88,300 אסימוני פלט לכל משימת Intelligence Index; 71,600 מהם הם אסימוני חשיבה. במחיר של $0.40 למיליון אסימוני פלט זה בערך $0.035 מהחשבון — זול, כי פלט זול. מה שזה עולה במקום זה זמן: בקצב מדוד של 204 אסימונים לשנייה, Artificial Analysis מתעד 430 שניות עבודה למשימת אינדקס ממוצעת, או כ-7.2 דקות. GPT-6 Luna (max) מפיק 50,000 אסימוני פלט למשימה בקצב של 127 אסימונים לשנייה ולוקח 396 שניות. Inkling (xhigh), מודל במשקלים פתוחים בעל 975 מיליארד פרמטרים, מפיק 34,700 אסימונים ומסיים תוך 169 שניות. Solar Mini 4 איטי משניהם, אבל בפער שאין לו שום קשר לפער העלויות של פי חמישה.

שנית — וזה כל הסיפור — קלט כתיבה למטמון. פירוט העלויות של Artificial Analysis מייחס כ-$0.30 מתוך $0.36 למשימה של Solar Mini 4 לאסימונים שנכתבים למטמון הפרומפט, לעומת $0.03 לקריאות מטמון, $0.035 לפלט ושגיאת עיגול לקלט שאינו במטמון באמת. עבור GPT-6 Luna (max), כתיבת מטמון היא $0.012 מתוך $0.068 — כ-17% מהחשבון, לעומת 82% עבור Solar Mini 4. קלט במטמון הוא השורה הזולה ביותר במחירון של Upstage ב-$0.01 למיליון, והמודל של Artificial Analysis אכן משתמש בו; הבעיה היא כמה צריך להיכתב לפני שאפשר לקרוא. סוכן ששולח מחדש שיחה גדלה בכל תור משלם את עלות הכתיבה לעתים קרובות בהרבה ממודל שעונה בתור קצר וסגור.

זהו הממצא ששווה לקחת לפרודקשן: עבור מודל כזה, המחיר לפי טוקן כמעט אינו מנבא דבר לגבי החשבון לפי משימה. התנהגות המטמון כן.

במקרים שבהם המספרים של Upstage עצמה נבדלים

A screenshot of Upstage's Console documentation page for Solar Mini 4, showing the Intelligence, Speed and Price gauges, the '$0.10 / 1M tokens' input rate, the description of a cost-efficient compact language model at 35B total and 3B active parameters built for agentic use cases, English, Japanese and Korean language support, tool calling, a 128K max output, the platforms Upstage Console and on-premises, and the version string solar-mini4-260922 with a training data cut-off of February 2026.

פוסט ההשקה של Upstage, שפורסם ב-1 באוקטובר 2026 תחת הכותרת "Solar Mini 4: Built for High-Volume Agent Workloads", מדווח על 24.1 במדד Artificial Analysis Intelligence Index — למעשה אותו נתון — ומעלה כמה טענות שניצבות לצד הנתונים העצמאיים ולא מעליהם.

הספק מציין 22.3% ב-AutomationBench-AA, תואם בדיוק את Artificial Analysis, ו-47.2 ב-τ³-Banking, מבחן מדיניות ושימוש בכלים שמערך המדדים הסיר מאז. הוא מדווח 83.3% ב-AA-LCR ו-47.6% ב-SciCode, שניהם בתוך שגיאת עיגול מהנתונים העצמאיים. ב-Humanity's Last Exam הוא מדווח 19.6%, בעוד שדף Artificial Analysis מציג 25.8% עבור אותו מודל; שתיהן קריאות סבירות של הערכה תנודתית לשמצה, אך הן אינן אותו מספר ואין להציג אחת מהן כשל האחרת.

שתי שורות מפרט גם סותרות זו את זו. Upstage מתעדת חלון הקשר של 512K טוקנים עם עד 128K טוקני פלט. Artificial Analysis מפרטת חלון הקשר של 1.0M טוקנים ופלט מקסימלי של 262K. הבלוג של Upstage מבהיר במפורש שנתון 512K הוא המפרט המחייב בגרסה המשוחררת; אי-ההתאמה הוא מסוג הדברים שכדאי ליישב מול תגובת API לפני שמישהו בונה על סמך זה צינור אחזור.

הספק גם עורך את ההשוואה היחידה שהוא יכול לערוך בתנאיו שלו: בדיקה פנימית על פני שלוש משימות סוכן בשפה הקוריאנית, שהורצו שלוש פעמים לכל מודל, שבה השלמת 1,000 מערכים של שלוש משימות עלתה לפי הערכה $1.25 עם Solar Mini 4 ו-$2.20 עם MiMo-V2.5. זוהי בדיקה שמנוהלת בידי הספק, על משימות שנבחרו בידי הספק, ללא התחשבות בזמן השהיה, והיא מצביעה בכיוון ההפוך מתוצאת Artificial Analysis. היא אינה שגויה — משימות שונות מפעילות תקציבי טוקנים שונים — אבל זהו נתון שיווקי, והנחת ההשקה המפורסמת של המודל היא סיבה נפרדת להריץ מחדש את המספרים שלך במקום לאמץ את של מישהו אחר.

תמחור, לפי התיעוד החי של קונסולת Upstage: $0.10 למיליון אסימוני קלט, $0.01 למיליון אסימוני קלט במטמון, $0.40 למיליון אסימוני פלט, עם הנחת השקה המפורסמת כעת בשיעור 50% עד 22 באוקטובר 2026 UTC, מה שמביא את התעריפים האפקטיביים ל-$0.05 לקלט, $0.005 לקלט במטמון ו-$0.20 לפלט עד אז.

מה זה אומר אם אתה זה שמשלם

הדבר המעניין ב-Solar Mini 4 הוא לא שהוא מודל גרוע. הוא שהוא מודל קטן טוב באמת, שהכלכלה שלו נשלטת על ידי התנהגות שכרטיס תעריפים לא יכול להראות לך. ציון 24 במדד עם שלושה פרמטרים פעילים הוא הישג הנדסי אמיתי, ועומסי עבודה בשפה הקוריאנית — נקודת החוזק המוצהרת של המודל, לצד אנגלית ויפנית — הם בדיוק המקום שבו סביר ביותר שהתוצאה הזו תהיה שווה את מחירו.

החלק המסורבל הוא כל מה שקורה אחרי הקריאה הראשונה. סבבי עוזר ארוכים, שימוש חוזר נמוך במטמון, ומשימה שלוקחת שבע דקות של פענוח לכל הרצת אינדקס — כולם מצטברים למספר שלא דומה בכלל ל-$0.10/$0.40. אם אתה בוחן אותו, הניסוי הישר הוא מבחן עלות לכל עבודה שהושלמה על עומס העבודה שלך, עם מטמון פרומפטים מופעל באופן שבו מחסנית הייצור שלך באמת תשתמש בו — לא השוואת מחירי טוקנים.

זו גם סוג הבעיה שנתב קיים כדי לפתור, והסיבה ש-OrcaRouter מעבירה הלאה את מחירי המחירון של הספקים במרווח של 0% כך ששינוי במחיר של ספק מגיע לחשבונית שלך באותו היום. אנחנו לא מנתבים מודלים של Upstage, ולכן לא Solar Mini 4 ולא Solar Pro 4 זמינים דרכנו — הם מגיעים מה-API של Upstage עצמה ומפלטפורמות צד שלישי. מה שכן אנחנו מנתבים הוא החצי השני של ההשוואה הזו: GPT-6 Luna, Qwen3.8-Max, Qwen3.8-27B, Qwen3.8-Flash ויותר מ-200 מודלים אחרים מאחורי מפתח אחד, וזה מה שהופך את זה למעשי להחזיק מודל זול ומודל יקר על אותה משימה ולתת ל-failover האוטומטי ולניתוב לפי בקשה להחליט מי מהם עונה. כשההבדל בין שני מודלים הוא פער של פי חמישה בעלות לכל משימה שאף מחירון לא חושף, היכולת להעביר בקשה בודדת ביניהם חשובה יותר מכל טבלת בנצ'מרקים.

A screenshot of the Artificial Analysis article dated September 30, 2026, headlined 'Korean AI Lab Upstage has released Solar Mini 4 which scores 24 on the Artificial Analysis Intelligence Index, but costs ~5x as much per task as GPT-6 Luna (max) despite similar per-token prices'. The visible key-results text covers the 3B-active Pareto claim, the 6-point lead over Qwen3.6 35B A3B at the same active size, 83% on AA-LCR v1.1 matching MiniMax-M3 and GPT-6 Luna (max), 48% on SciCode, and fast output at 208 tokens per second with slow tasks.

הגרסה הקצרה: Solar Mini 4 היא נקודת הפארטו החדשה ש-Artificial Analysis משרטטת עבור מודלים עם פחות משלושה מיליארד פרמטרים פעילים, והיא יקרה בערך פי חמישה לכל משימה שהושלמה מאשר מודל שמחירו הרשום לקלט זהה. שתי האמירות האלה נכונות, והשנייה היא זו שמופיעה בחשבונית.