
Solar Mini 4 השיג ציון 24 במדד Artificial Analysis — ועלותו לכל משימה גבוהה פי חמישה מזו של GPT-6 Luna
- openaiחדשOpenAI: GPT-6.1 Sol2026-09-29$2.00 / $10.00 לכל 1M טוקנים
- anthropicחדשAnthropic: Claude Sonnet 5.52026-09-28$2.00 / $10.00 לכל 1M טוקנים · 159 tok/s
- typesafeחדשTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 לכל 1M טוקנים · 220 tok/s
- OpenAIחדשOpenAI: GPT-6 Luna2026-09-2238אינטליגנציה
- OpenAIחדשOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- AnthropicחדשAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- xAIחדשGrok 4.72026-09-2146אינטליגנציה
- OrcaחדשOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 לכל 1M טוקנים · 118 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- OpenAIOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- AnthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 לכל 1M טוקנים · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 102 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 217 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
Solar Mini 4 גובה אותו מחיר לכל טוקן קלט כמו GPT-6 Luna, ובערך פי חמישה להשלמת משימה בפועל. זה כל הסיפור של ההערכה העצמאית הראשונה של המודל החדש של Upstage, וזה לא הסיפור שחומרי ההשקה סיפרו. Solar Mini 4 הושק ב-22 בספטמבר 2026 כתערובת מומחים דלילה (sparse mixture-of-experts) בת 35 מיליארד פרמטרים, שמפעילה כ-3 מיליארד פרמטרים לכל טוקן, במחיר של $0.10 למיליון טוקני קלט ו-$0.40 למיליון טוקני פלט. GPT-6 Luna, שכבת היעילות של OpenAI, מתומחר ב-$0.10 ו-$0.50, עם שכבת הקשר ארוך מעל 272,000 טוקנים שמכפילה בערך את שניהם. במחירון הם נראים כמו אותה רכישה. במדד האינטליגנציה של Artificial Analysis, שבו שני המודלים הורצו דרך אותה חבילת עשר הערכות, Solar Mini 4 עולה $0.36 לכל משימה שהושלמה לעומת $0.07 עבור GPT-6 Luna (max) — גורם של 5.4 שנובע כולו מהאופן שבו שני המודלים מתנהגים במהלך משימה ולא ממה שהם גובים עבור טוקן.
ב-30 בספטמבר 2026, Artificial Analysis פרסמה את הסקירה שלה על המודל, אשר קיבל ציון 24במדד ה-Intelligence Index v4.3.2. כל מה במאמר זה שמיוחס ל-Artificial Analysis הוא מדידה של אותו ארגון עצמו; כל מה שמיוחס ל-Upstage הוא טענת הספק. ההבחנה חשובה כאן יותר מהרגיל, משום ששתי קבוצות המספרים לא תמיד תואמות.
מה שההרצה העצמאית בעצם אומרת

Solar Mini 4 מגיע ל-24.05 במדד Intelligence Index, לעומת חציון של 12 בקרב מודלי החשיבה בקטגוריית המחיר שלו. זה ממקם אותו הרבה מעל הממוצע בקטגוריית המשקל שלו, והניסוח של Upstage עצמה — "הציון הכולל הגבוה ביותר מבין המודלים עם 3B פרמטרים פעילים בהשוואת Artificial Analysis Intelligence Index" — עומד בבדיקות עצמאיות בנקודה הספציפית הזו. Qwen3.6 35B A3B, שגם מפעיל 3B פרמטרים, משיג 18.2 באותו מדד. K2 Horizon MoVA 36B A4B, עם 4B פעילים, משיג 25.3 — והוא עושה זאת בהקשר קצר יותר, 524K טוקנים לעומת 1.05M של Solar Mini 4. מול Inkling, מודל MoE עם משקולות פתוחות בן 975 מיליארד פרמטרים שיצא ביולי, Solar Mini 4 מגיע ל-24.1 לעומת 25.0 — במרחק של פחות מנקודה ממודל שגדול ממנו כמעט פי שלושים ושעולה $1.00/$4.05 למיליון טוקנים.
הפרופיל שבתוך הציון ההוא אינו אחיד, ואי-האחידות היא החלק המועיל:
• הסקה בהקשר ארוך היא החוזק היחסי. Solar Mini 4 משיג 83% ב-AA-LCR v1.1, באותה רמה כמו MiniMax-M3 ו-GPT-6 Luna (max), ומקדים את Gemini 3.8 Flash (high) ואת GPT-6 Astra (max), שעומדים על 81%.
• קידוד מדעי מחזיק מעמד. 48% ב-SciCode, נקודה אחת לפני MiniMax-M3 ו-Inkling (xhigh).
• קידוד אג'נטי קורס. 1% ב-Terminal-Bench 4.0. לא "חלש" — 1%. ב-AutomationBench-AA, שמריץ תהליכי עבודה רב-שלביים על פני אפליקציות SaaS אמיתיות, 22.3%.
• דיוק הידע נמוך, אבל המודל יודע שהוא מנחש. AA-Omniscience מחזיר −11 עם דיוק של 18%; המודל נמנע מלהשיב על בערך מחצית מהשאלות שהוא נשאל עליהן. שיעור אי-ההזיה שלו הוא 64%, גבוה בהרבה מזה של Inkling (xhigh), שעומד על 32%, ושל GPT-6 Luna (max), שעומד על 23%. מודל שאומר "אני לא יודע" במחצית מהפעמים וצודק בשני שלישים מהפעמים שבהן הוא כן עונה הוא כלי שונה ממודל שמבדה בביטחון.
בעבודת ידע סוכנית, הנתונים הם 1072 Elo ב-GDPval-AA ו-872 Elo ב-AA-Briefcase, שניהם קרובים ל-Inkling (xhigh).
המספר פי חמישה, מפורק
הנתון של עלות לכל משימה מבית Artificial Analysis הוא זה שיכריע את רוב שיחות הרכש, וראוי לקרוא אותו כפירוט ולא לצטט אותו ככותרת ראשית. שני דברים מניעים אותו.
ראשית, נפח. Solar Mini 4 מפיק כ-88,300 אסימוני פלט לכל משימת Intelligence Index; 71,600 מהם הם אסימוני חשיבה. במחיר של $0.40 למיליון אסימוני פלט זה בערך $0.035 מהחשבון — זול, כי פלט זול. מה שזה עולה במקום זה זמן: בקצב מדוד של 204 אסימונים לשנייה, Artificial Analysis מתעד 430 שניות עבודה למשימת אינדקס ממוצעת, או כ-7.2 דקות. GPT-6 Luna (max) מפיק 50,000 אסימוני פלט למשימה בקצב של 127 אסימונים לשנייה ולוקח 396 שניות. Inkling (xhigh), מודל במשקלים פתוחים בעל 975 מיליארד פרמטרים, מפיק 34,700 אסימונים ומסיים תוך 169 שניות. Solar Mini 4 איטי משניהם, אבל בפער שאין לו שום קשר לפער העלויות של פי חמישה.
שנית — וזה כל הסיפור — קלט כתיבה למטמון. פירוט העלויות של Artificial Analysis מייחס כ-$0.30 מתוך $0.36 למשימה של Solar Mini 4 לאסימונים שנכתבים למטמון הפרומפט, לעומת $0.03 לקריאות מטמון, $0.035 לפלט ושגיאת עיגול לקלט שאינו במטמון באמת. עבור GPT-6 Luna (max), כתיבת מטמון היא $0.012 מתוך $0.068 — כ-17% מהחשבון, לעומת 82% עבור Solar Mini 4. קלט במטמון הוא השורה הזולה ביותר במחירון של Upstage ב-$0.01 למיליון, והמודל של Artificial Analysis אכן משתמש בו; הבעיה היא כמה צריך להיכתב לפני שאפשר לקרוא. סוכן ששולח מחדש שיחה גדלה בכל תור משלם את עלות הכתיבה לעתים קרובות בהרבה ממודל שעונה בתור קצר וסגור.
זהו הממצא ששווה לקחת לפרודקשן: עבור מודל כזה, המחיר לפי טוקן כמעט אינו מנבא דבר לגבי החשבון לפי משימה. התנהגות המטמון כן.
במקרים שבהם המספרים של Upstage עצמה נבדלים

פוסט ההשקה של Upstage, שפורסם ב-1 באוקטובר 2026 תחת הכותרת "Solar Mini 4: Built for High-Volume Agent Workloads", מדווח על 24.1 במדד Artificial Analysis Intelligence Index — למעשה אותו נתון — ומעלה כמה טענות שניצבות לצד הנתונים העצמאיים ולא מעליהם.
הספק מציין 22.3% ב-AutomationBench-AA, תואם בדיוק את Artificial Analysis, ו-47.2 ב-τ³-Banking, מבחן מדיניות ושימוש בכלים שמערך המדדים הסיר מאז. הוא מדווח 83.3% ב-AA-LCR ו-47.6% ב-SciCode, שניהם בתוך שגיאת עיגול מהנתונים העצמאיים. ב-Humanity's Last Exam הוא מדווח 19.6%, בעוד שדף Artificial Analysis מציג 25.8% עבור אותו מודל; שתיהן קריאות סבירות של הערכה תנודתית לשמצה, אך הן אינן אותו מספר ואין להציג אחת מהן כשל האחרת.
שתי שורות מפרט גם סותרות זו את זו. Upstage מתעדת חלון הקשר של 512K טוקנים עם עד 128K טוקני פלט. Artificial Analysis מפרטת חלון הקשר של 1.0M טוקנים ופלט מקסימלי של 262K. הבלוג של Upstage מבהיר במפורש שנתון 512K הוא המפרט המחייב בגרסה המשוחררת; אי-ההתאמה הוא מסוג הדברים שכדאי ליישב מול תגובת API לפני שמישהו בונה על סמך זה צינור אחזור.
הספק גם עורך את ההשוואה היחידה שהוא יכול לערוך בתנאיו שלו: בדיקה פנימית על פני שלוש משימות סוכן בשפה הקוריאנית, שהורצו שלוש פעמים לכל מודל, שבה השלמת 1,000 מערכים של שלוש משימות עלתה לפי הערכה $1.25 עם Solar Mini 4 ו-$2.20 עם MiMo-V2.5. זוהי בדיקה שמנוהלת בידי הספק, על משימות שנבחרו בידי הספק, ללא התחשבות בזמן השהיה, והיא מצביעה בכיוון ההפוך מתוצאת Artificial Analysis. היא אינה שגויה — משימות שונות מפעילות תקציבי טוקנים שונים — אבל זהו נתון שיווקי, והנחת ההשקה המפורסמת של המודל היא סיבה נפרדת להריץ מחדש את המספרים שלך במקום לאמץ את של מישהו אחר.
תמחור, לפי התיעוד החי של קונסולת Upstage: $0.10 למיליון אסימוני קלט, $0.01 למיליון אסימוני קלט במטמון, $0.40 למיליון אסימוני פלט, עם הנחת השקה המפורסמת כעת בשיעור 50% עד 22 באוקטובר 2026 UTC, מה שמביא את התעריפים האפקטיביים ל-$0.05 לקלט, $0.005 לקלט במטמון ו-$0.20 לפלט עד אז.
מה זה אומר אם אתה זה שמשלם
הדבר המעניין ב-Solar Mini 4 הוא לא שהוא מודל גרוע. הוא שהוא מודל קטן טוב באמת, שהכלכלה שלו נשלטת על ידי התנהגות שכרטיס תעריפים לא יכול להראות לך. ציון 24 במדד עם שלושה פרמטרים פעילים הוא הישג הנדסי אמיתי, ועומסי עבודה בשפה הקוריאנית — נקודת החוזק המוצהרת של המודל, לצד אנגלית ויפנית — הם בדיוק המקום שבו סביר ביותר שהתוצאה הזו תהיה שווה את מחירו.
החלק המסורבל הוא כל מה שקורה אחרי הקריאה הראשונה. סבבי עוזר ארוכים, שימוש חוזר נמוך במטמון, ומשימה שלוקחת שבע דקות של פענוח לכל הרצת אינדקס — כולם מצטברים למספר שלא דומה בכלל ל-$0.10/$0.40. אם אתה בוחן אותו, הניסוי הישר הוא מבחן עלות לכל עבודה שהושלמה על עומס העבודה שלך, עם מטמון פרומפטים מופעל באופן שבו מחסנית הייצור שלך באמת תשתמש בו — לא השוואת מחירי טוקנים.
זו גם סוג הבעיה שנתב קיים כדי לפתור, והסיבה ש-OrcaRouter מעבירה הלאה את מחירי המחירון של הספקים במרווח של 0% כך ששינוי במחיר של ספק מגיע לחשבונית שלך באותו היום. אנחנו לא מנתבים מודלים של Upstage, ולכן לא Solar Mini 4 ולא Solar Pro 4 זמינים דרכנו — הם מגיעים מה-API של Upstage עצמה ומפלטפורמות צד שלישי. מה שכן אנחנו מנתבים הוא החצי השני של ההשוואה הזו: GPT-6 Luna, Qwen3.8-Max, Qwen3.8-27B, Qwen3.8-Flash ויותר מ-200 מודלים אחרים מאחורי מפתח אחד, וזה מה שהופך את זה למעשי להחזיק מודל זול ומודל יקר על אותה משימה ולתת ל-failover האוטומטי ולניתוב לפי בקשה להחליט מי מהם עונה. כשההבדל בין שני מודלים הוא פער של פי חמישה בעלות לכל משימה שאף מחירון לא חושף, היכולת להעביר בקשה בודדת ביניהם חשובה יותר מכל טבלת בנצ'מרקים.

הגרסה הקצרה: Solar Mini 4 היא נקודת הפארטו החדשה ש-Artificial Analysis משרטטת עבור מודלים עם פחות משלושה מיליארד פרמטרים פעילים, והיא יקרה בערך פי חמישה לכל משימה שהושלמה מאשר מודל שמחירו הרשום לקלט זהה. שתי האמירות האלה נכונות, והשנייה היא זו שמופיעה בחשבונית.
