
Solar Mini מול MathForm 8B: מודל אחד עונה על השאלה, והאחר הופך אותה לניתנת לבדיקה
- openaiחדשOpenAI: GPT-6.1 Sol2026-09-29$2.00 / $10.00 לכל 1M טוקנים
- anthropicחדשAnthropic: Claude Sonnet 5.52026-09-28$2.00 / $10.00 לכל 1M טוקנים · 159 tok/s
- typesafeחדשTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 לכל 1M טוקנים · 220 tok/s
- OpenAIחדשOpenAI: GPT-6 Luna2026-09-2238אינטליגנציה
- OpenAIחדשOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- AnthropicחדשAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- xAIחדשGrok 4.72026-09-2146אינטליגנציה
- OrcaחדשOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 לכל 1M טוקנים · 118 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- OpenAIOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- AnthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 לכל 1M טוקנים · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 102 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 217 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
הצב את Solar Mini 4 לצד MathForm 8B ואתה משווה בין שני מודלים שלא מתחרים על אותו טוקן. Solar Mini 4 הוא מודל תערובת מומחים דליל עם 35 מיליארד פרמטרים של Upstage, ששוחרר ב-22 בספטמבר 2026 עם כ-3 מיליארד פרמטרים פעילים לכל טוקן, והוא עונה על שאלות: לקרוא מסמך ארוך, להסיק לגביו, ולהחזיר תוצאה כתובה. MathForm 8B הוא מפרמל אוטומטי עם 8 מיליארד פרמטרים של OpenBMB, שפורסם ב-14 באוגוסט 2026 תחת Apache 2.0, והוא עושה משהו שאף מודל הסקה לא עושה בכלל — הוא לוקח הצהרה מתמטית בשפה טבעית ומנסח אותה מחדש כמשפט Lean 4 שמהדר של עוזר הוכחות יבצע עליו בדיקת טיפוסים. אחד מייצר תשובות. האחר מייצר שאלות הניתנות לבדיקה על ידי מכונה, והשני הוא המצרך הנדיר יותר.
בכל זאת, שווה לערוך את ההשוואה, מפני ששניהם מגיעים בסופו של דבר לאותו סוג של פייפליין, ומפני שלשניים יש חוזקות מנוגדות באופן שהופך את הבחירה לנקייה במיוחד. המודל של Upstage חזק במסמכים ארוכים, חלש בהסקה מורכבת, ויקר לכל משימה שהושלמה. המודל של OpenBMB צר עד כדי היותו חסר תועלת מחוץ לנישה שלו, הוערך על ידי מעריך עצמאי בכלל, ולא עולה דבר להריץ אותו ברגע שיש לך GPU.
זה לצד זה, על הדברים השונים
• מה זה — Solar Mini 4 הוא מודל הסקה כללי עם חלון הקשר של מיליון טוקנים (512K לפי התיעוד של Upstage עצמה) וציון מדוד של 24.1 במדד הבינה של Artificial Analysis. MathForm 8B הוא אוטופורמליזר בעל משימה בודדת, ללא ציון מדד מפורסם, ללא הערכה בלתי תלויה וללא טענות ליכולות כלליות.
• פרמטרים — 35B סה״כ / 3B פעילים, דליל, עבור Solar Mini 4; 8.19B צפוף עבור MathForm 8B, מכוונן עדין מ-Qwen3-8B על קורפוס FormalVerse של OpenBMB של כ-367,000 דוגמאות Lean 4 מאומתות.
• רישיון ואספקה — Solar Mini 4 הוא קנייני, נגיש דרך ה-API של Upstage ופלטפורמות צד שלישי. MathForm 8B הוא משקלים ברישיון Apache-2.0 עם תבנית צ'אט, ארבעה שברי safetensors, ומסלול פריסה של Transformers, vLLM או SGLang מאחורי נקודת קצה תואמת OpenAI.
• מחיר — Solar Mini 4 במחיר $0.10 / $0.01 במטמון / $0.40 למיליון טוקנים, כרגע בהנחה של 50% עד 22 באוקטובר 2026. ל-MathForm 8B אין מחירון; העלות שלו היא ה-GPU שאתם שמים מתחתיו.
• מהירות — 204 טוקני פלט לשנייה עבור Solar Mini 4 בהרנס של Artificial Analysis, עם 88,300 טוקני פלט לכל משימת אינדקס וכ־430 שניות עבודה לכל משימה. הפלט של MathForm 8B הוא כותרת אחת של משפט ב־Lean 4, כמה מאות טוקנים לכל היותר.
• עצמאות הנתונים שלה — Solar Mini 4 הורץ על ידי צד שלישי. MathForm 8B לא: כל נתון במאמר שלו הוא של המחברים עצמם, והמודל חדש מדי ומתמחה מדי מכדי למשוך הרצה עצמאית.
היכן שני המודלים נפגשים, והיכן הם לא

מצבי הכשל הם מה שהופך את הזיווג הזה למעניין, משום שהם הפכים גמורים. התוצאה החלשה ביותר של Solar Mini 4 שפורסמה היא Terminal-Bench 4.0 עם 1%, כשבמקביל AutomationBench-AA עומד על 22.3% — הוא גרוע באימות העבודה של עצמו בסביבה שנותנת לו משוב. כל הנחת התכנון של MathForm 8B היא אימות: OpenBMB מבחינה בין בדיקת תחביר, ששואלת אם הצהרת Lean 4 מתקמפלת, לבין בדיקת עקביות, ששואלת אם ההצהרה שקומפלה אכן אומרת את אותו הדבר כמו הבעיה הלא־פורמלית. הכשל הקלאסי שנועד למנוע הוא הצהרה שעוברת בדיקת טיפוסים אך מחלישה בשקט את הטענה.
זו הבחנה אמיתית, וכדאי להיות מדויקים לגביה. למודל חשיבה שמייצר הוכחה יש בעיית אימות עצמי ידועה: שום דבר בייצור אינו אומר לך אם התשובה נכונה. מהדר כן. אם תהליך העבודה שלך הוא "להמיר מאגר בעיות למשהו שמכונה יכולה לבדוק", MathForm 8B עושה את החצי של העבודה ש-Solar Mini 4 לא מסוגל לעשות כלל, והשאריות אינן עניין של מידה.
מספרי הספק, המסומנים ככאלה: המאמר של OpenBMB מדווח על ממוצע Pass@8 של 88.06% תחת בדיקת תחביר ו-72.37% תחת בדיקת עקביות על פני שישה בנצ'מרקים, וטוען שאלה עוקפים כמה מודלים מתמחים לפורמליזציה אוטומטית בגודל 32B. דבר מזה לא שוחזר על ידי צד שלישי. הירידה של 16 נקודות בין שתי הבדיקות היא הנתון האינפורמטיבי יותר — היא מודדת באיזו תדירות הצהרה מקומפלת אינה בדיוק הבעיה ששאלת עליה, וזו הסיבה שבדיקת עקביות קיימת כעמודה נפרדת.
למה שצוות יריץ את שניהם
כי לפייפליין הטבעי יש שלב זול בהיקף גבוה ושלב יקר בהיקף נמוך. MathForm 8B פועל על החומרה שלך וממיר בעיות לא־פורמליות לכותרות של Lean 4, עם מהדר זמין שיכול לדחות פלט פגום לפני שאדם רואה אותו. Solar Mini 4 מטפל במה שקורה סביב זה: קריאת מאמר התמיכה, חילוץ ההנחות, סיכום התוצאה בקוריאנית או באנגלית, וניתוב העבודה. השניים לעולם לא מתחרים על אותה בקשה, והקטן מביניהם הוא זה שמחזיק בחלק של העבודה עם אות אובייקטיבי של עובר/נכשל.
אף אחד מהמודלים אינו משהו שאנחנו יכולים לנתב אליך — המודלים של Upstage אינם ב-OrcaRouter וגם לא אלה של OpenBMB — כך שאם אתה רוצה את Solar Mini 4 הוא מגיע מה-API של Upstage עצמה, ואם אתה רוצה את MathForm 8B הוא מגיע מ-Hugging Face ומה-GPU שלך. מה שאנחנו כן יכולים לעשות הוא להעמיד את שאר הצינור הזה מאחורי מפתח אחד: יותר מ-200 מודלים בתוספת של 0% מעל מחיר המחירון של הספק, מעבר אוטומטי בין ספקים בעת כשל, וDSL לניתוב שמאפשר לשרשר מודלים לקריאה אחת. בתהליך עבודה שבו מומחה קטן מבצע את שלב הפורמליזציה ומודל כללי גדול עושה את כל מה שסביבו, היכולת להחליף את המודל הכללי על ידי עריכת מחרוזת מודל — במקום לשלוח אינטגרציה חדשה — היא ההבדל בין שינוי של שבועיים לבין אחר צהריים.

מה לקחת מכאן
אם השאלה שלך היא "באיזה מהם עליי להשתמש", התשובה הכנה היא שזה תלוי אם אתה צריך תשובה או פורמליזציה, ואף בנצ'מרק לא יכריע בכך. אם השאלה שלך היא "האם MathForm 8B שווה את ההורדה", התשובה היא כן למשימה צרה אחת ולא לכל דבר אחר — הוא כלי פורמליזציה, לא מוכיח, והתחייבות ההוכחה נשארת פתוחה בפלט שהוא מייצר. אם השאלה שלך היא "האם Solar Mini 4 שווה $0.36 למשימה", התשובה היא כן למסמכים ארוכים בכמות גדולה ולא לכל דבר שדורש ממנו לבדוק את העבודה של עצמו.

מקורות, לסיום. כל נתון של Solar Mini 4 לעיל הוא מדידה עצמאית של Artificial Analysis למעט חלון ההקשר, שהוא נתון של Upstage עצמה ואינו תואם את שלהם. כל נתון של MathForm 8B הוא דיווח ספק מתוך arXiv 2608.14221 ואינו משוחזר, והשחרור שלו היה ללא הודעה מוקדמת — המשקלים, מערך הנתונים FormalVerse והמאמר הופיעו כולם ב-14 באוגוסט 2026, ללא פוסט בבלוג של הספק וללא הרצת בנצ'מרק עצמאית עד היום.
