כרטיס כותרת הירו שנוצר, שעליו הכיתוב 'Solar Mini 4 vs MathForm 8B', עם כתובית המשנה 'אחד עונה על השאלה, האחר הופך אותה לניתנת לבדיקה', ושתי תגיות עם הכיתוב 'גנרליסט נגד אוטופורמליזר' ו'קומפילציה של Lean 4 בתוך הלולאה'.
Guides & Insights

Solar Mini מול MathForm 8B: מודל אחד עונה על השאלה, והאחר הופך אותה לניתנת לבדיקה

מחבר

Magnus Corvin

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים →
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

הצב את Solar Mini 4 לצד MathForm 8B ואתה משווה בין שני מודלים שלא מתחרים על אותו טוקן. Solar Mini 4 הוא מודל תערובת מומחים דליל עם 35 מיליארד פרמטרים של Upstage, ששוחרר ב-22 בספטמבר 2026 עם כ-3 מיליארד פרמטרים פעילים לכל טוקן, והוא עונה על שאלות: לקרוא מסמך ארוך, להסיק לגביו, ולהחזיר תוצאה כתובה. MathForm 8B הוא מפרמל אוטומטי עם 8 מיליארד פרמטרים של OpenBMB, שפורסם ב-14 באוגוסט 2026 תחת Apache 2.0, והוא עושה משהו שאף מודל הסקה לא עושה בכלל — הוא לוקח הצהרה מתמטית בשפה טבעית ומנסח אותה מחדש כמשפט Lean 4 שמהדר של עוזר הוכחות יבצע עליו בדיקת טיפוסים. אחד מייצר תשובות. האחר מייצר שאלות הניתנות לבדיקה על ידי מכונה, והשני הוא המצרך הנדיר יותר.

בכל זאת, שווה לערוך את ההשוואה, מפני ששניהם מגיעים בסופו של דבר לאותו סוג של פייפליין, ומפני שלשניים יש חוזקות מנוגדות באופן שהופך את הבחירה לנקייה במיוחד. המודל של Upstage חזק במסמכים ארוכים, חלש בהסקה מורכבת, ויקר לכל משימה שהושלמה. המודל של OpenBMB צר עד כדי היותו חסר תועלת מחוץ לנישה שלו, הוערך על ידי מעריך עצמאי בכלל, ולא עולה דבר להריץ אותו ברגע שיש לך GPU.

זה לצד זה, על הדברים השונים

• מה זה — Solar Mini 4 הוא מודל הסקה כללי עם חלון הקשר של מיליון טוקנים (512K לפי התיעוד של Upstage עצמה) וציון מדוד של 24.1 במדד הבינה של Artificial Analysis. MathForm 8B הוא אוטופורמליזר בעל משימה בודדת, ללא ציון מדד מפורסם, ללא הערכה בלתי תלויה וללא טענות ליכולות כלליות.

• פרמטרים — 35B סה״כ / 3B פעילים, דליל, עבור Solar Mini 4; 8.19B צפוף עבור MathForm 8B, מכוונן עדין מ-Qwen3-8B על קורפוס FormalVerse של OpenBMB של כ-367,000 דוגמאות Lean 4 מאומתות.

• רישיון ואספקה — Solar Mini 4 הוא קנייני, נגיש דרך ה-API של Upstage ופלטפורמות צד שלישי. MathForm 8B הוא משקלים ברישיון Apache-2.0 עם תבנית צ'אט, ארבעה שברי safetensors, ומסלול פריסה של Transformers, vLLM או SGLang מאחורי נקודת קצה תואמת OpenAI.

• מחיר — Solar Mini 4 במחיר $0.10 / $0.01 במטמון / $0.40 למיליון טוקנים, כרגע בהנחה של 50% עד 22 באוקטובר 2026. ל-MathForm 8B אין מחירון; העלות שלו היא ה-GPU שאתם שמים מתחתיו.

• מהירות — 204 טוקני פלט לשנייה עבור Solar Mini 4 בהרנס של Artificial Analysis, עם 88,300 טוקני פלט לכל משימת אינדקס וכ־430 שניות עבודה לכל משימה. הפלט של MathForm 8B הוא כותרת אחת של משפט ב־Lean 4, כמה מאות טוקנים לכל היותר.

• עצמאות הנתונים שלה — Solar Mini 4 הורץ על ידי צד שלישי. MathForm 8B לא: כל נתון במאמר שלו הוא של המחברים עצמם, והמודל חדש מדי ומתמחה מדי מכדי למשוך הרצה עצמאית.

היכן שני המודלים נפגשים, והיכן הם לא

A two-column comparison scoreboard titled 'Solar Mini 4 vs MathForm 8B', subtitled 'One produces answers, the other produces machine-checkable questions'. Solar Mini 4: parameters 35B total / 3B active; job reads long documents and answers; weights proprietary; price per 1M $0.10 / $0.01 / $0.40; Intelligence Index 24.05 independently measured; cost per index task $0.36; core skill long-context reasoning at 83.3% on AA-LCR; weakest result Terminal-Bench 4.0 at 1%. MathForm 8B: parameters 8.19B dense, from Qwen3-8B; job writes Lean 4 statements for a compiler; weights Apache 2.0 on Hugging Face; price per 1M self-hosted on your own GPU; Intelligence Index none, never independently scored; cost per index task not applicable; core skill a consistency check at 72.37% Pass@8 claimed; weakest result untested outside formalisation.

מצבי הכשל הם מה שהופך את הזיווג הזה למעניין, משום שהם הפכים גמורים. התוצאה החלשה ביותר של Solar Mini 4 שפורסמה היא Terminal-Bench 4.0 עם 1%, כשבמקביל AutomationBench-AA עומד על 22.3% — הוא גרוע באימות העבודה של עצמו בסביבה שנותנת לו משוב. כל הנחת התכנון של MathForm 8B היא אימות: OpenBMB מבחינה בין בדיקת תחביר, ששואלת אם הצהרת Lean 4 מתקמפלת, לבין בדיקת עקביות, ששואלת אם ההצהרה שקומפלה אכן אומרת את אותו הדבר כמו הבעיה הלא־פורמלית. הכשל הקלאסי שנועד למנוע הוא הצהרה שעוברת בדיקת טיפוסים אך מחלישה בשקט את הטענה.

זו הבחנה אמיתית, וכדאי להיות מדויקים לגביה. למודל חשיבה שמייצר הוכחה יש בעיית אימות עצמי ידועה: שום דבר בייצור אינו אומר לך אם התשובה נכונה. מהדר כן. אם תהליך העבודה שלך הוא "להמיר מאגר בעיות למשהו שמכונה יכולה לבדוק", MathForm 8B עושה את החצי של העבודה ש-Solar Mini 4 לא מסוגל לעשות כלל, והשאריות אינן עניין של מידה.

מספרי הספק, המסומנים ככאלה: המאמר של OpenBMB מדווח על ממוצע Pass@8 של 88.06% תחת בדיקת תחביר ו-72.37% תחת בדיקת עקביות על פני שישה בנצ'מרקים, וטוען שאלה עוקפים כמה מודלים מתמחים לפורמליזציה אוטומטית בגודל 32B. דבר מזה לא שוחזר על ידי צד שלישי. הירידה של 16 נקודות בין שתי הבדיקות היא הנתון האינפורמטיבי יותר — היא מודדת באיזו תדירות הצהרה מקומפלת אינה בדיוק הבעיה ששאלת עליה, וזו הסיבה שבדיקת עקביות קיימת כעמודה נפרדת.

למה שצוות יריץ את שניהם

כי לפייפליין הטבעי יש שלב זול בהיקף גבוה ושלב יקר בהיקף נמוך. MathForm 8B פועל על החומרה שלך וממיר בעיות לא־פורמליות לכותרות של Lean 4, עם מהדר זמין שיכול לדחות פלט פגום לפני שאדם רואה אותו. Solar Mini 4 מטפל במה שקורה סביב זה: קריאת מאמר התמיכה, חילוץ ההנחות, סיכום התוצאה בקוריאנית או באנגלית, וניתוב העבודה. השניים לעולם לא מתחרים על אותה בקשה, והקטן מביניהם הוא זה שמחזיק בחלק של העבודה עם אות אובייקטיבי של עובר/נכשל.

אף אחד מהמודלים אינו משהו שאנחנו יכולים לנתב אליך — המודלים של Upstage אינם ב-OrcaRouter וגם לא אלה של OpenBMB — כך שאם אתה רוצה את Solar Mini 4 הוא מגיע מה-API של Upstage עצמה, ואם אתה רוצה את MathForm 8B הוא מגיע מ-Hugging Face ומה-GPU שלך. מה שאנחנו כן יכולים לעשות הוא להעמיד את שאר הצינור הזה מאחורי מפתח אחד: יותר מ-200 מודלים בתוספת של 0% מעל מחיר המחירון של הספק, מעבר אוטומטי בין ספקים בעת כשל, וDSL לניתוב שמאפשר לשרשר מודלים לקריאה אחת. בתהליך עבודה שבו מומחה קטן מבצע את שלב הפורמליזציה ומודל כללי גדול עושה את כל מה שסביבו, היכולת להחליף את המודל הכללי על ידי עריכת מחרוזת מודל — במקום לשלוח אינטגרציה חדשה — היא ההבדל בין שינוי של שבועיים לבין אחר צהריים.

A screenshot of the Hugging Face model card for openbmb/MathForm-8B showing the Apache-2.0 licence, the English language tag, the openbmb/FormalVerse dataset, the formal-verification and autoformalization tags, three safetensors shards at an 8B BF16 model size, the paper title 'MathForm: Scaling Mathematical Autoformalization with Knowledge Retrieval and Verification-Guided Refinement', the description that MathForm 8B translates natural-language mathematical statements into Lean 4 and was trained on FormalVerse through supervised fine-tuning followed by reinforcement learning using Lean compilation and semantic-consistency feedback, and a model tree showing Qwen/Qwen3-8B-Base as its base model.

מה לקחת מכאן

אם השאלה שלך היא "באיזה מהם עליי להשתמש", התשובה הכנה היא שזה תלוי אם אתה צריך תשובה או פורמליזציה, ואף בנצ'מרק לא יכריע בכך. אם השאלה שלך היא "האם MathForm 8B שווה את ההורדה", התשובה היא כן למשימה צרה אחת ולא לכל דבר אחר — הוא כלי פורמליזציה, לא מוכיח, והתחייבות ההוכחה נשארת פתוחה בפלט שהוא מייצר. אם השאלה שלך היא "האם Solar Mini 4 שווה $0.36 למשימה", התשובה היא כן למסמכים ארוכים בכמות גדולה ולא לכל דבר שדורש ממנו לבדוק את העבודה של עצמו.

A screenshot of Upstage's blog post headlined 'Solar Mini 4: Built for High-Volume Agent Workloads', with the summary line 'Only 3B active parameters per token, with leading performance in its class and lower costs for repetitive agent workloads' and a View API Docs link.

מקורות, לסיום. כל נתון של Solar Mini 4 לעיל הוא מדידה עצמאית של Artificial Analysis למעט חלון ההקשר, שהוא נתון של Upstage עצמה ואינו תואם את שלהם. כל נתון של MathForm 8B הוא דיווח ספק מתוך arXiv 2608.14221 ואינו משוחזר, והשחרור שלו היה ללא הודעה מוקדמת — המשקלים, מערך הנתונים FormalVerse והמאמר הופיעו כולם ב-14 באוגוסט 2026, ללא פוסט בבלוג של הספק וללא הרצת בנצ'מרק עצמאית עד היום.