
Ember-1 לעומת MathForm-8B: שני מודלים שנבנו על ידי צמצום של בסיס מושאל
- openaiחדשOpenAI: GPT-6 Luna2026-09-2237אינטליגנציה
- openaiחדשOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- anthropicחדשAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- grokחדשGrok 4.72026-09-2146אינטליגנציה
- OrcaחדשOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 לכל 1M טוקנים · 177 tok/s
- orcaחדשOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 1323 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- openaiOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- googleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- anthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0540אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0345אינטליגנציה76כתיבת קוד
ל-Ember-1 ול-MathForm-8B יש אסטרטגיה משותפת שאף אחת מהמעבדות לא מציגה ככזו: שתיהן צמצומים של מודל שמישהו אחר אימן. Ember-1 הוא נגזרת מתמחה של Fireworks Research של Kimi K3 מבית Moonshot AI, שפורסמה ב-23 בספטמבר 2026 ואומנה מחדש כך שהיא מגיעה לדיוק של K3 בכ-40% פחות טוקנים. MathForm-8B הוא מודל האוטופורמליזציה בעל 8B של OpenBMB, ששוחרר בשקט ב-14 באוגוסט 2026 ככיוונון עדין ברישיון Apache-2.0 של Qwen3-8B של Alibaba, שהופך מתמטיקה לא־פורמלית להצהרות משפט ב-Lean 4 שמהדר יכול לבדוק. צמצום אחד הסיר התלבטות מבוזבזת ושמר על היכולת הכללית ללא פגע. האחר הסיר כמעט את כל היכולת הכללית ובמקומה קנה יכולת אימות. הצבתם זו לצד זו היא הדרך הנקייה ביותר לראות מה באמת עולה התמחות, מפני ששני המודלים הוציאו את תקציבי האימון שלהם בצדדים מנוגדים של אותו מאזן.
שני סוגי הצרה
ההתערבות של Fireworks Research היא התנהגותית. Ember-1 שומר על הארכיטקטורה של Kimi K3 ועל רוחב היריעה שלה — מתמטיקה, קידוד, מעקב אחר הוראות, שיחה, חיפוש, שימוש בכלים והנדסת תוכנה — כולם מופיעים בתמהיל האימון — ומשנה רק את משך הזמן שבו המודל מהרהר לפני שהוא עונה. התוצאה המדווחת היא שאורך ההיסק ירד ב-35–50% בלי אובדן דיוק בשבעה מבחני ביצוע ובשתי בדיקות A/B בייצור של לקוחות, כאשר עומס קידוד ייצורי אחד ירד מ-49.3K ל-29.9K אסימוני פלט בעוד שהציון שלו נותר 0.753 לעומת 0.751. כל נתון מדווח על ידי הספק ולא שוחזר.
ההתערבות של OpenBMB היא חוזית. MathForm-8B לוקח את Qwen3-8B ומפנה את כל תקציב האימון לצורת פלט אחת: הצהרת Lean 4 עם כותרת imports ומשפט בעל שם. הצינור הוא כיוונון עדין מפוקח על FormalVerse — קורפוס של כ-367,000 דוגמאות Lean 4 מאומתות ש-OpenBMB בנתה ושחררה לצד המודל — ואחריו למידת חיזוק שמשתמשת בקומפילציה של Lean ובמשוב של עקביות סמנטית כאות התגמול. המודל לא פותר הוכחות. הוא כותב את ההצהרה שמוכיח יסיים, והמסגור של המאמר עצמו מתאר את ההערכה בת שישה מבחנים כמטרת התרגיל.

מה שכל אחד ויתר עליו
Ember-1 ויתר על מעט מאוד על הנייר, וזו כל הטענה. הגיליון המפורסם שלו מציג ניצחון ב-Terminal Bench 2.1 עם 82.0% מול 80.9% של Kimi K3 Max וב-DeepSWE 1.1 עם 75.2% מול 66.4%, והפסדים קטנים ב-SWE-bench Verified עם 92.2% מול 93.2% וב-SWE-Interact עם 20.0% מול 21.3%. אלה מספרים של ספק על סטים שנבחרו בידי הספק, אבל הצורה עקבית: מודל שלא איבד יכולת אלא יותר הפנה מחדש את היכן שהוא משקיע מאמץ. עם זאת, חיסכון הטוקנים נע בין 51.9% ב-Terminal Bench ל-5.9% ב-τ-2 Bench Airline, כך ש"כ-40%" הוא ממוצע על פני טווח רחב מאוד.
MathForm-8B ויתר על רוב מה ש-Qwen3-8B ידוע בזכותו. הוא לא מנהל שיחה כללית, לא מכסה את 119 השפות והדיאלקטים שעליהם אומן Qwen3-8B, ואינו מקבל תמונות או אודיו. תקציב היצירה שלו מותאם לפלט Lean, ולא לחשיבה מעורבת ממושכת. מה שכן שמר הוא רישיון מתירני וטביעת רגל קטנה: ארבעה שברי safetensors ב-BF16, הפועלים תחת Transformers, vLLM או SGLang מאחורי נקודת קצה תואמת OpenAI, עם נתיב קומפילציה שמצפה ל-Kimina Lean Server על Lean 4.21.0.
המספרים מודדים דברים שונים, והפער הוא העיקר.
הנתון הראשי של Ember-1 הוא אחוז המשימות שהושלמו כהלכה על ידי סוכן — Terminal Bench 2.1, 89 דגימות, 82.0%. הנתונים הראשיים של MathForm-8B הם ציוני Pass@8 ממוצעים על פני שישה מבחני אוטופורמליזציה: 88.06% תחת בדיקת תחביר ו-72.37% תחת בדיקת עקביות מחמירה יותר. אלה אינם על אותו ציר. האחד מודד אם סוכן סיים עבודה במסוף; האחר מודד אם הצהרת משפט שנוצרה עוברת ניתוח תחבירי ואם משמעותה זהה לזו של הבעיה הבלתי-פורמלית שממנה באה.
הפער של 88.06 לעומת 72.37 בתוך התוצאות של MathForm עצמו הוא המספר שמלמד יותר. הפער בין "זה מתקמפל" לבין "זה מתקמפל ואומר את מה שהתכוונתי" הוא בערך שש-עשרה נקודות, וזהו מצב הכשל שהופך את האוטופורמליזציה לקשה: הצהרה שעוברת בדיקת טיפוסים בעודה מחלישה בשקט את הטענה המקורית גרועה משגיאה גלויה, כי שום דבר בהמשך לא מתריע עליה. בקבוצות הקשות ביותר בדיקת העקביות יורדת ל-63% ב-FATE-H ול-37% ב-FATE-X, בעוד שקבוצות קלות כמו FormalIMATH עומדות על 95.06% ו-ProverBench על 94.83%. זהו מומחה שמגלה כנות באשר לחולשות של מומחה, וזה שימושי יותר מממוצע בודד.
הניגוד, ממד אחר ממד
• מודל בסיס — Ember-1: Kimi K3. MathForm-8B: Qwen3-8B.
• מה שהאימון שינה — Ember-1: כמה זמן המודל מבצע הסקה, כאשר היכולת נשמרת קבועה. MathForm-8B: מה המודל מפיק, כאשר הכלליות מוקרבת במידה רבה.
• פרמטרים — Ember-1: לא ידוע. MathForm-8B: ~8B, צפוף, BF16.
• חוזה פלט — Ember-1: טקסט רגיל וקריאות לכלים, באיכות ברמת K3. MathForm-8B: הצהרת Lean 4 עם כותרת ומשפט בעל שם.
• רישיון ומשקלות — Ember-1: לא פורסם דבר; תצוגה מקדימה למחקר דרך הפלטפורמה של הספק עצמו. MathForm-8B: Apache 2.0, גם המשקלות וגם מערך הנתונים ניתנים להורדה.
• כותרת מדווחת — Ember-1: 82.0% ב-Terminal Bench 2.1 עם 51.9% פחות טוקנים. MathForm-8B: 88.06% ממוצע Pass@8 תחת בדיקת תחביר, 72.37% תחת בדיקת עקביות.
• אימות בלתי תלוי — אף אחד מהם; שניהם דווחו על ידי הספק ולא שוחזרו.

שורת הרישיון מכריעה יותר מהבנצ'מרקים
למרות כל ההבדל המספרי, ההבדל המעשי בין שתי ההשקות האלה הוא בהפצה. MathForm-8B הוא קובץ. OpenBMB פרסמה את המשקולות, את מערך הנתונים FormalVerse ואת המאמר באותו יום, תחת Apache 2.0, בלי הודעה מוקדמת ובלי API מתארח — כרטיס המודל הוא ההשקה. אפשר להוריד אותו היום אחר הצהריים ולהריץ אותו על GPU בודד, ואף אחד לא יכול לקחת אותו בחזרה. Ember-1 הוא שירות. אין משקולות, אין מחיר מפורסם, וחלון הגישה מתואר כתקופה חסרת שרת של שבועיים, שהמשכה תלוי בביקוש. אפשר לקרוא לו היום, אבל אי אפשר להיות בטוחים שאפשר יהיה לקרוא לו בנובמבר.
ההבדל הזה גם קובע עבור מה יכול לשמש כל מודל. רכיב פורמליזציה שייך בתוך פייפליין שאתה שולט בו, נעוץ לגרסה, עם שרשרת הכלים של Lean על אותה מכונה — זו הסיבה לכך שצ'קפוינט Apache-2.0 ללא הגבלת גישה הוא הצורה הנכונה למשימה של MathForm-8B, ולכך שהקישור החסר לקוד ב-GitHub ב-README שלו (עדיין ממלא מקום במועד הכתיבה) הוא פער מעצבן יותר מכל מספר בנצ'מרק. מודל שעלות ההנמקה שלו היא השיקול המרכזי — מקומו מאחורי API, שבו חשבון הטוקנים הוא הדבר שמייעלים, ושבו ספקים מתחרים על מחיר ושהיה. הצורה של Ember-1 מתאימה גם היא למשימה שלו; זה רק אומר שהתלות היא מסחרית ולא טכנית.
כאשר פייפליין ישתמש בשניהם
שני המודלים הללו משלימים זה את זה ולא מתחרים, וההרכב קל לתיאור: מומחה לפורמליזציה ממיר בעיה להצהרה ניתנת לבדיקה, ומודל הסקה עובד על ההצהרה או על ההנדסה הסובבת. אף אחד מהם לא נמצא ב-OrcaRouter — MathForm-8B מופעל באירוח עצמי בלבד, ו-Ember-1 נמצא בתצוגה המקדימה של הספק — אבל ההרכב עצמו הוא דפוס שה-routing DSL שלנו קיים עבורו.הרכבת מספר מודלים לקריאה אחת היא האופן שבו צינור עיבוד משיג מומחה וכללן מבלי לתחזק שני נתיבי אינטגרציה ושני חוזים, ומיזוג מודלים הולך צעד אחד רחוק יותר בכך שהוא מאפשר לפאנל של מודלים להשיב יחד כאשר אופן הכשל של מודל בודד הוא יקר.
במיוחד עבור סטאק פורמליזציה, הטיעון בעד קומפוזיציה חזק מן הרגיל. מצב הכשל הנראה לעין הוא הצהרה שעוברת קומפילציה אך משמעותה שונה במעט, וההגנה הזולה ביותר מפני שגיאה שקטה היא מודל שני שקורא את אותה הבעיה — שהרי זו החלטת ניתוב, לא החלטת אימון.
מהי הקנייה הטובה יותר
אם אתה צריך מתמטיקה ניתנת לבדיקה ממוחשבת, MathForm-8B הוא היחיד מבין השניים שמייצר בכלל משהו כזה, והמחיר העיקרי שלו הוא הכלליות שממילא לא התכוונת להשתמש בה למשימה הזו. הורד אותו, הקצה תקציב לשרת Lean, ובנה הערכה משלך — המאמר של OpenBMB לא יגיד לך כיצד הוא מתפקד בהתפלגות שלך.
אם אתה צריך מנוע הסקה כללי עם עלות טוקנים נמוכה יותר, Ember-1 מיועד עבורך, והשלב הבא הנכון הוא תעבורת צל מול מה שאתה מריץ היום ולא השוואת בנצ'מרקים. הסיכון שלו הוא זמינות, לא יכולת, ואת הסיכון הזה אתה יכול לגדר על ידי שמירה על שכבת הניתוב בין היישום שלך למודל.
המסקנה הלא-נוחה למי שמקווה שאחד מאלה יכריע את השאלה היא שאף אחד מהם לא הוערך באופן בלתי תלוי. MathForm-8B פומבי כבר שישה שבועות ואף גורם שלישי לא פרסם שחזור; Ember-1 פומבי כבר יום. שניהם מבקשים ממך להיות המעריך, וזה המצב הרגיל בבחירת מודל מתמחה ב-2026.

מה שהם כן מוכיחים הוא שאסטרטגיית הצמצום עובדת בשני הכיוונים. אפשר להוזיל מודל חזית בלי להפוך אותו לגרוע יותר, ואפשר להפוך מודל בסיס קטן לקפדני על ידי כיוון האימון שלו אל מהדר. השאלה המעניינת אינה איזו משתי הגישות מנצחת, אלא כמה זמן עוד כל אחת מהן תישאר הכרחית לאחר שהטכניקות שבהן יהפכו לפרקטיקה סטנדרטית.
