
TwIL-LM3-Pro מול MathForm 8B: הצהרה והסקה הן שני חצאים שונים של פורמליזציה
- openaiחדשOpenAI: GPT-6.1 Sol2026-09-2952אינטליגנציה
- anthropicחדשAnthropic: Claude Sonnet 5.52026-09-2856אינטליגנציה
- typesafeחדשTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 לכל 1M טוקנים · 219 tok/s
- OpenAIחדשOpenAI: GPT-6 Luna2026-09-2238אינטליגנציה
- OpenAIחדשOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- AnthropicחדשAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- xAIחדשGrok 4.72026-09-2146אינטליגנציה
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 לכל 1M טוקנים · 118 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- OpenAIOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- AnthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 לכל 1M טוקנים · 47 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
TwIL-LM3-Pro וMathForm-8B מכוונים לאותה בעיה רחבה — לגרום למכונה להפיק טקסט פורמלי, שניתן לבדוק, ולא פרוזה סבירה — והם פותרים חצאים שונים שלה. MathForm-8B הוא אוטופורמלייזר בעל 8 מיליארד פרמטרים של OpenBMB, שיצא באוגוסט 2026: בהינתן בעיה מתמטית בשפה פשוטה, הוא פולט את הצהרת Lean 4 של אותה בעיה, ומשאיר את חובת ההוכחה פתוחה לבדיקת מהדר. TwIL-LM3-Pro הוא מודל לוגיקה פורמלית של webAI בעל 3.66 מיליארד פרמטרים מספטמבר 2026, ופלטי היעד שלו הם תוויות גרירה, תרגומים ללוגיקה מסדר ראשון, ניתוחים סמנטיים וביקורות הוכחה ב-Lean. האחד מייצר את הדבר שיש לבדוק. האחר אומר לך אם הדבר שיש לך גורר את מה שאתה טוען.
מכיוון ששניהם חופפים בנתיב אחד בדיוק — פורמליזציה ב־Lean — דף השוואה הוא מפתה ומטעה. השאלה המועילה יותר היא לשם מה אומן כל אחד מהם לקבל תגמול, משום שאות התגמול הוא הנקודה שבה שני העיצובים נבדלים זה מזה בצורה החדה ביותר, ושבה מצויה למעשה הבחירה החכמה יותר.
הצהרה לעומת גרירה
MathForm-8B מאומן על FormalVerse, קורפוס Lean 4 שהמאמר של OpenBMB מתאר ככ-367,000 דוגמאות מאומתות, באמצעות כוונון עדין מפוקח ולאחריו למידת חיזוק. הצינור סביבו מאחזר הגדרות רלוונטיות ופורמליזציות קיימות מ-Mathlib לפני היצירה, ואז משפר באמצעות אבחוני מהדר ובדיקת עקביות סמנטית. הפלט שלו הוא הצהרה פורמלית — ייבוא, טיפוסים, כותרת משפט — שמהדר חיצוני מקבל או דוחה. כרטיס המודל מבהיר במפורש שהוא אינו פותר את הבעיה ואינו מתיימר לעשות זאת; ההוכחה היא עבודה של מישהו אחר.
TwIL-LM3-Pro מגיע לאותו תחום מהצד הלוגי. צינור העיבוד שלו היה מכוון לשישה יעדים: תרגום לוגיקה מסדר ראשון, תיוג גרירה, ניתוח סמנטי, פורמליזציה ב-Lean, ביקורת הוכחות ב-Lean ואינדוקציה של כללים. בעוד MathForm בנויה לפלוט טענה, TwIL-LM3-Pro בנוי להכריע לגבי טענות — האם זו נגררת, האם הניתוח הזה נכון, האם ניסיון ההוכחה הזה תקף. היא גם מבצעת פורמליזציה, וזה המקום היחיד שבו שני המודלים ברי השוואה ממש ולא רק סמוכים.
תגמול ממהדר לעומת תגמול מנותן ניקוד
זהו ההבדל התכנוני שמשנה, ושני הספקים מתעדים אותו.
תגמול האימון של MathForm הגיע מהידור של Lean וממשוב לעקביות סמנטית. מהדר הוא אורקל: הוא או מקבל את הפורמליזציה או לא, ואין קרדיט חלקי ואין עם מה להתווכח. זהו אות התגמול הנקי ביותר בפינה הזאת של למידת מכונה, ולכן מבחני אוטופורמליזציה מדווחים כשיעורי הצלחה — המדד נמצא במורד הזרם של תוכנית שלא אכפת לה ממה שמישהו מאמין.
השלב הסופי של TwIL-LM3-Pro היה הרצת GRPO משוקללת אנטרופיה מול מאמת פרוגרמטי, כאשר הכרטיס של המודל עצמו מתאר ניקוד חלקי עבור התאמות רופפות ו-token-F1 כך שקבוצות פרומפט שבהן הכל נכשל עדיין מייצרות גרדיאנט. שער המאקרו הראשי שלו הוא הממוצע במשקל שווה של ארבעה מסלולי סיווג חסומים בתוספת אינדוקציה של כללים, ובשער זה מסלולי הבחירה המרובה והפרוצדורליים מזוכים כ-`max(exact_match, loose_match)` — כלל שהכרטיס מציין בפשטות, מכיוון שתשובה נכונה המעוצבת אחרת היא חפץ עיצוב ולא כשל בהיסק.
אף אחד מהעיצובים אינו גרוע יותר. הם מכווננים להשלכות שונות. תגמול מדורג על ידי קומפיילר מייצר מודל שאתה יכול להצביע על בעיית פורמליזציה קשה ולסמוך על הפלט שלו, כי הפלט ניתן לאימות. תגמול מדורג על ידי מעריך עם ניקוד חלקי מייצר מודל שניתן לאמן על שיפוטים מעורפלים יותר — הטמעה, ביקורת, הסקת כללים — שבהם אין קומפיילר שיכול לשפוט, והחלופה היא בכלל לא לאמן על אותם מסלולים. המחיר הוא שהמספרים המתקבלים טובים רק כמו מערכת ההערכה, ו-webAI אומרת זאת: השורה strict-7 שלה, שמסירה כל שמץ של ניקוד התאמה רופפת, קיימת בדיוק כדי שקורא יוכל לראות את הנתון המחמיר יותר לצד הנתון הכותרתי.
הציונים אינם על אותו סרגל
שני המודלים מפרסמים מספרים הקרובים ל-Lean ולא ניתן להחסיר אותם. המאמר של MathForm מדווח על ממוצע Pass@8 של 88.06% תחת בדיקת תחביר ו-72.37% תחת בדיקת עקביות על פני שישה מדדי Lean, עם שיעורי מעבר של 63% ו-37% בבדיקת עקביות על תת-הקבוצות הקשות יותר FATE-H ו-FATE-X, וטוען לביצועים טובים יותר מכמה מאוטומטים פורמליים מתמחים של 32B. הכרטיס של TwIL-LM3-Pro מדווח על token-F1 של `lean_formalize` של 0.5092 ודיוק של `lean_critic` של 0.7950 על מערכת ה-Track A שלו.
Pass@8 תחת בדיקת מהדר ו-token-F1 מול מחרוזת ייחוס מודדים דברים שונים. Pass@8 נותן למודל שמונה ניסיונות ושואל אם אחד מהם עבר קומפילציה ונשאר עקבי; token-F1 מדד עד כמה יצירה בודדת תאמה לייחוס. מודל יכול לקבל ציון גבוה באחד ונמוך באחר, ושום דבר באף אחד מהמסמכים אינו מתיר לקרוא את השניים זה לצד זה.
הסיכום הכנה של תיעוד הבנצ'מרק הוא שהראיות של MathForm-8B מגיעות ממאמר עם מהדר בלולאה, ושל TwIL-LM3-Pro מגיעות מרתמת ספק עם מעריך בלולאה, ואף צד שלישי לא הריץ את שניהם דרך רובריקה אחת. התייחס לכל עמוד שמציב "88.06%" לצד "0.5092" כאילו היו תוצאת משחק, כאל עמוד שלא קרא את ההגדרות.
מפרטים, זה לצד זה
• פרמטרים — TwIL-LM3-Pro 3.66B צפוף לעומת MathForm-8B 8B, בערך פי 2.2 בגודל.
• מודל בסיס — `ibm-granite/granite-4.2-3b` לעומת `Qwen/Qwen3-8B`.
• נתוני אימון — קורפוס סינתטי של לוגיקה פורמלית המכסה שישה יעדים לעומת FormalVerse, כ-367,000 דוגמאות Lean 4 מאומתות.
• תגמול — מאמת פרוגרמטי עם זיכוי חלקי וסובלנות להתאמה רופפת לעומת הידור Lean ומשוב של עקביות סמנטית.
• פלט ראשי — תוויות גרירה, תרגומי FOL, ניתוחים סמנטיים, הצהרות Lean וביקורות הוכחה מול הצהרת Lean 4 לבדיקת מהדר.
• חלון הקשר — 131,072 אסימונים עבור TwIL-LM3-Pro, נמדד בתוך 8,192 אסימונים; MathForm-8B מוגש עם תקציבי יצירה של עד 16,384 אסימונים בדוגמת השימוש שלו.
• רישיון — webAI Non-Commercial License ver. 1.0 לעומת Apache 2.0.
• טביעת רגל מכומתת — TwIL-LM3-Pro מגיע עם Q4_K_M GGUF בנפח 2.09 GiB עבור CPU או 4 GB של VRAM; MathForm-8B אינו מפרסם GGUF במאגר שלו.
הרישיון מכריע שוב בשאלת הייצור
MathForm-8B הוא Apache 2.0. אפשר לבצע בו כיוונון עדין, להפיץ אותו מחדש ולהריץ אותו בתוך מוצר מסחרי. TwIL-LM3-Pro אינו מסחרי: שימוש למחקר ולשימוש אישי מותר, ופריסה שמייצרת הכנסות מחייבת הסכם נפרד עם webAI, שדרכו המסחרית היא הסדר ארגוני ולא מחירון מפורסם.
עבור קבוצת מחקר או סטודנט, ההבדל הזה לא רלוונטי — שני המודלים זמינים להורדה ללא הגבלת גישה ב-Hugging Face. עבור חברה, הוא מכריע, והוא מצביע על MathForm-8B לכל עבודת אוטופורמליזציה בסביבת ייצור, ללא קשר לשאלה איזה מודל מקבל ציון טוב יותר במסלול שאף ספק לא מדד באותו אופן.
היכן יושב הנתב בצינור הזה
לא TwIL-LM3-Pro ולא MathForm-8B הוא נתיב בקטלוג של OrcaRouter, והסיבות שונות: האחד ברישיון לא-מסחרי ללא נקודת קצה מתארחת, והאחר מפורסם כצ'קפוינט פתוח לאירוח עצמי. שאלת הניתוב בצינור פורמליזציה היא השכבה שסביבם. בניית קורפוס בסגנון FormalVerse פירושה יצירת אלפי בעיות לא-פורמליות, סינון שלהן לתקינות מבנית, וכתיבת בדיקות העקביות הסמנטית שמדרגות את הפלט — כולן קריאות טקסט, וכולן מסוג העבודה שבה רוצים להחליף את המודל שמייצר נתונים בכמות גדולה במודל ששופט אותם בלי חוזה נוסף. על נקודת קצה אחת תואמת OpenAI שמאחוריה יותר מ-200 מודלים במחיר המחירון של הספק עם תוספת של 0%, החלפה כזו היא שינוי בקונפיגורציה, והורדת מחיר של ספק על מודל היצירה מגיעה באותו יום. מעבר אוטומטי לגיבוי הוא קריטי בבניית קורפוס במיוחד מפני שמשימה שמתה בשני שלישים מהדרך של סבב יצירה עולה את כל הריצה.

חלוקת העבודה
אם המשימה היא להפוך מתמטיקה מספרי לימוד להצהרות Lean בנות-הידור בקנה מידה, והתוצאה צריכה לצאת במוצר מסחרי, MathForm-8B הוא הכלי ורישיון Apache 2.0 הוא הסיבה לכך. אם המשימה היא להחליט אם גוף טקסט גורר טענה, לתייג גרירה, לבצע ניתוח סמנטי, או לבקר ניסיון הוכחה, TwIL-LM3-Pro מכסה תחום ש-MathForm מעולם לא נועד לו — והרישיון הבלתי-מסחרי שלו מהווה גבול לגבי היכן שניתן להשתמש ביכולת הזו, ולא נקודה לרעת היכולת עצמה.
השילוב ההגיוני הוא תהליך דו-שלבי ולא בחירה: מודל אחד מפיק את ההצהרה הפורמלית, והשני שופט אותה. שניהם פרסמו את התהליך שהפיק אותם, וזה יוצא דופן בגודל הזה, וזו הסיבה שאפשר בכלל לערוך את ההשוואה הזו.


