כרטיס כותרת שנוצר שכותרתו 'TwIL-LM3-Pro לעומת MathForm 8B', עם כותרת משנה 'הצהרה לעומת גרירה', ושתי כרטיסיות מעוגלות שעליהן כתוב 'MathForm 8B - מפיק את ההצהרה ב-Lean 4' ו-'TwIL-LM3-Pro - שופט את ההצהרה'. הלוגו של OrcaRouter משולב בפינה הימנית התחתונה.
Guides & Insights

TwIL-LM3-Pro מול MathForm 8B: הצהרה והסקה הן שני חצאים שונים של פורמליזציה

מחבר

Alistair Wren

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים →
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

TwIL-LM3-Pro וMathForm-8B מכוונים לאותה בעיה רחבה — לגרום למכונה להפיק טקסט פורמלי, שניתן לבדוק, ולא פרוזה סבירה — והם פותרים חצאים שונים שלה. MathForm-8B הוא אוטופורמלייזר בעל 8 מיליארד פרמטרים של OpenBMB, שיצא באוגוסט 2026: בהינתן בעיה מתמטית בשפה פשוטה, הוא פולט את הצהרת Lean 4 של אותה בעיה, ומשאיר את חובת ההוכחה פתוחה לבדיקת מהדר. TwIL-LM3-Pro הוא מודל לוגיקה פורמלית של webAI בעל 3.66 מיליארד פרמטרים מספטמבר 2026, ופלטי היעד שלו הם תוויות גרירה, תרגומים ללוגיקה מסדר ראשון, ניתוחים סמנטיים וביקורות הוכחה ב-Lean. האחד מייצר את הדבר שיש לבדוק. האחר אומר לך אם הדבר שיש לך גורר את מה שאתה טוען.

מכיוון ששניהם חופפים בנתיב אחד בדיוק — פורמליזציה ב־Lean — דף השוואה הוא מפתה ומטעה. השאלה המועילה יותר היא לשם מה אומן כל אחד מהם לקבל תגמול, משום שאות התגמול הוא הנקודה שבה שני העיצובים נבדלים זה מזה בצורה החדה ביותר, ושבה מצויה למעשה הבחירה החכמה יותר.

הצהרה לעומת גרירה

MathForm-8B מאומן על FormalVerse, קורפוס Lean 4 שהמאמר של OpenBMB מתאר ככ-367,000 דוגמאות מאומתות, באמצעות כוונון עדין מפוקח ולאחריו למידת חיזוק. הצינור סביבו מאחזר הגדרות רלוונטיות ופורמליזציות קיימות מ-Mathlib לפני היצירה, ואז משפר באמצעות אבחוני מהדר ובדיקת עקביות סמנטית. הפלט שלו הוא הצהרה פורמלית — ייבוא, טיפוסים, כותרת משפט — שמהדר חיצוני מקבל או דוחה. כרטיס המודל מבהיר במפורש שהוא אינו פותר את הבעיה ואינו מתיימר לעשות זאת; ההוכחה היא עבודה של מישהו אחר.

TwIL-LM3-Pro מגיע לאותו תחום מהצד הלוגי. צינור העיבוד שלו היה מכוון לשישה יעדים: תרגום לוגיקה מסדר ראשון, תיוג גרירה, ניתוח סמנטי, פורמליזציה ב-Lean, ביקורת הוכחות ב-Lean ואינדוקציה של כללים. בעוד MathForm בנויה לפלוט טענה, TwIL-LM3-Pro בנוי להכריע לגבי טענות — האם זו נגררת, האם הניתוח הזה נכון, האם ניסיון ההוכחה הזה תקף. היא גם מבצעת פורמליזציה, וזה המקום היחיד שבו שני המודלים ברי השוואה ממש ולא רק סמוכים.

תגמול ממהדר לעומת תגמול מנותן ניקוד

זהו ההבדל התכנוני שמשנה, ושני הספקים מתעדים אותו.

תגמול האימון של MathForm הגיע מהידור של Lean וממשוב לעקביות סמנטית. מהדר הוא אורקל: הוא או מקבל את הפורמליזציה או לא, ואין קרדיט חלקי ואין עם מה להתווכח. זהו אות התגמול הנקי ביותר בפינה הזאת של למידת מכונה, ולכן מבחני אוטופורמליזציה מדווחים כשיעורי הצלחה — המדד נמצא במורד הזרם של תוכנית שלא אכפת לה ממה שמישהו מאמין.

השלב הסופי של TwIL-LM3-Pro היה הרצת GRPO משוקללת אנטרופיה מול מאמת פרוגרמטי, כאשר הכרטיס של המודל עצמו מתאר ניקוד חלקי עבור התאמות רופפות ו-token-F1 כך שקבוצות פרומפט שבהן הכל נכשל עדיין מייצרות גרדיאנט. שער המאקרו הראשי שלו הוא הממוצע במשקל שווה של ארבעה מסלולי סיווג חסומים בתוספת אינדוקציה של כללים, ובשער זה מסלולי הבחירה המרובה והפרוצדורליים מזוכים כ-`max(exact_match, loose_match)` — כלל שהכרטיס מציין בפשטות, מכיוון שתשובה נכונה המעוצבת אחרת היא חפץ עיצוב ולא כשל בהיסק.

אף אחד מהעיצובים אינו גרוע יותר. הם מכווננים להשלכות שונות. תגמול מדורג על ידי קומפיילר מייצר מודל שאתה יכול להצביע על בעיית פורמליזציה קשה ולסמוך על הפלט שלו, כי הפלט ניתן לאימות. תגמול מדורג על ידי מעריך עם ניקוד חלקי מייצר מודל שניתן לאמן על שיפוטים מעורפלים יותר — הטמעה, ביקורת, הסקת כללים — שבהם אין קומפיילר שיכול לשפוט, והחלופה היא בכלל לא לאמן על אותם מסלולים. המחיר הוא שהמספרים המתקבלים טובים רק כמו מערכת ההערכה, ו-webAI אומרת זאת: השורה strict-7 שלה, שמסירה כל שמץ של ניקוד התאמה רופפת, קיימת בדיוק כדי שקורא יוכל לראות את הנתון המחמיר יותר לצד הנתון הכותרתי.

הציונים אינם על אותו סרגל

שני המודלים מפרסמים מספרים הקרובים ל-Lean ולא ניתן להחסיר אותם. המאמר של MathForm מדווח על ממוצע Pass@8 של 88.06% תחת בדיקת תחביר ו-72.37% תחת בדיקת עקביות על פני שישה מדדי Lean, עם שיעורי מעבר של 63% ו-37% בבדיקת עקביות על תת-הקבוצות הקשות יותר FATE-H ו-FATE-X, וטוען לביצועים טובים יותר מכמה מאוטומטים פורמליים מתמחים של 32B. הכרטיס של TwIL-LM3-Pro מדווח על token-F1 של `lean_formalize` של 0.5092 ודיוק של `lean_critic` של 0.7950 על מערכת ה-Track A שלו.

Pass@8 תחת בדיקת מהדר ו-token-F1 מול מחרוזת ייחוס מודדים דברים שונים. Pass@8 נותן למודל שמונה ניסיונות ושואל אם אחד מהם עבר קומפילציה ונשאר עקבי; token-F1 מדד עד כמה יצירה בודדת תאמה לייחוס. מודל יכול לקבל ציון גבוה באחד ונמוך באחר, ושום דבר באף אחד מהמסמכים אינו מתיר לקרוא את השניים זה לצד זה.

הסיכום הכנה של תיעוד הבנצ'מרק הוא שהראיות של MathForm-8B מגיעות ממאמר עם מהדר בלולאה, ושל TwIL-LM3-Pro מגיעות מרתמת ספק עם מעריך בלולאה, ואף צד שלישי לא הריץ את שניהם דרך רובריקה אחת. התייחס לכל עמוד שמציב "88.06%" לצד "0.5092" כאילו היו תוצאת משחק, כאל עמוד שלא קרא את ההגדרות.

מפרטים, זה לצד זה

• פרמטרים — TwIL-LM3-Pro 3.66B צפוף לעומת MathForm-8B 8B, בערך פי 2.2 בגודל.

• מודל בסיס — `ibm-granite/granite-4.2-3b` לעומת `Qwen/Qwen3-8B`.

• נתוני אימון — קורפוס סינתטי של לוגיקה פורמלית המכסה שישה יעדים לעומת FormalVerse, כ-367,000 דוגמאות Lean 4 מאומתות.

• תגמול — מאמת פרוגרמטי עם זיכוי חלקי וסובלנות להתאמה רופפת לעומת הידור Lean ומשוב של עקביות סמנטית.

• פלט ראשי — תוויות גרירה, תרגומי FOL, ניתוחים סמנטיים, הצהרות Lean וביקורות הוכחה מול הצהרת Lean 4 לבדיקת מהדר.

• חלון הקשר — 131,072 אסימונים עבור TwIL-LM3-Pro, נמדד בתוך 8,192 אסימונים; MathForm-8B מוגש עם תקציבי יצירה של עד 16,384 אסימונים בדוגמת השימוש שלו.

• רישיון — webAI Non-Commercial License ver. 1.0 לעומת Apache 2.0.

• טביעת רגל מכומתת — TwIL-LM3-Pro מגיע עם Q4_K_M GGUF בנפח 2.09 GiB עבור CPU או 4 GB של VRAM; MathForm-8B אינו מפרסם GGUF במאגר שלו.

הרישיון מכריע שוב בשאלת הייצור

MathForm-8B הוא Apache 2.0. אפשר לבצע בו כיוונון עדין, להפיץ אותו מחדש ולהריץ אותו בתוך מוצר מסחרי. TwIL-LM3-Pro אינו מסחרי: שימוש למחקר ולשימוש אישי מותר, ופריסה שמייצרת הכנסות מחייבת הסכם נפרד עם webAI, שדרכו המסחרית היא הסדר ארגוני ולא מחירון מפורסם.

עבור קבוצת מחקר או סטודנט, ההבדל הזה לא רלוונטי — שני המודלים זמינים להורדה ללא הגבלת גישה ב-Hugging Face. עבור חברה, הוא מכריע, והוא מצביע על MathForm-8B לכל עבודת אוטופורמליזציה בסביבת ייצור, ללא קשר לשאלה איזה מודל מקבל ציון טוב יותר במסלול שאף ספק לא מדד באותו אופן.

היכן יושב הנתב בצינור הזה

לא TwIL-LM3-Pro ולא MathForm-8B הוא נתיב בקטלוג של OrcaRouter, והסיבות שונות: האחד ברישיון לא-מסחרי ללא נקודת קצה מתארחת, והאחר מפורסם כצ'קפוינט פתוח לאירוח עצמי. שאלת הניתוב בצינור פורמליזציה היא השכבה שסביבם. בניית קורפוס בסגנון FormalVerse פירושה יצירת אלפי בעיות לא-פורמליות, סינון שלהן לתקינות מבנית, וכתיבת בדיקות העקביות הסמנטית שמדרגות את הפלט — כולן קריאות טקסט, וכולן מסוג העבודה שבה רוצים להחליף את המודל שמייצר נתונים בכמות גדולה במודל ששופט אותם בלי חוזה נוסף. על נקודת קצה אחת תואמת OpenAI שמאחוריה יותר מ-200 מודלים במחיר המחירון של הספק עם תוספת של 0%, החלפה כזו היא שינוי בקונפיגורציה, והורדת מחיר של ספק על מודל היצירה מגיעה באותו יום. מעבר אוטומטי לגיבוי הוא קריטי בבניית קורפוס במיוחד מפני שמשימה שמתה בשני שלישים מהדרך של סבב יצירה עולה את כל הריצה.

A generated two-column scoreboard headed 'TwIL-LM3-Pro vs MathForm 8B - the scoreboard' with six shared dimension rows. TwIL-LM3-Pro: Parameters 3.66B dense; Base granite-4.2-3b; Reward programmatic verifier; Primary output entailment and critiques; Context 131,072 tokens; Licence non-commercial. MathForm 8B: Parameters 8B; Base Qwen3-8B; Reward Lean compilation; Primary output Lean 4 statements; Generation budget 16,384 tokens; Licence Apache 2.0. A footer line reads 'MathForm figures from the OpenBMB paper; TwIL figures vendor-reported by webAI.' The OrcaRouter logo is composited in the bottom-right corner.

חלוקת העבודה

אם המשימה היא להפוך מתמטיקה מספרי לימוד להצהרות Lean בנות-הידור בקנה מידה, והתוצאה צריכה לצאת במוצר מסחרי, MathForm-8B הוא הכלי ורישיון Apache 2.0 הוא הסיבה לכך. אם המשימה היא להחליט אם גוף טקסט גורר טענה, לתייג גרירה, לבצע ניתוח סמנטי, או לבקר ניסיון הוכחה, TwIL-LM3-Pro מכסה תחום ש-MathForm מעולם לא נועד לו — והרישיון הבלתי-מסחרי שלו מהווה גבול לגבי היכן שניתן להשתמש ביכולת הזו, ולא נקודה לרעת היכולת עצמה.

השילוב ההגיוני הוא תהליך דו-שלבי ולא בחירה: מודל אחד מפיק את ההצהרה הפורמלית, והשני שופט אותה. שניהם פרסמו את התהליך שהפיק אותם, וזה יוצא דופן בגודל הזה, וזו הסיבה שאפשר בכלל לערוך את ההשוואה הזו.

A screenshot of the Hugging Face model card for openbmb/MathForm-8B, showing the OpenBMB author line, tags for Text Generation, Transformers, Safetensors, the openbmb/FormalVerse training dataset, English and arXiv 2608.14221, the apache-2.0 licence badge, and the opening of the paper abstract 'MathForm: Scaling Mathematical Autoformalization with Knowledge Retrieval and Verification-Guided Refinement'.A screenshot of the Hugging Face model card for webAI-Official/TwIL-LM3-Pro, showing the webAI author line, the granite, granite-4.2, formal-logic, reasoning, lora, reinforcement-learning and grpo tags, and the licence badge reading 'License: webai-non-commercial-license-ver.-1.0'.