
Clef לעומת MathForm-8B: האחד עונה על שאלתך, האחר כותב הוכחה
- openaiחדשOpenAI: GPT-6.1 Sol2026-09-2952אינטליגנציה
- anthropicחדשAnthropic: Claude Sonnet 5.52026-09-2856אינטליגנציה
- typesafeחדשTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 לכל 1M טוקנים · 219 tok/s
- OpenAIחדשOpenAI: GPT-6 Luna2026-09-2238אינטליגנציה
- OpenAIחדשOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- AnthropicחדשAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- xAIחדשGrok 4.72026-09-2146אינטליגנציה
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 לכל 1M טוקנים · 114 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- OpenAIOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- AnthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 לכל 1M טוקנים · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
הסיבה לשים Cloudflare/clef לצד openbmb/MathForm-8B היא שהם שני הדברים שהכי קל להתבלבל ביניהם במשקלים פתוחים כרגע, ובלבול ביניהם עולה ריצת אימון אחת. שניהם פיין-טיונים שנבנו על הצ׳קפוינטים Qwen3.8-27B ו-Qwen3-8B בהתאמה. שניהם Apache-2.0. שניהם פורסמו במהלך עשרת השבועות האחרונים. שניהם צרים, נבנו למטרה ייעודית, ומתוארים על ידי יוצריהם כמתמחים ולא ככלליים. ואין להם שום קשר זה לזה כלל, מפני שאחד מפיק מספר שנבחר מתוך רשימה שסיפקת, והאחר מפיק קוד מקור של Lean 4, טוקן אחר טוקן, כדי שעוזר הוכחות יבדוק אותו.
Clef הוא מודל החלטות רב-מודאלי של Cloudflare בעל 27 מיליארד פרמטרים: נותנים לו מצב וסכימה של שאלות עם טיפוסים, והוא מחזיר הסתברות מכוילת לכל תשובה מותרת במעבר יחיד שאינו אוטורגרסיבי, בלי יצירת טקסט בשום שלב במסלול. MathForm-8B, מבית OpenBMB, הוא מודל אוטופורמליזציה — הצהרה מתמטית בשפה טבעית נכנסת, Lean 4 יוצא, והצינור שאימן אותו מתואר במאמר קדם-פרסום ב-arXiv שפורסם לצד המשקולות ב-14 באוגוסט 2026. התקרה של מודל אחד היא גודל רשימת האפשרויות שלך. התקרה של האחר היא חוזק תורת הטיפוסים של Lean. לשאול איזה מהם טוב יותר זו טעות קטגורית, והעובדה ששניהם מהווים כיוונון עדין של בין שמונה לעשרים ושבעה מיליארד פרמטרים במשקולות פתוחות תחת Apache-2.0 היא בדיוק מה שעושה את הטעות לקלה לביצוע.
מה שהממשק של כל מודל אוסר פיזית
הדרך המהירה ביותר לראות את הפיצול היא לקרוא מה כל אחד מהם יכול להחזיר.
• קלט — Clef מקבל מצב (טקסט, JSON, תמונות או פריימים של וידאו) בתוספת 1 עד 64 שאלות בעלות שם וטיפוס; MathForm-8B מקבל הצהרה מתמטית בשפה טבעית.
• פלט — Clef מחזיר הסתברות אחת לכל אפשרות מותרת, שעברה softmax לכל שאלה. MathForm-8B מחזיר קוד מקור של Lean 4.
• סוגי שאלות — של Clef הם noul (אמת/שקר, עם ההסתברות לאמת), בחירה (2 עד 26 אפשרויות בעלות שם) וניקוד (2 עד 26 רמות מסודרות); ל-MathForm-8B אין מושג של שאלה בכלל.
• כיול — Clef מפרסם שדה ביטחון לכל תשובה; MathForm-8B מפרסם שיעורי Pass@8 תחת בדיקות תחביר ועקביות.
• הגשה — Clef מוגש דרך תואם Jev/SystemOne POST /v1/systemone גוף, מתארח או מופעל עצמאית; MathForm-8B מגיע עם הוראות Transformers, vLLM ו-SGLang, כולם חושפים נקודת קצה להשלמה תואמת OpenAI בהקשר של 16,384 טוקנים עם max_new_tokens מוגדר ל-16,384.
ההשלכה המעשית מתבהרת מיד. אם אתה זקוק להכרעת כן/לא לגבי קטע טקסט, Clef הוא היחיד מבין השניים שיכול לספק אותה — אין דרך לשאול את MathForm-8B שאלה שאינה "כתוב את ה-Lean 4 עבור זה". אם אתה זקוק ל-Lean 4, Clef הוא היחיד מבין השניים שבאופן מוחלט אינו יכול להפיק אותו, וזאת לא מתוך חולשה: לבקש ממעריך המחויב לסכימה לפרמל משפט אינו מתאים לחוזה שלו, ולכן הבקשה נדחית מעצם הגדרתה ולא נענית באופן גרוע.

הפייפליין ששניהם שייכים אליו
יש ארכיטקטורה אמיתית שבה שני המודלים האלה יושבים זה לצד זה, וכדאי לעבור עליה משום שהיא הופכת את הפיצול לקונקרטי ולא מופשט. חשבו על שירות שמפורמל מתמטיקה עבור חוקרים וסטודנטים.
טענות מגיעות בשפה טבעית, בלתי מוגבלות בסוגן. לפני שאפשר לפרמל דבר, משהו צריך להחליט מה הגיע. האם זה משפט שצריך להוכיח, הגדרה שצריך להוסיף, בקשה לבדוק הוכחה קיימת, או שאלה שדורשת הבהרה לפני שמישהו נוגע ב-Lean? האם היא עצמאית, או שהיא נשענת על הקשר שהמשתמש לא סיפק? האם הסמלים מקובלים, או שזה סימון שהמערכת מעולם לא ראתה? כל אחת מאלה היא שאלה תחומה עם קבוצת אפשרויות קטנה — הצורה המדויקת של Clef — וההסתברות המכוילת שמצורפת לכל תשובה היא מה שמאפשר לשירות לעשות משהו הגיוני עם אלה שאינן ודאיות: לנתב כל דבר שמתחת לסף לאדם במקום לנחש.
השלב השני שייך ל-MathForm-8B. קח הצהרה שכבר סווגה כמשפט עצמאי עם סימון ידוע ופלוט את ה-Lean 4. זו בעיית יצירה, ושאלת האיכות היא באיזו תדירות הפלט מתקמפל ובאיזו תדירות משמעותו זהה למקור — וזה בדיוק מה ששני צירי ההערכה של הספק מודדים. זהו הדפוס הכללי שכדאי לחלץ מהזיווג: מסווג חסום וזול לפני גנרטור מתמחה ויקר הוא בדרך כלל זול יותר ואמין יותר מאשר לבקש מהגנרטור להחליט אם עליו לפעול בכלל.
מה המספרים בכל צד בעצם מודדים
תקציר ה-arXiv של OpenBMB מדווח כי MathForm-8B מגיע לשיעורי Pass@8 ממוצעים של 88.06% תחת Syntax Check ו-72.37% תחת Consistency Check על פני שישה בנצ'מרקים, וכי על תת-הקבוצות FATE-H ו-FATE-X הוא משיג שיעורי מעבר לבדיקות עקביות של 63% ו-37%, שניהם מעל קווי הבסיס המתמחים החזקים ביותר שאיתם המאמר משווה. צינור האימון הוא החלק המעניין בטענה: מתכנן אחזור שולף הגדרות רלוונטיות ופורמליזציות קיימות מ-Mathlib לפני היצירה, ולאחר מכן ההצהרות שנוצרו מתוקנות בעזרת אבחוני קומפיילר ומשוב של עקביות סמנטית, וכך נבנה מערך הנתונים FormalVerse של כ-367,000 דוגמאות Lean 4 מאומתות לפני כיוונון עדין מפוקח ולמידת חיזוק. אלו נתונים שדווחו על ידי הספק מתוך מאמר וכרטיס מודל. אף גורם בלתי תלוי לא הריץ אותם מחדש.
המספרים של Clef מודדים משהו אחר לגמרי ואינם ברי-השוואה. הרצת ה-Decision Index של Cloudflare מדווחת על macro-F1 לכוונות של 94.2 ב-BANKING77, על 97.4 ב-CLINC150 עם טיפול מחוץ לתחום, על 48.0 ב-GPQA Diamond — בעוד Jev הישן יותר משיג 78.3 — ועל שהיית בקשה חציונית של 209.3 מ״ש. זו טבלה על סיווג וניתוב, שהופקה על ידי הספק על מערכת הבדיקות של הספק עצמו, מתארחת בלוח התוצאות של הספק עצמו, ולא שוחזרה.
המשפט הכן היחיד שאפשר לכתוב על שתי העמודות האלה הוא שהן אינן חולקות שום בנצ'מרק, שום יחידה ושום פילוסופיית הערכה. 37% של MathForm-8B על תת-קבוצת פורמליזציה קשה ו-97.4 של Clef על זיהוי כוונות מחוץ לתחום הם שתי טענות אמיתיות של היצרנים שלהם על משימות שונות, וקורא שמשווה ביניהם לא למד דבר מלבד ששני המספרים קיימים.
מה היית מריץ, וכמה זה עולה
אף אחד מהשניים אינו נתיב ב-OrcaRouter, ומאמר זה אינו טוען כל טענה לגבי זמינות — הקטלוג מחזיר 404 עבור cloudflare/clef ועבור MathForm-8B. מאגר MathForm משקלו כ-16.4 GB, ושני המודלים הם ברישיון Apache-2.0, כך ששניהם יכולים להתארח באופן עצמאי כבר מחר בידי כל מי שיש ברשותו את החומרה.
• Clef ב-Cloudflare — $0.24 למיליון אסימוני קלט ב-Workers AI, עם זמן ההשהיה שפורסם, שנמדד על H200 בודד.
• MathForm-8B באחסון עצמי — ללא אירוח של ספק, ללא מחיר לפי טוקן, והקשר מתועד של 16,384 טוקנים, וזהו אילוץ שכדאי לשים לב אליו: קטע ארוך ממאמר לא ייכנס במעבר אחד.
• החלופה המנותבת עבור החצי של המסווג — Jev 1.13 של TypeSafe במחיר של $0.042 למיליון טוקני קלט על פני חלון הקשר של 65,536 טוקנים, מוגשת דרך אותו POST /v1/systemone, הגוף שבו Clef משתמש, מה שהופך אותה לתחליף ישיר לשלב הראשון של הצינור שלמעלה.
שם שכבת ניתוב מצדיקה את מקומה בשילוב המסוים הזה. התבנית היא מכריע ומחולל, והחצי המכריע הוא זה שיש לו תחליף חי — נקודת קצה אחת לפני יותר מ-200 מודלים, מחיר מחירון של הספק מועבר הלאה ללא תוספת מחיר לכל טוקן, ומעבר אוטומטי לגיבוי כך שאחר צהריים רע של ספק לא יתקע את הדלת הקדמית של הצינור שלך. החצי המחולל הוא ארטיפקט של 16.4 GB שאתה מריץ בעצמך, ואף נקודת קצה לא משנה זאת.

עוד דבר אחד שהמידות מסתירות
ספירות הפרמטרים מזמינות השוואה שאינה תקפה. Clef הוא 27B ו-MathForm-8B הוא 8B, ולכן טבעי להניח שהמודל הגדול יותר הוא המסוגל יותר והקטן יותר הוא המומחה. ההיפך הוא הנכון מבחינה מהותית. Clef גדול משום שהוא נושא שלד מולטימודאלי קפוא שהוא זקוק לו כדי לקרוא צילומי מסך וחשבוניות; החלק המאומן שמעליו הוא ראש סכימה קטן עם מתאמים בדרגה 256. MathForm-8B קטן משום ש-Lean 4 הוא מטרה צרה ובסיס Qwen3-8B הספיק כדי להשיג אותה, כאשר ההנדסה האמיתית נמצאת בצינור האחזור והאימות שהפיק את נתוני האימון שלו ולא במספר הפרמטרים שלו.
גודל, במילים אחרות, אומר לך מה כל מודל היה צריך לשאת, לא כמה קשה הבעיה שהוא פותר. מודל 27B שקורא קבלה ומחזיר "billing, 0.98" ומודל 8B שמפיק Lean שניתן להדר, שניהם עושים בדיוק את מה שנבנו לעשות, והמסגור של שמונה מיליארד מול עשרים ושבעה מיליארד יוביל אותך למודל הלא נכון בערך בחצי מהמקרים.

ההחלטה, והשאלה שאף אחד מהספקים לא השיב עליה
אם יש לך פייפליין שבולע שפה טבעית בלתי מוגבלת וצריך לנתב אותה לפני שמוציאים עליה משאבי מחשוב, המהלך הראשון הוא מסווג חסום — Clef כאשר הקלט הרב-מודאלי שלו חשוב והמספרים שלו נראים טובים על הנתונים שלך, או Jev 1.13 כאשר אתה רוצה את אותה צורת בקשה במחיר מחירון נמוך יותר ובלי לקשור את הארכיטקטורה שלך לספק שאף אחד לא שחזר את ההערכה שלו. המהלך השני הוא מחולל מתמחה, ואם המחולל הזה הוא Lean 4, MathForm-8B הוא המודל הפתוח שנבנה בדיוק לשם כך, עם פייפליין מפורסם וקורפוס שמאחוריו.
מה שחסר בשני הצדדים הוא אותו סוג של ראיות. הרצת Decision Index של Clef היא של Cloudflare עצמה ומעולם לא שוחזרה באופן בלתי תלוי; נתוני Pass@8 של MathForm-8B מגיעים מהמאמר של עצמו. שתי אלה טענות שאפתניות בתחום שבו המבחן ההוגן זול לתיאור ויקר להרצה — קחו נתונים שאף אחד מהספקים לא אימן עליהם, יישמו את אותו צינור עיבוד, ופרסמו את התוצאה. עד שמישהו יעשה זאת עבור אחד מהשניים, הדבר המועיל שההשוואה הזו יכולה לספר לך הוא צורה: אחד מאלה שייך לחזית צינור העיבוד שלך, כשהוא מחליט מה מגיע, והשני שייך מאחוריו, כשהוא עושה את העבודה הקשה והמצומצמת, ואף אחד מהם אינו תחליף לשני בכל מספר פרמטרים.
