
Intern-Decision-0.8B לעומת MathForm 8B: אחד מאלה יכול לבדוק את העבודה של עצמו
- typesafeחדשTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 לכל 1M טוקנים · 592 tok/s
- openaiחדשOpenAI: GPT-6 Luna2026-09-2237אינטליגנציה
- openaiחדשOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- anthropicחדשAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- grokחדשGrok 4.72026-09-2146אינטליגנציה
- OrcaחדשOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 לכל 1M טוקנים · 187 tok/s
- orcaחדשOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- openaiOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- googleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- anthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0540אינטליגנציה72כתיבת קוד
השאלה השימושית ביותר שאפשר לשאול על כל מודל מומחה קטן היא מי בודק אותו. Intern-Decision-0.8B ו-MathForm 8B שניהם קיימים משום שמודל כללי עבר כיוונון עדין למודל צר, שניהם נגזרות Apache-2.0 של משקולות Qwen, ושניהם הועלו ל-Hugging Face בלי קמפיין שיווקי — אבל הם ניצבים משני צדדיו של קו שקובע כיצד תפרוס אותם. MathForm 8B הוא מודל האוטופורמליזציה 8B של OpenBMB, שיצא ב-14 באוגוסט 2026, שמתרגם מתמטיקה בשפה טבעית ל-Lean 4 ומעביר את התוצאה למהדר, שמקבל אותה או לא. Intern-Decision-0.8B הוא ראש ההחלטה בעל 852,985,920 פרמטרים של InternLM, שהועלה ב-26 בספטמבר 2026, שמחזיר התפלגות הסתברות מכוילת על אפשרויות שסיפקת מראש — ושום דבר בעולם לא מאמת באופן עצמאי אם התווית שהוא מחזיר נכונה. אחד מהמודלים האלה מפיק פלט עם הוכחה. האחר מפיק פלט עם ציון ביטחון, וההבדל במה שאפשר לעשות עם שני הדברים האלה הוא כל המאמר.
המסגור הזה גם מסביר מדוע פער הגודל — 8B מול 0.8B, פי עשרה — הוא המספר הכי פחות מעניין בהשוואה. אף אחד מהמודלים לא מנסה להיות טוב במה שהאחר עושה, וההערכה של אף אחד מהם לא מספרת לך דבר על האחר. מה שהם חולקים הוא דפוס שחרור ושושלת Qwen, ושניהם חשובים פחות משאלת האימות.
מה כל אחד הוא בפועל
MathForm 8B הוא התוצר המוגמר של מתכון דו-שלבי המתואר במאמר MathForm: הרחבת אוטופורמליזציה מתמטית עם אחזור ידע ועידון מונחה אימות (arXiv 2608.14221). מתכנן אחזור שולף הגדרות רלוונטיות ופורמליזציות קיימות מ-Mathlib לפני שהמחולל פועל; ההצהרות שנוצרו עוברות לאחר מכן עדכון תוך שימוש באבחון מהידור ובמשוב של עקביות סמנטית; הקורפוס המתקבל, FormalVerse, מכיל כ-367,000 דוגמאות מאומתות של Lean 4; ו-MathForm 8B מאומן עליו באמצעות כוונון עדין מפוקח ולאחריו למידת חיזוק תוך שימוש בקומפילציה של Lean ובאותות עקביות סמנטית כגמול. זהו מודל טקסט בלבד המבוסס על Qwen3-8B, המוגש דרך Transformers, vLLM או SGLang עם API תואם OpenAI, עם אורך הקשר מומלץ של 16,384 אסימונים ותקציב יצירה מקסימלי של 16,384 אסימונים. צינור ההערכה שלו, קבצי הבנצ'מרק וסקריפטים של Pass@k נמצאים כולם במאגר GitHub של OpenBMB, ומערך הנתונים לאימון הוא ציבורי.
Intern-Decision-0.8B הוא התוצר המוגמר של מתכון שאיש לא תיאר. כרטיס המודל אומר שזה "מודל החלטה מובנה מולטימודלי שעבר כוונון עדין מ-Qwen3.5-0.8B" ומסתפק בכך — אין תיאור נתונים, אין הליך אימון, אין מאמר, אין מאגר. מה שכן מתועד ביסודיות הוא חוזה ההסקה. המנוע המצורף ממפה את אפשרויות כל שאלה לסמלים של טוקן בודד, מרנדר שלד עם מציין מקום בשם <decision> אחד לכל שדה, מריץ מעבר קדימה סיבתי אחד, קורא לוגיטים במיקום שלפני כל מציין מקום, מפעיל softmax רק על הסמלים המותרים של אותו שדה, מיישם כיול מותאם, וממפה סמלים בחזרה לערכי האפשרויות שלך. אין קריאה ל-generate() ואין דגימה בשום מקום בנתיב. הוא מקבל טקסט בתוספת עד שמונה תמונות, מטפל באחת עד שש-עשרה שאלות עם עד 62 אפשרויות כל אחת, ודוחה קלטים מעל 8,192 טוקנים במקום לקצץ אותם. טמפרטורת הכיול המוגדרת כברירת מחדל היא 2.747760550703, מותאמת לכל נקודת ביקורת על ידי מזעור NLL על פני 1,728 מקרים.
קראו את שתי הפסקאות האלה זו לצד זו והאסימטריה בולטת. MathForm 8B מגיע עם מאמר, מערך נתונים, צינור הערכה ומאגר. Intern-Decision-0.8B מגיע עם תיאור API וטבלת בנצ'מרק.
א-סימטריית האימות, שהיא הסיפור האמיתי
הפלט של MathForm 8B ניתן לבדיקה על ידי משהו שאינו אדם. הוא מפיק Lean 4, ו-Lean 4 או שמתקמפל או שלא. המספרים של OpenBMB מדווחים תחת שני משטרים בדיוק מהסיבה הזו: Pass@8 של 88.06% תחת בדיקת תחביר, כלומר שהפלט מתקמפל, ו-72.37% תחת בדיקת עקביות, כלומר שהוא מתקמפל ובדיקת עקביות סמנטית מסכימה שההצהרה הפורמלית אומרת את מה שההצהרה הלא-פורמלית אמרה. שני הנתונים הם ממוצעים על פני שישה מדדים, והמאמר גם מדווח על שיעורי מעבר CC של 63% ב-FATE-H ו-37% בתת-הקבוצות הקשות יותר FATE-X, עם הטענה שזה עולה על אוטופורמליזטורים ייעודיים של 32B. אלה מדווחים על ידי הספק — OpenBMB הריצה אותם — אבל התכונה שחשובה היא מבנית, לא סטטיסטית: מערכת במורד הזרם שצורכת את הפלט של MathForm 8B יכולה לדחות פורמליזציה גרועה בלי לבקש ממודל לשפוט אותה. המהדר הוא האורקל.
ל-Intern-Decision-0.8B יש חוזה טיפוס ואין אורקל. צורת הפלט מובטחת — שדה שהוצהר כchoice מחזיר התפלגות על ערכי האפשרויות שציינת, score מחזיר ערך צפוי משוקלל בהסתברות על הרובריקה שלך, noul מחזיר הסתברות של כן. שום דבר מחוץ למודל לא יכול לומר לך אם ה-argmax היה נכון. ערך הביטחון הוא האומדן של המודל עצמו לגבי נכונותו שלו, ועבודת הכיול של הכרטיס היא ניסיון מפורש להפוך את האומדן הזה למשמעותי — טמפרטורה מותאמת שמשמרת את ה-argmax תוך חידוד או ריכוך ההסתברויות, שאומתה על מקרי בדיקה — אבל תשובה שגויה עם כיול טוב היא עדיין תשובה שגויה. אם הצינור שלך צריך לדעת שתווית נכונה, אתה צריך נתונים מתויגים, ואתה צריך למדוד זאת בעצמך.
זה אינו פגם ייחודי ל-Intern-Decision-0.8B. זהו מצבו של כל מסווג, וזו הבעיה הלא-פתורה בכל קטגוריית מודלי ההחלטה הכוללת את Jev של TypeSafe ואת Laya של Convai. כדאי לומר זאת בבירור, משום שטבלת בנצ'מרק עם עמודת ציון Brier עלולה ליצור את הרושם שכיול הוא אימות. זה לא כך. כיול אומר לך שכאשר המודל הזה אומר 80%, הוא צודק בכ-80% מהמקרים על פני ההתפלגות שנבחנה — מה שבאמת שימושי לקביעת ספים ולחישוב תוחלת, והוא אינו ערובה לנכונות של פריט בודד.
לוח התוצאות, על השורות שיש לשני המודלים
• פרמטרים — Intern-Decision-0.8B: 852,985,920 על פני שבר שפה של 1.50 GB, שבר ראייה של 176 MB ומקרן של 25 MB. MathForm 8B: 8B צפוף, מבוסס על Qwen3-8B.
• מודל בסיס — Intern-Decision-0.8B: Qwen3.5-0.8B, שוחרר בפברואר 2026. MathForm 8B: Qwen3-8B.
• משימה — Intern-Decision-0.8B: החלטות טיפוסיות על סכמה שאתה כותב — בחירה, ציון, בינארי. MathForm 8B: מתמטיקה בשפה טבעית לפורמליזציה ב-Lean 4.
• פלט — Intern-Decision-0.8B: התפלגות מכוילת בתוספת argmax לכל שדה, ללא טקסט שנוצר. MathForm 8B: קוד מקור Lean 4 שנוצר, בדרך כלל ארוך.
• אימות — Intern-Decision-0.8B: ללא גורם חיצוני; רמת הביטחון מדווחת על ידי המערכת עצמה. MathForm 8B: מהדר Lean 4, בתוספת בדיקת עקביות סמנטית.
• עדויות מפורסמות — Intern-Decision-0.8B: טבלת בנצ'מרקים של ספק על פני שבעה בנצ'מרקים, ללא שחזור, ללא מאמר. MathForm 8B: מאמר, מערך נתונים ציבורי של כ־367,000 דוגמאות, צינור הערכה ומאגר, בהרצת ספק.
• רישיון — שניהם Apache 2.0, ו-Intern-Decision-0.8B נושא בנוסף את קובץ הרישיון של Qwen שנשמר עבור המשקולות במעלה הזרם שלו.

עלות והשהיה אינן ברות השוואה, וזו לא התחמקות.
InternLM מדדה את Intern-Decision-0.8B ב-33.98 ms בממוצע וב-37.50 ms ב-p95 לכל שאילתה על כרטיס RTX 4090 בודד דרך מסלול Hugging Face המקומי, כאשר הדגם האח ה-2B הציג 33.28 ms בממוצע. הכרטיס של MathForm 8B עצמו ממליץ על עד 16,384 טוקנים חדשים לכל פורמליזציה בטמפרטורה 0.6 ו-top_p 0.95. שתי המדידות הללו אינן אותה כמות. האחת היא מעבר קדימה יחיד על פני פרומפט; האחרת היא יצירה אוטורגרסיבית שיכולה להימשך אלפי טוקנים. הכפלת תקציב פורמליזציה מול החלטה של 34 ms לא אומרת לך דבר על יעילות יחסית, מפני שהמודלים אינם עושים אותה כמות עבודה — האחד קורא ומנקד, האחר קורא וכותב סקריפט הוכחה. אם תפוקה היא האילוץ שלך, העובדות הרלוונטיות פשוטות יותר מיחס. MathForm 8B מפרמל הצהרה אחת לכל יצירה, וב-16K טוקנים לפלט במודל צפוף 8B, זהו עומס שמנצל את ה-GPU עד תום ומועמד לבאצ'ינג דרך vLLM או SGLang, שאותם מתעדת OpenBMB. Intern-Decision-0.8B עונה על שש עשרה שאלות המכסות רשומה שלמה במעבר אחד, כך שיחידת העבודה היא רשומה ולא שדה, ותקציב הרשומה הוא תקרת הקלט של 8,192 טוקנים — שמגיעה מהר יותר ממה שקורא עשוי לצפות כשאתה דוחס מצב ארוך, סכימה עשירה ועד שמונה תמונות.
היכן שכל אחד מהם הוא הכלי המתאים
MathForm 8B שייך בצינור עיבוד שצוואר הבקבוק שלו הוא סקירה אנושית של מתמטיקה. אוטופורמליזציה קיימת משום שכתיבת Lean איטית יותר מקריאתה, ומשום שהצהרה הניתנת לאימות מכונה היא הצהרה שעוזר הוכחה יכול לאחר מכן לתקוף. התכונה שהופכת אותה לאמינה — פלט מאומת על ידי מהדר — היא גם התכונה שהופכת אותה לצרה: היא מפורמלת, היא אינה מוכיחה, והכרטיס מפורש בכך שבדיקות קומפילציה דורשות שרת Kimina Lean פועל, ושהניסויים השתמשו ב-Lean 4.21.0. כל מי שמאמץ אותה מאמץ את אותה מחסנית. כמו בכל מודל בקוד פתוח בן ימים או שבועות ספורים, הפניית נתיב בדיקה אליו ונסיגה למודל מוכח כשהוא נתקע היא הדרך בסיכון נמוך להעריך אותו, וזה בדיוק מה ששער עם מעבר כשל אוטומטי על פני שרשרת גיבוי נועד לשם — ניסיונות חוזרים שמתרחשים לפני שהתגובה מתחילה, כך שפורמליזציה שנתקעה לעולם אינה מגיעה לקורא שלך.
Intern-Decision-0.8B שייך לכל מקום שבו כבר קיימת קבוצת תשובות סגורה, והעלות של יצירת טקסט כדי לשחזר אותה היא בזבוז מוחלט. מיון ראשוני, ניתוב, ניקוד לפי רובריקה, הכרעה של רשומה מול מדיניות כתובה — המקרים שבהם משתמשים במודל גנרטיבי כדרך יקרה לבחור מתוך רשימה. היתרונות שלו הם שהוא דטרמיניסטי, שהוא מחזיר הסתברות שמישה לשימוש ולא מחרוזת שצריך לפענח, ושבהיותו 1.73 GB על הדיסק הוא רץ בנוחות מתחת לעלות הזיכרון של דפדפן במחשב נייד. החסרונות שלו הם שהתיעוד נעצר בשטח ה-API, שאיש מחוץ ל-InternLM לא פרסם תוצאה עבורו, ושעמודת הבנצ'מרק היחידה שמרמזת על בעיית בטיחות — ציון WildJailBreak של 64.48 לעומת 96.29 של Jev — נותרה ללא הסבר. אל תציבו אותו מול קלט עוין בלי להריץ את הבדיקה הזו בעצמכם.

לשני המודלים מוצא משותף שראוי לציון, משום שהוא משנה את מה ש"פתוח" מקנה לך. כל אחד מהם הוא כיוונון עדין של נקודת ביקורת של Qwen, וכל אחד מהם משמר כראוי את הרישיון במעלה הזרם: MathForm 8B תחת Apache 2.0 עם מקור Qwen3-8B מצוין בכרטיס, ו-Intern-Decision-0.8B תחת Apache 2.0 עם קובץ LICENSE-QWEN נפרד במאגר. אף אחד מהם אינו נושא סף הכנסות או הגבלת תחום שימוש — שלא כמו LFM Open License v1.0 של Liquid AI, המתנה זכויות מסחריות בכך שהגוף שלך נשאר מתחת לקו הכנסה שנתית של 10 מיליון דולר. אם אתה בונה באופן מסחרי, זהו הבדל שמפריד בין שתי ההפצות הללו לחלקים ממערכת האקוסיסטם של המודלים הקטנים, והוא חל על שתיהן באותה מידה.
אם אתה רוצה את שכבת ההחלטה בלי נקודת הביקורת הלא מתועדת
הפער בין "ראש החלטה הוא הצורה הנכונה לבעיה הזו" לבין "ראש ההחלטה המסוים הזה הוא כזה שאתה יכול להגן עליו בפני סוקר" הוא מה שפתרון מתארח סוגר. Jev 1.13 של TypeSafe הוא המודל ש-InternLM בחנה את המשפחה שלו מולו ב-Jevbench, על Typed Decision ועל ToolACE, והוא ניתן לקריאה היום דרך נקודת קצה אחת תואמת OpenAI במחיר של 0.042 דולר למיליון טוקני קלט, כשהפלט מחויב באפס — המחיר המפורסם של הספק, מועבר הלאה ללא תוספת רווח במקום בתוספת רווח בדרך. עבור קורא שרוצה למדוד אם ראש החלטה עוזר בכלל לפני שהוא מתחייב לנקודת ביקורת של 0.8B עם מאגר חסר, זהו הניסוי הראשון והזול, וההערכות של Jev מצד שלישי מעניקות לו רקורד מתועד שעדיין אין ל-Intern-Decision-0.8B.

התשובה הקצרה
שני אלה אינם חלופות. MathForm 8B הוא מומחה שתוכנה יכולה לאמת את פלטו, ומכוון למשימה שבה האימות הוא החלק הקשה; הוא מגיע עם המאמר, מערך הנתונים ורתמת ההערכה כדי להוכיח את הטענה. Intern-Decision-0.8B הוא מומחה שרק אתה יכול לאמת את פלטו, ומכוון למשימות שבהן התשובות כבר היו כתובות והחלק הקשה היה להגיע אליהן במהירות ובזול; הוא מגיע עם מודול הסקה וטבלה. אם אתה זקוק לפורמליזציה, יש רק אחד מאלה שכדאי לשקול. אם אתה זקוק לתווית ואתה מוכן לבנות את האמת המוחלטת כדי לבדוק את התווית כנגדה, ה-0.8B הוא ההורדה המעניינת יותר — מהיר, דטרמיניסטי, Apache 2.0, וקטן מספיק כך שהעלות של לגלות אם הוא שווה משהו היא אחר צהריים אחד ולא שורת תקציב.
