כרטיס כותרת גיבור עם הכיתוב 'Intern-Decision-0.8B vs MathForm 8B', עם כתובית המשנה 'אחד מאלה יכול לבדוק את העבודה של עצמו', הנושא את התגיות 'פלט Lean 4 מאומת בקומפיילר' ו'ביטחון מדווח עצמי בלבד', עם הלוגו של OrcaRouter מורכב בפינה.
Guides & Insights

Intern-Decision-0.8B לעומת MathForm 8B: אחד מאלה יכול לבדוק את העבודה של עצמו

מחבר

Magnus Corvin

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים →
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

השאלה השימושית ביותר שאפשר לשאול על כל מודל מומחה קטן היא מי בודק אותו. Intern-Decision-0.8B ו-MathForm 8B שניהם קיימים משום שמודל כללי עבר כיוונון עדין למודל צר, שניהם נגזרות Apache-2.0 של משקולות Qwe​n, ושניהם הועלו ל-Hugging Face בלי קמפיין שיווקי — אבל הם ניצבים משני צדדיו של קו שקובע כיצד תפרוס אותם. MathForm 8B הוא מודל האוטופורמליזציה 8B של OpenBMB, שיצא ב-14 באוגוסט 2026, שמתרגם מתמטיקה בשפה טבעית ל-Lean 4 ומעביר את התוצאה למהדר, שמקבל אותה או לא. Intern-Decision-0.8B הוא ראש ההחלטה בעל 852,985,920 פרמטרים של InternLM, שהועלה ב-26 בספטמבר 2026, שמחזיר התפלגות הסתברות מכוילת על אפשרויות שסיפקת מראש — ושום דבר בעולם לא מאמת באופן עצמאי אם התווית שהוא מחזיר נכונה. אחד מהמודלים האלה מפיק פלט עם הוכחה. האחר מפיק פלט עם ציון ביטחון, וההבדל במה שאפשר לעשות עם שני הדברים האלה הוא כל המאמר.

המסגור הזה גם מסביר מדוע פער הגודל — 8B מול 0.8B, פי עשרה — הוא המספר הכי פחות מעניין בהשוואה. אף אחד מהמודלים לא מנסה להיות טוב במה שהאחר עושה, וההערכה של אף אחד מהם לא מספרת לך דבר על האחר. מה שהם חולקים הוא דפוס שחרור ושושלת Qwen, ושניהם חשובים פחות משאלת האימות.

מה כל אחד הוא בפועל

MathForm 8B הוא התוצר המוגמר של מתכון דו-שלבי המתואר במאמר MathForm: הרחבת אוטופורמליזציה מתמטית עם אחזור ידע ועידון מונחה אימות (arXiv 2608.14221). מתכנן אחזור שולף הגדרות רלוונטיות ופורמליזציות קיימות מ-Mathlib לפני שהמחולל פועל; ההצהרות שנוצרו עוברות לאחר מכן עדכון תוך שימוש באבחון מהידור ובמשוב של עקביות סמנטית; הקורפוס המתקבל, FormalVerse, מכיל כ-367,000 דוגמאות מאומתות של Lean 4; ו-MathForm 8B מאומן עליו באמצעות כוונון עדין מפוקח ולאחריו למידת חיזוק תוך שימוש בקומפילציה של Lean ובאותות עקביות סמנטית כגמול. זהו מודל טקסט בלבד המבוסס על Qwen3-8B, המוגש דרך Transformers, vLLM או SGLang עם API תואם OpenAI, עם אורך הקשר מומלץ של 16,384 אסימונים ותקציב יצירה מקסימלי של 16,384 אסימונים. צינור ההערכה שלו, קבצי הבנצ'מרק וסקריפטים של Pass@k נמצאים כולם במאגר GitHub של OpenBMB, ומערך הנתונים לאימון הוא ציבורי.

Intern-Decision-0.8B הוא התוצר המוגמר של מתכון שאיש לא תיאר. כרטיס המודל אומר שזה "מודל החלטה מובנה מולטימודלי שעבר כוונון עדין מ-Qwen3.5-0.8B" ומסתפק בכך — אין תיאור נתונים, אין הליך אימון, אין מאמר, אין מאגר. מה שכן מתועד ביסודיות הוא חוזה ההסקה. המנוע המצורף ממפה את אפשרויות כל שאלה לסמלים של טוקן בודד, מרנדר שלד עם מציין מקום בשם <decision> אחד לכל שדה, מריץ מעבר קדימה סיבתי אחד, קורא לוגיטים במיקום שלפני כל מציין מקום, מפעיל softmax רק על הסמלים המותרים של אותו שדה, מיישם כיול מותאם, וממפה סמלים בחזרה לערכי האפשרויות שלך. אין קריאה ל-generate() ואין דגימה בשום מקום בנתיב. הוא מקבל טקסט בתוספת עד שמונה תמונות, מטפל באחת עד שש-עשרה שאלות עם עד 62 אפשרויות כל אחת, ודוחה קלטים מעל 8,192 טוקנים במקום לקצץ אותם. טמפרטורת הכיול המוגדרת כברירת מחדל היא 2.747760550703, מותאמת לכל נקודת ביקורת על ידי מזעור NLL על פני 1,728 מקרים.

קראו את שתי הפסקאות האלה זו לצד זו והאסימטריה בולטת. MathForm 8B מגיע עם מאמר, מערך נתונים, צינור הערכה ומאגר. Intern-Decision-0.8B מגיע עם תיאור API וטבלת בנצ'מרק.

א-סימטריית האימות, שהיא הסיפור האמיתי

הפלט של MathForm 8B ניתן לבדיקה על ידי משהו שאינו אדם. הוא מפיק Lean 4, ו-Lean 4 או שמתקמפל או שלא. המספרים של OpenBMB מדווחים תחת שני משטרים בדיוק מהסיבה הזו: Pass@8 של 88.06% תחת בדיקת תחביר, כלומר שהפלט מתקמפל, ו-72.37% תחת בדיקת עקביות, כלומר שהוא מתקמפל ובדיקת עקביות סמנטית מסכימה שההצהרה הפורמלית אומרת את מה שההצהרה הלא-פורמלית אמרה. שני הנתונים הם ממוצעים על פני שישה מדדים, והמאמר גם מדווח על שיעורי מעבר CC של 63% ב-FATE-H ו-37% בתת-הקבוצות הקשות יותר FATE-X, עם הטענה שזה עולה על אוטופורמליזטורים ייעודיים של 32B. אלה מדווחים על ידי הספק — OpenBMB הריצה אותם — אבל התכונה שחשובה היא מבנית, לא סטטיסטית: מערכת במורד הזרם שצורכת את הפלט של MathForm 8B יכולה לדחות פורמליזציה גרועה בלי לבקש ממודל לשפוט אותה. המהדר הוא האורקל.

ל-Intern-Decision-0.8B יש חוזה טיפוס ואין אורקל. צורת הפלט מובטחת — שדה שהוצהר כchoice מחזיר התפלגות על ערכי האפשרויות שציינת, score מחזיר ערך צפוי משוקלל בהסתברות על הרובריקה שלך, noul מחזיר הסתברות של כן. שום דבר מחוץ למודל לא יכול לומר לך אם ה-argmax היה נכון. ערך הביטחון הוא האומדן של המודל עצמו לגבי נכונותו שלו, ועבודת הכיול של הכרטיס היא ניסיון מפורש להפוך את האומדן הזה למשמעותי — טמפרטורה מותאמת שמשמרת את ה-argmax תוך חידוד או ריכוך ההסתברויות, שאומתה על מקרי בדיקה — אבל תשובה שגויה עם כיול טוב היא עדיין תשובה שגויה. אם הצינור שלך צריך לדעת שתווית נכונה, אתה צריך נתונים מתויגים, ואתה צריך למדוד זאת בעצמך.

זה אינו פגם ייחודי ל-Intern-Decision-0.8B. זהו מצבו של כל מסווג, וזו הבעיה הלא-פתורה בכל קטגוריית מודלי ההחלטה הכוללת את Jev של TypeSafe ואת Laya של Convai. כדאי לומר זאת בבירור, משום שטבלת בנצ'מרק עם עמודת ציון Brier עלולה ליצור את הרושם שכיול הוא אימות. זה לא כך. כיול אומר לך שכאשר המודל הזה אומר 80%, הוא צודק בכ-80% מהמקרים על פני ההתפלגות שנבחנה — מה שבאמת שימושי לקביעת ספים ולחישוב תוחלת, והוא אינו ערובה לנכונות של פריט בודד.

לוח התוצאות, על השורות שיש לשני המודלים

• פרמטרים — Intern-Decision-0.8B: 852,985,920 על פני שבר שפה של 1.50 GB, שבר ראייה של 176 MB ומקרן של 25 MB. MathForm 8B: 8B צפוף, מבוסס על Qwen3-8B.

• מודל בסיס — Intern-Decision-0.8B: Qwen3.5-0.8B, שוחרר בפברואר 2026. MathForm 8B: Qwen3-8B.

• משימה — Intern-Decision-0.8B: החלטות טיפוסיות על סכמה שאתה כותב — בחירה, ציון, בינארי. MathForm 8B: מתמטיקה בשפה טבעית לפורמליזציה ב-Lean 4.

• פלט — Intern-Decision-0.8B: התפלגות מכוילת בתוספת argmax לכל שדה, ללא טקסט שנוצר. MathForm 8B: קוד מקור Lean 4 שנוצר, בדרך כלל ארוך.

• אימות — Intern-Decision-0.8B: ללא גורם חיצוני; רמת הביטחון מדווחת על ידי המערכת עצמה. MathForm 8B: מהדר Lean 4, בתוספת בדיקת עקביות סמנטית.

• עדויות מפורסמות — Intern-Decision-0.8B: טבלת בנצ'מרקים של ספק על פני שבעה בנצ'מרקים, ללא שחזור, ללא מאמר. MathForm 8B: מאמר, מערך נתונים ציבורי של כ־367,000 דוגמאות, צינור הערכה ומאגר, בהרצת ספק.

• רישיון — שניהם Apache 2.0, ו-Intern-Decision-0.8B נושא בנוסף את קובץ הרישיון של Qwen שנשמר עבור המשקולות במעלה הזרם שלו.

A two-column scoreboard comparing Intern-Decision-0.8B with MathForm 8B on six shared rows: parameters 852,985,920 against 8B dense based on Qwen3-8B, task typed decisions over a schema you write against natural-language mathematics to Lean 4, output a calibrated distribution plus argmax with no text against generated Lean 4 source, verification none external with self-reported confidence against the Lean 4 compiler plus a consistency check, published evidence a vendor table with no paper or dataset against a paper with a roughly 367k-example dataset and an eval pipeline, and Apache 2.0 on both sides.

עלות והשהיה אינן ברות השוואה, וזו לא התחמקות.

InternLM מדדה את Intern-Decision-0.8B ב-33.98 ms בממוצע וב-37.50 ms ב-p95 לכל שאילתה על כרטיס RTX 4090 בודד דרך מסלול Hugging Face המקומי, כאשר הדגם האח ה-2B הציג 33.28 ms בממוצע. הכרטיס של MathForm 8B עצמו ממליץ על עד 16,384 טוקנים חדשים לכל פורמליזציה בטמפרטורה 0.6 ו-top_p 0.95. שתי המדידות הללו אינן אותה כמות. האחת היא מעבר קדימה יחיד על פני פרומפט; האחרת היא יצירה אוטורגרסיבית שיכולה להימשך אלפי טוקנים. הכפלת תקציב פורמליזציה מול החלטה של 34 ms לא אומרת לך דבר על יעילות יחסית, מפני שהמודלים אינם עושים אותה כמות עבודה — האחד קורא ומנקד, האחר קורא וכותב סקריפט הוכחה. אם תפוקה היא האילוץ שלך, העובדות הרלוונטיות פשוטות יותר מיחס. MathForm 8B מפרמל הצהרה אחת לכל יצירה, וב-16K טוקנים לפלט במודל צפוף 8B, זהו עומס שמנצל את ה-GPU עד תום ומועמד לבאצ'ינג דרך vLLM או SGLang, שאותם מתעדת OpenBMB. Intern-Decision-0.8B עונה על שש עשרה שאלות המכסות רשומה שלמה במעבר אחד, כך שיחידת העבודה היא רשומה ולא שדה, ותקציב הרשומה הוא תקרת הקלט של 8,192 טוקנים — שמגיעה מהר יותר ממה שקורא עשוי לצפות כשאתה דוחס מצב ארוך, סכימה עשירה ועד שמונה תמונות.

היכן שכל אחד מהם הוא הכלי המתאים

MathForm 8B שייך בצינור עיבוד שצוואר הבקבוק שלו הוא סקירה אנושית של מתמטיקה. אוטופורמליזציה קיימת משום שכתיבת Lean איטית יותר מקריאתה, ומשום שהצהרה הניתנת לאימות מכונה היא הצהרה שעוזר הוכחה יכול לאחר מכן לתקוף. התכונה שהופכת אותה לאמינה — פלט מאומת על ידי מהדר — היא גם התכונה שהופכת אותה לצרה: היא מפורמלת, היא אינה מוכיחה, והכרטיס מפורש בכך שבדיקות קומפילציה דורשות שרת Kimina Lean פועל, ושהניסויים השתמשו ב-Lean 4.21.0. כל מי שמאמץ אותה מאמץ את אותה מחסנית. כמו בכל מודל בקוד פתוח בן ימים או שבועות ספורים, הפניית נתיב בדיקה אליו ונסיגה למודל מוכח כשהוא נתקע היא הדרך בסיכון נמוך להעריך אותו, וזה בדיוק מה ששער עם מעבר כשל אוטומטי על פני שרשרת גיבוי נועד לשם — ניסיונות חוזרים שמתרחשים לפני שהתגובה מתחילה, כך שפורמליזציה שנתקעה לעולם אינה מגיעה לקורא שלך.

Intern-Decision-0.8B שייך לכל מקום שבו כבר קיימת קבוצת תשובות סגורה, והעלות של יצירת טקסט כדי לשחזר אותה היא בזבוז מוחלט. מיון ראשוני, ניתוב, ניקוד לפי רובריקה, הכרעה של רשומה מול מדיניות כתובה — המקרים שבהם משתמשים במודל גנרטיבי כדרך יקרה לבחור מתוך רשימה. היתרונות שלו הם שהוא דטרמיניסטי, שהוא מחזיר הסתברות שמישה לשימוש ולא מחרוזת שצריך לפענח, ושבהיותו 1.73 GB על הדיסק הוא רץ בנוחות מתחת לעלות הזיכרון של דפדפן במחשב נייד. החסרונות שלו הם שהתיעוד נעצר בשטח ה-API, שאיש מחוץ ל-InternLM לא פרסם תוצאה עבורו, ושעמודת הבנצ'מרק היחידה שמרמזת על בעיית בטיחות — ציון WildJailBreak של 64.48 לעומת 96.29 של Jev — נותרה ללא הסבר. אל תציבו אותו מול קלט עוין בלי להריץ את הבדיקה הזו בעצמכם.

A screenshot of the Hugging Face model card for internlm/Intern-Decision-0.8B, showing the tags image-text-to-text, Transformers, Safetensors, qwen3_5, decision-making, multimodal and conversational, an Apache-2.0 licence, a model size of 0.9B params in F32-BF16, a seven-file repository, and a model tree naming Qwen/Qwen3.5-0.8B-Base as the base model. The card text reads that Intern-Decision-0.8B is 'a multimodal structured decision model fine-tuned from Qwen3.5-0.8B' which 'accepts a shared state, a schema of named questions, and optional images, and returns an answer distribution for every question in one model forward pass', followed by a three-step 'How inference works' list.

לשני המודלים מוצא משותף שראוי לציון, משום שהוא משנה את מה ש"פתוח" מקנה לך. כל אחד מהם הוא כיוונון עדין של נקודת ביקורת של Qwen, וכל אחד מהם משמר כראוי את הרישיון במעלה הזרם: MathForm 8B תחת Apache 2.0 עם מקור Qwen3-8B מצוין בכרטיס, ו-Intern-Decision-0.8B תחת Apache 2.0 עם קובץ LICENSE-QWEN נפרד במאגר. אף אחד מהם אינו נושא סף הכנסות או הגבלת תחום שימוש — שלא כמו LFM Open License v1.0 של Liquid AI, המתנה זכויות מסחריות בכך שהגוף שלך נשאר מתחת לקו הכנסה שנתית של 10 מיליון דולר. אם אתה בונה באופן מסחרי, זהו הבדל שמפריד בין שתי ההפצות הללו לחלקים ממערכת האקוסיסטם של המודלים הקטנים, והוא חל על שתיהן באותה מידה.

אם אתה רוצה את שכבת ההחלטה בלי נקודת הביקורת הלא מתועדת

הפער בין "ראש החלטה הוא הצורה הנכונה לבעיה הזו" לבין "ראש ההחלטה המסוים הזה הוא כזה שאתה יכול להגן עליו בפני סוקר" הוא מה שפתרון מתארח סוגר. Jev 1.13 של TypeSafe הוא המודל ש-InternLM בחנה את המשפחה שלו מולו ב-Jevbench, על Typed Decision ועל ToolACE, והוא ניתן לקריאה היום דרך נקודת קצה אחת תואמת OpenAI במחיר של 0.042 דולר למיליון טוקני קלט, כשהפלט מחויב באפס — המחיר המפורסם של הספק, מועבר הלאה ללא תוספת רווח במקום בתוספת רווח בדרך. עבור קורא שרוצה למדוד אם ראש החלטה עוזר בכלל לפני שהוא מתחייב לנקודת ביקורת של 0.8B עם מאגר חסר, זהו הניסוי הראשון והזול, וההערכות של Jev מצד שלישי מעניקות לו רקורד מתועד שעדיין אין ל-Intern-Decision-0.8B.

A screenshot of the OrcaRouter model page for typesafe/jev-1.13, dated 2026-09-24, showing a 65K token context, text input and text output, a P95 time to first token of 170 ms, and list pricing of $0.042 per million input tokens with no output rate. The description reads that Jev is TypeSafe's structured decision and evaluation model, taking a state and a set of named questions (noul, choice, score) and returning a structured answer for each, served non-streaming via POST /v1/systemone. A performance panel lower down reports a P50 time to first token of 178 ms and an output speed of 569 tokens per second.

התשובה הקצרה

שני אלה אינם חלופות. MathForm 8B הוא מומחה שתוכנה יכולה לאמת את פלטו, ומכוון למשימה שבה האימות הוא החלק הקשה; הוא מגיע עם המאמר, מערך הנתונים ורתמת ההערכה כדי להוכיח את הטענה. Intern-Decision-0.8B הוא מומחה שרק אתה יכול לאמת את פלטו, ומכוון למשימות שבהן התשובות כבר היו כתובות והחלק הקשה היה להגיע אליהן במהירות ובזול; הוא מגיע עם מודול הסקה וטבלה. אם אתה זקוק לפורמליזציה, יש רק אחד מאלה שכדאי לשקול. אם אתה זקוק לתווית ואתה מוכן לבנות את האמת המוחלטת כדי לבדוק את התווית כנגדה, ה-0.8B הוא ההורדה המעניינת יותר — מהיר, דטרמיניסטי, Apache 2.0, וקטן מספיק כך שהעלות של לגלות אם הוא שווה משהו היא אחר צהריים אחד ולא שורת תקציב.