
Decision 3.0 לעומת Intern-Decision-4B: שני צוותים כיווננו עדין את אותו המודל ולא הסכימו על כל דבר אחר
- OrcaחדשOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 לכל 1M טוקנים · 71 tok/s
- openaiחדשOpenAI: GPT-6.1 Sol2026-09-2952אינטליגנציה
- anthropicחדשAnthropic: Claude Sonnet 5.52026-09-2856אינטליגנציה
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 לכל 1M טוקנים · 116 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238אינטליגנציה
- OpenAIOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- AnthropicAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- xAIGrok 4.72026-09-2146אינטליגנציה
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 לכל 1M טוקנים · 48 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 478 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- OpenAIOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- AnthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 לכל 1M טוקנים · 59 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 389 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
הצב d3-mini, החבר ה-4B של Decision 3.0, לצד Intern-Decision-4B והדבר הראשון שאתה שם לב אליו אינו הבדל. שניהם פיין-טיונים של אותו צ'קפוינט בסיס, Qwen3.5-4B. שניהם רשומים עם 4.54 מיליארד פרמטרים. שניהם מקבלים מצב, סכימה של שאלות בעלות שמות וקבוצה של תשובות מועמדות, ומחזירים הסתברות מכוילת לכל מועמד בלי לייצר טוקן. שניהם Apache-2.0. שניהם שוחררו בלי הודעה — InternLM העלתה שלושה צ'קפוינטים בארבעים שניות ב-26 בספטמבר 2026, ומשפחת Decision 3.0 של vLLM-SR נחתה ב-Hugging Face ב-10 באוקטובר 2026 כשאת החדשות נשא רק חשבון ה-X של פרויקט vLLM.
כל מה שאחרי זה הוא מחלוקת. הם חלוקים בדעה לגבי איך לקרוא הסתברות מתוך המודל, לגבי האם וידאו נחשב כקלט, לגבי כמה ארוכה יכולה להיות בקשה, ובחדות הרבה ביותר — לגבי האם הצוות מוכן לפרסם את המספר שאומר שהביטחון שלו עצמו מהימן. הקטע הזה עוסק בארבע המחלוקות האלה ובמה שכל אחת מהן עולה לך, ולא בשאיזה מודל "טוב יותר", כי השניים אינם נמדדים באותו סולם ולא ניתן לדרג אותם זה כנגד זה בלי לבצע עבודה שאף אחד מהספקים לא ביצע.
צירוף המקרים ששווה להבין תחילה
שתי מעבדות שבוחרות ב-backbone 4B בתוך זה לא לגמרי — Qwen3.5-4B הוא בסיס למודל עם פלט מובנה, ושתי הקבוצות בבירור פנו אליו כי הוא קטן מספיק כדי להריץ בזול וחזק מספיק כדי לקרוא. מה שיוצא דופן הוא שהן הגיעו לאותו מספר פרמטרים בארבע ספרות מובהקות. זה אומר לך שהכוונון העדין שימר את הארכיטקטורה, ושאף אחת מהן לא הוסיפה מגדל ראייה נפרד גדול מספיק כדי להזיז את הסכום הכולל. שתיהן מקפלות את היכולת הרב-מודלית שלהן לתוך אותם משקלים.
החלק המעניין הוא הקריאה. שני המודלים עונים על שאלות באותו אופן באופן עקרוני — מדרגים תשובות מועמדות במקום לייצר אותן — ובאופן שונה לחלוטין מבחינת המנגנון:
• Intern-Decision-4B — ממפה כל אפשרות לסמל טוקן יחיד (A–Z, ואז a–z, ואז 0–9), מרנדר שלד JSON לתוך הפרומפט עם מציין מקום לכל שדה, ומריץ מעבר קדימה סיבתי אחד, תוך קריאת לוגיטים במיקום מיד לפני כל מציין מקום. המנגנון מתועד שלב אחר שלב בכרטיס המודל שלו, כולל שלב ה-softmax והטמפרטורה המדויק.
• d3-mini — מגיע עם ארכיטקטורה מותאמת אישית ב-modeling_d3.py עם ראש קריאה נפרד משלו ב-readout.safetensors, קובץ decision_config.json המצהיר על noncausal_full_attention וצבירת הטוקן האחרון, ומיפוי טוקנים לקודים שמוגדר בקונפיגורציה ולא מתואר בפרוזה.
אף אחת מהגישות אינה טובה יותר באופן מובהק. למסלול של InternLM יש את היתרון שהוא פועל על מחלקת מודל סטנדרטית של Hugging Face עם רצף מספרי מתועד — ניתן לבדוק את עבודתו. למסלול של vLLM-SR יש את היתרון שהקריאה היא ראש מאומן ולא השלכה של הטמעת אסימון קיימת, מה שמאפשר התאמה חופשית יותר, והמחיר הוא שעליך trust_remote_code=True ולהריץ את הקוד שלהם כדי לעשות משהו בכלל.
המגבלות שכל אחד מפרסם
כאן מתחילה להיווצר העדפה אמיתית, כי כרטיס אחד הרבה יותר ספציפי מהשני לגבי היכן הוא מפסיק לעבוד.
• תקרת קלט — Intern-Decision-4B: 8,192 טוקנים כברירת מחדל, ובקשות החורגות ממנה נדחות לחלוטין, ולעולם אינן נחתכות, כאשר התקרה נקבעת על ידי ארגומנט בנאי. d3-mini: max_length הוא null בתצורה שסופקה, ושום תקציב טוקנים אינו מופיע בשום מקום בכרטיס.
• שאלות לכל בקשה — Intern-Decision-4B: 1 עד 16, עם מקסימום מוצהר של 62 אפשרויות בכל שאלה בודדת. d3-mini: אין מגבלה מוצהרת; הכרטיס אומר רק שהשאלות נענות יחד, כל אחת ממעבר קדימה משלה.
• תמונות — Intern-Decision-4B: עד שמונה לבקשה, מסודרות לפי רשימה שאתה מספק, כאשר מעבד ה-checkpoint מטפל בשינוי גודל ובהרחבת טוקנים. d3-mini: מרובות לבקשה כנתיבים, כתובות URL, תמונות PIL או כתובות data URL ב-base64, כל אחת נקראת ברזולוציה של עד 1.6 מגה-פיקסל, וכל שאלה רואה כל תמונה.
• וידאו — Intern-Decision-4B: אין. d3-mini: מספר סרטונים, נקראים בקצב של 2 פריימים לשנייה, מוגבל ל-32 פריימים הפרוסים על פני הסרטון ו-0.2 מגה-פיקסל לפריים.
תקרת הקלט היא הגבול שיכריע את זה עבור רוב האנשים. תקציב של 8,192 טוקנים המשותף בין מצב, הוראות שאלה ותיאורי מועמדים הוא אילוץ ממשי על עבודת דירוג המסמכים וניתוב ההקשר הארוך שהמודלים האלה נמכרים עבורה, ומגיע קרדיט ל-InternLM על שאמר זאת בגלוי במקום להשאיר זאת להתגלות. vLLM-SR שמשאיר זאת בלתי מצוין הוא ההיפך: לא מגבלה נסתרת, אלא מגבלה לא ידועה, ושום כמות של קריאה במאגר לא תכריע בכך.
הכיול הוא הפיצול האמיתי
כל מודל קבלת החלטות מבטיח את אותה הבטחה: המספר שהוא מחזיר הוא הסתברות, וספים שנקבעים מולו הם בעלי משמעות. כמעט אף אחד מהם לא מוכיח זאת. כאן שתי המהדורות נבדלות זו מזו ביותר, והפער נע בכיוון ההפוך מזה שהייתם מנחשים מתאריכי השחרור.
Intern-Decision-4B מפרסם, בכרטיס שלו, ציון Brier של 0.347 ושגיאת כיול צפויה של 0.065 בממוצע על פני שבעת הבנצ'מרקים שלו, טמפרטורה מותאמת של 1.99241824 שנגזרה באמצעות מזעור NLL על 1,728 מקרי כיול ייעודיים עם 1,693 מקרי אימות נפרדים, הצהרה מפורשת שתוויות חבילת הבדיקות לא שימשו לבחירת אותה טמפרטורה, ואבחון של 96 מקרים המראה שהכיול שלו עובר מ-0.628 Brier / 0.213 ECE לפני כיול טמפרטורה ל-0.550 / 0.089 לאחריו. הוא גם מציין את ברירת המחדל ואומר שהכיול הוא לפי צ'קפוינט, כך ששימוש בגודל אחר עם מודול זה לא יתאים.
Decision 3.0 מפרסמת מדד דיוק וטענת כיסוי — כל אחת מ-140,178 הבקשות הציבוריות נענתה, אף אחת מהן לא נותרה ללא תמיכה — ולא נתון כיול כלל. אין ציון Brier, אין ECE, אין טמפרטורה מוצהרת, באף אחת משש נקודות הביקורת. הטמפרטורה בקובץ של d3 המסופק בשם decision_config.json היא 1.0, שזו הזהות ועשויה להיות הערך המותאם או שלא; הקובץ אינו מציין זאת.
קראו את שתי כותרות המדד זו לצד זו, והאסימטריה מחמירה. הכרטיס של d3-mini מדווח על ציון public-suite של Jev Decision Index 0.3 העומד על 54.90, המתואר כנמדד עם הערכה הרשמית על המשקלים ששוחררו, בעוד ששורות ההשוואה באותו לוח מתוארות כנתוני לוח בזמן אמת. Intern-Decision-4B מדווח על ממוצע של 90.02 על פני שבעה בנצ'מרקים משלו. שני המספרים האלה אינם באותו סולם, הם אינם משתמשים באותן משימות, והצבתם במשפט אחד כהשוואה תהיה לא-ישרה. מה שכן בר-השוואה הוא הגילוי: כרטיס אחד אומר לך עד כמה רמות הביטחון שלו מוטעות, והאחר אינו יודע או אינו מוכן לומר.

השהיה, ולמה גם שתי קבוצות המילישניות אינן ניתנות להשוואה
שני הכרטיסים מפרסמים השהיה לכל בקשה, ולקיחתם כפשוטם תהיה טעות מאותה סיבה שנתוני הדיוק אינם ברי השוואה.
• Intern-Decision-4B — ממוצע 44.16 ms, חציון 44.03 ms, p95 44.60 ms, נמדד על כרטיס RTX 4090 בודד דרך נתיב Hugging Face המקומי, ומתואר כתלוי בעומס העבודה ובחומרה.
• d3-mini — חציון של 17.5 מ״ש עבור טקסט, 96.2 מ״ש עם תמונה, 371.5 מ״ש עם וידאו באורך עשר שניות, על AMD Instinct MI325X אחד, בקשה אחת בכל פעם.
שני דברים הופכים את אלה לבלתי ניתנים להשוואה. הראשון הוא החומרה ונתיב התוכנה: 4090 מול MI325X, מעבר קדימה סטנדרטי של Hugging Face מול מימוש attention מותאם אישית עם קרנלים של שכבות ממוסכות הזמינים דרך flash-linear-attention. השני הוא עומס העבודה: המספר של InternLM מתואר כקצה-לקצה לכל שאילתה על תערובת שלא צוינה, וזה של vLLM-SR מפורק לפי מודאליות קלט, כך שההשוואה של טקסט בלבד היא הקו היחיד שהוא באמת שקול, ואפילו הוא חוצה שני ספקי GPU.
המספר שצריך לקחת משני הכרטיסים אינו הדירוג, אלא הצורה. מודל החלטות נקרא שוב ושוב בתוך זרימת עבודה אחת — רשומת תמיכה עשויה להזדקק ליעד, לבדיקת החזר, להחלטת הסלמה ולציון עדיפות, ארבע שאלות, ואצווה של 128 רשומות הופכת את זה ל-512 החלטות. בהיקף כזה, גם 17 ms וגם 44 ms מתגמדים לעומת העלות של המודל הגנרטיבי שבהמשך, תהיה אשר תהיה. הנתונים התלויים במודאליות הם אלה שצריך לשים לב אליהם, מפני שבקשה לתמונה או לווידאו עולה בין פי חמישה לפי עשרים מבקשה לטקסט לפי המספרים של d3-mini עצמו, ואם ההחלטה שלך מתקבלת על סמך צילום מסך, ייבאת פרופיל עלויות שלרוב פריסות מודלי ההחלטות אין.
איזו אחת לבחור למעשה
אם ההחלטה שעליך לקבל תלויה בווידאו, אין תחרות ואין צורך בניתוח: Decision 3.0 קורא וידאו ואילו Intern-Decision-4B לא. זו התשובה כולה לכל דבר הכרוך בהקלטות מסך, קטעי מצלמה או רצפי פריימים, וזהו פער היכולות שמצדיק בזכות עצמו את קיומה של המשפחה החדשה יותר.
אם הקלטים שלך הם טקסט ותמונות מדי פעם, הבחירה תלויה בשני דברים, ואף אחד מהם אינו טבלת המובילים.
קח את Intern-Decision-4B כשאתה צריך לשקול ספים. הוא היחיד מבין השניים שאומר לך האם 0.9 פירושו תשע מתוך עשר, הוא מציין את הטמפרטורה שלו, הוא אומר על אילו מקרים הותאמה הטמפרטורה הזו, והוא מתעד את ההסקה שלו כהליך ממוספר קצר שאתה יכול ליישם מחדש מול מחלקת מודל סטנדרטית. עבור מעריך שמוצב לפני פעולה אוטומטית, זו התכונה שחשובה, והיא נדירה יותר מנקודות דיוק.
בחר ב-Decision 3.0 כשאתה צריך את הטווח או את המודאליות. שש נקודות ביקורת מ-0.59B עד 26.09B אומרות שאותו פורמט בקשה יכול להיות מוגש על ידי מודל קצה של 6.7 מילישניות ומודל של 27B, והמשפחה חולקת ממשק אחד, כך שמעבר בין דרגים הוא שינוי תצורה ולא כתיבה מחדש. המלכוד הוא שאתה סומך על תקציב קלט שלא צוין ועל טענת כיול שלא עברה ביקורת, והמודל הגדול ביותר במשפחה הוא זה שהספק מדד את מספר האינדקס שלו ברתמת הבדיקה שלו עצמו.
אף אחד מהשניים אינו ברירת מחדל בטוחה כיום. הצ'קפוינט עם מספר ההורדות הגבוה ביותר של d3 נמצא ב-Hugging Face כבר בערך יום; Intern-Decision-4B זמין כבר שבועיים וצבר בערך 3,200 הורדות ו-83 לייקים, שזה תשומת לב אבל לא תעבורה בסביבת ייצור. שניהם זולים מספיק כדי לבדוק, ולאף אחד מהשניים אין הערכת צד שלישי מאחוריו. אם אתם מציבים סקורר לפני משהו שמוציא כסף, המהלך הנכון הוא להריץ את שניהם על המקרים המתויגים שלכם ולהשוות את עקומות הכיול, ולא את שורות האינדקס.

איפה נתב משתלב, בכנות
OrcaRouter אינו כולל אף אחד מהמודלים האלה. נקודות הביקורת של Decision 3.0 הן מסלול הסקה מקומי ב-Python במאגר של Hugging Face ללא נקודת קצה HTTP שפורסמה, ו-Intern-Decision-4B מגיע בתור מחלקת DecisionEngine שאתה יוצר מופע שלה בעצמך. אף אחד מהשניים אינו משהו שנוכל לנתב היום, ואין לקרוא שום חלק במאמר זה כהצהרה על זמינות.
מה שכן יש לנו הוא הקצה ה-hosted של אותה משפחה. typesafe/jev-1.13 נמצא בקטלוג שלנו, ומוגש דרך POST /v1/systemone — אותו חוזה state-and-named-questions ששני המודלים הפתוחים שלמעלה מיישמים — במחיר של $0.042 למיליון טוקנים בקלט, ללא חיוב על השלמה, מכיוון שהוא לעולם אינו מייצר אחת. הוא יושב לצד יותר מ-200 מודלים אחרים, וזו הנקודה המעשית לכל מי שמשווה בין השניים: מודל הניקוד הוא החלק הזול של הלולאה, והמודל שפועל על פי ההחלטה הוא החלק היקר. ניתוב של שניהם דרך מפתח אחד, עם מעבר אוטומטי לגיבוי כשספק מתנדנד, ומחיר המחירון של הספק מועבר הלאה ללא תוספת של 0%, משמעו שהערכת מודל החלטות אינה מחייבת לחתום על חוזה שני או לשכתב את מקום הקריאה כשאתה מחליף backend. אם אתה בעיצומו של תהליך הערכה — ושם נמצאים שני המודלים הללו, היום — זה החלק שכדאי להכין לפני שאתה מתחייב לאחד משניהם.

השאלה הפתוחה
שני הכרטיסים חלוקים בדעתם באשר למה שמחבר מודל חייב לקורא, והמחלוקת הזו מעניינת יותר מהמודלים. InternLM פרסמה טמפרטורה ואת המקרים שעליהם הותאמה, ואז פרסמה את האבחון שמראה בכמה השתפר הכיול. vLLM-SR פרסמה גיבובי קבצים, גרסאות בסיס מוצמדות, יעד חומרה מוצהר, טענת כיסוי — עבודת תיעוד מקור אמיתית — וללא מספר כיול כלל.
המבחן של איזו מהדורה מתבגרת אינו איזו מהן מנצחת בלוח. הוא האם הצ'קפוינט Decision הבא יוצא עם ציון Brier עליו, והאם ההעלאה הבאה של InternLM מגיעה לווידאו. שניהם נראים מבחוץ, בדיקת שניהם זולה, ואף אחד מהשניים עוד לא התרחש.
