כרטיס כותרת שנוצר עבור Decision 3.0 עם כתובית משנה 'שישה מודלים פתוחים רב-מודאליים לקבלת החלטות, מ-0.6B עד 27B', עם צ'יפים שעליהם כתוב 'משקלים Apache-2.0', 'תמונות וווידאו', 'אין עדיין פוסט השקה', וכיתוב תחתון באומרו 'כל הנתונים במאמר זה הם של vLLM-SR עצמה; אין כאן דבר שמשוחזר באופן עצמאי.' הלוגו של OrcaRouter מורכב בפינה הימנית התחתונה.
Engineering & Research

Decision 3.0 זמין ב-Hugging Face: שישה מודלי החלטה מולטימודליים פתוחים, שהוכרזו רק ב-X

מחבר

Gideon Frost

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים →
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

Decision 3.0 קיימת בצורה שאפשר להוריד ממש עכשיו, וכמעט שאף אחד לא כתב אותה. שישה נקודות ביקורת — d3, d3-flash, d3-mini, d3-nano, d3-lite ו-d3-edge — נחתו בארגון vllm-sr ב-Hugging Face ב-10 באוקטובר 2026, מהחדש לישן החל מ-09:38 UTC וכלה ב-d3-edge ב-23:49 UTC. הם ברישיון Apache-2.0, הם בנויים על עמודי השדרה Qwen3.5 ו-Qwen3.8, הם עונים על שאלות בחירה, כן/לא וניקוד בהסתברות לכל אפשרות במקום לייצר טוקן, וחמישה מהשישה קוראים כעת תמונות ווידאו. כל כרטיס מודל מתאר את עצמו כ"מודל ההחלטות הרב-מודלי הבסיסי בגודל 27B של Decision 3.0, מודלי ההחלטות של vLLM Semantic Router", שהוא שכבת ההחלטות הפתוחה של פרויקט vLLM.

מה שחסר הוא ההכרזה. חשבון ה-X של פרויקט vLLM בירך את צוות vLLM-SR על השחרור ב-11 באוקטובר, תוך ציטוט של שרשור ההיכרות של המתחזק עצמו — זהו כל התיעוד הציבורי. אינדקס הבלוג של הפרויקט עדיין מסתיים ב-10 באוקטובר עם פוסט על מודלים של החלטות ניתוב, ולא על אלה. עמוד המהדורות ב-GitHub עבור vllm-project/semantic-router מגיע רק עד v0.4.0 מ-27 בספטמבר. המשקלים שוחררו; הודעת ההשקה טרם.

ההבחנה הזו חשובה לאופן שבו אתה קורא את כל מה שמופיע בהמשך. כל נתון ביצועים במאמר הזה מגיע מכרטיסי המודל של vLLM-SR עצמה, כפי שנמדדו עם ההרנס שלהם ועל החומרה שלהם. שום דבר כאן לא שוחזר על ידי גורם חיצוני, והלוח שהם מפרסמים בו הוא לוח שהם מתחזקים. זוהי קריאה מוקדמת וכנה של תוצר שהוא אמיתי ושל טענה שטרם עברה ביקורת.

מה בעצם יש ב-Hugging Face

ששת המאגרים פשוטים, שלמים ועקביים זה עם זה. כל אחד מהם מכיל משקולות safetensors, תבנית צ'אט, decision_config.json שמצמיד את מהדורת מודל הבסיס, קוד מידול מותאם אישית (modeling_d3.py, d3_engine.py, d3_server.py), ראש קריאה משלו בreadout.safetensors, ו-MODEL_MANIFEST.json עם SHA-256 לכל קובץ. מאגר שביעי, דף האוסף, מפרט את כל השישה.

המשפחה, לפי הסדר שבו הגדלים יורדים:

• d3 — 26.09B פרמטרים, כולל מקודד חזותי של 0.46B, הבנוי על Qwen/Qwen3.8-27B. הועלה ב-10 באוקטובר, 09:38 UTC.

• d3-flash — 8.39B כולל מקודד חזותי של 0.46B, מבוסס על Qwen/Qwen3.5-9B.

• d3-mini — 4.54B כולל מקודד ראייה של 0.33B, מבוסס על Qwen/Qwen3.5-4B.

• d3-nano — 2.21B הכולל מקודד חזותי של 0.33B, הבנוי על Qwen/Qwen3.5-2B.

• d3-lite — 0.85B הכולל מקודד חזותי של 0.10B, הבנוי על Qwen/Qwen3.5-0.8B.

• d3-edge — 0.59B כולל מקודד חזותי של 0.10B, מבוסס גם על Qwen/Qwen3.5-0.8B. הועלה אחרון, 23:49 UTC.

לכל השישה יש את אותו חוזה בקשה: מצב (טקסט או JSON, עם אפשרות לתמונות וסרטונים) בתוספת מילון של שאלות בשמות, ותגובה של התפלגויות הסתברות מטיפוסים. שלושה סוגי שאלות קיימים — Choice, Noul (כן/לא), Score — והמודל עונה על כולם בקריאה אחת על ידי הרצת מעבר קדימה אחד לכל שאלה על אותו קלט, ללא לולאת פענוח בשום מקום.

A screenshot of the vLLM-SR collection page on Hugging Face, headed Decision 3.0 with the subtitle 'Towards Open Multimodal Foundation Decision Models' and marked as updated about 15 hours ago with 25 upvotes. It lists six repositories, each tagged Zero-Shot Classification: vllm-sr/d3 at 26B with 130 downloads and 18 likes, vllm-sr/d3-flash at 8B with 69 downloads, vllm-sr/d3-mini at 5B with 62, vllm-sr/d3-nano at 2B with 82, vllm-sr/d3-lite at 0.9B with 83, and vllm-sr/d3-edge at 0.6B with 33. The left sidebar lists the organisation's other collections: Vela 2.0, Decision 2.0, Decision 1.0, Vela 1.0, MoM 1.0 and MoM Nano.

המספרים, ולמי הם שייכים

vLLM-SR מפרסם לוח דירוג שהוא מכנה Jev Decision Index 0.3.1 וממקם את d3 בראשו. השורות הראשיות, כולן מדווחות על ידי הספקים:

• d3 — מדד 64.7, חבילת מבחנים ציבורית 65.5, מבחנים באותה מיומנות 62.8, משימות בתחום חדש 56.6.

• Perplexity Decider v1.1 (27B) — 62.8, 62.3, 61.1, 55.6.

• Fastino GLiDE no-thinking (28B) — 60.2, 59.1, 59.5, 52.9.

• Jev — 60.1, 58.0, 58.0, 55.0.

• Torchcast Decision 27B — 59.9, 65.1, 58.1, 50.8.

• Decision 2.0 (27B), הדור הקודם — 55.9, 57.0, 55.7, 47.9.

הערת שוליים בכרטיס של d3 קובעת במפורש שהשורה של d3 עצמה היא הערכה פנימית, בעוד ששורות ההשוואה הן נתוני לוח חיים שנקראו ב-10 באוקטובר. זהו הגילוי הנכון שיש לעשות, וכדאי לקרוא אותו פעמיים: מספרי המתחרים נלקחו מלוח, ומספר הנבדק הופק על ידי הצוות שבנה את המודל. הכרטיס גם טוען שכל 140,178 הבקשות הציבוריות נענו, כאשר אף אחת מהן לא נותרה ללא תמיכה — זו טענת כיסוי, לא טענת דיוק, וטענה יוצאת דופן לפרסום.

A screenshot of the vllm-sr/d3 model card on Hugging Face. The header shows 18 likes, the vLLM Semantic Router organisation, and tags for Transformers, Safetensors, qwen3_5, feature-extraction, decision-model, classification, system-one, multimodal, vision, video, custom_code and an Apache-2.0 licence, with the model size listed as 26B parameters in BF16. The card graphic reads 'Decision 3.0 / d3 27B'. A specification panel gives Parameters as 26.09B including the 0.46B vision encoder, Inputs as 'Text or JSON, plus images and videos (several per request)', Decision types as 'Choice - Yes / No - Score' and License as Apache-2.0. The Highlights section states a Jev Decision Index 0.3 public suite score of 65.45 measured with the official 0.3 kit on the released weights, all 140,178 public requests answered and none unsupported, and +8.5 on the public suite over Decision 2.0. The sidebar shows 130 downloads last month, a model tree pinned to Qwen/Qwen3.8-27B, and two Spaces using the model.

הצ'קפוינטים הקטנים יותר מדווחים על עצמם שהם צועדים בקצב אחיד. כל כרטיס מציג ציון בחבילת מבחנים ציבורית ואת הגודל המקביל ב-2: d3-flash 57.79, עלייה של 11.0 לעומת ה-9B הקודם; d3-mini 54.90, עלייה של 10.7; d3-nano 42.22, עלייה של 12.2; d3-lite 36.93, עלייה של 16.4; d3-edge 28.82, עלייה של 12.1. הרווחים היחסיים גדולים ביותר בתחתית הסקאלה, וזה מה שהייתם מצפים לו אם מתכון האימון המקדים המולטימודלי עושה עבודה רבה יותר עבור מודלים קטנים מאשר גדולים — וגם מה שהייתם מפיקים מכיוונון המודלים הקטנים בצורה האינטנסיבית ביותר. אין דרך לדעת איזו מהן מבחוץ.

החלק המולטימודאלי הוא השינוי האמיתי

המודלים של Decision 2.0 קוראים טקסט. אלה של Decision 3.0 קוראים טקסט, תמונות ווידאו, וזהו ההבדל המהותי בין הדורות — לא הזזת האינדקס. כל כרטיס מפרט קלט תמונה כ-PNG, JPEG או WebP, המסופק כנתיבים, כתובות URL, תמונות PIL או כתובות URL של נתוני base64, עם כמה תמונות בכל בקשה, כשכל תמונה בגודל של עד 1.6 מגה־פיקסלים; ווידאו כ-MP4, WebM, MOV או MKV, או כמערכי פריימים, הנקרא בקצב של 2 פריימים לשנייה, עם לכל היותר 32 פריימים הפרוסים על פני כל הקליפ, וכל פריים בגודל של עד 0.2 מגה־פיקסל. כל שאלה בבקשה רואה כל תמונה וכל וידאו שמצורפים לאותה בקשה.

הראיות התומכות לוידאו הן תוצאת Perception Test על כל 19,140 שאלות הוולידציה: d3 ב-77.4, d3-flash 73.3, d3-mini 70.3, d3-nano 63.5, d3-lite 59.3, d3-edge 46.6, לעומת רצפת מקריות מתועדת של 33.3 בשאלות עם שלוש אפשרויות. vLLM-SR מתייגת זאת כהערכה פנימית. d3 גם מופיעה בלוח חזותי המציב אותה ב-71.6 בסך הכול, לפני Perplexity Decider v1.1 ב-70.6 ו-JEV-27B-VL ב-69.6, כאשר שורות ההשוואה שוב נלקחו מנתוני הלוח ולא הורצו על ידי המחברים.

נתוני התפוקה הם של בקשה בודדת, GPU בודד, ומצוינים ככאלה: d3 עונה לבקשת טקסט בחציון של 55 מ"ש, לבקשה הנושאת תמונה ב-273 מ"ש, ולבקשה הנושאת וידאו של עשר שניות ב-553 מ"ש, על AMD Instinct MI325X אחד. d3-edge עושה את אותו הדבר ב-6.7 מ"ש, 41.9 מ"ש ו-308.3 מ"ש. אלה חציונים לכל שאלה במודל שנועד להיקרא פעמים רבות בתוך זרימת עבודה אחת, וזה המספר שחשוב לארכיטקטורה שעבורה המודלים האלה נבנו — עשרים החלטות עוקבות בתוספת של 100 מ"ש כל אחת עולות שתי שניות, כפי שמיקרוסופט העלתה את אותה נקודה לגבי מודל ההחלטות שלה החודש.

מה שהמאגרים לא אומרים

שלושה פערים ששווה לנקוב בשמם לפני שמישהו בונה תוכניות סביב זה.

הראשון הוא תקציב הקלט. decision_config.json עבור קבוצות המודלים הגדולות ביותר max_length כ-null, ואף כרטיס אינו מציין תקרת טוקנים עבור מצב בתוספת שאלות בתוספת תיאורי אפשרויות. הכרטיסים של Decision 1.0 פרסמו תקציבים מפורשים — 1,024 טוקנים לענף המקודד, 16,384 לענף המפענח — והמספרים הללו הם אילוץ תכנוני ממשי. היעדרם כאן בולט לעין, וזהו הדבר השימושי ביותר שקומיט המשך יוכל להוסיף.

השני הוא כיול. המספר החשוב ביותר של מודל החלטות אינו דיוק, אלא האם החזר של 0.9 פירושו תשע פעמים מתוך עשר. מדדי החזון והטקסט אינם אומרים דבר על כך. אין ציון Brier, אין נתון של שגיאת כיול צפויה, ואין טמפרטורה באף אחד מששת הכרטיסים. InternLM פרסמה את שניהם על מודל ההחלטות שלה בספטמבר; vLLM-SR לא עשתה זאת, עבור אף חבר במשפחה הזו.

השלישי הוא עצמאות. המודלים של Decision 2.0 היו בשימוש חיצוני במשך שבועיים; אלה של Decision 3.0 — שעות ספורות. מספרי ההורדות ב-11 באוקטובר — 130 עבור d3, 83 עבור d3-lite, 82 עבור d3-nano — הם טביעת הרגל של העלאה, לא של אימוץ. התייחסו לכל נתון מדד שלעיל כהשערה שצמוד לה מאגר.

היכן זה יושב בסטאק שאתה יכול לקרוא לו היום

השאלה המעשית בנוגע למודל החלטה היא אם הוא משתלב לתוך צינור עיבוד שכבר קיים, וכאן האקוסיסטם נמצא בשלב מתקדם יותר מהמודלים עצמם. פורמט הבקשה של System One שבו משתמשים המודלים האלה אינו קנייני ל-vLLM-SR: זהו אותו חוזה של מצב ושאלות בעלות שמות שמודלי Jev המתארחים נקראים באמצעותו, ולכן "Jev" מופיע גם כשם האינדקס בכרטיס המודל של d3 וגם כשורה בלוח הדירוג שלו.

OrcaRouter נושא את הצד הזה של המשפחה. typesafe/jev-1.13 נמצא בקטלוג שלנו ומוגש דרך POST /v1/systemone — אותו חוזה, במחיר $0.042 למיליון טוקנים של קלט, ללא חיוב על השלמה מפני שאין השלמה, עד לכ-64K טוקנים של קלט, טקסט נכנס ו-JSON מובנה יוצא, ללא סטרימינג. זה מסוג המודלים ששכבת החלטה קוראת להם היום. שני דברים שאיננו טוענים: d3 ושאר Decision 3.0 אינם בקטלוג שלנו, ונתיב ההסקה המקומי של Decision 3.0 הוא מחלקת Python במאגר Hugging Face, ולא נקודת קצה שיכולנו לנתב אליה גם אם היינו רוצים. מה שנתב כן קונה לכם כאן נמצא בצד השני של הלולאה — המודל הגנרטיבי שפועל על החלטה, מנותב דרך מפתח אחד על פני יותר מ-200 מודלים, עם מעבר אוטומטי לגיבוי כשספק מתערער, כך שהוספת שלב ניקוד לפני זרימת עבודה לא מחייבת גם הוספת קשר עם ספק שני.

מה היה משנה את התמונה הזו

ארבעה דברים, בסדר גס של כמה הם יאמרו לך. פוסט בבלוג מטעם הפרויקט שמציין את תקציב הקלט ואת צורת הפריסה המיועדת, מה שיאשר שזה שחרור ולא דחיפה. ציון Brier או נתון ECE על צ'קפוינט כלשהו. צד שלישי שמריץ את חבילת הבדיקות הציבורית על המשקלים המשוחררים במקום לקרוא את האינדקס. וסביבת הרצה — מאגר semantic-router קיבל שני קומיטים ב-11 באוקטובר שמחברים את d3 ו-d3-edge לסביבת ההרצה של המודל שלו, כולל קלט וידאו, מה שמרמז שסיפור ההגשה נבנה כעת וזה יהיה הדבר שיאפשר לנסות את המודלים האלה בזול.

עד שלפחות הראשון מאלה יגיע, הסיכום הכנה הוא זה: קיימת משפחת מודלים שלמה, Apache-2.0, רב-מודלית באמת, שנמצאת ב-Hugging Face מ-0.6B עד 27B, שפורסמה עם מקור טוב במיוחד — גיבובי קבצים, גרסאות בסיס מוצמדות, יעד חומרה מוצהר — ועם מעט מאוד מהתיעוד הנלווה שיאפשר לך להחליט אם להשתמש בה. להוריד אותה לא עולה כלום. להאמין שהאינדקס צריך לחכות.

A generated six-row scoreboard titled 'Decision 3.0 - the scoreboard', listing the family from largest to smallest with each checkpoint's parameter count and its vLLM-SR-reported Jev Decision Index 0.3 public-suite figure: d3 26.09B and 65.5, d3-flash 8.39B and 57.79, d3-mini 4.54B and 54.90, d3-nano 2.21B and 42.22, d3-lite 0.85B and 36.93, d3-edge 0.59B and 28.82, with a footer reading 'All figures are vLLM-SR's own; nothing here is independently reproduced.'

השוואות במאמר הזה1

זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית