
Decision 3.0 זמין ב-Hugging Face: שישה מודלי החלטה מולטימודליים פתוחים, שהוכרזו רק ב-X
- OrcaחדשOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 לכל 1M טוקנים · 71 tok/s
- openaiחדשOpenAI: GPT-6.1 Sol2026-09-2952אינטליגנציה
- anthropicחדשAnthropic: Claude Sonnet 5.52026-09-2856אינטליגנציה
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 לכל 1M טוקנים · 116 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238אינטליגנציה
- OpenAIOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- AnthropicAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- xAIGrok 4.72026-09-2146אינטליגנציה
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 לכל 1M טוקנים · 48 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 478 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- OpenAIOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- AnthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 לכל 1M טוקנים · 59 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 389 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
Decision 3.0 קיימת בצורה שאפשר להוריד ממש עכשיו, וכמעט שאף אחד לא כתב אותה. שישה נקודות ביקורת — d3, d3-flash, d3-mini, d3-nano, d3-lite ו-d3-edge — נחתו בארגון vllm-sr ב-Hugging Face ב-10 באוקטובר 2026, מהחדש לישן החל מ-09:38 UTC וכלה ב-d3-edge ב-23:49 UTC. הם ברישיון Apache-2.0, הם בנויים על עמודי השדרה Qwen3.5 ו-Qwen3.8, הם עונים על שאלות בחירה, כן/לא וניקוד בהסתברות לכל אפשרות במקום לייצר טוקן, וחמישה מהשישה קוראים כעת תמונות ווידאו. כל כרטיס מודל מתאר את עצמו כ"מודל ההחלטות הרב-מודלי הבסיסי בגודל 27B של Decision 3.0, מודלי ההחלטות של vLLM Semantic Router", שהוא שכבת ההחלטות הפתוחה של פרויקט vLLM.
מה שחסר הוא ההכרזה. חשבון ה-X של פרויקט vLLM בירך את צוות vLLM-SR על השחרור ב-11 באוקטובר, תוך ציטוט של שרשור ההיכרות של המתחזק עצמו — זהו כל התיעוד הציבורי. אינדקס הבלוג של הפרויקט עדיין מסתיים ב-10 באוקטובר עם פוסט על מודלים של החלטות ניתוב, ולא על אלה. עמוד המהדורות ב-GitHub עבור vllm-project/semantic-router מגיע רק עד v0.4.0 מ-27 בספטמבר. המשקלים שוחררו; הודעת ההשקה טרם.
ההבחנה הזו חשובה לאופן שבו אתה קורא את כל מה שמופיע בהמשך. כל נתון ביצועים במאמר הזה מגיע מכרטיסי המודל של vLLM-SR עצמה, כפי שנמדדו עם ההרנס שלהם ועל החומרה שלהם. שום דבר כאן לא שוחזר על ידי גורם חיצוני, והלוח שהם מפרסמים בו הוא לוח שהם מתחזקים. זוהי קריאה מוקדמת וכנה של תוצר שהוא אמיתי ושל טענה שטרם עברה ביקורת.
מה בעצם יש ב-Hugging Face
ששת המאגרים פשוטים, שלמים ועקביים זה עם זה. כל אחד מהם מכיל משקולות safetensors, תבנית צ'אט, decision_config.json שמצמיד את מהדורת מודל הבסיס, קוד מידול מותאם אישית (modeling_d3.py, d3_engine.py, d3_server.py), ראש קריאה משלו בreadout.safetensors, ו-MODEL_MANIFEST.json עם SHA-256 לכל קובץ. מאגר שביעי, דף האוסף, מפרט את כל השישה.
המשפחה, לפי הסדר שבו הגדלים יורדים:
• d3 — 26.09B פרמטרים, כולל מקודד חזותי של 0.46B, הבנוי על Qwen/Qwen3.8-27B. הועלה ב-10 באוקטובר, 09:38 UTC.
• d3-flash — 8.39B כולל מקודד חזותי של 0.46B, מבוסס על Qwen/Qwen3.5-9B.
• d3-mini — 4.54B כולל מקודד ראייה של 0.33B, מבוסס על Qwen/Qwen3.5-4B.
• d3-nano — 2.21B הכולל מקודד חזותי של 0.33B, הבנוי על Qwen/Qwen3.5-2B.
• d3-lite — 0.85B הכולל מקודד חזותי של 0.10B, הבנוי על Qwen/Qwen3.5-0.8B.
• d3-edge — 0.59B כולל מקודד חזותי של 0.10B, מבוסס גם על Qwen/Qwen3.5-0.8B. הועלה אחרון, 23:49 UTC.
לכל השישה יש את אותו חוזה בקשה: מצב (טקסט או JSON, עם אפשרות לתמונות וסרטונים) בתוספת מילון של שאלות בשמות, ותגובה של התפלגויות הסתברות מטיפוסים. שלושה סוגי שאלות קיימים — Choice, Noul (כן/לא), Score — והמודל עונה על כולם בקריאה אחת על ידי הרצת מעבר קדימה אחד לכל שאלה על אותו קלט, ללא לולאת פענוח בשום מקום.

המספרים, ולמי הם שייכים
vLLM-SR מפרסם לוח דירוג שהוא מכנה Jev Decision Index 0.3.1 וממקם את d3 בראשו. השורות הראשיות, כולן מדווחות על ידי הספקים:
• d3 — מדד 64.7, חבילת מבחנים ציבורית 65.5, מבחנים באותה מיומנות 62.8, משימות בתחום חדש 56.6.
• Perplexity Decider v1.1 (27B) — 62.8, 62.3, 61.1, 55.6.
• Fastino GLiDE no-thinking (28B) — 60.2, 59.1, 59.5, 52.9.
• Jev — 60.1, 58.0, 58.0, 55.0.
• Torchcast Decision 27B — 59.9, 65.1, 58.1, 50.8.
• Decision 2.0 (27B), הדור הקודם — 55.9, 57.0, 55.7, 47.9.
הערת שוליים בכרטיס של d3 קובעת במפורש שהשורה של d3 עצמה היא הערכה פנימית, בעוד ששורות ההשוואה הן נתוני לוח חיים שנקראו ב-10 באוקטובר. זהו הגילוי הנכון שיש לעשות, וכדאי לקרוא אותו פעמיים: מספרי המתחרים נלקחו מלוח, ומספר הנבדק הופק על ידי הצוות שבנה את המודל. הכרטיס גם טוען שכל 140,178 הבקשות הציבוריות נענו, כאשר אף אחת מהן לא נותרה ללא תמיכה — זו טענת כיסוי, לא טענת דיוק, וטענה יוצאת דופן לפרסום.

הצ'קפוינטים הקטנים יותר מדווחים על עצמם שהם צועדים בקצב אחיד. כל כרטיס מציג ציון בחבילת מבחנים ציבורית ואת הגודל המקביל ב-2: d3-flash 57.79, עלייה של 11.0 לעומת ה-9B הקודם; d3-mini 54.90, עלייה של 10.7; d3-nano 42.22, עלייה של 12.2; d3-lite 36.93, עלייה של 16.4; d3-edge 28.82, עלייה של 12.1. הרווחים היחסיים גדולים ביותר בתחתית הסקאלה, וזה מה שהייתם מצפים לו אם מתכון האימון המקדים המולטימודלי עושה עבודה רבה יותר עבור מודלים קטנים מאשר גדולים — וגם מה שהייתם מפיקים מכיוונון המודלים הקטנים בצורה האינטנסיבית ביותר. אין דרך לדעת איזו מהן מבחוץ.
החלק המולטימודאלי הוא השינוי האמיתי
המודלים של Decision 2.0 קוראים טקסט. אלה של Decision 3.0 קוראים טקסט, תמונות ווידאו, וזהו ההבדל המהותי בין הדורות — לא הזזת האינדקס. כל כרטיס מפרט קלט תמונה כ-PNG, JPEG או WebP, המסופק כנתיבים, כתובות URL, תמונות PIL או כתובות URL של נתוני base64, עם כמה תמונות בכל בקשה, כשכל תמונה בגודל של עד 1.6 מגה־פיקסלים; ווידאו כ-MP4, WebM, MOV או MKV, או כמערכי פריימים, הנקרא בקצב של 2 פריימים לשנייה, עם לכל היותר 32 פריימים הפרוסים על פני כל הקליפ, וכל פריים בגודל של עד 0.2 מגה־פיקסל. כל שאלה בבקשה רואה כל תמונה וכל וידאו שמצורפים לאותה בקשה.
הראיות התומכות לוידאו הן תוצאת Perception Test על כל 19,140 שאלות הוולידציה: d3 ב-77.4, d3-flash 73.3, d3-mini 70.3, d3-nano 63.5, d3-lite 59.3, d3-edge 46.6, לעומת רצפת מקריות מתועדת של 33.3 בשאלות עם שלוש אפשרויות. vLLM-SR מתייגת זאת כהערכה פנימית. d3 גם מופיעה בלוח חזותי המציב אותה ב-71.6 בסך הכול, לפני Perplexity Decider v1.1 ב-70.6 ו-JEV-27B-VL ב-69.6, כאשר שורות ההשוואה שוב נלקחו מנתוני הלוח ולא הורצו על ידי המחברים.
נתוני התפוקה הם של בקשה בודדת, GPU בודד, ומצוינים ככאלה: d3 עונה לבקשת טקסט בחציון של 55 מ"ש, לבקשה הנושאת תמונה ב-273 מ"ש, ולבקשה הנושאת וידאו של עשר שניות ב-553 מ"ש, על AMD Instinct MI325X אחד. d3-edge עושה את אותו הדבר ב-6.7 מ"ש, 41.9 מ"ש ו-308.3 מ"ש. אלה חציונים לכל שאלה במודל שנועד להיקרא פעמים רבות בתוך זרימת עבודה אחת, וזה המספר שחשוב לארכיטקטורה שעבורה המודלים האלה נבנו — עשרים החלטות עוקבות בתוספת של 100 מ"ש כל אחת עולות שתי שניות, כפי שמיקרוסופט העלתה את אותה נקודה לגבי מודל ההחלטות שלה החודש.
מה שהמאגרים לא אומרים
שלושה פערים ששווה לנקוב בשמם לפני שמישהו בונה תוכניות סביב זה.
הראשון הוא תקציב הקלט. decision_config.json עבור קבוצות המודלים הגדולות ביותר max_length כ-null, ואף כרטיס אינו מציין תקרת טוקנים עבור מצב בתוספת שאלות בתוספת תיאורי אפשרויות. הכרטיסים של Decision 1.0 פרסמו תקציבים מפורשים — 1,024 טוקנים לענף המקודד, 16,384 לענף המפענח — והמספרים הללו הם אילוץ תכנוני ממשי. היעדרם כאן בולט לעין, וזהו הדבר השימושי ביותר שקומיט המשך יוכל להוסיף.
השני הוא כיול. המספר החשוב ביותר של מודל החלטות אינו דיוק, אלא האם החזר של 0.9 פירושו תשע פעמים מתוך עשר. מדדי החזון והטקסט אינם אומרים דבר על כך. אין ציון Brier, אין נתון של שגיאת כיול צפויה, ואין טמפרטורה באף אחד מששת הכרטיסים. InternLM פרסמה את שניהם על מודל ההחלטות שלה בספטמבר; vLLM-SR לא עשתה זאת, עבור אף חבר במשפחה הזו.
השלישי הוא עצמאות. המודלים של Decision 2.0 היו בשימוש חיצוני במשך שבועיים; אלה של Decision 3.0 — שעות ספורות. מספרי ההורדות ב-11 באוקטובר — 130 עבור d3, 83 עבור d3-lite, 82 עבור d3-nano — הם טביעת הרגל של העלאה, לא של אימוץ. התייחסו לכל נתון מדד שלעיל כהשערה שצמוד לה מאגר.
היכן זה יושב בסטאק שאתה יכול לקרוא לו היום
השאלה המעשית בנוגע למודל החלטה היא אם הוא משתלב לתוך צינור עיבוד שכבר קיים, וכאן האקוסיסטם נמצא בשלב מתקדם יותר מהמודלים עצמם. פורמט הבקשה של System One שבו משתמשים המודלים האלה אינו קנייני ל-vLLM-SR: זהו אותו חוזה של מצב ושאלות בעלות שמות שמודלי Jev המתארחים נקראים באמצעותו, ולכן "Jev" מופיע גם כשם האינדקס בכרטיס המודל של d3 וגם כשורה בלוח הדירוג שלו.
OrcaRouter נושא את הצד הזה של המשפחה. typesafe/jev-1.13 נמצא בקטלוג שלנו ומוגש דרך POST /v1/systemone — אותו חוזה, במחיר $0.042 למיליון טוקנים של קלט, ללא חיוב על השלמה מפני שאין השלמה, עד לכ-64K טוקנים של קלט, טקסט נכנס ו-JSON מובנה יוצא, ללא סטרימינג. זה מסוג המודלים ששכבת החלטה קוראת להם היום. שני דברים שאיננו טוענים: d3 ושאר Decision 3.0 אינם בקטלוג שלנו, ונתיב ההסקה המקומי של Decision 3.0 הוא מחלקת Python במאגר Hugging Face, ולא נקודת קצה שיכולנו לנתב אליה גם אם היינו רוצים. מה שנתב כן קונה לכם כאן נמצא בצד השני של הלולאה — המודל הגנרטיבי שפועל על החלטה, מנותב דרך מפתח אחד על פני יותר מ-200 מודלים, עם מעבר אוטומטי לגיבוי כשספק מתערער, כך שהוספת שלב ניקוד לפני זרימת עבודה לא מחייבת גם הוספת קשר עם ספק שני.
מה היה משנה את התמונה הזו
ארבעה דברים, בסדר גס של כמה הם יאמרו לך. פוסט בבלוג מטעם הפרויקט שמציין את תקציב הקלט ואת צורת הפריסה המיועדת, מה שיאשר שזה שחרור ולא דחיפה. ציון Brier או נתון ECE על צ'קפוינט כלשהו. צד שלישי שמריץ את חבילת הבדיקות הציבורית על המשקלים המשוחררים במקום לקרוא את האינדקס. וסביבת הרצה — מאגר semantic-router קיבל שני קומיטים ב-11 באוקטובר שמחברים את d3 ו-d3-edge לסביבת ההרצה של המודל שלו, כולל קלט וידאו, מה שמרמז שסיפור ההגשה נבנה כעת וזה יהיה הדבר שיאפשר לנסות את המודלים האלה בזול.
עד שלפחות הראשון מאלה יגיע, הסיכום הכנה הוא זה: קיימת משפחת מודלים שלמה, Apache-2.0, רב-מודלית באמת, שנמצאת ב-Hugging Face מ-0.6B עד 27B, שפורסמה עם מקור טוב במיוחד — גיבובי קבצים, גרסאות בסיס מוצמדות, יעד חומרה מוצהר — ועם מעט מאוד מהתיעוד הנלווה שיאפשר לך להחליט אם להשתמש בה. להוריד אותה לא עולה כלום. להאמין שהאינדקס צריך לחכות.

השוואות במאמר הזה1
זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית
