כרטיס הירו שנוצר שכותרתו 'NV-Reason-CT לעומת Qwen3.8 Max' עם כתובית המשנה 'הכוונון העדין והמשפחה שממנה הגיע'. שלושה צ'יפים מוצגים לאורך החלק התחתון: 'שלד: Qwen/Qwen3.5-4B', '13,824 אסימונים לעומת 1,000,000', ו-'3.5% לעומת 0.21% שגיאה מדודה'. הלוגו של OrcaRouter משולב בפינה הימנית התחתונה.
Guides & Insights

NV-Reason-CT לעומת Qwen3.8 Max: הכיוונון העדין והמשפחה שממנה הוא הגיע

מחבר

Alistair Wren

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים →
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

השורה הראשונה של NV-Reason-CT בכרטיס המודל מספרת לך משהו שרוב האנשים מדלגים עליו. מודל הבסיס הוא Qwen/Qwen3.5-4B, המופיע במטא-נתוני המאגר כיחס כיוונון עדין. אז כאשר NVIDIA נזקקה למודל שפה כדי לחבר אליו טרנספורמר ראייה Primus 3D, היא לקחה Qwe​n. השווה את הצ'קפוינט הזה עם Qwen3.8 Max — הדגל של Aliba​ba עצמה עם 1,000,000 טוקנים, שהושק ב-3 באוגוסט 2026 — ואתה מסתכל על כיוונון עדין ועל העסק המשפחתי. האחד הוא מומחה 4.69B שקורא נפחי CT של החזה והבטן, ופורסם ב-Hugging Face ב-8 בספטמבר 2026 ללא כל הודעה. האחר הוא דגל כללי עם קלט טקסט, תמונה וווידאו, כרטיס תעריפים מפורסם, ו-37.2 מיליון טוקנים של תעבורה מדודה ברשת שלנו בשבוע האחרון. השאלה המעניינת אינה מי מנצח. היא מה שכיוונון עדין של 4B יכול לעשות שדגל המשפחה שלו לא יכול, ולמה התשובה ספציפית יותר ממה שהיית מצפה.

מה שהכיוונון העדין קנה, באופן קונקרטי

האופן שבו NVIDIA עצמה מנסחת את הפער מדויק באופן יוצא דופן, והוא המשפט השימושי ביותר במאגר: רוב המערכות החזותיות-לשוניות "או שפועלות על תמונות דו-ממדיות או שדוחסות מאפיינים נפחיים לפני פענוח לשוני". זהו תיאור של מחלקה שלמה של מודלים, והוא כולל כל מודל דגל רב-מודאלי כללי בשוק.

התיקון הוא ארכיטקטוני ולא עניין של קנה מידה. נפח קלט של 384×384×384 מ״מ הופך לרשת 24×24×24 של 13,824 טוקנים חזותיים. טוקנים אלה והקואורדינטות התלת-ממדיות שלהם נכנסים למודל השפה ללא דגימה מרחבית מופחתת, ו-3D MRoPE משמר את היחסים המרחביים בתוך המפענח. נפחי קלט נחתכים עם מודעות אנטומית לבית החזה או לבטן באמצעות יחידות Hounsfield של הריאה, ואז נדגמים מחדש לרזולוציה איזוטרופית של 2 מ״מ.

קרא את זה מול מה ש-Qwen3.8 Max מקבל. טקסט, תמונה ווידאו — והווידאו הוא הדבר הקרוב ביותר בסדרה הזו לקלט נפחי, מה שהופך אותו לנקודת ההשוואה הכנה ולא לרטורית. וידאו הוא ערימה of פריימים דו-ממדיים המסודרים לפי זמן. נפח CT הוא ערימה של פרוסות דו-ממדיות המסודרות לפי מיקום פיזי לאורך ציר ה-z, ביחידות האונספילד, עם מרחק מילימטרי ידוע. שניהם מערכים תלת-ממדיים. רק לאחד מהם יש מערכת קואורדינטות פיזית שאליה אפשר למקם ממצא של רדיולוג, ורק אחד מהם נמדד ביחידה שיש לה משמעות מחוץ לחיישן תמונה. מודל שמאומן על וידאו לומד רציפות זמנית. מודל שמאומן על נפחי CT לומד שמסה בפרוסה אחת היא אותה מסה בפרוסה הבאה, שמונה מילימטרים מתחת.

קורפוס האימון הוא ההבדל האמיתי

כאן שני הדגמים מפסיקים להיות ברי־השוואה כלל, וזה החלק שדף מפרט מסתיר.

NV-Reason-CT אומן מקצה לקצה עם כיוונון עדין מפוקח, שלאחריו Group Relative Policy Optimization, על כ־550,000 דוגמאות QA מובנות שנלקחו מ־70,111 נפחי CT ייחודיים. המקורות הם CT-RATE — 47,149 מקרים מבית החולים Istanbul Medipol University Mega Hospital עם דוחות רדיולוגיה מזווגים — סט פנימי של NIH של 15,991 מקרים, ו־22,720 מקרים של CancerVerse על פני ארבעה שלבי ניגודיות ושלושה־עשר סוגי גידולים ממאירים. הקורפוס כולל דוחות מתוקננים, QA ממוקד־אבנורמליות, דיאלוג רב־תורי, והנמקה שנכתבה על ידי רדיולוגים ותומללה מהקלטות של פרשנויות מומחים. שלב ה-GRPO משתמש בתגמולים ברי־אימות על מערכי אבנורמליות בחזה ובבטן, כלומר אות התגמול בודק אם ממצא מוצהר נמצא בנפח, ולא אם הפרוזה נשמעת קלינית.

קורפוס האימון של Qwen3.8 Max אינו מפורסם ברמה כזו של פירוט, וגם לא היה מועיל אילו היה מפורסם, משום שהיכולת המיועדת היא כללית. במקום זאת, נתוני Artificial Analysis שלו הם הראיות הרלוונטיות: מדד Intelligence Index של 45.4, שמציב אותו במקום ה-15 מתוך 145 מודלים בתמונת המצב של ה-API שלנו, AA Coding 76.2 במקום ה-9, Terminal-Bench 2.1 בציון 88.8, GPQA Diamond 92.8, Humanity's Last Exam 43.1, SciCode 52.1 וזכירה בהקשר ארוך 80.3. אלה מדידות של צד שלישי, לא טענות של ספק, מה שהופך אותן למספרים המהימנים ביותר משני צדי העמוד הזה.

פלט הנמקה, שני חוזים שונים

שני המודלים פולטים עקבות חשיבה ושניהם מאפשרים לך לכבות אותן. הדמיון ביניהם נגמר בממשק.

Qwen3.8 Max חושף את enable_thinking ו־reasoning_effort, יחד עם מכלול אפשרויות הדגימה המלא — temperature, top_p, seed, קנסות, פלטים מובנים, וקריאה לכלים. זוהי יכולת הסקה כללית שאתה מכוון אותה אל מה שיש לך. החשיבה שלה טובה במידה שבה הבעיה שאתה נותן לה טובה, ואין לה דרך לאמת טענה מול שום דבר מלבד הטקסט שניתן לה.

לחשיבה של NV-Reason-CT יש חוזה צר יותר עם הקורא, וכרטיס המודל מציין את המגבלה במפורש: חשיבה שנוצרת היא "פלט מודל שניתן לסקור ואינו מובטח כמייצג את החישוב הפנימי של המודל". ההסתייגות הזו עושה עבודה אמיתית, והיא מהסוג של משפטים שמופיעים רק כשצוות חשב מה יעשה קלינאי עם עקבה שנשמעת סבירה. הכרטיס מתאר את הפלט כתצפיות ניתנות לסקירה, אבחנות מבדלות ואי-ודאות. עקבה שאפשר לבדוק מול הנפח, במילים אחרות, ולא כזו שאפשר רק לקרוא.

תפוקה, מהמקום היחיד שבו אנחנו יכולים למדוד אותה

Qwen3.8 Max העביר 37.2 מיליון אסימונים דרך מגרש המשחקים הפרטי של OrcaRouter בשבעת הימים האחרונים. הזמן החציוני עד לאסימון הראשון היה 1.96 שניות — בנוחות המהיר מבין המודלים בסדרה הזו — בקצב של 53.3 אסימוני פלט לשנייה. שיעור השגיאות שלו באותו חלון זמן היה 3.5%.

שני הנתונים הללו מושכים לכיוונים מנוגדים ושניהם חשובים. השהיה מצוינת והופכת את העבודה עם המודל לנעימה באיטרציות. שיעור השגיאות גבוה בערך פי שבעה עשר מ-0.21% של Kimi K3 באותו חלון מדידה, וזה המספר שמכריע אם להעמיד אותו מאחורי קריאה סינכרונית מול המשתמש או מאחורי משימת אצווה עם ניסיונות חוזרים. זהו התנהגות נמדדת ברשת שלנו, לא בנצ'מרק, וזה מסוג הדברים שמחירון לעולם לא מספר לך.

ל-NV-Reason-CT אין מדידה מקבילה בשום מקום. זהו צ'קפוינט BF16 בנפח 10.6 GB עם קוד מודל מותאם אישית, שנטען עם trust_remote_code=True על חומרת Ampere, Hopper או Lovelace, נבדק על ידי NVIDIA על H100 ו-L40S. אין p50, אין שיעור שגיאות ואין נתון תפוקה שפורסם. כל מי שאומר לך את נפח המעבר שבו אירוח עצמי של זה משתלם יותר מתשלום לפי טוקן מנחש.

מחיר וצורה, זה לצד זה

• מחיר — הוצאות הון (capex) על GPU של NV-Reason-CT, ללא תעריף לכל טוקן לעומת Qwen3.8 Max $2.00 / $6.00 למיליון טוקנים, $0.25 לקריאה מהמטמון, $2.50 לכתיבה למטמון

• קלט — נפחי CT תלת־ממדיים בפורמט NIfTI של NV-Reason-CT ביחידות האנספילד, של בית החזה או הבטן בלבד, לעומת Qwen3.8 Max בטקסט, תמונה ווידאו

• הקשר — NV-Reason-CT נפח אחד, קידומת קבועה של 13,824 טוקנים לעומת Qwen3.8 Max עם 1,000,000 טוקנים

• פרמטרים — NV-Reason-CT 4.69B סה״כ / 4.35B פעילים במסלול CT לעומת Qwen3.8 Max שפרטיו לא נחשפו

• רישיון — NV-Reason-CT OpenMDW-1.1, משקלים מפורסמים לעומת Qwen3.8 Max קנייני, גישה ל-API בלבד

• ציונים בלתי־תלויים — NV-Reason-CT אין לעומת Qwen3.8 Max AA Intelligence Index 45.4, GPQA Diamond 92.8

A generated scoreboard titled 'NV-Reason-CT vs Qwen3.8 Max - the scoreboard'. Left column 'NV-Reason-CT': Price GPU capex, no per-token rate; Input 3D NIfTI CT, chest or abdomen; Context one volume, 13,824-token prefix; Parameters 4.69B total / 4.35B active; Licence OpenMDW-1.1, weights published; Independent score none published. Right column 'Qwen3.8 Max': Price $2.00 / $6.00, $0.25 cached read; Input text, image and video; Context 1,000,000 tokens; Parameters undisclosed; Licence proprietary, API only; Independent score AA Index 45.4, GPQA Diamond 92.8. A footer reads 'Qwen3.8 Max scores per Artificial Analysis; NV-Reason-CT figures are the authors' own, from the model card.'

כלכלת המטמון של Qwen3.8 Max מתגמלת תבנית מסוימת: קריאה מהמטמון בעלות $0.25 לעומת קלט טרי בעלות $2.00 היא הנחה של פי שמונה, וכתיבה למטמון בעלות $2.50 משמעה שקידומת ארוכה לשימוש חוזר מחזירה את עלותה במהירות. זהו עומס העבודה של הנחיית מערכת בתוספת מסמך פרוטוקול שנעשה בהם שימוש חוזר לאורך אלפי בקשות. ל-NV-Reason-CT יש פרופיל עלויות הפוך — עלות שולית כמעט אפסית לכל סריקה לאחר רכישת ה-GPU, ורצפה קשיחה של GPU אחד המוחזק ללא הגבלת זמן.

A screenshot of NVIDIA's Hugging Face model page for NV-Reason-CT, showing the model card header with Like 1 and 0 followers, the Image-Text-to-Text and Transformers and Safetensors tags, the qwen3_5, medical-imaging, ct, 3d-vlm and custom_code tags, 'Downloads last month 210', the 5B-parameter BF16 size row, the model description describing the 384x384x384-mm volume becoming a 24x24x24 grid of 13,824 visual tokens with no spatial downsampling, the training paragraph citing roughly 550,000 structured QA examples from 70,111 unique CT volumes, a side panel showing Base model Qwen/Qwen3.5-4B and the CT-RATE and CancerVerse datasets, and the arXiv 2609.27511 paper link.

לנהל את המשפחה ביחד

הארכיטקטורה הטבעית כאן, וכדאי לומר שאיש לא פרסם אותה, היא כיוונון עדין לנפח והמודל הדגל לכל מה שסביבו. NV-Reason-CT מפיק את הממצא המובנה; Qwen3.8 Max מטפל בטקסט ההפניה, בהתאמת הפרוטוקול, בקידוד, במכתב המעקב — עבודת הטקסט בנפח גבוה שבה חלון של מיליון טוקנים והנחת מטמון פי שמונה באמת מצדיקים את מקומם.

אם זה ה-pipeline שלך, חציו הוא צ'קפוינט שאתה מארח וחציו הם טוקנים שאתה קונה, והחצי השני הוא המקום שבו ראוטר עושה משהו שנקודת קצה של ספק בודד לא יכולה לעשות. Qwen3.8 Max מוגש דרך OrcaRouter במחיר המחירון של Alibaba וללא תוספת כלשהי, כך שה-$2.00 / $6.00 שלמעלה הם מה שאתה משלם, וכל שינוי מחיר עתידי ינחת על החשבון שלך באותו יום ולא בעת החידוש. מעבר אוטומטי בין ספקים (failover) חשוב יותר מהרגיל כאשר שיעור השגיאות הנמדד של המודל עצמו הוא 3.5% — ניסיון חוזר שפונה לנקודת קצה בריאה אחרת הוא ההבדל בין תקלה חולפת לאצווה שנכשלה. וכיוון שהחצי הכללי של ה-pipeline הוא שם מודל אחד מאחורי נקודת קצה תואמת OpenAI שמכסה יותר מ-200 מודלים, החלפה במשהו אחר לניסוי של שבוע עולה שינוי מחרוזת, לא אינטגרציה.

NV-Reason-CT, ליתר בהירות, אינו נמצא ב-OrcaRouter ואינו עתיד להיות — זוהי הסקה תלת-ממדית בקוד מותאם אישית שאתה מריץ בעצמך. הגרסה הכנה של סיפור האינטגרציה היא שהמומחה בהרצה עצמית והג'נרליסט המנותב יכולים לשבת תחת מפתח אחד, וזה כל מה שטוענים.

A screenshot of the OrcaRouter model page for Qwen3.8 Max, showing the identifier qwen/qwen3.8-max, input text + image + video, output text, the Vision, Tools, JSON and Reasoning badges, a 1,000,000-token context window with a p50 time to first token of 1.96 seconds, the description of it as Alibaba's newest flagship positioned against GPT-5.5, Claude Opus 4.7 and Gemini 3.1 Pro, OpenAI-compatible code samples pointing at https://api.orcarouter.ai/v1, and a stat strip reading $2.00 per million input tokens, $6.00 per million output tokens and 37.2M tokens of seven-day traffic.

פסק הדין שבאמת מחזיק

הזיווג הזה מסווג תחת "מי טוב יותר", וזה לא צריך לקרות. Qwen3.8 Max נמדד על ידי צדדים שלישיים בהסקה כללית ומתעלה על רוב התחום; ל-NV-Reason-CT יש טבלה אחת של מספרים משלו על מדד CT אחד, ומספר פרמטרים של 4.69B שלא היה יוצא דופן באף השוואה כללית. בכל מבחן כללי, דגם הדגל מנצח, והסיבה היא שהמבחן הכללי הוא מה שהוא נבנה עבורו.

במשימה האחת שלשמה נבנה NV-Reason-CT — לקרוא נפח CT של חזה או בטן ולומר מה יש בו, עם עקבה שמישהו יכול לבדוק — Qwen3.8 Max אינו מתחרה חלש יותר. אין לו מקודד נפחי, ולכן לא ניתן להריץ אותו על הקלט בכלל בלי שמישהו יחליט תחילה איך לשטח סריקה לתמונות. ההחלטה הזו היא המקום שאליו הולך המידע המרחבי. זו כל הנקודה של כיוונון עדין של 4B עם מסלול 3D נייטיבי וקידומת קבועה של 13,824 טוקנים, ולכן הדבר המעניין במודל הזה הוא הקטנות של עמוד השדרה שלו ולא הגודל שלו.