
NV-Reason-CT לעומת Qwen3.8 Max: הכיוונון העדין והמשפחה שממנה הוא הגיע
- typesafeחדשTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 לכל 1M טוקנים · 45 tok/s
- openaiחדשOpenAI: GPT-6 Luna2026-09-2237אינטליגנציה
- openaiחדשOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- anthropicחדשAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- grokחדשGrok 4.72026-09-2146אינטליגנציה
- OrcaחדשOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 לכל 1M טוקנים · 182 tok/s
- orcaחדשOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 1285 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- openaiOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- googleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- anthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 119 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0540אינטליגנציה72כתיבת קוד
השורה הראשונה של NV-Reason-CT בכרטיס המודל מספרת לך משהו שרוב האנשים מדלגים עליו. מודל הבסיס הוא Qwen/Qwen3.5-4B, המופיע במטא-נתוני המאגר כיחס כיוונון עדין. אז כאשר NVIDIA נזקקה למודל שפה כדי לחבר אליו טרנספורמר ראייה Primus 3D, היא לקחה Qwen. השווה את הצ'קפוינט הזה עם Qwen3.8 Max — הדגל של Alibaba עצמה עם 1,000,000 טוקנים, שהושק ב-3 באוגוסט 2026 — ואתה מסתכל על כיוונון עדין ועל העסק המשפחתי. האחד הוא מומחה 4.69B שקורא נפחי CT של החזה והבטן, ופורסם ב-Hugging Face ב-8 בספטמבר 2026 ללא כל הודעה. האחר הוא דגל כללי עם קלט טקסט, תמונה וווידאו, כרטיס תעריפים מפורסם, ו-37.2 מיליון טוקנים של תעבורה מדודה ברשת שלנו בשבוע האחרון. השאלה המעניינת אינה מי מנצח. היא מה שכיוונון עדין של 4B יכול לעשות שדגל המשפחה שלו לא יכול, ולמה התשובה ספציפית יותר ממה שהיית מצפה.
מה שהכיוונון העדין קנה, באופן קונקרטי
האופן שבו NVIDIA עצמה מנסחת את הפער מדויק באופן יוצא דופן, והוא המשפט השימושי ביותר במאגר: רוב המערכות החזותיות-לשוניות "או שפועלות על תמונות דו-ממדיות או שדוחסות מאפיינים נפחיים לפני פענוח לשוני". זהו תיאור של מחלקה שלמה של מודלים, והוא כולל כל מודל דגל רב-מודאלי כללי בשוק.
התיקון הוא ארכיטקטוני ולא עניין של קנה מידה. נפח קלט של 384×384×384 מ״מ הופך לרשת 24×24×24 של 13,824 טוקנים חזותיים. טוקנים אלה והקואורדינטות התלת-ממדיות שלהם נכנסים למודל השפה ללא דגימה מרחבית מופחתת, ו-3D MRoPE משמר את היחסים המרחביים בתוך המפענח. נפחי קלט נחתכים עם מודעות אנטומית לבית החזה או לבטן באמצעות יחידות Hounsfield של הריאה, ואז נדגמים מחדש לרזולוציה איזוטרופית של 2 מ״מ.
קרא את זה מול מה ש-Qwen3.8 Max מקבל. טקסט, תמונה ווידאו — והווידאו הוא הדבר הקרוב ביותר בסדרה הזו לקלט נפחי, מה שהופך אותו לנקודת ההשוואה הכנה ולא לרטורית. וידאו הוא ערימה of פריימים דו-ממדיים המסודרים לפי זמן. נפח CT הוא ערימה של פרוסות דו-ממדיות המסודרות לפי מיקום פיזי לאורך ציר ה-z, ביחידות האונספילד, עם מרחק מילימטרי ידוע. שניהם מערכים תלת-ממדיים. רק לאחד מהם יש מערכת קואורדינטות פיזית שאליה אפשר למקם ממצא של רדיולוג, ורק אחד מהם נמדד ביחידה שיש לה משמעות מחוץ לחיישן תמונה. מודל שמאומן על וידאו לומד רציפות זמנית. מודל שמאומן על נפחי CT לומד שמסה בפרוסה אחת היא אותה מסה בפרוסה הבאה, שמונה מילימטרים מתחת.
קורפוס האימון הוא ההבדל האמיתי
כאן שני הדגמים מפסיקים להיות ברי־השוואה כלל, וזה החלק שדף מפרט מסתיר.
NV-Reason-CT אומן מקצה לקצה עם כיוונון עדין מפוקח, שלאחריו Group Relative Policy Optimization, על כ־550,000 דוגמאות QA מובנות שנלקחו מ־70,111 נפחי CT ייחודיים. המקורות הם CT-RATE — 47,149 מקרים מבית החולים Istanbul Medipol University Mega Hospital עם דוחות רדיולוגיה מזווגים — סט פנימי של NIH של 15,991 מקרים, ו־22,720 מקרים של CancerVerse על פני ארבעה שלבי ניגודיות ושלושה־עשר סוגי גידולים ממאירים. הקורפוס כולל דוחות מתוקננים, QA ממוקד־אבנורמליות, דיאלוג רב־תורי, והנמקה שנכתבה על ידי רדיולוגים ותומללה מהקלטות של פרשנויות מומחים. שלב ה-GRPO משתמש בתגמולים ברי־אימות על מערכי אבנורמליות בחזה ובבטן, כלומר אות התגמול בודק אם ממצא מוצהר נמצא בנפח, ולא אם הפרוזה נשמעת קלינית.
קורפוס האימון של Qwen3.8 Max אינו מפורסם ברמה כזו של פירוט, וגם לא היה מועיל אילו היה מפורסם, משום שהיכולת המיועדת היא כללית. במקום זאת, נתוני Artificial Analysis שלו הם הראיות הרלוונטיות: מדד Intelligence Index של 45.4, שמציב אותו במקום ה-15 מתוך 145 מודלים בתמונת המצב של ה-API שלנו, AA Coding 76.2 במקום ה-9, Terminal-Bench 2.1 בציון 88.8, GPQA Diamond 92.8, Humanity's Last Exam 43.1, SciCode 52.1 וזכירה בהקשר ארוך 80.3. אלה מדידות של צד שלישי, לא טענות של ספק, מה שהופך אותן למספרים המהימנים ביותר משני צדי העמוד הזה.
פלט הנמקה, שני חוזים שונים
שני המודלים פולטים עקבות חשיבה ושניהם מאפשרים לך לכבות אותן. הדמיון ביניהם נגמר בממשק.
Qwen3.8 Max חושף את enable_thinking ו־reasoning_effort, יחד עם מכלול אפשרויות הדגימה המלא — temperature, top_p, seed, קנסות, פלטים מובנים, וקריאה לכלים. זוהי יכולת הסקה כללית שאתה מכוון אותה אל מה שיש לך. החשיבה שלה טובה במידה שבה הבעיה שאתה נותן לה טובה, ואין לה דרך לאמת טענה מול שום דבר מלבד הטקסט שניתן לה.
לחשיבה של NV-Reason-CT יש חוזה צר יותר עם הקורא, וכרטיס המודל מציין את המגבלה במפורש: חשיבה שנוצרת היא "פלט מודל שניתן לסקור ואינו מובטח כמייצג את החישוב הפנימי של המודל". ההסתייגות הזו עושה עבודה אמיתית, והיא מהסוג של משפטים שמופיעים רק כשצוות חשב מה יעשה קלינאי עם עקבה שנשמעת סבירה. הכרטיס מתאר את הפלט כתצפיות ניתנות לסקירה, אבחנות מבדלות ואי-ודאות. עקבה שאפשר לבדוק מול הנפח, במילים אחרות, ולא כזו שאפשר רק לקרוא.
תפוקה, מהמקום היחיד שבו אנחנו יכולים למדוד אותה
Qwen3.8 Max העביר 37.2 מיליון אסימונים דרך מגרש המשחקים הפרטי של OrcaRouter בשבעת הימים האחרונים. הזמן החציוני עד לאסימון הראשון היה 1.96 שניות — בנוחות המהיר מבין המודלים בסדרה הזו — בקצב של 53.3 אסימוני פלט לשנייה. שיעור השגיאות שלו באותו חלון זמן היה 3.5%.
שני הנתונים הללו מושכים לכיוונים מנוגדים ושניהם חשובים. השהיה מצוינת והופכת את העבודה עם המודל לנעימה באיטרציות. שיעור השגיאות גבוה בערך פי שבעה עשר מ-0.21% של Kimi K3 באותו חלון מדידה, וזה המספר שמכריע אם להעמיד אותו מאחורי קריאה סינכרונית מול המשתמש או מאחורי משימת אצווה עם ניסיונות חוזרים. זהו התנהגות נמדדת ברשת שלנו, לא בנצ'מרק, וזה מסוג הדברים שמחירון לעולם לא מספר לך.
ל-NV-Reason-CT אין מדידה מקבילה בשום מקום. זהו צ'קפוינט BF16 בנפח 10.6 GB עם קוד מודל מותאם אישית, שנטען עם trust_remote_code=True על חומרת Ampere, Hopper או Lovelace, נבדק על ידי NVIDIA על H100 ו-L40S. אין p50, אין שיעור שגיאות ואין נתון תפוקה שפורסם. כל מי שאומר לך את נפח המעבר שבו אירוח עצמי של זה משתלם יותר מתשלום לפי טוקן מנחש.
מחיר וצורה, זה לצד זה
• מחיר — הוצאות הון (capex) על GPU של NV-Reason-CT, ללא תעריף לכל טוקן לעומת Qwen3.8 Max $2.00 / $6.00 למיליון טוקנים, $0.25 לקריאה מהמטמון, $2.50 לכתיבה למטמון
• קלט — נפחי CT תלת־ממדיים בפורמט NIfTI של NV-Reason-CT ביחידות האנספילד, של בית החזה או הבטן בלבד, לעומת Qwen3.8 Max בטקסט, תמונה ווידאו
• הקשר — NV-Reason-CT נפח אחד, קידומת קבועה של 13,824 טוקנים לעומת Qwen3.8 Max עם 1,000,000 טוקנים
• פרמטרים — NV-Reason-CT 4.69B סה״כ / 4.35B פעילים במסלול CT לעומת Qwen3.8 Max שפרטיו לא נחשפו
• רישיון — NV-Reason-CT OpenMDW-1.1, משקלים מפורסמים לעומת Qwen3.8 Max קנייני, גישה ל-API בלבד
• ציונים בלתי־תלויים — NV-Reason-CT אין לעומת Qwen3.8 Max AA Intelligence Index 45.4, GPQA Diamond 92.8

כלכלת המטמון של Qwen3.8 Max מתגמלת תבנית מסוימת: קריאה מהמטמון בעלות $0.25 לעומת קלט טרי בעלות $2.00 היא הנחה של פי שמונה, וכתיבה למטמון בעלות $2.50 משמעה שקידומת ארוכה לשימוש חוזר מחזירה את עלותה במהירות. זהו עומס העבודה של הנחיית מערכת בתוספת מסמך פרוטוקול שנעשה בהם שימוש חוזר לאורך אלפי בקשות. ל-NV-Reason-CT יש פרופיל עלויות הפוך — עלות שולית כמעט אפסית לכל סריקה לאחר רכישת ה-GPU, ורצפה קשיחה של GPU אחד המוחזק ללא הגבלת זמן.

לנהל את המשפחה ביחד
הארכיטקטורה הטבעית כאן, וכדאי לומר שאיש לא פרסם אותה, היא כיוונון עדין לנפח והמודל הדגל לכל מה שסביבו. NV-Reason-CT מפיק את הממצא המובנה; Qwen3.8 Max מטפל בטקסט ההפניה, בהתאמת הפרוטוקול, בקידוד, במכתב המעקב — עבודת הטקסט בנפח גבוה שבה חלון של מיליון טוקנים והנחת מטמון פי שמונה באמת מצדיקים את מקומם.
אם זה ה-pipeline שלך, חציו הוא צ'קפוינט שאתה מארח וחציו הם טוקנים שאתה קונה, והחצי השני הוא המקום שבו ראוטר עושה משהו שנקודת קצה של ספק בודד לא יכולה לעשות. Qwen3.8 Max מוגש דרך OrcaRouter במחיר המחירון של Alibaba וללא תוספת כלשהי, כך שה-$2.00 / $6.00 שלמעלה הם מה שאתה משלם, וכל שינוי מחיר עתידי ינחת על החשבון שלך באותו יום ולא בעת החידוש. מעבר אוטומטי בין ספקים (failover) חשוב יותר מהרגיל כאשר שיעור השגיאות הנמדד של המודל עצמו הוא 3.5% — ניסיון חוזר שפונה לנקודת קצה בריאה אחרת הוא ההבדל בין תקלה חולפת לאצווה שנכשלה. וכיוון שהחצי הכללי של ה-pipeline הוא שם מודל אחד מאחורי נקודת קצה תואמת OpenAI שמכסה יותר מ-200 מודלים, החלפה במשהו אחר לניסוי של שבוע עולה שינוי מחרוזת, לא אינטגרציה.
NV-Reason-CT, ליתר בהירות, אינו נמצא ב-OrcaRouter ואינו עתיד להיות — זוהי הסקה תלת-ממדית בקוד מותאם אישית שאתה מריץ בעצמך. הגרסה הכנה של סיפור האינטגרציה היא שהמומחה בהרצה עצמית והג'נרליסט המנותב יכולים לשבת תחת מפתח אחד, וזה כל מה שטוענים.

פסק הדין שבאמת מחזיק
הזיווג הזה מסווג תחת "מי טוב יותר", וזה לא צריך לקרות. Qwen3.8 Max נמדד על ידי צדדים שלישיים בהסקה כללית ומתעלה על רוב התחום; ל-NV-Reason-CT יש טבלה אחת של מספרים משלו על מדד CT אחד, ומספר פרמטרים של 4.69B שלא היה יוצא דופן באף השוואה כללית. בכל מבחן כללי, דגם הדגל מנצח, והסיבה היא שהמבחן הכללי הוא מה שהוא נבנה עבורו.
במשימה האחת שלשמה נבנה NV-Reason-CT — לקרוא נפח CT של חזה או בטן ולומר מה יש בו, עם עקבה שמישהו יכול לבדוק — Qwen3.8 Max אינו מתחרה חלש יותר. אין לו מקודד נפחי, ולכן לא ניתן להריץ אותו על הקלט בכלל בלי שמישהו יחליט תחילה איך לשטח סריקה לתמונות. ההחלטה הזו היא המקום שאליו הולך המידע המרחבי. זו כל הנקודה של כיוונון עדין של 4B עם מסלול 3D נייטיבי וקידומת קבועה של 13,824 טוקנים, ולכן הדבר המעניין במודל הזה הוא הקטנות של עמוד השדרה שלו ולא הגודל שלו.
