
NV-Reason-CT לעומת Claude Opus 5: טעות קטגורית שראויה להתייחסות ברצינות
- typesafeחדשTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 לכל 1M טוקנים · 506 tok/s
- openaiחדשOpenAI: GPT-6 Luna2026-09-2237אינטליגנציה
- openaiחדשOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- anthropicחדשAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- grokחדשGrok 4.72026-09-2146אינטליגנציה
- OrcaחדשOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 לכל 1M טוקנים · 183 tok/s
- orcaחדשOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 1285 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- openaiOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- googleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- anthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 119 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0540אינטליגנציה72כתיבת קוד
הצבת NV-Reason-CT וClaude Opus 5 באותו משפט היא שגיאת קטגוריה, ואף על פי כן כדאי לעשות זאת, כי השגיאה מלמדת. NV-Reason-CT הוא מודל חזותי-לשוני תלת-ממדי נייטיב מבית NVIDIA בעל 4.69 מיליארד פרמטרים, שמקבל נפח CT של חזה או בטן ביחידות האונספילד ומפיק דוח מובנה ממצא אחר ממצא. זהו אינו מכשיר רפואי, וכרטיס המודל שלו עצמו אומר זאת. Claude Opus 5 הוא המודל הכללי והחזותי המוביל של הספק, שיצא ב-24 ביולי 2026, עם חלון הקשר של מיליון טוקנים, תקרת פלט של 128,000 טוקנים, ותעריף מפורסם של חמישה דולרים למיליון טוקני קלט ועשרים וחמישה למיליון טוקני פלט. אחד מהם קורא CT. האחר קורא את כל השאר.
הסיבה שההשוואה הזו ממשיכה להיעשות — והיא תיעשה בכל פעם שמישהו רואה VLM רפואי חדש ונאחז באמת מידה מוכרת — היא ששניהם מפיקים פרוזה על תמונה. הדמיון השטחי הזה גורם נזק של ממש לאופן שבו אנשים מנמקים לגבי השניים, ולכן כדאי לפרק אותו לפרטיו.
הציר האמיתי שהם חולקים, וזה שהם לא.
הם חופפים בדיוק במקום אחד, והוא צר יותר מכפי שהוא נראה.
• מודאליות בקלט — NV-Reason-CT מקבל נפחי NIfTI בערוץ אחד ביחידות האנספילד דרך מעבד תלת-ממדי ייעודי; Claude Opus 5 מקבל טקסט, תמונות וקבצים, שהוא ממשק מהדור השני לתמונות ואינו יכול לקלוט באופן מובנה בדיקת CT נפחית
• מה שחוזר — רשימת ממצאים המאורגנת לפי אזור אנטומי מ-NV-Reason-CT, לעומת טקסט כללי, JSON מובנה או קריאות לכלים מ-Claude Opus 5
• יחידות עבודה — נפח CT אחד, שנדגם מחדש ל-2 מ״מ איזוטרופי, נחתך לפי האנטומיה, מחולק לטלאים בגודל 8 x 8 x 8; לעומת כל מה שתכניסו לתקציב טוקנים
• הקשר — ל-NV-Reason-CT אין חלון צ'אט כלל; כרך בודד הופך ל-13,824 טוקנים חזותיים ללא דגימה מחדש. Claude Opus 5 מחזיק 1,000,000 טוקנים בקלט ופולט עד 128,000
• רישיון — OpenMDW-1.1, מודל להורדה שאתה מריץ על החומרה שלך
• שימוש מוצהר — מחקר וחינוך בלבד, במפורש אינו מכשיר רפואי, עבור NV-Reason-CT; לעומת סיוע כללי עבור Claude Opus 5
• מחיר — אין מחיר מחירון, כי אין מה לקנות, רק משקלים להריץ; לעומת $5 ו-$25 למיליון טוקנים, עם קריאות מהמטמון ב-$0.50
שורת ה'מודאליות בקלט' היא המקום שבו נולדת הטעות הקטגורית. שניהם מקבלים תמונה, ולכן שניהם נראים כמו מודלי תמונות, וקורא עשוי לשאול באופן סביר מי מהם טוב יותר בתמונות. אבל בדיקת CT אינה תמונה. היא מערך נפחי עם סקאלה פיזית במילימטרים, יחידת צפיפות מכוילת, ואנטומיה שרק בתלת-ממד יש לה משמעות. היכולת החזותית של Claude Opus 5 היא אכן ממשית, והוא ידון בצורה הגיונית בצילום רנטגן או בשקופית פתולוגית. זו משימה שונה מלשלב קובייה בת 384 מילימטרים של ערכי Hounsfield ברזולוציה של 2 מ"מ ולדווח על הלובולציה של נודולה.
מה המספרים בכל צד בעצם מודדים
לשני הדגמים יש רשומות בנצ'מרק שלעולם אינן נוגעות זו בזו, וקריאה שלהן זו לצד זו בלי לשים לב לכך היא הדרך שבה מתקבלות החלטות רכש גרועות.
NV-Reason-CT מדווח על תוצאותיו בבנצ'מרק CT-RATE הציבורי ל-CT חזה, על פני שמונה עשרה תוויות, תוך שימוש בסף אחיד קבוע ובפרומפט ישיר של כן/לא ללא ראש סיווג וללא התאמה ספציפית למשימה. הוא מציג 0.614 F1 ו-0.871 AUROC, ומקדים את VoxelFM עם 0.581 ו-0.870, את Pillar-0 עם 0.544 ו-0.861, את ClinFusion-8B עם 0.442 F1, את CT-CLIP עם 0.398 ו-0.733, את Merlin עם 0.358 ו-0.662, ואת MedGemma 1.5 עם 0.303 F1 כאשר ניתנות לו עד 85 פרוסות אקסיאליות. יש גם macro-F1 של 0.592 שנגזר מהדוח. כל אחד מהנתונים הללו מגיע מהמאמר של NVIDIA עצמה. אף אחד מהם לא שוחזר בידי אף גורם אחר, והמודל זמין להורדה כבר כמה שבועות.
הרקורד של Claude Opus 5 הוא כללי ובמידה רבה בלתי תלוי. Artificial Analysis מודדת אותו ב-50.8 במדד האינטליגנציה שלה, 78 במדד הקידוד שלה, 93.2 ב-GPQA Diamond ו-54.9 ב-Humanity's Last Exam, עם ציון שליפה בהקשר ארוך של 79.33. אלה מספרים של צד שלישי במשימות של חשיבה כללית, קוד וידע. אין בנצ'מרק לדימות קליני בקבוצה הזו, ואין שורת CT-RATE בשום מקום ברקורד המפורסם של Claude Opus 5.
אז ההצהרה הכנה היא לא שאחד מוביל. היא ששני המודלים מעולם לא נמדדו על אותה משימה על ידי אף אחד. כל משפט מהצורה "NV-Reason-CT טוב יותר מ-Claude Opus 5 בדימות רפואי" אינו ניתן להפרכה כפי שהוא כתוב, כי אף אחד לא ערך את הניסוי. טבלת ההשוואה של NVIDIA עצמה אינה מכילה מודל חזית כללי.

היכן אנשים טועים בשאלת הממשק
החפיפה הטכנית היחידה שבאמת מעניינת היא זו שאיש לא מתווכח עליה: כיצד אמור להיראות ממשק בין מודל CT למודל טקסט.
אינסטינקט סביר הוא להזין ל-Claude Opus 5 קבוצה של תמונות CT או נפח שעבר הקטנת דגימה ולבקש ממנו לבצע הסקה. ב-1,000,000 טוקנים של הקשר זה נשמע נדיב, ולעומת מחקר שהוא רק 13,824 טוקנים חזותיים זה נשמע כמו שפע של מקום. המקום אינו הבעיה. צינור הראייה של Claude Opus 5 מתייחס לתמונה כתמונה דו-ממדית עם קנה מידה של פיקסלים. CT חזה שמוצג כך מאבד את המרווח בין הפרוסות שמאפשר למדוד נגע, ואת כיול הצפיפות שהופך "זכוכית טחונה" לסף ולא לתיאור. אפשר למסור לו מונטאז' של פרוסות אקסיאליות ולקבל פסקה שנשמעת קוהרנטית. מה שאי אפשר לקבל הוא מדידה.
זה בדיוק מה שהעיצוב של NV-Reason-CT משקיע בו את כוח המחשוב שלו. הגריד בגודל 24 x 24 x 24 מנפח של 384 מילימטרים נמסר למודל השפה ברזולוציה מלאה, ללא דגימה מרחבית מופחתת וללא שכבת מיזוג, ולכן המסלול הפעיל הוא 4.35B פרמטרים ולא משהו קטן בהרבה. הארכיטקטורה היא הימור על כך ששימור הפירוט המרחבי שווה את עלות הטוקנים. זה הימור על ייצוג, לא על יכולת לשונית, ו-Claude Opus 5 אינו משתתף בו.
הדפוס היצרני הוא דווקא המשעמם: להשתמש במודל CT לקריאה הנפחית, ובמודל טקסט לכל מה שסביבה. הפקת דוחות ונרמול, סיכומי עוקבות, מערכי הערכה, המרת ארכיוני DICOM ל-NIfTI בהיקף גדול, ותעדוף אילו בדיקות אדם צריך לבחון קודם. זו עבודה על מסמכים ארוכים ועל קוד, ושם מודל עם חלון הקשר של 1M מצדיק את מחירו.
עלות, בשתי יחידות שאינן ניתנות להמרה
Claude Opus 5 מחויב לפי שימוש. חמישה דולרים למיליון טוקני קלט ועשרים וחמישה למיליון טוקני פלט, קריאות מהמטמון בחמישים סנט, כתיבות למטמון בעשרה דולרים. עבור צינור עיבוד שמנרמל קורפוס של דוחות או שכותב ומשכתב קוד הערכה, זה מייצר תחזית שאפשר לבנות עליה: טוקנים נכנסים, טוקנים יוצאים, קריאות מהמטמון, וחשבון זול בהרבה אם עושים את המטמון נכון.
ל-NV-Reason-CT אין מחיר. אתם מורידים 4.69 מיליארד פרמטרים ומשלמים בחשמל, שעות GPU וזמן הנדסי. אין נתון תפוקה מפורסם למחקר מלא של 13,824 טוקנים, ואין וריאנט מכומת מוצע, כך שהעלות לכל מחקר של הרצתו היא מספר שתצטרכו למדוד בעצמכם. זה נורמלי עבור משקולות מחקר וזה גם ההבדל המעשי הגדול ביותר בין השניים: לאחד יש מחירון, ולשני יש חשבון שלא תוכלו לראות עד שכבר שילמתם עליו.
ההשוואה שבאמת חשובה היא לפי בדיקה, לא לפי טוקן. קריאת CT היא יחידת עבודה אחת. מעבר נרמול דוח על אותו מקרה הוא עבודת טקסט הנמדדת באלפי טוקנים. לתמחר את הראשון פירושו לדעת את החומרה שלך; לתמחר את השני זה אריתמטיקה.
המלכודת באמצע ההשוואה
יש טעות ספציפית שראויה להיקרא בשמה, כי היא זו שהעימות הזה מזמין. הטעות היא להתייחס אל NV-Reason-CT כאל כיוונון עדין ייעודי של מודל כללי, ובכך להניח שהמודל הכללי יהיה קרוב מספיק ברוב המקרים והרבה יותר גמיש.
זה לא כיוונון עדין. זהו שנאי חזותי תלת-ממדי בשם Primus, המאותחל מ-COLIPRI, המוצמד לעמוד שדרה לשוני Qwen3.5-4B עם הטמעת מיקום סיבובית תלת-ממדית רב-צירית, שאומן על כ-550,000 דוגמאות מובנות של שאלות-תשובות שנשאבו מ-70,111 נפחי CT מתוך CT-RATE, CancerVerse ואוסף NIH פנימי, ולאחר מכן כוונן עם GRPO מול תגמול שמשקלל F1 של קבוצת האנומליות ב-2.0, ציון מבנה דוח ספציפי לאזור ב-0.5 וקנס אורך רך ב-1.0. המקודד התלת-ממדי הוא העיקר במודל. רכיב קדמי דו-ממדי או מבוסס פרוסות הוא כלי שונה, וההשוואה של המאמר עצמו מראה מה שווה ההבדל הזה: MedGemma 1.5 ב-0.303 F1 כאשר מוזן בעד 85 פרוסות אקסיאליות, לעומת 0.614 עבור המודל הנפחי הנייטיבי.
הטעות ההפוכה נפוצה באותה מידה ויקרה לא פחות: להניח שמכיוון ש-NV-Reason-CT הוא מודל מתמחה, יש להשתמש בו לכל דבר קליני. הוא תומך בחזה ובבטן ושום דבר אחר, ההפעלה שלו נעשית באמצעות קובץ NIfTI ולא הודעת צ׳אט, ותנאי הרישיון שלו קובעים מחקר וחינוך בלבד. הוא לא יקרא שקף פתולוגיה, לא יענה על שאלה בנוגע להנחיה קלינית, ולא יכתוב את הקוד שמעבד באצוות את המרת ה-DICOM שלך. לפנות למודל CT כדי לבצע עבודת טקסט זו אותה שגיאה קטגורית כמו לפנות למודל טקסט כדי לבצע מדידות נפח, רק בכיוון ההפוך.

כיצד שני החצאים משתלבים במערכת אחת
אף אחד מהמודלים אינו מחליף את האחר, והארכיטקטורה ההגיונית מכילה את שניהם — מה שמעלה את השאלה המעשית כיצד לקרוא להם.
Claude Opus 5 מוגש דרך OrcaRouter בתור anthropic/claude-opus-5 במחיר המחירון של Anthropic ללא תוספת, בתוך API יחיד שמכסה יותר מ-200 מודלים. זה פחות משנה לקריאה בודדת מאשר לצינור שסביבה: כשהחצי הטקסטואלי של בנייה קלינית הוא מודל אחד מבין כמה מועמדים, העובדה שכולם עומדים מאחורי מפתח אחד מאפשרת להשוות ביניהם על הקורפוס שלך בלי חוזה נוסף או שינוי בקוד, וה-DSL של הניתוב מאפשר לך לשלוח בקשות בודדות למודל שאמור לטפל בהן, בעוד מעבר אוטומטי לגיבוי מכסה אותך כשספק מתדרדר.
NV-Reason-CT אינו נמצא בפלטפורמה שלנו, וגם לא אף מודל של NVIDIA. אלו משקלים שאתם מורידים ומריצים על החומרה שלכם, וזה בדיוק מה שהרישיון מתיר לכם לעשות, ובהינתן שהקלט הוא נתונים נפחיים שמקורם במטופלים, זה כנראה גם מה שאתם רוצים בכל מקרה. אנחנו לא מתכוונים לרמוז שאנחנו מנתבים מודל שאיננו מארחים. הצד הטקסטואלי של הבנייה הוא המקום שבו אנחנו מועילים; הצד הנפחי הוא המקום שבו אתם לבד עם מודל של 4.69B ו-GPU.

פסק הדין שעומד בבחינה מדוקדקת
אם אתה זקוק לקריאת נפח CT לתוך ממצאים מובנים, יש מודל לכך — הוא בא מקבוצת המחקר של NVIDIA, והוא הורדה ולא קריאת API. אם אתה זקוק לנרמול של קורפוס דוחות, לכתיבת מסגרת הערכה, לתסרוט עבודת המרת DICOM, או לסיכום קבוצה, גם לכך יש מודל, ויש לו מחירון.
הקו שיש להחזיק בו הוא שאף אחד מהשניים לא הוכח כטוב יותר מהאחר בשום דבר, משום שהניסוי לא נערך. מה שכן הוכח הוא שממשק תלת-ממדי ילידי גובר על ממשק מבוסס פרוסות במדד ציבורי של CT חזה בפער שהמחברים מעריכים בכ-שלוש נקודות F1, ושמודל חזית כללי נמדד באופן בלתי תלוי בצמרת התחום בהסקה, בקוד ובעבודה בהקשר ארוך. אלה שתי אמירות על שתי מטלות שונות. לקרוא אותן כדירוג הוא טעות קטגורית, והיא מחזיקה מעמד ממש עד שמישהו יפרסם את ההשוואה ראש בראש שאף אחד עדיין לא פרסם.
