כרטיס Hero שנוצר, שכותרתו 'NV-Reason-CT vs Claude Opus 5', עם כותרת המשנה 'שגיאת קטגוריה שראוי להתייחס אליה ברצינות'. שני כרטיסים זה מול זה מופרדים בזוג חצים כחולים: הכרטיס השמאלי מסומן 'NV-Reason-CT' עם אייקון של סריקת גוף ו'4.69B פרמטרים - 13,824 טוקנים לכל נפח CT - לא מכשיר רפואי'; הכרטיס הימני מסומן 'Claude Opus 5' עם אייקון שבב ו'הקשר של 1M - פלט של 128K - 5$ / 25$ למיליון טוקנים'. הלוגו של OrcaRouter משולב בפינה הימנית התחתונה.
Guides & Insights

NV-Reason-CT לעומת Claude Opus 5: טעות קטגורית שראויה להתייחסות ברצינות

מחבר

Rowan Sterling

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים →
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

הצבת NV-Reason-CT וClaude Opus 5 באותו משפט היא שגיאת קטגוריה, ואף על פי כן כדאי לעשות זאת, כי השגיאה מלמדת. NV-Reason-CT הוא מודל חזותי-לשוני תלת-ממדי נייטיב מבית NVIDIA בעל 4.69 מיליארד פרמטרים, שמקבל נפח CT של חזה או בטן ביחידות האונספילד ומפיק דוח מובנה ממצא אחר ממצא. זהו אינו מכשיר רפואי, וכרטיס המודל שלו עצמו אומר זאת. Claude Opus 5 הוא המודל הכללי והחזותי המוביל של הספק, שיצא ב-24 ביולי 2026, עם חלון הקשר של מיליון טוקנים, תקרת פלט של 128,000 טוקנים, ותעריף מפורסם של חמישה דולרים למיליון טוקני קלט ועשרים וחמישה למיליון טוקני פלט. אחד מהם קורא CT. האחר קורא את כל השאר.

הסיבה שההשוואה הזו ממשיכה להיעשות — והיא תיעשה בכל פעם שמישהו רואה VLM רפואי חדש ונאחז באמת מידה מוכרת — היא ששניהם מפיקים פרוזה על תמונה. הדמיון השטחי הזה גורם נזק של ממש לאופן שבו אנשים מנמקים לגבי השניים, ולכן כדאי לפרק אותו לפרטיו.

הציר האמיתי שהם חולקים, וזה שהם לא.

הם חופפים בדיוק במקום אחד, והוא צר יותר מכפי שהוא נראה.

• מודאליות בקלט — NV-Reason-CT מקבל נפחי NIfTI בערוץ אחד ביחידות האנספילד דרך מעבד תלת-ממדי ייעודי; Claude Opus 5 מקבל טקסט, תמונות וקבצים, שהוא ממשק מהדור השני לתמונות ואינו יכול לקלוט באופן מובנה בדיקת CT נפחית

• מה שחוזר — רשימת ממצאים המאורגנת לפי אזור אנטומי מ-NV-Reason-CT, לעומת טקסט כללי, JSON מובנה או קריאות לכלים מ-Claude Opus 5

• יחידות עבודה — נפח CT אחד, שנדגם מחדש ל-2 מ״מ איזוטרופי, נחתך לפי האנטומיה, מחולק לטלאים בגודל 8 x 8 x 8; לעומת כל מה שתכניסו לתקציב טוקנים

• הקשר — ל-NV-Reason-CT אין חלון צ'אט כלל; כרך בודד הופך ל-13,824 טוקנים חזותיים ללא דגימה מחדש. Claude Opus 5 מחזיק 1,000,000 טוקנים בקלט ופולט עד 128,000

• רישיון — OpenMDW-1.1, מודל להורדה שאתה מריץ על החומרה שלך

• שימוש מוצהר — מחקר וחינוך בלבד, במפורש אינו מכשיר רפואי, עבור NV-Reason-CT; לעומת סיוע כללי עבור Claude Opus 5

• מחיר — אין מחיר מחירון, כי אין מה לקנות, רק משקלים להריץ; לעומת $5 ו-$25 למיליון טוקנים, עם קריאות מהמטמון ב-$0.50

שורת ה'מודאליות בקלט' היא המקום שבו נולדת הטעות הקטגורית. שניהם מקבלים תמונה, ולכן שניהם נראים כמו מודלי תמונות, וקורא עשוי לשאול באופן סביר מי מהם טוב יותר בתמונות. אבל בדיקת CT אינה תמונה. היא מערך נפחי עם סקאלה פיזית במילימטרים, יחידת צפיפות מכוילת, ואנטומיה שרק בתלת-ממד יש לה משמעות. היכולת החזותית של Claude Opus 5 היא אכן ממשית, והוא ידון בצורה הגיונית בצילום רנטגן או בשקופית פתולוגית. זו משימה שונה מלשלב קובייה בת 384 מילימטרים של ערכי Hounsfield ברזולוציה של 2 מ"מ ולדווח על הלובולציה של נודולה.

מה המספרים בכל צד בעצם מודדים

לשני הדגמים יש רשומות בנצ'מרק שלעולם אינן נוגעות זו בזו, וקריאה שלהן זו לצד זו בלי לשים לב לכך היא הדרך שבה מתקבלות החלטות רכש גרועות.

NV-Reason-CT מדווח על תוצאותיו בבנצ'מרק CT-RATE הציבורי ל-CT חזה, על פני שמונה עשרה תוויות, תוך שימוש בסף אחיד קבוע ובפרומפט ישיר של כן/לא ללא ראש סיווג וללא התאמה ספציפית למשימה. הוא מציג 0.614 F1 ו-0.871 AUROC, ומקדים את VoxelFM עם 0.581 ו-0.870, את Pillar-0 עם 0.544 ו-0.861, את ClinFusion-8B עם 0.442 F1, את CT-CLIP עם 0.398 ו-0.733, את Merlin עם 0.358 ו-0.662, ואת MedGemma 1.5 עם 0.303 F1 כאשר ניתנות לו עד 85 פרוסות אקסיאליות. יש גם macro-F1 של 0.592 שנגזר מהדוח. כל אחד מהנתונים הללו מגיע מהמאמר של NVIDIA עצמה. אף אחד מהם לא שוחזר בידי אף גורם אחר, והמודל זמין להורדה כבר כמה שבועות.

הרקורד של Claude Opus 5 הוא כללי ובמידה רבה בלתי תלוי. Artificial Analysis מודדת אותו ב-50.8 במדד האינטליגנציה שלה, 78 במדד הקידוד שלה, 93.2 ב-GPQA Diamond ו-54.9 ב-Humanity's Last Exam, עם ציון שליפה בהקשר ארוך של 79.33. אלה מספרים של צד שלישי במשימות של חשיבה כללית, קוד וידע. אין בנצ'מרק לדימות קליני בקבוצה הזו, ואין שורת CT-RATE בשום מקום ברקורד המפורסם של Claude Opus 5.

אז ההצהרה הכנה היא לא שאחד מוביל. היא ששני המודלים מעולם לא נמדדו על אותה משימה על ידי אף אחד. כל משפט מהצורה "NV-Reason-CT טוב יותר מ-Claude Opus 5 בדימות רפואי" אינו ניתן להפרכה כפי שהוא כתוב, כי אף אחד לא ערך את הניסוי. טבלת ההשוואה של NVIDIA עצמה אינה מכילה מודל חזית כללי.

A generated scoreboard titled 'NV-Reason-CT vs Claude Opus 5 - what each number measures' with two columns. The left column, headed 'NV-Reason-CT', lists six rows: input, one-channel NIfTI volumes in Hounsfield units; output, structured findings by anatomical region; benchmark, CT-RATE 0.614 F1 and 0.871 AUROC over 18 labels; provenance, authors' own paper, unreproduced; licence, OpenMDW-1.1, self-hosted; use, research and education, not a medical device. The right column, headed 'Claude Opus 5', lists six rows: input, text, images, files; output, general prose, JSON, tool calls; benchmark, AA Intelligence 50.8, GPQA Diamond 93.2, HLE 54.9; provenance, independent, Artificial Analysis; licence, hosted API; use, general purpose. A footer reads 'The two benchmark sets share no task, so neither column can be subtracted from the other.'

היכן אנשים טועים בשאלת הממשק

החפיפה הטכנית היחידה שבאמת מעניינת היא זו שאיש לא מתווכח עליה: כיצד אמור להיראות ממשק בין מודל CT למודל טקסט.

אינסטינקט סביר הוא להזין ל-Claude Opus 5 קבוצה של תמונות CT או נפח שעבר הקטנת דגימה ולבקש ממנו לבצע הסקה. ב-1,000,000 טוקנים של הקשר זה נשמע נדיב, ולעומת מחקר שהוא רק 13,824 טוקנים חזותיים זה נשמע כמו שפע של מקום. המקום אינו הבעיה. צינור הראייה של Claude Opus 5 מתייחס לתמונה כתמונה דו-ממדית עם קנה מידה של פיקסלים. CT חזה שמוצג כך מאבד את המרווח בין הפרוסות שמאפשר למדוד נגע, ואת כיול הצפיפות שהופך "זכוכית טחונה" לסף ולא לתיאור. אפשר למסור לו מונטאז' של פרוסות אקסיאליות ולקבל פסקה שנשמעת קוהרנטית. מה שאי אפשר לקבל הוא מדידה.

זה בדיוק מה שהעיצוב של NV-Reason-CT משקיע בו את כוח המחשוב שלו. הגריד בגודל 24 x 24 x 24 מנפח של 384 מילימטרים נמסר למודל השפה ברזולוציה מלאה, ללא דגימה מרחבית מופחתת וללא שכבת מיזוג, ולכן המסלול הפעיל הוא 4.35B פרמטרים ולא משהו קטן בהרבה. הארכיטקטורה היא הימור על כך ששימור הפירוט המרחבי שווה את עלות הטוקנים. זה הימור על ייצוג, לא על יכולת לשונית, ו-Claude Opus 5 אינו משתתף בו.

הדפוס היצרני הוא דווקא המשעמם: להשתמש במודל CT לקריאה הנפחית, ובמודל טקסט לכל מה שסביבה. הפקת דוחות ונרמול, סיכומי עוקבות, מערכי הערכה, המרת ארכיוני DICOM ל-NIfTI בהיקף גדול, ותעדוף אילו בדיקות אדם צריך לבחון קודם. זו עבודה על מסמכים ארוכים ועל קוד, ושם מודל עם חלון הקשר של 1M מצדיק את מחירו.

עלות, בשתי יחידות שאינן ניתנות להמרה

Claude Opus 5 מחויב לפי שימוש. חמישה דולרים למיליון טוקני קלט ועשרים וחמישה למיליון טוקני פלט, קריאות מהמטמון בחמישים סנט, כתיבות למטמון בעשרה דולרים. עבור צינור עיבוד שמנרמל קורפוס של דוחות או שכותב ומשכתב קוד הערכה, זה מייצר תחזית שאפשר לבנות עליה: טוקנים נכנסים, טוקנים יוצאים, קריאות מהמטמון, וחשבון זול בהרבה אם עושים את המטמון נכון.

ל-NV-Reason-CT אין מחיר. אתם מורידים 4.69 מיליארד פרמטרים ומשלמים בחשמל, שעות GPU וזמן הנדסי. אין נתון תפוקה מפורסם למחקר מלא של 13,824 טוקנים, ואין וריאנט מכומת מוצע, כך שהעלות לכל מחקר של הרצתו היא מספר שתצטרכו למדוד בעצמכם. זה נורמלי עבור משקולות מחקר וזה גם ההבדל המעשי הגדול ביותר בין השניים: לאחד יש מחירון, ולשני יש חשבון שלא תוכלו לראות עד שכבר שילמתם עליו.

ההשוואה שבאמת חשובה היא לפי בדיקה, לא לפי טוקן. קריאת CT היא יחידת עבודה אחת. מעבר נרמול דוח על אותו מקרה הוא עבודת טקסט הנמדדת באלפי טוקנים. לתמחר את הראשון פירושו לדעת את החומרה שלך; לתמחר את השני זה אריתמטיקה.

המלכודת באמצע ההשוואה

יש טעות ספציפית שראויה להיקרא בשמה, כי היא זו שהעימות הזה מזמין. הטעות היא להתייחס אל NV-Reason-CT כאל כיוונון עדין ייעודי של מודל כללי, ובכך להניח שהמודל הכללי יהיה קרוב מספיק ברוב המקרים והרבה יותר גמיש.

זה לא כיוונון עדין. זהו שנאי חזותי תלת-ממדי בשם Primus, המאותחל מ-COLIPRI, המוצמד לעמוד שדרה לשוני Qwen3.5-4B עם הטמעת מיקום סיבובית תלת-ממדית רב-צירית, שאומן על כ-550,000 דוגמאות מובנות של שאלות-תשובות שנשאבו מ-70,111 נפחי CT מתוך CT-RATE, CancerVerse ואוסף NIH פנימי, ולאחר מכן כוונן עם GRPO מול תגמול שמשקלל F1 של קבוצת האנומליות ב-2.0, ציון מבנה דוח ספציפי לאזור ב-0.5 וקנס אורך רך ב-1.0. המקודד התלת-ממדי הוא העיקר במודל. רכיב קדמי דו-ממדי או מבוסס פרוסות הוא כלי שונה, וההשוואה של המאמר עצמו מראה מה שווה ההבדל הזה: MedGemma 1.5 ב-0.303 F1 כאשר מוזן בעד 85 פרוסות אקסיאליות, לעומת 0.614 עבור המודל הנפחי הנייטיבי.

הטעות ההפוכה נפוצה באותה מידה ויקרה לא פחות: להניח שמכיוון ש-NV-Reason-CT הוא מודל מתמחה, יש להשתמש בו לכל דבר קליני. הוא תומך בחזה ובבטן ושום דבר אחר, ההפעלה שלו נעשית באמצעות קובץ NIfTI ולא הודעת צ׳אט, ותנאי הרישיון שלו קובעים מחקר וחינוך בלבד. הוא לא יקרא שקף פתולוגיה, לא יענה על שאלה בנוגע להנחיה קלינית, ולא יכתוב את הקוד שמעבד באצוות את המרת ה-DICOM שלך. לפנות למודל CT כדי לבצע עבודת טקסט זו אותה שגיאה קטגורית כמו לפנות למודל טקסט כדי לבצע מדידות נפח, רק בכיוון ההפוך.

A generated scoreboard titled 'The two models, at a glance' listing six paired rows. Row one: parameters, 4.69B total and 4.35B active, against undisclosed. Row two: context, 13,824 visual tokens per volume against 1,000,000 input and 128,000 output tokens. Row three: input, one-channel NIfTI in Hounsfield units against text, images and files. Row four: availability, weights downloadable on Hugging Face against hosted API. Row five: price, self-hosted with no rate card against $5 and $25 per million tokens. Row six: status, unannounced research release against generally available. A footer reads 'NV-Reason-CT figures per the authors paper and model card; Claude Opus 5 figures per the provider rate card and Artificial Analysis.'

כיצד שני החצאים משתלבים במערכת אחת

אף אחד מהמודלים אינו מחליף את האחר, והארכיטקטורה ההגיונית מכילה את שניהם — מה שמעלה את השאלה המעשית כיצד לקרוא להם.

Claude Opus 5 מוגש דרך OrcaRouter בתור anthropic/claude-opus-5 במחיר המחירון של Anthropic ללא תוספת, בתוך API יחיד שמכסה יותר מ-200 מודלים. זה פחות משנה לקריאה בודדת מאשר לצינור שסביבה: כשהחצי הטקסטואלי של בנייה קלינית הוא מודל אחד מבין כמה מועמדים, העובדה שכולם עומדים מאחורי מפתח אחד מאפשרת להשוות ביניהם על הקורפוס שלך בלי חוזה נוסף או שינוי בקוד, וה-DSL של הניתוב מאפשר לך לשלוח בקשות בודדות למודל שאמור לטפל בהן, בעוד מעבר אוטומטי לגיבוי מכסה אותך כשספק מתדרדר.

NV-Reason-CT אינו נמצא בפלטפורמה שלנו, וגם לא אף מודל של NVIDIA. אלו משקלים שאתם מורידים ומריצים על החומרה שלכם, וזה בדיוק מה שהרישיון מתיר לכם לעשות, ובהינתן שהקלט הוא נתונים נפחיים שמקורם במטופלים, זה כנראה גם מה שאתם רוצים בכל מקרה. אנחנו לא מתכוונים לרמוז שאנחנו מנתבים מודל שאיננו מארחים. הצד הטקסטואלי של הבנייה הוא המקום שבו אנחנו מועילים; הצד הנפחי הוא המקום שבו אתם לבד עם מודל של 4.69B ו-GPU.

A screenshot of the OrcaRouter model page for Claude Opus 5, showing the identifier anthropic/claude-opus-5, the description of it as Anthropic's most capable model for complex reasoning and long-horizon agentic work, a side panel listing a 1,000,000-token context window and 128,000 maximum output tokens with text, image and file input and text output, and a stat strip reading $5.00 per million input tokens, $25.00 per million output tokens, and a p50 time to first token under four seconds.

פסק הדין שעומד בבחינה מדוקדקת

אם אתה זקוק לקריאת נפח CT לתוך ממצאים מובנים, יש מודל לכך — הוא בא מקבוצת המחקר של NVIDIA, והוא הורדה ולא קריאת API. אם אתה זקוק לנרמול של קורפוס דוחות, לכתיבת מסגרת הערכה, לתסרוט עבודת המרת DICOM, או לסיכום קבוצה, גם לכך יש מודל, ויש לו מחירון.

הקו שיש להחזיק בו הוא שאף אחד מהשניים לא הוכח כטוב יותר מהאחר בשום דבר, משום שהניסוי לא נערך. מה שכן הוכח הוא שממשק תלת-ממדי ילידי גובר על ממשק מבוסס פרוסות במדד ציבורי של CT חזה בפער שהמחברים מעריכים בכ-שלוש נקודות F1, ושמודל חזית כללי נמדד באופן בלתי תלוי בצמרת התחום בהסקה, בקוד ובעבודה בהקשר ארוך. אלה שתי אמירות על שתי מטלות שונות. לקרוא אותן כדירוג הוא טעות קטגורית, והיא מחזיקה מעמד ממש עד שמישהו יפרסם את ההשוואה ראש בראש שאף אחד עדיין לא פרסם.