כרטיס הירו שנוצר בכותרת 'NV-Reason-CT vs Grok 4.6' עם כותרת המשנה 'מי קורא את הסריקה, ומי קורא את הדוח'. שלושה צ'יפים מופיעים לאורך החלק התחתון: 'נפח CT אחד מול 500,000 טוקנים', '0.871 מול 0.870 הוא תיקו', ו-'Grok 4.6: $2.00 / $6.00 למיליון'. הלוגו של OrcaRouter מורכב בפינה הימנית התחתונה.
Guides & Insights

NV-Reason-CT מול Grok 4.6: מי קורא את הסריקה, ומי קורא את הדוח

מחבר

Gideon Frost

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים →
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

ישנן שתי דרכים להכניס בינה מלאכותית לצינור עיבוד של CT, ורק אחת מהן קשורה לתמונה. NV-Reason-CTהוא הראשון: מודל ראייה-שפה תלת-ממדי בעל 4.69 מיליארד פרמטרים, שקורא נפחי NIfTI ישירות ופורסם ל-Hugging Face ב-8 בספטמבר 2026 בלי פוסט השקה מ-NVIDIA. Grok 4.6הוא השני: מודל טקסט ותמונה עם חלון של 500,000 טוקנים, שיצא ב-12 באוגוסט 2026, עולה 2.00 דולר למיליון טוקני קלט, וטוב מאוד בחלק של העבודה שקורה אחרי שמישהו כבר כתב את הממצא. אם שמים אותם בהשוואה, השאלה הרגילה — איזה מהם טוב יותר — מתבררת כלא תקינה. הם לא מתחרים על אותה משבצת בצינור העיבוד. הם מתחרים על אותה שורת תקציב.

מה שלמעשה יצא בכל צד

NV-Reason-CT הגיע בתור מאגר, מאמר ו-Space הדגמה, לא כמוצר. המאגר ב-GitHub תחת NVIDIA-Medtech נוצר ב-2 בספטמבר 2026; המשקלים ב-Hugging Face הגיעו ב-8 בספטמבר; המאמר המוקדם ב-arXiv, NV-Reason-CT: מודל שפה חזותי תלת-ממדי לניתוח CT, פורסם ב-23 בספטמבר עם 16 מחברים מ-NVIDIA, מה-NIH ומאוניברסיטת ציריך. חדר החדשות של NVIDIA אינו מפרסם על כך דבר. כרטיס המודל מתאר גרסה 0.1 ומגביל את השימוש למחקר והוראה.

Grok 4.6 הוא שחרור מהסוג ההפוך. הוא נקודת קצה מסחרית מהשורה הראשונה, המופיעה כ"Latest" בתיעוד המפתחים של הספק, מתומחרת לפי מחירון מפורסם, וזמינה כמודל תואם OpenAI שאינטגרציות קיימות מאמצות אותו על ידי שינוי כתובת URL בסיסית. הוא החליף את Grok 4.5 עם אותו חלון הקשר, אותו משטח קלט ואותו תמחור בסיס.

האי-סימטריה הזו היא כל הסיפור של ההשוואה הזו. האחד הוא תוצר מחקר שבמקרה ניתן להורדה. האחר הוא תשתית. קריאה שלהם זה מול זה אומרת לך היכן עובר כיום הגבול בין "תוצר מחקר" ל"תשתית" בדימות רפואי — וזה לא במקום שהייתם מנחשים.

חלוקת העבודה, בתשומות ובתפוקות

• קלט נפחי — NV-Reason-CT קורא נפחי NIfTI מסוג .nii/.nii.gz ביחידות Hounsfield, בית חזה או בטן בלבד לעומת Grok 4.6 שקורא טקסט, תמונות וקבצים, ללא מסלול נפחי • טיפול מרחבי — NV-Reason-CT ממיר נפח של 384×384×384 מ״מ לרשת בגודל 24×24×24 של 13,824 טוקנים עם 3D MRoPE, ללא דגימת משנה לעומת Grok 4.6 שמתייחס לתמונה כתמונה דו־ממדית • הקשר — NV-Reason-CT נפח אחד הוא קידומת קבועה אחת, אין חלון הקשר במובן הרגיל לעומת Grok 4.6 500,000 טוקנים • פלט — NV-Reason-CT דוח מובנה, תשובה, או מסלול הסקה עם אפשרות להשבית את החשיבה לעומת Grok 4.6 טקסט עם פלטים מובנים וקריאות לכלים • רישיון — NV-Reason-CT OpenMDW-1.1, משקולות BF16 בנפח 10.6 GB לעומת Grok 4.6 קנייני, API בלבד • מחיר — NV-Reason-CT הוצאות הון על GPU, ללא תעריף לפי טוקן לעומת Grok 4.6 $2.00 / $6.00 למיליון, כפול מעל 200K קלט

A generated scoreboard titled 'NV-Reason-CT vs Grok 4.6 - the scoreboard'. Left column 'NV-Reason-CT': Volumetric input NIfTI, Hounsfield, chest or abdomen; Spatial handling 24x24x24 grid, no downsampling; Context one volume, a fixed prefix; Output report, answer or reasoning trace; Licence OpenMDW-1.1, 10.6 GB BF16; Price GPU capex, no per-token rate. Right column 'Grok 4.6': Volumetric input none - 2D images, text, files; Spatial handling an image is a picture; Context 500,000 tokens; Output text, structured outputs, tools; Licence proprietary, API only; Price $2.00 / $6.00, doubled above 200K. A footer reads 'NV-Reason-CT figures from NVIDIA's model card and paper; Grok 4.6 pricing per the vendor rate card.'

הצמד הזה נתפס כמסירה טבעית. NV-Reason-CT מפיק את הממצא מהנפח; Grok 4.6 הוא המודל שאליו היית מוסר אלף מהממצאים האלה, בתוך חלון הקשר אחד, כדי לחפש דפוסים בקרב קבוצת חולים. איש לא פרסם את הפייפליין הזה. זו הארכיטקטורה המתבקשת, וכדאי לומר בפשטות שהיא לא נבדקה.

המספרים של Grok 4.6, ושל מי הם

שני נתונים עבור Grok 4.6 מופצים יחד והם אינם מאותו סוג דבר. ציון GPQA Diamond של 94.9 נמדד על ידי Artificial Analysis, ולא דווח על ידי הספק — וזו הקטגוריה המהימנה יותר מבין שתי הקטגוריות, בדיוק מפני שצד שלישי הריץ אותה. ציון Artificial Analysis Intelligence Index של 44, במהדורת האינדקס v4.3.2, מציב את Grok 4.6 במקום ה-28 מתוך 211 בקטגוריה שלו. Artificial Analysis גם רושמת את המודל כקנייני: המשקלים אינם זמינים לציבור.

על אותו לוח, AA מודדת את Terminal-Bench 2.1 בציון 88.4, את SciCode בציון 56.5, את Humanity's Last Exam בציון 42.9, את 𝜏²-banking בציון 50.7, ואת אחזור הקשר ארוך בציון 80.3. אלה מכשירים להסקה כללית. לא ניתן להריץ אף אחד מהם על נפח CT תלת-ממדי, וזו אינה ביקורת על Grok 4.6 — זוהי הצהרה על מה שמודדת סוללת הבנצ'מרקים.

לצד ה-CT יש בדיוק טבלה אחת, והיא של המחברים

כל בסיס הראיות הציבורי של NV-Reason-CT הוא טבלת סיווג אחת על 18 התוויות של CT-RATE, בסף אחיד קבוע, תוך שימוש בפרומפט ישיר של כן/לא ללא ראש סיווג. הוא מדווח Macro-F1 0.614 ו-Macro-AUROC 0.871, לעומת VoxelFM עם 0.581/0.870, Pillar-0 עם 0.544/0.861, ClinFusion-8B עם 0.442, CT-CLIP עם 0.398/0.733, Merlin עם 0.358/0.662, ו-MedGemma 1.5 עם 0.303.

אלה מדווחים על ידי הספקים, מכרטיס המודל, ואני מתייג אותם ככאלה כי אף גורם בלתי תלוי עדיין לא שחזר אותם. שני דברים ראויים לתשומת לב בתוך הטבלה. מרווח ה-F1 לעומת VoxelFM הוא 0.033, שזה פער ממשי על 18 תוויות עם סף קבוע. מרווח ה-AUROC לעומת אותו מודל הוא 0.001, שזה תיקו. שני המספרים מופיעים באותה שורה של אותה טבלה, ורק אחד מהם נושא טענה.

הדבר הנוסף שהטבלה מספרת לך נוגע למסגור של המאמר עצמו. מודלי ההשוואה הם מערכות אימון מקדים קונטרסטיביות תלת-ממדיות, MLLM גנרטיבי משולב דו-ממדי/תלת-ממדי, ומודל חזית מבוסס פרוסות. המחברים בחרו להשוות מול מערכות שקולטות נפחים, מפני שהטענה המשמעותית היחידה כאן היא שמודל תלת-ממדי גנרטיבי יכול להביס מודלים תלת-ממדיים דיסקרימינטיביים בסיווג ללא ראש. זה לא אומר דבר על איך NV-Reason-CT משתווה למודל חזית כללי בכל דבר, כי ההשוואה הזו לא קיימת על הציר הזה.

A screenshot of NVIDIA's Hugging Face model page for NV-Reason-CT, showing the model card header with Like 1 and 0 followers, the Image-Text-to-Text and Transformers and Safetensors tags, the qwen3_5, medical-imaging, ct, 3d-vlm and custom_code tags, 'Downloads last month 210', the 5B-parameter BF16 size row, the model description describing the 384x384x384-mm volume becoming a 24x24x24 grid of 13,824 visual tokens with no spatial downsampling, the training paragraph citing roughly 550,000 structured QA examples from 70,111 unique CT volumes, a side panel showing Base model Qwen/Qwen3.5-4B and the CT-RATE and CancerVerse datasets, and the arXiv 2609.27511 paper link.

לאן הולך הכסף, ולמה גבול השכבה חשוב

ללוח התעריפים של Grok 4.6 יש פרט אחד שמכריע בשקט לא מעט מהארכיטקטורה: פרומפטים מעל 200K אסימוני קלט מחויבים בכפול מהתעריף הבסיסי — $4.00 בקלט, $12.00 בפלט, כשתעריף קריאת המטמון עולה מ-$0.50 ל-$1.00. משימת סקירת קוהורט שצוברת ממצאים בהקשר ארוך אחד היא בדיוק סוג העומס שחוצה את הקו הזה. מתחתיו, תעריף קריאת המטמון של $0.50 למיליון הוא רבע ממחיר הקלט, וזה מה שהופך הרצה בלולאה של קידומת קבועה גדולה על פני אלפי דוחות למשתלמת ולא רק לאפשרית.

דרך OrcaRouter, Grok 4.6 מוגש במחיר המחירון של אותו ספק ללא כל תוספת, כך שחשבון השכבות שלמעלה הוא החשבון שאתם משלמים בפועל, וכל התאמה עתידית בו מגיעה לחשבון שלכם באותו יום ולא בחידוש הבא. הסיבה לנתב משימה כזו במקום לקודד נקודת קצה אחת ישירות היא שחצי סקירת הקוהורט של צינור קליני הוא המקום שבו תרצו לנסות שלושה מודלים שונים לפני שתחליטו — ועל מפתח יחיד התואם ל-OpenAI עם מעבר אוטומטי בין ספקים, הניסוי הזה עולה רק שינוי של שם מודל.

למחצית ה-CT של הפייפליין אין אפשרות כזו. NV-Reason-CT אינו מתארח ב-OrcaRouter — זהו צ'קפוינט בנפח 10.6 GB עם קוד מודל מותאם אישית שאתם מריצים בעצמכם, על סיליקון Ampere, Hopper או Lovelace, עם trust_remote_code=True. אנחנו לא מתכוונים לרמוז אחרת. אם אתם בונים את הפייפליין הזה, אתם קונים כרטיסי GPU למחצית אחת וטוקנים למחצית האחרת, והעובדה ששתי המחציות יכולות לכל הפחות להיות מנוהלות מקונסולה אחת היא טענת האינטגרציה היחידה ששווה להשמיע.

A screenshot of the OrcaRouter model page for Grok 4.6, showing the identifier grok/grok-4.6, input text + image + file, output text, the Vision, Tools, JSON and Reasoning badges, a 500,000-token context window, the description of it as SpaceXAI's smartest model to date and the current flagship listed as Latest in the vendor's own developer docs, OpenAI-compatible code samples pointing at https://api.orcarouter.ai/v1, and a pricing strip reading $2.00 per million input tokens and $6.00 per million output tokens.

כמה באמת שווה קורא שני

מאמר NV-Reason-CT כולל מחקר ראשוני של רדיולוגים מומחים המדווח על "דירוגי ביטחון חיוביים לסקירה בסיוע AI" ועל הפחתה של 50% בזמן הפרשנות והדיווח הממוצע המדווח. אלו מספרים חזקים, והם באים עם הסתייגות שהמאמר עצמו מציין: ראשוני, ובעיצוב המחקר של המחברים עצמם. אין שכפול בלתי תלוי שפורסם, והפחתת זמן של 50% במחקר קריאה מבוקר היא בדיוק סוג התוצאה שמתכווצת בשכפול. שווה לעקוב אחריה. לא שווה לצטט אותה כמבוססת.

כשקוראים זאת על רקע זה, תרומתו של Grok 4.6 לזרימת עבודה ברדיולוגיה אינה אבחון כלל. היא השכבה שקוראת את הדוחות — תור המיון, מכתב המעקב, הקידוד, חבילת האישור המוקדם. העבודה הזו היא טקסט, היא בנפח גבוה, היא זולה ליחידה, ואופן הכשל של טעות בה הוא מנהלי ולא קליני. זה גם המקום שבו חלון הקשר של 500K וקריאת מטמון ב-$0.50 באמת מצדיקים את מקומם.

אז החלוקה שאליה מגיעה ההשוואה הזו היא חדה: ל-NV-Reason-CT יש מסלול תלת־ממדי אמיתי, אבל אין הפצה, אין מחיר ואין אימות בלתי תלוי. ל-Grok 4.6 יש הפצה, מחיר, כיסוי בנצ'מרקים בלתי תלוי, ואין לו מסלול נפחי בכלל. אם אתה צריך שהסריקה תיקרא, רק אחד מהם יכול לעשות זאת. אם אתה צריך שהניירת סביב הסריקה תטופל, רק האחר הוא מוצר.

השוואות במאמר הזה1

זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית