
NV-Reason-CT מול Grok 4.6: מי קורא את הסריקה, ומי קורא את הדוח
- typesafeחדשTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 לכל 1M טוקנים · 45 tok/s
- openaiחדשOpenAI: GPT-6 Luna2026-09-2237אינטליגנציה
- openaiחדשOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- anthropicחדשAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- grokחדשGrok 4.72026-09-2146אינטליגנציה
- OrcaחדשOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 לכל 1M טוקנים · 182 tok/s
- orcaחדשOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 1285 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- openaiOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- googleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- anthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 119 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0540אינטליגנציה72כתיבת קוד
ישנן שתי דרכים להכניס בינה מלאכותית לצינור עיבוד של CT, ורק אחת מהן קשורה לתמונה. NV-Reason-CTהוא הראשון: מודל ראייה-שפה תלת-ממדי בעל 4.69 מיליארד פרמטרים, שקורא נפחי NIfTI ישירות ופורסם ל-Hugging Face ב-8 בספטמבר 2026 בלי פוסט השקה מ-NVIDIA. Grok 4.6הוא השני: מודל טקסט ותמונה עם חלון של 500,000 טוקנים, שיצא ב-12 באוגוסט 2026, עולה 2.00 דולר למיליון טוקני קלט, וטוב מאוד בחלק של העבודה שקורה אחרי שמישהו כבר כתב את הממצא. אם שמים אותם בהשוואה, השאלה הרגילה — איזה מהם טוב יותר — מתבררת כלא תקינה. הם לא מתחרים על אותה משבצת בצינור העיבוד. הם מתחרים על אותה שורת תקציב.
מה שלמעשה יצא בכל צד
NV-Reason-CT הגיע בתור מאגר, מאמר ו-Space הדגמה, לא כמוצר. המאגר ב-GitHub תחת NVIDIA-Medtech נוצר ב-2 בספטמבר 2026; המשקלים ב-Hugging Face הגיעו ב-8 בספטמבר; המאמר המוקדם ב-arXiv, NV-Reason-CT: מודל שפה חזותי תלת-ממדי לניתוח CT, פורסם ב-23 בספטמבר עם 16 מחברים מ-NVIDIA, מה-NIH ומאוניברסיטת ציריך. חדר החדשות של NVIDIA אינו מפרסם על כך דבר. כרטיס המודל מתאר גרסה 0.1 ומגביל את השימוש למחקר והוראה.
Grok 4.6 הוא שחרור מהסוג ההפוך. הוא נקודת קצה מסחרית מהשורה הראשונה, המופיעה כ"Latest" בתיעוד המפתחים של הספק, מתומחרת לפי מחירון מפורסם, וזמינה כמודל תואם OpenAI שאינטגרציות קיימות מאמצות אותו על ידי שינוי כתובת URL בסיסית. הוא החליף את Grok 4.5 עם אותו חלון הקשר, אותו משטח קלט ואותו תמחור בסיס.
האי-סימטריה הזו היא כל הסיפור של ההשוואה הזו. האחד הוא תוצר מחקר שבמקרה ניתן להורדה. האחר הוא תשתית. קריאה שלהם זה מול זה אומרת לך היכן עובר כיום הגבול בין "תוצר מחקר" ל"תשתית" בדימות רפואי — וזה לא במקום שהייתם מנחשים.
חלוקת העבודה, בתשומות ובתפוקות
• קלט נפחי — NV-Reason-CT קורא נפחי NIfTI מסוג .nii/.nii.gz ביחידות Hounsfield, בית חזה או בטן בלבד לעומת Grok 4.6 שקורא טקסט, תמונות וקבצים, ללא מסלול נפחי • טיפול מרחבי — NV-Reason-CT ממיר נפח של 384×384×384 מ״מ לרשת בגודל 24×24×24 של 13,824 טוקנים עם 3D MRoPE, ללא דגימת משנה לעומת Grok 4.6 שמתייחס לתמונה כתמונה דו־ממדית • הקשר — NV-Reason-CT נפח אחד הוא קידומת קבועה אחת, אין חלון הקשר במובן הרגיל לעומת Grok 4.6 500,000 טוקנים • פלט — NV-Reason-CT דוח מובנה, תשובה, או מסלול הסקה עם אפשרות להשבית את החשיבה לעומת Grok 4.6 טקסט עם פלטים מובנים וקריאות לכלים • רישיון — NV-Reason-CT OpenMDW-1.1, משקולות BF16 בנפח 10.6 GB לעומת Grok 4.6 קנייני, API בלבד • מחיר — NV-Reason-CT הוצאות הון על GPU, ללא תעריף לפי טוקן לעומת Grok 4.6 $2.00 / $6.00 למיליון, כפול מעל 200K קלט

הצמד הזה נתפס כמסירה טבעית. NV-Reason-CT מפיק את הממצא מהנפח; Grok 4.6 הוא המודל שאליו היית מוסר אלף מהממצאים האלה, בתוך חלון הקשר אחד, כדי לחפש דפוסים בקרב קבוצת חולים. איש לא פרסם את הפייפליין הזה. זו הארכיטקטורה המתבקשת, וכדאי לומר בפשטות שהיא לא נבדקה.
המספרים של Grok 4.6, ושל מי הם
שני נתונים עבור Grok 4.6 מופצים יחד והם אינם מאותו סוג דבר. ציון GPQA Diamond של 94.9 נמדד על ידי Artificial Analysis, ולא דווח על ידי הספק — וזו הקטגוריה המהימנה יותר מבין שתי הקטגוריות, בדיוק מפני שצד שלישי הריץ אותה. ציון Artificial Analysis Intelligence Index של 44, במהדורת האינדקס v4.3.2, מציב את Grok 4.6 במקום ה-28 מתוך 211 בקטגוריה שלו. Artificial Analysis גם רושמת את המודל כקנייני: המשקלים אינם זמינים לציבור.
על אותו לוח, AA מודדת את Terminal-Bench 2.1 בציון 88.4, את SciCode בציון 56.5, את Humanity's Last Exam בציון 42.9, את 𝜏²-banking בציון 50.7, ואת אחזור הקשר ארוך בציון 80.3. אלה מכשירים להסקה כללית. לא ניתן להריץ אף אחד מהם על נפח CT תלת-ממדי, וזו אינה ביקורת על Grok 4.6 — זוהי הצהרה על מה שמודדת סוללת הבנצ'מרקים.
לצד ה-CT יש בדיוק טבלה אחת, והיא של המחברים
כל בסיס הראיות הציבורי של NV-Reason-CT הוא טבלת סיווג אחת על 18 התוויות של CT-RATE, בסף אחיד קבוע, תוך שימוש בפרומפט ישיר של כן/לא ללא ראש סיווג. הוא מדווח Macro-F1 0.614 ו-Macro-AUROC 0.871, לעומת VoxelFM עם 0.581/0.870, Pillar-0 עם 0.544/0.861, ClinFusion-8B עם 0.442, CT-CLIP עם 0.398/0.733, Merlin עם 0.358/0.662, ו-MedGemma 1.5 עם 0.303.
אלה מדווחים על ידי הספקים, מכרטיס המודל, ואני מתייג אותם ככאלה כי אף גורם בלתי תלוי עדיין לא שחזר אותם. שני דברים ראויים לתשומת לב בתוך הטבלה. מרווח ה-F1 לעומת VoxelFM הוא 0.033, שזה פער ממשי על 18 תוויות עם סף קבוע. מרווח ה-AUROC לעומת אותו מודל הוא 0.001, שזה תיקו. שני המספרים מופיעים באותה שורה של אותה טבלה, ורק אחד מהם נושא טענה.
הדבר הנוסף שהטבלה מספרת לך נוגע למסגור של המאמר עצמו. מודלי ההשוואה הם מערכות אימון מקדים קונטרסטיביות תלת-ממדיות, MLLM גנרטיבי משולב דו-ממדי/תלת-ממדי, ומודל חזית מבוסס פרוסות. המחברים בחרו להשוות מול מערכות שקולטות נפחים, מפני שהטענה המשמעותית היחידה כאן היא שמודל תלת-ממדי גנרטיבי יכול להביס מודלים תלת-ממדיים דיסקרימינטיביים בסיווג ללא ראש. זה לא אומר דבר על איך NV-Reason-CT משתווה למודל חזית כללי בכל דבר, כי ההשוואה הזו לא קיימת על הציר הזה.

לאן הולך הכסף, ולמה גבול השכבה חשוב
ללוח התעריפים של Grok 4.6 יש פרט אחד שמכריע בשקט לא מעט מהארכיטקטורה: פרומפטים מעל 200K אסימוני קלט מחויבים בכפול מהתעריף הבסיסי — $4.00 בקלט, $12.00 בפלט, כשתעריף קריאת המטמון עולה מ-$0.50 ל-$1.00. משימת סקירת קוהורט שצוברת ממצאים בהקשר ארוך אחד היא בדיוק סוג העומס שחוצה את הקו הזה. מתחתיו, תעריף קריאת המטמון של $0.50 למיליון הוא רבע ממחיר הקלט, וזה מה שהופך הרצה בלולאה של קידומת קבועה גדולה על פני אלפי דוחות למשתלמת ולא רק לאפשרית.
דרך OrcaRouter, Grok 4.6 מוגש במחיר המחירון של אותו ספק ללא כל תוספת, כך שחשבון השכבות שלמעלה הוא החשבון שאתם משלמים בפועל, וכל התאמה עתידית בו מגיעה לחשבון שלכם באותו יום ולא בחידוש הבא. הסיבה לנתב משימה כזו במקום לקודד נקודת קצה אחת ישירות היא שחצי סקירת הקוהורט של צינור קליני הוא המקום שבו תרצו לנסות שלושה מודלים שונים לפני שתחליטו — ועל מפתח יחיד התואם ל-OpenAI עם מעבר אוטומטי בין ספקים, הניסוי הזה עולה רק שינוי של שם מודל.
למחצית ה-CT של הפייפליין אין אפשרות כזו. NV-Reason-CT אינו מתארח ב-OrcaRouter — זהו צ'קפוינט בנפח 10.6 GB עם קוד מודל מותאם אישית שאתם מריצים בעצמכם, על סיליקון Ampere, Hopper או Lovelace, עם trust_remote_code=True. אנחנו לא מתכוונים לרמוז אחרת. אם אתם בונים את הפייפליין הזה, אתם קונים כרטיסי GPU למחצית אחת וטוקנים למחצית האחרת, והעובדה ששתי המחציות יכולות לכל הפחות להיות מנוהלות מקונסולה אחת היא טענת האינטגרציה היחידה ששווה להשמיע.

כמה באמת שווה קורא שני
מאמר NV-Reason-CT כולל מחקר ראשוני של רדיולוגים מומחים המדווח על "דירוגי ביטחון חיוביים לסקירה בסיוע AI" ועל הפחתה של 50% בזמן הפרשנות והדיווח הממוצע המדווח. אלו מספרים חזקים, והם באים עם הסתייגות שהמאמר עצמו מציין: ראשוני, ובעיצוב המחקר של המחברים עצמם. אין שכפול בלתי תלוי שפורסם, והפחתת זמן של 50% במחקר קריאה מבוקר היא בדיוק סוג התוצאה שמתכווצת בשכפול. שווה לעקוב אחריה. לא שווה לצטט אותה כמבוססת.
כשקוראים זאת על רקע זה, תרומתו של Grok 4.6 לזרימת עבודה ברדיולוגיה אינה אבחון כלל. היא השכבה שקוראת את הדוחות — תור המיון, מכתב המעקב, הקידוד, חבילת האישור המוקדם. העבודה הזו היא טקסט, היא בנפח גבוה, היא זולה ליחידה, ואופן הכשל של טעות בה הוא מנהלי ולא קליני. זה גם המקום שבו חלון הקשר של 500K וקריאת מטמון ב-$0.50 באמת מצדיקים את מקומם.
אז החלוקה שאליה מגיעה ההשוואה הזו היא חדה: ל-NV-Reason-CT יש מסלול תלת־ממדי אמיתי, אבל אין הפצה, אין מחיר ואין אימות בלתי תלוי. ל-Grok 4.6 יש הפצה, מחיר, כיסוי בנצ'מרקים בלתי תלוי, ואין לו מסלול נפחי בכלל. אם אתה צריך שהסריקה תיקרא, רק אחד מהם יכול לעשות זאת. אם אתה צריך שהניירת סביב הסריקה תטופל, רק האחר הוא מוצר.
השוואות במאמר הזה1
זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית
