
NV-Reason-CT לעומת GPT-5.6 Sol: 13,824 טוקנים ויזואליים לפני שתקליד מילה
- typesafeחדשTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 לכל 1M טוקנים · 45 tok/s
- openaiחדשOpenAI: GPT-6 Luna2026-09-2237אינטליגנציה
- openaiחדשOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- anthropicחדשAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- grokחדשGrok 4.72026-09-2146אינטליגנציה
- OrcaחדשOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 לכל 1M טוקנים · 182 tok/s
- orcaחדשOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 1285 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- openaiOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- googleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- anthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 119 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0540אינטליגנציה72כתיבת קוד
כל סריקת CT חזה בודדת שאתה שולח אל NV-Reason-CT עולה 13,824 טוקנים חזותיים לפני שהפרומפט מתחיל. זו אינה גחמה או בחירת כיוונון — זה העיצוב כולו. מקודד הראייה התלת-ממדי המובנה של המודל מקבל נפח של 384×384×384 מ"מ והופך אותו לרשת של 24×24×24, וכרטיס המודל מפורש בכך שכל 13,824 הטוקנים והקואורדינטות התלת-ממדיות שלהם מגיעים למודל השפה "ללא הקטנת דגימה מרחבית". השווה זאת למה שאתה כנראה כבר משלם עליו. GPT-5.6 Sol מקבל טקסט, תמונות וקבצים, ותמונה שנשלחת אליו היא תמונה דו-ממדית — פרוסה, צילום מסך של מציג DICOM, איור רדיולוגי שהודבק מתוך PDF. לאחד מהמודלים האלה יש מסלול נפחי, ולשני יש חלון הקשר. רוב ההשוואות ביניהם קורסות לנוכח ההבחנה הזו, והקריסה היא החלק המעניין.
ההוצאה שאיש לא הודיע עליה
NVIDIA לא פרסמה מילה על NV-Reason-CT בחדר החדשות שלה. אין פוסט השקה, אין שקופית מרכזית, אין הודעה לעיתונות. מה שקיים הוא מאגר Hugging Face שנוצר ב-8 בספטמבר 2026, מאגר GitHub תחת הארגון NVIDIA-Medtech שנוצר ב-2 בספטמבר, ו-Space הדגמה של Gradio, ומאמר טרום-פרסום ב-arXiv — NV-Reason-CT: מודל שפה ויזואלי תלת-ממדי לניתוח CT — שהוגש ב-23 בספטמבר 2026 על ידי צוות של שישה-עשר מחברים מ-NVIDIA עם מחברים שותפים ב-NIH ובאוניברסיטת ציריך.
זהו דפוס אמיתי, וכדאי לתת לו שם מדויק במקום להתייחס אליו כמסתורין. קבוצת הדימות הרפואי של NVIDIA משחררת משקלים בשקט ומניחה למאמר ולמאגר לעשות את ההכרזה. קודמו, NV-Reason-CXR-3B, יצא באוקטובר 2025 באותו אופן. ההבדל כאן הוא בהיקף: זו הפעם הראשונה שקבוצה זו מרחיבה את המתכון מצילומי רנטגן דו-ממדיים לנפחים תלת-ממדיים נייטיביים, והמאמר בן יומיים.
מה שניתן לדעת מהריפוזיטורי: ארכיטקטורה, רישיון, נתוני אימון, טבלת הבנצ'מרק. מה שטרם אושר: האם NVIDIA מתכוונת לכך כקו מוצר נתמך, האם יגיעו עוד צ'קפוינטים, וכיצד זה מחזיק מעמד בהערכה של מישהו אחר מלבד המחברים. הריפוזיטורי נמצא בגרסה 0.1 ומתאר את עצמו כמיועד למחקר ולחינוך בלבד.
מה כל מודל למעשה מקבל
כאן השוואה ראש בראש נעשית כנה במהירות. לשני המודלים אין משטח קלט משותף.
NV-Reason-CT קורא נפחי NIfTI — .nii או .nii.gz — עם עוצמות ווקסל ביחידות האנספילד. הוא חותך אוטומטית לאזור החזה או הבטן באמצעות יחידות האנספילד של הריאות והיוריסטיקת מורפולוגיה תלת-ממדית, דוגם מחדש לרזולוציה איזוטרופית של 2 מ"מ, ומקבל רק "chest" או "abdomen" כערכי אנטומיה. הוא מפיק טקסט: דוח מובנה, תשובה, או מסלול חשיבה שלב אחר שלב, עם מתג לכיבוי החשיבה לצורך תשובות קצרות.
GPT-5.6 Sol קורא טקסט, תמונות וקבצים, עם חלון הקשר של 1,050,000 טוקנים ועד 128,000 טוקני פלט בתשובה אחת. אין לו מקודד נפחי. האכילו אותו בבדיקת CT ועליכם תחילה להחליט כיצד לשטח שלוש-מאות-ומשהו פרוסות למשהו שמקודד תמונות דו-ממדי יקבל — מונטאז', קומץ פרוסות מפתח, היטל עוצמה מרבית מרונדר. כל אחת מהבחירות האלה משליכה לפח את היחסים המרחביים שמסלול התלת-ממד נבנה כדי לשמר.
אז הניסוח הכנה אינו "איזה מודל חכם יותר". אלא שמסלול התמונה של Sol ומסלול התלת-ממד של NV-Reason-CT עונים על שאלות שונות. Sol יכול לבצע הסקה לגבי תיאור של רדיולוג את הסריקה. NV-Reason-CT יכול לבצע הסקה לגבי הסריקה עצמה.
קיים בנצ'מרק אחד, ורק לאחד מהם יש מספר עליו
NV-Reason-CT מדווח על Macro-F1 של 0.614 ו-Macro-AUROC של 0.871 במשימת סיווג 18 התוויות של CT-RATE, תוך שימוש בפרומפט ישיר של כן/לא, ללא ראש סיווג וללא התאמה ספציפית למשימה. אלה המספרים של המחברים עצמם מכרטיס המודל, ושורת ההשוואה היא החלק השימושי: VoxelFM עם 0.581 Macro-F1, Pillar-0 עם 0.544, ClinFusion-8B עם 0.442, CT-CLIP עם 0.398, Merlin עם 0.358, MedGemma 1.5 עם 0.303. על אותו סף אחיד קבוע, מודל 3D גנרטיבי גובר על בסיסי הפרה-טריינינג הקונטרסטיביים התלת-ממדיים ועל מודל החזית מבוסס הפרוסות.
מספר אחד בטבלה ההיא ראוי לספקנות ולא לחזרה: פער ה-AUROC. NV-Reason-CT מדווח 0.871 לעומת 0.870 של VoxelFM. אלפית נקודה, בהערכה שמנוהלת בידי ספק, אינה ניצחון — היא תיקו בתוך כל רעש שההערכה נושאת. פער ה-Macro-F1 של 0.033 הוא הטענה המבוססת.
ל-GPT-5.6 Sol אין מספר CT-RATE, מפני ש-CT-RATE אינו בנצ'מרק שאפשר להריץ עליו את המודל. יש לו Artificial Analysis Intelligence Index של 47, ציון GPQA Diamond שנמדד ב-AA של 94.1, וציון Humanity's Last Exam של 49.5 — כולם מכשירי הסקה כלליים. הצבת 0.614 Macro-F1 לצד 47 במדד AA תהיה חשבון בשני סרגלים שונים. אני לא אעשה זאת, ואתה צריך לחשוד בכל מי שכן עושה זאת.
עקבות הסקה, שני מוצרים שונים
שני המודלים מפיקים הנמקה. זו החפיפה הפילוסופית האמיתית היחידה, וההבדל מלמד.
GPT-5.6 Sol חושף מאמץ חשיבה הניתן להגדרה, כך שאתה מאזן בין השהיה ועלות לבין העומק בכל בקשה, ותוכל לבקש את החשיבה בחזרה דרך include_reasoning. זוהי יכולת כללית שמוחלת על כל מה שתשלח לה.
ההיסק של NV-Reason-CT הוא צר במכוון. קורפוס האימון כולל בערך 550,000 דוגמאות QA מובנות שנלקחו מ-70,111 נפחי CT ייחודיים, וחלק ממנו הוא היסק שנכתב על ידי רדיולוגים שנאסף מפרשנויות מומחים שהוקלטו ותומללו. שלב ה-GRPO שאחרי SFT משתמש בתגמולים ניתנים לאימות על פני קבוצות של ממצאים חריגים בחזה ובבטן — כלומר, אות התגמול מבוסס על האם ממצא מוצהר באמת קיים בנפח, ולא על האם הפרוזה נקראת היטב. כרטיס המודל מתאר את הפלט כ"תצפיות הניתנות לבדיקה, אבחנות מבדלות, ואי-ודאות", והוא נושא אזהרה מפורשת שהיסק שנוצר "אינו מובטח לייצג את החישוב הפנימי של המודל". האזהרה הזו עושה עבודה אמיתית. זה ההבדל בין עקבה שניתן לבדוק מול הנתונים לבין עקבה שרק ניתן להעריץ.
הגודל והרישיון, במעבר אחד
• פרמטרים — NV-Reason-CT 4.69B סך הכל / 4.35B פעילים במסלול CT, מבסיס Qwen3.5-4B בתוספת Primus 3D ViT לעומת GPT-5.6 Sol לא פורסם • גודל צ'קפוינט — NV-Reason-CT ~10.6 GB BF16 safetensors, פועל על Ampere/Hopper/Lovelace לעומת GPT-5.6 Sol API בלבד • קלט — נפחי CT תלת-ממדיים בפורמט NIfTI ביחידות Hounsfield לעומת טקסט, תמונה, קובץ • הקשר — NV-Reason-CT לא רלוונטי, נפח אחד הוא קידומת קבועה של 13,824 טוקנים לעומת Sol 1,050,000 טוקנים בקלט, 128,000 בפלט • רישיון — OpenMDW-1.1, משקלים להורדה לעומת קנייני, גישה ל-API בלבד • זמינות — מאגר הספק והמשקלים שלו לעומת מנותב ב-OrcaRouter במחיר $4.00 / $20.00 למיליון, כאשר התעריף של Sol מעל 272K טוקני קלט מוכפל ל-$8.00 / $30.00

מה שהפיצול באמת עולה לך
השוואת עלויות הופכת להגיונית רק כשמקבלים שעומסי העבודה שונים, ולכן הנה הגרסה שכן הגיונית.
עבור Sol החיוב הוא לפי טוקן, ולמחיר שלה יש צוק: $4.00 למיליון טוקני קלט ו-$20.00 למיליון טוקני פלט עד 272K טוקנים של פרומפט, ואחר כך $8.00 ו-$30.00. ב-OrcaRouter היא מוצעת במחיר המחירון של OpenAI עצמה, עם אפס תוספת, וזה חשוב יותר ממה שזה נשמע — התעריף שאתם רואים הוא התעריף ש-OpenAI מפרסמת, כך שכל שינוי מחיר מגיע לחשבון שלכם באותו יום ולא בחידוש החוזה הבא. תעריף קריאת המטמון שלה הוא $0.40 למיליון, עשירית מהקלט, וזה מה שמאפשר ללולאות אג'נטיות ארוכות עם קידומת קבועה גדולה לשרוד מבחינה אריתמטית.
ל-NV-Reason-CT אין בכלל מחיר לפי טוקן. אתם מורידים 10.6 GB ומשלמים על ה-GPU. זו שאלה של הוצאות הון מול הוצאות תפעול, ויש לה רק תשובה אחת: בהיקף גבוה מספיק, אירוח עצמי של מודל עם 4.35B פרמטרים פעילים מנצח מבחינת עלות. מתחת להיקף הזה הוא לא מנצח, ונקודת ההצטלבות תלויה כולה בניצולת ה-GPU שלכם. אף אחד מחוץ ל-NVIDIA עוד לא פרסם נתון תפוקה עבור הצ'ק-פוינט הזה, אז כל מי שמצטט לכם נקודת הצטלבות מנחש.

מה שנתב כן עוזר בו כאן הוא החלק בתהליך העבודה שאינו הסריקה. צינור מחקר קליני בסביבת ייצור הוא לעיתים רחוקות מודל אחד — הוא חילוץ, שלב הסקה, שלב סיכום, לפעמים חוות דעת שנייה. OrcaRouter חושף למעלה מ-200 מודלים מאחורי נקודת קצה אחת תואמת OpenAI עם מעבר אוטומטי בין ספקים בעת כשל, כך שהחצי הרב-תכליתי של אותו צינור יכול להיות מוחלף או מנותב מחדש בלי חוזה נוסף. NV-Reason-CT אינו אחד מהמודלים שאנו מנתבים; זהו צ'קפוינט שאתה מריץ בעצמך. שני חצאי הצינור יכולים עדיין להימצא מאחורי מפתח אחד.

השאלה הפתוחה
NV-Reason-CT הוא בן יומיים כמאמר ובן שבעה עשר ימים כמאגר קוד, והתחום שאליו הוא משתייך קטן מספיק כך שנקודת הנתונים הבאה תהיה אינפורמטיבית. שימו לב לשלושה דברים: שחזור עצמאי של CT-RATE, צ'קפוינט שני במשפחה, וכל סימן לכך שקבוצת הרפואה של NVIDIA מתייחסת לזה כקו ולא כמאמר. עד אז, העמדה הניתנת להגנה היא צרה וברורה — זהו צ'קפוינט הסקת ה-CT התלת-ממדי הנייטיבי החזק ביותר שניתן להוריד כיום, לפי הטבלה של המחברים עצמם, והוא אינו תחליף למודל חזית כללי בשום תחום מלבד פיענוח CT.
