כרטיס Hero שנוצר שכותרתו 'NV-Reason-CT vs GPT-5.6 Sol' עם כתובית המשנה '13,824 אסימונים חזותיים לפני שאתם מקלידים מילה'. שלושה צ'יפים משתרעים לאורך החלק התחתון: '4.69B מומחה CT מול לא-מפורט', '3D NIfTI נכנס, ממצאים יוצאים', ו-'Sol: 1,050,000 נכנס / 128,000 יוצא'. הלוגו של OrcaRouter מורכב בפינה הימנית התחתונה.
Guides & Insights

NV-Reason-CT לעומת GPT-5.6 Sol: 13,824 טוקנים ויזואליים לפני שתקליד מילה

מחבר

Gideon Frost

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים →
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

כל סריקת CT חזה בודדת שאתה שולח אל NV-Reason-CT עולה 13,824 טוקנים חזותיים לפני שהפרומפט מתחיל. זו אינה גחמה או בחירת כיוונון — זה העיצוב כולו. מקודד הראייה התלת-ממדי המובנה של המודל מקבל נפח של 384×384×384 מ"מ והופך אותו לרשת של 24×24×24, וכרטיס המודל מפורש בכך שכל 13,824 הטוקנים והקואורדינטות התלת-ממדיות שלהם מגיעים למודל השפה "ללא הקטנת דגימה מרחבית". השווה זאת למה שאתה כנראה כבר משלם עליו. GPT-5.6 Sol מקבל טקסט, תמונות וקבצים, ותמונה שנשלחת אליו היא תמונה דו-ממדית — פרוסה, צילום מסך של מציג DICOM, איור רדיולוגי שהודבק מתוך PDF. לאחד מהמודלים האלה יש מסלול נפחי, ולשני יש חלון הקשר. רוב ההשוואות ביניהם קורסות לנוכח ההבחנה הזו, והקריסה היא החלק המעניין.

ההוצאה שאיש לא הודיע עליה

NVIDIA לא פרסמה מילה על NV-Reason-CT בחדר החדשות שלה. אין פוסט השקה, אין שקופית מרכזית, אין הודעה לעיתונות. מה שקיים הוא מאגר Hugging Face שנוצר ב-8 בספטמבר 2026, מאגר GitHub תחת הארגון NVIDIA-Medtech שנוצר ב-2 בספטמבר, ו-Space הדגמה של Gradio, ומאמר טרום-פרסום ב-arXiv — NV-Reason-CT: מודל שפה ויזואלי תלת-ממדי לניתוח CT — שהוגש ב-23 בספטמבר 2026 על ידי צוות של שישה-עשר מחברים מ-NVIDIA עם מחברים שותפים ב-NIH ובאוניברסיטת ציריך.

זהו דפוס אמיתי, וכדאי לתת לו שם מדויק במקום להתייחס אליו כמסתורין. קבוצת הדימות הרפואי של NVIDIA משחררת משקלים בשקט ומניחה למאמר ולמאגר לעשות את ההכרזה. קודמו, NV-Reason-CXR-3B, יצא באוקטובר 2025 באותו אופן. ההבדל כאן הוא בהיקף: זו הפעם הראשונה שקבוצה זו מרחיבה את המתכון מצילומי רנטגן דו-ממדיים לנפחים תלת-ממדיים נייטיביים, והמאמר בן יומיים.

מה שניתן לדעת מהריפוזיטורי: ארכיטקטורה, רישיון, נתוני אימון, טבלת הבנצ'מרק. מה שטרם אושר: האם NVIDIA מתכוונת לכך כקו מוצר נתמך, האם יגיעו עוד צ'קפוינטים, וכיצד זה מחזיק מעמד בהערכה של מישהו אחר מלבד המחברים. הריפוזיטורי נמצא בגרסה 0.1 ומתאר את עצמו כמיועד למחקר ולחינוך בלבד.

מה כל מודל למעשה מקבל

כאן השוואה ראש בראש נעשית כנה במהירות. לשני המודלים אין משטח קלט משותף.

NV-Reason-CT קורא נפחי NIfTI — .nii או .nii.gz — עם עוצמות ווקסל ביחידות האנספילד. הוא חותך אוטומטית לאזור החזה או הבטן באמצעות יחידות האנספילד של הריאות והיוריסטיקת מורפולוגיה תלת-ממדית, דוגם מחדש לרזולוציה איזוטרופית של 2 מ"מ, ומקבל רק "chest" או "abdomen" כערכי אנטומיה. הוא מפיק טקסט: דוח מובנה, תשובה, או מסלול חשיבה שלב אחר שלב, עם מתג לכיבוי החשיבה לצורך תשובות קצרות.

GPT-5.6 Sol קורא טקסט, תמונות וקבצים, עם חלון הקשר של 1,050,000 טוקנים ועד 128,000 טוקני פלט בתשובה אחת. אין לו מקודד נפחי. האכילו אותו בבדיקת CT ועליכם תחילה להחליט כיצד לשטח שלוש-מאות-ומשהו פרוסות למשהו שמקודד תמונות דו-ממדי יקבל — מונטאז', קומץ פרוסות מפתח, היטל עוצמה מרבית מרונדר. כל אחת מהבחירות האלה משליכה לפח את היחסים המרחביים שמסלול התלת-ממד נבנה כדי לשמר.

אז הניסוח הכנה אינו "איזה מודל חכם יותר". אלא שמסלול התמונה של Sol ומסלול התלת-ממד של NV-Reason-CT עונים על שאלות שונות. Sol יכול לבצע הסקה לגבי תיאור של רדיולוג את הסריקה. NV-Reason-CT יכול לבצע הסקה לגבי הסריקה עצמה.

קיים בנצ'מרק אחד, ורק לאחד מהם יש מספר עליו

NV-Reason-CT מדווח על Macro-F1 של 0.614 ו-Macro-AUROC של 0.871 במשימת סיווג 18 התוויות של CT-RATE, תוך שימוש בפרומפט ישיר של כן/לא, ללא ראש סיווג וללא התאמה ספציפית למשימה. אלה המספרים של המחברים עצמם מכרטיס המודל, ושורת ההשוואה היא החלק השימושי: VoxelFM עם 0.581 Macro-F1, ‏Pillar-0 עם 0.544, ‏ClinFusion-8B עם 0.442, ‏CT-CLIP עם 0.398, ‏Merlin עם 0.358, ‏MedGemma 1.5 עם 0.303. על אותו סף אחיד קבוע, מודל 3D גנרטיבי גובר על בסיסי הפרה-טריינינג הקונטרסטיביים התלת-ממדיים ועל מודל החזית מבוסס הפרוסות.

מספר אחד בטבלה ההיא ראוי לספקנות ולא לחזרה: פער ה-AUROC. NV-Reason-CT מדווח 0.871 לעומת 0.870 של VoxelFM. אלפית נקודה, בהערכה שמנוהלת בידי ספק, אינה ניצחון — היא תיקו בתוך כל רעש שההערכה נושאת. פער ה-Macro-F1 של 0.033 הוא הטענה המבוססת.

ל-GPT-5.6 Sol אין מספר CT-RATE, מפני ש-CT-RATE אינו בנצ'מרק שאפשר להריץ עליו את המודל. יש לו Artificial Analysis Intelligence Index של 47, ציון GPQA Diamond שנמדד ב-AA של 94.1, וציון Humanity's Last Exam של 49.5 — כולם מכשירי הסקה כלליים. הצבת 0.614 Macro-F1 לצד 47 במדד AA תהיה חשבון בשני סרגלים שונים. אני לא אעשה זאת, ואתה צריך לחשוד בכל מי שכן עושה זאת.

עקבות הסקה, שני מוצרים שונים

שני המודלים מפיקים הנמקה. זו החפיפה הפילוסופית האמיתית היחידה, וההבדל מלמד.

GPT-5.6 Sol חושף מאמץ חשיבה הניתן להגדרה, כך שאתה מאזן בין השהיה ועלות לבין העומק בכל בקשה, ותוכל לבקש את החשיבה בחזרה דרך include_reasoning. זוהי יכולת כללית שמוחלת על כל מה שתשלח לה.

ההיסק של NV-Reason-CT הוא צר במכוון. קורפוס האימון כולל בערך 550,000 דוגמאות QA מובנות שנלקחו מ-70,111 נפחי CT ייחודיים, וחלק ממנו הוא היסק שנכתב על ידי רדיולוגים שנאסף מפרשנויות מומחים שהוקלטו ותומללו. שלב ה-GRPO שאחרי SFT משתמש בתגמולים ניתנים לאימות על פני קבוצות של ממצאים חריגים בחזה ובבטן — כלומר, אות התגמול מבוסס על האם ממצא מוצהר באמת קיים בנפח, ולא על האם הפרוזה נקראת היטב. כרטיס המודל מתאר את הפלט כ"תצפיות הניתנות לבדיקה, אבחנות מבדלות, ואי-ודאות", והוא נושא אזהרה מפורשת שהיסק שנוצר "אינו מובטח לייצג את החישוב הפנימי של המודל". האזהרה הזו עושה עבודה אמיתית. זה ההבדל בין עקבה שניתן לבדוק מול הנתונים לבין עקבה שרק ניתן להעריץ.

הגודל והרישיון, במעבר אחד

• פרמטרים — NV-Reason-CT 4.69B סך הכל / 4.35B פעילים במסלול CT, מבסיס Qwen3.5-4B בתוספת Primus 3D ViT לעומת GPT-5.6 Sol לא פורסם • גודל צ'קפוינט — NV-Reason-CT ~10.6 GB BF16 safetensors, פועל על Ampere/Hopper/Lovelace לעומת GPT-5.6 Sol API בלבד • קלט — נפחי CT תלת-ממדיים בפורמט NIfTI ביחידות Hounsfield לעומת טקסט, תמונה, קובץ • הקשר — NV-Reason-CT לא רלוונטי, נפח אחד הוא קידומת קבועה של 13,824 טוקנים לעומת Sol 1,050,000 טוקנים בקלט, 128,000 בפלט • רישיון — OpenMDW-1.1, משקלים להורדה לעומת קנייני, גישה ל-API בלבד • זמינות — מאגר הספק והמשקלים שלו לעומת מנותב ב-OrcaRouter במחיר $4.00 / $20.00 למיליון, כאשר התעריף של Sol מעל 272K טוקני קלט מוכפל ל-$8.00 / $30.00

A generated scoreboard titled 'NV-Reason-CT vs GPT-5.6 Sol - the scoreboard'. Left column 'NV-Reason-CT': Input 3D NIfTI CT, chest or abdomen; Volume prefix 13,824 tokens, fixed; Parameters 4.69B total / 4.35B active; CT-RATE Macro-F1 0.614 (vendor-reported); Licence OpenMDW-1.1, weights published; Price GPU capex, no per-token rate. Right column 'GPT-5.6 Sol': Input text, image, file; Context / output 1,050,000 in / 128,000 out; Parameters undisclosed; CT-RATE Macro-F1 not applicable; Licence proprietary, API only; Price $4.00 / $20.00 per M. A footer reads 'NV-Reason-CT figures are the authors' own and unreproduced; GPT-5.6 Sol pricing per OpenAI's rate card as routed by OrcaRouter.'

מה שהפיצול באמת עולה לך

השוואת עלויות הופכת להגיונית רק כשמקבלים שעומסי העבודה שונים, ולכן הנה הגרסה שכן הגיונית.

עבור Sol החיוב הוא לפי טוקן, ולמחיר שלה יש צוק: $4.00 למיליון טוקני קלט ו-$20.00 למיליון טוקני פלט עד 272K טוקנים של פרומפט, ואחר כך $8.00 ו-$30.00. ב-OrcaRouter היא מוצעת במחיר המחירון של OpenAI עצמה, עם אפס תוספת, וזה חשוב יותר ממה שזה נשמע — התעריף שאתם רואים הוא התעריף ש-OpenAI מפרסמת, כך שכל שינוי מחיר מגיע לחשבון שלכם באותו יום ולא בחידוש החוזה הבא. תעריף קריאת המטמון שלה הוא $0.40 למיליון, עשירית מהקלט, וזה מה שמאפשר ללולאות אג'נטיות ארוכות עם קידומת קבועה גדולה לשרוד מבחינה אריתמטית.

ל-NV-Reason-CT אין בכלל מחיר לפי טוקן. אתם מורידים 10.6 GB ומשלמים על ה-GPU. זו שאלה של הוצאות הון מול הוצאות תפעול, ויש לה רק תשובה אחת: בהיקף גבוה מספיק, אירוח עצמי של מודל עם 4.35B פרמטרים פעילים מנצח מבחינת עלות. מתחת להיקף הזה הוא לא מנצח, ונקודת ההצטלבות תלויה כולה בניצולת ה-GPU שלכם. אף אחד מחוץ ל-NVIDIA עוד לא פרסם נתון תפוקה עבור הצ'ק-פוינט הזה, אז כל מי שמצטט לכם נקודת הצטלבות מנחש.

A screenshot of NVIDIA's Hugging Face model page for NV-Reason-CT, showing the model card header with Like 1 and 0 followers, the Image-Text-to-Text and Transformers and Safetensors tags, the qwen3_5, medical-imaging, ct, 3d-vlm and custom_code tags, 'Downloads last month 210', the 5B-parameter BF16 size row, the model description describing the 384x384x384-mm volume becoming a 24x24x24 grid of 13,824 visual tokens with no spatial downsampling, the training paragraph citing roughly 550,000 structured QA examples from 70,111 unique CT volumes, a side panel showing Base model Qwen/Qwen3.5-4B and the CT-RATE and CancerVerse datasets, and the arXiv 2609.27511 paper link.

מה שנתב כן עוזר בו כאן הוא החלק בתהליך העבודה שאינו הסריקה. צינור מחקר קליני בסביבת ייצור הוא לעיתים רחוקות מודל אחד — הוא חילוץ, שלב הסקה, שלב סיכום, לפעמים חוות דעת שנייה. OrcaRouter חושף למעלה מ-200 מודלים מאחורי נקודת קצה אחת תואמת OpenAI עם מעבר אוטומטי בין ספקים בעת כשל, כך שהחצי הרב-תכליתי של אותו צינור יכול להיות מוחלף או מנותב מחדש בלי חוזה נוסף. NV-Reason-CT אינו אחד מהמודלים שאנו מנתבים; זהו צ'קפוינט שאתה מריץ בעצמך. שני חצאי הצינור יכולים עדיין להימצא מאחורי מפתח אחד.

A screenshot of the OrcaRouter model page for GPT-5.6 Sol, showing the identifier openai/gpt-5.6-sol, input text + image + file, output text, the Vision, Tools, JSON and Reasoning badges, a 1,050,000-token context window with 128K maximum output, the description of it as the flagship of OpenAI's GPT-5.6 series, OpenAI-compatible code samples pointing at https://api.orcarouter.ai/v1, and a pricing strip reading $4.00 per million input tokens and $20.00 per million output tokens with a p50 time to first token of 10.00 s.

השאלה הפתוחה

NV-Reason-CT הוא בן יומיים כמאמר ובן שבעה עשר ימים כמאגר קוד, והתחום שאליו הוא משתייך קטן מספיק כך שנקודת הנתונים הבאה תהיה אינפורמטיבית. שימו לב לשלושה דברים: שחזור עצמאי של CT-RATE, צ'קפוינט שני במשפחה, וכל סימן לכך שקבוצת הרפואה של NVIDIA מתייחסת לזה כקו ולא כמאמר. עד אז, העמדה הניתנת להגנה היא צרה וברורה — זהו צ'קפוינט הסקת ה-CT התלת-ממדי הנייטיבי החזק ביותר שניתן להוריד כיום, לפי הטבלה של המחברים עצמם, והוא אינו תחליף למודל חזית כללי בשום תחום מלבד פיענוח CT.