
NV-Reason-CT מול DeepSeek V4 Pro: העלות של קריאת סריקה, ומתי להריץ את האצווה
- typesafeחדשTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 לכל 1M טוקנים · 506 tok/s
- openaiחדשOpenAI: GPT-6 Luna2026-09-2237אינטליגנציה
- openaiחדשOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- anthropicחדשAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- grokחדשGrok 4.72026-09-2146אינטליגנציה
- OrcaחדשOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 לכל 1M טוקנים · 183 tok/s
- orcaחדשOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 1285 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- openaiOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- googleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- anthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 119 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0540אינטליגנציה72כתיבת קוד
הנה עובדה תפעולית שמעצבת יותר תקציבי צינור קליני מאשר כל מדד ביצועים: DeepSeek V4 Pro עולה $0.66 למיליון טוקני קלט ו-$1.98 למיליון טוקני פלט, והתעריפים האלה מוכפלים בשני חלונות בכל יום, 01:00 עד 04:00 ו-06:00 עד 10:00 UTC. עבודת באצווה שרצה מחוץ לחלונות האלה עולה חצי ממה שהיא עולה בתוכם. בינתיים NV-Reason-CT, מנוע ההסקה ל-CT תלת-ממדי של NVIDIA עם 4.69 מיליארד פרמטרים, אין לו מחירון כלל — הוא סט משקלים שאתם מורידים ומריצים, בלי נתון תפוקה מפורסם עבור בדיקת CT בודדת בת 13,824 טוקנים. אחד מהמודלים האלה אתם מתזמנים. את האחר אתם חייבים למדוד לפני שתוכלו לתקצב אותו.
האסימטריה הזו היא הדרך המועילה אל תוך ההשוואה הזאת, מפני ששני המודלים נמצאים בקצוות מנוגדים של צינור העיבוד ונכשלים בדרכים מנוגדות מבחינה פיננסית. NV-Reason-CT הוא מכשיר בעלות קבועה: המחקר השולי הוא כמעט בחינם ברגע שהחומרה נרכשת, אבל החלטת החומרה גדולה והשהיה לכל מחקר אינה מתועדת. DeepSeek V4 Pro הוא מנוע בעלות משתנה: אין מה לקנות, הכול נמדד, ולמדידה יש לוח זמנים שאפשר לקרוא מן היומן.
מה כל אחד מהם, שורה אחת לכל אחד
• תפקיד — NV-Reason-CT קורא נפח CT של בית החזה או הבטן ומפיק ממצאים מובנים; DeepSeek V4 Pro קורא וכותב טקסט
• ארכיטקטורה — טרנספורמר ראייה תלת-ממדי בשם Primus, מאותחל מ-COLIPRI, עם עמוד שדרה לשוני Qwen3.5-4B והטמעת מיקום סיבובית תלת-ממדית רב-צירית, בגודל 4.69B פרמטרים, מהם 4.35B פעילים; מול תערובת מומחים בת 1.6 טריליון פרמטרים עם 49 מיליארד פעילים לכל טוקן
• קלט — נפחי NIfTI בערוץ אחד (.nii, .nii.gz) ביחידות האונספילד, בעלי כיוון LPS, נדגמו מחדש ל-2 מ"מ איזוטרופי ונחתכו לאנטומיה; מול טקסט
• הקשר — נפח בודד הופך ל-13,824 אסימונים חזותיים ברשת 24 x 24 x 24, ללא דגימה מטה מרחבית וללא שכבת מיזוג; לעומת 1,048,576 אסימונים בקלט ו-384,000 בפלט
• אנטומיות נתמכות — בית החזה והבטן, ותו לא; בניגוד לכל מה שטקסט יכול לתאר
• מחיר — אין מחיר מחירון, אירוח עצמי, ואין נתוני תפוקה מפורסמים לכל מחקר; לעומת $0.66 / $1.98 למיליון טוקנים, תוך הכפלה בשני חלונות ה-UTC הנקובים לעיל, עם קריאות מטמון ב-$0.022
• השהיה מדודה — לא פורסמה; לעומת חציון של 3,483 אלפיות שנייה עד לאסימון הראשון, בקצב של 96.01 אסימוני פלט לשנייה, עם שיעור שגיאות של 0.75%
שתי שורות שם ראויות ליותר משורה אחת כל אחת. שורת ההקשר היא הברורה מאליה — מיליון טוקנים לעומת 13,824 — היחידות אינן ברות השוואה וזו טעות לפרש אותן כפער ביחידות לכאן או לכאן. 13,824 טוקנים הם המחיר של ייצוג נאמן של CT אחד. מיליון טוקנים הוא כמות הטקסט הסובב שאתה יכול להחזיק. המספר הראשון הוא אמירה על רזולוציה; השני הוא אמירה על זיכרון.
שורת ההשהיה היא זו שמדלגים עליה. החציון של 3.48 שניות עד לטוקן הראשון ו-96 טוקנים לשנייה של DeepSeek V4 Pro הם נתונים מדודים ומפורסמים, והם מאפשרים לכם להעריך את היקפה של משימת טקסט על הנייר. היעדרו של נתון מקביל כלשהו אצל NV-Reason-CT אינו ביקורת על המודל; הוא הסיבה שלא ניתן לתמחר פייפליין CT לפני שמישהו מריץ אותו. מודל של 4.69B על פני 13,824 טוקנים חזותיים אינו חישוב קטן, ועד שתמדדו את זמני ההרצה שלו על החומרה שלכם, אתם מנחשים.
לקרוא את שתי רשומות הבנצ'מרק בלי לרמות את עצמך
הרקורד של DeepSeek V4 Pro הוא שילוב של מדידה עצמאית ודיווח ספק, והשילוב הזה מלמד, מפני שהוא מכיל מספר אחד שנראה מדאיג – ושאינו.
• Artificial Analysis Intelligence Index — 36, שנמצא באחוזון ה-72.4 של המודלים שנמדדו
• GPQA Diamond — 92.8, שקרוב לצמרת התחום
• Humanity's Last Exam — 41, ו-41 ב-MMLU-Pro, 62.51 במדד המתמטיקה
• τ²-Bench — 96.20, כאשר IFBench עומד על 76.46 ו-tau_banking על 39.59
• זכירה בהקשר ארוך — 80.33
• SciCode ו-Terminal-Bench — 51 ו-78.65 בגרסה השנייה של Terminal-Bench
מדד מורכב של 36 שלצידו ציון GPQA Diamond של 92.8 נראה כמו סתירה עד שמבינים מהו מדד. הוא צבירה על פני הערכות רבות, ומודל שמצטיין בקומץ מהן ורק סביר באחרות יתמקם באמצע הטבלה בסכום הכולל בעוד שהוא מוביל בלוחות דירוג בודדים. מי שמצטט את ה-36 בלבד כדי לטעון ש-DeepSeek V4 Pro הוא בדרג הביניים מצטט ממוצע כאילו היה מקסימום. מי שמצטט את ה-92.8 בלבד כדי לטעון שהוא מוביל את התחום מצטט מקסימום כאילו היה ממוצע. שני המספרים מקורם ב-Artificial Analysis, ושניהם נכונים.
לרשומה של NV-Reason-CT אין תערובת כזו, וזו הבעיה הכנה איתו. נתוני ה-CT-RATE שלו — 0.614 F1 ו-0.871 AUROC על פני שמונה עשרה תוויות, תוך שימוש בסף אחיד קבוע ובפרומפט ישיר של כן/לא ללא ראש סיווג וללא התאמה ספציפית למשימה — מגיעים מהמאמר של NVIDIA עצמה ומשום מקום אחר. קבוצת ההשוואה באותו מאמר (VoxelFM ב-0.581, Pillar-0 ב-0.544, ClinFusion-8B ב-0.442, CT-CLIP ב-0.398, Merlin ב-0.358, MedGemma 1.5 ב-0.303) מורכבת כולה ממודלי הדמיה אחרים. אף לא מודל טקסט כללי אחד מופיע בה, ואף צד שלישי לא שחזר ולו אחד מהמספרים.

שאלת התזמון,处理后
התמחור המבוסס על זמן ב-DeepSeek V4 Pro הוא הדבר הישים ביותר מבחינה תפעולית מבין שני המודלים, ולכן הוא ראוי לסקירה מעשית מפורטת.
עומס עבודה ריאלי בצד הטקסט עבור תוכנית CT אינו זוהר. הוא כולל חילוץ שדות מובנים מקורפוס של דוחות היסטוריים, כדי שיהיו לך תוויות שעל פיהן תאמן, המרת עצי תיקיות DICOM ל-NIfTI בהיקף גדול, כתיבה ושכתוב של סביבת ההערכה, נרמול יחידות ומינוח על פני ארבעה מערכי נתונים, וסיכום קוהורטים. נניח מאה מיליון טוקנים בקלט ועשרה מיליון טוקנים בפלט עבור תוכנית בגודל בינוני, וזהו מספר עגול במתכוון שנועד לייצג "המון עבודת טקסט".
• בתוך חלון מוכפל — $1.32 ו-$3.96 למיליון, כלומר $132 ועוד $39.60 בנפחים האלה
• מחוץ לטווחים האלה — $0.66 ו-$1.98 למיליון, כלומר $66 ועוד $19.80
• ההפרש — כ-86 דולרים, או 49% מחשבון שעות השפל, עבור העברת משימה שניתנת מעצם טיבה לביצוע באצווה
• קריאות מהמטמון — $0.022 למיליון, שהם חלק שישים משיעור הקלט, כך שכל קידומת פרומפט שאתם עושים בה שימוש חוזר ברחבי הקורפוס היא כמעט בחינם
זו אינה שגיאת עיגול, והיא זמינה משום שהעבודה אסינכרונית. חילוץ דוחות לא צריך להתרחש בשעה 14:00. לשום דבר במשימת המרת DICOM לא אכפת מה השעה. מבנה התמחור הוא הזמנה ישירה לתזמון, ופייפליין שמתעלם ממנו משלם פרמיה של 49% לשם הזכות לפעול כשבא לו. קריאות מטמון חשובות מאותה סיבה: הנחיית מערכת משותפת או סכימת חילוץ קבועה, שנמצאות בשימוש חוזר על פני אלפי דוחות, עומדות על אחת משישים מתעריף הקלט.
ל-NV-Reason-CT אין מנוף שקול, מפני שאין לו מד. העלות של קריאת סריקה היא מחיר ה-GPU שלך לשעה חלקי מספר הסריקות לשעה שאתה יכול להעביר דרכו, והמספר השני הוא זה שאף אחד לא פרסם. אם בדיקה בודדת אורכת שתי שניות, L40S בודד מתמודד עם תוכנית בנוחות. אם היא אורכת עשרים, האריתמטיקה של החומרה משתנה לחלוטין. NVIDIA בחנה על H100 ו-L40S, מה שמלמד אותך על סוג הכרטיס, לא על הקצב.
המלכודת שבהנחה שאפשר להחליף אותם
הטעות שההתמודדות הזו מזמינה עדינה יותר משגיאת הקטגוריה הרגילה, כי יש לה גרסה שנראית סבירה על שקופית.
DeepSeek V4 Pro מכיל 1,048,576 טוקנים ומפיק עד 384,000. נפח CT הוא, לפי חישובו של המודל שקורא אותו כראוי, רק 13,824 טוקנים. לכן למודל טקסט עם חלון של מיליון טוקנים יש מקום לכשבעים בדיקות CT במספר טוקנים זה. החשבון נכון, והמסקנה — שאפשר להזין נתוני CT למודל טקסט ולחסוך לעצמך את תשתית הדימות — שגויה, מהסיבה שהנתון 13,824 קיים מלכתחילה.
המספר הזה אינו סיכום דחוס של סריקה. זו הסריקה עצמה, ברזולוציה איזוטרופית של 2 מ״מ על פני קובייה של 384 מילימטר, מחולקת ל-8 x 8 x 8 טלאים, ונמסרת למודל השפה בלי דגימת מטה מרחבית ובלי שכבת מיזוג. מספר הטוקנים גבוה בדיוק מפני ששום דבר לא נזרק: המרווח בין הפרוסות שהופך נודולה למדידה, ערכי הצפיפות שהופכים מרקם לסף ולא לשם תואר. מודל טקסט אינו יכול לקלוט את הטוקנים האלה כנפחים, בדיוק כמו שמסמך אינו יכול. יש לו את התקציב. אין לו את הממשק.
ההשוואה הפנימית של המאמר עצמו מכמתת את הפער. MedGemma 1.5, כשהוא מקבל עד 85 חתכים אקסיאליים — הטוב ביותר שרכיב קדמי דו-ממדי או מבוסס ערימת חתכים יכול לעשות באופן סביר — משיג ציון F1 של 0.303 לעומת 0.614 של המודל הנפחי המקורי. הפער הזה הוא הערך של המקודד התלת-ממדי, ושום חלון הקשר, גדול ככל שיהיה, לא סוגר אותו.
ההחלפה ההפוכה נכשלת מסיבות פשוטות יותר. NV-Reason-CT תומך בבית החזה ובבטן, מקבל קובץ NIfTI ולא פרומפט, אין לו שימוש בכלים, וכרטיס המודל שלו מגביל אותו למחקר ולחינוך ומציין שהוא אינו מכשיר רפואי ושהפלטים עלולים להיות שגויים. הוא אינו יכול לחלץ שדות מדוח, והוא אינו יכול לכתוב את הסקריפט שבונה את הקורפוס שלך.

היכן אנחנו משתלבים, והיכן אנחנו בכוונה לא
DeepSeek V4 Pro מוגש דרך OrcaRouter בתור deepseek/deepseek-v4-pro, בתעריף המחירון של הספק ללא תוספת מחיר, בתוך API יחיד שמכסה יותר מ-200 מודלים. ההעברה הישירה חשובה יותר מהרגיל עבור מודל עם תמחור לפי שעות היום: כאשר ספק משנה תעריף או חלון, התעריף אצלנו משתנה באותו יום, מפני שאין שכבת תוספת מחיר באמצע שמחזיקה מספר ישן. מעבר אוטומטי (failover) מכסה את המקרה שבו ספק מתדרדר באמצע אצווה, וזה עבור עבודת חילוץ ארוכה ללא השגחה הוא מצב הכשל שבאמת עולה לך לילה שלם, וה-DSL של הניתוב מאפשר לך לשלוח בקשות בודדות למודל שאמור לטפל בהן במקום להעביר הכול דרך נקודת קצה אחת.
NV-Reason-CT אינו נמצא בפלטפורמה שלנו. גם לא שום מודל של NVIDIA. הצד ה-CT של הארכיטקטורה הזו הוא החומרה שלכם עם המשקולות שהורדתם בעצמכם, ואנחנו לא נכתוב משפט שיאפשר לקורא לחשוב אחרת. לאור העובדה שהקלט הוא נתונים נפחיים שמקורם במטופלים והרישיון הוא OpenMDW-1.1 בלי שירות מתארח כלשהו מצורף, הרצה מקומית היא המקום שאליו שייך המודל הזה ממילא.
מה שהשילוב בעצם מספר לך
שני המודלים אינם מתחרים, והנקודה בהשוואה ביניהם היא שהם נכשלים בדרכים שונות. NV-Reason-CT מעניק לך יכולת שאף דבר אחר בקוד הפתוח אינו מספק — הסקת CT תלת-ממדית נייטיבית ברזולוציה המלאה של הבדיקה — ומבקש ממך להשלים עם עלות לא מתוקצבת לכל בדיקה, תפוקה שלא פורסמה, ורישיון שאוסר פריסה קלינית. DeepSeek V4 Pro מעניק לך מנוע מדוד לפי שימוש עם השהיה שפורסמה, שיעור שגיאות שפורסם, מדידות בלתי תלויות ומחיר שתוכל להפחית בחצי אם תביט בשעון, והוא אינו מסוגל לראות סריקה כלל.
אם אתם בונים את הדבר בעצמכם ולא קונים אותו, הצורה ששורדת מפגש עם המציאות היא המשעממת. הריצו את קריאת ה-CT מקומית, תקצבו אותה לפי מדידה ולא לפי הצעת מחיר, ותאמו את כל מה שטקסטואלי סביבה למפגש עם חלון מחוץ לשעות העומס. לוח הזמנים היחיד שאיש לא צריך להעתיק הוא זה שמריץ מאה מיליון טוקנים של חילוץ בשעה 02:00 UTC, כי אז האצווה במקרה הייתה מוכנה.

