כרטיס הירו שנוצר שכותרתו "NV-Reason-CT vs DeepSeek V4 Pro" וכותרת המשנה שלו "העלות של קריאת סריקה, ומתי להריץ את הבאצ'". שני כרטיסים זה מול זה מופרדים בזוג חצים כחולים: הכרטיס השמאלי מסומן "NV-Reason-CT" עם סמל של סריקת גוף ו"נפח CT אחד - 13,824 טוקנים חזותיים - לא פורסמה תפוקה"; הכרטיס הימני מסומן "DeepSeek V4 Pro" עם סמל שבב ו"1.6T סה"כ / 49B MoE פעיל - הקשר של 1M - $0.66 / $1.98 למיליון, מוכפל בשני חלונות UTC". הלוגו של OrcaRouter משולב בפינה הימנית התחתונה.
Guides & Insights

NV-Reason-CT מול DeepSeek V4 Pro: העלות של קריאת סריקה, ומתי להריץ את האצווה

מחבר

Magnus Corvin

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים →
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

הנה עובדה תפעולית שמעצבת יותר תקציבי צינור קליני מאשר כל מדד ביצועים: DeepSeek V4 Pro עולה $0.66 למיליון טוקני קלט ו-$1.98 למיליון טוקני פלט, והתעריפים האלה מוכפלים בשני חלונות בכל יום, 01:00 עד 04:00 ו-06:00 עד 10:00 UTC. עבודת באצווה שרצה מחוץ לחלונות האלה עולה חצי ממה שהיא עולה בתוכם. בינתיים NV-Reason-CT, מנוע ההסקה ל-CT תלת-ממדי של NVIDIA עם 4.69 מיליארד פרמטרים, אין לו מחירון כלל — הוא סט משקלים שאתם מורידים ומריצים, בלי נתון תפוקה מפורסם עבור בדיקת CT בודדת בת 13,824 טוקנים. אחד מהמודלים האלה אתם מתזמנים. את האחר אתם חייבים למדוד לפני שתוכלו לתקצב אותו.

האסימטריה הזו היא הדרך המועילה אל תוך ההשוואה הזאת, מפני ששני המודלים נמצאים בקצוות מנוגדים של צינור העיבוד ונכשלים בדרכים מנוגדות מבחינה פיננסית. NV-Reason-CT הוא מכשיר בעלות קבועה: המחקר השולי הוא כמעט בחינם ברגע שהחומרה נרכשת, אבל החלטת החומרה גדולה והשהיה לכל מחקר אינה מתועדת. DeepSeek V4 Pro הוא מנוע בעלות משתנה: אין מה לקנות, הכול נמדד, ולמדידה יש לוח זמנים שאפשר לקרוא מן היומן.

מה כל אחד מהם, שורה אחת לכל אחד

• תפקיד — NV-Reason-CT קורא נפח CT של בית החזה או הבטן ומפיק ממצאים מובנים; DeepSeek V4 Pro קורא וכותב טקסט

• ארכיטקטורה — טרנספורמר ראייה תלת-ממדי בשם Primus, מאותחל מ-COLIPRI, עם עמוד שדרה לשוני Qwen3.5-4B והטמעת מיקום סיבובית תלת-ממדית רב-צירית, בגודל 4.69B פרמטרים, מהם 4.35B פעילים; מול תערובת מומחים בת 1.6 טריליון פרמטרים עם 49 מיליארד פעילים לכל טוקן

• קלט — נפחי NIfTI בערוץ אחד (.nii, .nii.gz) ביחידות האונספילד, בעלי כיוון LPS, נדגמו מחדש ל-2 מ"מ איזוטרופי ונחתכו לאנטומיה; מול טקסט

• הקשר — נפח בודד הופך ל-13,824 אסימונים חזותיים ברשת 24 x 24 x 24, ללא דגימה מטה מרחבית וללא שכבת מיזוג; לעומת 1,048,576 אסימונים בקלט ו-384,000 בפלט

• אנטומיות נתמכות — בית החזה והבטן, ותו לא; בניגוד לכל מה שטקסט יכול לתאר

• מחיר — אין מחיר מחירון, אירוח עצמי, ואין נתוני תפוקה מפורסמים לכל מחקר; לעומת $0.66 / $1.98 למיליון טוקנים, תוך הכפלה בשני חלונות ה-UTC הנקובים לעיל, עם קריאות מטמון ב-$0.022

• השהיה מדודה — לא פורסמה; לעומת חציון של 3,483 אלפיות שנייה עד לאסימון הראשון, בקצב של 96.01 אסימוני פלט לשנייה, עם שיעור שגיאות של 0.75%

שתי שורות שם ראויות ליותר משורה אחת כל אחת. שורת ההקשר היא הברורה מאליה — מיליון טוקנים לעומת 13,824 — היחידות אינן ברות השוואה וזו טעות לפרש אותן כפער ביחידות לכאן או לכאן. 13,824 טוקנים הם המחיר של ייצוג נאמן של CT אחד. מיליון טוקנים הוא כמות הטקסט הסובב שאתה יכול להחזיק. המספר הראשון הוא אמירה על רזולוציה; השני הוא אמירה על זיכרון.

שורת ההשהיה היא זו שמדלגים עליה. החציון של 3.48 שניות עד לטוקן הראשון ו-96 טוקנים לשנייה של DeepSeek V4 Pro הם נתונים מדודים ומפורסמים, והם מאפשרים לכם להעריך את היקפה של משימת טקסט על הנייר. היעדרו של נתון מקביל כלשהו אצל NV-Reason-CT אינו ביקורת על המודל; הוא הסיבה שלא ניתן לתמחר פייפליין CT לפני שמישהו מריץ אותו. מודל של 4.69B על פני 13,824 טוקנים חזותיים אינו חישוב קטן, ועד שתמדדו את זמני ההרצה שלו על החומרה שלכם, אתם מנחשים.

לקרוא את שתי רשומות הבנצ'מרק בלי לרמות את עצמך

הרקורד של DeepSeek V4 Pro הוא שילוב של מדידה עצמאית ודיווח ספק, והשילוב הזה מלמד, מפני שהוא מכיל מספר אחד שנראה מדאיג – ושאינו.

• Artificial Analysis Intelligence Index — 36, שנמצא באחוזון ה-72.4 של המודלים שנמדדו

• GPQA Diamond — 92.8, שקרוב לצמרת התחום

• Humanity's Last Exam — 41, ו-41 ב-MMLU-Pro, 62.51 במדד המתמטיקה

• τ²-Bench — 96.20, כאשר IFBench עומד על 76.46 ו-tau_banking על 39.59

• זכירה בהקשר ארוך — 80.33

• SciCode ו-Terminal-Bench — 51 ו-78.65 בגרסה השנייה של Terminal-Bench

מדד מורכב של 36 שלצידו ציון GPQA Diamond של 92.8 נראה כמו סתירה עד שמבינים מהו מדד. הוא צבירה על פני הערכות רבות, ומודל שמצטיין בקומץ מהן ורק סביר באחרות יתמקם באמצע הטבלה בסכום הכולל בעוד שהוא מוביל בלוחות דירוג בודדים. מי שמצטט את ה-36 בלבד כדי לטעון ש-DeepSeek V4 Pro הוא בדרג הביניים מצטט ממוצע כאילו היה מקסימום. מי שמצטט את ה-92.8 בלבד כדי לטעון שהוא מוביל את התחום מצטט מקסימום כאילו היה ממוצע. שני המספרים מקורם ב-Artificial Analysis, ושניהם נכונים.

לרשומה של NV-Reason-CT אין תערובת כזו, וזו הבעיה הכנה איתו. נתוני ה-CT-RATE שלו — 0.614 F1 ו-0.871 AUROC על פני שמונה עשרה תוויות, תוך שימוש בסף אחיד קבוע ובפרומפט ישיר של כן/לא ללא ראש סיווג וללא התאמה ספציפית למשימה — מגיעים מהמאמר של NVIDIA עצמה ומשום מקום אחר. קבוצת ההשוואה באותו מאמר (VoxelFM ב-0.581, Pillar-0 ב-0.544, ClinFusion-8B ב-0.442, CT-CLIP ב-0.398, Merlin ב-0.358, MedGemma 1.5 ב-0.303) מורכבת כולה ממודלי הדמיה אחרים. אף לא מודל טקסט כללי אחד מופיע בה, ואף צד שלישי לא שחזר ולו אחד מהמספרים.

A generated scoreboard titled 'Two records, two kinds of provenance' with two columns. The left column, headed 'NV-Reason-CT', lists five rows: CT-RATE F1 0.614 and AUROC 0.871; provenance, the authors paper only; reproduced, no; throughput, not published; price, self-hosted, no rate card. The right column, headed 'DeepSeek V4 Pro', lists five rows: AA Intelligence 36, GPQA Diamond 92.8, tau-squared Bench 96.20; provenance, Artificial Analysis plus vendor; reproduced, yes, independently measured; throughput, 3,483 ms to first token at 96 tokens per second; price, $0.66 and $1.98 per million tokens. A footer reads 'An index of 36 beside a benchmark of 92.8 is an average beside a maximum, not a contradiction.'

שאלת התזמון,处理后

התמחור המבוסס על זמן ב-DeepSeek V4 Pro הוא הדבר הישים ביותר מבחינה תפעולית מבין שני המודלים, ולכן הוא ראוי לסקירה מעשית מפורטת.

עומס עבודה ריאלי בצד הטקסט עבור תוכנית CT אינו זוהר. הוא כולל חילוץ שדות מובנים מקורפוס של דוחות היסטוריים, כדי שיהיו לך תוויות שעל פיהן תאמן, המרת עצי תיקיות DICOM ל-NIfTI בהיקף גדול, כתיבה ושכתוב של סביבת ההערכה, נרמול יחידות ומינוח על פני ארבעה מערכי נתונים, וסיכום קוהורטים. נניח מאה מיליון טוקנים בקלט ועשרה מיליון טוקנים בפלט עבור תוכנית בגודל בינוני, וזהו מספר עגול במתכוון שנועד לייצג "המון עבודת טקסט".

• בתוך חלון מוכפל — $1.32 ו-$3.96 למיליון, כלומר $132 ועוד $39.60 בנפחים האלה

• מחוץ לטווחים האלה — $0.66 ו-$1.98 למיליון, כלומר $66 ועוד $19.80

• ההפרש — כ-86 דולרים, או 49% מחשבון שעות השפל, עבור העברת משימה שניתנת מעצם טיבה לביצוע באצווה

• קריאות מהמטמון — $0.022 למיליון, שהם חלק שישים משיעור הקלט, כך שכל קידומת פרומפט שאתם עושים בה שימוש חוזר ברחבי הקורפוס היא כמעט בחינם

זו אינה שגיאת עיגול, והיא זמינה משום שהעבודה אסינכרונית. חילוץ דוחות לא צריך להתרחש בשעה 14:00. לשום דבר במשימת המרת DICOM לא אכפת מה השעה. מבנה התמחור הוא הזמנה ישירה לתזמון, ופייפליין שמתעלם ממנו משלם פרמיה של 49% לשם הזכות לפעול כשבא לו. קריאות מטמון חשובות מאותה סיבה: הנחיית מערכת משותפת או סכימת חילוץ קבועה, שנמצאות בשימוש חוזר על פני אלפי דוחות, עומדות על אחת משישים מתעריף הקלט.

ל-NV-Reason-CT אין מנוף שקול, מפני שאין לו מד. העלות של קריאת סריקה היא מחיר ה-GPU שלך לשעה חלקי מספר הסריקות לשעה שאתה יכול להעביר דרכו, והמספר השני הוא זה שאף אחד לא פרסם. אם בדיקה בודדת אורכת שתי שניות, L40S בודד מתמודד עם תוכנית בנוחות. אם היא אורכת עשרים, האריתמטיקה של החומרה משתנה לחלוטין. NVIDIA בחנה על H100 ו-L40S, מה שמלמד אותך על סוג הכרטיס, לא על הקצב.

המלכודת שבהנחה שאפשר להחליף אותם

הטעות שההתמודדות הזו מזמינה עדינה יותר משגיאת הקטגוריה הרגילה, כי יש לה גרסה שנראית סבירה על שקופית.

DeepSeek V4 Pro מכיל 1,048,576 טוקנים ומפיק עד 384,000. נפח CT הוא, לפי חישובו של המודל שקורא אותו כראוי, רק 13,824 טוקנים. לכן למודל טקסט עם חלון של מיליון טוקנים יש מקום לכשבעים בדיקות CT במספר טוקנים זה. החשבון נכון, והמסקנה — שאפשר להזין נתוני CT למודל טקסט ולחסוך לעצמך את תשתית הדימות — שגויה, מהסיבה שהנתון 13,824 קיים מלכתחילה.

המספר הזה אינו סיכום דחוס של סריקה. זו הסריקה עצמה, ברזולוציה איזוטרופית של 2 מ״מ על פני קובייה של 384 מילימטר, מחולקת ל-8 x 8 x 8 טלאים, ונמסרת למודל השפה בלי דגימת מטה מרחבית ובלי שכבת מיזוג. מספר הטוקנים גבוה בדיוק מפני ששום דבר לא נזרק: המרווח בין הפרוסות שהופך נודולה למדידה, ערכי הצפיפות שהופכים מרקם לסף ולא לשם תואר. מודל טקסט אינו יכול לקלוט את הטוקנים האלה כנפחים, בדיוק כמו שמסמך אינו יכול. יש לו את התקציב. אין לו את הממשק.

ההשוואה הפנימית של המאמר עצמו מכמתת את הפער. MedGemma 1.5, כשהוא מקבל עד 85 חתכים אקסיאליים — הטוב ביותר שרכיב קדמי דו-ממדי או מבוסס ערימת חתכים יכול לעשות באופן סביר — משיג ציון F1 של 0.303 לעומת 0.614 של המודל הנפחי המקורי. הפער הזה הוא הערך של המקודד התלת-ממדי, ושום חלון הקשר, גדול ככל שיהיה, לא סוגר אותו.

ההחלפה ההפוכה נכשלת מסיבות פשוטות יותר. NV-Reason-CT תומך בבית החזה ובבטן, מקבל קובץ NIfTI ולא פרומפט, אין לו שימוש בכלים, וכרטיס המודל שלו מגביל אותו למחקר ולחינוך ומציין שהוא אינו מכשיר רפואי ושהפלטים עלולים להיות שגויים. הוא אינו יכול לחלץ שדות מדוח, והוא אינו יכול לכתוב את הסקריפט שבונה את הקורפוס שלך.

A generated scoreboard titled 'Where the money actually goes' listing five rows for a worked example of 100 million input and 10 million output tokens on DeepSeek V4 Pro. Row one: inside the doubled UTC windows, $132 input and $39.60 output. Row two: outside those windows, $66 input and $19.80 output. Row three: difference, about $86, or 49% of the off-peak bill. Row four: cached reads, $0.022 per million, a sixtieth of the input rate. Row five: the CT side, self-hosted with no published per-study throughput, so the cost per scan has to be measured. A footer reads 'Pricing per the provider rate card; the CT column has no rate card to quote.'

היכן אנחנו משתלבים, והיכן אנחנו בכוונה לא

DeepSeek V4 Pro מוגש דרך OrcaRouter בתור deepseek/deepseek-v4-pro, בתעריף המחירון של הספק ללא תוספת מחיר, בתוך API יחיד שמכסה יותר מ-200 מודלים. ההעברה הישירה חשובה יותר מהרגיל עבור מודל עם תמחור לפי שעות היום: כאשר ספק משנה תעריף או חלון, התעריף אצלנו משתנה באותו יום, מפני שאין שכבת תוספת מחיר באמצע שמחזיקה מספר ישן. מעבר אוטומטי (failover) מכסה את המקרה שבו ספק מתדרדר באמצע אצווה, וזה עבור עבודת חילוץ ארוכה ללא השגחה הוא מצב הכשל שבאמת עולה לך לילה שלם, וה-DSL של הניתוב מאפשר לך לשלוח בקשות בודדות למודל שאמור לטפל בהן במקום להעביר הכול דרך נקודת קצה אחת.

NV-Reason-CT אינו נמצא בפלטפורמה שלנו. גם לא שום מודל של NVIDIA. הצד ה-CT של הארכיטקטורה הזו הוא החומרה שלכם עם המשקולות שהורדתם בעצמכם, ואנחנו לא נכתוב משפט שיאפשר לקורא לחשוב אחרת. לאור העובדה שהקלט הוא נתונים נפחיים שמקורם במטופלים והרישיון הוא OpenMDW-1.1 בלי שירות מתארח כלשהו מצורף, הרצה מקומית היא המקום שאליו שייך המודל הזה ממילא.

מה שהשילוב בעצם מספר לך

שני המודלים אינם מתחרים, והנקודה בהשוואה ביניהם היא שהם נכשלים בדרכים שונות. NV-Reason-CT מעניק לך יכולת שאף דבר אחר בקוד הפתוח אינו מספק — הסקת CT תלת-ממדית נייטיבית ברזולוציה המלאה של הבדיקה — ומבקש ממך להשלים עם עלות לא מתוקצבת לכל בדיקה, תפוקה שלא פורסמה, ורישיון שאוסר פריסה קלינית. DeepSeek V4 Pro מעניק לך מנוע מדוד לפי שימוש עם השהיה שפורסמה, שיעור שגיאות שפורסם, מדידות בלתי תלויות ומחיר שתוכל להפחית בחצי אם תביט בשעון, והוא אינו מסוגל לראות סריקה כלל.

אם אתם בונים את הדבר בעצמכם ולא קונים אותו, הצורה ששורדת מפגש עם המציאות היא המשעממת. הריצו את קריאת ה-CT מקומית, תקצבו אותה לפי מדידה ולא לפי הצעת מחיר, ותאמו את כל מה שטקסטואלי סביבה למפגש עם חלון מחוץ לשעות העומס. לוח הזמנים היחיד שאיש לא צריך להעתיק הוא זה שמריץ מאה מיליון טוקנים של חילוץ בשעה 02:00 UTC, כי אז האצווה במקרה הייתה מוכנה.

A screenshot of the OrcaRouter model page for DeepSeek V4 Pro, showing the identifier deepseek/deepseek-v4-pro, the description of it as a large mixture-of-experts model with a one-million-token context window, and a side panel listing a 1,048,576-token context window with up to 384,000 output tokens and text input with text output. A stat strip reads $0.66 per million input tokens, $1.98 per million output tokens, a 3.5-second p50 time to first token, and traffic measured in the billions of tokens over seven days.