بطاقة رئيسية مُولّدة بعنوان 'NV-Reason-CT مقابل DeepSeek V4 Pro' وعنوان فرعي 'تكلفة قراءة فحص، ومتى تُشغّل الدفعة'. تفصل بين بطاقتين متواجهتين زوج من الأسهم الزرقاء: البطاقة اليسرى موسومة 'NV-Reason-CT' مع أيقونة مسح للجسم و'حجم CT واحد - 13,824 رمزًا مرئيًا - لا توجد إنتاجية منشورة'؛ والبطاقة اليمنى موسومة 'DeepSeek V4 Pro' مع أيقونة شريحة و'1.6T إجمالي / 49B نشط MoE - سياق 1M - $0.66 / $1.98 لكل مليون، تتضاعف في نافذتين بتوقيت UTC'. شعار OrcaRouter مركّب في الزاوية السفلية اليمنى.
Guides & Insights

NV-Reason-CT مقابل DeepSeek V4 Pro: تكلفة قراءة مسح، ومتى يجب تشغيل الدفعة

الكاتب

Magnus Corvin

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج →
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

إليك حقيقة تشغيلية تؤثر في ميزانيات خطوط الأنابيب السريرية أكثر من أي معيار مرجعي: DeepSeek V4 Pro يكلّف 0.66 دولار لكل مليون رمز إدخال و1.98 دولار لكل مليون رمز إخراج، وتتضاعف هذه الأسعار خلال نافذتين كل يوم، من 01:00 إلى 04:00 ومن 06:00 إلى 10:00 بتوقيت UTC. العمل بالدفعات الذي يُشغَّل خارج هاتين النافذتين يكلّف نصف ما يكلّفه داخل هاتين النافذتين. وفي المقابل NV-Reason-CT، وهو نموذج استدلال التصوير المقطعي ثلاثي الأبعاد من NVIDIA ذو 4.69 مليار معلمة، ليس له أي بطاقة أسعار على الإطلاق — فهو مجموعة أوزان تقوم بتنزيلها وتشغيلها، ومن دون رقم منشور لمعدل الإنتاجية لدراسة واحدة بحجم 13,824 رمزًا. أحد هذين النموذجين تقوم بجدولته. أما الآخر فعليك قياسه قبل أن تتمكن من وضع ميزانية له.

هذا التباين هو المدخل المفيد إلى هذه المقارنة، لأن النموذجين يحتلّان طرفَي خط المعالجة المتقابلين ويفشلان ماليًا بطرق متعاكسة. NV-Reason-CT أداة بتكلفة ثابتة: تكلفة الدراسة الحدّية تكاد تكون مجانية بمجرد شراء العتاد، لكن قرار العتاد كبير، وزمن الاستجابة لكل دراسة غير موثّق. DeepSeek V4 Pro محرّك بتكلفة متغيّرة: لا شيء يُشترى، وكل شيء يُقاس بالعدّاد، وللعدّاد جدول يمكنك قراءته من التقويم.

ما هو كل واحد منها، في سطر واحد لكل منها

• الوظيفة — يقرأ NV-Reason-CT حجم تصوير مقطعي محوسب للصدر أو البطن ويصدر نتائج مُهيكلة؛ ويقرأ DeepSeek V4 Pro النص ويكتبه

• البنية — محوّل رؤية ثلاثي الأبعاد يُسمى Primus، مهيّأ من COLIPRI، مع عمود فقري لغوي Qwen3.5-4B وتضمين موضعي دوّار ثلاثي الأبعاد متعدد المحاور، بـ4.69 مليار معامل منها 4.35 مليار نشطة؛ مقابل مزيج من الخبراء بـ1.6 تريليون معامل مع 49 مليارًا نشطة لكل رمز

• الإدخال — أحجام NIfTI أحادية القناة (.nii, .nii.gz) بوحدات هاونسفيلد، موجّهة وفق LPS، أُعيد أخذ عيناتها إلى 2 مم متساوي القياس ومقصوصة على التشريح؛ مقابل النص

• السياق — يتحول حجم واحد إلى 13,824 رمزًا مرئيًا في شبكة 24 × 24 × 24، دون أي تقليل عينات مكاني ودون طبقة دمج؛ مقابل 1,048,576 رمزًا داخلًا و384,000 رمزًا خارجًا

• المناطق التشريحية المدعومة — الصدر والبطن، ولا شيء غيرهما؛ مقابل كل ما يمكن للنص وصفه

• السعر — لا يوجد سعر قائمة، استضافة ذاتية، لا توجد إنتاجية منشورة لكل دراسة؛ مقابل $0.66 / $1.98 لكل مليون رمز، مع تضاعف في نافذتي التوقيت العالمي المنسق المذكورتين أعلاه، مع قراءات ذاكرة التخزين المؤقت عند $0.022

• زمن الاستجابة المقاس — غير منشور؛ مقارنةً بوسيط زمن الوصول إلى أول رمز البالغ 3,483 مللي ثانية عند 96.01 رمز إخراج في الثانية، مع معدل خطأ 0.75%

هناك صفّان يستحقّان أكثر من سطر واحد لكلٍّ منهما. صفّ السياق هو الواضح — مليون توكن مقابل 13,824 — لكن الوحدتين غير قابلتين للمقارنة، ومن الخطأ قراءتهما على أنهما فجوة في القدرات في أيٍّ من الاتجاهين. 13,824 توكن هو ما يتطلّبه تمثيل دراسة CT واحدة بأمانة. أما مليون توكن فهو مقدار النص المحيط الذي يمكنك الاحتفاظ به. الرقم الأول بيان عن الدقة؛ والثاني بيان عن الذاكرة.

صف الكمون هو الصف الذي يُتخطّى. إن وسيط زمن الوصول إلى أول رمز لدى DeepSeek V4 Pro البالغ 3.48 ثانية، وسرعته 96 رمزًا في الثانية، رقمان مقاسان ومنشوران، وهما يتيحان لك تقدير حجم مهمة نصية على الورق. غياب أي رقم مكافئ لدى NV-Reason-CT ليس انتقادًا للنموذج؛ بل هو السبب في أنه لا يمكن تقدير تكلفة خط أنابيب CT قبل أن يشغّله أحد. إن نموذجًا بحجم 4.69B يتعامل مع 13,824 رمزًا مرئيًا ليس عملية حسابية صغيرة، وإلى أن تقيس زمنه على عتادك الخاص فأنت تخمّن.

قراءة سجلي الأداء المعياريين دون أن تخدع نفسك

سجل DeepSeek V4 Pro مزيج من القياس المستقل وتقارير المورّد، وهذا المزيج مفيد للعِبرة لأنه يحتوي على رقم واحد يبدو مقلقًا لكنه ليس كذلك.

• مؤشر التحليل الاصطناعي للذكاء — 36، وهو يقع عند المئين 72.4 من النماذج المقاسة

• GPQA Diamond — 92.8، وهو قريب من قمة هذا المجال

• الاختبار الأخير للبشرية — 41، و41 في MMLU-Pro، و62.51 في مؤشر الرياضيات

• τ²-Bench — 96.20، مع IFBench عند 76.46 وtau_banking عند 39.59

• استدعاء السياق الطويل — 80.33

• SciCode وTerminal-Bench — ‏51 و78.65 في الإصدار الثاني من Terminal-Bench

مؤشر مركّب عند 36 بجانب درجة GPQA Diamond تبلغ 92.8 يبدو وكأنه تناقض حتى تدرك ما هو المؤشر. إنه تجميع عبر العديد من التقييمات، والنموذج الذي يتفوق في حفنة منها ويكون مقبولًا فحسب في أخرى سيحل في منتصف المجال عند المجموع بينما يتصدر لوحات فردية. من يستشهد بالرقم 36 وحده ليجادل بأن DeepSeek V4 Pro من الطبقة المتوسطة إنما يستشهد بمتوسط كأنه حد أقصى. ومن يستشهد بالرقم 92.8 وحده ليجادل بأنه يتصدر المجال إنما يستشهد بحد أقصى كأنه متوسط. كلا الرقمين من Artificial Analysis، وكلاهما صحيح.

سجل NV-Reason-CT لا يحتوي على مثل هذا المزيج، وهذه هي المشكلة الصريحة فيه. فأرقامه على CT-RATE — 0.614 F1 و0.871 AUROC عبر ثمانية عشر تسمية، باستخدام عتبة موحّدة ثابتة ومطالبة مباشرة بنعم/لا دون رأس تصنيف ودون تكييف خاص بالمهمة — مصدرها ورقة NVIDIA نفسها ولا مكان آخر. أما مجموعة المقارنة في تلك الورقة (VoxelFM عند 0.581، وPillar-0 عند 0.544، وClinFusion-8B عند 0.442، وCT-CLIP عند 0.398، وMerlin عند 0.358، وMedGemma 1.5 عند 0.303) فهي بالكامل نماذج تصوير أخرى. ولا يظهر فيها نموذج نصي عام واحد، ولم يُعِد أي طرف ثالث إنتاج أيٍّ من هذه الأرقام.

A generated scoreboard titled 'Two records, two kinds of provenance' with two columns. The left column, headed 'NV-Reason-CT', lists five rows: CT-RATE F1 0.614 and AUROC 0.871; provenance, the authors paper only; reproduced, no; throughput, not published; price, self-hosted, no rate card. The right column, headed 'DeepSeek V4 Pro', lists five rows: AA Intelligence 36, GPQA Diamond 92.8, tau-squared Bench 96.20; provenance, Artificial Analysis plus vendor; reproduced, yes, independently measured; throughput, 3,483 ms to first token at 96 tokens per second; price, $0.66 and $1.98 per million tokens. A footer reads 'An index of 36 beside a benchmark of 92.8 is an average beside a maximum, not a contradiction.'

مسألة الجدولة، مشروحة خطوة بخطوة

يُعدّ التسعير الزمني على {{1}}DeepSeek V4 Pro{{/1}} الأمر الأكثر قابلية للتنفيذ العملي فيما يتعلق بأي من النموذجين، لذا فهو يستحق عرضاً تفصيلياً ملموساً.

عبء العمل النصي الواقعي في برنامج CT ليس لامعًا. إنه يتمثل في استخراج حقول مهيكلة من مدونة تقارير تاريخية لتكون لديك تسميات تدرّب عليها، وتحويل أشجار أدلة DICOM إلى NIfTI على نطاق واسع، وكتابة أداة التقييم وإعادة كتابتها، وتوحيد الوحدات والمصطلحات عبر أربع مجموعات بيانات، وتلخيص المجموعات. لنقل إنها مئة مليون رمز إدخال وعشرة ملايين رمز إخراج لبرنامج متوسط الحجم، وهو رقم مستدير عمدًا يُستخدم للإشارة إلى «الكثير من العمل النصي».

• داخل نافذة مضاعفة — ‏$1.32 و‏$3.96 لكل مليون، أي ‏$132 زائد ‏$39.60 على تلك الأحجام

• خارج تلك النوافذ — 0.66 دولار و1.98 دولار لكل مليون، أي 66 دولارًا بالإضافة إلى 19.80 دولار

• الفرق — نحو 86 دولارًا، أو 49% من فاتورة خارج أوقات الذروة، مقابل نقل مهمة قابلة للمعالجة على دفعات بطبيعتها

• قراءات مخزّنة مؤقتًا — 0.022 دولار لكل مليون، أي سُدس سعر الإدخال، لذا فإن أي بادئة طلب تعيد استخدامها عبر مجموعة النصوص تكون شبه مجانية

هذا ليس خطأ تقريب، وهو متاح لأن العمل غير متزامن. لا يحتاج استخراج التقارير إلى الحدوث في الساعة 14:00. لا يهم أي شيء في مهمة تحويل DICOM ما هو الوقت. هيكل التسعير هو دعوة مباشرة للجدولة، وخط الأنابيب الذي يتجاهله يدفع علاوة 49% مقابل امتياز التشغيل عندما يحلو له. قراءات الذاكرة المؤقتة مهمة للسبب نفسه: موجه نظام مشترك أو مخطط استخراج ثابت، يعاد استخدامه عبر آلاف التقارير، يقع عند واحد على ستين من سعر الإدخال.

إن NV-Reason-CT لا يملك رافعة مكافئة، لأنه لا يملك عدّادًا. تكلفة قراءة مسح هي ما تكلفه وحدة معالجة الرسومات لديك في الساعة مقسومًا على عدد المسحات في الساعة التي يمكنك تمريرها عبرها، والرقم الثاني هو الذي لم ينشره أحد. إذا استغرقت دراسة واحدة ثانيتين، فإن بطاقة L40S واحدة تتعامل مع برنامج كبير بارتياح. وإذا استغرقت عشرين، تتغير حسابات العتاد بالكامل. اختبرت NVIDIA على H100 وL40S، وهذا يخبرك بفئة البطاقة، لا بمعدلها.

الفخ في افتراض أنه يمكن استبدالهم

الخطأ الذي تدعو إليه هذه المواجهة أكثر خفاءً من خطأ التصنيف المعتاد، لأن هناك نسخة منه تبدو معقولة على شريحة عرض.

يستوعب DeepSeek V4 Pro 1,048,576 رمزًا، ويولّد ما يصل إلى 384,000 رمز. وحجم CT واحد، بحسب تقدير النموذج الذي يقرأه قراءةً صحيحة، ليس سوى 13,824 رمزًا. لذا فإن نموذجًا نصيًا بنافذة تبلغ مليون رمز لديه متسع لنحو سبعين دراسة CT عند هذا العدد من الرموز. الحساب صحيح، لكن الاستنتاج — أنه يمكنك تغذية بيانات CT إلى نموذج نصي وتستغني عن البنية التحتية للتصوير — خاطئ، للسبب الذي وُجد رقم 13,824 من أجله أصلًا.

ذلك الرقم ليس ملخّصًا مضغوطًا لمسح. إنه المسح نفسه، بدقة متناحية تبلغ 2 مم على مكعب طوله 384 مليمترًا، مقطّعًا إلى رقع بتوزيع 8 × 8 × 8، ومسلّمًا إلى النموذج اللغوي دون تخفيض مكاني للعيّنات ودون طبقة دمج. عدد الرموز مرتفع تحديدًا لأنه لم يُطرح شيء: التباعد بين الشرائح الذي يجعل العقدة قابلة للقياس، وقيم الكثافة التي تجعل النسيج عتبة لا صفة. لا يستطيع نموذج نصي أن يستوعب تلك الرموز كأحجام، كما لا تستطيع وثيقة ذلك. لديه الميزانية. لكنه لا يملك الواجهة.

تضع المقارنة الداخلية للورقة البحثية نفسها رقمًا على الفرق. عند إعطاء MedGemma 1.5 ما يصل إلى 85 شريحة محورية — وهو أفضل ما يمكن لواجهة أمامية ثنائية الأبعاد أو مكدّسة الشرائح أن تفعله بشكل معقول — يسجل 0.303 F1 مقابل 0.614 للنموذج الحجمي الأصلي. تمثل هذه الفجوة قيمة المُرمِّز ثلاثي الأبعاد، ولا تغلقها أي كمية من نافذة السياق.

يفشل الاستبدال العكسي لأسباب أوضح. يدعم NV-Reason-CT الصدر والبطن، ويتلقى ملف NIfTI بدلًا من مُوجّه نصي، ولا يدعم استخدام الأدوات، كما تقصر بطاقة النموذج استخدامه على البحث والتعليم، وتذكر أنه ليس جهازًا طبيًا وأن المخرجات قد تكون غير صحيحة. وهو لا يستطيع استخراج الحقول من تقرير، ولا يستطيع كتابة السكربت الذي يبني مجموعة نصوصك.

A generated scoreboard titled 'Where the money actually goes' listing five rows for a worked example of 100 million input and 10 million output tokens on DeepSeek V4 Pro. Row one: inside the doubled UTC windows, $132 input and $39.60 output. Row two: outside those windows, $66 input and $19.80 output. Row three: difference, about $86, or 49% of the off-peak bill. Row four: cached reads, $0.022 per million, a sixtieth of the input rate. Row five: the CT side, self-hosted with no published per-study throughput, so the cost per scan has to be measured. A footer reads 'Pricing per the provider rate card; the CT column has no rate card to quote.'

أين نندرج، وأين لا نندرج عمدًا

يتم تقديم DeepSeek V4 Pro عبر OrcaRouter باسم deepseek/deepseek-v4-pro، بسعر قائمة المزوّد دون أي هامش ربح، داخل واجهة API واحدة تغطي أكثر من 200 نموذج. وتكتسب آلية تمرير السعر هذه أهمية أكبر من المعتاد بالنسبة لنموذج يتغيّر سعره حسب الوقت من اليوم: عندما يغيّر مورّد ما سعرًا أو نافذة زمنية، يتغيّر السعر من جانبنا في اليوم نفسه، لأنه لا توجد طبقة هامش ربح في الوسط تحتفظ برقم قديم. تغطي تجاوز الفشل التلقائي الحالة التي يتدهور فيها مزوّد في منتصف دفعة، وهي بالنسبة لمهمة استخراج طويلة دون إشراف نمط الفشل الذي يكلفك ليلة كاملة فعلاً، وتتيح لك لغة DSL للتوجيه إرسال الطلبات الفردية إلى النموذج الذي ينبغي أن يتولاها بدلاً من تمرير كل شيء عبر نقطة نهاية واحدة.

NV-Reason-CT ليس على منصتنا. ولا أي نموذج من NVIDIA على منصتنا. الجانب المتعلق بـ CT في هذه البنية هو عتادك الخاص بأوزانك التي حمّلتها بنفسك، ولن نكتب جملة تجعل القارئ يعتقد خلاف ذلك. وبالنظر إلى أن المدخلات بيانات حجمية مستمدة من المرضى، وأن الترخيص هو OpenMDW-1.1 دون أي خدمة مستضافة مرتبطة به، فإن التنفيذ المحلي هو حيث ينتمي ذلك النموذج بصرف النظر عن ذلك.

ما الذي يخبرك به الاقتران في الواقع

النموذجان لا يتنافسان، والهدف من المقارنة بينهما هو أنهما يفشلان بطرق مختلفة. يمنحك NV-Reason-CT قدرة لا يمنحها أي شيء آخر في المجال المفتوح — استدلال أصلي ثلاثي الأبعاد بالتصوير المقطعي المحوسب (CT) بالدقة الكاملة للدراسة — ويطلب منك قبول تكلفة لكل دراسة غير مدرجة في الميزانية، وإنتاجية غير منشورة، وترخيص يحظر الاستخدام السريري. يمنحك DeepSeek V4 Pro محركًا محدود الاستهلاك بزمن استجابة منشور، ومعدل خطأ منشور، وقياسات مستقلة، وسعر يمكنك خفضه إلى النصف بمجرد النظر إلى الساعة، وهو لا يستطيع رؤية أي مسح ضوئي على الإطلاق.

إذا كنت تبني الشيء بدلًا من شرائه، فالشكل الذي يصمد عند التلامس مع الواقع هو الشكل الممل. شغّل قراءة CT محليًا، وحدّد ميزانيتها بالقياس لا بالاقتباس، واجعل كل ما هو نصي حولها في موعد مع نافذة خارج أوقات الذروة. الجدول الوحيد الذي لا ينبغي لأحد أن ينسخه هو ذلك الذي يشغّل مئة مليون رمز من الاستخراج عند 02:00 UTC لأن ذلك هو الوقت الذي صادف أن الدفعة أصبحت جاهزة فيه.

A screenshot of the OrcaRouter model page for DeepSeek V4 Pro, showing the identifier deepseek/deepseek-v4-pro, the description of it as a large mixture-of-experts model with a one-million-token context window, and a side panel listing a 1,048,576-token context window with up to 384,000 output tokens and text input with text output. A stat strip reads $0.66 per million input tokens, $1.98 per million output tokens, a 3.5-second p50 time to first token, and traffic measured in the billions of tokens over seven days.