
NV-Reason-CT مقابل Claude Opus 5: خطأ فئوي يستحق أن يُؤخذ على محمل الجد
- typesafeجديدTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 لكل مليون رمز · 506 tok/s
- openaiجديدOpenAI: GPT-6 Luna2026-09-2237الذكاء
- openaiجديدOpenAI: GPT-6 Sol2026-09-2248الذكاء
- anthropicجديدAnthropic: Claude Opus 5.52026-09-2258الذكاء
- grokجديدGrok 4.72026-09-2146الذكاء
- OrcaجديدOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 لكل مليون رمز · 183 tok/s
- orcaجديدOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 لكل مليون رمز · 1285 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- openaiOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- googleGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245الذكاء76البرمجة
- anthropicAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز · 119 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 لكل مليون رمز · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236الذكاء69البرمجة
- grokSpaceXAI: Grok 4.62026-08-1244الذكاء77البرمجة
- metaMeta: Muse Spark 1.22026-08-0540الذكاء72البرمجة
وضع NV-Reason-CT وClaude Opus 5 في الجملة نفسها خطأ في التصنيف، لكنه جدير بالارتكاب على أي حال، لأن الخطأ مفيد. NV-Reason-CT نموذج أصلي للرؤية واللغة ثلاثي الأبعاد يضم 4.69 مليار معامل، من إنفيديا، يتلقى حجمًا من الأشعة المقطعية للصدر أو البطن بوحدات هاونسفيلد وينتج تقريرًا منظمًا نتيجةً بنتيجة. وهو ليس جهازًا طبيًا، وبطاقة النموذج الخاصة به تقول ذلك. أما Claude Opus 5 فهو نموذج النصوص والرؤية العام الرائد لدى مورده، وقد صدر في 24 يوليو 2026، بنافذة سياق تبلغ مليون رمز، وسقف إخراج يبلغ 128,000 رمز، وسعر معلن قدره خمسة دولارات لكل مليون رمز إدخال وخمسة وعشرون دولارًا لكل مليون رمز إخراج. أحد هذين يقرأ أشعة مقطعية. والآخر يقرأ كل شيء آخر.
السبب في أن المقارنة تظل تُعقد — وستظل تُعقد في كل مرة يرى فيها أحدهم نموذج VLM طبيًا جديدًا ويمدّ يده إلى مقياس مألوف — هو أن كليهما ينتج نثرًا عن صورة. هذا التشابه السطحي يُلحق ضررًا حقيقيًا بطريقة تفكير الناس في الاثنين، لذا يجدر تفكيكه بالتفصيل.
المحور الفعلي الذي يشتركون فيه، والمحور الذي لا يشتركون فيه
يتداخلان في موضع واحد بالضبط، وهو أضيق مما يبدو.
• الوسيلة المُدخَلة — يستقبل NV-Reason-CT مجسّمات NIfTI أحادية القناة بوحدات هاونسفيلد عبر معالج ثلاثي الأبعاد مخصّص؛ أما Claude Opus 5 فيستقبل النصوص والصور والملفات، وهي واجهة من الجيل الثاني للصور ولا تستطيع بشكل أصلي استيعاب فحص تصوير مقطعي محوسب حجمي.
• ما الذي يعود — قائمة نتائج منظَّمة حسب المنطقة التشريحية من NV-Reason-CT، مقابل نثر عام، أو JSON منظَّم، أو استدعاءات أدوات من Claude Opus 5
• وحدات العمل — حجم تصوير مقطعي محوسب واحد، يُعاد أخذ عينات منه إلى 2 مم متساوي الخواص، ويُقص على البنية التشريحية، ويُقطّع إلى رقعات بحجم 8 × 8 × 8؛ مقابل أي شيء تضعه في ميزانية الرموز
• السياق — لا يملك NV-Reason-CT نافذة دردشة على الإطلاق؛ إذ يتحوّل الحجم الواحد إلى 13,824 رمزًا بصريًا دون أي تقليل للعيّنات. يستوعب Claude Opus 5 عدد 1,000,000 رمز مدخل، ويُخرج ما يصل إلى 128,000
• ترخيص — OpenMDW-1.1، نموذج قابل للتنزيل تشغّله على أجهزتك الخاصة؛ مقابل واجهة برمجة تطبيقات مستضافة
• الاستخدام المُعلن — للبحث والتعليم فقط، وليس جهازًا طبيًا بشكل صريح، لـ NV-Reason-CT؛ في مقابل المساعدة للأغراض العامة لـ Claude Opus 5
• السعر — لا يوجد سعر مُدرج، لأنه لا يوجد شيء لشرائه، بل أوزان فقط لتشغيلها؛ مقابل 5 دولارات و25 دولارًا لكل مليون توكن، مع قراءات مخزّنة مؤقتًا عند 0.50 دولار
صف «modality in» هو حيث يُولد خطأ التصنيف. فكلاهما يقبل صورة، لذا يبدوان كأنهما نموذجان للصور، ويسأل القارئ بشكل معقول أيهما أفضل في الصور. لكن دراسة التصوير المقطعي المحوسب ليست صورة. إنها مصفوفة حجمية بمقياس فيزيائي بالملليمترات، ووحدة كثافة معايَرة، وتشريح لا يعني شيئًا إلا في ثلاثة أبعاد. رؤية Claude Opus 5 قادرة حقًا، وستناقش صورة شعاعية أو شريحة باثولوجية بشكل معقول. لكن تلك مهمة مختلفة عن دمج مكعب بحجم 384 ملليمترًا من قيم هاونسفيلد بدقة 2 مم، وتقديم تقرير عن تفصّص العقيدة.
ما الذي تقيسه الأرقام على كل جانب فعليًا
للنموذجين سجلات معيارية لا تتقاطع أبدًا، وقراءتها جنبًا إلى جنب دون إدراك ذلك هو ما يؤدي إلى اتخاذ قرارات مشتريات سيئة.
يقدم NV-Reason-CT نتائجه على معيار CT-RATE العام للتصوير المقطعي المحوسب للصدر، عبر ثمانية عشر تصنيفًا، باستخدام عتبة ثابتة موحدة ومطالبة مباشرة بنعم/لا، بدون رأس تصنيف وبدون تكييف خاص بالمهمة. يسجل 0.614 F1 و0.871 AUROC، متقدمًا على VoxelFM عند 0.581 و0.870، وPillar-0 عند 0.544 و0.861، وClinFusion-8B عند 0.442 F1، وCT-CLIP عند 0.398 و0.733، وMerlin عند 0.358 و0.662، وMedGemma 1.5 عند 0.303 F1 عند إعطائه ما يصل إلى 85 شريحة محورية. هناك أيضًا macro-F1 مشتق من التقرير بقيمة 0.592. كل هذه الأرقام تأتي من ورقة NVIDIA الخاصة. لم يقم أي شخص آخر بإعادة إنتاج أي منها، وكان النموذج قابلاً للتنزيل لبضعة أسابيع.
سجل Claude Opus 5 هو سجل عام الأغراض ومستقل إلى حد كبير. تقيسه Artificial Analysis عند 50.8 على Intelligence Index، و78 على Coding Index، و93.2 على GPQA Diamond، و54.9 على Humanity's Last Exam، مع درجة استدعاء للسياق الطويل تبلغ 79.33. هذه أرقام طرف ثالث على مهام الاستدلال العام والبرمجة والمعرفة. لا يوجد في تلك المجموعة أي معيار تقييم للتصوير السريري، ولا يوجد أي صف CT-RATE في أي مكان في السجل المنشور لـ Claude Opus 5.
لذا فالقول الصادق ليس إن أحدًا متقدّم. بل إن النموذجين لم يقِسْهما أحد على المهمة نفسها قط. أي جملة على الصيغة «NV-Reason-CT أفضل من Claude Opus 5 في التصوير الطبي» غير قابلة للتكذيب كما كُتبت، لأنه لم يُجرِ أحد التجربة. ولا يحتوي جدول المقارنة الذي أعدّته NVIDIA بنفسها على أي نموذج حدودي عام.

أين يخطئ الناس في مسألة الواجهة
التداخل التقني المثير للاهتمام حقًا هو ذلك الذي لا يجادل فيه أحد: كيف ينبغي أن تبدو الواجهة بين نموذج CT ونموذج نصي.
الغريزة المعقولة هي أن تُغذّي Claude Opus 5 مجموعة من صور CT أو حجمًا مُخفَّض الدقة وتطلب منه أن يستنتج. عند سياق يبلغ 1,000,000 رمز يبدو ذلك سخيًا، وإزاء دراسة لا تتجاوز 13,824 رمزًا بصريًا يبدو كأنه مساحة وافرة. المساحة ليست المشكلة. فخط أنابيب الرؤية في Claude Opus 5 يتعامل مع الصورة كصورة ثنائية الأبعاد ذات مقياس بكسل. وCT صدري مُقدَّم بهذه الطريقة يفقد التباعد بين الشرائح الذي يجعل الآفة قابلة للقياس، ومعايرة الكثافة التي تجعل «ground-glass» عتبةً لا وصفًا. يمكنك أن تسلّمه توليفة من الشرائح المحورية فتحصل على فقرة تبدو متماسكة. أما ما لا يمكنك الحصول عليه فهو قياس.
هذا بالضبط ما يخصص تصميم NV-Reason-CT حوسبته له. تُسلَّم شبكة 24 x 24 x 24 الناتجة عن حجم 384 مليمترًا إلى النموذج اللغوي بدقتها الكاملة، من دون تقليل مكاني ومن دون طبقة دمج، ولهذا يضم المسار النشط 4.35B معلمة بدلًا من شيء أصغر بكثير. تمثل هذه البنية رهانًا على أن الحفاظ على التفاصيل المكانية يستحق كلفة الرموز. إنه رهان على التمثيل، لا على القدرة اللغوية، وClaude Opus 5 ليس مشاركًا فيه.
النمط المُثمِر هو النمط المُمِل: استخدم نموذج CT للقراءة الحجمية، واستخدم نموذجًا نصيًا لكل ما يحيط بها. إنشاء التقارير وتوحيدها، وملخصات الأتراب، وأُطر التقييم، وتحويل أرشيفات DICOM إلى NIfTI على نطاق واسع، وفرز الدراسات التي ينبغي أن ينظر إليها الإنسان أولًا. هذا عمل على المستندات الطويلة والشيفرة البرمجية، وهو المجال الذي يبرر فيه نموذج بسياق 1M تكلفته.
التكلفة، بوحدتين لا يتم التحويل بينهما
يُحتسب Claude Opus 5 بالعدّاد. خمسة دولارات لكل مليون رمز إدخال، وخمسة وعشرون لكل مليون رمز إخراج، وقراءات الذاكرة المؤقتة بخمسين سنتًا، وكتابات الذاكرة المؤقتة بعشرة دولارات. وبالنسبة إلى خط معالجة يطبّع مجموعة من التقارير أو يكتب كود التقييم ويعيد كتابته، فإن ذلك يُنتج توقّعًا يمكنك بناؤه: رموز داخلة، ورموز خارجة، وقراءات مخزّنة مؤقتًا، وفاتورة أرخص بكثير إذا أحسنت ضبط التخزين المؤقت.
لا يوجد سعر لـ NV-Reason-CT. تقوم بتنزيل 4.69 مليار معامل وتدفع بالكهرباء وساعات GPU والوقت الهندسي. لا يوجد رقم منشور لمعدل الإنتاجية لدراسة كاملة بطول 13,824 توكنًا، ولا توجد نسخة مُكمّمة معروضة، لذا فإن تكلفة تشغيله لكل دراسة رقم سيتعين عليك قياسه بنفسك. هذا أمر طبيعي بالنسبة لأوزان بحثية، وهو أيضًا أكبر فرق عملي منفرد بين الاثنين: أحدهما لديه قائمة أسعار، والآخر لديه فاتورة لا تراها حتى تكون قد دفعت ثمنها بالفعل.
المقارنة التي تهم فعلاً هي لكل دراسة، لا لكل توكن. قراءة CT هي وحدة عمل واحدة. تمريرة تطبيع تقرير على الحالة نفسها هي مهمة نصية تُقاس بآلاف التوكنات. إسناد رقم بالدولار إلى الأولى يعني معرفة عتادك؛ أما إسناده إلى الثانية فهو مجرد حساب.
الفخ في منتصف المقارنة
هناك خطأ محدد يستحق التسمية، لأنه الخطأ الذي تستدعيه هذه المواجهة. إنه التعامل مع NV-Reason-CT كضبط دقيق متخصّص لنموذج عام، ومن ثم افتراض أن النموذج العام سيكون قريبًا بما يكفي في معظم الحالات وأكثر مرونة بكثير.
إنه ليس ضبطًا دقيقًا. إنه محوّل رؤية ثلاثي الأبعاد يُسمى Primus، مُهيأ من COLIPRI، ومثبّت على عمود فقري لغوي Qwen3.5-4B بتضمين موضعي دوّار ثلاثي الأبعاد متعدد المحاور، ودُرّب على نحو 550,000 مثال مُهيكل لسؤال وجواب مستمد من 70,111 حجم تصوير مقطعي عبر CT-RATE وCancerVerse ومجموعة داخلية من NIH، ثم ضُبط باستخدام GRPO مقابل مكافأة تزن F1 لمجموعة الاعتلالات عند 2.0، ودرجة بنية تقرير خاصة بالمنطقة عند 0.5، وعقوبة طول ناعمة عند 1.0. المشفّر ثلاثي الأبعاد هو جوهر النموذج. الواجهة الأمامية ثنائية الأبعاد أو القائمة على الشرائح أداة مختلفة، وتُظهر مقارنة الورقة نفسها قيمة هذا الفرق: MedGemma 1.5 عند 0.303 F1 عندما يُغذّى بما يصل إلى 85 شريحة محورية، مقابل 0.614 للنموذج الحجمي الأصلي.
الخطأ المعاكس شائع بالقدر نفسه ومكلف بالقدر نفسه: أن تفترض أنه لأن NV-Reason-CT متخصص، ينبغي استخدامه في كل شيء سريري. فهو يدعم الصدر والبطن ولا شيء غيرهما، واستدعاؤه يكون عبر ملف NIfTI لا عبر رسالة محادثة، وتنص شروط ترخيصه على أنه للأبحاث والتعليم فقط. ولن يقرأ شريحة باثولوجية، أو يجيب عن سؤال حول دليل إرشادي، أو يكتب الكود الذي ينفذ تحويل DICOM الخاص بك على دفعات. واللجوء إلى نموذج CT للقيام بعمل نصي هو الخطأ الفئوي نفسه الذي هو اللجوء إلى نموذج نصي لإجراء قياسات حجمية، لكنه في الاتجاه المعاكس.

كيف يتلاءم النصفان في نظام واحد
لا يحل أي من النموذجين محل الآخر، والبنية المعمارية السليمة تضم كليهما — ما يطرح السؤال العملي حول كيفية استدعائهما.
يتم تقديم Claude Opus 5 عبر OrcaRouter باسم anthropic/claude-opus-5 بسعر قائمة مزود Anthropic بدون هامش ربح، داخل واجهة API واحدة تغطي أكثر من 200 نموذج. هذا يهم أقل لنداء واحد مما يهم للخط الأنابيب المحيط: عندما يكون النصف النصي من بناء سريري نموذجًا واحدًا بين عدة مرشحين، فإن وجودها جميعًا خلف مفتاح واحد يعني أنه يمكنك مقارنتها على مجموعة البيانات الخاصة بك دون عقد ثانٍ أو تغيير في الكود، وتتيح لك لغة التوجيه DSL إرسال طلبات فردية إلى النموذج الذي ينبغي أن يتعامل معها بينما يحميك التجاوز التلقائي عند تدهور المزود.
NV-Reason-CT ليس على منصتنا، ولا أي نموذج من NVIDIA. إنها أوزان تقوم بتنزيلها وتشغيلها على عتادك الخاص، وهذا بالضبط ما يسمح لك الترخيص بفعله، وبما أن المدخلات بيانات حجمية مشتقة من المرضى، فمن المحتمل أن يكون هذا ما تريده على أي حال. لن نلمح إلى أننا نوجّه نموذجًا لا نستضيفه. الجانب النصي من البناء هو حيث نكون مفيدين؛ أما الجانب الحجمي فهو حيث تكون وحدك مع نموذج بحجم 4.69B ووحدة GPU.

الحكم الذي يصمد أمام التدقيق
إذا كنت بحاجة إلى قراءة حجم CT وتحويله إلى نتائج منظمة، فهناك نموذج لذلك، صدر عن مجموعة أبحاث NVIDIA، وهو عبارة عن تنزيل وليس استدعاء API. وإذا كنت بحاجة إلى توحيد مجموعة من التقارير، أو كتابة إطار تقييم، أو برمجة مهمة تحويل DICOM، أو تلخيص مجموعة مرضى، فهناك نموذج لذلك أيضًا، ولديه بطاقة أسعار.
الخط الذي ينبغي الالتزام به هو أنه لم يثبت أن أيًا منهما أفضل من الآخر في أي شيء، لأن التجربة لم تُجرَ بعد. ما ثبت هو أن واجهة أصلية ثلاثية الأبعاد تتفوق على واجهة قائمة على الشرائح في معيار عام للتصوير المقطعي المحوسب للصدر، بفارق قدّر المؤلفون أنه نحو ثلاث نقاط F1، وأن نموذجًا حدوديًا عامًا يُقاس بشكل مستقل في صدارة المجال في الاستدلال والبرمجة والعمل ذي السياق الطويل. هذان قولان عن مهمتين مختلفتين. وقراءتهما كترتيب هي الخطأ الفئوي، ويظل قائمًا حتى ينشر أحدهم المواجهة المباشرة التي لم ينشرها أحد بعد.
