بطاقة رئيسية مُنشأة بعنوان 'NV-Reason-CT vs Grok 4.6' مع عنوان فرعي 'من يقرأ المسح، ومن يقرأ التقرير'. تمتد ثلاث شرائح على طول الجزء السفلي: 'حجم CT واحد مقابل 500,000 توكن'، و'0.871 مقابل 0.870 تعادل'، و'Grok 4.6: $2.00 / $6.00 لكل مليون'. شعار OrcaRouter مركّب في أسفل اليمين.
Guides & Insights

NV-Reason-CT مقابل Grok 4.6: من يقرأ الفحص، ومن يقرأ التقرير

الكاتب

Gideon Frost

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج →
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

هناك طريقتان لوضع ذكاء اصطناعي على مسار التصوير المقطعي المحوسب (CT)، وواحدة فقط منهما تتعلق بالصورة. NV-Reason-CTهو الأول: نموذج لغوي بصري ثلاثي الأبعاد بمعاملات 4.69B يقرأ ملفات NIfTI مباشرةً، ونُشر على Hugging Face في 8 سبتمبر 2026 دون منشور إطلاق من NVIDIA. Grok 4.6هو الثاني: نموذج نصي وصوري بسعة 500,000 رمز، صدر في 12 أغسطس 2026، ويكلف 2.00 دولار لكل مليون رمز إدخال، وهو جيد جدًا في الجزء من المهمة الذي يحدث بعد أن يكون شخص ما قد دوّن النتيجة بالفعل. وإذا وضعتهما في مقارنة، فإن السؤال المعتاد — أيهما أفضل — يتبين أنه مصاغ بشكل خاطئ. إنهما لا يتنافسان على الموضع نفسه في المسار. بل يتنافسان على بند الميزانية نفسه.

ما الذي شُحن فعليًا على كل جانب

وصل NV-Reason-CT كمستودع وورقة ومساحة تجريبية، وليس كمنتج. أُنشئ مستودع GitHub تحت NVIDIA-Medtech في 2 سبتمبر 2026؛ تبعت أوزان Hugging Face في 8 سبتمبر؛ مسودة arXiv، NV-Reason-CT: نموذج لغة مرئي ثلاثي الأبعاد لتحليل التصوير المقطعي المحوسب، ظهرت في 23 سبتمبر مع ستة عشر مؤلفًا من NVIDIA والمعاهد الوطنية للصحة وجامعة زيورخ. لا تحمل غرفة أخبار NVIDIA أي شيء عنه. تصف بطاقة النموذج الإصدار 0.1 وتقصر الاستخدام على البحث والتعليم.

Grok 4.6 هو النوع المعاكس من الإصدارات. فهو نقطة نهاية تجارية من الدرجة الأولى، مُدرَج باسم "Latest" في وثائق المطوّرين الخاصة بالمورّد، ومسعّر وفق بطاقة أسعار منشورة، ومتاح كنموذج متوافق مع OpenAI تعتمده عمليات التكامل القائمة عبر تغيير عنوان URL الأساسي. وقد خلف Grok 4.5 بنفس نافذة السياق، ونفس واجهة الإدخال، ونفس التسعير الأساسي.

هذا التفاوت هو كل حكاية هذه المقارنة. أحدهما نتاج بحثي يُصادف أنه قابل للتنزيل. والآخر بنية تحتية. وقراءتهما مقابل بعضهما تخبرك أين يقع الآن الخط الفاصل بين "نتاج بحثي" و"بنية تحتية" في التصوير الطبي — وهو ليس حيث قد تتوقع.

تقسيم العمل، في المدخلات والمخرجات

• إدخال حجمي — يقرأ NV-Reason-CT مجسمات NIfTI بصيغة .nii/.nii.gz بوحدات هاونسفيلد، للصدر أو البطن فقط، مقابل Grok 4.6 الذي يقرأ النصوص والصور والملفات، بلا مسار حجمي • التعامل المكاني — يحوّل NV-Reason-CT مجسماً بأبعاد 384×384×384 مم إلى شبكة 24×24×24 من 13,824 رمزاً باستخدام 3D MRoPE، دون تقليل العينات، مقابل Grok 4.6 الذي يتعامل مع الصورة كصورة ثنائية الأبعاد • السياق — في NV-Reason-CT يمثّل المجسم الواحد بادئة ثابتة واحدة، ولا توجد نافذة سياق بالمعنى المعتاد، مقابل 500,000 رمز في Grok 4.6 • المخرجات — تقرير منظّم أو إجابة أو أثر استدلال في NV-Reason-CT مع إمكانية تعطيل التفكير، مقابل نص مع مخرجات منظّمة واستدعاءات أدوات في Grok 4.6 • الترخيص — NV-Reason-CT برخصة OpenMDW-1.1، أوزان BF16 بحجم 10.6 غيغابايت، مقابل Grok 4.6 احتكاري عبر API فقط • السعر — NV-Reason-CT تكلفة رأسمالية لوحدات GPU، بلا سعر لكل رمز، مقابل Grok 4.6 بسعر 2.00 / 6.00 دولار لكل مليون، يتضاعف لما يزيد على 200 ألف إدخال

A generated scoreboard titled 'NV-Reason-CT vs Grok 4.6 - the scoreboard'. Left column 'NV-Reason-CT': Volumetric input NIfTI, Hounsfield, chest or abdomen; Spatial handling 24x24x24 grid, no downsampling; Context one volume, a fixed prefix; Output report, answer or reasoning trace; Licence OpenMDW-1.1, 10.6 GB BF16; Price GPU capex, no per-token rate. Right column 'Grok 4.6': Volumetric input none - 2D images, text, files; Spatial handling an image is a picture; Context 500,000 tokens; Output text, structured outputs, tools; Licence proprietary, API only; Price $2.00 / $6.00, doubled above 200K. A footer reads 'NV-Reason-CT figures from NVIDIA's model card and paper; Grok 4.6 pricing per the vendor rate card.'

يبدو هذا الثنائي بمثابة تسليم طبيعي. يُنتج NV-Reason-CT النتيجة من الحجم؛ أما Grok 4.6 فهو النموذج الذي قد تُسلّم إليه ألفًا من تلك النتائج، ضمن نافذة سياق واحدة، للبحث عن أنماط عبر مجموعة. لم ينشر أحد خط الأنابيب هذا. إنها البنية البديهية، ويجدر القول بصراحة إنها غير مُختبَرة.

أرقام Grok 4.6، ولمن هي

هناك رقمان لـ Grok 4.6 يتداولان معًا، وهما ليسا من النوع نفسه. درجة GPQA Diamond البالغة 94.9 قاستها Artificial Analysis، ولم يبلّغ عنها المورّد — وهي الفئة الأكثر جديرة بالثقة بين الفئتين تحديدًا لأن طرفًا ثالثًا أجرى القياس. درجة Artificial Analysis Intelligence Index البالغة 44، على مراجعة المؤشر v4.3.2، تضع Grok 4.6 في المرتبة 28 من 211 في فئته. كما يسجّل Artificial Analysis أن النموذج خاص: الأوزان ليست متاحة للعموم.

على اللوحة نفسها، يقيس AA اختبار Terminal-Bench 2.1 عند 88.4، وSciCode عند 56.5، وHumanity's Last Exam عند 42.9، و𝜏²-banking عند 50.7، واستدعاء السياق الطويل عند 80.3. تلك أدوات استدلال عام. ولا يمكن تشغيل أيٍّ منها على حجم تصوير مقطعي محوسب ثلاثي الأبعاد، وهذا ليس انتقاصًا من Grok 4.6 — بل هو بيان عمّا تقيسه مجموعة المعايير.

يوجد في جانب CT جدول واحد فقط، وهو جدول المؤلفين.

تتكوّن قاعدة الأدلة العامة الكاملة لـ NV-Reason-CT من جدول تصنيف واحد على التسميات الـ18 الخاصة بـ CT-RATE، عند عتبة موحّدة ثابتة، باستخدام مُطالبة مباشرة بنعم/لا دون رأس تصنيف. ويُبلّغ عن Macro-F1 0.614 وMacro-AUROC 0.871، مقابل VoxelFM عند 0.581/0.870، وPillar-0 عند 0.544/0.861، وClinFusion-8B عند 0.442، وCT-CLIP عند 0.398/0.733، وMerlin عند 0.358/0.662، وMedGemma 1.5 عند 0.303.

هذه أرقام يبلّغ عنها المورّد، مأخوذة من بطاقة النموذج، وأنا أصنّفها على هذا النحو لأنه لم يُعِد إنتاجها أي طرف مستقل بعد. ثمة أمران جديران بالملاحظة داخل الجدول. هامش تفوق F1 على VoxelFM هو 0.033، وهو فارق حقيقي على 18 وسمًا بعتبة ثابتة. وهامش تفوق AUROC على النموذج نفسه هو 0.001، وهو تعادل. يظهر الرقمان معًا في الصف نفسه من الجدول نفسه، وواحد منهما فقط يحمل ادعاءً.

الشيء الآخر الذي يخبرك به الجدول يتعلق بتأطير الورقة نفسها. النماذج المقارَن بها هي أنظمة تدريب تبايني مسبق ثلاثية الأبعاد، ونموذج MLLM توليدي مدمج ثنائي/ثلاثي الأبعاد، ونموذج حدودي قائم على الشرائح. اختار المؤلفون القياس المرجعي مقابل أنظمة تستوعب مجسمات ثلاثية الأبعاد، لأن الادعاء ذا المعنى الوحيد هنا هو أن نموذجًا توليديًا ثلاثي الأبعاد يمكنه التغلب على نماذج تمييزية ثلاثية الأبعاد في التصنيف دون رأس. وهو لا يقول شيئًا عن كيفية مقارنة NV-Reason-CT بنموذج حدودي عام في أي شيء، لأن تلك المقارنة غير موجودة على هذا المحور.

A screenshot of NVIDIA's Hugging Face model page for NV-Reason-CT, showing the model card header with Like 1 and 0 followers, the Image-Text-to-Text and Transformers and Safetensors tags, the qwen3_5, medical-imaging, ct, 3d-vlm and custom_code tags, 'Downloads last month 210', the 5B-parameter BF16 size row, the model description describing the 384x384x384-mm volume becoming a 24x24x24 grid of 13,824 visual tokens with no spatial downsampling, the training paragraph citing roughly 550,000 structured QA examples from 70,111 unique CT volumes, a side panel showing Base model Qwen/Qwen3.5-4B and the CT-RATE and CancerVerse datasets, and the arXiv 2609.27511 paper link.

إلى أين يذهب المال، ولماذا يهم حد الشريحة

تحتوي قائمة أسعار Grok 4.6 على تفصيل يقرر بهدوء الكثير من البنية المعمارية: تُحتسب المطالبات التي تتجاوز 200 ألف رمز إدخال بضعف السعر الأساسي — 4.00 دولارات للإدخال، و12.00 دولارًا للإخراج، مع ارتفاع سعر قراءة الذاكرة المؤقتة من 0.50 دولار إلى 1.00 دولار. مهمة مراجعة المجموعة التي تجمع النتائج في سياق طويل واحد هي بالضبط عبء العمل الذي يتجاوز هذا الحد. تحته، سعر قراءة الذاكرة المؤقتة البالغ 0.50 دولار لكل مليون هو ربع سعر الإدخال، وهو ما يجعل تكرار بادئة ثابتة كبيرة عبر آلاف التقارير ميسور التكلفة بدلاً من كونه ممكنًا فحسب.

عبر OrcaRouter، يتم تقديم Grok 4.6 بسعر قائمة ذلك المزوّد دون أي هامش ربح، لذا فإن حسابات الطبقات أعلاه هي الحسابات التي تدفعها فعليًا، وأي تعديل مستقبلي عليها يصل إلى فاتورتك في اليوم نفسه وليس عند التجديد التالي. سبب توجيه مهمة كهذه بدلًا من تثبيت نقطة نهاية واحدة هو أن نصف مراجعة المجموعة في مسار سريري هو حيث سترغب في تجربة ثلاثة نماذج مختلفة قبل الاستقرار — وعلى مفتاح واحد متوافق مع OpenAI مع تحويل تلقائي عند الفشل عبر المزوّدين، تكلف تلك التجربة تغيير اسم النموذج.

نصف CT من خط الأنابيب لا يملك هذا الخيار. لا تُستضاف NV-Reason-CT على OrcaRouter — فهي نقطة تفتيش بحجم 10.6 GB مع كود نموذج مخصص تشغّله بنفسك، على شرائح Ampere أو Hopper أو Lovelace، مع trust_remote_code=True. لن نلمّح إلى غير ذلك. إذا كنت تبني خط الأنابيب هذا، فأنت تشتري وحدات GPU لنصف و رموزاً للنصف الآخر، وكون النصفين يمكن إدارتهما على الأقل من وحدة تحكم واحدة هو ادعاء التكامل الوحيد الجدير بالذكر.

A screenshot of the OrcaRouter model page for Grok 4.6, showing the identifier grok/grok-4.6, input text + image + file, output text, the Vision, Tools, JSON and Reasoning badges, a 500,000-token context window, the description of it as SpaceXAI's smartest model to date and the current flagship listed as Latest in the vendor's own developer docs, OpenAI-compatible code samples pointing at https://api.orcarouter.ai/v1, and a pricing strip reading $2.00 per million input tokens and $6.00 per million output tokens.

ما قيمة القارئ الثاني فعليًا

تتضمن ورقة NV-Reason-CT دراسة أولية لأخصائيي أشعة خبراء تُفيد بـ«تقييمات ثقة مواتية للمراجعة بمساعدة الذكاء الاصطناعي» وانخفاض بنسبة 50% في متوسط وقت التفسير وإعداد التقارير المُبلَّغ عنه. هذه أرقام قوية، لكنها تأتي مصحوبة بتحفّظ تذكره الورقة نفسها: إنها أولية، ومن تصميم الدراسة الخاص بالمؤلفين أنفسهم. لا يوجد تكرار مستقل منشور، وانخفاض الوقت بنسبة 50% في دراسة قراءة مضبوطة هو تحديدًا نوع النتائج التي تتقلص عند التكرار. الأمر يستحق المتابعة. لكنه لا يستحق الاقتباس باعتباره نتيجة مُثبتة.

وبالنظر إلى ذلك، فإن مساهمة Grok 4.6 في سير عمل الأشعة ليست التشخيص على الإطلاق. إنها الطبقة التي تقرأ التقارير — قائمة الفرز، وخطاب المتابعة، والترميز، وحزمة التفويض المسبق. ذلك العمل نصي، وكثيف الحجم، ورخيص لكل وحدة، ونمط الإخفاق عند الخطأ فيه إداري لا سريري. وهو أيضًا الموضع الذي تستحق فيه نافذة سياق بسعة 500 ألف وقراءة ذاكرة تخزين مؤقت بتكلفة $0.50 مكانهما حقًا.

إذن، الانقسام الذي تنتهي إليه هذه المقارنة حادٌ وصريح: NV-Reason-CT لديه مسار ثلاثي الأبعاد حقيقي، ولا توزيع له، ولا سعر، ولا تحقق مستقل. أما Grok 4.6 فلديه توزيع، وسعر، وتغطية مستقلة بالمقاييس المرجعية، ولا يملك أي مسار حجمي على الإطلاق. إذا كنت بحاجة إلى قراءة المسح، فواحد منهما فقط قادر على ذلك. وإذا كنت بحاجة إلى التعامل مع الأوراق المحيطة بالمسح، فالآخر فقط هو منتج.

مقارنات في هذه المقالة1

مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا