بطاقة بطل مُولّدة بعنوان '‏NV-Reason-CT مقابل GPT-5.6 Sol' وبعنوان فرعي '‏13,824 رمزًا بصريًا قبل أن تكتب أي كلمة'. ثلاثة شرائح تمتد على طول الجزء السفلي: '‏4.69B متخصص CT مقابل غير معلن'، و'‏NIfTI ثلاثي الأبعاد إدخالًا، والنتائج إخراجًا'، و'‏Sol: 1,050,000 إدخال / 128,000 إخراج'. شعار OrcaRouter مُدمج في أسفل اليمين.
Guides & Insights

NV-Reason-CT مقابل GPT-5.6 Sol: 13,824 رمزًا مرئيًا قبل أن تكتب كلمة

الكاتب

Gideon Frost

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج →
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

كل تصوير مقطعي محوسب للصدر ترسله إلى NV-Reason-CT يكلّف 13,824 رمزًا بصريًا قبل أن يبدأ الموجّه أصلًا. وهذا ليس شذوذًا ولا خيارًا من خيارات الضبط — بل هو التصميم بأكمله. فمُرمِّز الرؤية ثلاثي الأبعاد الأصلي في النموذج يلتقط حجمًا بأبعاد 384×384×384 مم ويحوّله إلى شبكة 24×24×24، وبطاقة النموذج صريحة في أن جميع الرموز البالغ عددها 13,824 وإحداثياتها ثلاثية الأبعاد تصل إلى النموذج اللغوي "دون اختزال مكاني". قارن ذلك بما تدفعه على الأرجح بالفعل. GPT-5.6 Sol يقبل النص والصور والملفات، والصورة المرسلة إليه هي صورة ثنائية الأبعاد — شريحة، أو لقطة شاشة من عارض DICOM، أو صورة شعاعية مقتبسة من ملف PDF. أحد هذين النموذجين لديه مسار حجمي. والآخر لديه نافذة سياق. ومعظم المقارنات بينهما تنهار عند هذا التمييز، والانهيار هو الجزء المثير للاهتمام.

الإصدار الذي لم يُعلن عنه أحد

لم تنشر NVIDIA أي كلمة عن NV-Reason-CT في غرفة أخبارها. لا يوجد منشور إطلاق، ولا شريحة عرض رئيسية، ولا بيان صحفي. ما هو موجود هو مستودع على Hugging Face أُنشئ في 8 سبتمبر 2026، ومستودع على GitHub تحت منظمة NVIDIA-Medtech أُنشئ في 2 سبتمبر، ومساحة عرض تجريبي على Gradio، ومسودة arXiv — NV-Reason-CT: نموذج لغوي بصري ثلاثي الأبعاد لتحليل التصوير المقطعي المحوسب — قُدِّمت في 23 سبتمبر 2026 من فريق من ستة عشر مؤلفًا من NVIDIA مع مؤلفين مشاركين في NIH وجامعة زيورخ.

هذا نمط حقيقي، ويستحق التسمية بدقة بدلًا من التعامل معه كغموض. تُصدر مجموعة التصوير الطبي في NVIDIA الأوزان بهدوء وتدع الورقة البحثية والمستودع يقومان بالإعلان. السلف، NV-Reason-CXR-3B، صدر في أكتوبر 2025 بالطريقة نفسها. الفارق هنا هو النطاق: هذه هي المرة الأولى التي وسّعت فيها تلك المجموعة الوصفة من أشعة سينية ثنائية الأبعاد إلى أحجام ثلاثية الأبعاد أصلية، والورقة البحثية عمرها يومان.

ما يمكن معرفته من المستودع: البنية، والترخيص، وبيانات التدريب، وجدول المعايير. وما لم يتأكد بعد: هل تعتزم NVIDIA طرح هذا كخط منتجات مدعوم، وهل ستتبع ذلك نقاط حفظ إضافية، وكيف يصمد في تقييم أي شخص غير المؤلفين. المستودع في الإصدار 0.1 ويصف نفسه بأنه للأبحاث والتعليم فقط.

ما الذي يقبله كل نموذج فعليًا

هنا تصبح المواجهة المباشرة صادقة بسرعة. النموذجان لا يشتركان في سطح إدخال واحد.

يقرأ NV-Reason-CT أحجام NIfTI — .nii أو .nii.gz — بقيم شدة فوكسل بوحدات هانسفيلد. ويقصّ تلقائيًا إلى الصدر أو البطن باستخدام وحدات هانسفيلد الرئوية واستدلال مورفولوجي ثلاثي الأبعاد، ويعيد أخذ العينات إلى دقة أيزوتروبية 2 مم، ولا يقبل سوى "chest" أو "abdomen" كقيم تشريحية. ويُخرج نصًا: تقريرًا مُهيكلًا، أو إجابةً، أو أثر استدلال خطوة بخطوة، مع مفتاح لإيقاف الاستدلال للإجابات القصيرة.

يقرأ GPT-5.6 Sol النصوص والصور والملفات، عبر نافذة سياق تبلغ 1,050,000 رمز، وما يصل إلى 128,000 رمز إخراج في استجابة واحدة. ولا يمتلك مُشفِّرًا حجميًا. أطعمه صورة CT وعليك أولًا أن تقرر كيفية تسطيح نحو ثلاثمائة شريحة إلى شيء يقبله مُشفِّر صور ثنائي الأبعاد — لوحة مجمّعة، أو عدد قليل من الشرائح الأساسية، أو إسقاط أقصى كثافة مُصيَّر. كل واحد من هذه الخيارات يتخلّى عن العلاقات المكانية التي بُني المسار الثلاثي الأبعاد للحفاظ عليها.

إذن، الصياغة الصادقة ليست «أي النموذجين أذكى؟»، بل إن مسار الصور لدى Sol والمسار ثلاثي الأبعاد لدى NV-Reason-CT يجيبان عن سؤالين مختلفين. يستطيع Sol إجراء استدلال حول وصف طبيب الأشعة لفحص ما، بينما يستطيع NV-Reason-CT إجراء استدلال حول الفحص نفسه.

يوجد معيار واحد، وواحد منها فقط عليه رقم.

يذكر NV-Reason-CT قيمتَي Macro-F1 البالغة 0.614 وMacro-AUROC البالغة 0.871 في مهمة التصنيف ذات الـ18 تسمية لدى CT-RATE، باستخدام مُطالبة مباشرة بنعم/لا دون رأس تصنيف ودون أي تكييف خاص بالمهمة. هذه هي أرقام المؤلفين أنفسهم من بطاقة النموذج، والجزء المفيد هو صف المقارنة: VoxelFM عند 0.581 في Macro-F1، وPillar-0 عند 0.544، وClinFusion-8B عند 0.442، وCT-CLIP عند 0.398، وMerlin عند 0.358، وMedGemma 1.5 عند 0.303. وعند العتبة الموحدة الثابتة نفسها، يتفوق نموذج ثلاثي الأبعاد توليدي على خطوط الأساس للتدريب المسبق التقابلي ثلاثي الأبعاد وعلى النموذج الحدودي القائم على الشرائح.

رقم واحد في ذلك الجدول يستحق التشكيك بدلًا من التكرار: فجوة AUROC. يذكر NV-Reason-CT القيمة 0.871 مقابل 0.870 لدى VoxelFM. إن جزءًا واحدًا من ألف من نقطة، في تقييم يديره المورّد، ليس انتصارًا — بل هو تعادل ضمن أي ضجيج يحمله التقييم. أما فجوة Macro-F1 البالغة 0.033 فهي الادعاء المؤيَّد بالأدلة.

ليس لدى GPT-5.6 Sol رقم CT-RATE لأن CT-RATE ليس معيارًا يمكن تشغيله عليه. لديه مؤشر Artificial Analysis Intelligence Index بقيمة 47، ودرجة GPQA Diamond المقيسة من AA وقدرها 94.1، ودرجة Humanity's Last Exam وقدرها 49.5 — وكلها أدوات استدلال عام. إن وضع 0.614 Macro-F1 إلى جانب 47 على AA Index سيكون حسابًا على مسطرتين مختلفتين. لن أفعل ذلك، وعليك ألا تثق بأي شخص يفعله.

آثار الاستدلال، منتجان مختلفان

كلا النموذجين يُصدران استدلالاً. هذا هو التقاطع الفلسفي الحقيقي الوحيد، والاختلاف يحمل درساً.

يتيح GPT-5.6 Sol جهدًا استدلاليًا قابلًا للتكوين، لذا فأنت توازن بين زمن الاستجابة والتكلفة مقابل العمق في كل طلب، ويمكنك طلب الاستدلال مجددًا عبر include_reasoning. إنها قدرة عامة تُطبَّق على أي شيء ترسله.

استدلال NV-Reason-CT ضيّق عن قصد. تتألف مجموعة التدريب من نحو 550,000 مثال منظم للأسئلة والأجوبة مستمد من 70,111 حجم CT فريد، وجزء منها استدلال من تأليف أخصائيي الأشعة جُمع من تفسيرات خبراء مسجلة ومفرغة نصيًا. مرحلة GRPO التي تلي SFT تستخدم مكافآت قابلة للتحقق على مجموعات الشذوذات الصدرية والبطنية — أي أن إشارة المكافأة تستند إلى ما إذا كانت نتيجة مذكورة موجودة فعليًا في الحجم، لا إلى ما إذا كانت الصياغة النثرية حسنة القراءة. تصف بطاقة النموذج المخرجات بأنها "ملاحظات قابلة للمراجعة، وتشخيصات تفريقية، وعدم يقين"، وتحمل تحذيرًا صريحًا مفاده أن الاستدلال المولَّد "لا يُضمن أن يمثل الحساب الداخلي للنموذج". هذا التحذير يؤدي عملًا حقيقيًا. إنه الفرق بين أثر يمكنك التحقق منه مقابل البيانات وأثر لا يسعك إلا الإعجاب به.

الحجم والترخيص، في تمريرة واحدة

• المعاملات — NV-Reason-CT بإجمالي 4.69B / 4.35B نشطة في مسار CT، من هيكل أساس Qwen3.5-4B بالإضافة إلى Primus 3D ViT مقابل GPT-5.6 Sol غير مُفصح عنه • حجم نقطة التحقق — NV-Reason-CT ~10.6 GB BF16 safetensors، يعمل على Ampere/Hopper/Lovelace مقابل GPT-5.6 Sol عبر API فقط • المُدخل — أحجام CT ثلاثية الأبعاد بصيغة NIfTI بوحدات هاونسفيلد مقابل نص، صورة، ملف • السياق — NV-Reason-CT غير منطبق، الحجم الواحد هو بادئة ثابتة من 13,824 رمزًا مقابل Sol 1,050,000 رمزًا إدخالًا، و128,000 إخراجًا • الترخيص — OpenMDW-1.1، الأوزان قابلة للتنزيل مقابل ترخيص مملوك، والوصول عبر API فقط • التوافر — مستودع البائع وأوزانه الخاصة مقابل التوجيه عبر OrcaRouter بسعر $4.00 / $20.00 لكل مليون، مع تضاعف سعر Sol فوق 272K من رموز الإدخال إلى $8.00 / $30.00

A generated scoreboard titled 'NV-Reason-CT vs GPT-5.6 Sol - the scoreboard'. Left column 'NV-Reason-CT': Input 3D NIfTI CT, chest or abdomen; Volume prefix 13,824 tokens, fixed; Parameters 4.69B total / 4.35B active; CT-RATE Macro-F1 0.614 (vendor-reported); Licence OpenMDW-1.1, weights published; Price GPU capex, no per-token rate. Right column 'GPT-5.6 Sol': Input text, image, file; Context / output 1,050,000 in / 128,000 out; Parameters undisclosed; CT-RATE Macro-F1 not applicable; Licence proprietary, API only; Price $4.00 / $20.00 per M. A footer reads 'NV-Reason-CT figures are the authors' own and unreproduced; GPT-5.6 Sol pricing per OpenAI's rate card as routed by OrcaRouter.'

ما تكلفك إياه هذه الفُرقة فعليًا

لا تكون مقارنة التكلفة منطقية إلا بعد أن تقبل أن أعباء العمل مختلفة، لذا إليك النسخة التي تكون منطقية بالفعل.

يُحتسب سعر Sol لكل توكن، ولسعره قفزة حادة: 4.00 دولارات لكل مليون توكن إدخال و20.00 دولارًا لكل مليون توكن إخراج حتى 272 ألف توكن من الموجّه، ثم 8.00 و30.00 دولارًا. على OrcaRouter يُقدَّم بسعر OpenAI المعلن نفسه دون أي هامش ربح، وهذا أهم مما يبدو — فالسعر الذي تراه هو السعر الذي تنشره OpenAI، لذا يصل أي تغيّر سعري إلى فاتورتك في اليوم نفسه بدلًا من تجديد العقد التالي. سعر قراءة الذاكرة المؤقتة لديه 0.40 دولار لكل مليون، أي عُشر سعر الإدخال، وهو ما يجعل الحلقات الوكيلية الطويلة ذات البادئة الثابتة الكبيرة قابلة للاستمرار حسابيًا.

لا يوجد لـ NV-Reason-CT سعر لكل رمز على الإطلاق. تُنزّل 10.6 GB وتدفع ثمن وحدة GPU. تلك مسألة نفقات رأسمالية مقابل نفقات تشغيلية، ولها جواب واحد فقط: عند حجم استخدام مرتفع بما يكفي، يتفوق الاستضافة الذاتية لنموذج بعدد معاملات نشطة 4.35B من حيث التكلفة. أما دون ذلك الحجم فلا، ونقطة التقاطع تعتمد كليًا على معدل استغلالك لوحدة GPU. لم ينشر أحد خارج NVIDIA رقمًا لمعدل الإنتاجية (throughput) لهذه النسخة (checkpoint) بعد، لذا أي شخص يقدم لك نقطة تقاطع فهو يخمّن.

A screenshot of NVIDIA's Hugging Face model page for NV-Reason-CT, showing the model card header with Like 1 and 0 followers, the Image-Text-to-Text and Transformers and Safetensors tags, the qwen3_5, medical-imaging, ct, 3d-vlm and custom_code tags, 'Downloads last month 210', the 5B-parameter BF16 size row, the model description describing the 384x384x384-mm volume becoming a 24x24x24 grid of 13,824 visual tokens with no spatial downsampling, the training paragraph citing roughly 550,000 structured QA examples from 70,111 unique CT volumes, a side panel showing Base model Qwen/Qwen3.5-4B and the CT-RATE and CancerVerse datasets, and the arXiv 2609.27511 paper link.

ما يساعد فيه الموجّه هنا هو الجزء من سير العمل الذي ليس الفحص. نادرًا ما تكون خط أنابيب البحث السريري الإنتاجي نموذجًا واحدًا — بل هي استخراج، وخطوة استدلال، وخطوة تلخيص، وأحيانًا رأي ثانٍ. يعرض OrcaRouter أكثر من 200 نموذج خلف نقطة نهاية واحدة متوافقة مع OpenAI مع تحوّل تلقائي عند الفشل عبر المزوّدين، بحيث يمكن استبدال النصف المخصص للأغراض العامة من خط الأنابيب هذا أو إعادة توجيهه دون عقد ثانٍ. NV-Reason-CT ليس أحد النماذج التي نوجّهها؛ بل هو نقطة تفتيش تشغّلها بنفسك. يمكن أن يظل نصفا خط الأنابيب خلف مفتاح واحد.

A screenshot of the OrcaRouter model page for GPT-5.6 Sol, showing the identifier openai/gpt-5.6-sol, input text + image + file, output text, the Vision, Tools, JSON and Reasoning badges, a 1,050,000-token context window with 128K maximum output, the description of it as the flagship of OpenAI's GPT-5.6 series, OpenAI-compatible code samples pointing at https://api.orcarouter.ai/v1, and a pricing strip reading $4.00 per million input tokens and $20.00 per million output tokens with a p50 time to first token of 10.00 s.

السؤال المفتوح

NV-Reason-CT عمره يومان كورقة بحثية وسبعة عشر يومًا كمستودع، والمجال الذي ينتمي إليه صغير بما يكفي ليكون نقطة البيانات التالية مفيدة. راقب ثلاثة أمور: إعادة إنتاج مستقلة لـ CT-RATE، ونقطة تفتيش ثانية في العائلة، وأي مؤشر على أن مجموعة NVIDIA الطبية تتعامل مع هذا كخط بحثي مستمر وليس كورقة. حتى ذلك الحين، الموقف القابل للدفاع ضيق وواضح — هذه أقوى نقطة تفتيش للاستدلال الأصلي ثلاثي الأبعاد على CT متاحة للتنزيل حاليًا، وفقًا لجدول المؤلفين أنفسهم، وهي ليست بديلاً عن نموذج عام رائد في أي شيء باستثناء قراءة CT.