بطاقة رئيسية مُولَّدة بعنوان 'NV-Reason-CT مقابل Gemini 3.1 Pro' وعنوانها الفرعي 'أوسع واجهة إدخال، ومع ذلك ليست قارئ تصوير مقطعي محوسب'. بطاقتان متقابلتان تفصل بينهما زوج من الأسهم الزرقاء: البطاقة اليسرى موسومة بـ 'NV-Reason-CT' مع أيقونة مسح للجسم و'الصدر والبطن فقط - 13,824 رمزًا مرئيًا لكل حجم - OpenMDW-1.1'؛ والبطاقة اليمنى موسومة بـ 'Gemini 3.1 Pro' مع أيقونة شريحة و'إدخال صوت وفيديو وصورة وملف ونص - سياق 1M - طبقة معاينة'. شعار OrcaRouter مُركَّب في الزاوية السفلية اليمنى.
Guides & Insights

NV-Reason-CT مقابل Gemini 3.1 Pro: أوسع سطح إدخال، ومع ذلك لا يزال ليس قارئًا لـ CT

الكاتب

Magnus Corvin

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج →
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

أربعة وتسعون بالمئة. هذا هو معدل الخطأ الذي يسجّله كتالوجنا الخاص حالياً لمسار واحد يقدّم Gemini 3.1 Pro — 93.93%، إلى جانب زمن وسيط للوصول إلى أول رمز يُقرأ على أنه سقف عشر ثوانٍ، ورقم إنتاجية قدره 978 رمزًا في الثانية. اقرأ ذلك كبيان عن النموذج وستخلص إلى نتيجة خاطئة تمامًا. اقرأه كبيان عن طبقة معاينة تحت الحمل فيصبح الشيء الأكثر فائدة على الصفحة، لأنه ما يواجهه خط أنابيب سريري فعليًا عندما يعتمد على مسار لم يُجهَّز لحركة مرور الإنتاج.

النموذج على الجانب الآخر من هذه المقارنة ليس لديه هذه المشكلة ولا هذا القياس. NV-Reason-CT هو مُستدِلّ NVIDIA الأصلي للتصوير المقطعي ثلاثي الأبعاد (3D CT) بعدد معلمات يبلغ 4.69 مليار، وقابل للتنزيل بموجب OpenMDW-1.1، دون أي رقم منشور للإنتاجية على الإطلاق ودون أي استضافة في أي مكان. لذا يمنحك أحد طرفي هذه المواجهة أوسع سطح إدخال في المجال، مع ملف توفّر عليك أن تصمّم حوله؛ بينما يمنحك الطرف الآخر قدرة واحدة ضيقة مع زمن استجابة عليك قياسه بنفسك. لا يملك أيٌّ منهما لوحة مراقبة يمكنك الوثوق بها من اليوم الأول، ولأسباب متعاكسة.

نموذجان، تعريفان لـ"متعدد الوسائط"

الكلمة تقوم بعمل كبير في كلا وصفي المنتج، ولا يكاد يشترك أي منهما في شيء.

• المُدخلات المقبولة — يقبل Gemini 3.1 Pro النصوص والصور والصوت والفيديو والملفات؛ أما NV-Reason-CT فيقبل حجم NIfTI أحادي القناة بوحدات هاونسفيلد، ولا شيء غير ذلك

• ما معنى «3D» — تعيد NV-Reason-CT أخذ العينات إلى دقة 2 مم متماثلة الخواص على مكعب بطول 384 ملليمترًا وتقطعه إلى رقع بأبعاد 8 × 8 × 8 لشبكة 24 × 24 × 24؛ إدخال الفيديو لدى Gemini 3.1 Pro عبارة عن سلسلة من إطارات ثنائية الأبعاد مع خط زمني

• السياق — 1,048,576 رمزًا داخلة و65,536 خارجة لـ Gemini 3.1 Pro؛ والمجلّد الواحد 13,824 رمزًا مرئيًا لـ NV-Reason-CT، دون اختزال ولا طبقة دمج، ولا توجد نافذة دردشة حوله

• إصدار — 19 فبراير 2026 لـ Gemini 3.1 Pro، على slug معاينة؛ طرح بحثي غير معلن لـ NV-Reason-CT، مع نشاط في المستودع بتاريخ 2 إلى 25 سبتمبر 2026

• السعر — 2 دولار و12 دولارًا لكل مليون رمز حتى 200,000 رمز ثم 4 دولارات و18 دولارًا، مع قراءات الذاكرة المؤقتة بسعر 0.20 دولار وكتابات الذاكرة المؤقتة بسعر 0.375 دولار؛ مقابل أوزان مستضافة ذاتيًا بدون جدول أسعار

• القدرات — الرؤية والصوت واستخدام الأدوات وإخراج JSON والاستدلال في Gemini 3.1 Pro؛ نتائج مُهيكلة حسب المنطقة التشريحية لـ NV-Reason-CT، دون أدوات

• الترخيص والحالة — واجهة برمجة تطبيقات معاينة مستضافة؛ مقابل أوزان OpenMDW-1.1 التي تقول بطاقة نموذجها إنها للأبحاث والتعليم فقط وتنص صراحة على أنها ليست جهازًا طبيًا

مدخل فيديو ومدخل تصوير مقطعي محوسب حجمي يبدوان متجاورين من بعيد، لكنهما لا يمكن أن يكونا أكثر تباعدًا عند النظر عن قرب. الفيديو هو إطارات عبر الزمن. أما فحص التصوير المقطعي فهو حجم ساكن واحد بثلاثة محاور مكانية، ومقياس فيزيائي بالمليمترات، ووحدة كثافة معايَرة، حيث يكون الشيء الذي يُقاس هو كثافة بنية يهم حجمها. سيراقب Gemini 3.1 Pro تسجيلًا جراحيًا ويصف ما حدث. لكنه لن يقيس عقيدة. هذا ليس قيدًا فشلت Google في معالجته؛ إنه مشكلة مختلفة لم يحلها أحد بنموذج عام.

ما الذي تغطيه سجلات المعايير الاثنان، وما الذي تستبعدانه

يتمتع Gemini 3.1 Pro بسجل مستقل وهو سجل جيد على المحاور التي يقيسها.

• GPQA Diamond — 94.1، وهو أعلى رقم في هذه المجموعة بأكملها من المقالات

• Humanity's Last Exam — 47، بدرجة استرجاع للسياق الطويل بلغت 82، وهي مرة أخرى الأعلى في هذه المقارنة

• IFBench وSciCode — 77.14 و58.7

• τ²-Bench — 95.61، مع tau_banking عند 21.44 وTerminal-Bench Hard عند 53.79

• الذكاء والبرمجة من Artificial Analysis — 29.7 و68.8

• زمن الاستجابة المقيس — وسيط زمني يبلغ عشر ثوانٍ حتى أول رمز، ويبدو أنه حد أقصى وليس وسيطًا حقيقيًا، عند 978 رمزًا في الثانية ومعدل خطأ 93.93%

لاحظ شكل ذلك: ملف تعريف للمعرفة والسياق الطويل في أعلى المقارنة، ومؤشر ذكاء في الشريحة الوسطى الدنيا، وقياس للإتاحة غير قابل للاستخدام. الثلاثة جميعًا تصف النموذج نفسه على المسار نفسه. ارتفاع GPQA Diamond يعني أنه يعرف الكثير. أما الدرجة المركبة 29.7 فتعني أنه لا يتصدّر في كل شيء. ومعدل خطأ 93.93% يعني أنه على هذا المسار تحديدًا، لن تكتمل معظم طلباتك — وهذا على الأرجح حقيقة تتعلق بالسعة والتزويد لنقطة نهاية معاينة، وليس خاصية من خصائص الأوزان. لا يمكننا إثبات أيّهما من الخارج. ما يمكننا قوله هو أن أيًّا من هذه الأرقام الثلاثة ليس خطأً مطبعيًا، وأن أي معمارية تقرأ الأول فقط ستواجه أسبوعًا سيئًا.

سجل NV-Reason-CT أضيق ويأتي مع تحفظ مختلف. إن معدل F1 البالغ 0.614 و AUROC البالغ 0.871 على CT-RATE، عبر ثمانية عشر تسمية بعتبة موحدة ثابتة ومطالبة مباشرة بنعم/لا وبدون رأس تصنيف أو تكييف خاص بالمهمة، هي أرقام NVIDIA الخاصة من ورقة NVIDIA الخاصة. مجموعة المقارنة التي تقف خلفها — VoxelFM عند 0.581، Pillar-0 عند 0.544، ClinFusion-8B عند 0.442، CT-CLIP عند 0.398، Merlin عند 0.358، MedGemma 1.5 عند 0.303 — تحتوي فقط على نماذج تصوير. لا يظهر أي نموذج متعدد الوسائط عام، مما يعني أن السؤال "كيف سيكون أداء Gemini 3.1 Pro على CT-RATE" لم يُطرح، فضلاً عن أن يُجاب عليه.

A generated scoreboard titled 'Breadth on one side, depth on the other' with two columns. The left column, headed 'Gemini 3.1 Pro', lists six rows: inputs, text, image, audio, video, file; context, 1,048,576 in and 65,536 out; GPQA Diamond 94.1; AA Intelligence 29.7; route reliability, 93.93% measured error rate; price, $2 and $12 per million tokens, doubling past 200k. The right column, headed 'NV-Reason-CT', lists six rows: input, one-channel NIfTI in Hounsfield units; context, 13,824 visual tokens per volume, no chat window; CT-RATE F1 0.614 and AUROC 0.871; provenance, the authors paper only; route reliability, not applicable, self-hosted; price, no rate card, no published throughput. A footer reads 'The 93.93% error rate describes a preview route under load, not the quality of the weights.'

مشكلة طبقة المعاينة، مطروحة على النحو الصحيح

هذا هو الجزء من المقارنة الذي لا علاقة له إطلاقًا بـ CT، وكل علاقته بتشغيل أي شيء سريري.

معدل خطأ بنسبة 93.93% ليس تدهورًا طفيفًا. إنه مسار تفشل فيه الغالبية العظمى من الاستدعاءات. ورد الفعل الطبيعي هو إعلان أن النموذج غير قابل للاستخدام، وهذا الرد خاطئ لسببين. أولًا، معدل الخطأ المقاس على نقطة نهاية معاينة يعكس السعة والحصة والتوجيه الإقليمي، لا قدرة النموذج. فمستويات المعاينة لدى Google معروفة بأنها مُجهّزة للتقييم لا للإنتاج، والمُعرّف (slug) الذي يحمل اسم معاينة هو مُعرّف يمكن تقييده دون إشعار. ثانيًا، القياس هو لقطة لمسار واحد في لحظة واحدة. وسيتغير. أما ما لن يتغير فهو الدرس: الاعتماد على مسار معاينة هو اعتماد على قرار سعة يتخذه شخص آخر.

التدابير التخفيفية غير براقة، وهي السبب الكامل وراء وجود التوجيه كتخصص لا كمجرد وسيلة مريحة.

• لا تُضمّن أبدًا مُعرّف المعاينة (slug) بشكل ثابت في بيئة الإنتاج — ضع النموذج خلف واجهة بحيث يمكن استبدال ما خلفها من نموذج دون الحاجة إلى نشر

• أعد المحاولة واعتمد بديلاً من مزوّد مختلف أو نموذج مختلف — في مهمة استخراج دفعية، معدل فشل بنسبة 94% يمكن تحمّله إذا وُجّهت حالات الفشل إلى مكان آخر، ويكون قاتلاً إذا لم يحدث ذلك

• قِس معدل الخطأ الخاص بك بدلًا من أن ترث معدلًا جاهزًا — إن نسبة 93.93% هي رقم كتالوجنا لمسار واحد، وستعتمد نسبتك على منطقتك وحجمك وشكل عبء العمل لديك

• أبقِ نموذجًا ثانيًا جاهزًا لأي أمر ذي جدول زمني سريري — نمط الفشل الذي تحمي منه ليس إجابة سيئة، بل ألا تكون هناك إجابة

ينطبق الانضباط نفسه في الاتجاه المعاكس على جانب CT، حيث لا يوجد مسار على الإطلاق. النموذج المستضاف ذاتيًا ليس لديه معدل خطأ من المزود؛ بل لديه معدل خطأ في الأجهزة، وعبء صيانة، وسقف سعة محدد بعدد وحدات GPUs التي اشتريتها. نمط الفشل هو قائمة انتظار، والتخفيف هو الجدولة بدلاً من التبديل الاحتياطي. مشكلة مختلفة، القاعدة نفسها: اعرف الرقم الذي تعتمد عليه فعلاً.

حيث يفيد السياق الطويل حقًا، وحيث لا يفيد

نافذة Gemini 3.1 Pro البالغة 1,048,576 توكن، ودرجة استرجاع السياق الطويل البالغة 82 نقطة، حقيقيتان ويستحق استخدامهما بشكل متعمد بدلًا من افتراضهما.

الموضع الذي تثمر فيه في برنامج CT ليس هو الفحص، بل كل ما يحيط به. تمريرة استخراج واحدة على ملاحظة جراحية طويلة وتقاريرها المرتبطة، مع إبقاء الوثيقة كاملة في السياق بحيث تكون الحقول متسقة فيما بينها. ملخص أترابي يجب أن يستوعب مئات سرديات المرضى دفعة واحدة للعثور على النمط عبرها. مهمة تحويل يلزم فيها أن يكون المخطط ومئة سجل نموذجي وسجل الأخطاء كلها مرئية في الاستدعاء نفسه. تلك مهام تغيّر فيها نافذة طويلة الإجابة، وليس مجرد السهولة.

المكان الذي لا يفيد فيه هو الفحص نفسه، والسبب يستحق الذكر بدقة لأنه الخطأ الذي تستدعيه هذه المواجهة. التصوير المقطعي المحوسب للصدر، عندما يُمثَّل بالطريقة التي يمثّله بها NV-Reason-CT، يكلّف 13,824 توكنًا. يستطيع Gemini 3.1 Pro أن يستوعب سبعين دراسة كهذه داخل نافذته مع مساحة فائضة. القيد ليس المساحة، بل إن مسار الرؤية لدى Gemini 3.1 Pro يتعامل مع الصورة كصورة ذات مقياس بكسل، لذا فإن دراسة مقدَّمة بهذه الطريقة تكون قد فقدت التباعد بين الشرائح ومعايرة الكثافة قبل إصدار أول توكن. يمكنك أن تنفق مليون توكن على مجسّم وما زلت لا تملك مجسّمًا. إن مقارنة الورقة البحثية نفسها تجعل كلفة ذلك ملموسة: MedGemma 1.5 عند 0.303 F1 عند تغذيته بما يصل إلى 85 شريحة محورية، مقابل 0.614 للنموذج الحجمي الأصلي، وهو فارق يقارب الضعف.

أين نندرج، والشيء الوحيد الذي لن نقوله

تُقدَّم Gemini 3.1 Pro عبر OrcaRouter بصيغة google/gemini-3.1-pro-preview بسعر القائمة لدى المزوّد وبهامش ربح صفري، ضمن واجهة برمجة تطبيقات واحدة تغطي أكثر من 200 نموذج. وبالنسبة إلى نموذج يقع حالياً في فئة المعاينة، فإن هذه التركيبة أنفع مما تبدو عليه. ويعني الهامش الصفري أن أي تغيير في سعر المورّد يصل إلينا في اليوم نفسه بدلاً من أن تمتصّه طبقة وسيطة متمسّكة برقم قديم. كما يعني التحويل التلقائي عند الفشل أن المسار الذي يبدأ في التعطّل لا يُسقط معه دفعة كاملة — وهذا ليس أمراً افتراضياً، بالنظر إلى معدّل خطأ مقيس في التسعينيات على أحد المسارات. كما تتيح لك لغة توجيه (DSL) مخصّصة لإرسال الطلبات الفردية إلى النموذج الذي ينبغي أن يتولّى معالجتها، توزيع العمل ذي السياق الطويل على نموذج واحد والعمل الرخيص عالي الحجم على نموذج آخر دون الحاجة إلى صيانة تكاملين.

NV-Reason-CT ليس على منصتنا. ولا أي طراز من NVIDIA. إنها أوزان تقوم بتنزيلها وتشغيلها بنفسك، والتوصيف الصادق هو أن نصفي هذه البنية يقعان في مكانين مختلفين تمامًا: أحدهما خلف واجهة برمجية ذات بطاقة أسعار ومخاطر معاينة، والآخر على عتادك الخاص برخصة OpenMDW-1.1 ورقم إنتاجية عليك تحقيقه بنفسك.

A generated scoreboard titled 'What each side gives you, and what it costs' listing five paired rows. Row one: widest input surface, audio, video, image and file against text only, one modality at a time. Row two: longest context, 1,048,576 tokens in against 13,824 tokens per volume. Row three: highest benchmark, GPQA Diamond 94.1 against CT-RATE F1 0.614. Row four: weakest measured figure, a 93.93% route error rate against no published throughput at all. Row five: dependency, a hosted preview tier against your own GPUs. A footer reads 'Both sides carry a number nobody should build on without measuring it themselves.'A screenshot of the OrcaRouter model page for Gemini 3.1 Pro, showing the identifier google/gemini-3.1-pro-preview with tags for Vision, Audio, Video, Tools, JSON and Reasoning, the description of it as a multimodal model accepting text, image, audio, video and file input, and a side panel listing a 1,048,576-token context window with up to 65,536 output tokens. A stat strip reads $2.00 per million input tokens, $12.00 per million output tokens, a median time to first token, and an error rate of 93.93 percent.

القرار الذي يصمد عند ملامسته للإنتاج

إذا كانت مشكلتك تكمن في فهم النصوص أو الصوت أو الفيديو أو المستندات ضمن سياق طويل، فإن Gemini 3.1 Pro مُقاس بشكل مستقل في صدارة المجال من حيث المعرفة والاستدعاء، وكل ما يفصله عن خط إنتاج جاهز هو موثوقية المسار — وهي مشكلة هندسية قابلة للحل، وليست مشكلة في النموذج. ضعه خلف آلية تجاوز الفشل، ولا تُثبّت مُعرّف المعاينة (preview slug) في الكود، وقِس معدل الخطأ الخاص بك بدلًا من الوثوق بمعدل أي أحد آخر، بما في ذلك معدلنا.

إذا كانت مشكلتك عبارة عن حجم تصوير مقطعي محوسب للصدر أو البطن، فهناك نموذج مفتوح واحد بالضبط في هذه المقارنة يمكنه معالجتها، وهو ليس النموذج ذا النافذة المليون رمز، والرقم الذي ينبغي أن يحكم تخطيطك ليس درجة F1 الخاصة به. بل هو زمن الاستجابة لكل دراسة الذي لم ينشره أحد. قِسه قبل أن تَعِد أي شخص برقم لمعدل الإنتاجية.

تستحق هذه المقارنة أن تُعقد لأنها تفصل بين أمرين يختلطان باستمرار: اتساع المدخلات وعمق التمثيل. لدى Gemini 3.1 Pro أوسع سطح مدخلات طرحه أي أحد، وأفضل استرجاع للسياق الطويل في هذه المجموعة، ومع ذلك لا يستطيع قراءة دراسة CT باعتبارها دراسة CT. أما NV-Reason-CT فيستطيع قراءة واحدة ولا شيء غيرها. يحتاج خط الأنابيب إلى كليهما، ويحتاجهما على بنية تحتية مختلفة، ويحتاج إلى معرفة أي من الرقمين على كل جانب هو الذي سيستدعيك في الثالثة فجرًا.