
NV-Reason-CT مقابل Gemini 3.1 Pro: أوسع سطح إدخال، ومع ذلك لا يزال ليس قارئًا لـ CT
- typesafeجديدTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 لكل مليون رمز · 506 tok/s
- openaiجديدOpenAI: GPT-6 Luna2026-09-2237الذكاء
- openaiجديدOpenAI: GPT-6 Sol2026-09-2248الذكاء
- anthropicجديدAnthropic: Claude Opus 5.52026-09-2258الذكاء
- grokجديدGrok 4.72026-09-2146الذكاء
- OrcaجديدOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 لكل مليون رمز · 183 tok/s
- orcaجديدOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 لكل مليون رمز · 1285 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- openaiOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- googleGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245الذكاء76البرمجة
- anthropicAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز · 119 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 لكل مليون رمز · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236الذكاء69البرمجة
- grokSpaceXAI: Grok 4.62026-08-1244الذكاء77البرمجة
- metaMeta: Muse Spark 1.22026-08-0540الذكاء72البرمجة
أربعة وتسعون بالمئة. هذا هو معدل الخطأ الذي يسجّله كتالوجنا الخاص حالياً لمسار واحد يقدّم Gemini 3.1 Pro — 93.93%، إلى جانب زمن وسيط للوصول إلى أول رمز يُقرأ على أنه سقف عشر ثوانٍ، ورقم إنتاجية قدره 978 رمزًا في الثانية. اقرأ ذلك كبيان عن النموذج وستخلص إلى نتيجة خاطئة تمامًا. اقرأه كبيان عن طبقة معاينة تحت الحمل فيصبح الشيء الأكثر فائدة على الصفحة، لأنه ما يواجهه خط أنابيب سريري فعليًا عندما يعتمد على مسار لم يُجهَّز لحركة مرور الإنتاج.
النموذج على الجانب الآخر من هذه المقارنة ليس لديه هذه المشكلة ولا هذا القياس. NV-Reason-CT هو مُستدِلّ NVIDIA الأصلي للتصوير المقطعي ثلاثي الأبعاد (3D CT) بعدد معلمات يبلغ 4.69 مليار، وقابل للتنزيل بموجب OpenMDW-1.1، دون أي رقم منشور للإنتاجية على الإطلاق ودون أي استضافة في أي مكان. لذا يمنحك أحد طرفي هذه المواجهة أوسع سطح إدخال في المجال، مع ملف توفّر عليك أن تصمّم حوله؛ بينما يمنحك الطرف الآخر قدرة واحدة ضيقة مع زمن استجابة عليك قياسه بنفسك. لا يملك أيٌّ منهما لوحة مراقبة يمكنك الوثوق بها من اليوم الأول، ولأسباب متعاكسة.
نموذجان، تعريفان لـ"متعدد الوسائط"
الكلمة تقوم بعمل كبير في كلا وصفي المنتج، ولا يكاد يشترك أي منهما في شيء.
• المُدخلات المقبولة — يقبل Gemini 3.1 Pro النصوص والصور والصوت والفيديو والملفات؛ أما NV-Reason-CT فيقبل حجم NIfTI أحادي القناة بوحدات هاونسفيلد، ولا شيء غير ذلك
• ما معنى «3D» — تعيد NV-Reason-CT أخذ العينات إلى دقة 2 مم متماثلة الخواص على مكعب بطول 384 ملليمترًا وتقطعه إلى رقع بأبعاد 8 × 8 × 8 لشبكة 24 × 24 × 24؛ إدخال الفيديو لدى Gemini 3.1 Pro عبارة عن سلسلة من إطارات ثنائية الأبعاد مع خط زمني
• السياق — 1,048,576 رمزًا داخلة و65,536 خارجة لـ Gemini 3.1 Pro؛ والمجلّد الواحد 13,824 رمزًا مرئيًا لـ NV-Reason-CT، دون اختزال ولا طبقة دمج، ولا توجد نافذة دردشة حوله
• إصدار — 19 فبراير 2026 لـ Gemini 3.1 Pro، على slug معاينة؛ طرح بحثي غير معلن لـ NV-Reason-CT، مع نشاط في المستودع بتاريخ 2 إلى 25 سبتمبر 2026
• السعر — 2 دولار و12 دولارًا لكل مليون رمز حتى 200,000 رمز ثم 4 دولارات و18 دولارًا، مع قراءات الذاكرة المؤقتة بسعر 0.20 دولار وكتابات الذاكرة المؤقتة بسعر 0.375 دولار؛ مقابل أوزان مستضافة ذاتيًا بدون جدول أسعار
• القدرات — الرؤية والصوت واستخدام الأدوات وإخراج JSON والاستدلال في Gemini 3.1 Pro؛ نتائج مُهيكلة حسب المنطقة التشريحية لـ NV-Reason-CT، دون أدوات
• الترخيص والحالة — واجهة برمجة تطبيقات معاينة مستضافة؛ مقابل أوزان OpenMDW-1.1 التي تقول بطاقة نموذجها إنها للأبحاث والتعليم فقط وتنص صراحة على أنها ليست جهازًا طبيًا
مدخل فيديو ومدخل تصوير مقطعي محوسب حجمي يبدوان متجاورين من بعيد، لكنهما لا يمكن أن يكونا أكثر تباعدًا عند النظر عن قرب. الفيديو هو إطارات عبر الزمن. أما فحص التصوير المقطعي فهو حجم ساكن واحد بثلاثة محاور مكانية، ومقياس فيزيائي بالمليمترات، ووحدة كثافة معايَرة، حيث يكون الشيء الذي يُقاس هو كثافة بنية يهم حجمها. سيراقب Gemini 3.1 Pro تسجيلًا جراحيًا ويصف ما حدث. لكنه لن يقيس عقيدة. هذا ليس قيدًا فشلت Google في معالجته؛ إنه مشكلة مختلفة لم يحلها أحد بنموذج عام.
ما الذي تغطيه سجلات المعايير الاثنان، وما الذي تستبعدانه
يتمتع Gemini 3.1 Pro بسجل مستقل وهو سجل جيد على المحاور التي يقيسها.
• GPQA Diamond — 94.1، وهو أعلى رقم في هذه المجموعة بأكملها من المقالات
• Humanity's Last Exam — 47، بدرجة استرجاع للسياق الطويل بلغت 82، وهي مرة أخرى الأعلى في هذه المقارنة
• IFBench وSciCode — 77.14 و58.7
• τ²-Bench — 95.61، مع tau_banking عند 21.44 وTerminal-Bench Hard عند 53.79
• الذكاء والبرمجة من Artificial Analysis — 29.7 و68.8
• زمن الاستجابة المقيس — وسيط زمني يبلغ عشر ثوانٍ حتى أول رمز، ويبدو أنه حد أقصى وليس وسيطًا حقيقيًا، عند 978 رمزًا في الثانية ومعدل خطأ 93.93%
لاحظ شكل ذلك: ملف تعريف للمعرفة والسياق الطويل في أعلى المقارنة، ومؤشر ذكاء في الشريحة الوسطى الدنيا، وقياس للإتاحة غير قابل للاستخدام. الثلاثة جميعًا تصف النموذج نفسه على المسار نفسه. ارتفاع GPQA Diamond يعني أنه يعرف الكثير. أما الدرجة المركبة 29.7 فتعني أنه لا يتصدّر في كل شيء. ومعدل خطأ 93.93% يعني أنه على هذا المسار تحديدًا، لن تكتمل معظم طلباتك — وهذا على الأرجح حقيقة تتعلق بالسعة والتزويد لنقطة نهاية معاينة، وليس خاصية من خصائص الأوزان. لا يمكننا إثبات أيّهما من الخارج. ما يمكننا قوله هو أن أيًّا من هذه الأرقام الثلاثة ليس خطأً مطبعيًا، وأن أي معمارية تقرأ الأول فقط ستواجه أسبوعًا سيئًا.
سجل NV-Reason-CT أضيق ويأتي مع تحفظ مختلف. إن معدل F1 البالغ 0.614 و AUROC البالغ 0.871 على CT-RATE، عبر ثمانية عشر تسمية بعتبة موحدة ثابتة ومطالبة مباشرة بنعم/لا وبدون رأس تصنيف أو تكييف خاص بالمهمة، هي أرقام NVIDIA الخاصة من ورقة NVIDIA الخاصة. مجموعة المقارنة التي تقف خلفها — VoxelFM عند 0.581، Pillar-0 عند 0.544، ClinFusion-8B عند 0.442، CT-CLIP عند 0.398، Merlin عند 0.358، MedGemma 1.5 عند 0.303 — تحتوي فقط على نماذج تصوير. لا يظهر أي نموذج متعدد الوسائط عام، مما يعني أن السؤال "كيف سيكون أداء Gemini 3.1 Pro على CT-RATE" لم يُطرح، فضلاً عن أن يُجاب عليه.

مشكلة طبقة المعاينة، مطروحة على النحو الصحيح
هذا هو الجزء من المقارنة الذي لا علاقة له إطلاقًا بـ CT، وكل علاقته بتشغيل أي شيء سريري.
معدل خطأ بنسبة 93.93% ليس تدهورًا طفيفًا. إنه مسار تفشل فيه الغالبية العظمى من الاستدعاءات. ورد الفعل الطبيعي هو إعلان أن النموذج غير قابل للاستخدام، وهذا الرد خاطئ لسببين. أولًا، معدل الخطأ المقاس على نقطة نهاية معاينة يعكس السعة والحصة والتوجيه الإقليمي، لا قدرة النموذج. فمستويات المعاينة لدى Google معروفة بأنها مُجهّزة للتقييم لا للإنتاج، والمُعرّف (slug) الذي يحمل اسم معاينة هو مُعرّف يمكن تقييده دون إشعار. ثانيًا، القياس هو لقطة لمسار واحد في لحظة واحدة. وسيتغير. أما ما لن يتغير فهو الدرس: الاعتماد على مسار معاينة هو اعتماد على قرار سعة يتخذه شخص آخر.
التدابير التخفيفية غير براقة، وهي السبب الكامل وراء وجود التوجيه كتخصص لا كمجرد وسيلة مريحة.
• لا تُضمّن أبدًا مُعرّف المعاينة (slug) بشكل ثابت في بيئة الإنتاج — ضع النموذج خلف واجهة بحيث يمكن استبدال ما خلفها من نموذج دون الحاجة إلى نشر
• أعد المحاولة واعتمد بديلاً من مزوّد مختلف أو نموذج مختلف — في مهمة استخراج دفعية، معدل فشل بنسبة 94% يمكن تحمّله إذا وُجّهت حالات الفشل إلى مكان آخر، ويكون قاتلاً إذا لم يحدث ذلك
• قِس معدل الخطأ الخاص بك بدلًا من أن ترث معدلًا جاهزًا — إن نسبة 93.93% هي رقم كتالوجنا لمسار واحد، وستعتمد نسبتك على منطقتك وحجمك وشكل عبء العمل لديك
• أبقِ نموذجًا ثانيًا جاهزًا لأي أمر ذي جدول زمني سريري — نمط الفشل الذي تحمي منه ليس إجابة سيئة، بل ألا تكون هناك إجابة
ينطبق الانضباط نفسه في الاتجاه المعاكس على جانب CT، حيث لا يوجد مسار على الإطلاق. النموذج المستضاف ذاتيًا ليس لديه معدل خطأ من المزود؛ بل لديه معدل خطأ في الأجهزة، وعبء صيانة، وسقف سعة محدد بعدد وحدات GPUs التي اشتريتها. نمط الفشل هو قائمة انتظار، والتخفيف هو الجدولة بدلاً من التبديل الاحتياطي. مشكلة مختلفة، القاعدة نفسها: اعرف الرقم الذي تعتمد عليه فعلاً.
حيث يفيد السياق الطويل حقًا، وحيث لا يفيد
نافذة Gemini 3.1 Pro البالغة 1,048,576 توكن، ودرجة استرجاع السياق الطويل البالغة 82 نقطة، حقيقيتان ويستحق استخدامهما بشكل متعمد بدلًا من افتراضهما.
الموضع الذي تثمر فيه في برنامج CT ليس هو الفحص، بل كل ما يحيط به. تمريرة استخراج واحدة على ملاحظة جراحية طويلة وتقاريرها المرتبطة، مع إبقاء الوثيقة كاملة في السياق بحيث تكون الحقول متسقة فيما بينها. ملخص أترابي يجب أن يستوعب مئات سرديات المرضى دفعة واحدة للعثور على النمط عبرها. مهمة تحويل يلزم فيها أن يكون المخطط ومئة سجل نموذجي وسجل الأخطاء كلها مرئية في الاستدعاء نفسه. تلك مهام تغيّر فيها نافذة طويلة الإجابة، وليس مجرد السهولة.
المكان الذي لا يفيد فيه هو الفحص نفسه، والسبب يستحق الذكر بدقة لأنه الخطأ الذي تستدعيه هذه المواجهة. التصوير المقطعي المحوسب للصدر، عندما يُمثَّل بالطريقة التي يمثّله بها NV-Reason-CT، يكلّف 13,824 توكنًا. يستطيع Gemini 3.1 Pro أن يستوعب سبعين دراسة كهذه داخل نافذته مع مساحة فائضة. القيد ليس المساحة، بل إن مسار الرؤية لدى Gemini 3.1 Pro يتعامل مع الصورة كصورة ذات مقياس بكسل، لذا فإن دراسة مقدَّمة بهذه الطريقة تكون قد فقدت التباعد بين الشرائح ومعايرة الكثافة قبل إصدار أول توكن. يمكنك أن تنفق مليون توكن على مجسّم وما زلت لا تملك مجسّمًا. إن مقارنة الورقة البحثية نفسها تجعل كلفة ذلك ملموسة: MedGemma 1.5 عند 0.303 F1 عند تغذيته بما يصل إلى 85 شريحة محورية، مقابل 0.614 للنموذج الحجمي الأصلي، وهو فارق يقارب الضعف.
أين نندرج، والشيء الوحيد الذي لن نقوله
تُقدَّم Gemini 3.1 Pro عبر OrcaRouter بصيغة google/gemini-3.1-pro-preview بسعر القائمة لدى المزوّد وبهامش ربح صفري، ضمن واجهة برمجة تطبيقات واحدة تغطي أكثر من 200 نموذج. وبالنسبة إلى نموذج يقع حالياً في فئة المعاينة، فإن هذه التركيبة أنفع مما تبدو عليه. ويعني الهامش الصفري أن أي تغيير في سعر المورّد يصل إلينا في اليوم نفسه بدلاً من أن تمتصّه طبقة وسيطة متمسّكة برقم قديم. كما يعني التحويل التلقائي عند الفشل أن المسار الذي يبدأ في التعطّل لا يُسقط معه دفعة كاملة — وهذا ليس أمراً افتراضياً، بالنظر إلى معدّل خطأ مقيس في التسعينيات على أحد المسارات. كما تتيح لك لغة توجيه (DSL) مخصّصة لإرسال الطلبات الفردية إلى النموذج الذي ينبغي أن يتولّى معالجتها، توزيع العمل ذي السياق الطويل على نموذج واحد والعمل الرخيص عالي الحجم على نموذج آخر دون الحاجة إلى صيانة تكاملين.
NV-Reason-CT ليس على منصتنا. ولا أي طراز من NVIDIA. إنها أوزان تقوم بتنزيلها وتشغيلها بنفسك، والتوصيف الصادق هو أن نصفي هذه البنية يقعان في مكانين مختلفين تمامًا: أحدهما خلف واجهة برمجية ذات بطاقة أسعار ومخاطر معاينة، والآخر على عتادك الخاص برخصة OpenMDW-1.1 ورقم إنتاجية عليك تحقيقه بنفسك.


القرار الذي يصمد عند ملامسته للإنتاج
إذا كانت مشكلتك تكمن في فهم النصوص أو الصوت أو الفيديو أو المستندات ضمن سياق طويل، فإن Gemini 3.1 Pro مُقاس بشكل مستقل في صدارة المجال من حيث المعرفة والاستدعاء، وكل ما يفصله عن خط إنتاج جاهز هو موثوقية المسار — وهي مشكلة هندسية قابلة للحل، وليست مشكلة في النموذج. ضعه خلف آلية تجاوز الفشل، ولا تُثبّت مُعرّف المعاينة (preview slug) في الكود، وقِس معدل الخطأ الخاص بك بدلًا من الوثوق بمعدل أي أحد آخر، بما في ذلك معدلنا.
إذا كانت مشكلتك عبارة عن حجم تصوير مقطعي محوسب للصدر أو البطن، فهناك نموذج مفتوح واحد بالضبط في هذه المقارنة يمكنه معالجتها، وهو ليس النموذج ذا النافذة المليون رمز، والرقم الذي ينبغي أن يحكم تخطيطك ليس درجة F1 الخاصة به. بل هو زمن الاستجابة لكل دراسة الذي لم ينشره أحد. قِسه قبل أن تَعِد أي شخص برقم لمعدل الإنتاجية.
تستحق هذه المقارنة أن تُعقد لأنها تفصل بين أمرين يختلطان باستمرار: اتساع المدخلات وعمق التمثيل. لدى Gemini 3.1 Pro أوسع سطح مدخلات طرحه أي أحد، وأفضل استرجاع للسياق الطويل في هذه المجموعة، ومع ذلك لا يستطيع قراءة دراسة CT باعتبارها دراسة CT. أما NV-Reason-CT فيستطيع قراءة واحدة ولا شيء غيرها. يحتاج خط الأنابيب إلى كليهما، ويحتاجهما على بنية تحتية مختلفة، ويحتاج إلى معرفة أي من الرقمين على كل جانب هو الذي سيستدعيك في الثالثة فجرًا.
