
NV-Reason-CT مقابل Qwen3.8 Max: الضبط الدقيق والعائلة التي جاء منها
- typesafeجديدTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 لكل مليون رمز · 45 tok/s
- openaiجديدOpenAI: GPT-6 Luna2026-09-2237الذكاء
- openaiجديدOpenAI: GPT-6 Sol2026-09-2248الذكاء
- anthropicجديدAnthropic: Claude Opus 5.52026-09-2258الذكاء
- grokجديدGrok 4.72026-09-2146الذكاء
- OrcaجديدOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 لكل مليون رمز · 182 tok/s
- orcaجديدOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 لكل مليون رمز · 1285 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- openaiOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- googleGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245الذكاء76البرمجة
- anthropicAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز · 119 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 لكل مليون رمز · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236الذكاء69البرمجة
- grokSpaceXAI: Grok 4.62026-08-1244الذكاء77البرمجة
- metaMeta: Muse Spark 1.22026-08-0540الذكاء72البرمجة
السطر الأول من NV-Reason-CT — بطاقة النموذج — تخبرك بشيء يتجاهله معظم الناس. النموذج الأساسي هو Qwen/Qwen3.5-4B، المدرج في بيانات المستودع كعلاقة ضبط دقيق. لذا عندما احتاجت NVIDIA إلى نموذج لغوي لتثبيت محول رؤية Primus 3D عليه، أخذت Qwen. قارن تلك النقطة المرجعية مع Qwen3.8 Max — الرائد الخاص بـ Alibaba بـ 1,000,000 رمز، والذي تم شحنه في 3 أغسطس 2026 — وأنت تنظر إلى ضبط دقيق وشركة عائلية. أحدهما متخصص بحجم 4.69 مليار يقرأ أحجام CT للصدر والبطن وتم نشره على Hugging Face في 8 سبتمبر 2026 بدون إعلان. والآخر رائد عام مع إدخال نص وصورة وفيديو، وبطاقة أسعار منشورة، و37.2 مليون رمز من حركة المرور المقاسة على شبكتنا في الأسبوع الماضي. السؤال المثير للاهتمام ليس أيهما يفوز. بل ما يمكن أن يفعله ضبط دقيق بحجم 4 مليار لا يستطيع الرائد في عائلته فعله، ولماذا الإجابة أكثر تحديدًا مما تتوقع.
ما الذي حققه الضبط الدقيق، على نحو ملموس
إن صياغة NVIDIA نفسها للفجوة دقيقة على نحو غير معتاد، وهي الجملة الأكثر فائدة في المستودع: فمعظم أنظمة الرؤية واللغة «إما أن تعمل على صور ثنائية الأبعاد أو تضغط السمات الحجمية قبل فك ترميز اللغة». وهذا وصف لفئة كاملة من النماذج، ويشمل كل طراز رائد عام متعدد الوسائط في السوق.
الإصلاح معماري وليس مسألة مقياس. حجم إدخال 384×384×384 مم يصبح شبكة 24×24×24 من 13,824 رمزًا بصريًا. تدخل تلك الرموز وإحداثياتها ثلاثية الأبعاد إلى النموذج اللغوي دون اختزال مكاني، ويحافظ 3D MRoPE على العلاقات المكانية داخل المفكك. تُقتطع أحجام الإدخال بطريقة تراعي التشريح إلى الصدر أو البطن باستخدام وحدات هاونسفيلد الرئوية، ثم يُعاد أخذ عيناتها إلى دقة 2 مم متساوية القياس.
اقرأ ذلك في مقابل ما يقبله Qwen3.8 Max. النص والصورة والفيديو — والفيديو هو أقرب شيء في هذه السلسلة إلى مُدخل حجمي، ما يجعله نقطة المقارنة الصادقة لا البلاغية. الفيديو مكدس من إطارات ثنائية الأبعاد مرتبة حسب الزمن. أما حجم التصوير المقطعي المحوسب (CT) فهو مكدس من شرائح ثنائية الأبعاد مرتبة حسب الموضع الفيزيائي على طول المحور z، بوحدات هاونسفيلد، وبتباعد معروف بالملليمتر. كلاهما مصفوفتان ثلاثيّتا الأبعاد. واحد فقط منهما يمتلك نظام إحداثيات فيزيائي يمكن تحديد موقع نتيجة طبيب الأشعة بالنسبة إليه، وواحد فقط منهما يُقاس بوحدة تعني شيئًا خارج مستشعر الصورة. النموذج المدرَّب على الفيديو يتعلم الاستمرارية الزمنية. والنموذج المدرَّب على أحجام التصوير المقطعي المحوسب يتعلم أن كتلة في شريحة ما هي الكتلة نفسها في الشريحة التالية التي تقع أدنى بثمانية ملليمترات.
مدونة التدريب هي الفرق الحقيقي
هنا يتوقف النموذجان تمامًا عن كونهما قابلين للمقارنة، وهذا هو الجزء الذي تخفيه ورقة المواصفات.
تم تدريب NV-Reason-CT من البداية إلى النهاية باستخدام الضبط الدقيق الخاضع للإشراف متبوعًا بتحسين السياسة النسبية الجماعية على ما يقرب من 550,000 مثال أسئلة وأجوبة منظمة مستمدة من 70,111 حجم تصوير مقطعي محوسب فريد. المصادر هي CT-RATE — 47,149 حالة من مستشفى إسطنبول ميديبول الجامعي العملاق مع تقارير الأشعة المقترنة — ومجموعة داخلية من NIH تضم 15,991 حالة، و22,720 حالة من CancerVerse عبر أربع مراحل تباين وثلاثة عشر نوعًا من الأورام الخبيثة. تتضمن المجموعة تقارير موحدة، وأسئلة وأجوبة تركز على التشوهات، وحوار متعدد الجولات، واستدلالًا من تأليف أخصائيي الأشعة منسوخًا من تفسيرات الخبراء المسجلة. تستخدم مرحلة GRPO مكافآت قابلة للتحقق على مجموعات التشوهات الصدرية والبطنية، مما يعني أن إشارة المكافأة تتحقق مما إذا كانت النتيجة المذكورة موجودة في الحجم بدلاً من ما إذا كانت النثر تبدو سريرية.
لم تُنشَر مجموعة تدريب Qwen3.8 Max بأي تفصيل يقارب ذلك، ولن يفيد حتى لو نُشرت، لأن القدرة المستهدفة عامة. وبالمقابل، فإن أرقام Artificial Analysis هي الدليل ذو الصلة: مؤشر Intelligence Index بقيمة 45.4 يضعه في المرتبة 15 من أصل 145 نموذجًا في لقطة API الخاصة بنا، وAA Coding 76.2 في المرتبة 9، وTerminal-Bench 2.1 عند 88.8، وGPQA Diamond 92.8، وHumanity's Last Exam 43.1، وSciCode 52.1، واستدعاء السياق الطويل 80.3. هذه قياسات طرف ثالث، وليست ادعاءات مورّد، مما يجعلها أكثر الأرقام موثوقية على جانبي هذه الصفحة.
مخرجات الاستدلال، عقدان مختلفان
كلا النموذجين يصدران آثار استدلال، وكلاهما يتيح لك إيقافها. ينتهي التشابه عند الواجهة.
يكشف Qwen3.8 Max عن enable_thinking و reasoning_effort، إلى جانب مجموعة معاملات أخذ العينات الكاملة — درجة الحرارة، وtop_p، والبذرة، ومعاملات العقوبة، والمخرجات المهيكلة، واستدعاء الأدوات. إنها قدرة استدلال عامة توجّهها نحو أي شيء لديك. تفكيرها بجودة المسألة التي تعرضها عليها، ولا تملك وسيلة للتحقق من ادعاء ما مقابل أي شيء سوى النص الذي أُعطي لها.
يُبرم استدلال NV-Reason-CT عقدًا أضيق مع القارئ، وتنصّ بطاقة النموذج على هذا الحدّ صراحةً: فالاستدلال المولَّد هو «مخرَج نموذجي قابل للمراجعة، وليس مضمونًا أن يمثّل الحوسبة الداخلية للنموذج». وهذا التحذير يقوم بعمل حقيقي، وهو من نوع الجُمل التي لا تظهر إلا حين يكون الفريق قد فكّر في ما سيفعله الطبيب بمسار يبدو معقولًا. وتصف البطاقة المخرَج بأنه ملاحظات قابلة للمراجعة، وتشخيصات تفريقية، وعدم يقين. أي مسار يمكنك التحقق منه مقابل الصورة الحجمية، بعبارة أخرى، لا مسار لا يسعك إلا قراءته.
الإنتاجية، من المكان الوحيد الذي يمكننا قياسها فيه
مرّر Qwen3.8 Max 37.2 مليون توكن عبر ساحة التجربة الخاصة بـ OrcaRouter خلال الأيام السبعة الماضية. وبلغ وسيط زمن الوصول إلى أول توكن 1.96 ثانية — وهو الأسرع بأريحية بين النماذج في هذه السلسلة — عند 53.3 توكن إخراج في الثانية. وبلغ معدل الخطأ خلال تلك النافذة 3.5%.
هذان الرقمان يشدّان في اتجاهين متعاكسين، وكلاهما مهم. زمن الاستجابة ممتاز ويجعل تكرار التجارب على النموذج ممتعًا. ومعدل الخطأ أعلى بنحو سبعة عشر ضعفًا من نسبة Kimi K3 البالغة 0.21% خلال النافذة الزمنية نفسها، وهذا هو الرقم الذي يحدد ما إذا كنت ستضعه خلف استدعاء متزامن يواجه المستخدم أو مهمة دفعية مع إعادة المحاولات. هذا سلوك مُقاس على شبكتنا، وليس معيارًا مرجعيًا، وهو من النوع الذي لا تخبرك به بطاقة الأسعار أبدًا.
لا يوجد لـ NV-Reason-CT أي قياس مكافئ في أي مكان. إنه نقطة تفتيش BF16 بحجم 10.6 GB مع شيفرة نموذج مخصصة، يُحمَّل باستخدام trust_remote_code=True على عتاد Ampere أو Hopper أو Lovelace، وقد اختبرته NVIDIA على H100 وL40S. لم يُنشر أي p50، ولا معدل خطأ، ولا رقم إنتاجية. أي شخص يخبرك بحجم التعادل الذي عنده تتفوق الاستضافة الذاتية لهذا على الدفع مقابل كل رمز فإنه يخمّن.
السعر والشكل، جنبًا إلى جنب
• السعر — النفقات الرأسمالية لوحدة معالجة الرسومات NV-Reason-CT، لا يوجد سعر لكل رمز مقابل Qwen3.8 Max بقيمة 2.00 / 6.00 دولار لكل مليون رمز، و0.25 دولار للقراءة من الذاكرة المؤقتة، و2.50 دولار للكتابة في الذاكرة المؤقتة
• المُدخل — NV-Reason-CT ثلاثي الأبعاد NIfTI CT بوحدات هانسفيلد، الصدر أو البطن فقط مقابل Qwen.8 Max نص وصورة وفيديو
• السياق — NV-Reason-CT بحجم واحد، بادئة ثابتة من 13,824 رمزًا مقابل Qwen3.8 Max بـ 1,000,000 رمز
• المعلمات — NV-Reason-CT 4.69B إجمالي / 4.35B نشط في مسار CT مقابل Qwen3.8 Max غير معلن
• الترخيص — N-Reason-CT OpenMDW-1.1، الأوزان منشورة مقابل Qwen3.8 Max الاحتكاري، الوصول عبر API فقط
• درجات مستقلة — NV-Reason-CT لا يوجد مقابل Qwen3.8 Max، مؤشر AA للذكاء 45.4، GPQA Diamond 92.8

تكافئ اقتصاديات الذاكرة المؤقتة في Qwen3.8 Max شكلاً محدداً: قراءة مخزنة مؤقتاً بتكلفة 0.25 دولار مقابل إدخال جديد بتكلفة 2.00 دولار تمثل خصماً بمقدار ثمانية أضعاف، كما أن كتابة الذاكرة المؤقتة بتكلفة 2.50 دولار تعني أن بادئة طويلة قابلة لإعادة الاستخدام تسترد تكلفتها بسرعة. هذا هو عبء العمل المتمثل في موجه نظام بالإضافة إلى مستند بروتوكول يُعاد استخدامه عبر آلاف الطلبات. يتمتع NV-Reason-CT بملف تكلفة معاكس — تكلفة حدية شبه معدومة لكل مسح بمجرد شراء وحدة معالجة الرسومات (GPU)، وحد أدنى صارم يتمثل في وحدة معالجة رسومات واحدة تُحتفظ بها إلى أجل غير مسمى.

إدارة العائلة معًا
البنية الطبيعية هنا، ومن الجدير بالذكر أن أحدًا لم ينشرها، هي النموذج المضبوط بدقة للحجم، والنموذج الرائد لكل ما يحيط به. يُنتج NV-Reason-CT النتيجة المهيكلة؛ ويتولى Qwen3.8 Max نص الإحالة، ومطابقة البروتوكول، والترميز، وخطاب المتابعة — العمل النصي عالي الحجم حيث تستحق نافذة المليون رمز وخصم التخزين المؤقت ثماني الأضعاف مكانهما فعلاً.
إذا كان هذا هو خط الأنابيب الخاص بك، فالنصف الأول منه نقطة تفتيش تستضيفها أنت والنصف الثاني رموز تشتريها، والنصف الثاني هو حيث يقوم الراوتر بشيء لا تستطيع نقطة نهاية مورّد واحد القيام به. يُقدَّم Qwen3.8 Max عبر OrcaRouter بسعر Alibaba المعلن دون أي هامش إضافي، لذا فإن 2.00$ / 6.00$ المذكورين أعلاه هو ما تدفعه، وأي تحرّك سعري مستقبلي يظهر على فاتورتك في اليوم نفسه بدلًا من وقت التجديد. التحويل التلقائي عند الفشل بين المزوّدين يكتسب أهمية أكبر من المعتاد عندما يكون معدل الخطأ المقاس للنموذج نفسه 3.5% — فإعادة المحاولة التي تذهب إلى نقطة نهاية سليمة مختلفة هي الفرق بين عثرة عابرة ودفعة فاشلة. ولأن النصف العام من خط الأنابيب هو اسم نموذج واحد خلف نقطة نهاية متوافقة مع OpenAI تغطي أكثر من 200 نموذج، فإن استبداله بشيء آخر لتجربة تمتد أسبوعًا لا يكلف سوى تغيير سلسلة نصية، لا عملية تكامل.
NV-Reason-CT، للتوضيح، ليس على OrcaRouter ولن يكون كذلك — إنه استدلال ثلاثي الأبعاد بكود مخصص تشغّله بنفسك. النسخة الصادقة من قصة التكامل هي أن المتخصص المستضاف ذاتيًا والعمومي الموجَّه يمكن أن يقعا تحت مفتاح واحد، وهذا كل ما في الادعاء.

الحكم الذي يصمد فعلاً
يُدرَج هذا الثنائي تحت تصنيف «أيهما أفضل»، ولا ينبغي أن يُدرَج كذلك. يقيس أطرافٌ ثالثة Qwen3.8 Max في الاستدلال العام، وهو يتفوق على معظم المنافسين؛ أما NV-Reason-CT فلديه جدول واحد بأرقامه الخاصة على معيار CT واحد، وعدد معاملات يبلغ 4.69B لن يكون ملحوظًا في أي مقارنة عامة. على أي معيار عام، يفوز الطراز الرائد، والسبب هو أن المعيار العام هو ما صُمِّم من أجله.
في المهمة الوحيدة التي بُني من أجلها NV-Reason-CT — قراءة حجم تصوير مقطعي محوسب للصدر أو البطن وقول ما يحتويه، مع أثر يمكن لشخص ما التحقق منه — ليس Qwen3.8 Max منافسًا أضعف. فهو لا يملك مُرمِّزًا حجميًا، لذا لا يمكن تشغيله على المُدخل على الإطلاق دون أن يقرر أحدهم أولًا كيفية تسطيح مسح ضوئي إلى صور. هذا القرار هو النقطة التي تُهدَر فيها المعلومات المكانية. وهذا هو بيت القصيد من ضبط دقيق بحجم 4B مع مسار ثلاثي الأبعاد أصلي وبادئة ثابتة من 13,824 رمزًا، وهو السبب في أن الأمر المثير للاهتمام في هذا النموذج هو صِغر عموده الفقري وليس حجمه.
مقارنات في هذه المقالة1
مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا
