بطاقة رئيسية مُولَّدة بعنوان «NV-Reason-CT مقابل Kimi K3» وعنوان فرعي «210 تنزيلات و588 مليون توكن». ثلاث شرائح صغيرة تمتد على طول أسفل البطاقة: «210 تنزيلات من HF مقابل 587.8 مليون توكن / 7 أيام»، و«خطأ مُقاس بنسبة 0.21% على شبكتنا»، و«مجلد واحد مقابل 1,048,576 توكن». ويُركَّب شعار OrcaRouter في أسفل اليمين.
Guides & Insights

NV-Reason-CT مقابل Kimi K3: 210 تنزيلات و588 مليون توكن

الكاتب

Elias Hawthorne

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج →
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

حُمِّل أحد هذين النموذجين 210 مرات من Hugging Face. أما الآخر فقد مرّر 588 مليون رمز عبر ساحة التجربة الخاصة بنا خلال الأيام السبعة الماضية. كلاهما مفتوح الأوزان، وكلاهما قابل للتنزيل الآن، والفجوة بين هذين الرقمين هي أكثر ما يفيد في هذه المقارنة. NV-Reason-CT هو نموذج NVIDIA للرؤية واللغة ثلاثي الأبعاد بمعاملات 4.69B والمخصص للتصوير المقطعي للصدر والبطن، نُشر على Hugging Face في 8 سبتمبر 2026 دون أي إعلان. Kimi K3 هو النموذج الرائد من MoonshotAI بسعة 1,048,576 رمزًا، طُرح في 15 يوليو 2026 وأصبح الآن أحد أكثر النماذج انشغالًا على شبكتنا. كلاهما "مفتوح" بالمعنى الذي يهم في استمارة الشراء. لكنهما ليسا مفتوحين بالطريقة نفسها على الإطلاق.

معنيان لعبارة "you can download it"

ابدأ بما يودعه كل تنزيل فعليًا على قرصك، لأن هنا تحديدًا تتراخى معظم مقارنات الأوزان المفتوحة.

NV-Reason-CT يمنحك model.safetensors بحجم يقارب 10.6 جيجابايت بصيغة BF16، بالإضافة إلى model.py و ملف ضخم processor.py — 26 كيلوبايت من كود معالجة مخصص ينفذ الاقتصاص الواعي بالتشريح، وإعادة التشكيل بدقة 2 مم، وتقسيم الرقع ثلاثي الأبعاد. تقوم بتحميله باستخدام trust_remote_code=True، مما يعني أنك تنفذ كود مستودع NVIDIA داخل عمليتك. يتطلب الاستدلال CUDA PyTorch، وتذكر البطاقة Ampere و Hopper و Lovelace، تم اختبارها على H100 و L40S. المدخل هو حجم NIfTI واحد في كل مرة. لا توجد قصة معالجة دفعية منشورة، ولا رقم إنتاجية، ولا تكوين خدمة في المستودع يتجاوز inference.py مثال.

يمنحك Kimi K3 نموذجًا استدلاليًا عام الأغراض بنافذة سياق تبلغ 1,048,576 توكن، وإدخال نصي وصوري، واستدعاء أدوات أصلي، ومخرجات مُهيكلة، وجهد استدلالي قابل للضبط. إنه النموذج الذي قد تلجأ إليه لقراءة مئة إرشاد سريري في طلب واحد، أو تقارير قسم تمتد لعقد من الزمن. درجة الاستدعاء طويلة السياق في Artificial Analysis هي 88.7 — وهي الأعلى بين النماذج في هذه السلسلة، وتتجاوز Grok 4.6 البالغة 80.3 بمقدار 8.4 نقاط كاملة.

بكل وضوح: NV-Reason-CT هو نقطة حفظ متخصصة ذات سطح إدخال ضيق وشيفرة مخصصة يجب أن تثق بها وتحافظ عليها. أما Kimi K3 فهو نموذج عام ذو سطح إدخال واسع يتصرف كبنية تحتية. كلاهما قابل للتنزيل. واحد فقط منهما بديل جاهز للاستخدام مباشرة.

أدلة التصوير المقطعي المحوسب، كاملةً، وهي قصيرة.

كل ما هو معروف علنًا عن جودة NV-Reason-CT يستند إلى جدول واحد في بطاقة النموذج الخاصة به: مهمة التصنيف ذات 18 وسمًا في CT-RATE عند عتبة موحّدة ثابتة، مع تنبيه مباشر بنعم/لا، دون رأس تصنيف، ودون تكييف خاص بالمهمة. Macro-F1 0.614، Macro-AUROC 0.871.

صفوف المقارنة هي VoxelFM عند 0.581/0.870، وPillar-0 عند 0.544/0.861، وClinFusion-8B عند 0.442، وCT-CLIP عند 0.398/0.733، وMerlin عند 0.358/0.662، وMedGemma 1.5 عند 0.303. كل واحد من هذه الأرقام هو رقم مُبلَّغ عنه من المورّد في بطاقة NVIDIA، ولم يتم إعادة إنتاج أي منها بشكل مستقل حتى الآن — فالورقة البحثية عمرها يومان فقط.

ما يثبته الجدول محدود ويستحق أن يُقال بدقة: نموذج ثلاثي الأبعاد توليدي بلا رأس مخصص لمهمة يتفوق على خطوط الأساس للتدريب المسبق التبايني ثلاثي الأبعاد وعلى نموذج طليعي قائم على الشرائح في تصنيف CT ذي 18 تسمية. وما لا يثبته هو أي شيء يتعلق بالاستدلال العام، أو بأي أنماط تصوير غير CT الصدر والبطن، أو بأي ميزة في AUROC — فـ 0.871 مقابل 0.870 تعادل يرتدي فاصلة عشرية.

أرقام Kimi K3، والتحفظ الخاص بلوحة النماذج مفتوحة الأوزان

تقيس Artificial Analysis نموذج Kimi K3 بمؤشر ذكاء يبلغ 43.6، مما يضعه في المرتبة 19 من بين 145 نموذجًا في ذلك التصنيف في لقطة واجهة برمجة تطبيقات النماذج لدينا للتصنيف. درجة GPQA Diamond الخاصة به هي 93.5، وHumanity's Last Exam 46.9، وSciCode 59.5، وTerminal-Bench 2.1 85.0، وAA Coding 76.2 في المرتبة 9، و𝜏²-banking 46.0.

ثمة ادعاء واحد بشأن الترتيب يحتاج إلى حذر، لأنه يسهل الخطأ فيه وقد أُخطئ فيه من قبل. يحتل مؤشر AA Intelligence Index البالغ 44 الخاص بـ Kimi K3 المرتبة الثالثة بين النماذج المفتوحة الأوزان على لوحة الأوزان المفتوحة، خلف MiMo-V2.6-Pro عند 46 وGLM-5.3 عند 45. وهو ليس المتصدر على تلك اللوحة، ولا ينافس على اللوحة نفسها التي يتنافس عليها Grok 4.6 — إذ تسجّل Artificial Analysis أن Grok 4.6 مملوك، لذا فإن 44 الخاصة به تنتمي إلى التصنيف العام، لا إلى تصنيف الأوزان المفتوحة. يبدو المؤشران متطابقين وهما ليسا كذلك.

ما يراه المشغّل فعليًا

من هنا يأتي الرقم 588 مليون، ويستحق أن يُشرح بالتفصيل لأنه الدليل الوحيد في هذا المقال الذي يخصّنا نحن لا يسويق أي جهة أخرى.

خلال الأيام السبعة الماضية، نقلت Kimi K3 587.8 مليون رمز عبر ملعب OrcaRouter. كان الزمن الوسيط للرمز الأول 7.8 ثانية، وأنتجت 42.9 رمز إخراج في الثانية، وكان معدل الخطأ خلال تلك الفترة 0.21% — فشل واحد في حوالي 480 طلبًا. معدل الخطأ المقاس هذا هو الشيء الذي لا يمكنك الحصول عليه من بطاقة النموذج، وهو الرقم الذي يحدد ما إذا كان النموذج آمنًا لوضعه خلف مهمة دفعية.

بالنسبة لـ NV-Reason-CT لا يوجد نظير، لأنه ليس نقطة نهاية مستضافة في أي مكان — إنه نقطة تفتيش تشغلها بنفسك. لا يوجد p50، ولا معدل خطأ، ولا وقت تشغيل، ولا جهة يمكن التحويل إليها عند الفشل. هذا ليس انتقاصًا؛ إنها حقيقة هيكلية بشأن الاستضافة الذاتية، وهي السبب في أن مجموعة بحثية يمكنها تبني NV-Reason-CT يوم الثلاثاء بينما فريق الإنتاج عمومًا لا يستطيع.

إذا كنت تشغّل كلا النصفين من هذا — Kimi K3 كطبقة عامة مستضافة وNV-Reason-CT على جهاز GPU الخاص بك — فإن جانب التوجيه هو حيث يحصل النصف المستضاف على مرونته. يُقدَّم Kimi K3 بسعر قائمة Moonshot نفسه البالغ 3.00 دولارات لكل مليون إدخال و15.00 دولارًا لكل مليون إخراج دون أي هامش ربح، ومعدل قراءة الذاكرة المؤقتة لديه البالغ 0.30 دولار لكل مليون هو عُشر سعر الإدخال، ولأن السعر يُمرَّر دون تغيير، فإن أي خفض سعر من المورّد يصل إلى فاتورتك في اليوم نفسه. التبديل التلقائي عند الفشل عبر المزوّدين هو ما يُبقي مهمة دفعية على قيد الحياة عندما تتذبذب نقطة نهاية أحد المصادر — وعند معدل خطأ 0.21%، تكون التذبذبات نادرة بما يكفي ليكون من السهل نسيانها حتى تصبح غير نادرة.

لا تتشابه أشكال التكلفة مع بعضها البعض

• السعر — النفقات الرأسمالية لوحدات GPU الخاصة بـ NV-Reason-CT بالإضافة إلى حزمة الخدمة الخاصة بك مقابل Kimi K3 بسعر 3.00 دولارات / 15.00 دولارًا لكل مليون، و0.30 دولار لقراءة من الذاكرة المؤقتة

• الحد الأدنى من الإنفاق القابل للتطبيق — NV-Reason-CT على وحدة معالجة رسوميات من طراز Ampere أو أحدث محتجَزة إلى أجل غير مسمى مقابل Kimi K3 طلب واحد

• السياق — NV-Reason-CT مجلد واحد، 13,824 توكن ثابت مقابل Kimi K3 1,048,576 توكن

• التكلفة الحدية للطلب الألف — NV-Reason-CT صفر فعليًا بمجرد دفع ثمن GPU، مقابل Kimi K3 التي تتناسب خطيًا مع عدد الرموز

• أين ينهار أولًا — إنتاجية NV-Reason-CT غير الموثوقة وغياب أي طرح للتجميع مقابل تكلفة السياق الطويل لدى Kimi K3 عند مليون رمز لكل طلب

• الطرائق — NV-Reason-CT 3D NIfTI، الصدر أو البطن مقابل Kimi K3 النص والصورة، أي شيء

A generated scoreboard titled 'NV-Reason-CT vs Kimi K3 - the scoreboard'. Left column 'NV-Reason-CT': Price GPU capex plus your serving stack; Minimum viable spend one Ampere-or-newer GPU; Context one volume, 13,824 tokens; Marginal cost of request #1000 effectively zero; Breaks first at unverified throughput, no batching; Modalities 3D NIfTI, chest or abdomen. Right column 'Kimi K3': Price $3.00 / $15.00 per M, $0.30 cached read; Minimum viable spend one request; Context 1,048,576 tokens; Marginal cost of request #1000 linear in tokens; Breaks first at long-context cost at 1M per request; Modalities text and image, anything. A footer reads 'Kimi K3 traffic and error rate measured on OrcaRouter's playground over seven days; NV-Reason-CT has no hosted endpoint to measure.'

تنقلب المعادلة الاقتصادية حسب الحجم. لا يكلّف Kimi K3 شيئًا عند البدء، ويتوسّع خطيًا. أما NV-Reason-CT فيكلّف وحدة معالجة رسومات واحدة عند البدء، ثم يتوسّع بشكل شبه مسطّح — ولهذا فإن 210 تنزيلات ليست إشارة فشل. إنه الرقم الصحيح لنقطة حفظ جمهورها مؤسسات تملك العتاد بالفعل، ولن تظهر أبدًا في أي إحصاء لإنتاجية الرموز على الإطلاق.

A screenshot of NVIDIA's Hugging Face model page for NV-Reason-CT, showing the model card header with Like 1 and 0 followers, the Image-Text-to-Text and Transformers and Safetensors tags, the qwen3_5, medical-imaging, ct, 3d-vlm and custom_code tags, 'Downloads last month 210', the 5B-parameter BF16 size row, the model description describing the 384x384x384-mm volume becoming a 24x24x24 grid of 13,824 visual tokens with no spatial downsampling, the training paragraph citing roughly 550,000 structured QA examples from 70,111 unique CT volumes, a side panel showing Base model Qwen/Qwen3.5-4B and the CT-RATE and CancerVerse datasets, and the arXiv 2609.27511 paper link.

أي واحد تختاره فعليًا

إذا كانت المهمة هي قراءة حجم CT وإنتاج نتيجة مُهيكلة مع مسار استدلال، فإن Kimi K3 لا يستطيع القيام بذلك بينما يستطيع NV-Reason-CT ذلك. ليس الأمر «يفعلها بشكل أسوأ» — بل لا يستطيع، لأنه لا يوجد أي مُشفّر حجمي في أي جزء منه، ولأن تسطيح المسح إلى صور أولًا يتجاهل العلاقات المكانية التي وُجد المسار ثلاثي الأبعاد للحفاظ عليها.

إذا كانت المهمة تتمثل في قراءة 400 صفحة من ملاحظات الإحالة، ومطابقتها مع مستند بروتوكول، وإصدار مخرجات منظمة، فإن NV-Reason-CT ليس في الصورة، وKimi K3 هو أحد أفضل الحلول المتاحة، بمعدل خطأ مُقاس أقل من ربع في المئة على شبكتنا.

A screenshot of the OrcaRouter model page for Kimi K3, showing the identifier kimi/kimi-k3, input text + image, output text, the Vision, Tools, JSON and Reasoning badges, a 1M-token context window with a p50 time to first token of 7.77 seconds, the description of it as MoonshotAI's 2.8-trillion-parameter Mixture-of-Experts flagship built for long-horizon coding, OpenAI-compatible code samples pointing at https://api.orcarouter.ai/v1, and a stat strip reading $3.00 per million input tokens, $15.00 per million output tokens and 591.2M tokens of seven-day traffic.

القرار الحقيقي ليس بين الاثنين. بل هو ما إذا كانت مشكلتك مشكلة حجم أم مشكلة نص، والفجوة بين 210 و588 مليونًا ليست سوى ما يبدو عليه هذا التمييز من الخارج. أحد النموذجين ورقة بحثية مرفقة بأوزان. والآخر قطعة من البنية التحتية. كلاهما يستحق الاقتناء؛ ولا يغني أحدهما عن الآخر.

مقارنات في هذه المقالة1

مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا