
NV-Reason-CT مقابل GLM-5.2: أحد هذين أصبح مهملًا، وهو ليس الذي تظنه
- typesafeجديدTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 لكل مليون رمز · 97 tok/s
- openaiجديدOpenAI: GPT-6 Luna2026-09-2237الذكاء
- openaiجديدOpenAI: GPT-6 Sol2026-09-2248الذكاء
- anthropicجديدAnthropic: Claude Opus 5.52026-09-2258الذكاء
- grokجديدGrok 4.72026-09-2146الذكاء
- OrcaجديدOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 لكل مليون رمز · 182 tok/s
- orcaجديدOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 لكل مليون رمز · 1285 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- openaiOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- googleGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245الذكاء76البرمجة
- anthropicAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز · 119 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 لكل مليون رمز · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236الذكاء69البرمجة
- grokSpaceXAI: Grok 4.62026-08-1244الذكاء77البرمجة
- metaMeta: Muse Spark 1.22026-08-0540الذكاء72البرمجة
النموذج الأقدم في هذه المقارنة هو الذي يجري إحالته إلى التقاعد. GLM-5.2 صدر في 16 يونيو 2026؛ NV-Reason-CT لديه نشاط في المستودع بتاريخ يتراوح بين 2 و25 سبتمبر 2026. قد تتوقع أن يكون نموذج سبتمبر هو المجهول، وأن يكون نموذج يونيو هو الخيار المحسوم. والعكس صحيح على المحور المهم لخط أنابيب النصوص: فقد استُبدل GLM-5.2 بـ GLM-5.3، الذي طُرح في 18 أغسطس 2026، وهو الآن يحمل علامة إهمال على لوحة الصدارة المستقلة حيث تُنشر أرقامه. أما NV-Reason-CT، مهما كان ما لا يزال غير محسوم بشأنه، فهو الإصدار الحالي للشيء الوحيد الذي يفعله.
إذن، أول جملة مفيدة في هذا المقال هي الجملة التي يُرجَّح أن يكون القارئ أقل احتمالًا لامتلاكها: إذا كنت تبدأ بناءً نصيًا اليوم وتمتد يدك إلى GLM-5.2 بحكم العادة، فتوقف وانظر إلى GLM-5.3 أولًا. فهو يكلّف 1.26 دولار لكل مليون رمز إدخال و3.96 دولار لكل مليون رمز إخراج، مقابل 1.40 دولار و4.40 دولار لـ GLM-5.2 — فهو أحدث وأرخص معًا — ومؤشره المستقل للذكاء 44.8 مقابل 33.7، وهو ارتفاع في المقياس نفسه لا خطوة جانبية. وهذا قرار منفصل عن أي شيء له علاقة بـ CT، ويستحق أن يُتخذ بشكل منفصل.
النموذجان، والنوعان المختلفان من البائت
هناك تمييز حقيقي بين نموذج قديم ونموذج تجاوزه غيره، وهذا الاقتران يجعله ملموسًا.
• وظيفته — يقرأ NV-Reason-CT حجم تصوير مقطعي محوسب للصدر أو البطن ويُصدر نتائج مُهيكلة حسب المنطقة التشريحية؛ أما GLM-5.2 فهو نموذج لغوي نصي فقط مخصص للاستدلال والبرمجة ومعالجة المستندات الطويلة
• صدر — تعود مخرجات NV-Reason-CT إلى الفترة من 2 إلى 25 سبتمبر 2026؛ وGLM-5.2 في 16 يونيو 2026، ويليه GLM-5.3 في 18 أغسطس 2026
• حالة الجيل — NV-Reason-CT هو الإصدار 0.1، إصدار أولي غير معلن عنه؛ GLM-5.2 هو الجيل السابق لخط منتجات مطروح في السوق
• المكانة المستقلة — لا توجد قياسات مستقلة لـ NV-Reason-CT؛ وتم قياس GLM-5.2 عند 33.7 على مؤشر Artificial Analysis Intelligence Index، مع علامة إهمال، مقابل GLM-5.3 عند 44.8
• الترخيص والوصول — أوزان OpenMDW-1.1 التي تقوم بتنزيلها؛ مقابل نموذج مفتوح الأوزان يُقدَّم بسعر $1.40 و $4.40 لكل مليون رمز مع قراءات مخزنة مؤقتًا بسعر $0.26
• السياق — 13,824 رمزًا مرئيًا لكل مجلد بدون نافذة دردشة؛ مقابل 1,000,000 رمز إدخال و128,000 رمز إخراج
• الاستخدام المُعلَن — للأبحاث والتعليم فقط، وليس جهازًا طبيًا؛ وضدّ النشر للأغراض العامة
كلمة "deprecated" تؤدي هنا عملًا دقيقًا، ويستحق ألّا نبالغ في قراءتها. علامة التقادم على لوحة الصدارة تعني أن المُقيِّم قد توقف عن اعتبار النموذج حاليًا، عادةً لأن خلفًا له قد حلّ مكانه. وهي لا تعني أن الأوزان سُحبت، أو أن واجهة API أُوقفت، أو أن النموذج توقف عن العمل. الفرق التي لديها خطوط أنابيب مضبوطة على GLM-5.2 ليست في مشكلة. ما تعنيه فعلًا هو أن أرقامه لقطة من قبل وجود GLM-5.3، وأن خلطها بأرقام حالية لنماذج أخرى هو مقارنة قياس من يونيو بميدان من سبتمبر.
الأعداد التي يمتلكها كل طرف، وما تساويه.
سجل GLM-5.2 حافل بشكل غير معتاد، وهو مستمد من مصدرين يختلفان بطرق مفيدة.
استنادًا إلى ما نشرته Z.ai بنفسها، يسجّل النموذج 99.12 على τ²-Bench، و62.1 على SWE-bench Pro، و54.7 على Humanity's Last Exam مع الأدوات، و82.7 كأفضل نتيجة معلنة على Terminal-Bench 2.1. وعلى الجانب المستقل، تقيس Artificial Analysis النموذج نفسه عند 77.9 على Terminal-Bench 2.1، و33.7 على مؤشر الذكاء الخاص بها، و89.5 على GPQA Diamond، و41.1 على Humanity's Last Exam. وهناك أرقام أخرى من المورّد — 99.2 على AIME 2026، و92.5 على HMMT February 2026، و91 على IMOAnswerBench، و74.4 على FrontierSWE، و63.7 على ProgramBench، و76.8 على MCP-Atlas — وكلها خاصة بـ Z.ai.
هناك أمران في تلك القائمة يستحقان الذكر. أولاً، فارق 4.5 نقاط على Terminal-Bench 2.1 بين أفضل رقم مُبلَّغ عنه من المورّد وهو 82.7 والرقم المستقل 77.9 ليس تناقضاً. عادةً ما تكون أفضل الدرجات المُبلَّغ عنها من المورّد هي الأفضل بين عدة أُطر اختبار، ورقم Term-2 الخاص بـ Z.ai لنفس المعيار هو 81 — أي أن القياس المستقل يقع داخل نطاق المورّد نفسه. ثانياً، الفارق في Humanity's Last Exam أكبر: 41.1 بشكل مستقل مقابل رقم للمورّد قدره 40.5 بدون أدوات و54.7 معها، ما يعني أن الرقم الرئيسي 54.7 هو رقم بأدوات وأن 41.1 هو الرقم المجرّد. إن اقتباس 54.7 بجانب نتيجة نموذج آخر سيكون خطأً حقيقياً.
سجل NV-Reason-CT لا يحتوي على بنية المصدرين هذه، وهذا تحديدًا موضع ضعفه. نتائجه على CT-RATE — 0.614 F1 و0.871 AUROC عبر ثمانية عشر تصنيفًا، بعتبة موحّدة ثابتة ومطالبة مباشرة بنعم/لا ودون رأس تصنيف أو تكييف خاص بالمهمة — هي نتائج NVIDIA نفسها. أما النماذج التي تتم المقارنة معها في تلك الورقة (VoxelFM 0.581، Pillar-0 0.544، ClinFusion-8B 0.442، CT-CLIP 0.398، Merlin 0.358، MedGemma 1.5 0.303) فكلها نماذج تصوير. لم يُعَد إنتاج أي شيء بشكل مستقل، والنموذج متاح للتنزيل منذ أسابيع. كما يقدّم macro-F1 مستمدًا من التقرير قدره 0.592 ودراسة أولية لأطباء أشعة خبراء تربط المراجعة المدعومة بانخفاض بنسبة 50% في متوسط زمن التفسير المُبلَّغ عنه، وهو ما يشير إليه المؤلفون أنفسهم باعتباره يعاني بشدة من صغر العينة.
إذن، مقارنة المصدر لا تصب في مصلحة النموذج الأحدث، وهذه هي النقطة التي تستحق التوقف عندها. GLM-5.2 هو النموذج الأقدم الذي جرى تجاوزه، وأرقامه أكثر موثوقية من أرقام NV-Reason-CT، لأن شخصًا من خارج الشركة هو من شغّل منصة الاختبار. أن تكون حديثًا لا يعني أن تكون موثّقًا.

لماذا للإهمال أهمية أكبر مما يبدو
هناك فشل محدّد صُمّمت هذه المقارنة لمنعه، وهو لا علاقة له بـ CT على الإطلاق.
فريق يبني خط معالجة نصوص سريرية يبحث عن نموذج مفتوح الأوزان ليشغّله على عتاده الخاص، لأن البيانات حساسة. يجدون GLM-5.2، المرخّص بموجب MIT وذي 743 مليار معامل مع نحو 40 مليارًا نشطة، يفي بالغرض، وله سجل قياسات موثّق جيدًا. يضبطون نماذجهم عليه. بعد ستة أشهر يكتشفون أن الجيل الحالي هو GLM-5.3، وأنه بسياق 1M مع سقف إخراج 128K، وأنه أرخص بسعر 1.26 دولار و3.96 دولار، وأن القرار الذي ظنوا أنهم يتخذونه — أي نموذج مفتوح الأوزان يعتمدونه معيارًا — كان في الواقع قرارًا بشأن أي جيل، وقد اتخذوه عن غير قصد.
هذا حادث مكلف أن تكتشفه متأخرًا، ويمكن تجنبه بعملية بحث واحدة. الإرشادات الملموسة:
• تحقق مما إذا كان النموذج الذي أنت على وشك اعتماده كمعيار هو الجيل الحالي — فعلامة إهمال لوحة الصدارة هي أسرع إشارة، وقائمة النماذج الخاصة بالبائع هي المصدر الموثوق
• لا تخلط بين لقطة يونيو وأرقام سبتمبر — فقد قِيس مؤشر GLM-5.2 البالغ 33.7 قبل وجود GLM-5.3، ووضعه إلى جانب مؤشر طراز حالي يقارن بين لحظتين مختلفتين في مجال متغيّر
• احذر من الاسم — إن إدراج "GLM-5.3 Prime" هو مستوى خدمة يحمل الأوزان نفسها بسعر يقارب ضعف سعر القائمة، وليس نموذجًا منفصلًا. تحقق من الأوزان الكامنة خلف أي SKU قبل أن تدفع مبلغًا إضافيًا مقابله
• تعامل مع معدل العنوان المنخفض كسؤال، لا كإجابة — كون GLM-5.3 أرخص من سابقه أمر غير معتاد ويستحق التحقق منه مقابل عبء العمل الخاص بك بدلاً من افتراضه
لا شيء من ذلك يجعل GLM-5.2 خيارًا سيئًا. فنموذج بحجم 743B مرخّص بموجب MIT، بتكلفة 1.40 دولار و4.40 دولار، سبق أن ضبط فريقٌ ما إعداداته عليه، هو أمر معقول تمامًا للاستمرار في تشغيله، كما أن نموذجًا من منتصف الجيل ذا سجل راسخ قد يكون أحيانًا بالضبط ما يريده سير عمل خاضع للتنظيم. النقطة هي أنه ينبغي أن يكون خيارًا يُتخذ عن قصد، لا افتراضيًا موروثًا من قائمة كانت سارية في يوليو.
الفخ في مقارنة نموذج نصي بنموذج CT
السبب في أن هذا الاقتران يبدو معقولًا على الإطلاق هو أن كليهما نموذجان مفتوحا الأوزان صدرا في عام 2026، وأن القارئ الذي يتصفح كتالوجًا يرى بندين متشابهين قابلين للمقارنة. لكنهما ليسا قابلين للمقارنة، ولعدم التطابق شكل محدد.
يحتفظ GLM-5.2 بـ 1,000,000 رمز. يكلف حجم CT الواحد الخاص بـ NV-Reason-CT 13,824 رمزًا بصريًا. وبهذه الحسابات، يمكن لـ GLM-5.2 أن يستوعب سبعين دراسة CT ولا يزال لديه متسع، وهو ما يغري بالاستنتاج أن نموذجًا نصيًا ذا سياق طويل بما فيه الكفاية يجعل نموذج التصوير زائدًا عن الحاجة. لكن هذا الاستنتاج لا يصح، والسبب هو الواجهة وليس الميزانية.
تلك الـ13,824 رمزًا ليست ملخصًا. إنها مكعب بقياس 384 مليمترًا أُعيد أخذ عيناته إلى دقة 2 مم متماثلة الأبعاد، وقُطّع إلى رقع بحجم 8 × 8 × 8 على شبكة 24 × 24 × 24، وسُلّمت إلى عمود فقري لغوي دون أي تقليل للعينات المكانية ودون طبقة دمج — ولهذا السبب يبلغ المسار النشط 4.35 مليار معلمة من إجمالي 4.69 مليار، ولهذا تُنفَق الحوسبة على الحفاظ على الدقة بدلًا من ضغطها والتخلص منها. GLM-5.2 نصّي فقط. لا يملك مسار رؤية على الإطلاق، لذا لا يُطرح سؤال كيف سيتعامل مع مسح ما؛ الجواب أنه لا يمكن إعطاؤه مسحًا بأي شكل. تصف بطاقتا النموذجين فرقًا مقداره ستمئة ضعف في ميزانية الرموز لا علاقة له بالمقارنة، لأن أحدهما لا يملك أي وسيلة لاستقبال المُدخل.
الخطأ المعاكس متاح تمامًا بالقدر نفسه. يدعم NV-Reason-CT الصدر والبطن، ويأخذ ملف NIfTI بدلًا من مُوجّه نصي، ولا يستخدم أدوات، وتقصره بطاقة النموذج الخاصة به على البحث والتعليم، وتذكر أنه ليس جهازًا طبيًا وأن المخرجات قد تكون غير صحيحة. ولا يمكنه تطبيع مجموعة نصوص تقارير، أو كتابة إطار تقييم، أو الاستدلال على وثيقة إرشادية. إن نموذج تصوير بحجم 4.7B ليس بديلًا عن نموذج نصي بحجم 743B، تمامًا كما أن العكس ليس صحيحًا.

وضع نصف النص على مفتاح واحد
إذا كان السؤال هو على أي نموذج نصي تشغيل عمل خط المعالجة، فالجواب اليوم هو الأرجح GLM-5.3 بدلًا من GLM-5.2 — وكلاهما موجود في كتالوجنا تحت مفتاح واحد. z-ai/glm-5.2 يُقدَّم بسعر قائمة مزوّد Z.ai من دون أي هامش ربح، وGLM-5.3 إلى جانبه، ضمن واجهة API واحدة تغطي أكثر من 200 نموذج. إن إبقاء كليهما متاحين يكتسب أهمية أكبر من المعتاد خلال تغيير جيل: يمكنك قياس النموذج اللاحق على مجموعتك الخاصة قبل الالتزام به، والإبقاء على النموذج الحالي كخيار احتياطي أثناء ذلك، والتبديل من دون عقد ثانٍ أو تغيير في الشيفرة.
يستحق معدل التمرير أن نخصّص له جملة للسبب نفسه الذي يجعله مهمًا في أي نموذج يعيد مورده التسعير. فمن دون طبقة هامش ربح وسيطة، ينعكس تغيير سعر المورّد على جانبنا في اليوم نفسه. يغطي التبديل التلقائي عند الفشل تدهور أحد المزوّدين في منتصف الدفعة، وهو، بالنسبة لمهمة استخراج طويلة، الفشل الذي يكلّف ليلة كاملة بالفعل، كما تتيح لك لغة التوجيه DSL إرسال الطلبات الفردية إلى النموذج الذي ينبغي أن يتعامل معها بدلاً من توجيه كل شيء إلى نقطة نهاية واحدة.
NV-Reason-CT ليس على منصتنا، ولا يوجد أي نموذج من NVIDIA عليها. يجدر قول ذلك بوضوح بدل تركه للاستنتاج: فجانب CT في هذه البنية عبارة عن أوزان مُنزَّلة على عتادك الخاص، بموجب ترخيص يسمح بذلك وبطاقة نموذج تحظر الاستخدام السريري. نحن لا نستضيفه ولن نكتب جملة توحي بغير ذلك.
الترتيب الذي تُتخذ فيه هذه القرارات
التسلسل الصحيح لإجراء بناء سريري ليس هو التسلسل الذي توحي به المقارنة.
ابدأ بسؤال توليد النص، وابدأه بالتحقق من أي جيل هو الحالي — GLM-5.3 بدلاً من GLM-5.2، من حيث السعر والقدرة المقاسة، إلا إذا كان لديك سبب للبقاء كما هو. ثم قِس زمن الاستجابة لكل دراسة لنموذج CT على عتادك الخاص، لأن هذا الرقم غير منشور وهو يحكم بقية الميزانية. ثم صمّم خط الأنابيب بحيث يكون النصفان قابلين للاستبدال بشكل مستقل، لأن أحدهما على دورة حياة قريبة من المعاينة والآخر عند الإصدار 0.1.
الشيء الوحيد الذي لا ينبغي فعله هو التعامل مع الاثنين كخيار. نموذج نصي 743B مُستبدَل ونموذج CT حالي بحجم 4.69B ليست بينهما مهمة مشتركة. لا تستحق المقارنة أن تُعقد إلا بما تكشفه: أن الأدلة الواقعة خلف الأثر الأحدث أضعف، وأن الأقدم خرج بهدوء من جيله، وأن كلتا الحقيقتين غير مرئيتين لأي شخص يقرأ صفًا في كتالوج يسردهما جنبًا إلى جنب وكأنهما بديلان.

مقارنات في هذه المقالة1
مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا
