بطاقة عنوان رئيسية لـ GLM 5.3 Prime مقابل GLM-5.3-Flash تحمل عبارة «GLM 5.3 Prime مقابل GLM-5.3-Flash: فجوة 18 ضعفًا»، وعنوانًا فرعيًا «أحدهما مسار خدمة للنصوص فقط، والآخر نموذج متعدد الوسائط»، مع ثلاث شرائح تحمل «السعر / لكل مليون: $2.80 / $8.80 مقابل $0.15 / $0.50»، و«الوسائط: نص فقط مقابل نص وصورة وفيديو»، و«الترخيص: مخصّص مقابل MIT»، وسطر تذييل «أُعلن عن GLM-5.3 في 14 أغسطس 2026؛ وصدر GLM-5.3-Flash في 26 أغسطس 2026.»
Guides & Insights

GLM 5.3 Prime مقابل GLM-5.3-Flash: فجوة سعرية تبلغ 18 ضعفًا بين نموذجين مختلفين

الكاتب

Alistair Wren

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

إليك المقارنة في سطر واحد، لكل من وصل وقرار الشراء شبه محسوم لديه: GLM 5.3 Prime هو GLM-5.3، الأوزان الرائدة الخاصة به التي تُباع عبر طبقة خدمة مُسرَّعة بسعر 2.80 دولار و8.80 دولار لكل مليون رمز، وGLM-5.3-Flash هو نموذج منفصل متعدد الوسائط بطبيعته، بأوزانه المفتوحة الخاصة، بسعر 0.15 دولار و0.50 دولار. الفجوة بينهما تبلغ نحو ثمانية عشر ضعفًا في كل من الإدخال والإخراج. هذا ليس فرقًا في الطبقة — بل هو نموذج مختلف في موضع مختلف داخل العائلة، والسبب الوحيد في أن الاسمين يتجاوران في قائمة نماذج هو أن كليهما ظهر خلال ستة أسابيع من الآخر.

الخطأ في هذا مكلف في كلا الاتجاهين. إذا تعاملت مع Flash باعتباره نسخة رخيصة من Prime، فسوف تُفاجأ بما لا يستطيع فعله. وإذا تعاملت مع Prime باعتباره نسخة أسرع من Flash، فسوف تدفع أكثر بثمانية عشر ضعفًا مقابل نموذج لا يستطيع رؤية صورة.

ابدأ بما هو عليه كل واحد في الواقع.

GLM-5.3-Flash هو نموذج خليط خبراء متعدد الوسائط يضم 320 مليار معامل، منها 18 مليار معامل نشط، صدر في 26 أغسطس 2026 بموجب رخصة MIT، مع أوزان متاحة على Hugging Face وModelScope. ويقبل النصوص والصور والفيديو والملفات بشكل أصلي في الطلب نفسه، ويحمل نافذة سياق تبلغ 1,000,000 رمز وسقف إخراج يبلغ 128,000 رمز، وقد جرى تدريبه مسبقًا بشكل منفصل بدلًا من تقطيره من النموذج الرائد. يقلل تصميمه الهجين للانتباه الذي يجمع بين الخطي والمتناثر من حسابات الانتباه إلى نحو الثلث، ويقلص ذاكرة KV cache بأكثر من أربعة أضعاف مقارنة بـGLM-5.3، ومن هنا تأتي ميزته في التكلفة على مستوى البنية المعمارية، لا من خصم.

GLM 5.3 Prime هو GLM-5.3 — خليط خبراء متناثر بـ40 مليار معامل نشط، أُعلن في 14 أغسطس 2026، وأُتيح عبر واجهة API اعتبارًا من 18 أغسطس، مع فتح الأوزان في 25 أغسطس — ويُقدَّم عبر مسار عالي السرعة. السياق نفسه من 1,000,000 توكن، وسقف الإخراج نفسه من 131,072 توكن، إدخال نصي وإخراج نصي، والاستدلال إلزامي عند low، high أو max مع جهد max كخيار افتراضي. لا تذكر وثائق Z.ai الخاصة أي SKU باسم Prime؛ إذ توجد هذه الفئة على منصة طرف ثالث تسمّي مزوّدًا واحدًا في المنبع يقف خلفها.

لوحة النتائج

A two-column scoreboard titled 'GLM 5.3 Prime vs GLM-5.3-Flash - the scoreboard'. The GLM 5.3 Prime column reads 'Price / 1M: $2.80 / $8.80', 'Cached input: $0.56', 'Modality: text only', 'Weights: none', 'Intelligence Index: 45, same as GLM-5.3', 'Speed: 1.5-2x, vendor-reported'; the GLM-5.3-Flash column reads 'Price / 1M: $0.15 / $0.50', 'Cached input: $0.03', 'Modality: text, image, video, file', 'Weights: open, MIT', 'Intelligence Index: 42', 'Speed: 46 tokens/sec, independently measured'; the footer reads 'Flash figures per Artificial Analysis v4.3.2; Prime speed is vendor-reported with no independent measurement.'

• السعر — GLM 5.3 Prime $2.80 / $8.80 لكل مليون مقابل GLM-5.3-Flash $0.15 / $0.50 لكل مليون
• الإدخال المخزَّن مؤقتًا — $0.56 لكل مليون مقابل $0.03 لكل مليون
• المضاعِف — نحو 18× على الإدخال والإخراج، قبل أي تخزين مؤقت
• الوسائط — نص فقط مقابل نص، وصورة، وفيديو، وملف كإدخال
• المعاملات — 40B نشطة على MoE رائد مقابل 320B إجمالًا / 18B نشطة
• الأوزان — مفتوحة، بموجب ترخيص مخصص مع حدّ إيرادات مقابل MIT، قابلة للتنزيل اليوم
• الحد الأقصى للإخراج — 131,072 رمزًا مقابل 128,000 رمزًا
• السياق — 1,000,000 رمز لكلٍّ منهما
• مؤشر الذكاء — يسجل GLM-5.3 نتيجة 45 على مؤشر v4.3.2؛ ويسجل GLM-5.3-Flash نتيجة 42
• التكلفة لكل مهمة على المؤشر — $2.01 للرائد مقابل $0.25 لـ Flash
• السرعة — نحو 61 رمز إخراج في الثانية مقابل نحو 46، وكلاهما وسيط مقيس بشكل مستقل
• الوصول عبر الاشتراك — Prime ليس ضمن خطة Coding Plan من Z.ai؛ أما Flash فهو ضمنها، مع حصة 3×

هناك صفان في تلك القائمة يستحقان أكثر من مجرد نقطة تعداد. الأول هو فجوة الذكاء: ثلاث نقاط على مؤشر Artificial Analysis Intelligence Index، 45 مقابل 42، وفق مراجعة v4.3.2. وقد وضعت مراجعة أقدم لنفس المؤشر تلك النماذج عند 60 و57، ولا يزال هذا الزوج الأقدم ينتشر على نطاق واسع في تغطية الإطلاق — لا تخلط بين الاثنين، لأن الأرقام غير قابلة للمقارنة عبر المراجعات. ثلاث نقاط هي فجوة ضيقة تظهر كانحراف طفيف أكثر في السلاسل الوكيلية الطويلة جدًا وحساسية أكبر تجاه التعليمات الغامضة، وليس كفئة مختلفة من النماذج.

الثاني هو السرعة، وهو يقلب الحدس الذي تصنعه الأسماء. إن Flash هو الأبطأ بين الاثنين وفق قياس مستقل — نحو 46 رمز إخراج في الثانية مقابل 61 للنموذج الرائد، في فئة يبلغ متوسطها 67. يكسب Flash اسمه من السعر ومن تعدد الوسائط، لا من زمن الاستجابة. وهذا مهم للمقارنة، لأن السبب المعتاد للجوء إلى نموذج صغير هو أنه يجيب بشكل أسرع، وهنا ليس كذلك.

القرار الذي يعود إليك فعلاً اتخاذه

لأن النموذجين يختلفان على ثلاثة محاور في آنٍ واحد — الوسائط، والترخيص، والسعر — فإن الاختيار عادةً يُحسم عند المحور الأول ولا يصل أبدًا إلى الحسابات. يقرأ Flash الصور والفيديو؛ أما Prime فلا يقرأ سوى النص. إذا كان عبء عملك يمسّ لقطة شاشة، أو صفحة ممسوحة ضوئيًا، أو لقطة واجهة مستخدم، أو إطار فيديو، فقد انتهت المقارنة قبل أن يدخل السعر في الصورة، وستشتري Flash.

إذا كان عبء العمل لديك نصيًا بحتًا والسؤال يتعلق حقًا بالجودة، فالجواب الصادق هو أن فجوة المؤشر البالغة ثلاث نقاط هي كل ما تدفع مقابله 18×. ما إذا كان ذلك يستحق العناء يعتمد كليًا على ما إذا كان بإمكانك التحقق من المخرجات. حين تكون الإجابة قابلة للتحقق — كود يُترجم، استعلام يُرجع صفوفًا، استخلاص منظم يتحقق مقابل مخطط — فإن أخطاء Flash العابرة رخيصة الاكتشاف ورخيصة إعادة المحاولة، وبثمن يعادل 1/18 من السعر يمكنك إعادة المحاولة مرات كثيرة جدًا. وحيث تكون المخرجات نثرًا يجب على الشخص الحكم عليه، أو خطة طويلة متعددة الخطوات بدون تحقق وسيط، يصعب تعويض الفجوة ويصبح تبرير العلاوة أسهل.

حيث تُغيّر الأوزان المفتوحة المعادلة

Flash مرخّص بموجب MIT، وأصغر تكميم قابل للاستخدام لديه يحتاج إلى ما في حدود 93 جيجابايت من ذاكرة المسرّعات — أي عقدة واحدة عالية الذاكرة بالنسبة لكثير من الفرق، وخطأ تقريب في الفاتورة بالنسبة للبعض. ويحمل GLM-5.3 ترخيصًا مخصصًا يلزم المشغّلين الكبار للنماذج كخدمة ممن يتجاوزون عتبة إيرادات معينة باجتياز مراجعة أمنية، وأصغر تكميم عملي له يقع في حدود 217 جيجابايت، وهو نشر متعدد العقد بالنسبة لمعظم الفرق.

يعني هذا اللاتماثل أن المقارنة الحقيقية لفريق ذي حجم استخدام كبير ليست بين 8.80 دولارًا لـ Prime و0.50 دولار لـ Flash. بل بين 8.80 دولارًا لـ Prime وتكلفتك المطفأة الخاصة لكل مليون توكن من المخرجات على عتاد تملكه بالفعل، وتشغّل عليه أوزانًا يمكنك تنزيلها اليوم دون الحاجة إلى أي نقاش بشأن الترخيص. وبالنسبة لفريق يمتلك العتاد وحجم الاستخدام، غالبًا ما يكون هذا الرقم هو الأصغر بين الثلاثة، وهو متاح فقط في جانب Flash من هذه المقارنة.

شراء كليهما، وشراؤهما معًا

A screenshot of the OrcaRouter model page for GLM 5.3 Flash (z-ai/glm-5.3-flash, captured September 24, 2026) showing the 1M-token context badge, a 128K max output, text, image and video input with text output, a 2026-08-26 date beside 'Public benchmarks by Z.ai', a 320B total / 18B active parameter line, a p50 time to first token of 6.86 seconds, and a stat strip reading $0.07 input, $0.25 output, 6.86 s p50 TTFT, 10.00 s p95 TTFT and 22,120.9M tokens.

معظم أنظمة الإنتاج لا تحتاج إلى الاختيار. النمط الذي يناسب هذين النموذجين هو الموجّه (router): Flash على المسار الافتراضي للأعمال النصية ومتعددة الوسائط، والنموذج الرائد عند التصعيد حين تكون المهمة طويلة الأفق أو تفشل المحاولة الأولى في اجتياز أحد الفحوص. هذا معرّفان للنموذجين ودالة قرار واحدة، وتكلفة الخطأ الطفيف في هذا التقسيم بضعة سنتات لكل ألف طلب، لا مشكلة معمارية.

نستضيف GLM-5.3-Flash بسعر 0.07 و0.25 دولار لكل مليون رمز — أقل من سعر القائمة الخاص بالمورّد البالغ 0.15 و0.50 — وGLM-5.3 بسعر القائمة لدى المزوّد البالغ 1.40 و4.40 دولارًا، وكلاهما دون أي هامش ربح منا — يُمرَّر سعر قائمة المزوّد كما هو بدل إعادة تسعيره، لذا يصل تغيّر سعر المورّد إلينا في اليوم نفسه الذي يصل فيه إليهم. يقع كلا المعرّفين خلف مفتاح واحد إلى جانب أكثر من 200 نموذج آخر، ما يجعل الترقية من Flash إلى الفئة الرائدة مجرد تغيير في اسم النموذج داخل مسار استدعاء واحد بدل تكامل ثانٍ. يغطي التبديل التلقائي حالة تدهور المزوّد الوحيد في المنبع خلف فئة سريعة، وبالنسبة لفئة مثل Prime، التي تدرج مورّدًا واحدًا فقط، فليس ذلك مصدر قلق افتراضي.

ينبغي أن نكون صريحين بشأن حدود ذلك: لا تستضيف OrcaRouter نموذج GLM 5.3 Prime، ولا نستضيف نحن GLM-5.3-FlashX أيضًا. صفحتا النموذجين كلتاهما تُرجعان 404 هنا. إذا كنت تحتاج إلى تسريع Prime، فستشتريه من المنصة التي تبيعه.

ما الذي قد نقوله لك في الواقع

A screenshot of the Artificial Analysis model page for GLM 5.3 Flash (captured September 24, 2026) showing an Intelligence Index score of 42 against a class median of 18, 180M tokens generated during evaluation, a 1M-token context window, $0.15 per 1M input and $0.50 per 1M output tokens with an 83% cache discount, and the comparison line 'At 46 tokens per second, GLM 5.3 Flash is notably slow (67).'

إذا كنت قد قرأت حتى هذا الحد بحثًا عن فائز، فالجواب هو أن هذا الثنائي لم يكن يومًا منافسة. يفوز Flash من حيث التكلفة، ومن حيث الوسائط، ومن حيث الترخيص، ومن حيث قابلية النشر، ويفوز في الأربعة جميعها بفارق كبير. ادعاء الطراز الرائد الوحيد هو ثلاث نقاط مؤشر وحوالي 15 رمز إخراج إضافيًا في الثانية، وهو يتقاضى ثمانية عشر ضعف السعر مقابلها. وبالنسبة للغالبية العظمى من أعباء العمل النصية، فإن Flash هو الخيار الافتراضي الصحيح، ويقع عبء الإثبات على الخيار المكلف.

المكان الذي يجب الحذر فيه هو المنتصف. الفريق الذي يحتاج إلى جودة استدلال رائدة في النصوص ويحتاج أيضًا إلى قراءة الصور سينتهي به الأمر إلى تشغيل كلا الطرازين، ويكون الإغراء هو توجيه كل شيء إلى الطراز الرائد لأنه صاحب السمعة. هنا يتحول معامل الـ18× بهدوء إلى بند تكلفة حقيقي. وجّه العمل متعدد الوسائط إلى Flash، وصعّد عند الفشل، وتحقق من معدل التصعيد الفعلي لديك قبل أن تفترض أنه مرتفع.

مقارنات في هذه المقالة1

مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا