
GLM 5.3 Prime مقابل GLM-5.3-Flash: فجوة سعرية تبلغ 18 ضعفًا بين نموذجين مختلفين
- openaiجديدOpenAI: GPT-6 Luna2026-09-2237الذكاء
- openaiجديدOpenAI: GPT-6 Sol2026-09-2248الذكاء
- anthropicجديدAnthropic: Claude Opus 5.52026-09-2258الذكاء
- grokجديدGrok 4.72026-09-2146الذكاء
- OrcaجديدOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 لكل مليون رمز · 177 tok/s
- orcaجديدOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 لكل مليون رمز · 1323 tok/s
- deepseekجديدDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- openaiOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- googleGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245الذكاء76البرمجة
- anthropicAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 لكل مليون رمز · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236الذكاء69البرمجة
- grokSpaceXAI: Grok 4.62026-08-1244الذكاء77البرمجة
- metaMeta: Muse Spark 1.22026-08-0540الذكاء72البرمجة
- qwenQwen: Qwen3.8 Max2026-08-0345الذكاء76البرمجة
إليك المقارنة في سطر واحد، لكل من وصل وقرار الشراء شبه محسوم لديه: GLM 5.3 Prime هو GLM-5.3، الأوزان الرائدة الخاصة به التي تُباع عبر طبقة خدمة مُسرَّعة بسعر 2.80 دولار و8.80 دولار لكل مليون رمز، وGLM-5.3-Flash هو نموذج منفصل متعدد الوسائط بطبيعته، بأوزانه المفتوحة الخاصة، بسعر 0.15 دولار و0.50 دولار. الفجوة بينهما تبلغ نحو ثمانية عشر ضعفًا في كل من الإدخال والإخراج. هذا ليس فرقًا في الطبقة — بل هو نموذج مختلف في موضع مختلف داخل العائلة، والسبب الوحيد في أن الاسمين يتجاوران في قائمة نماذج هو أن كليهما ظهر خلال ستة أسابيع من الآخر.
الخطأ في هذا مكلف في كلا الاتجاهين. إذا تعاملت مع Flash باعتباره نسخة رخيصة من Prime، فسوف تُفاجأ بما لا يستطيع فعله. وإذا تعاملت مع Prime باعتباره نسخة أسرع من Flash، فسوف تدفع أكثر بثمانية عشر ضعفًا مقابل نموذج لا يستطيع رؤية صورة.
ابدأ بما هو عليه كل واحد في الواقع.
GLM-5.3-Flash هو نموذج خليط خبراء متعدد الوسائط يضم 320 مليار معامل، منها 18 مليار معامل نشط، صدر في 26 أغسطس 2026 بموجب رخصة MIT، مع أوزان متاحة على Hugging Face وModelScope. ويقبل النصوص والصور والفيديو والملفات بشكل أصلي في الطلب نفسه، ويحمل نافذة سياق تبلغ 1,000,000 رمز وسقف إخراج يبلغ 128,000 رمز، وقد جرى تدريبه مسبقًا بشكل منفصل بدلًا من تقطيره من النموذج الرائد. يقلل تصميمه الهجين للانتباه الذي يجمع بين الخطي والمتناثر من حسابات الانتباه إلى نحو الثلث، ويقلص ذاكرة KV cache بأكثر من أربعة أضعاف مقارنة بـGLM-5.3، ومن هنا تأتي ميزته في التكلفة على مستوى البنية المعمارية، لا من خصم.
GLM 5.3 Prime هو GLM-5.3 — خليط خبراء متناثر بـ40 مليار معامل نشط، أُعلن في 14 أغسطس 2026، وأُتيح عبر واجهة API اعتبارًا من 18 أغسطس، مع فتح الأوزان في 25 أغسطس — ويُقدَّم عبر مسار عالي السرعة. السياق نفسه من 1,000,000 توكن، وسقف الإخراج نفسه من 131,072 توكن، إدخال نصي وإخراج نصي، والاستدلال إلزامي عند low، high أو max مع جهد max كخيار افتراضي. لا تذكر وثائق Z.ai الخاصة أي SKU باسم Prime؛ إذ توجد هذه الفئة على منصة طرف ثالث تسمّي مزوّدًا واحدًا في المنبع يقف خلفها.
لوحة النتائج

• السعر — GLM 5.3 Prime $2.80 / $8.80 لكل مليون مقابل GLM-5.3-Flash $0.15 / $0.50 لكل مليون
• الإدخال المخزَّن مؤقتًا — $0.56 لكل مليون مقابل $0.03 لكل مليون
• المضاعِف — نحو 18× على الإدخال والإخراج، قبل أي تخزين مؤقت
• الوسائط — نص فقط مقابل نص، وصورة، وفيديو، وملف كإدخال
• المعاملات — 40B نشطة على MoE رائد مقابل 320B إجمالًا / 18B نشطة
• الأوزان — مفتوحة، بموجب ترخيص مخصص مع حدّ إيرادات مقابل MIT، قابلة للتنزيل اليوم
• الحد الأقصى للإخراج — 131,072 رمزًا مقابل 128,000 رمزًا
• السياق — 1,000,000 رمز لكلٍّ منهما
• مؤشر الذكاء — يسجل GLM-5.3 نتيجة 45 على مؤشر v4.3.2؛ ويسجل GLM-5.3-Flash نتيجة 42
• التكلفة لكل مهمة على المؤشر — $2.01 للرائد مقابل $0.25 لـ Flash
• السرعة — نحو 61 رمز إخراج في الثانية مقابل نحو 46، وكلاهما وسيط مقيس بشكل مستقل
• الوصول عبر الاشتراك — Prime ليس ضمن خطة Coding Plan من Z.ai؛ أما Flash فهو ضمنها، مع حصة 3×
هناك صفان في تلك القائمة يستحقان أكثر من مجرد نقطة تعداد. الأول هو فجوة الذكاء: ثلاث نقاط على مؤشر Artificial Analysis Intelligence Index، 45 مقابل 42، وفق مراجعة v4.3.2. وقد وضعت مراجعة أقدم لنفس المؤشر تلك النماذج عند 60 و57، ولا يزال هذا الزوج الأقدم ينتشر على نطاق واسع في تغطية الإطلاق — لا تخلط بين الاثنين، لأن الأرقام غير قابلة للمقارنة عبر المراجعات. ثلاث نقاط هي فجوة ضيقة تظهر كانحراف طفيف أكثر في السلاسل الوكيلية الطويلة جدًا وحساسية أكبر تجاه التعليمات الغامضة، وليس كفئة مختلفة من النماذج.
الثاني هو السرعة، وهو يقلب الحدس الذي تصنعه الأسماء. إن Flash هو الأبطأ بين الاثنين وفق قياس مستقل — نحو 46 رمز إخراج في الثانية مقابل 61 للنموذج الرائد، في فئة يبلغ متوسطها 67. يكسب Flash اسمه من السعر ومن تعدد الوسائط، لا من زمن الاستجابة. وهذا مهم للمقارنة، لأن السبب المعتاد للجوء إلى نموذج صغير هو أنه يجيب بشكل أسرع، وهنا ليس كذلك.
القرار الذي يعود إليك فعلاً اتخاذه
لأن النموذجين يختلفان على ثلاثة محاور في آنٍ واحد — الوسائط، والترخيص، والسعر — فإن الاختيار عادةً يُحسم عند المحور الأول ولا يصل أبدًا إلى الحسابات. يقرأ Flash الصور والفيديو؛ أما Prime فلا يقرأ سوى النص. إذا كان عبء عملك يمسّ لقطة شاشة، أو صفحة ممسوحة ضوئيًا، أو لقطة واجهة مستخدم، أو إطار فيديو، فقد انتهت المقارنة قبل أن يدخل السعر في الصورة، وستشتري Flash.
إذا كان عبء العمل لديك نصيًا بحتًا والسؤال يتعلق حقًا بالجودة، فالجواب الصادق هو أن فجوة المؤشر البالغة ثلاث نقاط هي كل ما تدفع مقابله 18×. ما إذا كان ذلك يستحق العناء يعتمد كليًا على ما إذا كان بإمكانك التحقق من المخرجات. حين تكون الإجابة قابلة للتحقق — كود يُترجم، استعلام يُرجع صفوفًا، استخلاص منظم يتحقق مقابل مخطط — فإن أخطاء Flash العابرة رخيصة الاكتشاف ورخيصة إعادة المحاولة، وبثمن يعادل 1/18 من السعر يمكنك إعادة المحاولة مرات كثيرة جدًا. وحيث تكون المخرجات نثرًا يجب على الشخص الحكم عليه، أو خطة طويلة متعددة الخطوات بدون تحقق وسيط، يصعب تعويض الفجوة ويصبح تبرير العلاوة أسهل.
حيث تُغيّر الأوزان المفتوحة المعادلة
Flash مرخّص بموجب MIT، وأصغر تكميم قابل للاستخدام لديه يحتاج إلى ما في حدود 93 جيجابايت من ذاكرة المسرّعات — أي عقدة واحدة عالية الذاكرة بالنسبة لكثير من الفرق، وخطأ تقريب في الفاتورة بالنسبة للبعض. ويحمل GLM-5.3 ترخيصًا مخصصًا يلزم المشغّلين الكبار للنماذج كخدمة ممن يتجاوزون عتبة إيرادات معينة باجتياز مراجعة أمنية، وأصغر تكميم عملي له يقع في حدود 217 جيجابايت، وهو نشر متعدد العقد بالنسبة لمعظم الفرق.
يعني هذا اللاتماثل أن المقارنة الحقيقية لفريق ذي حجم استخدام كبير ليست بين 8.80 دولارًا لـ Prime و0.50 دولار لـ Flash. بل بين 8.80 دولارًا لـ Prime وتكلفتك المطفأة الخاصة لكل مليون توكن من المخرجات على عتاد تملكه بالفعل، وتشغّل عليه أوزانًا يمكنك تنزيلها اليوم دون الحاجة إلى أي نقاش بشأن الترخيص. وبالنسبة لفريق يمتلك العتاد وحجم الاستخدام، غالبًا ما يكون هذا الرقم هو الأصغر بين الثلاثة، وهو متاح فقط في جانب Flash من هذه المقارنة.
شراء كليهما، وشراؤهما معًا

معظم أنظمة الإنتاج لا تحتاج إلى الاختيار. النمط الذي يناسب هذين النموذجين هو الموجّه (router): Flash على المسار الافتراضي للأعمال النصية ومتعددة الوسائط، والنموذج الرائد عند التصعيد حين تكون المهمة طويلة الأفق أو تفشل المحاولة الأولى في اجتياز أحد الفحوص. هذا معرّفان للنموذجين ودالة قرار واحدة، وتكلفة الخطأ الطفيف في هذا التقسيم بضعة سنتات لكل ألف طلب، لا مشكلة معمارية.
نستضيف GLM-5.3-Flash بسعر 0.07 و0.25 دولار لكل مليون رمز — أقل من سعر القائمة الخاص بالمورّد البالغ 0.15 و0.50 — وGLM-5.3 بسعر القائمة لدى المزوّد البالغ 1.40 و4.40 دولارًا، وكلاهما دون أي هامش ربح منا — يُمرَّر سعر قائمة المزوّد كما هو بدل إعادة تسعيره، لذا يصل تغيّر سعر المورّد إلينا في اليوم نفسه الذي يصل فيه إليهم. يقع كلا المعرّفين خلف مفتاح واحد إلى جانب أكثر من 200 نموذج آخر، ما يجعل الترقية من Flash إلى الفئة الرائدة مجرد تغيير في اسم النموذج داخل مسار استدعاء واحد بدل تكامل ثانٍ. يغطي التبديل التلقائي حالة تدهور المزوّد الوحيد في المنبع خلف فئة سريعة، وبالنسبة لفئة مثل Prime، التي تدرج مورّدًا واحدًا فقط، فليس ذلك مصدر قلق افتراضي.
ينبغي أن نكون صريحين بشأن حدود ذلك: لا تستضيف OrcaRouter نموذج GLM 5.3 Prime، ولا نستضيف نحن GLM-5.3-FlashX أيضًا. صفحتا النموذجين كلتاهما تُرجعان 404 هنا. إذا كنت تحتاج إلى تسريع Prime، فستشتريه من المنصة التي تبيعه.
ما الذي قد نقوله لك في الواقع

إذا كنت قد قرأت حتى هذا الحد بحثًا عن فائز، فالجواب هو أن هذا الثنائي لم يكن يومًا منافسة. يفوز Flash من حيث التكلفة، ومن حيث الوسائط، ومن حيث الترخيص، ومن حيث قابلية النشر، ويفوز في الأربعة جميعها بفارق كبير. ادعاء الطراز الرائد الوحيد هو ثلاث نقاط مؤشر وحوالي 15 رمز إخراج إضافيًا في الثانية، وهو يتقاضى ثمانية عشر ضعف السعر مقابلها. وبالنسبة للغالبية العظمى من أعباء العمل النصية، فإن Flash هو الخيار الافتراضي الصحيح، ويقع عبء الإثبات على الخيار المكلف.
المكان الذي يجب الحذر فيه هو المنتصف. الفريق الذي يحتاج إلى جودة استدلال رائدة في النصوص ويحتاج أيضًا إلى قراءة الصور سينتهي به الأمر إلى تشغيل كلا الطرازين، ويكون الإغراء هو توجيه كل شيء إلى الطراز الرائد لأنه صاحب السمعة. هنا يتحول معامل الـ18× بهدوء إلى بند تكلفة حقيقي. وجّه العمل متعدد الوسائط إلى Flash، وصعّد عند الفشل، وتحقق من معدل التصعيد الفعلي لديك قبل أن تفترض أنه مرتفع.
مقارنات في هذه المقالة1
مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا
