بطاقة عنوان رئيسية لـ GLM-5.3-FlashX مقابل GLM-5.3-Flash، بعنوان فرعي "الأوزان نفسها، لافتتا سعر"، مع شرائح تقرأ "200 مقابل 98 tok/s"، و"$0.37 / $1.25 مقابل $0.15 / $0.50" و"ذكاء متطابق"، وسطر تذييل "أُطلق GLM-5.3-FlashX في 18 سبتمبر 2026".
Guides & Insights

GLM-5.3-FlashX مقابل GLM-5.3-Flash: نفس الأوزان، سعر أعلى بـ 2.5 مرة، رقم واحد مختلف

الكاتب

Rowan Sterling

تاريخ النشر

العودة إلى جميع المقالات

لا يمكنك شراء GLM-5.3-FlashX والحصول على نموذج أفضل. هذا ليس انتقادًا — بل هو الفرضية بأكملها. GLM-5.3-FlashX، الذي أُطلق على واجهة برمجة تطبيقات Z.ai في 18 سبتمبر 2026، يشغّل الأوزان نفسها التي يشغّلها GLM-5.3-Flash: العمود الفقري نفسه لمزيج الخبراء بإجمالي 320B و18B نشطًا، والسياق نفسه البالغ 1M رمز، والإدخال الأصلي نفسه للنص والصورة والفيديو والملف، وحد الإخراج نفسه البالغ 131,072 رمزًا. لم تنشر Z.ai أي اختبار أداء لـ FlashX لأنه لا يوجد شيء جديد لاختباره. ما يختلف هو مدى سرعة صدور الرموز وتكلفتها، وهذان الرقمان هما الشيئان الوحيدان اللذان على المشتري التفكير فيهما.

هذا قرار أنقى من معظم مقارنات النماذج، وأصعب منها، لأنه لا توجد قصة قدرات يمكن الاختباء خلفها. إما أن يكون زمن الاستجابة يستحق 2.5× بالنسبة لك، أو لا يستحق.

نموذج واحد، بطاقتا سعر

• ما هو FlashX — طبقة تقديم، وليست إصدار نموذج؛ الأوزان نفسها، الدرجات نفسها، الحدود نفسهاbr> • سعر الإدخال — 0.37 دولار لكل مليون رمز على FlashX مقابل 0.15 دولار لكل مليون على Flash بسعر القائمةbr> • سعر الإخراج — 1.25 دولار لكل مليون مقابل 0.50 دولار لكل مليون، المضاعف الذي يحرّك الفاتورة فعليًاbr> • الإدخال المخزّن مؤقتًا — 0.075 دولار لكل مليون مقابل 0.03 دولار لكل مليونbr> • السرعة — حتى 200 رمز إخراج في الثانية (ذروة مُبلَّغ عنها من البائع) مقابل 98 رمزًا/ثانية قياس مستقل من Artificial Analysisbr> • الوصول عبر الاشتراك — GLM-5.3-Flash مُضمَّن في خطة GLM Coding Plan من Z.ai مع حصة 3×؛ FlashX غير مُضمَّنbr> • الاستضافة الذاتية — GLM-5.3-Flash أوزان مفتوحة بترخيص MIT على Hugging Face؛ لا توجد أوزان لـ FlashX لتنزيلها

A two-column scoreboard titled 'GLM-5.3-FlashX vs GLM-5.3-Flash - the scoreboard'. The GLM-5.3-FlashX column reads 'Price: $0.37 / $1.25 per 1M', 'Cached input: $0.075 per 1M', 'Speed: up to 200 tok/s (vendor)', 'Intelligence: identical', 'Context: 1M tokens', 'Weights: hosted tier only'; the GLM-5.3-Flash column reads 'Price: $0.15 / $0.50 per 1M', 'Cached input: $0.03 per 1M', 'Speed: 98 tok/s (measured)', 'Intelligence: identical', 'Context: 1M tokens', 'Weights: MIT open weights'; the footer reads 'Same weights and same scores; only serving speed and price differ.'

في سوق Z.ai المحلية، تُذكر النسبة نفسها بوضوح: ¥2 دخول و¥7 خروج لـ FlashX مقابل ¥0.8 و¥2.8 لـ Flash. وتصف عدة منافذ إعلامية صينية الإطلاق بالطريقة نفسها — سرعة 5× بسعر 2.5× — ويشير كل منها إلى أن مستوى الذكاء لم يتغير.

زمن الاستجابة بند مستقل، ولا يُسعّر لكل رمز.

السبب في أن مضاعف 2.5× ليس صفقة سيئة تلقائيًا هو أن سعر التوكن وكلفة المهمة مقداران مختلفان. مهمة دفعية تولّد مليون توكن إخراجي بين عشية وضحاها تدفع $0.50 على Flash و$1.25 على FlashX مقابل الإخراج وحده، ولا تحصل على أي شيء مقابل $0.75 الإضافية لأن لا أحد ينتظر. حلقة وكيل تُجري عشرة استدعاءات متتابعة تدفع العلاوة نفسها لكل توكن، لكن كل استدعاء يعود أسرع، وتذهب الوفورات إلى الزمن الفعلي بدلًا من الفاتورة. إذا كان FlashX يعود فعلًا في جزء من الوقت، فيمكن لعشر جولات أن تعيد عشرات الثواني من زمن الاستجابة لكل مهمة — وإذا كانت تلك المهمة تعيق إنسانًا أو خدمة أعلى في السلسلة، فإن الثواني تساوي أكثر من التوكنات.

يتماشى تموضع Z.ai نفسه مع هذا التوجه تمامًا. فهو يوجّه FlashX نحو البرمجة عالية التزامن، واستدعاءات الوكلاء متعددة الخطوات، والحوار الفوري، وإكمال الشيفرة، والعمل متعدد الوسائط ذي السياق الطويل، كما يوجّه أحمال العمل الحساسة للسعر وغير الحساسة لزمن الاستجابة — مثل المعالجة الدفعية دون اتصال، والتوليد بالجملة، وأي مهام مُجدولة — نحو Flash الأساسي. هذا هو التقسيم الصحيح، ويجدر بالذكر أن المورّد هو من يرسمه.

حيث ينهار الاستدلال هو عند حد الإنتاجية. إن 200 توكن في الثانية لـ FlashX هي ذروة تعلنها الشركة الموردة؛ بينما 98 للنموذج الأساسي هو وسيط قاسه مختبر مستقل. يتم الوصول إلى الذروة في المخرجات القصيرة مع ذاكرات تخزين مؤقتة دافئة وعنقود خامل. طلب متعدد الوسائط طويل السياق — وهو بالضبط عبء العمل الذي يُروَّج له FlashX — هو الأقل احتمالاً للاقتراب منها، ولم ينشر أحد خارج Z.ai أرقاماً لحسم المسألة. إذا كان عبء العمل لديك محدوداً بالإنتاجية وليس بزمن الاستجابة، فإن رقم الذروة لا يخبرك إلا القليل عما ستحصل عليه فعلاً.

منفذ الهروب الذي لا يملكه FlashX

ثمة خيار ثالث في هذه المقارنة، وهو موجود فقط لأن النموذج الأساسي مفتوح. صدر GLM-5.3-Flash في 26 أغسطس 2026 بموجب رخصة MIT، مع أوزان على Hugging Face وModelScope، ويُقدَّم اليوم عبر مكدسات استدلال تشمل SGLang وvLLM وTokenSpeed وKTransformers. إذا كان حجمك مرتفعًا بما يكفي لتبرير العتاد، فالمقارنة الصادقة ليست بين Flash وFlashX — بل هي 1.25 دولار لكل مليون رمز إخراج لـ FlashX مقابل تكلفتك المطفأة الخاصة لكل رمز على مسرّعاتك الخاصة.

A screenshot of the OrcaRouter model page for GLM 5.3 Flash (z-ai/glm-5.3-flash, captured September 19, 2026) showing the 1M-token context badge, a 128K max output, text, image and video input, a 2026-08-26 release date by Z.ai, the 320B total / 18B active parameter line, and the billing row reading $0.07 per 1M input and $0.25 per 1M output tokens with a 6.68-second p50 time to first token.

هذا الخيار له ثمن دخول حقيقي. يحتاج إصدار FP8 إلى ما يقارب 328 غيغابايت من ذاكرة GPU لتقديم الخدمة، وهو نشر متعدد العقد بالنسبة لمعظم الفرق، وغير قابل للتنفيذ بالنسبة للبقية. لكن يجدر ذكر ذلك لأن هذا التفاوت هو ما يجعل تسعير FlashX اختبارًا متعمدًا وليس نتيجة حتمية: إذ يفرض Z.ai علاوة سعرية على تهيئة تقديم خدمة يمكن للعملاء، من حيث المبدأ، بناؤها بأنفسهم للنموذج الأساسي. العلاوة هنا مقابل السهولة، لا مقابل القدرة، وللسهولة سعر سوقي ينخفض بمرور الوقت.

ما الذي يعنيه تغيير السعر حقًا

اقتصاديات الإطلاق واضحة على نحو غير معتاد. فقد أُطلق GLM-5.3-Flash بسعر يعادل عُشر سعر GLM-5.3 — ونصف ذلك خلال عرض ترويجي للإطلاق — وقد استُخدم بكثافة، بما في ذلك فترة من الاختبارات المجهولة قبل الإصدار أكّدتها Z.ai لاحقًا. وFlashX هي المرة الأولى التي تتحرك فيها هذه العائلة في الاتجاه المعاكس: النموذج نفسه، بسعر أعلى. وقد رأى محللون نقلت عنهم الصحافة المالية الصينية أنه اختبار تجاري متعمد لمعرفة ما إذا كان المطورون سيدفعون مقابل السرعة في حد ذاتها، بعد عام من شراء الحصة السوقية بقدرات تقترب من الطليعة وبأسعار زهيدة.

تفصيلان يدعمان هذا التفسير. فـ FlashX مستبعد من خطة GLM Coding Plan، بينما الطراز الأساسي Flash مشمول بحصة ثلاثة أضعاف، لذا لا يمكن لمستخدمي الاشتراك دمج الفئة الجديدة في التزام قائم — بل يدفعون لكل توكن. والسعر ثابت، بلا خصم خارج ساعات الذروة، على خلاف هيكل التوقيت الزمني الذي يعتمده بعض المنافسين لملء السعة الخاملة. أما سعر ثابت بمقدار ×2.5 على فئة سرعة، فهو سعر موجّه لمن لا يستطيعون الانتظار، وZ.ai يكتشف الآن كم عدد هؤلاء.

الاختيار بينهما

اختر FlashX إذا كان إنسان أو خدمة متوقفًا عند الرمز التالي وكان النموذج نفسه هو الخيار الصحيح بالفعل — الإكمال المضمّن، والوكلاء التفاعليون، والدردشة في الوقت الفعلي، وأي شيء يكون فيه التوقف نفسه هو المنتج. اختر GLM-5.3-Flash للعمل على دفعات، والعمل دون اتصال، والعمل بالجملة، ولأي شيء يمكنك جدولته، ولأي عبء عمل تدفع فيه مقابل حجم المخرجات لا مقابل زمن استجابة المخرجات. إذا كان حجمك كبيرًا وكان فريقك قادرًا على تشغيل المسرّعات، فقيّم أوزان الأساس المستضافة ذاتيًا قبل أن تقيّم FlashX؛ فالمقارنة أكثر ملاءمة مما توحي به أسعار الرموز.

أيًّا كان المسار الذي تختاره، فعامل الاثنين على أنهما قابلان للتبادل في موضع الاستدعاء. فهما يستقبلان المطالبات نفسها، ويعيدان الصيغة نفسها، وينتجان الجودة نفسها — والشيء الوحيد الذي يتغير هو سلسلة اسم النموذج، وهي أرخص أنواع اختبارات A/B التي يمكن إجراؤها. على OrcaRouter يُمرَّر سعر القائمة الخاص بالمورّد دون أي هامش ربح ، لذا فإن أي تغيير في تسعير Z.ai أو أي عرض ترويجي يسري في اليوم الذي يُطلَق فيه لدى المصدر، وتقع كلتا الفئتين خلف نقطة نهاية واحدة أمام أكثر من 200 نموذج. وبالنسبة إلى قرار يعتمد كليًا على زمن الاستجابة المقيس، فإن القدرة على التبديل بينهما في منتصف التجربة دون المساس بتكامل نظامك تمثل الجزء الأكبر من العمل.

الحكم أضيق نطاقًا من مقارنة النماذج المعتادة، وهذا هو المقصود بالضبط. فـ FlashX ليس نموذجًا أفضل ولا يدّعي ذلك. إنه النموذج نفسه بطابور انتظار أقصر، ويُباع بسعر لا يكون منطقيًا إلا إذا كان طابور الانتظار هو مشكلتك. قِس بنفسك زمنك حتى أول رمز على كلا النموذجين قبل أن تلتزم — فرقم 200 الذي يعلنه المورّد هو حدّ أعلى، وحمل عملك هو المعيار الوحيد المهم، والفرق بين الفئتين لا يعدو أن يكون تغييرًا في الإعدادات.

A screenshot of the Artificial Analysis model page for GLM 5.3 Flash (captured September 19, 2026) showing an Intelligence Index score of 42 against a class median of 18, 180M tokens generated during evaluation, $0.15 per 1M input and $0.50 per 1M output tokens, and a measured 98 output tokens per second against an average of 71.

مقارنات في هذه المقالة1

مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا