
يُطرح GLM-5.3-FlashX بسعر يعادل 2.5 ضعف سعر النموذج الذي يعمل عليه
- OrcaجديدOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 لكل مليون رمز
- orcaجديدOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 لكل مليون رمز
- deepseekجديدDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- openaiOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- googleGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245الذكاء76البرمجة
- anthropicAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 لكل مليون رمز
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236الذكاء69البرمجة
- grokSpaceXAI: Grok 4.62026-08-1244الذكاء77البرمجة
- metaMeta: Muse Spark 1.22026-08-0540الذكاء72البرمجة
- qwenQwen: Qwen3.8 Max2026-08-0345الذكاء76البرمجة
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135الذكاء69البرمجة
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 لكل مليون رمز
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
الرقم الجدير بالملاحظة ليس 200. بل 2.5. في 18 سبتمبر 2026، طرحت Z.ai GLM-5.3-FlashX على واجهة API الخاصة بها بسرعة تصل إلى 200 رمز إخراج في الثانية — وسعّرته بـ2.5× ما تتقاضاه مقابل GLM-5.3-Flash، النموذج مفتوح الأوزان المبني عليه. لم يتغير شيء في النموذج نفسه. الأوزان ذاتها، والشبكة الخلفية ذاتها بمزيج الخبراء 320B-A18B، وسياق الرموز المليوني ذاته، والتعامل الأصلي نفسه مع النصوص والصور والفيديو والملفات. ما تغيّر هو حزمة الخدمة تحته، وما تتقاضاه Z.ai الآن مقابل امتياز الجلوس أقرب إلى مقدمة الطابور.
وهذا يجعل FlashX شيئًا نادرًا في سوق النماذج: إطلاق دون أي معيار قياس مرفق به. لم تنشر Z.ai أي تقييم خاص بـ FlashX، لأنه لا يوجد نموذج جديد لتقييمه. وكل رقم لقدرة ينطبق على GLM-5.3-Flash ينطبق هنا، بما في ذلك الأرقام التي تقل إطراءً عما أوحَت به تغطية الإطلاق.
الفرق بأكمله، في تمريرة واحدة
• السرعة — GLM-5.3-FlashX حتى 200 tok/s (الذروة المعلنة من المورّد) مقابل GLM-5.3-Flash بسرعة 98 tok/s وفق ما قاسته Artificial Analysis على واجهة Z.ai الخاصةbr> • السعر — 0.37 دولار لكل مليون رمز إدخال / 1.25 دولار لكل مليون رمز إخراج مقابل 0.15 / 0.50 دولار حسب قائمة الأسعارbr> • الإدخال المخزّن مؤقتًا — 0.075 دولار لكل مليون مقابل 0.03 دولار لكل مليونbr> • الذكاء — متطابق؛ إذ يرث FlashX نتائج النموذج الأساسيbr> • السياق — مليون رمز في كليهماbr> • الأوزان — GLM-5.3-Flash أوزان مفتوحة برخصة MIT؛ أما FlashX فهو طبقة مستضافة ولا يملك أوزانًا خاصة به
إن العددين 200 و98 ليسا من النوع نفسه من الأرقام، ويجدر بنا أن نكون صريحين في ذلك. أحدهما سقف تقول الشركة المورّدة إن الخدمة قادرة على بلوغه. والآخر هو ما قاسه مختبر مستقل عبر طلبات حقيقية. وعلى المستخدم الذي يقرر ما إذا كان يدفع 2.5× أن يعامل الرقم 200 كإعلان تجاري، وأن يذهب ليقيس عبء عمله الخاص.

ما يقوله Z.ai هو الذي يقوم بالعمل
التسريع ناتج عن البنية التحتية، لا عن الرياضيات. تصف Z.ai برنامج FlashX بأنه يعمل على عنقود يضم نحو 100,000 مسرّع صيني محلي، مع حزمة خدمة مصممة خصيصًا: محرك استدلال مبني على SGLang، وتكميم W8A8، وتكميم مختلط للذاكرة المؤقتة من INT8/FP8/BF16، وبنية مفككة للترميز والتعبئة المسبقة وفك الترميز تفصل مرحلة الترميز متعدد الوسائط عن مرحلتي توليد الرموز بحيث لا يحجب أحدهما الآخر. وتفيد الشركة بتحقيق نحو 3 أضعاف الإنتاجية الخدمية من الطرف إلى الطرف مقارنة بخط الأساس الأولي لديها على العتاد نفسه، وتقول إن وكيلًا للبنية التحتية مدعومًا بـ GLM-5.3 ساعد في ضبط الحزمة.
كل ذلك مُبلَّغ عنه من قِبل المورّد، ولم يُعِد إنتاجه حتى الآن أي شخص خارج Z.ai. وهو أيضًا الجزء الأكثر معقولية في القصة: فعمليات إطلاق طبقات الخدمة مثل هذه تكون عادةً مكاسب هندسية، والخيارات المعمارية الموصوفة هي مجموعة الأدوات القياسية لتحقيق هذا النوع من المكسب تحديدًا. لكنها ليست ضمانًا. رقم 200 tok/s هو ذروة، ويُبلَغ إلى الذروات عند مخرجات قصيرة وذاكرات تخزين مؤقت ساخنة وعنقود غير مزدحم. أما الطلبات متعددة الوسائط ذات السياق الطويل — وهي عبء العمل الذي يُوجَّه إليه FlashX صراحةً — فهي الأقل احتمالًا لبلوغه.
السعر هو القرار الفعلي للمنتج
بسعر القائمة، تبلغ تكلفة GLM-5.3-FlashX 0.37 دولار لكل مليون رمز إدخال و1.25 دولار لكل مليون رمز إخراج، مع الإدخال المخزن مؤقتًا بسعر 0.075 دولار وتخزين الذاكرة المؤقتة مجاني لفترة محدودة. في التسعير المحلي لـ Z.ai، هذا يعني ¥2 إدخال و¥7 إخراج، مقابل ¥0.8 و¥2.8 لـ Flash الأساسي — نفس نسبة 2.5×، مذكورة بالعملة التي تبيع بها Z.ai محليًا.

الحساب يصبح غير مريح بسرعة في الاتجاه الذي قلّما يتحقق منه الناس. فرموز الإخراج هي حيث تكون مضاعِفات التكلفة أشدّ وقعًا، لأن الإخراج هو الجانب المكلف في كل نموذج في هذه العائلة: إخراج FlashX يساوي 2.5× إخراج Flash، والإخراج أصلًا يبلغ نحو 3.4× سعر الإدخال في كليهما. مهمة دفعاتية تولّد مليون رمز إخراج يوميًا تنتقل من 0.50 دولار إلى 1.25 دولار — فرق قدره 274 دولارًا سنويًا لعبء عمل لا ينتظره أحد، بحكم التعريف.
حيث يعود ذلك بالنفع هو زمن الاستجابة الذي يمكن تقسيط كلفته. حلقة وكيل تُجري عشرة استدعاءات متتالية توفّر الفرق الخاص بكل استدعاء عشر مرات، وإذا كان هذا الفرق ثانيتين أو ثلاث، فقد استعدت نصف دقيقة من الزمن الفعلي لكل مهمة. بالنسبة للإكمال التفاعلي للشيفرة، أو الحوار في الوقت الحقيقي، أو أي مسار يكون فيه إنسان أو خدمة منبع معلّقاً بانتظار الرمز التالي، تكون هذه المقايضة صحيحة عادةً. كما توضح Z.ai صراحةً أن النموذج ليس جزءاً من خطة GLM Coding Plan الخاصة بها حالياً، لذا لا يحصل مستخدمو الاشتراك على FlashX ضمن الحزمة — بل يدفعون مقابل كل رمز للحصول عليه.
إذا كانت حزمتك التقنية تتحدث بالفعل إلى أكثر من مزوّد واحد، فإن التحويل هو تغيير في سلسلة الطراز ولا شيء غير ذلك. وهذا هو السبب العملي لوجود التوجيه كطبقة: على OrcaRouter يُمرَّر سعر القائمة لدى المورّد بهامش ربح 0%، لذا فإن تغيير سعر Z.ai أو خفضًا ترويجيًا يصل في اليوم نفسه الذي يحدث فيه في المنبع، ونقطة نهاية واحدة أمام أكثر من 200 طراز تعني أن تقييم FlashX مقابل Flash هو تعديل في الإعدادات وليس مشروع تكامل. كما أن تجاوز الفشل مهم هنا أيضًا — فطبقة تقديم جديدة تمامًا على عنقود جديد تمامًا هي بالضبط نوع الاعتماد الذي يستحق أن تكون له خطة احتياطية خلفه.
ما الذي لم يتغيّر، ولماذا يهم أكثر
يرث FlashX ملف القدرات الخاص بـ GLM-5.3-Flash بالكامل، وهذا الملف أضيق مما أوحت به تغطية الإطلاق. تضع مواد Z.ai النموذج الأساسي في مستوى Claude Opus 4.8 على مؤشر Artificial Analysis Intelligence Index. وتُدرج Artificial Analysis نفسها حاليًا GLM-5.3-Flash عند 42 على ذلك المؤشر، مقيسًا على واجهة API الخاصة بـ Z.ai — نتيجة قوية، أعلى بكثير من الوسيط لنماذج مفتوحة الأوزان من فئتها، وبعيدة جدًا عن الطبقة الحدودية التي توحي بها مقارنة المورّد. كلتا العبارتين صحيحتان؛ غير أنهما ليستا العبارة ذاتها، والفجوة بينهما هي السبب وراء وصف هذه المدونة أرقام المورّد بأنها أرقام مورّد.
النموذج الأساسي قادر حقًا ومفتوح حقًا. صدر GLM-5.3-Flash في 26 أغسطس 2026 تحت رخصة MIT مع أوزان على Hugging Face، ويؤدي تصميمه الهجين للانتباه الخطي والمتناثر — ضغط IndexPool، والاتصالات الفائقة المقيّدة بالمتشعبات — إلى تقليص حوسبة الانتباه بنحو 3× وتقليص ذاكرة KV المؤقتة بنحو 4.4× مقابل GLM-5.3، وهذا ما يجعل نموذجًا بحجم 320B مع 18B معامل نشط رخيصًا بما يكفي لتقديم الخدمة أصلًا. الإخراج محدود بـ131,072 رمزًا. إنه سريع بالنسبة لسعره، لا سريع بالنسبة لفئته: قاست Artificial Analysis 98 رمزًا في الثانية مقابل وسيط نظراء يتجاوز 70 لكنه أدنى من أسرع النماذج في لوحة الترتيب.
لا يغيّر FlashX أيًا من ذلك. إنه يغيّر المدة التي تنتظرها للحصول عليه.
القراءة الصادقة
اشترِ FlashX إذا كان عبء العمل لديك مرتبطًا بزمن الاستجابة وقد قررت بالفعل أن GLM-5.3-Flash هو النموذج المناسب — وكيل يسلسل الاستدعاءات، أو محرر يكمل أثناء الكتابة، أو واجهة صوتية أو دردشة تكون الوقفة فيها هي المنتج. ابقَ على GLM-5.3-Flash، أو على الأوزان المفتوحة التي يمكنك استضافتها بنفسك، إذا كان عملك على دفعات أو دون اتصال أو مرتبطًا بمعدل النقل بدلًا من زمن الاستجابة. الذكاء الذي تدفع مقابله 2.5× هو الذكاء الذي كان لديك بالفعل.
السؤال المفتوح هو ما يقوله القياس المستقل بشأن الـ200. لم ينشر أحد خارج Z.ai أرقام الإنتاجية الخاصة بـ FlashX بعد، وإلى أن يفعل ذلك أحد، فإن الموقف الصادق هو أن FlashX طبقة خدمة واعدة تُسوَّق اعتمادًا على رقم ذروة. كما أنه، بشكل لافت، اختبار تجاري: مختبر أمضى عامًا وهو يقدّم نموذجًا قريبًا من الطليعة بعُشر سعر طرازه الرائد، يطرح الآن سؤالًا: هل سيدفع المطورون مقابل السرعة في حد ذاتها؟ وستشكّل الإجابة كيفية تسعير الطبقة التالية.

مقارنات في هذه المقالة2
مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا
