كشف النقاب عن GLM-5.3-Flash — كان «Ox Alpha» المجهول هو نموذج Zhipu الرائد المفتوح متعدد الوسائط طوال الوقت. رسم توضيحي مُعاد توليده.
Guides & Insights

GLM-5.3-Flash، بعد خمسة أسابيع: 42 مستقلة، وعملية استغلال بمستوى Mythos، ووكيل GLM الذي أعاد بناء بنية الخدمة الخاصة به

الكاتب

Rowan Sterling

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج →
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

يقدّم GLM-5.3-Flash خدمة حركة الإنتاج منذ خمسة أسابيع، وفي 17 سبتمبر 2026 قالت Zhipu AI شيئًا عن المكان: أفصحت الشركة أن كل طلب إنتاجي لـ GLM-5.3-Flash يعمل الآن على أسطول يضم أكثر من 100,000 مسرّع ذكاء اصطناعي صيني محلي الصنع، وأنها انتقلت من أول إقلاع على ذلك العتاد إلى حمل كامل حمل العمل الحيّ في أقل من أسبوعين، وأن الإنتاجية من طرف إلى طرف ارتفعت 3.2 مرة خلال الفترة نفسها. الجزء الذي امتد أثره إلى أبعد مدى هو مَن أنجز العمل. فقد أنجز جزء كبير منه ليس فريق البنية التحتية بل وكيل مدفوع بـ GLM-5.3 نفسه، قرأ الاختناقات، واقترح إصلاحات، وكتب شيفرة نظام الاستدلال، بينما حدّد المهندسون الأهداف، وبنوا بيئة التغذية الراجعة، وراجعوا أي شيء يمسّ الدلالات الرقمية أو التزامن أو مخاطر الإنتاج. GLM-5.3-Flash هو النموذج متعدد الوسائط بإجمالي 320 مليار معامل و18 مليار معامل نشط (320B-A18B) الذي أطلقته Zhipu وفتحت مصدره في 26 أغسطس 2026 — وهو «Ox Alpha» المجهول الذي كشفت عنه الشركة ذلك اليوم — وشقيقه الأكبر GLM-5.3 هو النموذج الرائد بحجم 743B الذي وُضع تسعير GLM-5.3-Flash مقارنةً به. ولم يأتِ أي من الأرقام الثلاثة في إفصاح اليوم منا أو من أي جهة أخرى: فهي أرقام Zhipu الخاصة. كما لم يعد النموذج الرائد هو المقارنة الوحيدة التي تهم: ففي ExploitBench، وهو تقييم مستقل لمدى تقدم نموذج في سلّم استغلال حقيقي لمتصفح Chrome، جرى الآن قياس GLM-5.3-Flash على قدم المساواة مع Claude Mythos Preview، النموذج الحدودي المغلق الذي أتاحه مطوّره فقط لمدافعين خضعوا للتحقق، وبجزء صغير من التكلفة لكل محاولة.

تلك هي الأخبار السارة، وهي حقيقية لكنها معلنة من البائع. تغيّرت ثلاثة أمور أخرى منذ أن نُشر هذا المنشور أول مرة في يوم الإطلاق، واثنان منها يسيران في الاتجاه المعاكس. نشرت Artificial Analysis الآن قياسها الخاص للنموذج، ورقمها ليس رقم Zhipu. وخصم الإطلاق الذي جعل هذا أرخص نموذج قادر في السوق انتهى في موعده المحدد في 9 سبتمبر ولم يُمدّد. وقد نشرت جهة تقييم خارجية، Generality Labs، تشغيلها الخاص لـ ExploitBench، سجّل فيه GLM-5.3-Flash أعلى من متوسط ثلاث محاولات لـ Claude Mythos Preview على السلّم نفسه — مقابل نحو ست سنتات لكل دولار. وبالنسبة لأي شخص وضع هذا النموذج في المفضلة في أواخر أغسطس باعتباره «الرخيص»، فإن الحسابات اليوم مختلفة عما كانت عليه، والعنوان الصادق مختلط: تحسّنت اقتصاديات التقديم فعلاً، وارتفع السعر لأن عرضاً ترويجياً انتهى، ورقم الذكاء الشائع الاستشهاد به لم يصمد عند أول احتكاك بمنظومة تقييم مستقلة، ومقارنة القدرات التي ذهبت في صالح النموذج هي تشغيل واحد غير محكّم يقول مؤلفوه أنفسهم إنه لا ينبغي المبالغة في قراءته.

Zhipu هي المصدر الوحيد لحجم العنقود، والجدول الزمني البالغ أسبوعين، ومعامل 3.2x — ولا يوجد تدقيق مستقل لأي منها، وتقول الشركة نفسها إنها لم تحقق تحسناً ذاتياً تكراريًا، وتصف النتيجة بأنها حلقة بأدنى نطاق وليس الشيء الحقيقي. ما أمكن التحقق منه، تحققنا منه: الأثر الملموس الوحيد في الرواية الذي يقع خارج أسوار Zhipu — إصلاح للدقة في نواة Flash Linear Attention — مدمج فعلاً في المنبع upstream، وقد أكدنا ذلك. وحيثما يأتي رقم أدناه من Zhipu، يُذكر ذلك. وحيثما يأتي من Artificial Analysis، يُقال ذلك بدلاً منه. وحيثما يأتي من Generality Labs — الجهة المختصة بتقييم السلامة التي تقف وراء أرقام الاستغلال في هذا المنشور — يُذكر ذلك، إلى جانب المحاذير التي أرفقها مؤلفوها بأنفسهم: تشغيل واحد، و41 خطأً، ومنهج منشور ذاتياً، ولا إعادة إنتاج من طرف ثالث، ومسألة تلوث يطرحونها بمبادرة منهم. وحيثما كان الرقم من Anthropic — وهي الأرقام الوحيدة هنا التي تأتي من مختبر له مصلحة تنافسية في الإجابة — يذكر المتن أي نموذج قاسه فعلاً، لأنها ليست جميعها خاصة بهذا النموذج.

ما الذي تم شحنه فعليًا

GLM-5.3-Flash هو نموذج مزيج خبراء بإجمالي 320 مليار معامل و18 مليار معامل نشط، ويضم 45 طبقة، مما يضع حجمه النشط عند أكثر قليلًا من نصف حجم GLM-5.2 البالغ نحو 32 مليار معامل. أبرز قدرة هي تعدد الوسائط: فهو يستقبل النص والصورة والفيديو كمدخلات أصلاً — أول نموذج من GLM-5 يفعل ذلك — بدلاً من توجيه الرؤية عبر محول منفصل. ويمتد السياق إلى مليون رمز، وتزعم Zhipu أن تكلفة تقديم السياق الطويل تصل إلى نحو ثلث تكلفة GLM-5.3.

على صعيد البنية، تصف Zhipu النموذج بأنه أول نموذج حدودي مفتوح المصدر يقرن انتباهًا هجينًا يجمع بين المتناثر والخطي مع Manifold-Constrained Hyper-Connections (mHC) من أجل التوسّع، وآلية IndexPool تضغط أربعة متجهات مفاتيح للفهرسة في مجمّع مرجّح واحد لتقليص زمن استجابة السياقات الطويلة. أُجري التدريب المسبق على مجموعة بيانات متعددة الوسائط تضم 30 تريليون توكن. لا شيء من ذلك خضع لتدقيق مستقل — إنما هي Zhipu تصف نموذجها الخاص — لكن ادعاءات كفاءة التقديم محددة بما يكفي لاختبارها الآن بعد أن صارت الأوزان متاحة أمام مكدس الاستدلال مفتوح المصدر، ويضيف تقرير 17 سبتمبر أول صورة مفصلة عن كيفية بناء جانب التقديم فعليًا.

ورقة مواصفات يوم الإطلاق، في لمحة:

• المعاملات — 320 مليار إجمالاً / 18 مليار نشطة، 45 طبقة، MoE.

• الوسائط — إدخال أصلي للنص والصورة والفيديو؛ وإخراج نصي.

نافذة السياق — حتى 1,000,000 رمز.

• الترخيص — MIT، أوزان مفتوحة على Hugging Face منذ يوم الإطلاق.

• السعر — 0.15 $ / 0.50 $ لكل مليون رمز (إدخال / إخراج)، 0.03 $ لكل مليون إدخال مخزّن مؤقتًا.

A generated single-model scoreboard titled 'GLM-5.3-Flash — the scoreboard' with rows for AA Index 57 (vendor-reported), Active params 18B, Context 1M tokens, Modality text/image/video, Open weights MIT live now, and Price ~$0.14/$0.44 per 1M (discount $0.07/$0.22); footer notes benchmarks are vendor-reported and pricing is derived from Zhipu's stated ratios.

تلك البطاقة لقطة من يوم الإطلاق، وقد تغيّر صفّان من صفوفها منذ 26 أغسطس. ولا يزال رقم AA Index ادّعاءً من Zhipu نفسها، ويناقضه الآن قياس مستقل — والمزيد عن ذلك أدناه. أما السعر المخفّض الذي تعرضه فقد زال؛ إذ انتهى العرض الترويجي في 9 سبتمبر. وتُعدّ أعداد المعاملات، ونافذة السياق، والترخيص، والوسائط حقائق حالية لم تتغير، وهي المقصود الأساسي من الصورة.

أسبوع Ox Alpha، وما الذي كان السحب المجاني يختبره حقًا

طوى الكشف أسبوعًا من التكهنات. في 20 أغسطس/آب، ظهر نموذج مجهول على منصة API للذكاء الاصطناعي تابعة لطرف ثالث، بنافذة سياق تبلغ مليون توكن، وإدخال نص/صورة/فيديو، وبسعر صفر، وسرعان ما أصبح النموذج الأكثر استدعاءً في لوحات الصدارة الأسبوعية لتلك المنصة. وخلال 48 ساعة، أعاد المجتمع تتبّع بصمته إلى عائلة GLM من Zhipu — وهو النمط نفسه: مجهول ثم مُعلن عنه، والذي سبق أن كشف هوية نماذج من مختبرات صينية أخرى — ورجّح المحللون على نطاق واسع أنه GLM-5.3 بنسخة Flash. وأكد إعلان 26 أغسطس هذا التخمين: فقد كان الأسبوع المجاني اختبارًا متعمدًا، وتقول الشركة إن التشغيل المجهول مرّر أكثر من 62 تريليون توكن في ستة أيام عبر منصات البرمجة التي طُرح فيها، وكل ذلك جرى تقديمه بالكامل عبر رقائق صينية محلية.

بدا ذلك البند الأخير في حينه أشبه بحاشية. لكنه تبيّن أنه المقصد. فالأسبوع المجاني لم يكن في الأساس حيلة تسويقية ولا حتى اختبار تحميل للنموذج؛ بل كان اختبار تحميل لأسطول المسرّعات الذي يقع تحته، أُجري على نطاق كان الفشل فيه سيكون علنيًا ومجانيًا. وبعد ثلاثة أسابيع، تصف Zhipu الأسطول نفسه بأنه يحمل 100% من حركة الإنتاج الخاصة بالنموذج.

A screenshot of the Z.ai blog page for the GLM-5.3-Flash launch, titled 'GLM-5.3-Flash: Frontier Intelligence, Flash Cost', describing the 320B-total / 18B-active model as the first natively multimodal model in the GLM-5 series, at one-tenth the price, approaching Claude Opus 4.8 on coding benchmarks.

لا يزال منطق التسعير في ذلك الأسبوع قائمًا، مع تصحيح واحد. طرح طراز مجانًا مقابل 0 دولار لمدة أسبوع ثم أُطلق بعُشر سعر الطراز الرائد مع خصم إضافي بنسبة 50% كان خطوة متعمَّدة لصناعة السوق في الفئة الاقتصادية، وكان وصف «لفترة محدودة» دائمًا هو الجزء الجدير بالمراقبة. أشرنا إليه باعتباره أمرًا يمكن التراجع عنه. وقد تم التراجع عنه في الموعد المحدد — وهذا جدير بالقول بوضوح، لأن انتهاء صلاحية الخصم هو التغيير الوحيد في هذه القصة الذي يظهر على الفاتورة.

مكدّس التقديم الذي أعاد وكيلٌ بناءه

يُعدّ التقرير الفني الذي نشرته Zhipu في 17 سبتمبر أول وصف مفصّل لكيفية تشغيل GLM-5.3-Flash على شرائح صينية، ويتمثل ادعاؤه المركزي في أن نموذجًا ساعد في تحسين النظام الذي يشغّله. وتسمّي الشركة هذه الآلية التغذية الراجعة الكثيفة: فقد رُبطت اختبارات الصحة، وسجلات التنفيذ، والتتبعات، والقياسات المتناهية الصغر، والمقاييس من الطرف إلى الطرف بحيث يستطيع وكيل التحقق من فرضية محليًا بدل انتظار نشر كامل واختبار حمل بعد كل تغيير. ولكي ينجح ذلك، تقول Zhipu إنه كان لا بد أن تكون التغذية الراجعة محلية ورخيصة وقابلة للتحقق الموضوعي — مرتبطة بنواة محددة أو مسار شفرة محدد، وسريعة بما يكفي للتكرار عليها، وصحيحة أو خاطئة دون وجود إنسان في الحلقة.

مع تطبيق تلك الحلقة، اكتشف الوكيل وأصلح ثلاثة أشياء وصفتها الشركة بالتفصيل:

• كان مسار متوازي السياق في نواة KDA يفقد الدقة مع نمو التسلسلات، لأن tl.dot كان افتراضيًا على TF32 رغم مدخلات FP32، مما فاقم خطأ التقريب مع طول السياق. يثبّت الإصلاح دقة الإدخال على tf32x3، مع تراجع احتياطي إلى ieee على المنصات التي لا تدعم TF32. هذا هو الأكثر إثارة للاهتمام بين الثلاثة، لأنه الادعاء الوحيد في الحساب الذي يخرج عن البنية التحتية الخاصة بـ Zhipu: التغيير مدمج في المنبع في Flash Linear Attention باسم PR #1180، وقد تحققنا منه وأكدنا دمجه في 27 أغسطس 2026.

• لم يكن نقل KV يتداخل مع جدولة DeepEP. لم يكن أيٌّ من الإرسال داخل العقدة أو الدمج داخل العقدة يُحرّر Python GIL في نسخة DeepEP المستخدمة، مما أدى إلى توقف خيط النقل خلفهما؛ وتضع الروايتان الإنجليزية والصينية لنفس المقال النفقات الناتجة فوق 20% وفوق 30% على التوالي. بعد الإصلاح، تقول Zhipu إن الفجوة مقابل خط الأساس الخاص بها القائم على التعبئة المسبقة فقط قد انخفضت إلى أقل من 1%.

• كانت نواة فك ترميز تعيد حساب التطبيع والبوابة نفسيهما بصيغة FP32 أربع مرات، مرة لكل شريحة من بُعد V. أدى تقسيم عمل القسمة إلى خفض زمن النواة بنسبة 9.6%، كما أن دمج الشرائح في كتلة خيوط واحدة — بحيث يُنفَّذ التطبيع مرة واحدة — أنتج تسريعًا مقداره 1.71x.

وحول تلك الإصلاحات توجد التغييرات الهيكلية: ReplaySSM، الذي يقايض الحوسبة بالذاكرة على الشريحة لأن المسرّعات لديها قدر أقل من الأخيرة مما لدى وحدات GPU التي كُتبت الحزمة البرمجية أصلاً من أجلها؛ والتوازي التنسوري داخل العقدة لتخفيف الضغط نفسه؛ والتخزين المؤقت المختلط بـ INT8 وFP8 وBF16 لتوسيع السعة؛ وبنية Encode-Prefill-Decode المفككة التي تُجدول مراحل الاستدلال الثلاث بشكل منفصل بدلاً من خط أنابيب واحد. كما تسمّي Zhipu القيود بصراحة — ذاكرة محدودة على الشريحة وعرض نطاق ربط بيني، وبرمجيات غير ناضجة، وتغطية نوى غير مكتملة، وتوثيق شحيح — وتقول إنها لم تحقق التحسين الذاتي التكراري، واصفة النتيجة بأنها حلقة على الحد الأدنى من النطاق.

اقرأ الرواية بتشكك، لأن الحوافز واضحة. لن تقول Zhipu مقدار العمل الذي أنجزه الوكيل مقابل ما أنجزه المهندسون، ولا يوجد تدقيق خارجي في رقم الإنتاجية، أو الجدول الزمني لأسبوعين، أو حجم العنقود. كما أن تأطير التغذية الراجعة الكثيفة يخدم المصلحة الذاتية بطريقة محددة: فهو يجعل الادعاء الأكثر إبهارًا في ظاهره («نموذجنا حسّن نفسه») يرتكز على أقل الأدلة قابلية للتحقق (حلقة داخلية لا يستطيع أحد فحصها). ما يمنع الرواية من أن تكون تسويقًا خالصًا هو أن أكثر ادعاء ملموس فيها قابل للدحض، ويتبين أنه صحيح — فإصلاح نواة tf32x3 موجود فعلًا في المستودع upstream، بتاريخ 27 أغسطس، قبل ثلاثة أسابيع من الدورة الصحفية التي دارت حوله.

كم تبلغ تكلفته، بالدولار الفعلي

بطاقة الأسعار هي بطاقة Zhipu، وهي بسيطة: $0.15 لكل مليون رمز إدخال، و$0.50 لكل مليون رمز إخراج، و$0.03 لكل مليون رمز إدخال مخزّن مؤقتًا. هذا هو سعر القائمة اعتبارًا من اليوم. استمر عرض الإطلاق بخصم 50% حتى 9 سبتمبر 2026 ولم يُمدَّد، لذا لم تعد أرقام $0.075 / $0.25 / $0.015 التي انتشرت على نطاق واسع في أواخر أغسطس متاحة على واجهة برمجة التطبيقات الخاصة بالمورّد نفسه. وبالمقارنة مع سعر GLM-5.3 المعلن البالغ $1.40 / $4.40، لا يزال Flash يقع عند نحو العُشر بسعر القائمة — فكان الخصم مكافأة إضافية فوق سعر كان يشكّل نقطة الجذب أصلًا، وليس السعر نفسه. تحسب Artificial Analysis سعرًا مدمجًا يبلغ نحو $0.10 لكل مليون رمز وفق مزيج 7:2:1 من إصابة الذاكرة المؤقتة/الإدخال/الإخراج، وتدرج سرعة الإخراج عند نحو 117 رمزًا في الثانية، وهو ما تصفه بأنه سريع بشكل ملحوظ، رغم أن AA تشير إلى أن أرقام السرعة تصف واجهة برمجة التطبيقات الخاصة بالطرف الأول للطراز وليس اختبارًا أجرته AA.

قصة التكلفة الأوسع لدى Zhipu هي السبب الذي يسمح للسعر بالبقاء عند هذا المستوى. في نتائجها النصف سنوية، المنشورة في 31 أغسطس، قالت الشركة إن تكلفة الاستدلال لكل رمز على أسطولها المحلي البالغ 100,000 مسرّع قد انخفضت بنسبة 80% منذ بداية عام 2026، وإن هامش الربح الإجمالي لواجهة API انتقل من -0.4% إلى 24.6% نتيجة الحجم والتسعير وتقديم أرخص. هذه أرقام الشركة من شركة ترفع تقاريرها إلى المساهمين، وهي غير مدققة من جانبنا؛ عاملها على أنها واضحة اتجاهياً لا دقيقة. وشرح التقديم أعلاه هو الآلية التي تقف خلف الادعاء — تمريرات kernel مكررة أقل، وضغط ذاكرة أقل، وتراكب أفضل — وهو سرد أكثر مصداقية من نسبة مجردة، حتى لو كانت النسبة هي التي سيُقتبس منها.

ادعاءات الكفاءة مقارنةً بالطراز الرائد لم تتغيّر: حسابات الانتباه انخفضت 3.0x وذاكرة KV المؤقتة انخفضت 4.4x مقابل GLM-5.3، وفق ما أعلنته الشركة، مع إقرار Zhipu بأن ذاكرتها KV المؤقتة لا تزال أكبر قليلاً من ذاكرة DeepSeek V4 Flash وKimi K3. أما الادعاء الذي سِيق عند الإطلاق بتحقيق تحسّن من طرف إلى طرف بمقدار 3x في الخدمة على الشرائح المحلية، فيُ stated الآن بوصفه 3.2x، مقيساً من أول إقلاع حتى اكتمال حركة مرور الإنتاج. الرقمان كلاهما لـ Zhipu، والحسابان اللذان يحملانهما يفصل بينهما ثلاثة أسابيع — ولم يُعَد إنتاج أي شيء مما ورد هنا خارج الشركة.

لماذا يهمّ الكشف — وأين ذهب الرقم الرئيسي

هذا هو التصحيح الأهم لكل من قرأ تغطية الإطلاق واحتفظ بالرقم. وضعت مواد Zhipu نموذج GLM-5.3-Flash عند 57 على مؤشر Artificial Analysis للذكاء، بما يطابق Claude Opus 4.8. ومنذ ذلك الحين نشرت Artificial Analysis قياسها الخاص للنموذج على Intelligence Index v4.3، وقد سجل 42 — مقابل 47 لـ GPT-5.6 Sol (max) على الإصدار نفسه. لم يكن الرقم 57 يوماً رقماً مستقلاً؛ فقد كان رقم Zhipu، والقياس المستقل يضع النموذج عند نحو خمس نقاط دون النطاق المجاور للحدود التقنية، وأدنى بكثير من الرقم الرئيسي لدى المورّد. وعلى المؤشر الحالي نفسه، يُقاس GLM-5.3 نفسه عند 45، لذا لم يعد الرقم 60 للنموذج الرائد الذي ظهر في تغطيتنا للإطلاق مطابقاً لما تنشره Artificial Analysis اليوم. الفجوة البالغة 15 نقطة بين الادعاء والقياس ليست فرقاً ناتجاً عن التقريب، وهي أكثر شيء مفيد وحده يمكن للقارئ أن يستخلصه من هذا التحديث — مع تحفظ واحد يضيفه القسم أدناه، لأن القياس المستقل الثاني في هذه القصة يشير في الاتجاه المعاكس.

ما يبقى بعد ذلك التصحيح أضيق نطاقًا لكنه لا يزال حقيقيًا. GLM-5.3-Flash هو نموذج متعدد الوسائط مفتوح الأوزان بسياق يبلغ مليونًا، وإدخال أصلي للصور والفيديو، وبسعر قائمة يبلغ نحو عُشر سعر نظيره الرائد — وهو مزيج لا يوجد له مقابل مباشر من مختبرات الذكاء الاصطناعي الحدودية الأمريكية، التي تكلف نماذجها متعددة الوسائط المماثلة أكثر بكثير وتُطرح مغلقة. وصياغة Zhipu نفسها، «ذكاء حدودي، بتكلفة فلاش»، هي الجزء الذي تلقّى الضربة: فعند نتيجة قياس تبلغ 42، يكون نموذجًا اقتصاديًا قويًا، لا نموذجًا حدوديًا بخصم. كما يضعه قياس مستقل فوق الوسيط بهامش مريح بين النماذج مفتوحة الأوزان المماثلة في الحجم، وهو إنجاز حقيقي لنموذج ذي 18B معاملًا نشطًا بتكلفة استدلال تبلغ عُشر التكلفة — لكنه مجرد إنجاز مختلف عما أوحَت به تغطية الإطلاق.

الرقم المستقل الآخر — وقد كان في صالح النموذج

إذا كان نتيجة Artificial Analysis قد أنزلت GLM-5.3-Flash درجة، فإن هذه النتيجة تسير في الاتجاه المعاكس، وهي أغرب حقيقة في القصة. لا يطرح ExploitBench، المطوَّر في Carnegie Mellon، سؤالاً عما إذا كان النموذج قادرًا على إسقاط هدف. بل يقيس التسلق: الوصول إلى الشيفرة المعرضة للخطر، وإثارة الخطأ، وبناء أوليات قابلة لإعادة الاستخدام، وأخيرًا الاستيلاء الكامل على تدفق التحكم مع تنفيذ شيفرة عشوائية، ويُقيَّم آليًا مقابل V8 الإنتاجي مع تشغيل العزل الأمني. شغّلت Generality Labs نموذج GLM-5.3-Flash على 41 خطأً برمجيًا بميزانية مليار رمز لكل خطأ، بدلاً من الحد المعتاد للمعيار البالغ 300 دور، بحجة أن الأدوار مقياس ضعيف لما ينفقه المشتري فعليًا، وأن الدولارات هي القيد الصادق. وصل GLM-5.3-Flash إلى تنفيذ شيفرة عشوائية كامل في 13 من أصل 41، وحصل على متوسط درجة قدرة بلغ 64.8% من الحد الأقصى للسلم. حصلت التشغيلات الثلاث المنشورة لـ Claude Mythos Preview على 9 و10 و11 على نفس السلم — بمتوسط 10، أو 62.2%. الصياغة الخاصة بـ Generality، المطبوعة أسفل المخطط، هي أن GLM-5.3-Flash «قد يكون بمستوى Mythos في الأمن السيبراني» وفق هذا القياس. تقرير ExploitBench الخاص بـ Anthropic، المنشور في 29 سبتمبر، يسجل نفس الترتيب بمعدلات مطلقة أقل بكثير — وإن كان على النموذج الرائد GLM-5.3، وليس على Flash: فهو يحسب الاستغلالات من البداية إلى النهاية لكل محاولة بدلاً من تقدم السلم، ويضع GLM-5.3 عند 50 من 410 مقابل 56 من 410 لـ Mythos Preview. قاعدة عد مختلفة، ترتيب مماثل — وهذا بالضبط هو السبب في أنه لا ينبغي أبدًا اقتباس رقم ExploitBench دون إرفاق القاعدة.

السبب المهم هو المقام الكامن تحته. سعّر التشغيل رموز مخرجات GLM-5.3-Flash عند 0.25 دولار لكل مليون — وهو سعر الإطلاق بخصم 50%، الذي انتهت صلاحيته منذ ذلك الحين — مقابل سعر Claude Mythos Preview التاريخي البالغ 125 دولاراً لكل مليون، أي فجوة مقدارها 500 ضعف. عند تعادل التكلفة، أنفق التشغيل 16.81 دولاراً لكل ثغرة مقابل 297.17 دولاراً لدى Mythos، ومن هنا يأتي الرقم الذي يبلغ نحو 6%. اقرأ الادعاء بعناية، لأن النسخة المتداولة هي النسخة الخاطئة. فالأمر ليس أن GLM-5.3-Flash مطوّر استغلال أفضل من Claude Mythos Preview. بل إن دولاراً من رموز GLM-5.3-Flash يشتري تقريباً ما يشتريه دولار من رموز Mythos في هذه المهمة تحديداً، وأنه يمكنك تحمّل إنفاق دولارات أكثر بكثير على الأول.

محاذير Generality نفسها تستحق أكثر من العنوان الرئيسي. فهي تقول بصراحة إن تشغيلًا واحدًا لا يثبت التكافؤ عبر الأمن السيبراني ككل، وإن التلوث مسألة مفتوحة — فقد تكون ExploitBench دُرِّب عليها بطريقة ما — وإن أربعًا من العينات الـ41 وقعت في أخطاء وحُسبت بنقل آخر نتيجة مرصودة إلى الأمام، وهو ما يقلل من شأن النموذج إن فعل شيئًا. كما نشرت متابعة في 28 سبتمبر تزيد المقارنة كلها تعقيدًا. فعند تشغيل GLM-5.3-Flash عبر سبعة أُطر مختلفة لتشغيل الوكلاء بميزانية 250 مليون رمز، وعلى عشر عينات مختارة لتغطي مدى الصعوبة، سجّلت الأوزان نفسها 10.6 تحت إطار Codex — فوق مرجع Claude Mythos Preview البالغ 10.02 — و6.2 تحت إطار Claude Code، أي دون حتى الإعداد الأصلي للمقياس المحدود الجولات عند 6.4. وقد حرّك إطار التشغيل النتيجة أكثر مما فعلت مقارنة النماذج، ويقول المؤلفون إن المجموعة الفرعية المكوّنة من عشر عينات ليست ممثلة على الأرجح. وإن انتشار المخطط على نطاق واسع في 2 أكتوبر مع الحجة بأن توسيع الحوسبة وقت الاختبار يمحو الفجوات بين فئات النماذج هو ادعاء عن القطاع، وليس نتيجة من نتائج التقييم: ما وجده التقييم هو أن نموذجًا مفتوحًا رخيصًا، إذا مُنح ميزانية بدلًا من حد للجولات، يمكنه أن يبلغ متخصص استغلال في مختبر حدودي على سلّم واحد.

لم تعد هذه قصة مختبر واحد. فقد شغّل تقييم فريق Frontier Red Team التابع لـ Anthropic نفسه، المنشور في 29 سبتمبر، نموذج GLM-5.3-Flash — الشقيق الأصغر — في جلسة بوجود إنسان في الحلقة: بعد أن أُعطي تفاصيل علنية عن ثغرة Chrome مُرقَّعة وثغرة أخرى إضافية، ودون توجيه ذي شأن، سلسل النموذج بينها ليصنع استغلالًا موثوقًا لـ ARM64 تجاوز تحصين مصادقة المؤشرات، خلال 20 دقيقة من الانتباه البشري وثماني ساعات من عمل النموذج — 20.40 دولارًا بأسعار API الخاصة بـ Zhipu. التقييم نفسه هو مصدر رقم 50 من 410 في ExploitBench المذكور أعلاه، وقد قاس ذلك الجزء منه GLM-5.3، النموذج الرائد بحجم 743B، لا Flash — وهو تمييز طغت تغطية التقرير عليه إلى حد كبير. طرفان مستقلان، وأدوات اختبار مختلفة، وميزانيات مختلفة، والاتجاه واحد. وكلاهما أيضًا عمليتا تشغيل من مختبر واحد، وليست أي منهما نتيجة مُعاد إنتاجها، وتجربة Generality وحدها هي التي تذكر رقمًا بالدولار الخاص بـ Flash لا بالنموذج الرائد. والقراءة العملية هي التي يصرّح بها Anthropic صراحةً: الأوزان قابلة للتنزيل، واستغرق إخضاع GLM-5.3-Flash لعملية abliterating نحو 600 ساعة GPU، ونموذج تبلغ تكلفة تشغيله أقل من دولار في الساعة هو نوع مختلف من مشكلات الإتاحة مقارنةً بنموذج يقف خلف برنامج تدقيق.

جرّبها، وكيف تتناسب طبقة التوجيه

الوصول مباشر. توفّره واجهة API الخاصة بـ Zhipu بالسعر المدرج أعلاه، والأوزان المرخّصة بموجب MIT موجودة على Hugging Face في zai-org/GLM-5.3-Flash بصيغتي FP8 وBF16، كما تضمّه منتجات Zhipu البرمجية — ZCode وGLM Coding Plan. للاستضافة الذاتية، يدعمه كل من vLLM وSGLang. ملاحظتان عمليتان إن سلكت هذا المسار: يحمل كتاب وصفات SGLang تحذير تغيير مفتوحاً بأن مدخل الرؤية قد يُسقَط بصمت في بنى transformers قبل 5.13، وهو ما لن يرفع خطأً وسيمنحك ببساطة قراءة نصية فقط لطلب صورة؛ ومسار AMD لا يزال ليس وصفة جاهزة. أُغلق طلب السحب الأصلي الخاص بتمكين gfx950 في يوم الإطلاق (sgl-project/sglang #37653) دون دمجه في 6 سبتمبر، واستُبدل بمجموعة أوسع من طلبات السحب الخاصة بـ gfx950 ليوم الصفر — mHC عبر AITER، ومفهرس k-pool DSA، وتقديم FP8 وMXFP4 — وكان عدد منها لا يزال مفتوحاً في 17 سبتمبر. تمكين الأجهزة من فئة MI350X قيد التقدم، ولم يُطرح بعد، ولا يزال لا يوجد رقم إنتاجية مستقل لـ AMD.

على صعيد التوجيه، تغيّر الوضع منذ الإطلاق: أصبح GLM-5.3-Flash الآن ضمن قائمة OrcaRouter، إلى جانب بقية سلسلة GLM. نحن نمرّر سعر القائمة الخاص بالمزوّد بهامش ربح 0% ومن دون أي رسوم إضافية على الراوتر، وهو بالضبط الآلية التي تهمّ نموذجًا تغيّر سعره للتو — فالخصم المنتهي الصلاحية من جانب Zhipu هو السعر الذي تدفعه هنا، في اليوم نفسه، من دون عقد ثانٍ لإعادة التفاوض ومن دون تغيير في الكود. تمرير السعر هذا ذو حدّين، ويجدر أن نكون صريحين بشأنه: العرض الترويجي المنتهي هو زيادة حقيقية في السعر على فاتورتك، ويحدث هنا في اللحظة نفسها التي يحدث فيها في المنبع. إذا كنت توازن بين Flash وGLM-5.3 أو نموذج اقتصادي آخر، فكلاهما يقع خلف مفتاح واحد مع تحويل احتياطي تلقائي بين المزوّدين، وهذه هي الطريقة الرخيصة لتجربة نموذج لا تزال درجاته المستقلة في طور الاستقرار من دون المراهنة بمسار إنتاجي عليه. وهو أيضًا الشكل المناسب للنتيجة أعلاه، ولسبب أكثر صراحة من مجرّد الراحة: الأوزان نفسها سجّلت 10.6 أو 6.2 على الاختبار المعياري نفسه حسب أيّ إطار تشغيل للوكيل قادها، لذا ما يختبره المشتري فعليًا هو تركيبة سقالة مع نموذج، وتبديل النموذج خلف سقالة ثابتة تحت مفتاح واحد أرخص من الالتزام بأيٍّ منهما.

A screenshot of the Hugging Face model card for zai-org/GLM-5.3-Flash showing the MIT license badge, the Text Generation tag, and the 320B total / 18B active parameter counts.

ماذا تشاهد بعد ذلك

أربعة أمور تحسم بقية هذه القصة. أولاً، ما إذا كان 42 يتحرك: فالطراز قيد الاستخدام العام الواسع منذ أغسطس، لذا إذا اختلف التقييم الداخلي لـ Zhipu ومنصة اختبار AA لسبب هيكلي — مثل حساب رموز الاستدلال، أو الإسهاب، أو تقييم أولاه البائع وزنًا كبيرًا — فيجب أن يظهر ذلك عند مراجعة المؤشر وليس كفجوة لمرة واحدة. ثانيًا، ما إذا كانت نتيجة الاستغلال تتكرر. أجرت Generality Labs اختبار 41 خطأ مرة واحدة، على منصتها الخاصة، وتقول ذلك؛ ويظهر المتابعة على نفس المنصة أن الأوزان نفسها تتحرك أربع نقاط بمجرد اختيار المنصة، لذا فإن الرقم الذي سيحسم الأمر هو فريق ثانٍ يعيد تشغيل الـ41 مع تثبيت الميزانية بالدولار وإبقاء المنصة ثابتة. ثالثًا، ما إذا كان سرد السيليكون المحلي يحصل على مصدر ثانٍ. Zhipu هي الطرف الوحيد القادر على ذكر حجم العنقود، والجدول الزمني لأسبوعين، ومعامل 3.2x، والادعاء الوحيد القابل للتحقق بشكل مستقل فيه — إصلاح النواة المدمج — هو ادعاء صغير. رابعًا، السعر: لقد اختفى الخصم، والسؤال المثير هو ما إذا كان سيعود كعرض ترويجي عندما تحتاج Zhipu إلى حجم، أم أن السعر المدرج أصبح الآن هو الحد الأدنى.

الخيط الجامع هو أن GLM-5.3-Flash يُطالب بإثبات أمرين مختلفين في الوقت نفسه — أن نموذجًا منخفض التكلفة يمكن أن يكون جيدًا بما يكفي، وأن المسرّعات الصينية قادرة على تشغيله على نطاق واسع — وأن إفصاح 17 سبتمبر هو جواب Zhipu عن السؤال الثاني، قدّمه نموذج ساعد في كتابته. أما السؤال الأول فقد ارتبط به الآن رقمان مستقلان وهما يشيران في اتجاهين متعاكسين: 42 على مؤشر الذكاء، وهو أقل بكثير من الرقم الرئيسي الذي يعلنه المورّد، وعملية استغلال تبلغ مستوى متخصص في مختبر رائد بتكلفة تعادل 5٪ من التكلفة. يمكن أن يكون كلا الأمرين صحيحًا في الوقت نفسه، والفجوة بينهما — وليس أيًّا من الرقمين — هي حيث تُتخذ القرارات فعليًا.

مقارنات في هذه المقالة1

مستخرج من هذه المقالة · المعايير: Artificial Analysis · يُحدَّث يوميًا