
شرح التكميم المدرك للحساسية: كيف يقرر OrcaSAQ أي الأوزان تحصل على بتات أكثر؟
- AlibabaجديدQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز
- z-aiجديدZ.ai: GLM 5.3 Flash2026-08-2658الذكاء72البرمجة
- DeepSeekجديدDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 لكل مليون رمز
- z-aiجديدZ.ai: GLM 5.32026-08-1860الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1552الذكاء68البرمجة
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253الذكاء69البرمجة
- grokSpaceXAI: Grok 4.62026-08-1261الذكاء77البرمجة
- metaMeta: Muse Spark 1.22026-08-0557الذكاء72البرمجة
- qwenQwen: Qwen3.8 Max2026-08-0358الذكاء72البرمجة
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152الذكاء69البرمجة
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 لكل مليون رمز
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463الذكاء78البرمجة
- googleGoogle: Gemini 3.6 Flash2026-07-2152الذكاء69البرمجة
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137الذكاء49البرمجة
- metaMeta: Muse Spark 1.12026-07-1653الذكاء71البرمجة
- kimiMoonshotAI: Kimi K32026-07-1560الذكاء76البرمجة
- openaiOpenAI: GPT-5.6 Luna2026-07-0952الذكاء71البرمجة
القياس الكمّي المراعي للحساسية هو ممارسة إنفاق ميزانية البتّات حيثما يكون لذلك أثر: الموتّرات التي يلحق بها القياس الكمّي أكبر ضرر تحصل على بتّات إضافية، ويظلّ كل ما سواها على عرض أساسي أقل. تشرح هذه المقالة كيف يحدّد OrcaSAQ — أسلوبنا القائم على الدقة المختلطة، والخالي من المعايرة، والمراعي لبنية النموذج، والمُطلَق مع GLM-5.3-Flashعائلة الكمّorcarouter/GLM-5.3-Flash-MLX — أيٌّ من الموتّرات البالغ عددها 37,338 في نموذج خليط الخبراء (Mixture-of-Experts) ذي المعاملات البالغة 320 مليارًا يستحقّ بتّات إضافية، وذلك دون أي مجموعة بيانات معايرة إطلاقًا. أمّا الدرس الذي يمكن تعميمه على من يكمّم نموذج خليط خبراء مختلفًا: فالخبراء المشتركون والإسقاطات السفلية (down-projections) هي التي تستحق البتّات الإضافية، ولا تحتاج في تحديدها إلى أكثر من البيانات الوصفية للقياس الكمّي التي يحملها الإصدار الأصلي نفسه.
الإجابة المختصرة
القياس الكمّي المراعي للحساسية هو دقة مختلطة تتبع سياسة: عرض البت لكل موتر يتبع مدى حساسيته لخطأ القياس الكمّي، بدلاً من عرض واحد للنموذج بأكمله. يقيس الأدب البحثي الحساسية باستخدام مصفوفات هسه أو معلومات فيشر أو التباعد بين مخرجات الطبقات الأصلية والمكمّمة، ثم يخصص البتات للطبقات الأكثر تأثراً. تنتمي OrcaSAQ إلى عائلة أصغر تتخطى القياس تماماً. إنها ترمّز ترتيب الحساسية في البنية نفسها: تستخدم أولويات معمارية وأولويات مرتبطة بدور الموتر لتحديد أي الأوزان هشة، ثم تكمّم كل شيء آخر عند دقة أساسية مستهدفة.
ما تكسبه من ذلك هو خط أنابيب سريع وحتمي لا يتطلب أي معايرة. لا حاجة لتجميع مجموعة معايرة، ولا بحث عن الحساسية لكل طبقة، ولا إعادة ضبط لكل نموذج؛ لذا فإن الوصفة نفسها تنتقل إلى بنية جديدة بمجرد صدور أوزانها. وما يتخلى عنه هو التكيّف: فالأسلوب القائم على المعايرة مثل GPTQ أو AWQ ينظر إلى التوزيع الفعلي للتنشيطات في نموذجك وبياناتك، وعادةً ما يستخرج جودة أكبر من نفس متوسط عرض البت. رهان OrcaSAQ هو أنه بالنسبة لنماذج خليط الخبراء، فإن دور الموتّر يخبرك بمعظم ما قد تخبرك به عملية معايرة، بتكلفة أقل بكثير.
طريقتان للعثور على الأوزان الحساسة
قبل السياسة، السؤال هو: كيف تعرف أي الموترات يضرها التكميم؟ الإجابتان هما مساحة التصميم بأكملها.
• موجه بالمعايرة. قم بتشغيل مجموعة صغيرة من النصوص عبر النموذج، وقياس الخطأ الذي يسببه كل موتر أو كتلة، وتخصيص البتات لتقليل خطأ إعادة البناء الإجمالي. يستخدم GPTQ تقريبًا قائمًا على هيسيان لخطأ التكميم لكل طبقة؛ بينما يستخدم AWQ إحصائيات التنشيط لتحديد الأوزان البارزة التي يجب حمايتها. القوة تكمن في التكيف مع بياناتك الفعلية؛ أما التكاليف فهي مجموعة نصوص منسقة، وتمريرات أمامية، وحلول هيسيان معكوسة لكل طبقة، ونتائج تتغير عندما تتغير مجموعة المعايرة.
• بدون معايرة.حدّد ترتيب الحساسية من البنية قبل رؤية أي بيانات. في نموذج خليط الخبراء (MoE)، تعرف مسبقًا الأدوار الحاملة للعبء: الخبير الذي ينشط مع كل توكن، والإسقاط الذي يكتب في تيار البقايا. قم بترميز هذا الترتيب كسياسة ثابتة وطبّقها بشكل آلي.
تقع OrcaSAQ بثبات في المعسكر الثاني، وهذا المقال دفاع عن ذلك المعسكر في مجال تكميم MoE — مع بيان واضح وصريح لما تتخلى عنه مقابل ذلك.
السياسة: أي الموترات تحصل على بتات أكثر
سياسة تخصيص البتات في OrcaSAQ مذكورة في بطاقة النموذج الخاصة بـ orcarouter/GLM-5.3-Flash-MLX، وتتلخص في ثلاث قواعد بالإضافة إلى استثناء واحد. الدقة الأساسية هي البناء الذي تقوم بإنشائه — 6 أو 4 أو 3 أو 2 بت — وترفع السياسة أدوار موتر محددة فوقها:
• الخبير المشترك: الأساس +2 بت. يعمل الخبير المشترك على كل رمز، لذا فإن خطأ التكميم الخاص به يُعاد إدخاله في كل مخرج ينتجه النموذج. وهو الموتر الأعظم تأثيرًا في النموذج، ويحصل على أكبر عدد من البتات.
• down_proj: الأساس +1 بت. في كتلة SwiGLU MLP، يُعد الإسقاط السفلي عنق الزجاجة المتبقي — تُضاف مخرجاته مباشرة إلى التدفق المتبقي الذي تقرأه كل طبقة أعمق. الخطأ هنا يُفسد مباشرة كل ما تراه المكونات اللاحقة.
• gate_proj و up_proj: الدقة الأساسية.هذه هي مسارات التوسيع والبوابة؛ يتم ضرب مخرجاتها عنصرًا بعنصر داخل دالة التنشيط. الخطأ البسيط هناك يُزال جزئيًا بواسطة البوابة، لذا فهي تتحمل العرض الأساسي.
• لم تُكمَّم أبدًا، وتُحمَل بصيغة BF16: طبقات الانتباه الخطي الـ34، والمفهرس المتناثر المُتعلَّم، ومصفوفات الترابط الفائق، وطبقات التطبيع، embed_tokens، lm_head، وبرج الرؤية بأكمله. لم تكن هذه بصيغة FP8 في الإصدار الأصلي، وتبقى بدقتها الكاملة.
تُقرَّب البتات إلى أقرب عرض مدعوم من MLX، {2,3,4,5,6,8}. على وجه التحديد، في GLM-5.3-Flash — إجمالي 320B / 18B نشط، و288 موجهًا بالإضافة إلى خبير مشترك واحد مع توجيه top-8، و45 طبقة — يعطي إصدار 4-بت للخبير المشترك 6 بتات، وكل إسقاط سفلي 5 بتات، وإسقاطات البوابة والأعلى 4 بتات. إصدار 6-بت يقرّب الإسقاطات السفلية إلى 8 بتات. حجم المجموعة هو 64 لإصدارَي 4-بت و6-بت، و32 لإصدارَي 2-بت و3-بت، ويستخدم الخبير المشترك دائمًا 64.

هل تستحق قاعدة الخبير المشترك ذلك؟ عند أساس 2-بت، يستقر الخبير المشترك عند 4 بتات، وعند أساس 6-بت يستقر عند 8 — وفي كلتا الحالتين، تستهلك البتتان الإضافيتان ذاكرة كان يمكن للخبراء الموجَّهين استخدامها بدلًا من ذلك، وتشير أرقام بطاقة النموذج نفسها، التي نناقشها أدناه، إلى أن المقايضة تستحق العناء. وهو نفس المنطق الذي يجعل بناء 2bit-lite يستحق الإصدار أصلًا: فالخبير النشط دائمًا هو الموضع الذي تحقق فيه الدقة الإضافية القليلة أكبر عائد.
قاعدة الاختيار: _scale_inv كإشارة حساسية حرة
تفترض سياسة تخصيص البتات أنك تعرف مسبقًا أي الموترات هي المرشحة. وهنا تكمن براعة OrcaSAQ في اختيار تلك المجموعة، لأن القاعدة آلية ولا تحتاج إلى أي بيانات: يُعاد تكميم الموتر إذا وفقط إذا كان إصدار FP8 قد صدّره مع مرافق _scale_inv.
لماذا ينجح ذلك: القاعدة الأساسية لـ GLM-5.3-Flash من المنبع هي FP8 — على مستوى الكتل e4m3، كتل 128×128، مع مخطط تنشيط ديناميكي. التكميم الكتلي FP8 يخزن مقياسًا لكل كتلة ومعكوسه بجانب الوزن؛ وجود _scale_inv في نقطة التحقق هو علامة دائمة على أن الموتر مرّ عبر مسار التكميم في المنبع. إصدار المنبع قد أخبرك بالفعل أي الموترات آمنة للتكميم — لا هيسيان، ولا مجموعة معايرة، ولا تمريرات أمامية.
بالنسبة إلى GLM-5.3-Flash، تتكون هذه المجموعة من الخطيات MoE وdense-MLP، بالإضافة إلى الإسقاطات الأربعة لكل deepseek_sparse_attention كتلة — q_a_proj، q_b_proj، kv_a_proj_with_mqa، وo_proj — عبر الطبقات المتفرقة الـ11 عند الأعماق 3 و7 و11 … 43، بالإضافة إلى كتلة MTP، أي 12 × 4 = 48 موترًا. كل شيء آخر لم يحمل العلامة أبدًا ويظل بترميز BF16: الـ34 linear_attention طبقة، والمفهرس المتفرق، وبرج الرؤية. طبقة MTP — الطبقة 45 — مضمّنة داخل الأوزان المكمّمة بدلاً من تصديرها كوحدة منفصلة.
النقطة الجديرة بالاقتباس هي الحيلة نفسها. إن إصدار نموذج يكمّم أوزانه مسبقًا قد أنجز بالفعل قدرًا هائلًا من العمل في تحديد ما يمكن تكميمه؛ علامة _scale_inv هي ذلك القرار، مُسلسَل في تنسيق الملف. يستخرجه OrcaSAQ. وهذا ما يجعل خط المعالجة حتميًا وقابلًا للنقل — يمكن لأي نموذج يشحن أوزان FP8 مع بيانات وصفية للمقياس أن يُعالَج بنفس القاعدة، دون أي خط معالجة بيانات على الإطلاق.

المشكلة الخفية: الإعدادات لكل وحدة، وليست على مستوى الإعدادات العلوية.
إذا كنت تكتب مُكمِّم MLX الخاص بك — وهذا هو الجمهور المعني بهذا القسم — فإن أكثر شيء مفيد في بطاقة النموذج هو تحذير: القيم العلوية bits و group_size في config.json ليست كافية.
في المجموع، تم تكميم 37,338 موترًا. يُسجَّل التعيين في config.json → التكميم كتجاوزات لكل وحدة {group_size, bits} مرتبطة بمسار وحدة MLX — على سبيل المثال model.layers.3.mlp.switch_mlp.down_proj. ولأن MLX يدمج خبراءَ طبقةٍ مُوجَّهين في وحدة switch_mlp واحدة، فإن 173 إدخالًا يغطي جميع الـ37,338 موترًا.
ويقرأ المحمّل تلك الإدخالات وقت التحميل. إذا قمت بتكميم الملف بالكامل بالعرض الأساسي، فإن كل موتر بدقة مرفوعة — الخبير المشترك عند الأساس +2، وكل إسقاط سفلي عند الأساس +1 — يخرج بعرض خاطئ، ويُحمَّل النموذج بشكل غير سليم. خريطة كل وحدة ليست تحسينًا يمكنك تخطيه؛ بل هي مسار التحميل. عندما تكتب المكمّم الخاص بك، أصدر التجاوزات لكل موتر ترفعه السياسة، وتحقق منها مقابل الافتراضي على المستوى الأعلى قبل الإصدار.
هل تدفع البوليصة تكلفتها؟
الأدلة من قياسنا الخاص على نموذج واحد: GLM-5.3-Flash، وكل بناء تم فك تكميمه وتشغيله عبر نفسglm5_nextللأمام بحيث يكون المتغير الوحيد هو التكميم. الأرقام أدناه من بطاقة النموذج، وليست معاييرَ من البائع ولا أرقامَ طرفٍ ثالث — اعتبرها نقطة بيانات واحدة، لا قاعدة.
• الارتباك، مقابل مرجع FP8 عند 2.7797: 6-بت 2.7864 (+0.24%)، 4-بت 2.8620 (+2.96%)، 3-بت 3.0566 (+9.96%)، 2-بت 4.3622 (+56.9%).
• توافق الرمز الأعلى-1 مع المرجع، بنفس الترتيب: 97.76٪، 96.13٪، 92.06٪، 86.56٪.
القراءة مطابقة تماماً لما تتنبأ به السياسة. كل شيء حتى مستوى 3-بت يتدهور بلطف — وهذه هي بصمة ميزانية بتات أُنفقت على الموترات الصحيحة — أما مستوى 2-بت فهو هاوية، لأنه تحت نقطة معينة تتوقف الزيادات المبنية على الدور عن تغطية الضرر. عند 4-بت، فإن زيادة الالتباس بنسبة 2.96% مقابل بناء أصغر بنحو 38% من مرجع FP8 هي صفقة جيدة حقاً، وهي نفس السياسة، المطبَّقة بقوة أكبر، التي تجعل بناء 2bit-lite البالغ 102 غيغابايت يُحمَّل أصلاً. الممارسون المستقلون الذين يكمّمون النموذج الأساسي نفسه يبلغون عن الترتيب نفسه — الدرجات العليا قريبة من مستوى الضوضاء، و4-بت حقيقي لكنه متواضع — بأرقام مطلقة مختلفة من مجموعة تقييم مختلفة.

ما الذي يُنقل إلى MoE الخاص بك
الاستدلال القابل لإعادة الاستخدام، لنموذج ليس ملكنا:
• اعثر على الخبراء النشطين دائمًا. كل ما يتم تفعيله على كل رمز — عادةً خبير مشترك أو مُوجَّه إليه دائمًا — يحصل على أوفر مخصصاتك من البتات، ويتكرر خطؤه في كل مكان.
• ابحث عن الاختناقات المتبقية. الإسقاط الذي يكتب في التدفق المتبقي (عادةً الإسقاط التنازلي لكل كتلة MLP) يحصل على أساس +1. الخطأ هناك تراه كل طبقة أعمق.
• اترك مسارات التوسيع والبوابة عند الأساس. إذا كان المخرج يُضرب عنصرًا بعنصر داخل تنشيط، فإن خطأ التكميم فيه يُمتص جزئيًا.
• عدم تكميم المنبع يعني عدم تكميمه من جانبك. إذا كان الإصدار الأساسي يحمل تلك الموترات بدقة كاملة، فانقلها بدقة كاملة.
• استخدم بيانات المقياس الخاصة بالإصدار الأصلي كقاعدة اختيارك.إذا قام النموذج الأساسي بتكميم أوزانه، فإن علامات المقياس/المقياس العكسي التي يتركها تمثل خريطة مجانية لما يمكن تكميمه — لا حاجة للبحث عن الحساسية.
• سجّل التجاوزات الخاصة بكل وحدة. سيتسبب عرض البت العام في تشويه شكل كل موتر مرفوع عند التحميل. اكتب خريطة مسار الوحدة.
وإذا كان بإمكانك الاحتفاظ بمجموعة معايرة على الإطلاق، فاستخدمها لمراجعة السياسة — وليس لاستبدالها. قم بتشغيل تكميم موجه بالمعايرة بنفس متوسط البتات، وتحقق مما إذا كان ترتيب الأولوية المسبقة للدور يطابق ما تقوله البيانات. بالنسبة لنموذج كثيف أو بنية جديدة كليًا، تشكل هذه المراجعة الفرق بين إعداد افتراضي قابل للدفاع وتخمين.
حيث يكون OrcaSAQ هو الخيار الخاطئ
هذا هو القسم الذي ينبغي أن يُبقي المنهجية صادقة، لأن المقايضة الخالية من المعايرة حقيقية.
• عندما يتفوق سقف الجودة على سرعة خط الإنتاج، ولديك مجموعة معايرة.الطرق المشابهة لـ GPTQ أو AWQ تتكيف مع الإحصائيات الفعلية للتنشيطات في نموذجك وبياناتك، وعند تساوي متوسط البتات، سوف تتفوق عادةً على سياسة ثابتة قائمة على الأدوار. إذا كنت تقوم بتكميم نموذج واحد مرة واحدة ولن تعيد التكميم، فإن الساعات الإضافية للمعايرة تُعد تكلفة لمرة واحدة تشتري جودة ملموسة.
• نماذج كثيفة غير معتمدة على MoE. الافتراض المسبق للأدوار — الخبير المشترك، البوابة/العلوي/السفلي — غير موجود، لذا تفقد السياسة البنية التي تجعلها جديرة بالثقة. ويبقى لديك "كل ما تم تكميمه في المراحل السابقة يبقى مكممًا"، وهو ادعاء أضعف.
• نماذج لا تحتوي على إصدار FP8 من المنبع. قاعدة اختيار _scale_inv ليس لديها ما تستند إليه. يجب عليك تحديد المجموعة القابلة للتكميم بطريقة أخرى، وتنهار حجة قابلية النقل الميكانيكية.
• بنى جديدة كليًا.الافتراضات المسبقة هي تحديدًا الافتراضات التي قد لا تصمد. فالمنهج القائم على المعايرة سيكتشف موترًا هشًا فاتته سياسة قائمة على الأدوار؛ أما OrcaSAQ فلن يكتشفه، لأنه لا ينظر أبدًا.
• أهداف أقل من 3 بتات.السياسة لا تنقذك. عند 2-بت، تصل حيرة النموذج إلى +56.9% بغض النظر عن أين ذهبت البتات الإضافية؛ إصدار 2bit-lite موجود للملاءمة، وليس للجودة.
• عندما تحتاج إلى ضمانات. الضمانات لكل موتر، وميزانيات التدريب الواعي بالتكميم (QAT)، أو أفضل جودة ممكنة لحجم ثابت دون النظر إلى تكلفة خط المعالجة — تقع جميعها في نطاق المعايرة.
الخلاصة
التكميم المراعي للحساسية هو الممارسة؛ OrcaSAQ هي وصفة حتمية وخالية من المعايرة لذلك. الدروس الدائمة هي رفع الخبير المشترك والإسقاط السفلي، والميكانيكية _scale_inv قاعدة الاختيار، والتكوين لكل وحدة الذي يقرؤه المُحمّل فعليًا. بالنسبة لنموذج خليط الخبراء ذي 320 مليار معلمة مثل GLM-5.3-Flash، تنتج تلك الوصفة بناء MLX بترميز 4 بت مع زيادة في الحيرة بنسبة +2.96% — و orcarouter/GLM-5.3-Flash-MLX يحتوي المستودع على نفس السياسة بترميز 2 و3 و4 و6 بت، مع بناء منفصل 2bit-lite للأجهزة ذات ذاكرة 128 جيجابايت. لدينا GLM-5.3-Flash-MLX شرح يغطي أي بناء يجب تشغيله على أي جهاز، خطوة بخطوة.
إذا كانت أولويتك هي الحصول على أعلى قدر ممكن من الجودة بحجم ثابت ويمكنك تجميع مدوّنة معايرة، فاستخدم الأدوات القائمة على المعايرة ودعها تتكيّف. إذا كانت أولويتك هي تكميم قابل للتكرار وسريع وخالٍ من البيانات وينتقل إلى البنية التالية — أو كنت ببساطة لا ترغب في بناء خط بيانات على الإطلاق — فإن السياسة القائمة على الأدوار تُعد خيارًا افتراضيًا معقولًا. وإذا كنت تفضّل عدم التكميم من الأساس، فإن النموذج كامل الدقة GLM-5.3-Flash يُقدَّم عبر OrcaRouter باسم z-ai/glm-5.3-flash. ويتعلّق الاختيار بمقدار خط البيانات الذي ترغب في تشغيله، لا بما إذا كان التكميم المُراعي للحساسية يستحق القيام به.
هل تفضّل عدم تكميم أي شيء على الإطلاق؟ z-ai/glm-5.3-flash هو النموذج كامل الدقة المُقدَّم عبر OrcaRouter بسعر المزوّد، وبهامش ربح 0%.
