بطاقة عنوان مُولّدة تحمل النص 'Ternary Bonsai 2 27B مقابل Qwen3.8-27B IQ2_XXS GGUF' مع عنوان فرعي 'بتات أقل، نتائج أفضل'، فوق ثلاث بطاقات مكتوب عليها 'عدد البتات لكل وزن: 1.76 مقابل 2.2'، و'الحجم: 5.93 جيجابايت مقابل 7.3 جيجابايت' و'متوسط مجموعة اختبارات المورّد: 83.9 مقابل 75.2'، مع تذييل يقول 'أرقام Bonsai مُبلّغ عنها من المورّد؛ أرقام IQ2_XXS وفقًا لاختبارات المورّد والمجتمع.' ويظهر شعار OrcaRouter في الزاوية اليمنى السفلية.
Engineering & Research

Ternary Bonsai 2 27B مقابل Qwen3.8-27B IQ2_XXS GGUF: بتات أقل، نتائج أفضل

الكاتب

Rowan Sterling

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

إن Ternary Bonsai 2 27B أصغر من نسخة IQ2_XXS GGUF من Qwen3.8-27B، ووفقًا للأرقام المنشورة معه، فهو أفضل أيضًا — وهو أمر لا ينبغي أن يكون ممكنًا لو كان كل ما يفصل بينهما هو ميزانية البتات. تحمل نسخة Bonsai 1.76 بت لكل وزن في ملف بحجم 5.93 GB. أما التكميم التقليدي ببتين للنموذج الأساسي نفسه فيحمل نحو 2.2 بت لكل وزن في ملف بحوالي 7.3 GB. وتُفيد Prism ML، التي أعلنت عن النسخة الثلاثية في 17 سبتمبر 2026، بأن متوسط 20 اختبارًا لنموذجها يبلغ 83.9 مقابل 75.2 لنقطة المقارنة IQ2_XXS — بفارق 8.7 نقطة لصالح النموذج الذي يستخدم بتات أقل.

هذا الانقلاب هو القصة كاملة، وهو ليس خدعة. فالمَلَفّان ينتجهما عمليتان مختلفتان في مرحلتين مختلفتين من عمر النموذج، والفرق بين هاتين العمليتين أغلى من الفرق في عرض البتّات. وهو أيضًا المقارنة التي تصطدم فيها النصيحة الشائعة — «فقط استخدم تكميمًا ثنائي البتّات، فقد أصبحت جيدة الآن» — بأوضح مثال مضاد لها، وحيث يكون للمثال المضاد قياسٌ مستقل يدعمه بدلًا من كلام مورّد.

المفارقة هي الآلية

IQ2_XXS هو تنسيق تكميم بعد التدريب. يُدرَّب النموذج حتى التقارب بدقة كاملة، ثم بعد ذلك تُقرَّب أوزانه إلى تمثيل منخفض البتات يختاره إجراء ملاءمة. ولا تُتاح للنموذج فرصة للتكيّف؛ إذ يُقاس بعد وقوع الأمر ويُقرَّب. تُحسِّن عائلة i-quant على k-quants الأقدم باستخدام مصفوفة أهمية — تمريرة معايرة تقرر أي الأوزان تستحق نصيبًا أكبر من الدقة المتاحة — لكن الترتيب الجوهري للعمليات يبقى كما هو. درِّب، ثم اضغط.

يعكس Bonsai ذلك الترتيب. يتمثل وصف Prism ML لطريقته الخاصة في أنه تخلّى تمامًا عن تكميم ما بعد التدريب وفرض القيد الثلاثي أثناء التدريب: تُحسب التمريرة الأمامية بأوزان مقصورة على {−1, 0, +1}، بينما لا تزال التمريرة الخلفية تحمل تدرجات كاملة الدقة. يقضي النموذج تدريبه في تعلّم تمثيلات تصمد أمام القيد، بدلًا من فرض القيد على تمثيلات لم تتوقعه قط. توصف الخوارزمية بأنها ملكية فكرية خاصة، لكن شكلها سيكون مألوفًا لأي شخص قرأ سلسلة أعمال BitNet.

ثمة تحسينان دقيقان يُضافان فوق ذلك، وكلاهما ظاهر في الحسابات. الأول هو الدقة الانتقائية: 26.2 مليون معامل — نحو 0.098% من النموذج، وقرابة 52 ميغابايت عند bf16، معظمها مسار الحالة التكرارية لطبقات الانتباه الخطي إضافة إلى أوزان التطبيع — تُحفظ بدقة كاملة بدلاً من تحويلها إلى قيم ثلاثية. والثاني هو دوران على مستوى الكتل. تُحوَّل كل مصفوفة أوزان عبر دوران Walsh–Hadamard بحجم كتلة 1,024 قبل اختيار القيم الثلاثية، ما يوزّع القيم الشاذة عبر الإحداثيات ويجعل التقريب ثلاثي المستويات أقل تدميراً. يُدمج الدوران في الأوزان المخزّنة، فلا يكلّف بايتات إضافية؛ ويُطبَّق التحويل المطابق على التنشيطات وقت التشغيل بدلاً من ذلك.

ذلك التفصيل الأخير له نتيجة تواجهها عند أول محاولة لتشغيل الشيء، وهي التكلفة الحقيقية للنهج.

أي IQ2_XXS تقصد، وما النتيجة التي يحققها فعليًا؟

قبل مقارنة الجودة، تصحيح تغفله معظم التغطيات: "IQ2_XXS" ليس مُخرَجًا واحدًا. إنه نوع تكميم في llama.cpp، والنوع نفسه عند تطبيقه بواسطة سلاسل أدوات مختلفة على النموذج الأساسي نفسه ينتج ملفات تختلف اختلافًا ذا دلالة في الحجم، واختلافًا جوهريًا في الجودة.

أوضح دليل عام هو مقارنة مستقلة نشرها مستخدم في 15 أغسطس 2026، كان يتحقق مما إذا كان بناء Qwen3.8-27B بدقة أقل من 2 بت يستحق العناء أصلاً. الاختبار عبارة عن قياس تباعد KL على wikitext-2، بواقع 100 قطعة عند سياق 512، مقابل مرجع Q8_0 مبني محليًا بقيمة ارتباك (perplexity) تبلغ 6.7500، مع استخدام كل مرشح لنفس مصفوفة الأهمية والمجموعة النصية وخط الأساس وبناء llama.cpp في جلسة واحدة. النتائج:

• unsloth UD-IQ2_XXS — 8.39 GiB، الارتباك 7.6528، متوسط KLD 0.146، وسيط KLD 0.076، توافق top-1 82.98%

• bartowski IQ2_XXS — 8.75 GiB، الحيرة 8.5352، متوسط KLD 0.301، وسيط KLD 0.162، توافق top-1 76.53%

المتغير الديناميكي هو 0.36 GiB أصغر من الثابت، وأفضل بنحو 2.1x في متوسط KLD — عند 1.13x من الارتباك الأساسي. ملفان يحملان التسمية نفسها، يفصلهما عامل اثنين في المقياس الذي يقيس مدى انحراف توزيع المخرجات. وجد الاختبار نفسه أن كل مرشح دون 2 بت أسوأ من كلا خياري IQ2 المنشورين، ولهذا يقع الحد العملي لهذا النموذج الأساسي عند IQ2 وليس دونه.

A screenshot of a Hugging Face community discussion titled 'Independent KLD benchmark: UD-IQ2_XXS beats bartowski IQ2_XXS on both size and quality', opened 15 August 2026, describing a wikitext-2 test of 100 chunks at 512 context against a locally built Q8_0 reference with perplexity 6.7500. Its table lists unsloth UD-IQ2_XXS at 8.39 GiB with perplexity 7.6528, mean KLD 0.146, median KLD 0.076 and 82.98% top-1 agreement; bartowski IQ2_XXS at 8.75 GiB with perplexity 8.5352, mean KLD 0.301, median 0.162 and 76.53%; stock IQ1_M at 7.33 GiB with mean KLD 0.659; and stock IQ1_S at 6.88 GiB with mean KLD 0.896.

هذا مهم للمقارنة لأنه يغيّر ما يشير إليه «بناء 7.3 GB IQ2_XXS». رقم Prism ML يأتي من التكميم الخاص به للنموذج الأساسي عند 2.2 بت لكل وزن. بناء unsloth الديناميكي من العائلة نفسها يبلغ 8.39 GiB. بناء bartowski يبلغ 8.75 GiB. وبالتالي فإن فجوة الحجم بين Bonsai و«IQ2_XXS» تقع في مكان ما بين 1.4x و1.5x حسب البناء الذي تقصده — أكبر من 1.23x التي يلمح إليها العنوان الرئيسي، وكل ذلك قبل أن تبدأ مقارنة الجودة.

أين يفشل بناء ما بعد التدريب، ولماذا يسهل إغفاله

الفارق الإجمالي البالغ 8.7 نقطة هو أقل الطرق إفادةً في بيان الاختلاف، لأن التدهور في إصدار IQ2_XXS ليس موحّدًا. إنه انتقائي، والنمط عكس ما يتوقعه معظم الناس.

• MMLU-Redux — البناء بعد التدريب يظل متماسكًا بمستوى محترم، في نطاق الثمانينيات المتوسطة إلى المرتفعة

• GPQA Diamond — حوالي 65.5، مقابل 85.76 للبنية الثلاثية

• AIME26 — في نطاق 57.5 إلى 78.6 حسب الإصدار، مقابل 95.83 للإصدار الثلاثي

• LiveCodeBench — في النطاق من 56.4 إلى 70.05، مقابل 90.07 للبنية الثلاثية

تتحرك أرقام IQ2 الدقيقة بين مجموعات اختبارات Prism ML وقياسات المجتمع، والنطاقات أعلاه تغطي كليهما، لكن النمط متسق عبر كل مصدر: المعرفة السطحية تصمد، وأي شيء يتطلب سلسلة استدلال متواصلة يتدهور بحدّة. وهذا بالتحديد هو نمط الفشل الذي لن يكشفه اختبار عابر. اطلب من نسخة 2-بت أن تلخّص مستندًا أو تجيب عن سؤال معرفي، فتؤدي كما يؤدي نموذج أكبر بكثير. واطلب منها أن تحافظ على اشتقاق متعدد الخطوات أو أن تنتج شيفرة غير تافهة، فيكون الانهيار مفاجئًا لا تدريجيًا. لهذا السبب، فإن "بدا الأمر جيدًا عندما جرّبته" ليس دليلًا على نموذج مُكمَّم — بل هو دليل على المطالبات التي صادف أن جرّبتها.

لا تُظهر النسخة الثلاثية ذلك الانهيار على المقاييس المرجعية نفسها. وتُبلِغ Prism ML عن بلوغ AIME26 نسبة 95.83 مقابل 94.58 لقاعدتها كاملة الدقة، وعن LiveCodeBench عند 90.07 مقابل 90.05 — أي على المستوى نفسه فعليًا، وهو الادعاء الأكثر فائدة منفردًا في الإصدار لأنه يقول إن القيد المفروض وقت التدريب قد منح النموذج ما يفقده القيد المفروض بعد التدريب.

الحجة المضادة، وهي حجة حقيقية لا يلتقطها جدول الجودة

كل ما سبق يرجّح كفة البناء الثلاثي من حيث الجودة لكل بايت. لكن هناك بُعد واحد يتفوق فيه GGUF التقليدي تفوقًا قاطعًا، وهو ليس بُعدًا صغيرًا: فهو يعمل على البرمجيات التي لديك بالفعل.

بناء IQ2_XXS من Qwen3.8-27B هو مُخرَج llama.cpp القياسي. يُحمَّل في llama.cpp وOllama وLM Studio وJan وأي شيء آخر يرتبط بـ ggml، على كل منصة يدعمها ggml، دون الحاجة إلى تفرع ودون أنوية خاصة. يمكن إعادة بناء مصفوفة الأهمية الخاصة به أو استبدالها. يتصرف مثل كل نموذج كمي آخر لديك على القرص.

Ternary Bonsai 2 27B لا يفعل ذلك. توجد النوى الثلاثية للانتباه الهجين في هذه البنية داخل تفرّع llama.cpp الخاص بـ Prism ML. يرفض llama.cpp القياسي PTQ1_0 وPQ2_0 باعتبارهما نوعين غير معروفين — وليس لديه أي فكرة عما يفعل بالأساس المُدوَّر الذي تفترضه تلك الحزم. تتمتع نسخة MLX الخاصة بـ Apple Silicon بنوى Metal وCPU لكن ليس لديها مسار CUDA، لذا على جهاز NVIDIA فإنها تتراجع إلى تمرير أمامي على CPU قد يستغرق دقائق. يُدرِج Prism ML بالفعل التكامل مع العديد من بيئات التشغيل، لكن النقطة الجوهرية تبقى: قابلية استخدام هذا النموذج محدودة بما إذا كانت بيئة التشغيل التي تختارها قد عُلِّمت عنه أم لا.

تلك هي المقايضة الصادقة. أنت تختار بين نسخة أكبر بمقدار 1.4x، وأسوأ بشكل قابل للقياس في المهام ذاتها التي يُرجَّح أنك تريد نموذج 27B من أجلها تحديدًا، وقابلة للتشغيل عالميًا — ونسخة أصغر وأفضل، على منظومة لا تزيد حاليًا عن تفريعة أحد المختبرات بالإضافة إلى أي بيئات تشغيل تبنّتها.

A screenshot of Prism ML's launch post for Bonsai 2 27B dated September 17 2026, showing the headline 'PrismML Launches Bonsai 2 27B, Its Most Capable Model Yet' and the paragraphs stating the model is based on Qwen3.8 27B, reduces memory footprint by more than 9x at 5.9 GB, and that the original Ternary Bonsai 27B retained 95% of its full-precision counterpart's aggregate benchmark performance while the new model retains over 98%.

ما يتطلبه تشغيل أيٍّ منهما

حسابات الذاكرة أقرب مما توحي به أحجام الملفات، لأن الملفات ليست الشيء الوحيد في VRAM.

• إصدار IQ2_XXS — من 8.39 إلى 8.75 GiB من الأوزان، مما يترك حوالي 7.5 GB حرة على بطاقة سعة 16 GB للسياق ونماذج المسودة. يشير الاختبار المستقل أعلاه تحديدًا إلى أن إصدارًا بحجم 8.39 GiB يستوعب بالفعل نموذج مسودة بحجم 2.1 GB إلى جانبه.

• Ternary Bonsai 2 27B — 5.93 GB للنموذج اللغوي PTQ1_0، بالإضافة إلى 0.63 GB لبرج الرؤية إذا كنت تستخدم الصور على الإطلاق، بالإضافة إلى السياق. تستهلك حزمة PQ2_0 من Prism ML مساحة 7.25 GB وهي الخيار الأسرع على الأجهزة المقيّدة بإنتاجية التعليمات بدلاً من عرض النطاق الترددي.

من حيث السرعة، تبلغ الأرقام الثلاثية المعلنة 142.5 tok/s لفك التشفير على RTX 5090 و46.8 tok/s على Apple M5 Max؛ أما تقارير الأطراف الثالثة عن بناء IQ2 فهي أكثر ندرة، مع قياس Vulkan على بطاقتي Radeon بنحو 3.8 tok/s للتوليد، رغم أن هذا الرقم يقول أكثر عن تلك الواجهة الخلفية بعينها مما يقوله عن التكميم. تعامل مع أرقام الإنتاجية على كلا الجانبين باعتبارها مرتبطة بالعتاد ارتباطًا قويًا.

أين يتلاءم OrcaRouter، وأين لا يتلاءم

لا يقدّم الراوتر أيًّا من هذين الملفين. فهما ملفان محليان، والتوصيف الأمين هو أن OrcaRouter لا يستضيف أيًّا منهما — فهذه مقارنة حول ما يعمل على عتادك الخاص. أما ما يقع في جانبنا فهو النموذج الذي اشتُقّ كلاهما منه. الدقة الكاملة لـ Qwen3.8-27B هي متاحة عبر البنية التحتية الخاصة بـ OrcaRouter بسعر 0.33 دولار لكل مليون توكن إدخال و2.40 دولار لكل مليون توكن إخراج، مع بقاء سياق النموذج الأصلي البالغ 262 ألفًا والتحكم في جهد الاستدلال المنخفض/المتوسط/المرتفع دون مساس.

وهذا يمنح إعدادًا هجينًا يجدر أن نكون محددين بشأنه. شغّل البنية المضغوطة محليًا للمهام التي تجيدها، ووجّه الطلب العرضي الذي يحتاج إلى دقة كاملة إلى النموذج الأساسي المستضاف عبر المفتاح نفسه — دون عقد مورد ثانٍ، ودون تغيير في الشيفرة، لأن كلا الجانبين يتحدثان واجهة برمجة التطبيقات نفسها. إذا تبين أن البنية المحلية غير مناسبة لحمل عمل ما، فإن الطلب الذي يفشل يمكن تحويله تلقائيًا عند الفشل بدلًا من إعادته كخطأ، وهو وسيلة أرخص لاكتشاف أن التكميم غير مناسب من اكتشافه في بيئة الإنتاج.

النسخة المختصرة

• من حيث الجودة المنشورة لكل بايت، يفوز البناء الثلاثي بوضوح، ويتركّز هذا الفوز في الاستدلال والبرمجة — وهما الفئتان اللتان يتدهور فيهما بناء ما بعد التدريب أكثر من غيرهما.

• فيما يخص قابلية النقل، يفوز بناء IQ2_XXS بوضوح بالقدر ذاته. بيئات تشغيل قياسية في كل مكان، بلا تفرعات، بلا نوى خاصة، وبلا نمط فشل يتمثل في بيانات تالفة صامتة.

• المقارنة ليست "1.76 بت مقابل 2.2 بت". بل هي "تمثيل يُختار أثناء التدريب مقابل تمثيل يُلاءَم بعد ذلك"، وفرق 0.44 بت ليس سوى خطأ تقريب لا يُذكر مقارنة بذلك.

• كل رقم جودة للبناء الثلاثي في هذه المقالة هو قياس Prism ML الخاص على مجموعة اختارتها Prism ML. نتائج KLD لإصدارات IQ2 مستقلة، ومن تشغيل واحد، وخاصة بنموذج أساسي واحد ومجموعة اختبار واحدة؛ وهي أقوى دليل من طرف ثالث في هذه المقارنة وهي لا تقول شيئًا عن Bonsai.

ستُغلق الفجوة من الاتجاه الآخر أيضًا، وعلى الأرجح قريبًا. إذا وصلت نوى ternary إلى المنبع في llama.cpp، فإن الاعتراض الجدي الوحيد على Bonsai يتبخر ويصبح الاختيار مباشرًا. حتى ذلك الحين، يحتفظ بناء IQ2_XXS بميزة حقيقية لا علاقة لها بمدى جودته.

A screenshot of OrcaRouter's model page for Qwen3.8-27B, showing the qwen/qwen3.8-27b identifier attributed to Qwen and dated 2026-08-13, a 262K token context with text, image and video input and text output, input pricing of $0.33 and output pricing of $2.40 per million tokens, a p50 time to first token of 4.80 seconds over seven days, and a description stating the model is self-hosted on OrcaRouter's own infrastructure.

إذا كنت تتخذ قرارك هذا الأسبوع، فإن الاختبار الذي يحسم الأمر يستغرق عصرًا واحدًا: خُذ عشرين مُوجّهًا من عبء عملك الخاص تتطلب أكثر من خطوة استدلالية، وشغّل كلا الإصدارين، وقيّم الإجابات تقييمًا أعمى. الجداول المنشورة تخبرك أين تنظر، لكنها لا تستطيع أن تخبرك ما إذا كان عملك يقع في نطاقها.