بطاقة عنوان مُولَّدة نصُّها 'Bonsai مقابل Ternary Bonsai 2 27B'، وتحتها عنوان فرعي 'رهانان على البتات المنخفضة، ومسطرتان مختلفتان'، فوق ثلاث بطاقات نصُّها 'الأوزان: 0.43 GB مقابل 5.93 GB'، و'ادّعاء الجودة: مقارنة مقابل احتفاظ بنسبة 98.2%'، و'السيليكون: Hexagon NPU مقابل Apple silicon وCUDA'، مع تذييل نصُّه 'جميع أرقام الجودة مُعلَنة من المُورِّد وغير مُعاد إنتاجها.' ويقع شعار OrcaRouter في الزاوية السفلية اليمنى.
Guides & Insights

بونساي مقابل تيرناري بونساي 2 27B: رهانان منخفضا البتات، ومسطرتان مختلفتان

الكاتب

Alistair Wren

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

ضع نموذج Bonsai 2B للرؤية واللغة بدقة 1-بت بجانب Ternary Bonsai 2 27B، والمقارنة البديهية — 2 مليار معامل مقابل 27 مليارًا، و0.43 GB من أوزان اللغة مقابل 5.93 GB — هي أقل ما يثير الاهتمام في هذا الثنائي. المثير للاهتمام هو أن النموذجين، من الشركة المصنّعة نفسها وبرنامج الضغط نفسه، لا يقدّمان جودتهما بالطريقة ذاتها. يقدّم Ternary Bonsai 2 27B نسبة الاحتفاظ: فهو يحتفظ بأكثر من 98% من الأداء الإجمالي في الاختبارات المعيارية لنظيره كامل الدقة، مقيسًا مقابل نفسه. أما 1-bit Bonsai 2B فيقدّم مقارنة: فقد حقق "نتائج اختبارات معيارية مقارنة" مقابل نموذج Qwen 3 1.7B عند تكميم 4-بت، مقيسة مقابل نموذج طرف آخر بدقة مختلفة. أحدهما بيان عن مقدار ما فُقد. والآخر بيان عن مكانته في المقارنة. لا هذا ولا ذاك بيان عن مدى جودة أي من النموذجين بالمعنى المطلق، ولا يمكن قراءة الاثنين على المقياس نفسه.

هذا التمييز يهم أكثر من عدد المعلمات، لأنه يحدد ما يمكنك فعلاً استنتاجه من أرقام المورّد — وبناءً على الأدلة المنشورة حتى الآن، فإن الإجابة الصادقة أقل مما توحي به الأرقام الرئيسية.

ادّعاءان بشأن الجودة، ومقياسان مختلفان

Ternary Bonsai 2 27B، الذي صدر في 17 سبتمبر 2026، هو إعادة بناء ثلاثية {−1, 0, +1} للنموذج Qwen3.8-27B بكثافة 1.76 بت فعال لكل وزن، والرقم الذي تبرزه PrismML في المقدمة هو أنه يحتفظ بأكثر من 98% من الأداء الإجمالي للنموذج كامل الدقة في اختبارات المعايير. هذا ادعاء بالاحتفاظ، وادعاءات الاحتفاظ ذاتية الإحالة بحكم بنيتها: فهي تخبرك بكم نجا من الأصل بعد الضغط، لا بمستوى الأصل نفسه. النموذج الذي يحتفظ بنسبة 98% من خط أساس متواضع يظل نموذجاً متواضعاً، وQwen3.8-27B ليس متواضعاً — لكن الرقم وحده لا يقول ذلك، ولا يمكن مقارنته بين النماذج الأساسية.

نموذج Bonsai 2B للرؤية واللغة بـ1-بت، الذي أُعلن في 23 سبتمبر 2026 لمنصة نظارات Snapdragon AR1 Gen 1، هو نموذج لغوي بحجم 1.7B بـ1-بت بالإضافة إلى مشفر رؤية بحجم 0.3B بـ4-بت. بيان الجودة المنشور الخاص به مختلف في نوعه: قيّمت PrismML النموذج مقابل نموذج Qwen 3 1.7B بتكميم 4-بت عبر BFCL v3، وHumanEval+، وMMLU Redux، وIFEval، وIFBench، وMuSR، وGSM8K، وGPQA Diamond، وأفادت أن التكوينين حققا نتائج متقاربة. هذا ادعاء تكافؤ مقابل خط أساس خارجي. إنه يقول إن الضغط لم يكلفك بشكل واضح مقابل مسار 4-بت الذي كنت ستستخدمه لولا ذلك — وهو بالضبط السؤال الصحيح لإصدار من فئة الأجهزة، وادعاء أضعف بكثير من "هذا النموذج جيد".

إذن لا توجد قراءة يمكن أن تتفوق فيها 98.2% على "comparative" أو العكس. إنهما إجابتان لسؤالين مختلفين، طُرحا مقابل مرجعين مختلفين، على مجموعتين مختلفتين، من نفس المورد. أي شخص يرتب هذين النموذجين بناءً على هاتين الجملتين فإنه يرتب الجمل.

تأتي النماذج الأساسية من أماكن مختلفة

هناك فرق بنيوي ثانٍ، وهو الفرق الذي سيكون مهمًا على مدى العام المقبل. إن Ternary Bonsai 2 27B هو إعادة ضغط لنموذج خارجي — Qwen3.8-27B من علي بابا. سقف جودته يحدده جدول إصدارات شخص آخر، وإيقاع تعاقب أجياله يتبع Qwen لا PrismML. وعندما تُصدر Qwen نموذج 27B جديدًا، تحصل سلسلة Bonsai 27B على مدخل جديد، ويُعاد حساب رقم الاحتفاظ مقابل خط أساس جديد.

تم بناء 1-bit Bonsai 2B على Bonsai 1.7B الخاص بـ PrismML. يُحدد سقفه داخليًا، ووتيرة تحديثه يختارها PrismML، وتحسيناته تأتي من وصفة الضغط ومسار النواة بدلاً من استبدال النموذج المصدر. هذا أصل من نوع مختلف: أبطأ في التحسن من حيث القدرة الخام، وخاضع بالكامل لسيطرة المورّد، و—كما يظهر إصدار النظارات—قابل للضبط من أجل مسرّع معين بطريقة لا تستطيع إعادة الضغط العامة فعلها.

كلتا الاستراتيجيتين مشروعة. لكنهما ليستا قابلتين للتبادل، والاستراتيجية التي تريدها تعتمد على ما إذا كانت خارطة طريقك مرتبطة بـ Qwen أم بالجهاز.

A screenshot of PrismML's announcement page titled 'PrismML Brings 1-Bit Bonsai Models to AI Smart Glasses Powered by Snapdragon', dated September 23 2026, describing a 2-billion-parameter vision-language model with a 1.7B 1-bit LLM and a 0.3B 4-bit vision encoder running on the Snapdragon AR1 Gen 1 Platform.

تباين المواصفات، سطر واحد في كل مرة

• المعلمات — نموذج لغوي 1.7B بـ1-بت بالإضافة إلى مشفّر رؤية 0.3B بـ4-بت في نموذج النظارة، مقابل نموذج من فئة 27B مستمد من Qwen3.8-27B في Ternary Bonsai 2 27B.

• التمثيل — ثنائي {−1، +1} مع قياس جماعي بنظام FP16 في نموذج النظارات، مقابل ثلاثي {−1، 0، +1} مع القياس نفسه عند 1.76 بت فعّالة لكل وزن في النموذج 27B.

• أوزان نموذج اللغة — 0.43 غيغابايت للنموذج 1-بت 1.7B، مقابل 5.93 غيغابايت لتغليف PTQ1_0 الخاص بـ Ternary Bonsai 2 27B، مع توفر تغليف PQ2_0 بسعة 7.25 غيغابايت أيضاً.

• السياق — 1,024 رمزًا على نموذج النظارات، مقابل سياق كامل يبلغ 262,000 رمز على Ternary Bonsai 2 27B.

• المسرّع — Qualcomm Hexagon NPU عبر QNN SDK مع دعم نواة 1-بت، مقابل Apple silicon عبر MLX وNVIDIA عبر CUDA.

• ادعاء الجودة — "نتائج اختبار مرجعي مقارنة" مقابل Qwen 3 1.7B بدقة 4 بت، مقابل الحفاظ على "أكثر من 98%" من خط الأساس Qwen3.8-27B بالدقة الكاملة. كلاهما مُبلَّغ عنه من المورّد، ولم يُعَد إنتاجه بشكل مستقل، وقيسا على مجموعات اختبار مختلفة.

• وقت التشغيل — مجموعة أدوات وحدة المعالجة العصبية (NPU) من Qualcomm لنموذج النظارات، مقابل نسخة llama.cpp المتفرعة الخاصة بـ PrismML وحاوية MLX للنموذج 27B، ولا يدعم أيًّا منهما llama.cpp القياسي.

A screenshot of PrismML's launch post for Bonsai 2 27B dated September 17 2026, stating the model is available as a ternary build based on Qwen3.8 27B, reduces the memory footprint by more than 9x to 5.9 GB, and that while the original Ternary Bonsai 27B retained 95% of the aggregate benchmark performance of its full precision counterpart the new model retains over 98%.

ما الذي يمنحه الرهان على البتات المنخفضة في كل حالة

فلسفة الضغط هي نفسها في كلا النموذجين، ويجدر تسميتها، لأنها الأطروحة الفعلية لهذه العائلة: فتمثيل البتات المنخفضة يعمل من البداية إلى النهاية — التضمينات، والانتباه، ووحدات MLP، ورأس LM — مع تحجيم جماعي بدقة FP16 ودون أي منافذ هروب إلى دقة أعلى. لا يحتفظ أي من النموذجين بشبكة أمان من نوع float للأجزاء التي يصعب تكميمها. وهذا موقف أكثر عدوانية مما تتخذه معظم أعمال التكميم، وهو ما يجعل 1.76 بت لكل وزن وأوزانًا بحجم 0.43 غيغابايت ممكنة على الإطلاق.

تختلف مواضع تحقق المردود. في Ternary Bonsai 2 27B، المردود هو القدرة لكل بايت على العتاد الذي تملكه بالفعل: نموذج من فئة 27B في 5.93 GB، يعمل على حاسوب محمول أو هاتف، عند 98% من خط أساسه. وفي 1-bit Bonsai 2B، المردود هو الوجود على فئة أجهزة لم يكن لديها خيار: نموذج متعدد الوسائط في 0.43 GB من أوزان اللغة، على NPU، بسرعة 15.36 رمزًا في الثانية. الأول نسخة أفضل من شيء كان يعمل بالفعل. والثاني شيء لم يكن يعمل من قبل.

حيث يقع حد المستوى

هذان ليسا بديلين، والتعامل معهما على أنهما في مواجهة مباشرة يغفل شكل النشر الذي يشير إليه كلا الإصدارين. فمنتج النظارات أو الأجهزة القابلة للارتداء يشغّل طراز ‎2B‎ محليًا لأن لا شيء آخر يلائمه. ومنتج الحاسوب المحمول أو الهاتف يشغّل طراز ‎27B‎ لأنه قادر على ذلك. وبمجرد أن يمتد منتج ما ليشمل كليهما — تطبيق هاتف مقترن بنظارات، أو تطبيق حاسوب محمول مزوّد بمساعد على الجهاز — يتوقف السؤال عن كونه أي طراز، ويصبح أي الطلبات يُسمح لكل طبقة بالإجابة عنها.

من الجدير وضع هذا الحد في الإعدادات بدلاً من كود التطبيق، لأن كلتا الطبقتين ستتحرّكان. يتحرّك خط 27B عندما تُصدر Qwen إصدارها، ويتحرّك خط 2B عندما تغيّر PrismML الوصفة، وتتعطل أي قاعدة مثبتة في الكود حول طول السياق أو القدرات عند كلا الحدثين. سياسة توجيه تُصعّد الطلبات التي تتجاوز ميزانية الطبقة المحلية إلى نموذج مستضاف تنجو من كلا التغييرين؛ وتبقى الطبقة المحلية طبقة واحدة بين عدة طبقات بدلاً من افتراض منسوج عبر العميل. OrcaRouter هي الطبقة التي تنفذ ذلك التصعيد — نقطة نهاية واحدة عبر أكثر من 200 نموذج مستضاف، مع تضمين تجاوز الفشل، ومع السياسة المعبَّر عنها كإعدادات. لا يتم توجيه أي من Bonsai هنا؛ فكلاهما تنزيلان محليان. ما يوجد هنا هو الطبقة الأعلى منهما، ومع نموذج محلي بطول 1,024 رمزًا، فإن تلك الطبقة تؤدي معظم العمل.

A generated scoreboard titled 'Bonsai vs Ternary Bonsai 2 27B — the scoreboard'. The Bonsai column reads: parameters 1.7B 1-bit LLM plus 0.3B 4-bit vision encoder; weights 0.43 GB; context 1,024 tokens; representation binary; quality claim comparative against 4-bit Qwen 3 1.7B; accelerator Qualcomm Hexagon NPU. The Ternary Bonsai 2 27B column reads: parameters 27B on Qwen3.8-27B; weights 5.93 GB PTQ1_0; context 262K tokens; representation ternary at 1.76 bits per weight; quality claim over 98% retention of full precision; accelerator Apple MLX and NVIDIA CUDA. Footer reads 'All quality figures vendor-reported; the two claims use different baselines and suites.' The OrcaRouter logo sits in the bottom-right.

ما الذي سيحسم الأمر؟

ثلاثة قياسات كفيلة بنقل هذين الادعاءين التسويقيين من مجرد دعاية إلى مقارنة حقيقية. تفصيل لكل معيار أداء (benchmark) يقع خلف سطر "النتائج المقارنة"، بحيث تصبح المقايضة في مقابل 4-بت ظاهرة للعيان بدلاً من أن تُختصر في ملخّص. ورقم لمدى احتفاظ نموذج Bonsai 2B أحادي البت بأدائه مقابل خط أساسه الخاص بالدقة الكاملة — وهو القياس الذي تستخدمه PrismML لخط 27B ولم تنشره هنا. وتقييم مستقل لأيٍّ من النموذجين، إذ إن كل رقم في كلا الإصدارين يأتي حالياً من المورّد نفسه.

إلى أن يوجد أحد هذين، فإن الموقف القابل للدفاع هو الذي تدعمه الأرقام فعليًا: إن Ternary Bonsai 2 27B هو النموذج الأفضل بفارق واسع، و1-bit Bonsai 2B هو الوحيد من بين الاثنين الذي يعمل على الجهاز الذي صُنع من أجله. هذان القولان لا يتناقضان، وكون المورّد نفسه قاسهما بمساطر مختلفة هو الأمر الجدير بالتذكر في المرة القادمة التي يُقتبس فيها أحد هذه الأرقام دون خط الأساس الخاص به.