بطاقة عنوان مُنشأة تقرأ «Ternary Bonsai 2 27B مقابل Qwen3.8-27B» مع عنوان فرعي «الشبكة نفسها بدقتين»، فوق ثلاث بطاقات تقرأ «حجم الملف: 5.93 GB مقابل 53.81 GB»، و«التقليل: 9.05x» و«السياق: 262K رمزًا، لكلتيهما»، مع تذييل يقرأ «نسبة الاحتفاظ البالغة 98.2% مُبلَّغ عنها من المورّد وغير مُعاد إنتاجها.» ويقع شعار OrcaRouter في أسفل اليمين.
Guides & Insights

Ternary Bonsai 2 27B مقابل Qwen3.8-27B: ما الذي تمنحك إياه 47.9 جيجابايت من الدقة فعليًا؟

الكاتب

Rowan Sterling

تاريخ النشر

أحدث النماذج · 20عرض جميع النماذج
المعايير: Artificial Analysis · يُحدَّث يوميًا
العودة إلى جميع المقالات

Ternary Bonsai 2 27B وQwen3.8-27B هما النموذج نفسه في عالمين رقميين. يتشاركان البنية، والمُرمِّز، وسلالة التدريب، ونافذة سياق من 262,144 رمزًا. ما يفصل بينهما هو طريقة تدوين الأوزان: يخزّن Qwen3.8-27B كل وزن كعدد عشري عائم 16 بت ويشغل 53.81 GB في صيغته المرجعية FP16، بينما يخزّن Ternary Bonsai 2 27B كل وزن كواحد من ثلاثة رموز ويشغل 5.93 GB. أعلنت Prism ML عن الإصدار المضغوط في 17 سبتمبر 2026 ونشرته على Hugging Face تحت رخصة Apache 2.0؛ ونُشرت أوزان Qwen3.8-27B الأصلية في 13 أغسطس 2026، أيضًا تحت رخصة Apache 2.0.

المقارنة التي تهم ليست أيهما أفضل. بل ما الذي يكلفك فقدان 47.9 GB، والجواب الصادق أضيق وأكثر تحديدًا مما سيخبرك به أي من المعسكرين. تُفيد Prism ML بأن نسختها تحتفظ بـ98.2% من متوسط أداء النموذج كامل الدقة عبر مجموعة من 20 اختبارًا معياريًا — 83.9 مقابل 85.4. هذا الرقم صادر عن البائع نفسه، وقيس على منصة الاختبار الخاصة بالبائع نفسه، وبعد يوم واحد من الإصدار لم يتحقق أحد خارج Prism ML من صحته. كما أن المتوسط المجمّع يخفي الجزء الذي ينبغي أن يهمك فعلاً، لأن نقاط الـ1.8 ليست موزعة بالتساوي. في الاختبارين المعياريين اللذين يضعان ضغطًا على هندسة البرمجيات المستدامة، الفجوة ليست 1.8% — بل أقرب إلى 25%.

نفس الشبكة، مكتوبة بشكل مختلف

ابدأ بما لا يمسّه الضغط، لأنه السبب الذي يجعل المقارنة مثيرة للاهتمام أصلًا. فعدد الطبقات، والحجم المخفي، والمفردات، ونمط الانتباه، وبرج الرؤية كلها تنتمي إلى النموذج الأساسي. إن Qwen3.8-27B تصميم انتباه هجين: 48 طبقة انتباه خطي Gated DeltaNet متداخلة مع 16 طبقة انتباه كامل، بتقسيم يقارب 3:1، عبر 64 طبقة بحجم مخفي 5,120 ومفردات من 248,320 رمزًا. هذا العمود الفقري الغالب خطيته هو ما يجعل سياقًا بحجم 262K ممكنًا من الأساس، وهي الخاصية التي يرثها Bonsai دون تغيير.

ما غيّرته Prism ML هو تمثيل مصفوفات نموذج اللغة، بالإضافة إلى النوى الحاسوبية اللازمة للحساب عليها. تُقسّم ورقتها البيضاء المعلمات البالغ عددها 27.36B إلى 24.35B في العمود الفقري اللغوي عبر 64 كتلة، و2.54B في التضمين ورأس LM، و0.47B في برج رؤية مكوّن من 27 كتلة. يُشحن برج الرؤية كملف mmproj منفصل بدقة 4 بت بحجم يقارب 0.63 GB، ولا يُحمَّل إلا عند وصول صورة فعليًا، لذا لا يتحمل نشر نصي فقط تكلفته.

ثمة نتيجة عملية لهذا التصميم شبه الخطي في الغالب تجدر الإشارة إليها قبل أي نقاش حول القياسات المرجعية. ولأن البنية المعمارية ليست محوّلًا تقليديًا، فقد كان لا بد من كتابة النوى منخفضة البتات خصيصًا لها. يرفض llama.cpp القياسي كلا التعبئتين الخاصتين بـ Prism ML باعتبارهما نوعين مجهولين — والأخطر من ذلك، أنه يحمّل تنسيقًا ثلاثيًا أقدم دون اعتراض وينتج كلامًا طليقًا لا معنى له، لأنه لا يطبّق أي دوران مطابق على التنشيطات. إذا شغّلت هذا النموذج على ملف ثنائي لا يعرف عنه شيئًا، فلن تحصل على خطأ. ستحصل على مخرجات واثقة وخاطئة.

المقارنة، فئةً فئةً

إليك تفصيل البائع لمقاييس الأداء العشرين، مع اعتماد القاعدة كاملة الدقة كمرجع. كل رقم في هذه القائمة مأخوذ من Prism ML؛ ولا يوجد أي منها مُتحقق منه بشكل مستقل.

• الرياضيات — 96.57 لـ Ternary Bonsai 2 27B مقابل 97.06 لـ Qwen3.8-27B. على نفس المستوى فعليًا.

• البرمجة — 81.58 مقابل 82.17. قريب أيضًا، وهي الفئة التي تدور حولها حجة التقنية بأكملها.

• اتباع التعليمات — 82.66 مقابل 81.25. النموذج المضغوط هو متقدّم هنا، وهو السطر الوحيد في الجدول المُفاجئ حقًا.

• المعرفة والاستدلال — 83.95 مقابل 86.66. انخفاض بمقدار 2.7 نقطة، وهو أكبر مساهم منفرد في النقاط الـ1.8 المفقودة.

• القدرات الوكيلية واستدعاء الأدوات — 77.57 مقابل 79.74، بما يشمل τ2-Bench عند 80.22 وBFCL v3 عند 74.92.

• الرؤية — 78.59 مقابل 81.64، أكبر خسارة ضمن الفئات. لاحظ أن برج الرؤية نفسه ليس هو الجزء المضغوط؛ بل نموذج اللغة الذي يقرأ مخرجاته هو المضغوط.

A generated two-column scoreboard titled 'Ternary Bonsai 2 27B vs Qwen3.8-27B — the scoreboard'. The Ternary Bonsai 2 27B column reads: bits per weight 1.76 packed, file size 5.93 GB, 20-benchmark average 83.9, math 96.57, instruction following 82.66, Terminal-Bench 2.1 52.8. The Qwen3.8-27B FP16 column reads: bits per weight 16.0, file size 53.81 GB, 20-benchmark average 85.4, math 97.06, instruction following 81.25, Terminal-Bench 2.1 69.7. Footer reads 'Both columns are one vendor suite; the compressed figures are unaudited.' The OrcaRouter logo sits in the bottom-right.

اقرأ الشكل بدلًا من المتوسط، تظهر قصة أوضح. الضغط شبه مجاني في الرياضيات والبرمجة واتباع التعليمات، ومكلف في المعرفة والرؤية. وهذا عكس الحكمة الشائعة عن النماذج منخفضة البتات، التي تقول إن المعرفة السطحية تنجو والاستدلال ينهار. هنا المعرفة هي التي تتآكل والاستدلال هو الذي يصمد.

أين تكمن نقاط 1.8 فعليًا

المُجمَّع هو متوسط حسابي على عشرين معيارًا، والمتوسطات هي المكان الذي تختبئ فيه الفجوات. استخرج النتائج الفردية وستجد أن اثنتين منها أسوأ بكثير مما يوحي به المتوسط.

• Terminal-Bench 2.1 — 52.8 للنسخة الثلاثية مقابل 69.7 للدقة الكاملة

• SWE-bench Verified — 60.8 مقابل 80.6

يقع كلاهما قرب ثلاثة أرباع نتيجة الدقة الكاملة. وفي المقابل، يأتي AIME26 عند 95.83، وLiveCodeBench عند 90.07، وAA-LCR عند 77.0 — أي في حدود نقطة واحدة من النموذج غير المضغوط. هذه هي المرة الأولى التي تُقيَّم فيها عائلة Bonsai على Terminal-Bench على الإطلاق، وتوضح Prism ML صراحةً في موادها الخاصة أن قدرة الهندسة البرمجية طويلة الأفق التي وعدت بها في الجيل الأول قد تحققت جزئيًا، وليس بالكامل.

إذن فالسؤال العملي ليس "هل يحتفظ بنسبة 98.2%؟" بل "ما هو عبء العمل الخاص بي؟". إذا كنت تشغّل وكيل برمجة يحتفظ بخطة عبر عشرات من نداءات الأدوات ويحرّر الملفات على مدى دقائق، فأنت في الفئة التي بها فجوة 25%، والرقم الإجمالي مضلّل فعلياً. وإذا كنت تقوم بالرياضيات، أو توليد الكود في جولة واحدة، أو الاستخراج، أو التصنيف، أو الدردشة، فأنت في الفئات التي تتلاشى فيها الفجوة. وأكثر ما يفيد في جدول المورّد نفسه أنه يتيح لك إجراء هذا التمييز بدلاً من التخمين.

ما الذي يحتاجه كل واحد منها فعليًا لكي يعمل

حكاية العتاد أقل تناظرًا مما توحي به نسبة الحجم. نموذج FP16 بحجم 53.81 GB لا يتسع إطلاقًا على حاسوب محمول بسعة 16 GB، ما يجعل المقارنة أقرب إلى "ممكن مقابل غير ممكن" منها إلى "أسرع مقابل أبطأ". قياسات Prism ML الموحّدة عند حجم دفعة 1، مع استبعاد برج الرؤية:

• NVIDIA RTX 5090 — فك ترميز بمعدل 142.5 رمز/ث على تعبئة PQ2_0، عند 0.582 ملي واط-ساعة لكل رمز

• Apple M5 Max — 46.8 tok/s لفك الترميز، مع معالجة الموجّه بحوالي 765 tok/s

• Apple M5 Pro — 27.7 tok/s فك الترميز

• Apple M4 Pro — 18.0 tok/s لفك الترميز، مع معالجة المطالبات عند حوالي 125 tok/s لتصبح القيد الملزم في السياقات الطويلة جدًا

التحفّظ المهم هو أن أياً من هذا ليس ملفاً ثنائياً واحداً. فحزمة PTQ1_0 تمنحك 5.93 GB عند 1.76 بت لكل وزن؛ أما PQ2_0 فتكلف 7.25 GB عند 2.16 بت لكل وزن، وتشتري سرعة فك الترميز على عتاد يكون فيه صبيب التعليمات، لا عرض نطاق الذاكرة، هو القيد. وبناء MLX لـ Apple Silicon هو أثر ثالث بحساباته الخاصة — حاوية أفينية ثنائية البت تخزّن انحيازاً لا تحتاجه الأوزان الثلاثية، لتستقر عند 2.25 بت لكل وزن و8.005 GiB على القرص، مع نوى Metal وCPU لكن دون مسار CUDA. عبارة "إنه يعمل في 5.9 GB" صحيحة بالنسبة لواحد فقط من تلك الملفات على بيئة التشغيل الصحيحة تحديداً.

مقارنة التكلفة، بصياغة صادقة

هناك طريقتان للدفع مقابل Qwen3.8-27B وطريقة واحدة فقط للدفع مقابل نظيره المضغوط. Ternary Bonsai 2 27B هو تنزيل: Apache 2.0، أجهزتك، بدون عدّاد. Qwen3.8-27B هو تنزيل وخدمة مستضافة معًا، وإذا اخترت المسار المستضاف، فإن الرقم المعني هو الموجود في صفحة النموذج — $0.33 لكل مليون رمز إدخال و$2.40 لكل مليون رمز إخراج، مقدَّمة من البنية التحتية الخاصة بـ OrcaRouter بدلاً من إعادة بيعها من بنية تحتية لجهة أخرى.

هنا يأتي دور OrcaRouter ليستحق مكانًا في هذه المقارنة بدلًا من أن يكون مجرد حاشية. فالبناء الموجّه من Qwen3.8-27B يحمل السياق نفسه البالغ 262K، ويقبل النصوص والصور والفيديو، ويكشف عن التحكم في جهد الاستدلال الذي يأتي به النموذج. وهو يقف خلف المفتاح نفسه الذي تستخدمه أكثر من 200 طراز آخر دون أي هامش يُضاف فوق سعر القائمة لدى المزوّد، وهذا أمر يهم أكثر مما يبدو: لأن سعر القائمة يُمرَّر بدلًا من إعادة بيعه، فإن تغيّر سعر المورّد يظهر هنا في اليوم نفسه بدلًا من تجدده في العقد التالي. وبالنسبة لفريق يريد النسخة الأساسية كاملة الدقة كطبقة تصعيد فوق Bonsai محلي، فهذا نقطة نهاية واحدة ومفتاح واحد بدلًا من علاقتين مع مورّدين.

A screenshot of Prism ML's launch post for Bonsai 2 27B, dated September 17 2026 and titled 'PrismML Launches Bonsai 2 27B, Its Most Capable Model Yet', showing the opening paragraphs stating the model is based on Qwen3.8 27B, reduces memory footprint by more than 9x at 5.9 GB, and that while the original Ternary Bonsai 27B retained 95% of its full-precision counterpart's aggregate benchmark performance the new model retains over 98%.

أي واحد تختار؟

القرار يتعلق في الأساس بمكان تنفيذ العمل، لا بأيّ النموذجين أفضل، لأنهما في معظم المهام النموذج نفسه.

• اختر Qwen3.8-27B بالدقة الكاملة عندما تكون المهمة ممتدة على أفق طويل وذات طابع وكيلي، وعندما تكون في طور التقييم أو الضبط الدقيق، أو عندما تحتاج إلى سياق YaRN البالغ مليون رمز، أو عندما تكون دقة الرؤية ذات وزن حاسم. فأرقام Terminal-Bench وSWE-bench هي السبب.

• اختر Ternary Bonsai 2 27B عندما يجب أن يتم العمل على أجهزة تملكها، أو عندما يكون البديل هو عدم تشغيل نموذج 27B إطلاقًا، أو عندما يكون عبء العمل في الرياضيات أو البرمجة أو الاستخلاص أو الاستدلال دون أدوات حيث تكون الفئات على نفس المستوى.

• لا تختر بناءً على الإجمالي. 83.9 و85.4 متقاربان بما يكفي لأن تبديل اختبار معياري واحد قد يعيد ترتيبهما، وواحد فقط من الرقمين مُتحقَّق منه بشكل مستقل.

ما الجديد حقًا هنا ليس أن نموذجًا بحجم 27B يتّسع في ستة غيغابايت — فقد فعل ذلك الجيل الأول من Bonsai في يوليو. بل إن اتباع التعليمات جاء متقدمًا على النموذج الأصل، وأن الرياضيات والبرمجة جاءتا في المستوى نفسه، وهذا ادعاء مختلف عن «صغير بالنسبة لحجمه». أما ما إذا كان يصمد على عبء عملك فهو بالضبط ما لا يستطيع عمره الذي لا يتجاوز يومًا واحدًا أن يخبرك به، وأول تقييم مستقل لهذا النموذج هو النتيجة التي تستحق الانتظار.

A screenshot of OrcaRouter's model page for Qwen3.8-27B, showing the qwen/qwen3.8-27b identifier attributed to Qwen and dated 2026-08-13, a 262K token context with text, image and video input and text output, input pricing of $0.33 and output pricing of $2.40 per million tokens, a p50 time to first token of 4.80 seconds over seven days, and the description that the model is self-hosted on OrcaRouter's own infrastructure.

إذا كنت تريد إجراء المقارنة على مطالباتك الخاصة بدلًا من مجموعة اختبار مرجعية، فأسرع طريق هو استدعاء Qwen3.8-27B المستضاف عبر نقطة نهاية واحدة وتشغيل نسخة ternary محليًا، ثم مقارنة المخرجات على المهام التي لديك فعلًا. هذا عمل صباح واحد، وسيخبرك عن الـ1.8 نقطة أكثر من أي جدول منشور.