
Bonsai على النظارات الذكية: نموذج VLM بحجم 2B وبدقة 1-بت يعمل على Snapdragon AR1 Gen 1
- typesafeجديدTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 لكل مليون رمز · 36 tok/s
- openaiجديدOpenAI: GPT-6 Luna2026-09-2237الذكاء
- openaiجديدOpenAI: GPT-6 Sol2026-09-2248الذكاء
- anthropicجديدAnthropic: Claude Opus 5.52026-09-2258الذكاء
- grokجديدGrok 4.72026-09-2146الذكاء
- OrcaجديدOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 لكل مليون رمز · 182 tok/s
- orcaجديدOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 لكل مليون رمز · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040الذكاء
- openaiOpenAI: GPT-6 Astra2026-09-0453الذكاء77البرمجة
- googleGoogle: Gemini 3.8 Flash2026-09-0241الذكاء76البرمجة
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245الذكاء76البرمجة
- anthropicAnthropic: Claude Fable 5.12026-09-0153الذكاء82البرمجة
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 لكل مليون رمز · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642الذكاء72البرمجة
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 لكل مليون رمز · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845الذكاء75البرمجة
- obsidianQwen3.8 27B2026-08-1534الذكاء68البرمجة
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236الذكاء69البرمجة
- grokSpaceXAI: Grok 4.62026-08-1244الذكاء77البرمجة
- metaMeta: Muse Spark 1.22026-08-0540الذكاء72البرمجة
الرقم الذي يحدد ما يصلح له هذا الإعلان فعليًا ليس 4x وليس 2x. بل هو 1,024 — طول السياق للنموذج الذي وضعته PrismML على زوج من النظارات الذكية في Snapdragon Summit في 23 سبتمبر 2026. نموذج Bonsai 2B أحادي البت للرؤية واللغة، وهو نظام ب ملياري معامل مبني على Bonsai 1.7B، يعمل محليًا على نظارات ذكية مدعومة بمنصة Snapdragon AR1 Gen 1، والأرقام التي تتصدر بها PrismML هي الذاكرة والسرعة: 0.43 GB من أوزان LLM مقابل 1.66 GB للنموذج المقابل 4-bit 1.7B، أي انخفاض بمقدار 3.83x، و15.36 توكنًا في الثانية مقابل 7.44، أي تحسين بمقدار 2.06x. كلا الرقمين من المورّد نفسه، وكلاهما قيس على منصة اختبار 4 GB، وكلاهما قيس مقابل نموذج Qwen 3 1.7B 4-bit. ولم يُقيسا مقابل أي Bonsai 27B، ولم يُقيسا مقابل أي شيء مستضاف. قراءتهما كادعاء حول جودة Bonsai ستكون خطأً؛ وقراءتهما كادعاء حول ما يتسع في ميزانية ذاكرة من فئة النظارات هي القراءة الصحيحة.
ما الذي أُعلن، في مكان واحد
إعلان PrismML — المؤرخ من باسادينا، والمرتبط بقمة Snapdragon Summit من Qualcomm — يضع نموذجاً لغوياً بصرياً يبلغ عدد معاملاته ملياري معامل على منصة نظارات AR1 Gen 1. التقسيم هو نموذج لغوي بحجم 1.7B بدقة 1-بت، بالإضافة إلى مشفّر بصري بحجم 0.3B بدقة 4-بت، بطول سياق يبلغ 1,024 رمزاً. وهو مبني على Bonsai 1.7B من PrismML، لذا فهو الطرف الأصغر في عائلة Bonsai وليس معمارية جديدة، وقد جُمّع من أجل Qualcomm Hexagon NPU باستخدام QNN SDK داخلي يدعم نوى 1-بت.
يزعم العنوان الرئيسي، كما ذكره المورّد:
• يستوعب نموذجًا يبلغ عدد معاملاته أربعة أضعاف ضمن قيود الذاكرة نفسها على بعض تصاميم النظارات.
• يوفر ذكاءً مكافئًا تقريبًا لذكاء النموذج نفسه عند دقة 4 بتات، مع استخدام ذاكرة أقل بنحو 4 أضعاف.
• يُولّد الرموز بسرعة تزيد عن الضعف.
تلك الجمل الثلاث هي البيان. القياسات المحددة الكامنة وراء ادعاءات الذاكرة والسرعة هي 0.43 GB مقابل 1.66 GB و15.36 مقابل 7.44 توكن في الثانية، وكلاهما على منصة مهيأة بذاكرة سعة 4 GB. ويُذكر أن AR1 Gen 1 نفسه بذروة تبلغ 6 TOPS و2,304 MACs لكل دورة — وهو رقم يخص المنصة، لا الاستدلال في نماذج اللغة، وهو تمييز توضحه أرقام الإعلان نفسه بذكر التوكنات في الثانية بشكل منفصل.

4x هو ادعاء يتعلق بالذاكرة، وخط الأساس نموذج مختلف.
هذا هو الجزء الذي يستحق أن نتمهّل عنده، لأن «4x» رقم من النوع الذي ينتشر أبعد من الجملة التي جاء منها. كل مقارنة نشرتها PrismML لطراز النظارات هي مقابل تكميم 4-بت من Qwen 3 1.7B — فئة المعاملات نفسها، والمهمة نفسها، وتكميم مختلف. هذه مقارنة مشروعة ومفيدة: فهي المقارنة التي تواجهها شركة تصنيع أصلية (OEM) للنظارات فعلاً، حيث يكون السؤال هو ما إذا كان مسار 1-بت يوفّر ما يكفي من الذاكرة ليستحق العمل على النواة. وهي ليست مقارنة بنسخة 4-بت من Bonsai، وليست مقارنة بنسخة أكبر من Bonsai تعمل في مكان آخر.
الحاشية الخاصة بالمعايير والملحقة بالإعلان حذرة بالطريقة نفسها. قيّمت PrismML نموذج Bonsai 1.7B 1-bit LLM مقابل نموذج Qwen 3 1.7B 4-bit في سبتمبر 2026 عبر BFCL v3 وHumanEval+ وMMLU Redux وIFEval وIFBench وMuSR وGSM8K وGPQA Diamond، والنتيجة المُبلَّغ عنها هي أن التكوينين «حقّقا نتائج معيارية مقارِنة». مقارِنة، وليست متفوّقة. لا توجد درجات لكل معيار على حدة في الإعلان، ولا إعادة إنتاج مستقلة لأيٍّ من ذلك، وهو أمر طبيعي لإصدار طرفي في أسبوع الإطلاق، وهو بالضبط سبب وجوب التعامل مع الأرقام باعتبارها مُبلَّغًا عنها من المورّد إلى أن يشغّلها شخص من خارج PrismML.
1,024 رمزًا هي المواصفة التي تشكّل المنتج
نموذج الرؤية واللغة على النظارات هو عبء عمل مختلف عن نموذج الرؤية واللغة في نافذة الدردشة، وطول السياق هو حيث يظهر ذلك. عند 1,024 رمزًا، يمكن للنموذج أن يحمل تعليمات قصيرة بالإضافة إلى ما تنظر إليه الكاميرا حاليًا. لا يمكنه حمل سجل محادثة، أو مستند، أو سلسلة طويلة من الأدوار السابقة. هذا ليس عيبًا في الإصدار — بل هو القيد الذي جعل الإصدار ممكنًا، لأن ذاكرة KV والتفعيلات يجب أن توجد في نفس 4 جيجابايت مع الأوزان، ونموذج من فئة 27B بسياق 262K رمز يحتاج مساحة أكبر بمراتب عديدة لتلك الحالة.
الوصف الصادق لما تم إطلاقه هو مساعد قصير السياق وقادر، يعمل بالكامل على الجهاز. المهام على شكل نظارات — تعرَّف على هذا، واقرأ ذاك، وترجم اللافتة أمامي، وأجب عن سؤال حول ما أنظر إليه — تتسع داخل 1,024 رمزًا. أما أي شيء يحتاج إلى تذكّر الدقائق العشر الأخيرة فلا يتسع، ولا يغيّر ذلك أي قدر من ضغط 1-بت، لأن الحد هو الحالة، لا الأوزان.
ما ينبغي أن يستخلصه النظام البيئي للحوسبة الطرفية منه
الهندسة الجديدة حقًا في هذا الإعلان ليست النموذج. إنها مسار النواة: نموذج لغوي كبير بدقة 1 بت مُصرَّف من أجل Hexagon NPU عبر QNN SDK مع دعم نوى 1 بت. كانت الأوزان منخفضة البتات قابلة للتشغيل على وحدات المعالجة المركزية ووحدات معالجة الرسومات منذ فترة، وقد أظهرت إصدارات Bonsai 27B الخاصة بـ PrismML ذلك على عتاد Apple silicon وNVIDIA. إن نقل نوى الأوزان الثنائية إلى NPU محمول يمثل مشكلة مختلفة، لأن مسار بيانات المسرّع، وصيغة تعبئته، وجدولته، يجب أن تستوعب جميعها تمثيلًا ليس نوعًا عائمًا على الإطلاق.
إذا كان ذلك المسار قابلاً للتعميم خارج هذا النموذج الواحد — وتشير صياغة SDK إلى أن PrismML تعتزم ذلك — فإن النتيجة المثيرة للاهتمام هي أن عائلة 1-بت تتوقف عن كونها قصة حاسوب محمول وهاتف وتصبح قصة جهاز يعمل دائماً. منصة 4 غيغابايت في الإعلان هي السقف الحالي. أي شيء يقلل بصمة الأوزان عند جودة ثابتة يرفع حجم النموذج الذي يتسع تحت ذلك.

ادعاء العمل على الجهاز يستحق تحفظًا واحدًا.
يُعدّ الاستدلال متعدد الوسائط المحلي بالكامل على زوج من النظارات ادعاءً قويًا، ويستحق أن نفصل فيه بين ما هو مُبرهَن عليه وما هو مُضمَر. إن AR1 Gen 1 منصة نظارات مبنية لاستشعار وصوت دائمين؛ وقد كان تأطير Qualcomm نفسها لنماذج اللغة على الجهاز هجينًا عمومًا، حيث يتولى الجهاز ما يستطيع، ويحيل الباقي إلى هاتف مقترن أو إلى السحابة. وكان أول عرض عام من Qualcomm لنموذج لغوي صغير على الجهاز مرتبطًا بمنصة AR1+ Gen 1 وليس بـ AR1 Gen 1. لا تتعارض أي من النقطتين مع إعلان PrismML — إذ يقول الإعلان إن النموذج يعمل محليًا على AR1 Gen 1، كما أن أرقام الإنتاجية والذاكرة الخاصة بالمورّد نفسه متسقة مع قيام نموذج صغير بذلك تحديدًا — لكنهما يعنيان أن المنتج العملي المبني على هذا سيكون على الأرجح طبقة محلية مع مسار تصعيد، لا جهازًا لا يتواصل مطلقًا مع أي شيء آخر.
هذه هي البنية الصحيحة على أي حال. النموذج المحلي بسعة 1,024 رمزًا جيد جدًا في الطلبات التي تقع ضمن 1,024 رمزًا، ولا يستطيع الإجابة عن الطلبات التي لا تقع ضمن ذلك.
أين ينتمي مسار التصعيد
بالنسبة لأي شخص يبني على إصدار كهذا، لا يتمثل السؤال التصميمي في ما إذا كان نموذج النظارات جيدًا — بل في ما الذي يحدث للطلب الذي لا يستطيع تلبيته. إذا أُجيب عنه في شيفرة التطبيق، أصبح ذلك كومة من الحالات الخاصة التي يجب إعادة كتابتها كلما تغيّر حجم النموذج على الجهاز أو سياقه. وإذا أُجيب عنه كسياسة توجيه، أصبح قاعدة واحدة: الطلبات التي تتجاوز ميزانية سياق الطبقة المحلية، أو التي تتطلب أدوات أو استدلالًا لا تملكه الطبقة المحلية، تُرفع إلى نموذج مستضاف. هذه السياسة هي نوع الشيء الذي وُجد OrcaRouter من أجله — نقطة نهاية واحدة أمام أكثر من 200 نموذج مستضاف، مع تجاوز الفشل والتعبير عن السياسة في الإعدادات لا في العميل. Bonsai نفسه لا يتم توجيهه هنا؛ بل هو تنزيل تشغّله على عتادك الخاص. ما تغطيه طبقة التوجيه هو الحد الفاصل أعلاه، وهذا الحد هو حيث سيقضي نشر النظارات معظم وقته الهندسي.

ماذا تشاهد بعد ذلك
ثلاثة أمور ستنقل هذا من كونه إعلانًا إلى منصة. تفصيل لكل اختبار أداء خلف سطر "النتائج المقارنة"، بحيث تكون المقايضة مقابل 4-بت مرئية بدل أن تكون مُلخَّصة. نافذة سياق أكبر على مسار NPU نفسه، وهي مشكلة ذاكرة حالة وليست مشكلة أوزان، وبالتالي فهي الأصعب بين الاثنتين. وتقييم مستقل لنموذج LLM بحجم 1.7B بدقة 1-بت مقابل نظيره بدقة 4-بت، لأن كل رقم في هذا الإصدار يأتي حاليًا من الجهة التي بنته.
حتى ذلك الحين، يكون الملخص الدقيق ضيقًا ومفيدًا: نموذج متعدد الوسائط بمعاملات تبلغ ملياري معامل يعمل الآن على جهاز من فئة النظارات بأوزان لغوية تبلغ 0.43 جيجابايت، بسرعة تقارب ضعف سرعة المكافئ 4-بت وذاكرة تقارب ربع ذاكرته، على ميزانية سياق تبلغ 1,024 رمزًا. هذه خطوة حقيقية للاستدلال على الجهاز وخطوة صغيرة لقدرة النموذج، والاثنان ليسا نفس الادعاء.
