כרטיס כותרת שנוצר עם הכיתוב 'Bonsai on Smart Glasses' עם כיתוב המשנה 'A 2-billion-parameter 1-bit vision-language model running locally', מעל שלושה כרטיסים עם הכיתוב '1.7B 1-bit LLM + 0.3B 4-bit vision encoder', 'Context: 1,024 tokens' ו-'LLM weights: 0.43 GB vs 1.66 GB at 4-bit', עם כותרת תחתונה עם הכיתוב 'Vendor-reported figures, September 2026.' הלוגו של OrcaRouter נמצא בפינה הימנית התחתונה.
Engineering & Research

Bonsai על משקפיים חכמים: VLM של 2B עם 1-ביט שרץ על Snapdragon AR1 Gen 1

מחבר

Magnus Corvin

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים →
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

המספר שקובע למה ההכרזה הזו באמת טובה הוא לא פי 4 והוא לא פי 2. הוא 1,024 — אורך ההקשר של המודל ש-PrismML שמה על זוג משקפיים חכמים ב-Snapdragon Summit ב-23 בספטמבר 2026. מודל חזותי-לשוני Bonsai 2B ב-1 סיבית, מערכת בת 2 מיליארד פרמטרים הבנויה על Bonsai 1.7B, פועל באופן מקומי על משקפיים חכמים עם בינה מלאכותית המופעלים על ידי Snapdragon AR1 Gen 1 Platform, והנתונים ש-PrismML מציגה בראש הם זיכרון ומהירות: 0.43 GB של משקולות LLM לעומת 1.66 GB עבור מודל 1.7B המקביל ב-4 סיביות, הפחתה של פי 3.83, ו-15.36 אסימונים לשנייה לעומת 7.44, שיפור של פי 2.06. שני הנתונים הם של הספק עצמו, שניהם נמדדו על פלטפורמת בדיקה של 4 GB, ושניהם נמדדו מול מודל Qwen 3 1.7B 4-bit. הם לא נמדדו מול שום Bonsai 27B, והם לא נמדדו מול שום דבר מתארח. לקרוא אותם כטענה על האיכות של Bonsai תהיה טעות; לקרוא אותם כטענה על מה שנכנס בתקציב זיכרון ברמת משקפיים היא הקריאה הנכונה.

מה הוכרז, במקום אחד

ההכרזה של PrismML — עם תאריך מפסדינה, קשורה ל-Snapdragon Summit של Qualcomm — מציבה מודל חזותי-לשוני עם 2 מיליארד פרמטרים על פלטפורמת המשקפיים AR1 Gen 1. הפיצול הוא מודל שפה 1-ביט בנפח 1.7B בתוספת מקודד חזותי 4-ביט בנפח 0.3B, עם אורך הקשר של 1,024 טוקנים. הוא מבוסס על Bonsai 1.7B של PrismML, כך שהוא הקצה הקטן של משפחת Bonsai ולא ארכיטקטורה חדשה, והוא קומפל עבור Qualcomm Hexagon NPU באמצעות QNN SDK פנימי עם תמיכה בקרנל 1-ביט.

הכותרת טוענת, כפי שנמסר על ידי הספק:

• מאפשר להכניס מודל עם פי 4 יותר פרמטרים בתוך אותן מגבלות זיכרון בתצורות מסוימות של משקפיים.

• מספק בערך את אותה רמת בינה של אותו מודל בדיוק של 4 סיביות, תוך שימוש בכמות זיכרון קטנה פי 4 בערך.

• מייצר טוקנים במהירות של יותר מפי 2.

שלושת המשפטים האלה הם ההודעה. המדידות הספציפיות מאחורי טענות הזיכרון והמהירות הן 0.43 GB מול 1.66 GB ו-15.36 מול 7.44 אסימונים לשנייה, שתיהן על פלטפורמה המוגדרת עם 4 GB של זיכרון. ה-AR1 Gen 1 עצמו מצוטט בשיא של 6 TOPS ו-2,304 MACs למחזור — נתון עבור הפלטפורמה, לא עבור הסקת מודל שפה, וזו הבחנה שהמספרים של ההודעה עצמה מבהירים על ידי ציטוט אסימונים לשנייה בנפרד.

A screenshot of PrismML's announcement page titled 'PrismML Brings 1-Bit Bonsai Models to AI Smart Glasses Powered by Snapdragon', dated September 23 2026, describing a 2-billion-parameter vision-language model running locally on AI smart glasses powered by the Snapdragon AR1 Gen 1 Platform, fitted with a 1.7B 1-bit LLM and a 0.3B 4-bit vision encoder and a 1,024-token context.

ה-4x הוא טענה לגבי זיכרון, ובסיס ההשוואה הוא מודל שונה

זה החלק ששווה להאט בו, מפני ש"4x" הוא מסוג המספרים שמגיעים רחוק יותר מהמשפט שממנו הם באו. כל השוואה ש-PrismML פרסמה עבור מודל המשקפיים היא מול קוונטיזציה של 4 סיביות של Qwen 3 1.7B — אותה מחלקת פרמטרים, אותה משימה, קוונטיזציה שונה. זוהי השוואה לגיטימית ושימושית: זוהי ההשוואה שיצרן OEM של משקפיים באמת מתמודד איתה, שבה השאלה היא אם מסלול של 1 סיבית מחזיר מספיק זיכרון כדי להצדיק את עבודת הקרנל. זוהי אינה השוואה מול גרסת 4 סיביות של Bonsai, וזוהי אינה השוואה מול Bonsai גדול יותר שרץ במקום אחר.

הערת השוליים של הבנצ'מרק המצורפת להכרזה זהירה באותו אופן. PrismML העריכה את Bonsai 1.7B 1-bit LLM מול המודל Qwen 3 1.7B 4-bit בספטמבר 2026 על פני BFCL v3, HumanEval+, MMLU Redux, IFEval, IFBench, MuSR, GSM8K ו-GPQA Diamond, והתוצאה המדווחת היא ששתי התצורות "השיגו תוצאות בנצ'מרק השוואתיות". השוואתיות, לא עדיפות. אין בהכרזה ציונים לכל בנצ'מרק בנפרד, ואין שחזור בלתי תלוי של שום דבר מזה, וזה רגיל עבור מהדורת edge בשבוע ההשקה, ובדיוק משום כך יש להתייחס למספרים כאל מדווחים על ידי הספק עד שמישהו מחוץ ל-PrismML יריץ אותם.

1,024 טוקנים הם המפרט שמעצב את המוצר

מודל ראייה-שפה שעל משקפיים הוא עומס עבודה שונה ממודל ראייה-שפה בחלון צ'אט, ואורך ההקשר הוא המקום שבו זה ניכר. ב-1,024 אסימונים, המודל יכול להחזיק הנחיה קצרה בתוספת מה שהמצלמה רואה כעת. הוא לא יכול להחזיק היסטוריית שיחה, מסמך, או שרשרת ארוכה של תורות קודמים. זה אינו פגם בגרסה — זה האילוץ שאיפשר את הגרסה, כי מטמון KV והאקטיבציות צריכים לשהות באותם 4 GB שבהם מאוחסנים המשקלים, ומודל בדרגת 27B עם הקשר של 262K אסימונים זקוק למקום גדול יותר בסדרי גודל עבור המצב הזה.

אז התיאור הישר של מה שיצא הוא עוזר קצר-הקשר בעל יכולת שרץ כולו על המכשיר. משימות בצורת משקפיים — לזהות את זה, לקרוא את ההוא, לתרגם את השלט שלפניי, לענות על שאלה על מה שאני מסתכל עליו — נכנסות בתוך 1,024 טוקנים. כל דבר שצריך לזכור את עשר הדקות האחרונות לא נכנס, ושום מידה של דחיסת 1-ביט לא משנה את זה, כי המגבלה היא המצב, לא המשקולות.

מה שאקוסיסטם ה-edge צריך להפיק מכך

ההנדסה החדשה באמת בהכרזה הזו היא לא המודל. זה נתיב הקרנל: מודל LLM של 1-bit שהודר עבור Hexagon NPU דרך QNN SDK עם תמיכה בקרנלים של 1-bit. משקלים בדיוק נמוך ניתנים להרצה על CPU-ים ועל GPU-ים מזה זמן מה, והשחרורים של Bonsai 27B מבית PrismML עצמה הדגימו זאת על Apple silicon וחומרת NVIDIA. העברת קרנלים עם משקלים בינאריים אל NPU נייד היא בעיה אחרת, מפני שנתיב הנתונים של המאיץ, פורמט האריזה שלו ותזמון העבודה שלו חייבים כולם להתאים לייצוג שאינו מטיפוס float בכלל.

אם הנתיב הזה מכליל מעבר למודל הזה — ושפת ה-SDK מרמזת ש-PrismML מתכוונת לכך — אז ההשלכה המעניינת היא שמשפחת ה-1-bit מפסיקה להיות סיפור של מחשבים ניידים וטלפונים והופכת לסיפור של מכשירים תמיד-דלוקים. פלטפורמת ה-4 GB בהכרזה היא התקרה הנוכחית. כל דבר שמוריד את טביעת המשקל באיכות קבועה מעלה את גודל המודל שנכנס מתחתיה.

A screenshot of the Hugging Face model page for prism-ml/Bonsai-1.7B-mlx-1bit, PrismML's 1-bit Bonsai 1.7B language model — the parameter class and 1-bit representation that the glasses release is built on.

הטענה בדבר פעולה על המכשיר ראויה להסתייגות אחת.

הסקה מולטימודלית מקומית לחלוטין על זוג משקפיים היא טענה חזקה, וכדאי להפריד בין מה שמודגם לבין מה שמשתמע. AR1 Gen 1 היא פלטפורמת משקפיים שנבנתה לחישה ושמע תמידיים; המסגור של Qualcomm עצמה למודלי שפה על-מכשיר היה בדרך כלל היברידי, כאשר המכשיר מטפל במה שהוא יכול ומעביר את השאר לטלפון משויך או לענן. ההדגמה הפומבית הראשונה של Qualcomm של מודל שפה קטן על-מכשיר הייתה קשורה לפלטפורמת AR1+ Gen 1 ולא ל-AR1 Gen 1. אף אחת מהנקודות הללו אינה סותרת את ההכרזה של PrismML — ההכרזה אומרת שהמודל פועל מקומית על AR1 Gen 1, ונתוני התפוקה והזיכרון של הספק עצמו עקביים עם מודל קטן שעושה בדיוק את זה — אבל הן כן אומרות שהמוצר המעשי שייבנה על זה יהיה כמעט בוודאות שכבה מקומית עם נתיב הסלמה, ולא מכשיר שלעולם לא מדבר עם שום דבר אחר.

זו בכל זאת הארכיטקטורה הנכונה. מודל מקומי בגודל 1,024 טוקנים טוב מאוד בבקשות שנכנסות ל-1,024 טוקנים ואינו יכול לענות לאלה שלא.

היכן נתיב ההסלמה שייך

לכל מי שבונה על מהדורה כמו זו, שאלת התכנון אינה אם מודל המשקפיים טוב — אלא מה קורה לבקשה שהוא לא יכול לשרת. כשעונים על כך בקוד האפליקציה, זה הופך לערימה של מקרים מיוחדים שצריך לשכתב בכל פעם שהמודל במכשיר משתנה בגודל או בהקשר. כשעונים על כך כמדיניות ניתוב, זה הופך לכלל אחד: בקשות שמעבר לתקציב ההקשר של השכבה המקומית, או שדורשות כלים או הנמקה שאין לשכבה המקומית, מועברות למודל מתארח. מדיניות כזו היא מסוג הדברים ש-OrcaRouter קיים בשבילם — נקודת קצה אחת מול יותר מ-200 מודלים מתארחים, עם מעבר לגיבוי והמדיניות שמתבטאת בתצורה ולא בלקוח. Bonsai עצמו לא מנותב כאן; הוא הורדה שאתם מריצים על החומרה שלכם. מה ששכבת הניתוב מכסה הוא הגבול שמעליה, והגבול הזה הוא המקום שבו פריסת משקפיים תשקיע את רוב זמן ההנדסה שלה.

A generated scoreboard titled 'Bonsai 2B VLM on Snapdragon AR1 Gen 1 — the scoreboard', listing: parameters 1.7B 1-bit LLM plus 0.3B 4-bit vision encoder; context 1,024 tokens; LLM weights 0.43 GB versus 1.66 GB for a 4-bit 1.7B; decode speed 15.36 versus 7.44 tokens per second; accelerator Qualcomm Hexagon NPU via a QNN SDK with 1-bit kernel support; test platform 4 GB of memory. Footer reads 'All figures vendor-reported, September 2026; comparison baseline is a 4-bit Qwen 3 1.7B, not another Bonsai.' The OrcaRouter logo sits in the bottom-right.

מה לצפות בהמשך

שלושה דברים יהפכו את זה מהכרזה לפלטפורמה. פירוט לפי בנצ'מרק מאחורי השורה "תוצאות השוואתיות", כך שהפשרה מול 4-bit תהיה גלויה ולא מסוכמת. חלון הקשר גדול יותר על אותו נתיב NPU, שהיא בעיה של זיכרון מצב ולא בעיה של משקלים, ולכן קשה יותר מבין השתיים. והערכה בלתי תלויה של מודל LLM בגודל 1.7B עם 1-bit מול מקבילו עם 4-bit, כי כל נתון במהדורה הזו מגיע כרגע מהצד שבנה אותו.

עד אז, הסיכום המדויק הוא צר ושימושי: מודל מולטימודלי בעל 2 מיליארד פרמטרים פועל כעת על התקן ברמת משקפיים עם 0.43 ג'יגה-בייט של משקלים לשוניים, במהירות של בערך פי שניים ובזיכרון של בערך רבע מהמקבילה 4-ביט, על תקציב הקשר של 1,024 טוקנים. זהו צעד אמיתי עבור הסקה במכשיר וצעד קטן עבור יכולת המודל, ושתי אלה אינן אותה טענה.