
Bonsai על משקפיים חכמים: VLM של 2B עם 1-ביט שרץ על Snapdragon AR1 Gen 1
- typesafeחדשTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 לכל 1M טוקנים · 36 tok/s
- openaiחדשOpenAI: GPT-6 Luna2026-09-2237אינטליגנציה
- openaiחדשOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- anthropicחדשAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- grokחדשGrok 4.72026-09-2146אינטליגנציה
- OrcaחדשOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 לכל 1M טוקנים · 182 tok/s
- orcaחדשOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- openaiOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- googleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- anthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0540אינטליגנציה72כתיבת קוד
המספר שקובע למה ההכרזה הזו באמת טובה הוא לא פי 4 והוא לא פי 2. הוא 1,024 — אורך ההקשר של המודל ש-PrismML שמה על זוג משקפיים חכמים ב-Snapdragon Summit ב-23 בספטמבר 2026. מודל חזותי-לשוני Bonsai 2B ב-1 סיבית, מערכת בת 2 מיליארד פרמטרים הבנויה על Bonsai 1.7B, פועל באופן מקומי על משקפיים חכמים עם בינה מלאכותית המופעלים על ידי Snapdragon AR1 Gen 1 Platform, והנתונים ש-PrismML מציגה בראש הם זיכרון ומהירות: 0.43 GB של משקולות LLM לעומת 1.66 GB עבור מודל 1.7B המקביל ב-4 סיביות, הפחתה של פי 3.83, ו-15.36 אסימונים לשנייה לעומת 7.44, שיפור של פי 2.06. שני הנתונים הם של הספק עצמו, שניהם נמדדו על פלטפורמת בדיקה של 4 GB, ושניהם נמדדו מול מודל Qwen 3 1.7B 4-bit. הם לא נמדדו מול שום Bonsai 27B, והם לא נמדדו מול שום דבר מתארח. לקרוא אותם כטענה על האיכות של Bonsai תהיה טעות; לקרוא אותם כטענה על מה שנכנס בתקציב זיכרון ברמת משקפיים היא הקריאה הנכונה.
מה הוכרז, במקום אחד
ההכרזה של PrismML — עם תאריך מפסדינה, קשורה ל-Snapdragon Summit של Qualcomm — מציבה מודל חזותי-לשוני עם 2 מיליארד פרמטרים על פלטפורמת המשקפיים AR1 Gen 1. הפיצול הוא מודל שפה 1-ביט בנפח 1.7B בתוספת מקודד חזותי 4-ביט בנפח 0.3B, עם אורך הקשר של 1,024 טוקנים. הוא מבוסס על Bonsai 1.7B של PrismML, כך שהוא הקצה הקטן של משפחת Bonsai ולא ארכיטקטורה חדשה, והוא קומפל עבור Qualcomm Hexagon NPU באמצעות QNN SDK פנימי עם תמיכה בקרנל 1-ביט.
הכותרת טוענת, כפי שנמסר על ידי הספק:
• מאפשר להכניס מודל עם פי 4 יותר פרמטרים בתוך אותן מגבלות זיכרון בתצורות מסוימות של משקפיים.
• מספק בערך את אותה רמת בינה של אותו מודל בדיוק של 4 סיביות, תוך שימוש בכמות זיכרון קטנה פי 4 בערך.
• מייצר טוקנים במהירות של יותר מפי 2.
שלושת המשפטים האלה הם ההודעה. המדידות הספציפיות מאחורי טענות הזיכרון והמהירות הן 0.43 GB מול 1.66 GB ו-15.36 מול 7.44 אסימונים לשנייה, שתיהן על פלטפורמה המוגדרת עם 4 GB של זיכרון. ה-AR1 Gen 1 עצמו מצוטט בשיא של 6 TOPS ו-2,304 MACs למחזור — נתון עבור הפלטפורמה, לא עבור הסקת מודל שפה, וזו הבחנה שהמספרים של ההודעה עצמה מבהירים על ידי ציטוט אסימונים לשנייה בנפרד.

ה-4x הוא טענה לגבי זיכרון, ובסיס ההשוואה הוא מודל שונה
זה החלק ששווה להאט בו, מפני ש"4x" הוא מסוג המספרים שמגיעים רחוק יותר מהמשפט שממנו הם באו. כל השוואה ש-PrismML פרסמה עבור מודל המשקפיים היא מול קוונטיזציה של 4 סיביות של Qwen 3 1.7B — אותה מחלקת פרמטרים, אותה משימה, קוונטיזציה שונה. זוהי השוואה לגיטימית ושימושית: זוהי ההשוואה שיצרן OEM של משקפיים באמת מתמודד איתה, שבה השאלה היא אם מסלול של 1 סיבית מחזיר מספיק זיכרון כדי להצדיק את עבודת הקרנל. זוהי אינה השוואה מול גרסת 4 סיביות של Bonsai, וזוהי אינה השוואה מול Bonsai גדול יותר שרץ במקום אחר.
הערת השוליים של הבנצ'מרק המצורפת להכרזה זהירה באותו אופן. PrismML העריכה את Bonsai 1.7B 1-bit LLM מול המודל Qwen 3 1.7B 4-bit בספטמבר 2026 על פני BFCL v3, HumanEval+, MMLU Redux, IFEval, IFBench, MuSR, GSM8K ו-GPQA Diamond, והתוצאה המדווחת היא ששתי התצורות "השיגו תוצאות בנצ'מרק השוואתיות". השוואתיות, לא עדיפות. אין בהכרזה ציונים לכל בנצ'מרק בנפרד, ואין שחזור בלתי תלוי של שום דבר מזה, וזה רגיל עבור מהדורת edge בשבוע ההשקה, ובדיוק משום כך יש להתייחס למספרים כאל מדווחים על ידי הספק עד שמישהו מחוץ ל-PrismML יריץ אותם.
1,024 טוקנים הם המפרט שמעצב את המוצר
מודל ראייה-שפה שעל משקפיים הוא עומס עבודה שונה ממודל ראייה-שפה בחלון צ'אט, ואורך ההקשר הוא המקום שבו זה ניכר. ב-1,024 אסימונים, המודל יכול להחזיק הנחיה קצרה בתוספת מה שהמצלמה רואה כעת. הוא לא יכול להחזיק היסטוריית שיחה, מסמך, או שרשרת ארוכה של תורות קודמים. זה אינו פגם בגרסה — זה האילוץ שאיפשר את הגרסה, כי מטמון KV והאקטיבציות צריכים לשהות באותם 4 GB שבהם מאוחסנים המשקלים, ומודל בדרגת 27B עם הקשר של 262K אסימונים זקוק למקום גדול יותר בסדרי גודל עבור המצב הזה.
אז התיאור הישר של מה שיצא הוא עוזר קצר-הקשר בעל יכולת שרץ כולו על המכשיר. משימות בצורת משקפיים — לזהות את זה, לקרוא את ההוא, לתרגם את השלט שלפניי, לענות על שאלה על מה שאני מסתכל עליו — נכנסות בתוך 1,024 טוקנים. כל דבר שצריך לזכור את עשר הדקות האחרונות לא נכנס, ושום מידה של דחיסת 1-ביט לא משנה את זה, כי המגבלה היא המצב, לא המשקולות.
מה שאקוסיסטם ה-edge צריך להפיק מכך
ההנדסה החדשה באמת בהכרזה הזו היא לא המודל. זה נתיב הקרנל: מודל LLM של 1-bit שהודר עבור Hexagon NPU דרך QNN SDK עם תמיכה בקרנלים של 1-bit. משקלים בדיוק נמוך ניתנים להרצה על CPU-ים ועל GPU-ים מזה זמן מה, והשחרורים של Bonsai 27B מבית PrismML עצמה הדגימו זאת על Apple silicon וחומרת NVIDIA. העברת קרנלים עם משקלים בינאריים אל NPU נייד היא בעיה אחרת, מפני שנתיב הנתונים של המאיץ, פורמט האריזה שלו ותזמון העבודה שלו חייבים כולם להתאים לייצוג שאינו מטיפוס float בכלל.
אם הנתיב הזה מכליל מעבר למודל הזה — ושפת ה-SDK מרמזת ש-PrismML מתכוונת לכך — אז ההשלכה המעניינת היא שמשפחת ה-1-bit מפסיקה להיות סיפור של מחשבים ניידים וטלפונים והופכת לסיפור של מכשירים תמיד-דלוקים. פלטפורמת ה-4 GB בהכרזה היא התקרה הנוכחית. כל דבר שמוריד את טביעת המשקל באיכות קבועה מעלה את גודל המודל שנכנס מתחתיה.

הטענה בדבר פעולה על המכשיר ראויה להסתייגות אחת.
הסקה מולטימודלית מקומית לחלוטין על זוג משקפיים היא טענה חזקה, וכדאי להפריד בין מה שמודגם לבין מה שמשתמע. AR1 Gen 1 היא פלטפורמת משקפיים שנבנתה לחישה ושמע תמידיים; המסגור של Qualcomm עצמה למודלי שפה על-מכשיר היה בדרך כלל היברידי, כאשר המכשיר מטפל במה שהוא יכול ומעביר את השאר לטלפון משויך או לענן. ההדגמה הפומבית הראשונה של Qualcomm של מודל שפה קטן על-מכשיר הייתה קשורה לפלטפורמת AR1+ Gen 1 ולא ל-AR1 Gen 1. אף אחת מהנקודות הללו אינה סותרת את ההכרזה של PrismML — ההכרזה אומרת שהמודל פועל מקומית על AR1 Gen 1, ונתוני התפוקה והזיכרון של הספק עצמו עקביים עם מודל קטן שעושה בדיוק את זה — אבל הן כן אומרות שהמוצר המעשי שייבנה על זה יהיה כמעט בוודאות שכבה מקומית עם נתיב הסלמה, ולא מכשיר שלעולם לא מדבר עם שום דבר אחר.
זו בכל זאת הארכיטקטורה הנכונה. מודל מקומי בגודל 1,024 טוקנים טוב מאוד בבקשות שנכנסות ל-1,024 טוקנים ואינו יכול לענות לאלה שלא.
היכן נתיב ההסלמה שייך
לכל מי שבונה על מהדורה כמו זו, שאלת התכנון אינה אם מודל המשקפיים טוב — אלא מה קורה לבקשה שהוא לא יכול לשרת. כשעונים על כך בקוד האפליקציה, זה הופך לערימה של מקרים מיוחדים שצריך לשכתב בכל פעם שהמודל במכשיר משתנה בגודל או בהקשר. כשעונים על כך כמדיניות ניתוב, זה הופך לכלל אחד: בקשות שמעבר לתקציב ההקשר של השכבה המקומית, או שדורשות כלים או הנמקה שאין לשכבה המקומית, מועברות למודל מתארח. מדיניות כזו היא מסוג הדברים ש-OrcaRouter קיים בשבילם — נקודת קצה אחת מול יותר מ-200 מודלים מתארחים, עם מעבר לגיבוי והמדיניות שמתבטאת בתצורה ולא בלקוח. Bonsai עצמו לא מנותב כאן; הוא הורדה שאתם מריצים על החומרה שלכם. מה ששכבת הניתוב מכסה הוא הגבול שמעליה, והגבול הזה הוא המקום שבו פריסת משקפיים תשקיע את רוב זמן ההנדסה שלה.

מה לצפות בהמשך
שלושה דברים יהפכו את זה מהכרזה לפלטפורמה. פירוט לפי בנצ'מרק מאחורי השורה "תוצאות השוואתיות", כך שהפשרה מול 4-bit תהיה גלויה ולא מסוכמת. חלון הקשר גדול יותר על אותו נתיב NPU, שהיא בעיה של זיכרון מצב ולא בעיה של משקלים, ולכן קשה יותר מבין השתיים. והערכה בלתי תלויה של מודל LLM בגודל 1.7B עם 1-bit מול מקבילו עם 4-bit, כי כל נתון במהדורה הזו מגיע כרגע מהצד שבנה אותו.
עד אז, הסיכום המדויק הוא צר ושימושי: מודל מולטימודלי בעל 2 מיליארד פרמטרים פועל כעת על התקן ברמת משקפיים עם 0.43 ג'יגה-בייט של משקלים לשוניים, במהירות של בערך פי שניים ובזיכרון של בערך רבע מהמקבילה 4-ביט, על תקציב הקשר של 1,024 טוקנים. זהו צעד אמיתי עבור הסקה במכשיר וצעד קטן עבור יכולת המודל, ושתי אלה אינן אותה טענה.
