
Bonsai מול Bonsai 27B: שם משפחה אחד, פי שישה עשר פרמטרים
- openaiחדשOpenAI: GPT-6 Luna2026-09-2237אינטליגנציה
- openaiחדשOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- anthropicחדשAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- grokחדשGrok 4.72026-09-2146אינטליגנציה
- OrcaחדשOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 לכל 1M טוקנים
- orcaחדשOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים
- deepseekחדשDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- openaiOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- googleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- anthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0540אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0345אינטליגנציה76כתיבת קוד
כל מי שמחפש לקנות את המשפחה הזו לפי השם יקבל את הדגם הלא נכון, והסיבה היא שהשם החשוף "Bonsai" אינו דגם. הוא שם המשפחה, ונכון לשבוע זה המשפחה כוללת מודל חזותי-לשוני בעל 2 מיליארד פרמטרים שרץ על זוג משקפיים חכמים, ומודל בעל 27 מיליארד פרמטרים שרץ על טלפון, מחשב נייד או מחשב שולחני. הראשון הוא מודל Bonsai 2B החזותי-לשוני החד-סיבית שהוכרז ב-23 בספטמבר 2026 — מודל שפה חד-סיבית בעל 1.7 מיליארד פרמטרים בתוספת מקודד ראייה 4-סיביות בעל 0.3 מיליארד פרמטרים, הקשר של 1,024 טוקנים, המבוסס על Bonsai 1.7B. השני הוא Bonsai 27B, שיצא ב-14 ביולי 2026 תחת רישיון Apache 2.0, מבוסס על Qwen3.6-27B עם הקשר של 262,000 טוקנים ואפשרות לבחור בין גרסה טרנרית של 5.9 GB לגרסה בינארית של 3.9 GB. יש להם שם משותף, ספק משותף, פילוסופיית דחיסה משותפת וכמעט שום דבר אחר. פי 16 בפרמטרים, פי 256 בהקשר, ושני מכשירים שונים לחלוטין.
הדף הזה מיועד לאדם שחיפש את אחד מהם ונחת על האחר.
בעיית השמות, בניסוח פשוט
תפריט המודלים של PrismML מציג כעת את Bonsai 2 27B, Bonsai 27B, Bonsai 8B, Bonsai 4B, Bonsai 1.7B ו-Bonsai Image. הכרזת המשקפיים מוסיפה מודל חזותי-לשוני בן 2 מיליארד פרמטרים על גבי קו Bonsai 1.7B. לכן "Bonsai" לבדו יכול להתכוון לכל אחד מלפחות ארבעה מחלקות פרמטרים ושני דורות, וסיומת הגודל היא הדבר היחיד שמבחין ביניהם. זו אינה ביקורת על השמות — זה הצורה הרגילה של משפחת מודלים — אבל היא כן אומרת ששם המשפחה אינו נושא מידע על מה שאתם מורידים.
החתך השימושי אינו הדור, אלא מחלקת ההתקן. כל דבר בקו ה-27B מניח שיש לך בין 4 GB ל-8 GB של זיכרון להעמיד לרשות מודל שפה, ושהינך מוכן להשקיע אותו. כל דבר בקו ה-1.7B מניח שיש לך כמה מאות מגה-בייט ולא יותר. העובדה הבודדת הזו קובעת איזו מחצית מהמשפחה רלוונטית לך לפני שכל בנצ'מרק קובע זאת.
מה כל אחד הוא בפועל
• פרמטרים — LLM של 1.7B עם 1-bit בתוספת מקודד חזותי של 0.3B עם 4-bit במודל המשקפיים, לעומת מודל בדרגת 27B שנגזר מ-Qwen3.6-27B ב-Bonsai 27B.
• הקשר — 1,024 טוקנים במודל המשקפיים, לעומת חלון הקשר מלא של 262,000 טוקנים ב-Bonsai 27B.
• משקולות מודל שפה — 0.43 GB עבור גרסת ה-1-bit של 1.7B, לעומת 5.9 GB עבור Bonsai 27B הטרנארי ו-3.9 GB עבור גרסת ה-1-bit שלו.
• ייצוג — משקלים בינאריים {−1, +1} עם סקיילינג קבוצתי ב-FP16 בשניהם, וזהו מתכון ה-1-ביט שהמשפחה בנויה סביבו; Bonsai 27B מציע בנוסף גרסה טרנרית {−1, 0, +1} ב-1.71 ביטים אפקטיביים למשקל.
• סיליקון יעד — ה-NPU של Qualcomm Hexagon בפלטפורמת המשקפיים Snapdragon AR1 Gen 1, מהודר דרך QNN SDK עם תמיכה בקרנלים של 1-bit, מול Apple silicon באמצעות MLX ו-NVIDIA באמצעות CUDA עבור Bonsai 27B.
• תפוקת פענוח — 15.36 אסימונים לשנייה על פלטפורמת בדיקה AR1 Gen 1 עם 4 GB עבור מודל המשקפיים, לעומת כ-11 אסימונים לשנייה ב-iPhone 17 Pro, 87 ב-Apple M5 Max ו-163 ב-RTX 5090 עבור Bonsai 27B ב-1-bit.
כל אחד מהנתונים האלה הוא של הספק, ושתי הקבוצות נמדדו על חומרה שונה מול קווי בסיס שונים, ולכן הן מתארות שני מוצרים ולא שתי נקודות על עקומה.

היכן ש-Bonsai 27B מנצח, וזה לא צמוד
ההקשר הוא המקום הראשון, והפער אינו ניואנס. חלון של 262,000 טוקנים מכיל בסיס קוד, מסמך ארוך, תמלול, או סשן סוכן פעיל עם מקום פנוי. חלון של 1,024 טוקנים מכיל הוראה קצרה אחת ותמונה אחת. אם עומס העבודה שלך כולל קריאת משהו ארוך מדף, Bonsai 27B הוא היחיד מבין השניים שמסוגל לבצע את העבודה בכלל, ושום כמות של פרומפטינג חכם במודל המשקפיים לא תסגור את הפער הזה, כי המגבלה היא הזיכרון המוקצה למצב מפתח-ערך ולא גודל המשקולות.
היכולת היא במקום השני. מדווח שהמבנה הטרינרי של Bonsai 27B שומר על כ-95% מקו הבסיס שלו בדיוק מלא לאורך חבילת בדיקות של 15 מבחני בנצ'מרק במצב חשיבה, והמבנה החד-סיביות שלו שומר על כ-90%, כשההפסדים הגדולים ביותר הם בראייה ובשימוש בכלים. אלה נתוני ספק מחבילת הבדיקות של הספק עצמו, והם עדיין מסוג אחר לחלוטין ממודל עם 2 מיליארד פרמטרים, שהצהרת האיכות היחידה שפורסמה לגביו היא שהוא השיג "תוצאות בנצ'מרק השוואתיות" מול Qwen 3 1.7B בן 4 סיביות. היצרן של מודל המשקפיים עצמו אינו משווה אותו למודל 27B, משום שההשוואה לא תהיה מועילה.
האקוסיסטם הוא השלישי. Bonsai 27B משווק באריזות GGUF, MLX ו-AWQ עם סביבות הרצה מתועדות, כך שיש מסלול להרצתו על חומרה שכבר בבעלותך. מודל המשקפיים קיים בתוך שרשרת כלים של Qualcomm NPU.

במקום שבו ה-2B מנצח, וזה כל העניין
מודל שפה של 0.43 GB נכנס למקומות שמודל של 5.9 GB לא יכול להגיע אליהם, ופלטפורמת המשקפיים היא אחד מהם. זה כל הטיעון, והוא טיעון חזק יותר מכפי שפער המפרט גורם לו להישמע, מפני שלמכשירים המדוברים אין חלופה: זוג משקפיים עם 4 GB של זיכרון פלטפורמה משותף לא יכול להריץ את Bonsai 27B בשום גרסה, וטלפון לא יכול להריץ את הגרסה הטרנארית בלי לוותר על רוב מה שהטלפון נועד לו.
יש ניצחון שני שזוכה לפחות לתשומת לב: ייצוג 1-ביט אינו פשרה בסוג המכשירים הזה — הוא הטריק שמאפשר אותו. הניסוח של PrismML עצמה הוא שמסלול ה-1-ביט מספק בערך אותה תבונה של אותו מודל בדיוק 4-ביט, תוך שימוש בכרבע מהזיכרון וביצירת טוקנים במהירות כפולה ומעלה. עבור מכשיר שדלוק תמיד, שבו כל מיליוואט וכל מגה-בייט נמצאים בתחרות, העסקה הזו היא המוצר.
אז שני המודלים לא מתחרים. ה-2B הוא זה שרץ כשאין שום מקום אחר להריץ. ה-27B הוא זה שרץ כשיש.
גבול הדרג הוא ההחלטה האמיתית
כמעט אף אחד לא בוחר בין השניים האלה. בפריסה מציאותית יש את שניהם: מודל קטן שפועל תמיד על המכשיר עבור בקשות שנכנסות ב־1,024 טוקנים, ומשהו גדול יותר מאחוריו עבור כל השאר. ברגע שאתם מקבלים את הצורה הזו, השאלה ההנדסית מפסיקה להיות "איזה Bonsai" והופכת ל"היכן עובר הקו, ומי אוכף אותו".
כשזה נאכף בקוד היישום, השורה הזו הופכת לענף שצריך לשכתב בכל פעם שהמודל שעל המכשיר משנה את אורך ההקשר או את היכולות שלו — מה שלפי העדויות משלושת החודשים האחרונים קורה בערך אחת לחודש. כשזה נאכף כמדיניות ניתוב, זה הופך לכלל אחד בנוגע לתקציב ההקשר וליכולת הנדרשת, והשכבה המקומית נשארת שכבה במקום להפוך להנחה המוטמעת לרוחב הלקוח. זו השכבה שבה פועל OrcaRouter: נקודת קצה אחת מול יותר מ-200 מודלים מתארחים, עם מעבר לגיבוי וגם מדיניות ההסלמה המובעת בקונפיגורציה. אף אחד משני ה-Bonsai אינו מנותב כאן — שניהם הורדות שאתם מריצים על החומרה שלכם — כך שהניסוח הכנה הוא ששכבת הניתוב מכסה את השכבה שמעל לשכבה המקומית, ועם מודל מקומי של 1,024 טוקנים, השכבה הזו היא היכן שרוב התעבורה תנחת.

אם עליך לבחור אחד
• אתה בונה עבור משקפיים, מכשירים לבישים או כל מכשיר שפועל תמיד — מודל השפה-חזות 1-bit Bonsai 2B הוא האפשרות היחידה כאן, וההקשר של 1,024 טוקנים הוא אילוץ העיצוב שסביבו אתה בונה ולא נגדו.
• אתה בונה עבור טלפון — 1-bit Bonsai 27B בנפח 3.9 GB הוא המודל הגדול ביותר במשפחה הזו שנכנס לתקציב זיכרון ברמת iPhone, והוא מקנה לך חלון הקשר של 262K שמודל המשקפיים לא יכול להתקרב אליו.
• אתה בונה עבור מחשב נייד או מחשב שולחני — גרסת Bonsai 27B הטרינרית היא הבחירה המוכוונת לאיכות במשפחה, וגרסת ה-1-bit קונה מהירות במקום יכולת.
• אתה בונה משהו היברידי — קבע קודם את כלל ההסלמה, ורק אחר כך את המודל. את המודל אפשר להחליף; את הגבול אי אפשר, ברגע שהוא כבר בצד הלקוח.
מה ששווה לעקוב אחריו הוא אם נתיב ה-NPU שאיפשר את השקת המשקפיים מתפשט כלפי מעלה. אם קרנלים של 1-ביט במאיצים ניידים מכלילים, סדרת ה-1.7B גדלה והטיעון בעד מודל 27B בטלפון מתחזק. עד אז, שני חצאי המשפחה נשארים מופרדים היטב לפי סוג המכשיר, מה שהופך את הבחירה לקלה יותר ממה שהשם המשותף מרמז.
