
Bonsai לעומת Ternary Bonsai 2 27B: שני הימורי Low-Bit, שני סרגלים שונים
- openaiחדשOpenAI: GPT-6 Luna2026-09-2237אינטליגנציה
- openaiחדשOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- anthropicחדשAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- grokחדשGrok 4.72026-09-2146אינטליגנציה
- OrcaחדשOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 לכל 1M טוקנים
- orcaחדשOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים
- deepseekחדשDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- openaiOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- googleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- anthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0540אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0345אינטליגנציה76כתיבת קוד
הצבו את מודל השפה-חזות 1-bit Bonsai 2B לצד Ternary Bonsai 2 27B, וההשוואה המובנת מאליה — 2 מיליארד פרמטרים מול 27 מיליארד, 0.43 GB של משקלי שפה מול 5.93 GB — היא הדבר הפחות מעניין בזוג. הדבר המעניין הוא ששני המודלים, מאותו ספק ואותה תוכנית דחיסה, אינם מדווחים על איכותם באותו אופן. Ternary Bonsai 2 27B מדווח על שימור: הוא שומר על למעלה מ-98% מביצועי הבנצ'מרק המצטברים של מקבילו בעל הדיוק המלא, כשהוא נמדד מול עצמו. ה-1-bit Bonsai 2B מדווח על השוואה: הוא השיג "תוצאות בנצ'מרק השוואתיות" מול מודל Qwen 3 1.7B בקוונטיזציה של 4-bit, כשהוא נמדד מול המודל של מישהו אחר ברמת דיוק שונה. האחד הוא הצהרה על כמה אבד. האחר הוא הצהרה על איך הוא משתווה. אף אחד מהם אינו הצהרה על כמה טוב כל אחד מהמודלים במונחים מוחלטים, ואין לקרוא את השניים באותו קנה מידה.
ההבחנה הזו חשובה יותר ממספר הפרמטרים, מפני שהיא קובעת מה אתה יכול בעצם להסיק מהמספרים של הספק — ולפי הראיות שפורסמו עד כה, התשובה הכנה היא פחות ממה שהמספרים הכותרתיים מרמזים.
שתי טענות איכות, שני סרגלים שונים
Ternary Bonsai 2 27B, ששוחרר ב-17 בספטמבר 2026, הוא בנייה מחדש טרנארית {−1, 0, +1} של Qwen3.8-27B ב-1.76 ביטים אפקטיביים לכל משקל, והנתון המרכזי ש-PrismML מציגה הוא שהוא שומר על יותר מ-98% מביצועי הבנצ'מרק המצטברים של מודל הדיוק המלא. זו טענת שימור, וטענות שימור הן מעצם טבען הפניות לעצמן: הן אומרות לך כמה מהמקור שרד את הדחיסה, לא היכן עמד המקור. מודל ששומר על 98% מבסיס בינוני הוא עדיין מודל בינוני, ו-Qwen3.8-27B אינו בינוני — אבל המספר לבדו לא אומר זאת, ואין להשוותו בין מודלי בסיס.
מודל השפה-חזות Bonsai 2B ב-1-bit, שהוכרז ב-23 בספטמבר 2026 עבור פלטפורמת המשקפיים Snapdragon AR1 Gen 1, הוא מודל שפה 1.7B ב-1-bit בתוספת מקודד חזותי 0.3B ב-4-bit. הצהרת האיכות שפורסמה שלו שונה במהותה: PrismML העריכה אותו מול מודל Qwen 3 1.7B בקוונטיזציה של 4-bit על פני BFCL v3, HumanEval+, MMLU Redux, IFEval, IFBench, MuSR, GSM8K ו-GPQA Diamond, ודיווחה ששתי התצורות השיגו תוצאות דומות. זוהי טענת שוויון מול קו בסיס חיצוני. היא אומרת שהדחיסה לא גבתה ממך מחיר ברור לעומת מסלול ה-4-bit שבו היית משתמש אחרת — וזו בדיוק השאלה הנכונה עבור מהדורה בסיווג מכשיר, וטענה חלשה בהרבה מ"המודל הזה טוב".
לכן אין שום פירוש שבו 98.2% מנצח את "השוואתי" או להיפך. הן תשובות לשתי שאלות שונות, שנשאלו כנגד שני מקורות ייחוס שונים, בשתי חבילות שונות, על ידי אותו ספק. כל מי שמדרג את שני המודלים האלה על סמך שני המשפטים האלה מדרג את המשפטים.
מודלי הבסיס מגיעים ממקומות שונים
ישנו הבדל מבני שני, והוא זה שיהיה חשוב בשנה הקרובה. Ternary Bonsai 2 27B הוא דחיסה מחדש של מודל חיצוני — Qwen3.8-27B של Alibaba. תקרת האיכות שלו נקבעת על ידי לוח הזמנים של מישהו אחר, והקצב הדורי שלו עוקב אחרי Qwen ולא אחרי PrismML. כאשר Qwen משחררת 27B חדש, קו Bonsai 27B מקבל קלט חדש, ונתון השימור מחושב מחדש מול בסיס חדש.
ה-Bonsai 2B בעל 1-bit בנוי על ה-Bonsai 1.7B של PrismML עצמה. התקרה שלו נקבעת בבית, קצב העדכונים שלו נתון לבחירתה של PrismML, והשיפורים שלו מגיעים ממתכון הדחיסה וממסלול הקרנל ולא מהחלפת מודל במעלה הזרם. זהו סוג אחר של נכס: איטי יותר להשתפר ביכולת גולמית, נמצא לחלוטין בשליטת הספק, ו—כפי שמראה השחרור של המשקפיים—יכול להיות מכוונן עבור מאיץ ספציפי באופן שדחיסה מחדש כללית אינה יכולה.
שתי אלה אסטרטגיות לגיטימיות. הן אינן ניתנות להחלפה זו בזו, והאחת שתרצו תלויה בשאלה אם מפת הדרכים שלכם מעוגנת בזו של Qwen או במכשיר.

הניגוד במפרט, שורה אחת בכל פעם
• פרמטרים — מודל LLM של 1.7B עם 1 ביט בתוספת מקודד ראייה של 0.3B עם 4 ביט במודל המשקפיים, לעומת מודל בסדר גודל של 27B הנגזר מ-Qwen3.8-27B ב-Ternary Bonsai 2 27B.
• ייצוג — בינארי {−1, +1} עם סקיילינג קבוצתי FP16 במודל המשקפיים, לעומת טרנרי {−1, 0, +1} עם אותו סקיילינג ב-1.76 ביטים אפקטיביים לכל משקל ב-27B.
• משקולות של מודל שפה — 0.43 GB עבור ה-1-bit 1.7B, לעומת 5.93 GB עבור אריזת PTQ1_0 של Ternary Bonsai 2 27B, כאשר זמינה גם אריזת PQ2_0 בנפח 7.25 GB.
• הקשר — 1,024 טוקנים במודל המשקפיים, לעומת חלון הקשר מלא של 262,000 טוקנים ב-Ternary Bonsai 2 27B.
• מאיץ — ה-NPU Qualcomm Hexagon באמצעות QNN SDK עם תמיכה בקרנל של 1 סיבית, לעומת Apple silicon דרך MLX ו-NVIDIA דרך CUDA.
• טענת איכות — "תוצאות בנצ'מרק השוואתיות" לעומת Qwen 3 1.7B ב-4-ביט, ולעומת שימור של "מעל 98%" של בסיס Qwen3.8-27B בדיוק מלא. שניהם דווחו על ידי הספק, אף אחד מהם לא שוחזר באופן עצמאי, ונמדדו על מערכי בדיקות שונים.
• סביבת ריצה — שרשרת כלים של Qualcomm NPU עבור מודל המשקפיים, לעומת ה-fork של PrismML עצמה של llama.cpp ומיכל MLX עבור ה-27B, ש-llama.cpp הסטנדרטי אינו תומך באף אחד מהם.

מה שההימור על סיביות נמוכות קונה בכל אחד מהמקרים
פילוסופיית הדחיסה זהה בשני המודלים, וראוי לתת לה שם, משום שהיא התזה הממשית של המשפחה: הייצוג ברזולוציית סיביות נמוכה פועל מקצה לקצה — אמבדינגים, קשב, MLP-ים וראש LM — עם סקיילינג קבוצתי ב-FP16 וללא פתחי מילוט ברמת דיוק גבוהה יותר. אף אחד מהמודלים לא שומר רשת ביטחון מסוג float עבור החלקים שקשים לכימות. זוהי עמדה אגרסיבית יותר מזו שרוב עבודות הכימות נוקטות, והיא מה שמאפשר בכלל 1.76 סיביות לכל משקל ומשקלות בנפח 0.43 GB.
המקום שבו ההימור משתלם שונה. ב-Ternary Bonsai 2 27B התמורה היא יכולת לכל בייט על חומרה שכבר בבעלותך: מודל בדרגת 27B ב-5.93 GB, שרץ על מחשב נייד או טלפון, ב-98% מקו הבסיס שלו. ב-Bonsai 2B החד-סיבי התמורה היא עצם הקיום במחלקת מכשירים שלא הייתה לה אפשרות: מודל מולטימודלי ב-0.43 GB של משקולות שפה, על NPU, בקצב של 15.36 טוקנים לשנייה. הראשון הוא גרסה טובה יותר של משהו שכבר עבד. השני הוא משהו שלא עבד קודם.
היכן ממוקם גבול השכבה
שני אלה אינם חלופות, והתייחסות אליהם כאל עימות ראש בראש מחמיצה את צורת הפריסה ששתי המהדורות מצביעות עליה. מוצר משקפיים או מוצר לביש מריץ את ה-2B מקומית כי שום דבר אחר לא מתאים. מוצר מחשב נייד או טלפון מריץ את ה-27B כי הוא יכול. ברגע שמוצר משתרע על שניהם — אפליקציית טלפון שמתחברת למשקפיים, אפליקציית מחשב נייד עם עוזר על-המכשיר — השאלה מפסיקה להיות איזה מודל ומתחילה להיות אילו בקשות כל שכבה מורשית לענות עליהן.
כדאי לשים את הגבול הזה בקונפיגורציה ולא בקוד האפליקציה, מפני ששתי השכבות יזוזו. קו ה-27B זז כשמשחררים את Qwen, קו ה-2B זז כשמשנים את המתכון ב-PrismML, וכלל מקודד-קשיח לגבי אורך ההקשר או היכולת נשבר בשני האירועים. מדיניות ניתוב שמסלילה בקשות מעבר לתקציב השכבה המקומית למודל מתארח שורדת את שני השינויים; השכבה המקומית נשארת שכבה אחת מבין כמה, ולא הנחה שמשורשרת דרך הלקוח. OrcaRouter הוא השכבה שעושה את ההסלמה הזו — נקודת קצה אחת על פני יותר מ-200 מודלים מתארחים, כולל failover, עם המדיניות מבוטאת כקונפיגורציה. אף אחד מה-Bonsai לא מנותב כאן; שניהם הורדות מקומיות. מה שיושב כאן הוא השכבה שמעליהם, ועם מודל מקומי של 1,024 טוקנים השכבה הזו עושה את רוב העבודה.

מה יפתור את זה?
שלוש מדידות יהפכו את הצמד הזה משתי הצהרות שיווקיות להשוואה. פירוט לפי בנצ'מרק מאחורי שורת "התוצאות ההשוואתיות", כך שהפשרה מול 4-bit תהיה גלויה במקום מסוכמת. נתון שימור עבור Bonsai 2B בגרסת 1-bit לעומת קו הבסיס שלו ברמת דיוק מלאה — המדידה שבה משתמשת PrismML עבור סדרת ה-27B ולא פרסמה כאן. והערכה בלתי תלויה של כל אחד מהמודלים, מכיוון שכל נתון בשתי ההכרזות מגיע כיום מהספק.
עד שאחד מאלה יהיה קיים, העמדה שאפשר להגן עליה היא זו שהמספרים באמת תומכים בה: Ternary Bonsai 2 27B הוא המודל הטוב יותר בפער ניכר, ו-1-bit Bonsai 2B הוא היחיד מבין השניים שפועל על המכשיר שעבורו הוא נבנה. שתי האמירות האלה אינן בסתירה, והעובדה שאותו ספק מדד אותם בסרגלים שונים היא הדבר שכדאי לזכור בפעם הבאה שאחד מהנתונים האלה יצוטט בלי קו הבסיס שלו.
