
Ternary Bonsai 2 27B מול Bonsai 27B: חודשיים, שני מודלים בסיסיים, וריאנט אחד חסר
- OrcaחדשOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 לכל 1M טוקנים
- orcaחדשOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים
- deepseekחדשDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- openaiחדשOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- googleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- anthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0540אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0345אינטליגנציה76כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Ternary Bonsai 2 27B הגיע ב-17 בספטמבר 2026, חודשיים לאחר ש-Bonsai 27B הושק ב-14 ביולי 2026, וההשוואה המרכזית ביניהם היא צמד מספרים בודד: הדור הראשון שמר על כ-95% מממוצע הבנצ'מרק של מודל הבסיס שלו בדיוק מלא, והשני שומר על 98.2%. זה נראה כמו שיפור דורי פשוט, וזה בעיקרו נכון — אבל שני המספרים לא מודדים את אותו הדבר, כי מודל הבסיס השתנה מתחתיהם. גרסת יולי דחסה את Qwen3.6-27B. גרסת ספטמבר דוחסת את Qwen3.8-27B. חלק מהשיפור באיכות שייך למתכון הדחיסה וחלק ממנו שייך ל-Qwen3.8-27B החדש יותר, ואף נתון שפורסם לא מפריד בין השניים.
יש הבדל שני בין הדורות שזכה לפחות תשומת לב וחשוב יותר לקבוצה מסוימת של משתמשים: ה-Bonsai הראשון הושק בשני וריאנטים והשני מושק בוריאנט אחד. לגרסת ה-3.9 GB שגרמה לדגם בדרגת 27B להתאים ל-iPhone 17 Pro אין יורש במהדורה הזו. אם טביעת הרגל הזו היא הסיבה שהתעניינת ב-Bonsai מלכתחילה, הדור החדש יותר אינו שדרוג — הוא מוצר אחר שלא מכסה את המקרה שלך.
מה שהדור הראשון בפועל סיפק
Bonsai 27B שוחרר ב-14 ביולי 2026 תחת Apache 2.0 כשני ארטיפקטים שנבנו על אותו מודל בסיס, והפיצול ביניהם היה מטרת השחרור.
• Ternary Bonsai 27B — משקולות טרנריות {−1, 0, +1} עם סקיילינג קבוצתי FP16, 1.71 ביטים אפקטיביים למשקל, נפח של 5.9 GB. הגרסה ממוקדת האיכות, מיועדת למחשב נייד יומיומי עם יכולות מלאות של הסקה, קריאה לכלים ופעולה סוכנית.
• 1-bit Bonsai 27B — משקלים בינאריים {−1, +1} עם אותו סקיילינג קבוצתי, 1.125 סיביות אפקטיביות לכל משקל, תפוסת זיכרון של 3.9 GB. הגרסה הממוקדת בתפוסת זיכרון, בגודל שמתאים לתקציב הזיכרון של iPhone 17 Pro.
שניהם נשאו הקשר של 262K טוקנים, שניהם שמרו על מגדל ראייה קומפקטי של 4 סיביות כך שהמודל נשאר מולטימודלי, ושניהם תמכו בפענוח ספקולטיבי עם מנסח DSpark. ההצגה של Prism ML באותו זמן הייתה שהייצוג בסיביות נמוכות פעל מקצה לקצה — הטמעות, קשב, MLP-ים וראש ה-LM — בלי פתחי מילוט ברמת דיוק גבוהה יותר, ושמבנה ה-1 סיביות היה המודל הראשון בדרגת 27B שרץ על טלפון בכלל. התפוקה המדווחת בגרסת ה-1 סיביות הייתה בסביבות 11 טוקנים לשנייה על iPhone 17 Pro, 87 tok/s על Apple M5 Max, ו-163 tok/s על RTX 5090; הגרסה הטרינארית צוינה ב-58 tok/s על ה-M5 Max וב-134 tok/s על ה-5090.
עלות האיכות דווחה לצד המספרים האלה ולא הוטמנה. במערך של 15 בנצ׳מרקים במצב חשיבה, גרסת הבסיס ברמת דיוק מלאה קיבלה 85.0, גרסת הטרנארי 80.5 — כ-95% — וגרסת ה-1-ביט 76.1, כ-90%. ההידרדרות התרכזה בקריאה לכלים סוכניים, שירדה מ-80.0 ל-66.0 בגרסת ה-1-ביט, ובראייה, שירדה מ-72.6 ל-59.6. מתמטיקה וקידוד החזיקו מעמד טוב בהרבה בשתי הווריאציות.

מה שהדור השני שינה
Ternary Bonsai 2 27B שומר על המתכון ומשנה את הקלטים. הייצוג הטרנרי הוא עדיין {−1, 0, +1} עם סקאלה אחת מסוג FP16 לכל קבוצה של 128 משקלים, כשהוא נארז כעת ל-1.76 סיביות למשקל בקובץ של 5.93 GB, עם חלון הקשר של 262K ואותו מגדל ראייה נפרד — 0.63 GB ב-4-bit במהדורה הזו, נטען רק כאשר מגיעה תמונה.
שני דברים הם באמת חדשים, ושניהם מתוארים כסיבה לכך שנתון השימור השתנה.
הראשון הוא דיוק סלקטיבי. בשונה מגרסת יולי, שהמירה כמעט הכול לייצוג טרנרי, Bonsai 2 מחזיק 26,238,464 פרמטרים בדיוק מלא — 0.0976% ממודל השפה, כ-52 MB ב-bf16, המרוכזים במסלול המצב הרקורנטי של שכבות הקשב הליניארי בתוספת משקולות נרמול. זהו ויתור קטן מבחינת בייטים, ולכאורה ויתור גדול מבחינת התנהגות.
השני הוא בסיס משקלים מסובב. מטריצות המשקל נשמרות לאחר סיבוב Walsh–Hadamard לפי בלוקים בגודל בלוק של 1,024, כאשר ההתמרה המתאימה מוחלת על האקטיבציות בזמן ריצה, מתוך התאוריה שפיזור ערכים חריגים בין קואורדינטות הופך קירוב תלת-רמתי לפחות אובדני. זה אינו דורש אחסון נוסף משום שהסיבוב מקופל לתוך המשקלים, אבל הוא כן נמצא בנתיב החישוב.
ואז יש את השינוי שהוא בכלל לא טכניקה: מודל הבסיס. Qwen3.8-27B הוא עיצוב של קשב היברידי — בערך 75% קשב ליניארי, 25% קשב מלא — בעוד קודמו לא היה כזה. ציוני הקטגוריות שדווחו על ידי Prism ML מראים מה המהלך הזה הניב. ביצוע הוראות עומד על 82.66 עבור Bonsai 2, לעומת 74.53 עבור Qwen3.6-27B, מודל הבסיס שאותו דחס הדור הראשון. יכולות הסקה וידע מגיעות ל-83.95 לעומת 84.71 עבור מודל הבסיס הישן, וקידוד ל-81.58 לעומת 82.57. מודל הבסיס החדש טוב יותר בביצוע הוראות בפער ניכר, ומעט מאחור בשתי קטגוריות אחרות, וזה בדיוק סוג הפרופיל שהופך אחוזי שימור חוצי-דורות ללא מועילים בפני עצמם.
מדוע שני נתוני השימור אינם ניתנים להשוואה
95% ו-98.2% נראים כמו שתי קריאות על סולם אחד. הם לא כאלה, משלוש סיבות שכדאי להבדיל ביניהן היטב לפני שמסיקים שהמתכון השתפר ב-3.2 נקודות.
• המכנים שונים. ה-95% של הדור הראשון נמדדו על מערך של 15 מבחני בנצ'מרק מול Qwen3.6-27B. ה-98.2% של הדור השני מגיעים ממערך של 20 מבחני בנצ'מרק מול Qwen3.8-27B. מערכים שונים, קווי בסיס שונים, תמהילי קושי שונים.
• קווי הבסיס נעו באופן בלתי תלוי. חלק מהרווח בשימור נובע מכך שהמודל הדחוס משתפר בדחיסה, וחלק מכך שמודל הבסיס משתנה בדרכים שמסתברות להיות ידידותיות יותר למשקלים טרינאריים. שום דבר שפורסם לא מפריד בין התרומות האלה.
• השימור הוא יחסי, ולכן הוא יכול לעלות בעוד שהיכולת המוחלטת יורדת בקטגוריה. מודל שמשמר 99% מהורה חלש יותר עדיין יכול לפגר אחרי מודל שמשמר 96% מהורה חזק יותר.
ההשוואה האבסולוטית מספקת מידע רב יותר מההשוואה היחסית, ועל בסיס זה התמונה נקייה יותר. הציון המצטבר של Bonsai 2, 83.9, גבוה מ-83.6 ש-Qwen3.6-27B בדייקנות מלאה השיג בסוללת המבחנים הישנה — כלומר, היורש הדחוס נמצא כעת לפני המודל הלא-דחוס שאותו החליף דור אחד קודם לכן. הגרסה הטרנרית מהדור הראשון קיבלה 80.5 בסוללת המבחנים שלה. שני הנתונים האלה הם של Prism ML, וסוללות המבחנים שונות, ולכן יש לקרוא את הסדר ולא את הספרות העשרוניות.

הווריאנט שלא חזר
זהו החלק בהשוואה שמשנה את החלטת הרכישה, ולא תרשים בנצ'מרק.
אין Bonsai 2 של 1-ביט. מהדורת ספטמבר מגיעה עם בנייה טרנרית, בשתי אריזות — PTQ1_0 ב-1.76 ביטים לכל משקל ו-5.93 GB, ו-PQ2_0 ב-2.16 ביטים לכל משקל ו-7.25 GB — בתוספת קונטיינר MLX עבור Apple Silicon. אין גרסה בינארית של 3.9 GB, ואין הכרזה על גרסה כזו. הנתון של 3.9 GB ברמת טלפון שמופיע בסיקור הנוכחי מתייחס עדיין לדגם מיולי.
ההשלכה המעשית ישירה. אם היעד שלך הוא iPhone או iPad, או כל מכשיר שבו מודל שפה של 5.9 GB בתוספת מגדל ראייה של 0.63 GB בתוספת תקציב הקשר לא נכנס, אז גרסת ה-1-bit מהדור הראשון נשארת האפשרות היחידה במשפחה הזו, והיא תישאר כך עד שיהיה קיים Bonsai 2 עם 1-bit. שדרוג המסלול הטרנרי לא משדרג את המסלול הזה. כל מי שקורא ש"Bonsai 2 טוב יותר" ומוריד מחדש לטלפון יגלה שהקובץ לא נכנס.
אם אתם על מחשב נייד או שולחני, החישוב הוא הפוך: אין סיבה להריץ את הבילד הטרינארי של יולי כשזה של ספטמבר קטן יותר ליחידת איכות, טוב יותר בבנצ'מרקים החשובים, ומציע אותו חלון הקשר של 262K.
מהירות, שבה ממש קשה לדרג את הדורות
תפוקה היא החלק בהשוואה הזו שבו התשובה הכנה היא שהמספרים שפורסמו אינם תומכים בדירוג נקי, וכדאי לומר זאת במקום לבחור את הצמד המחמיא.
המדידות המתוקננות של הדור השני בגודל אצווה 1, כאשר מגדל הראייה אינו נכלל, הן 142.5 tok/s פענוח על RTX 5090 באריזת PQ2_0, 46.8 tok/s על Apple M5 Max, 27.7 על M5 Pro, ו-18.0 על M4 Pro. הדור הראשון ציין 134 tok/s על RTX 5090 ו-58 tok/s על M5 Max עבור מבנה הטרנרי שלו. הנתון של 5090 נע במתינות בכיוון הצפוי. הנתון של M5 Max נע בכיוון ההפוך — מ-58 ל-46.8 — וזה לא מה שצעד דורי של חודשיים אמור להיראות.
שתי הסתייגויות מונעות מכך להיות ממצא. בסיסי המדידה שונים בין המהדורות, ולפחות נתון M5 Max אחד שפורסם עבור הדגם החדש יותר יוחס לבנייה שקדמה לאופטימיזציית הרוטציה. אבל כדאי לסמן זאת כשאלה פתוחה, מפני שהמנגנון שהיה מסביר זאת נמצא בהערות הגרסה: הבסיס המסובב מציב טרנספורם על המסלול הקריטי של כל הטלה בגודל אצווה 1, ופענוח ב-Apple Silicon הוא המשטר שבו זה מזיק ביותר. הטכניקה שקונה איכות עשויה לעלות בתפוקת הפענוח, ובחומרה בעלת זיכרון מאוחד הוויתור הזה הוא החד ביותר.
מכל MLX מוסיף קושי נפרד למשתמשי Apple. זהו פורמט אפיני של 2 סיביות שהבלוק שלו שומר גם סקייל וגם הטיה עבור כל קבוצה של 128 משקלים, אבל משקלים טרנאריים זקוקים רק לסקייל, כך שההטיה היא משקל מת — הבלוק עולה 36 בתים לכל 128 משקלים במקום 34, וקצב האריזה מגיע ל-2.25 סיביות למשקל עם גודל קובץ נמדד של 8.005 GiB. זהו מכל אחר הנושא את אותם ערכים, וזו החבילה שמערך ההדגמה מוריד כברירת מחדל.
הרצת דור כזה או אחר
שני הדורות חולקים אילוץ תפעולי אחד שאף גרסה של המודל הזה לא נמלטה ממנו: אף אחד מהם לא רץ על llama.cpp הסטנדרטי. גרעיני הטרנרי לארכיטקטורה הזו נמצאים בפורק של Prism ML עצמה, llama.cpp הסטנדרטי דוחה את האריזות הנוכחיות כלא מוכרות, וגרוע מכך — הוא יטען את פורמט הטרנרי הישן יותר בלי להתלונן ויפיק שטויות רהוטות, מפני שהוא אינו מחיל את הרוטציה שהמשקולות מניחות. בניית ה-MLX נושאת גרעיני Metal ו-CPU אך ללא נתיב CUDA. לאיזה דור שתבחר, שאלת סביבת ההרצה נענית על ידי ההפצה של Prism ML עצמה או על ידי סביבת הרצה שאימצה את הגרעינים שלה, ולא על ידי מערכת ה-ggml בכללותה.
המקום שבו OrcaRouter משתלב בהחלטה כמו זו הוא רמה אחת למעלה. אף דור של Bonsai אינו מתארח כאן — אלה הורדות שאתם מריצים על החומרה שלכם. מה ששכבת הניתוב מועילה לו הוא הגבול: הבקשות שהמודל המקומי שלכם לא אמור לענות עליהן. הגדירו את מדיניות ההסלמה פעם אחת בהגדרות הניתוב ולא בקוד האפליקציה, כך ששכבה המסופקת מקומית תעביר בקשות ארוכות-הקשר, עתירות-ראייה או אחרות שמחוץ לתחום אל מודל מתארח במקום להיכשל בהן, וכך מנגנון הנפילה לאחור ישרוד בכל דור של Bonsai שיהיה לכם מותקן. אז גם השכבה המקומית וגם זו המתארחת יושבות מאחורי מפתח אחד, והמדיניות נמצאת במקום אחד כשהדור הבא של Bonsai יגיע וגבולות השכבות יזוזו שוב.
מה לעשות עם זה

• אם אתם מריצים את גרסת הבנייה הטרנרית של יולי על מחשב נייד או שולחני — עברו ל-Ternary Bonsai 2 27B. זה מודל טוב יותר עם טביעת רגל בערך זהה, וציוני הקטגוריות שבהן הוא מנצח הם אלה שחשובים לעבודה אג'נטית ולעבודה של ביצוע הוראות.
• אם אתם מריצים על טלפון את בניית ה-1-bit של יולי — הישארו. אין לה יורש, ובניית ה-ternary של 5.93 GB אינה תחליף ישיר לזו של 3.9 GB.
• אם אתה בוחן את המשפחה בפעם הראשונה — החלט קודם על טביעת הרגל, ואחר כך על הדור. הווריאנט שאתה צריך קובע באיזו מהדורה אתה קונה, וסדר זה הוא ההפוך מכפי שהשדרוג הזה מתואר בדרך כלל.
• אם אתם בוחרים על סמך בנצ'מרקים — התייחסו ל-95% ול-98.2% כאל שתי מדידות שונות ולא כאל שתי נקודות על קו, והתייחסו לכל נתון בשניהם כאל נתון של הספק עצמו עד שתופיע הערכה בלתי תלויה של מודל ספטמבר. ההערכה הזו היא הדבר שכדאי לעקוב אחריו, כי היא הראשונה שתוכל להשוות בין שני הדורות על בסיס משותף.
