כרטיס כותרת שנוצר עם הכיתוב 'Ternary Bonsai 2 27B vs Qwen3.8-27B IQ2_XXS GGUF' וכתובית המשנה 'פחות ביטים, ציונים טובים יותר', מעל שלושה כרטיסים עם הכיתוב 'ביטים לכל משקל: 1.76 לעומת 2.2', 'גודל: 5.93 GB לעומת 7.3 GB' ו'ממוצע חבילת הספק: 83.9 לעומת 75.2', עם כותרת תחתונה עם הכיתוב 'נתוני Bonsai לפי דיווח הספק; נתוני IQ2_XXS לפי בדיקות הספק והקהילה.' הלוגו של OrcaRouter נמצא בפינה הימנית התחתונה.
Engineering & Research

Ternary Bonsai 2 27B לעומת Qwen3.8-27B IQ2_XXS GGUF: פחות ביטים, ציונים טובים יותר

מחבר

Rowan Sterling

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

Ternary Bonsai 2 27B קטן יותר מבניית ה-GGUF IQ2_XXS של Qwen3.8-27B, ולפי המספרים שפורסמו איתו, גם טוב יותר — דבר שלא אמור להיות אפשרי אם כל מה שהפריד ביניהם היה תקציב סיביות. בניית Bonsai נושאת 1.76 סיביות למשקל בקובץ של 5.93 GB. הכימות המקובל של 2-סיביות של אותו מודל בסיס נושא בערך 2.2 סיביות למשקל בקובץ של כ-7.3 GB. Prism ML, שהכריזה על הבנייה הטרנרית ב-17 בספטמבר 2026, מדווחת על ממוצע של 20 בנצ'מרקים של 83.9 עבור המודל שלה לעומת 75.2 עבור נקודת ההשוואה IQ2_XXS — פער של 8.7 נקודות לטובת המודל שמשתמש בפחות סיביות.

ההיפוך הזה הוא כל הסיפור, והוא אינו טריק. שני הקבצים נוצרים בתהליכים שונים בשלבים שונים בחיי המודל, וההבדל בין התהליכים האלה שווה יותר מההבדל ברוחב הסיביות. זו גם ההשוואה שבה העצה הפופולרית — "רק קחו קוונטיזציה של 2 סיביות, הם בסדר עכשיו" — נתקלת בדוגמה הנגדית הברורה ביותר שלה, ושבה לדוגמה הנגדית יש מדידה בלתי תלויה מאחוריה ולא מילה של ספק.

הפרדוקס הוא המנגנון

IQ2_XXS הוא פורמט כימות לאחר אימון. המודל מאומן עד התכנסות בדיוק מלא, ורק לאחר מכן המשקולות שלו מעוגלות לייצוג ברוחב סיביות נמוך שנבחר על ידי הליך התאמה. המודל אינו מקבל הזדמנות להסתגל; הוא נמדד בדיעבד ומקורב. משפחת ה-i-quant משפרת את ה-k-quants הישנים יותר באמצעות מטריצת חשיבות — מעבר כיול שקובע לאילו משקולות מגיע יותר מהדיוק הזמין — אך סדר הפעולות הבסיסי נותר בעינו. לאמן, ואז לדחוס.

Bonsai הופך את הסדר הזה. התיאור של Prism ML לשיטה שלה הוא שהיא נטשה לחלוטין קוונטיזציה לאחר אימון ואכפה את האילוץ הטרנרי במהלך האימון: המעבר קדימה מחשב עם משקלים המוגבלים ל-{−1, 0, +1}, בעוד שהמעבר אחורה עדיין נושא גרדיאנטים בדיוק מלא. המודל מבלה את האימון שלו בלימוד ייצוגים ששורדים את האילוץ, במקום שהאילוץ ייכפה על ייצוגים שמעולם לא ציפו לו. האלגוריתם מתואר כקניין רוחני קנייני, אך צורתו תהיה מוכרת לכל מי שקרא את קו העבודות של BitNet.

שני עידונים יושבים מעל, ושניהם ניכרים בחשבון. הראשון הוא דיוק סלקטיבי: 26.2 מיליון פרמטרים — כ-0.098% מהמודל, בערך 52 MB ב-bf16, בעיקר נתיב המצב הנשנה של שכבות הקשב הליניארי בתוספת משקולות נרמול — נשמרים בדיוק מלא במקום לעבור טרנריזציה. השני הוא סיבוב לפי בלוקים. כל מטריצת משקולות עוברת טרנספורמציה באמצעות סיבוב Walsh–Hadamard בגודל בלוק של 1,024 לפני בחירת הערכים הטרנאריים, מה שמפזר ערכים חריגים על פני הקואורדינטות והופך קירוב תלת-רמתי להרסני פחות. הסיבוב מקופל לתוך המשקולות המאוחסנות, כך שהוא אינו עולה בתוספת בייטים; במקום זאת, הטרנספורמציה המתאימה מוחלת על האקטיבציות בזמן ריצה.

לפרט האחרון הזה יש תוצאה שאתה נתקל בה כבר בניסיון הראשון להריץ את הדבר, והיא המחיר האמיתי של הגישה.

איזה IQ2_XXS אתה מתכוון, ומה הוא משיג בפועל?

לפני השוואת איכות, תיקון שרוב הסיקור מפספס: "IQ2_XXS" אינו ארטיפקט אחד. זהו סוג כימות של llama.cpp, ואותו סוג שמיושם על ידי שרשראות כלים שונות על אותו מודל בסיס מייצר קבצים שנבדלים באופן משמעותי בגודל ובאופן ניכר באיכות.

העדות הציבורית הברורה ביותר היא השוואה בלתי תלויה שפורסמה ב-15 באוגוסט 2026 על ידי משתמש שבדק האם מודל Qwen3.8-27B בתת-2-ביט היה שווה בכלל לבנייה. הבדיקה היא מדידת KL-divergence על wikitext-2, 100 מקטעים בהקשר של 512, מול参考 מקומי Q8_0 עם perplexity של 6.7500, כאשר כל מועמד משתמש באותה מטריצת חשיבות, קורפוס, baseline ובנייה של llama.cpp באותו מושב. התוצאות:

• unsloth UD-IQ2_XXS — 8.39 GiB, פרפלקסיטי 7.6528, KLD ממוצע 0.146, KLD חציוני 0.076, התאמת top-1 82.98%

• bartowski IQ2_XXS — 8.75 GiB, פרפלקסיה 8.5352, KLD ממוצע 0.301, KLD חציוני 0.162, התאמת top-1 76.53%

הווריאנט הדינמי הוא 0.36 GiB קטן יותר מהווריאנט הסטטי, וטוב פי כ-2.1 ב-KLD הממוצע — ב-1.13x מרמת הפרפלקסיה של קו הבסיס. שני קבצים הנושאים את אותה תווית, מופרדים בפקטור של שניים במדד שמודד עד כמה סטתה התפלגות הפלט. אותו מבחן מצא שכל מועמד מתחת ל-2 ביטים גרוע משתי אפשרויות ה-IQ2 שפורסמו, ולכן הרצפה המעשית עבור מודל בסיס זה נמצאת ב-IQ2 ולא מתחתיו.

A screenshot of a Hugging Face community discussion titled 'Independent KLD benchmark: UD-IQ2_XXS beats bartowski IQ2_XXS on both size and quality', opened 15 August 2026, describing a wikitext-2 test of 100 chunks at 512 context against a locally built Q8_0 reference with perplexity 6.7500. Its table lists unsloth UD-IQ2_XXS at 8.39 GiB with perplexity 7.6528, mean KLD 0.146, median KLD 0.076 and 82.98% top-1 agreement; bartowski IQ2_XXS at 8.75 GiB with perplexity 8.5352, mean KLD 0.301, median 0.162 and 76.53%; stock IQ1_M at 7.33 GiB with mean KLD 0.659; and stock IQ1_S at 6.88 GiB with mean KLD 0.896.

זה משנה להשוואה מכיוון שזה משנה למה מתייחס "ה-build של 7.3 GB בשם IQ2_XXS". הנתון של Prism ML מגיע מקוונטיזציה עצמית של מודל הבסיס ב-2.2 ביטים לכל משקל. build דינמי של unsloth מאותה משפחה נמדד ב-8.39 GiB. build של bartowski נמדד ב-8.75 GiB. פער הגודל בין Bonsai ל-"IQ2_XXS" הוא אפוא בין 1.4x ל-1.5x, תלוי לאיזה build אתה מתכוון — גדול מ-1.23x שהכותרת מרמזת עליו, והכול לפני שהשוואת האיכות בכלל מתחילה.

היכן נשברת הבנייה שלאחר האימון, ומדוע קל לפספס אותה

פער מצטבר של 8.7 נקודות הוא הדרך הכי פחות אינפורמטיבית לתאר את ההבדל, מכיוון שההידרדרות בבנייה של IQ2_XXS אינה אחידה. היא סלקטיבית, והדפוס הוא הפוך ממה שרוב האנשים היו חוזים.

• MMLU-Redux — הבילד שלאחר-האימון מחזיק מעמד בכבוד, בטווח הבינוני-גבוה של שנות ה-80

• GPQA Diamond — בסביבות 65.5, לעומת 85.76 לבנייה הטרינרית

• AIME26 — בטווח של 57.5 עד 78.6, בהתאם ל-build, לעומת 95.83 עבור ה-build הטרנרי

• LiveCodeBench — בטווח של 56.4 עד 70.05, לעומת 90.07 עבור הבילד הטרנרי

הנתונים המדויקים של IQ2 נעים בין הסוויטות של Prism ML לבין מדידות הקהילה, והטווחים שלמעלה משתרעים על פני שניהם, אבל הצורה עקבית בכל מקור: ידע שטחי שורד, וכל דבר שדורש שרשרת היסק מתמשכת מתדרדר בחדות. זה בדיוק מצב הכשל שבדיקה מזדמנת לא תגלה. בקשו מבילד 2-bit לסכם מסמך או לענות על שאלה עובדתית, והוא מתפקד כמו מודל גדול בהרבה. בקשו ממנו להחזיק גזירה רבת-שלבים או להפיק קוד לא טריוויאלי, והקריסה פתאומית ולא הדרגתית. לכן "זה הרגיש בסדר כשניסיתי את זה" אינו עדות על מודל מכומת — הוא עדות על הפרומפטים שבמקרה ניסית.

גרסת הטרנארי לא מציגה את הקריסה הזו באותם בנצ'מרקים. Prism ML מדווחת על AIME26 בתוצאה 95.83 לעומת 94.58 בבסיס הדיוק המלא שלה, ועל LiveCodeBench בתוצאה 90.07 לעומת 90.05 — למעשה באותה רמה, וזו הטענה השימושית ביותר בהודעה, מפני שהיא אומרת שאילוץ זמן האימון השיג את מה שהאילוץ שאחרי האימון מאבד.

הטיעון הנגדי, שהוא ממשי ושאותו טבלת האיכות אינה לוכדת

כל מה שלמעלה מעדיף את הבנייה הטרינארית בכל הנוגע לאיכות לכל בית. יש ממד אחד שבו ה-GGUF הרגיל מנצח לחלוטין, והוא לא ממד קטן: הוא פועל על התוכנה שכבר יש לך.

הבנייה IQ2_XXS של Qwen3.8-27B היא תוצר סטנדרטי של llama.cpp. היא נטענת ב-llama.cpp, Ollama, LM Studio, Jan, ובכל דבר אחר שמתקשר עם ggml, בכל פלטפורמה ש-ggml תומך בה, בלי צורך בפורק ובלי קרנלים מיוחדים. מטריצת החשיבות שלה יכולה להיבנות מחדש או להיות מוחלפת. היא מתנהגת כמו כל מודל מכומת אחר שיש לך בדיסק.

Ternary Bonsai 2 27B לא. הקרנלים הטרנאריים של הקשב ההיברידי של הארכיטקטורה הזו נמצאים בפורק ה-llama.cpp של Prism ML עצמה. llama.cpp הסטנדרטי דוחה את PTQ1_0 ו-PQ2_0 כסוגים לא מזוהים — ואין לו מושג מה לעשות עם הבסיס המסובב שאותן חבילות מניחות. גרסת ה-MLX עבור Apple Silicon כוללת קרנלים של Metal ו-CPU אך אין בה מסלול CUDA, כך שעל מחשב NVIDIA היא נופלת חזרה למעבר קדימה ב-CPU שעשוי לקחת דקות. Prism ML אמנם מפרטת אינטגרציה עם כמה סביבות הרצה, אבל הנקודה הבסיסית נשארת בעינה: שמישותו של המודל הזה מוגבלת בשאלה אם לימדו את סביבת ההרצה שבחרת להכיר אותו.

זו העסקה הכנה. אתה בוחר בין בנייה שגדולה פי 1.4, גרועה באופן מדיד בדיוק במשימות שבגללן סביר להניח שאתה רוצה מודל 27B, וניתנת להרצה אוניברסאלית — לבין בנייה שקטנה יותר וטובה יותר, על אקוסיסטם שכרגע מסתכם בפורק של מעבדה אחת בתוספת אותן סביבות הרצה שאימצו אותו.

A screenshot of Prism ML's launch post for Bonsai 2 27B dated September 17 2026, showing the headline 'PrismML Launches Bonsai 2 27B, Its Most Capable Model Yet' and the paragraphs stating the model is based on Qwen3.8 27B, reduces memory footprint by more than 9x at 5.9 GB, and that the original Ternary Bonsai 27B retained 95% of its full-precision counterpart's aggregate benchmark performance while the new model retains over 98%.

מה דרוש כדי להריץ כל אחד מהם

חשבון הזיכרון צמוד יותר ממה שגדלי הקבצים מרמזים, כי הקבצים הם לא הדבר היחיד ב-VRAM.

• בנייה של IQ2_XXS — 8.39 עד 8.75 GiB של משקלים, ומשאירה בערך 7.5 GB פנויים בכרטיס של 16 GB עבור הקשר ומודלי טיוטה. הבדיקה הבלתי־תלויה שלעיל מציינת במפורש שבנייה של 8.39 GiB כבר כוללת מקום למודל טיוטה של 2.1 GB לצדה.

• Ternary Bonsai 2 27B — 5.93 GB עבור מודל השפה PTQ1_0, בתוספת מגדל הראייה בנפח 0.63 GB אם אתה משתמש בתמונות בכלל, ובנוסף להקשר. אריזת PQ2_0 של Prism ML עולה 7.25 GB והיא האפשרות המהירה יותר בחומרה המוגבלת בתפוקת פקודות ולא ברוחב פס.

בכל הנוגע למהירות, נתוני ה-ternary המדווחים הם 142.5 tok/s פענוח על RTX 5090 ו-46.8 tok/s על Apple M5 Max; דיווחים מצד שלישי על ה-build של IQ2 דלילים יותר, עם מדידת Vulkan על שני כרטיסי Radeon בסביבות 3.8 tok/s יצירה, אם כי המספר הזה אומר יותר על ה-backend המסוים הזה מאשר על הכימות. התייחסו לנתוני התפוקה משני הצדדים כספציפיים מאוד לחומרה.

היכן OrcaRouter מתאים, והיכן לא

אף אחד מהקבצים האלה אינו משהו שראוטר מגיש. הם ארטיפקטים מקומיים, וההצגה הכנה היא ש-OrcaRouter לא מארח אף אחד מהם — זו השוואה לגבי מה שרץ על החומרה שלך. מה שכן נמצא בצד שלנו הוא המודל ששניהם נגזרו ממנו. Qwen3.8-27B ברמת דיוק מלאה זמין דרך התשתית של OrcaRouter עצמו במחיר של $0.33 למיליון טוקני קלט ו-$2.40 למיליון טוקני פלט, כאשר חלון ההקשר המקורי של המודל בגודל 262K ובקרת מאמץ החשיבה שלו בדרגות נמוך/בינוני/גבוה נשמרים ללא שינוי.

זה יוצר מערך היברידי שכדאי להיות קונקרטיים לגביו. הריצו את הבנייה הדחוסה באופן מקומי עבור המשימות שהיא טובה בהן, ונתבו את הבקשה המזדמנת שזקוקה לדיוק מלא למודל הבסיס המתארח דרך אותו מפתח — בלי חוזה ספק שני, בלי שינוי בקוד, כי שני הצדדים מדברים באותו API. אם הבנייה המקומית מתבררת כלא מתאימה לעומס עבודה, הבקשה שנכשלת יכולה לעבור failover באופן אוטומטי במקום להיות מוחזרת כשגיאה, וזו דרך זולה יותר לגלות שקוונטיזציה אינה מתאימה מאשר לגלות זאת בייצור.

הגרסה הקצרה

• באיכות שפורסמה לכל בייט, הבילד הטרינארי מנצח בבירור, והניצחון מתרכז בהיסק ובקוד — הקטגוריות שבהן הבילד שאחרי האימון מתדרדר ביותר.

• בכל הנוגע לניידות, בניית IQ2_XXS מנצחת בבירור באותה מידה. סביבות הרצה סטנדרטיות בכל מקום, בלי פורק, בלי קרנלים מיוחדים, בלי מצב כשל של זבל שקט.

• ההשוואה אינה "1.76 סיביות מול 2.2 סיביות". היא "ייצוג שנבחר במהלך האימון לעומת ייצוג שהותאם בדיעבד", וההפרש של 0.44 סיביות הוא שגיאת עיגול בהשוואה לכך.

• כל נתון איכות עבור ה-build הטרנרי במאמר הזה הוא מדידה של Prism ML עצמה על חבילת בדיקות ש-Prism ML בחרה. תוצאות ה-KLD עבור ה-buildים של IQ2 הן בלתי תלויות, בהרצה בודדת, וספציפיות למודל בסיס אחד ולמערך בדיקות אחד; הן הראיות החזקות ביותר מגורם שלישי בהשוואה הזו, והן לא אומרות דבר על Bonsai.

הפער ייסגר גם מהכיוון השני, וכנראה בקרוב. אם הקרנלים הטרנריים ייכנסו אפסטרים ב-llama.cpp, ההתנגדות הרצינית היחידה ל-Bonsai תתפוגג והבחירה תהפוך לפשוטה. עד אז, גרסת ה-IQ2_XXS ממשיכה להחזיק ביתרון אמיתי שאין לו שום קשר למידת הטוב שלה.

A screenshot of OrcaRouter's model page for Qwen3.8-27B, showing the qwen/qwen3.8-27b identifier attributed to Qwen and dated 2026-08-13, a 262K token context with text, image and video input and text output, input pricing of $0.33 and output pricing of $2.40 per million tokens, a p50 time to first token of 4.80 seconds over seven days, and a description stating the model is self-hosted on OrcaRouter's own infrastructure.

אם אתם מחליטים השבוע, המבחן שיכריע את העניין לוקח אחר צהריים: קחו עשרים פרומפטים מעומס העבודה שלכם שדורשים יותר משלב הסקה אחד, הריצו את שתי הגרסאות, ותדרגו את התשובות באופן עיוור. הטבלאות המפורסמות אומרות לכם היכן להסתכל. הן לא יכולות לומר לכם אם העבודה שלכם נמצאת שם.