כרטיס כותרת שנוצר עם הכיתוב 'Ternary Bonsai 2 27B vs Qwen3.8-27B' וכתובית משנה 'אותה רשת בשני דיוקים', מעל שלושה כרטיסים עם הכיתוב 'גודל קובץ: 5.93 GB מול 53.81 GB', 'צמצום: פי 9.05' ו'הקשר: 262K טוקנים, בשניהם', עם כותרת תחתונה עם הכיתוב 'שימור של 98.2% הוא דיווח ספק ולא שוחזר.' הלוגו של OrcaRouter נמצא בפינה הימנית התחתונה.
Guides & Insights

Ternary Bonsai 2 27B לעומת Qwen3.8-27B: מה 47.9 ג'יגה-בייט של דיוק בעצם קונים

מחבר

Rowan Sterling

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

Ternary Bonsai 2 27B ו-Qwen3.8-27B הם אותו מודל בשני עולמות מספריים. הם חולקים ארכיטקטורה, טוקנייזר, שושלת אימון וחלון הקשר של 262,144 טוקנים. מה שמפריד ביניהם הוא האופן שבו המשקולות נכתבות: Qwen3.8-27B מאחסן כל אחת מהן כמספר נקודה צפה של 16 סיביות ותופס 53.81 GB בצורת הייחוס FP16 שלו, בעוד Ternary Bonsai 2 27B מאחסן כל אחת מהן כאחד משלושה סמלים ותופס 5.93 GB. Prism ML הכריזה על הבנייה הדחוסה ב-17 בספטמבר 2026 והעלתה אותה ל-Hugging Face תחת Apache 2.0; משקולות Qwen3.8-27B המקוריות פורסמו ב-13 באוגוסט 2026, אף הן תחת Apache 2.0.

ההשוואה שמשנה היא לא איזה מהם טוב יותר. היא מה שה-47.9 GB החסרים עולים לך, והתשובה הכנה צרה ומדויקת יותר ממה ששני המחנות יגידו לך. Prism ML מדווחת שהבנייה שלה שומרת על 98.2% מהממוצע של המודל ברמת דיוק מלאה על פני מערך של 20 מבחנים — 83.9 מול 85.4. המספר הזה הוא של המוכר עצמו, נמדד על הרנס של המוכר עצמו, ויום אחד לאחר ההשחרור אף אחד מחוץ ל-Prism ML לא שחזר אותו. הממוצע המצטבר גם מסתיר את החלק שבאמת צריך לעניין אותך, כי 1.8 הנקודות לא מתפלגות באופן שווה. בשני המבחנים שמעמידים במבחן הנדסת תוכנה מתמשכת, הפער הוא לא 1.8% — הוא קרוב יותר ל-25%.

אותה רשת, מנוסחת אחרת

התחל במה שהדחיסה אינה נוגעת בו, משום שזה הסיבה שההשוואה מעניינת בכלל. מספר השכבות, הגודל הנסתר, אוצר המילים, דפוס הקשב ומגדל הראייה הם של מודל הבסיס. Qwen3.8-27B הוא עיצוב קשב היברידי: 48 שכבות קשב לינאריות Gated DeltaNet משולבות לסירוגין עם 16 שכבות קשב מלא, חלוקה של בערך 3:1, על פני 64 שכבות עם גודל נסתר של 5,120 ואוצר מילים של 248,320 טוקנים. עמוד השדרה הזה, שהוא בעיקרו לינארי, הוא מה שהופך הקשר של 262K לאפשרי מבחינת עלות מלכתחילה, וזו התכונה ש-Bonsai יורש ללא שינוי.

מה ששינתה Prism ML הוא ייצוג המטריצות של מודל השפה, בתוספת הקרנלים הדרושים לביצוע חישוב עליהן. מסמך הווייט פייפר שלה מחלק את 27.36B הפרמטרים ל-24.35B בעמוד השדרה הלשוני הפרוסים על פני 64 בלוקים, 2.54B בהטמעה ובראש ה-LM, ו-0.47B במגדל חזותי בן 27 בלוקים. המגדל החזותי מסופק כקובץ mmproj נפרד של 4-bit בגודל של כ-0.63 GB, והוא נטען רק כאשר מגיעה תמונה בפועל, כך שפריסה מבוססת טקסט בלבד לעולם אינה משלמת עליו.

תוצאה מעשית של התכנון הכמעט־לינארי הזה ראויה לציון לפני כל דיון בנצ'מרקים. מכיוון שהארכיטקטורה אינה שנאי קונבנציונלי, הקרנלים של הביטים הנמוכים נאלצו להיכתב עבורה במיוחד. llama.cpp הסטנדרטי דוחה את שתי האריזות של Prism ML כסוגים לא מוכרים — ובעייתי יותר, טוען פורמט טרנרי ישן יותר בלי להתלונן ומייצר שטויות רהוטות, כי אין לו סיבוב תואם שמוחל על האקטיבציות. אם תריצו את המודל הזה על בינארי שלא יודע עליו, לא תקבלו שגיאה. תקבלו פלט בטוח בעצמו ומוטעה.

ההשוואה, קטגוריה אחר קטגוריה

הנה פירוט של 20 מדדים מטעם הספק, כאשר בסיס הדיוק המלא משמש כאסמכתא. כל נתון ברשימה זו הוא של Prism ML; אף אחד מהם לא אומת באופן עצמאי.

• מתמטיקה — 96.57 עבור Ternary Bonsai 2 27B לעומת 97.06 עבור Qwen3.8-27B. למעשה באותה רמה.

• קידוד — 81.58 לעומת 82.17. גם צמוד, וגם הקטגוריה שכל הטכניקה נדונה לגביה.

• ביצוע הוראות — 82.66 לעומת 81.25. המודל הדחוס מוביל כאן, שזו השורה היחידה בטבלה שבאמת מפתיעה.

• ידע והסקה — 83.95 לעומת 86.66. ירידה של 2.7 נקודות, והתורם הגדול ביותר ל-1.8 הנקודות החסרות.

• סוכניות וקריאה לכלים — 77.57 לעומת 79.74, הכולל τ2-Bench ב-80.22 ו-BFCL v3 ב-74.92.

• ראייה — 78.59 לעומת 81.64, האובדן הגדול ביותר בקטגוריה. שים לב שמגדל הראייה עצמו אינו החלק הדחוס; מודל השפה שקורא את הפלטים שלו הוא החלק הדחוס.

A generated two-column scoreboard titled 'Ternary Bonsai 2 27B vs Qwen3.8-27B — the scoreboard'. The Ternary Bonsai 2 27B column reads: bits per weight 1.76 packed, file size 5.93 GB, 20-benchmark average 83.9, math 96.57, instruction following 82.66, Terminal-Bench 2.1 52.8. The Qwen3.8-27B FP16 column reads: bits per weight 16.0, file size 53.81 GB, 20-benchmark average 85.4, math 97.06, instruction following 81.25, Terminal-Bench 2.1 69.7. Footer reads 'Both columns are one vendor suite; the compressed figures are unaudited.' The OrcaRouter logo sits in the bottom-right.

קרא את הצורה ולא את הממוצע, ותתגלה תמונה ברורה יותר. דחיסה היא כמעט בחינם במתמטיקה, בתכנות ובביצוע הוראות, והיא יקרה בידע ובראייה. זה ההפך מהחוכמה העממית על מודלים בעלי סיביות נמוכה, שלפיה ידע שטחי שורד וההסקה מתמוטטת. כאן דווקא הידע נשחק וההסקה מחזיקה מעמד.

איפה 1.8 הנקודות בעצם נמצאות

הנתון המצרפי הוא ממוצע על פני עשרים בנצ'מרקים, וממוצעים הם המקום שבו פערים מסתתרים. שלוף את התוצאות הבודדות החוצה ושתיים מהן גרועות בהרבה ממה שהממוצע מרמז.

• Terminal-Bench 2.1 — 52.8 עבור בניית ה-ternary לעומת 69.7 עבור דיוק מלא

• SWE-bench Verified — 60.8 לעומת 80.6

שניהם מגיעים לכמעט שלושה רבעים מהציון במלוא הדיוק. לעומת זאת, AIME26 מגיע ל-95.83, LiveCodeBench ל-90.07, ו-AA-LCR ל-77.0 — במרחק נקודה אחת מהמודל הלא דחוס. זו הפעם הראשונה שמשפחת Bonsai בכלל מוערכת על Terminal-Bench, ו-Prism ML מצהירה במפורש בחומרים שלה שיכולת הנדסת התוכנה לטווח ארוך שהבטיחה בדור הראשון מסופקת חלקית, לא במלואה.

אז השאלה המעשית היא לא "האם זה משמר 98.2%" אלא "מהי עומס העבודה שלי". אם אתה מריץ סוכן קידוד שמחזיק תוכנית לאורך עשרות קריאות לכלים ועורך קבצים במשך דקות, אתה בקטגוריה עם פער של 25%, והמספר המצטבר מטעה באופן פעיל. אם אתה עוסק במתמטיקה, יצירת קוד בתור בודד, חילוץ, סיווג או צ'אט, אתה בקטגוריות שבהן הפער מתאפס. הדבר השימושי ביותר בטבלה של הספק עצמו הוא שהיא מאפשרת לך לעשות את ההבחנה הזו במקום לנחש.

מה שכל אחד מהם באמת צריך כדי לפעול

סיפור החומרה פחות סימטרי מכפי שיחס הגודל מרמז. מודל FP16 בגודל 53.81 GB לא נכנס כלל במחשב נייד עם 16 GB, מה שהופך את ההשוואה מ"מהיר יותר לעומת איטי יותר" ל"אפשרי לעומת בלתי אפשרי". המדידות הסטנדרטיות של Prism ML בגודל אצווה 1, ללא מגדל הראייה:

• NVIDIA RTX 5090 — פענוח של 142.5 tok/s על אריזת PQ2_0, ב-0.582 mWh לכל טוקן

• Apple M5 Max — 46.8 tok/s פענוח, עם עיבוד פרומפט של כ-765 tok/s

• Apple M5 Pro — 27.7 tok/s פענוח

• Apple M4 Pro — 18.0 tok/s פענוח, כאשר עיבוד פרומפט בסמוך ל-125 tok/s הופך לאילוץ המחייב בהקשרים ארוכים מאוד

ההסתייגות החשובה היא ששום דבר מזה אינו קובץ בינארי יחיד. אריזת PTQ1_0 נותנת לך 5.93 GB ב-1.76 סיביות למשקל; PQ2_0 עולה 7.25 GB ב-2.16 סיביות למשקל וקונה מהירות פענוח בחומרה שבה תפוקת ההוראות, ולא רוחב הפס של הזיכרון, היא המגבלה. בניית ה-MLX ל-Apple Silicon היא ארטיפקט שלישי עם חשבונאות משל עצמו — מיכל אפיני של 2 סיביות שמאחסן הטיה שהמשקלים התלת-ערכיים אינם זקוקים לה, ומגיע ל-2.25 סיביות למשקל ול-8.005 GiB בדיסק, עם קרנלי Metal ו-CPU אך ללא נתיב CUDA. "זה רץ ב-5.9 GB" נכון בדיוק לגבי אחד מהקבצים האלה, בדיוק בסביבת ההרצה הנכונה.

השוואת העלויות, במסגור כן

ישנן שתי דרכים לשלם עבור Qwen3.8-27B ורק דרך אחת לשלם עבור האח הדחוס שלה. Ternary Bonsai 2 27B הוא הורדה: Apache 2.0, החומרה שלך, בלי מונה. Qwen3.8-27B הוא גם הורדה וגם שירות מתארח, ואם תבחרו במסלול המתארח, הנתון הרלוונטי הוא זה שבעמוד הדגם — 0.33 דולר למיליון טוקני קלט ו-2.40 דולר למיליון טוקני פלט, מוגש מהתשתית של OrcaRouter עצמה ולא נמכר מחדש משל מישהו אחר.

זה המקום שבו OrcaRouter זוכה למקום בהשוואה הזו ולא להערת שוליים. הגרסה המנותבת של Qwen3.8-27B נושאת את אותו חלון הקשר של 262K, מקבלת טקסט, תמונות וווידאו, וחושפת את בקרת מאמץ החשיבה שהמודל מגיע איתה. היא יושבת מאחורי אותו מפתח כמו יותר מ-200 מודלים אחרים, בלי תוספת מעל מחיר המחירון של הספק, וזה חשוב יותר ממה שזה נשמע: מכיוון שמחיר המחירון מועבר הלאה ולא נמכר מחדש, שינוי מחיר של ספק מופיע כאן באותו יום במקום בחידוש החוזה הבא. עבור צוות שרוצה את הבסיס בדיוק מלא כשכבת ההסלמה מעל Bonsai מקומי, זו נקודת קצה אחת ומפתח אחד במקום שני קשרי ספק.

A screenshot of Prism ML's launch post for Bonsai 2 27B, dated September 17 2026 and titled 'PrismML Launches Bonsai 2 27B, Its Most Capable Model Yet', showing the opening paragraphs stating the model is based on Qwen3.8 27B, reduces memory footprint by more than 9x at 5.9 GB, and that while the original Ternary Bonsai 27B retained 95% of its full-precision counterpart's aggregate benchmark performance the new model retains over 98%.

איזה מהם לבחור

ההחלטה היא בעיקר בשאלה היכן העבודה מתבצעת, ולא בשאלה איזה מודל טוב יותר, כי ברוב המשימות מדובר באותו מודל.

• בחרו ב‑Qwen3.8-27B בדיוק מלא כאשר המשימה היא ארוכת‑טווח וסוכנית, כאשר אתם מעריכים או מכווננים (fine-tuning), כאשר אתם זקוקים להקשר YaRN של מיליון טוקנים, או כאשר דיוק הראייה הוא קריטי. מספרי Terminal-Bench ו‑SWE-bench הם הסיבה לכך.

• בחרו ב-Ternary Bonsai 2 27B כאשר העבודה צריכה להתבצע על חומרה שבבעלותכם, כאשר החלופה היא לא להריץ מודל 27B בכלל, או כאשר עומס העבודה הוא מתמטיקה, קידוד, חילוץ או הסקה ללא כלים, שבהם הקטגוריות שוות.

• אל תבחרו לפי הציון המצטבר. 83.9 ו־85.4 קרובים מספיק לכך שהחלפת בנצ׳מרק אחת עשויה לשנות את סדרם, ורק אחד משני המספרים מאומת באופן עצמאי.

מה שבאמת חדש כאן הוא לא ש�-מודל 27B נכנס לשישה ג'יגה-בייטים — הדור הראשון של Bonsai עשה זאת ביולי. אלא שביצוע ההוראות יצא טוב יותר מאשר אצל מודל האב, ושמתמטיקה ותכנות יצאו באותה רמה, וזו טענה שונה מ"קטן לגודלו". האם זה מחזיק בעומס העבודה שלך הוא בדיוק מה שגיל של יום אחד לא יכול לומר לך, וההערכה הבלתי תלויה הראשונה של המודל הזה היא התוצאה ששווה להמתין לה.

A screenshot of OrcaRouter's model page for Qwen3.8-27B, showing the qwen/qwen3.8-27b identifier attributed to Qwen and dated 2026-08-13, a 262K token context with text, image and video input and text output, input pricing of $0.33 and output pricing of $2.40 per million tokens, a p50 time to first token of 4.80 seconds over seven days, and the description that the model is self-hosted on OrcaRouter's own infrastructure.

אם ברצונך להריץ את ההשוואה על הפרומפטים שלך ולא על חבילת בנצ׳מרק, המסלול המהיר ביותר הוא לקרוא ל-Qwen3.8-27B המתארח דרך endpoint אחד ולהריץ את הבילד הטרנרי באופן מקומי, ואז להשוות את הפלטים במשימות שבאמת יש לך. זו עבודה של בוקר אחד והיא תספר לך יותר על 1.8 הנקודות מאשר כל טבלה מפורסמת.