
Ternary Bonsai 2 27B לעומת Qwen3.8-27B: מה 47.9 ג'יגה-בייט של דיוק בעצם קונים
- OrcaחדשOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 לכל 1M טוקנים
- orcaחדשOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים
- deepseekחדשDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- openaiחדשOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- googleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- anthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236אינטליגנציה69כתיבת קוד
- grokSpaceXAI: Grok 4.62026-08-1244אינטליגנציה77כתיבת קוד
- metaMeta: Muse Spark 1.22026-08-0540אינטליגנציה72כתיבת קוד
- qwenQwen: Qwen3.8 Max2026-08-0345אינטליגנציה76כתיבת קוד
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135אינטליגנציה69כתיבת קוד
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Ternary Bonsai 2 27B ו-Qwen3.8-27B הם אותו מודל בשני עולמות מספריים. הם חולקים ארכיטקטורה, טוקנייזר, שושלת אימון וחלון הקשר של 262,144 טוקנים. מה שמפריד ביניהם הוא האופן שבו המשקולות נכתבות: Qwen3.8-27B מאחסן כל אחת מהן כמספר נקודה צפה של 16 סיביות ותופס 53.81 GB בצורת הייחוס FP16 שלו, בעוד Ternary Bonsai 2 27B מאחסן כל אחת מהן כאחד משלושה סמלים ותופס 5.93 GB. Prism ML הכריזה על הבנייה הדחוסה ב-17 בספטמבר 2026 והעלתה אותה ל-Hugging Face תחת Apache 2.0; משקולות Qwen3.8-27B המקוריות פורסמו ב-13 באוגוסט 2026, אף הן תחת Apache 2.0.
ההשוואה שמשנה היא לא איזה מהם טוב יותר. היא מה שה-47.9 GB החסרים עולים לך, והתשובה הכנה צרה ומדויקת יותר ממה ששני המחנות יגידו לך. Prism ML מדווחת שהבנייה שלה שומרת על 98.2% מהממוצע של המודל ברמת דיוק מלאה על פני מערך של 20 מבחנים — 83.9 מול 85.4. המספר הזה הוא של המוכר עצמו, נמדד על הרנס של המוכר עצמו, ויום אחד לאחר ההשחרור אף אחד מחוץ ל-Prism ML לא שחזר אותו. הממוצע המצטבר גם מסתיר את החלק שבאמת צריך לעניין אותך, כי 1.8 הנקודות לא מתפלגות באופן שווה. בשני המבחנים שמעמידים במבחן הנדסת תוכנה מתמשכת, הפער הוא לא 1.8% — הוא קרוב יותר ל-25%.
אותה רשת, מנוסחת אחרת
התחל במה שהדחיסה אינה נוגעת בו, משום שזה הסיבה שההשוואה מעניינת בכלל. מספר השכבות, הגודל הנסתר, אוצר המילים, דפוס הקשב ומגדל הראייה הם של מודל הבסיס. Qwen3.8-27B הוא עיצוב קשב היברידי: 48 שכבות קשב לינאריות Gated DeltaNet משולבות לסירוגין עם 16 שכבות קשב מלא, חלוקה של בערך 3:1, על פני 64 שכבות עם גודל נסתר של 5,120 ואוצר מילים של 248,320 טוקנים. עמוד השדרה הזה, שהוא בעיקרו לינארי, הוא מה שהופך הקשר של 262K לאפשרי מבחינת עלות מלכתחילה, וזו התכונה ש-Bonsai יורש ללא שינוי.
מה ששינתה Prism ML הוא ייצוג המטריצות של מודל השפה, בתוספת הקרנלים הדרושים לביצוע חישוב עליהן. מסמך הווייט פייפר שלה מחלק את 27.36B הפרמטרים ל-24.35B בעמוד השדרה הלשוני הפרוסים על פני 64 בלוקים, 2.54B בהטמעה ובראש ה-LM, ו-0.47B במגדל חזותי בן 27 בלוקים. המגדל החזותי מסופק כקובץ mmproj נפרד של 4-bit בגודל של כ-0.63 GB, והוא נטען רק כאשר מגיעה תמונה בפועל, כך שפריסה מבוססת טקסט בלבד לעולם אינה משלמת עליו.
תוצאה מעשית של התכנון הכמעט־לינארי הזה ראויה לציון לפני כל דיון בנצ'מרקים. מכיוון שהארכיטקטורה אינה שנאי קונבנציונלי, הקרנלים של הביטים הנמוכים נאלצו להיכתב עבורה במיוחד. llama.cpp הסטנדרטי דוחה את שתי האריזות של Prism ML כסוגים לא מוכרים — ובעייתי יותר, טוען פורמט טרנרי ישן יותר בלי להתלונן ומייצר שטויות רהוטות, כי אין לו סיבוב תואם שמוחל על האקטיבציות. אם תריצו את המודל הזה על בינארי שלא יודע עליו, לא תקבלו שגיאה. תקבלו פלט בטוח בעצמו ומוטעה.
ההשוואה, קטגוריה אחר קטגוריה
הנה פירוט של 20 מדדים מטעם הספק, כאשר בסיס הדיוק המלא משמש כאסמכתא. כל נתון ברשימה זו הוא של Prism ML; אף אחד מהם לא אומת באופן עצמאי.
• מתמטיקה — 96.57 עבור Ternary Bonsai 2 27B לעומת 97.06 עבור Qwen3.8-27B. למעשה באותה רמה.
• קידוד — 81.58 לעומת 82.17. גם צמוד, וגם הקטגוריה שכל הטכניקה נדונה לגביה.
• ביצוע הוראות — 82.66 לעומת 81.25. המודל הדחוס מוביל כאן, שזו השורה היחידה בטבלה שבאמת מפתיעה.
• ידע והסקה — 83.95 לעומת 86.66. ירידה של 2.7 נקודות, והתורם הגדול ביותר ל-1.8 הנקודות החסרות.
• סוכניות וקריאה לכלים — 77.57 לעומת 79.74, הכולל τ2-Bench ב-80.22 ו-BFCL v3 ב-74.92.
• ראייה — 78.59 לעומת 81.64, האובדן הגדול ביותר בקטגוריה. שים לב שמגדל הראייה עצמו אינו החלק הדחוס; מודל השפה שקורא את הפלטים שלו הוא החלק הדחוס.

קרא את הצורה ולא את הממוצע, ותתגלה תמונה ברורה יותר. דחיסה היא כמעט בחינם במתמטיקה, בתכנות ובביצוע הוראות, והיא יקרה בידע ובראייה. זה ההפך מהחוכמה העממית על מודלים בעלי סיביות נמוכה, שלפיה ידע שטחי שורד וההסקה מתמוטטת. כאן דווקא הידע נשחק וההסקה מחזיקה מעמד.
איפה 1.8 הנקודות בעצם נמצאות
הנתון המצרפי הוא ממוצע על פני עשרים בנצ'מרקים, וממוצעים הם המקום שבו פערים מסתתרים. שלוף את התוצאות הבודדות החוצה ושתיים מהן גרועות בהרבה ממה שהממוצע מרמז.
• Terminal-Bench 2.1 — 52.8 עבור בניית ה-ternary לעומת 69.7 עבור דיוק מלא
• SWE-bench Verified — 60.8 לעומת 80.6
שניהם מגיעים לכמעט שלושה רבעים מהציון במלוא הדיוק. לעומת זאת, AIME26 מגיע ל-95.83, LiveCodeBench ל-90.07, ו-AA-LCR ל-77.0 — במרחק נקודה אחת מהמודל הלא דחוס. זו הפעם הראשונה שמשפחת Bonsai בכלל מוערכת על Terminal-Bench, ו-Prism ML מצהירה במפורש בחומרים שלה שיכולת הנדסת התוכנה לטווח ארוך שהבטיחה בדור הראשון מסופקת חלקית, לא במלואה.
אז השאלה המעשית היא לא "האם זה משמר 98.2%" אלא "מהי עומס העבודה שלי". אם אתה מריץ סוכן קידוד שמחזיק תוכנית לאורך עשרות קריאות לכלים ועורך קבצים במשך דקות, אתה בקטגוריה עם פער של 25%, והמספר המצטבר מטעה באופן פעיל. אם אתה עוסק במתמטיקה, יצירת קוד בתור בודד, חילוץ, סיווג או צ'אט, אתה בקטגוריות שבהן הפער מתאפס. הדבר השימושי ביותר בטבלה של הספק עצמו הוא שהיא מאפשרת לך לעשות את ההבחנה הזו במקום לנחש.
מה שכל אחד מהם באמת צריך כדי לפעול
סיפור החומרה פחות סימטרי מכפי שיחס הגודל מרמז. מודל FP16 בגודל 53.81 GB לא נכנס כלל במחשב נייד עם 16 GB, מה שהופך את ההשוואה מ"מהיר יותר לעומת איטי יותר" ל"אפשרי לעומת בלתי אפשרי". המדידות הסטנדרטיות של Prism ML בגודל אצווה 1, ללא מגדל הראייה:
• NVIDIA RTX 5090 — פענוח של 142.5 tok/s על אריזת PQ2_0, ב-0.582 mWh לכל טוקן
• Apple M5 Max — 46.8 tok/s פענוח, עם עיבוד פרומפט של כ-765 tok/s
• Apple M5 Pro — 27.7 tok/s פענוח
• Apple M4 Pro — 18.0 tok/s פענוח, כאשר עיבוד פרומפט בסמוך ל-125 tok/s הופך לאילוץ המחייב בהקשרים ארוכים מאוד
ההסתייגות החשובה היא ששום דבר מזה אינו קובץ בינארי יחיד. אריזת PTQ1_0 נותנת לך 5.93 GB ב-1.76 סיביות למשקל; PQ2_0 עולה 7.25 GB ב-2.16 סיביות למשקל וקונה מהירות פענוח בחומרה שבה תפוקת ההוראות, ולא רוחב הפס של הזיכרון, היא המגבלה. בניית ה-MLX ל-Apple Silicon היא ארטיפקט שלישי עם חשבונאות משל עצמו — מיכל אפיני של 2 סיביות שמאחסן הטיה שהמשקלים התלת-ערכיים אינם זקוקים לה, ומגיע ל-2.25 סיביות למשקל ול-8.005 GiB בדיסק, עם קרנלי Metal ו-CPU אך ללא נתיב CUDA. "זה רץ ב-5.9 GB" נכון בדיוק לגבי אחד מהקבצים האלה, בדיוק בסביבת ההרצה הנכונה.
השוואת העלויות, במסגור כן
ישנן שתי דרכים לשלם עבור Qwen3.8-27B ורק דרך אחת לשלם עבור האח הדחוס שלה. Ternary Bonsai 2 27B הוא הורדה: Apache 2.0, החומרה שלך, בלי מונה. Qwen3.8-27B הוא גם הורדה וגם שירות מתארח, ואם תבחרו במסלול המתארח, הנתון הרלוונטי הוא זה שבעמוד הדגם — 0.33 דולר למיליון טוקני קלט ו-2.40 דולר למיליון טוקני פלט, מוגש מהתשתית של OrcaRouter עצמה ולא נמכר מחדש משל מישהו אחר.
זה המקום שבו OrcaRouter זוכה למקום בהשוואה הזו ולא להערת שוליים. הגרסה המנותבת של Qwen3.8-27B נושאת את אותו חלון הקשר של 262K, מקבלת טקסט, תמונות וווידאו, וחושפת את בקרת מאמץ החשיבה שהמודל מגיע איתה. היא יושבת מאחורי אותו מפתח כמו יותר מ-200 מודלים אחרים, בלי תוספת מעל מחיר המחירון של הספק, וזה חשוב יותר ממה שזה נשמע: מכיוון שמחיר המחירון מועבר הלאה ולא נמכר מחדש, שינוי מחיר של ספק מופיע כאן באותו יום במקום בחידוש החוזה הבא. עבור צוות שרוצה את הבסיס בדיוק מלא כשכבת ההסלמה מעל Bonsai מקומי, זו נקודת קצה אחת ומפתח אחד במקום שני קשרי ספק.

איזה מהם לבחור
ההחלטה היא בעיקר בשאלה היכן העבודה מתבצעת, ולא בשאלה איזה מודל טוב יותר, כי ברוב המשימות מדובר באותו מודל.
• בחרו ב‑Qwen3.8-27B בדיוק מלא כאשר המשימה היא ארוכת‑טווח וסוכנית, כאשר אתם מעריכים או מכווננים (fine-tuning), כאשר אתם זקוקים להקשר YaRN של מיליון טוקנים, או כאשר דיוק הראייה הוא קריטי. מספרי Terminal-Bench ו‑SWE-bench הם הסיבה לכך.
• בחרו ב-Ternary Bonsai 2 27B כאשר העבודה צריכה להתבצע על חומרה שבבעלותכם, כאשר החלופה היא לא להריץ מודל 27B בכלל, או כאשר עומס העבודה הוא מתמטיקה, קידוד, חילוץ או הסקה ללא כלים, שבהם הקטגוריות שוות.
• אל תבחרו לפי הציון המצטבר. 83.9 ו־85.4 קרובים מספיק לכך שהחלפת בנצ׳מרק אחת עשויה לשנות את סדרם, ורק אחד משני המספרים מאומת באופן עצמאי.
מה שבאמת חדש כאן הוא לא ש�-מודל 27B נכנס לשישה ג'יגה-בייטים — הדור הראשון של Bonsai עשה זאת ביולי. אלא שביצוע ההוראות יצא טוב יותר מאשר אצל מודל האב, ושמתמטיקה ותכנות יצאו באותה רמה, וזו טענה שונה מ"קטן לגודלו". האם זה מחזיק בעומס העבודה שלך הוא בדיוק מה שגיל של יום אחד לא יכול לומר לך, וההערכה הבלתי תלויה הראשונה של המודל הזה היא התוצאה ששווה להמתין לה.

אם ברצונך להריץ את ההשוואה על הפרומפטים שלך ולא על חבילת בנצ׳מרק, המסלול המהיר ביותר הוא לקרוא ל-Qwen3.8-27B המתארח דרך endpoint אחד ולהריץ את הבילד הטרנרי באופן מקומי, ואז להשוות את הפלטים במשימות שבאמת יש לך. זו עבודה של בוקר אחד והיא תספר לך יותר על 1.8 הנקודות מאשר כל טבלה מפורסמת.
