כרטיס Hero שנוצר שכותרתו Claude Sonnet 5.5 מול Muse Glimmer, עם כתובית משנה: דגם לפטופ 30B מול ה-Sonnet החדש, עם שלושה כרטיסי נתונים: מדד האינטליגנציה 56 מול 17, חלון הקשר 1M מול 131K טוקנים, ומשקלים סגורים מול Apache 2.0, עם כותרת תחתונה שמציינת: המדד לפי Artificial Analysis v4.3.2; מפרטי Muse Glimmer לפי Meta.
Guides & Insights

Claude Sonnet 5.5 נגד Muse Glimmer: מודל לפטופ של 30B מול ה-Sonnet החדש

מחבר

Gideon Frost

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים →
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

שאלת המסגור של העמוד הזה היא האם ההשוואה בכלל לגיטימית, והתשובה הכנה היא שClaude Sonnet 5.5 וMuse Glimmer אינם מתחרים במובן הרגיל. במדד האינטליגנציה של Artificial Analysis, גרסה v4.3.2, Claude Sonnet 5.5 מקבל 56 ו-Muse Glimmer מקבל 17, והפער הזה אינו רעש — הוא בערך המרחק בין מודל כללי בחזית הטכנולוגיה למודל קטן וטוב מאוד. מה שבכל זאת הופך את הזיווג לכדאי לקריאה הוא של-Muse Glimmer יש תכונה אחת שהאחר אינו יכול לקנות בשום מחיר: זהו מודל עם משקלים פתוחים ו-30 מיליארד פרמטרים, שפורסם על ידי M​eta ב-10 באוגוסט 2026 תחת Apache 2.0, מכומת ל-4 ביט כך שהוא נכנס מתחת ל-20 GB של VRAM, ותוכנן לפעול כשהרשת מנותקת. Claude Sonnet 5.5 הגיע ב-28 בספטמבר 2026 כמודל ה-Sonnet המהיר והחכם ביותר של הספק, במחיר של $2.00 למיליון טוקני קלט ו-$10.00 למיליון טוקני פלט, ונגיש רק דרך הרשת. ההחלטה האמיתית אינה איזה מודל טוב יותר. היא היכן שאתם רוצים שהטוקנים יופעלו.

שני מודלים, שתי הגדרות של התפקיד

Muse Glimmer יוצא מ-Meta Superintelligence Labs כמודל בעל 30B פרמטרים שאומן בזיקוק לוגיטים מהמורה הגדול יותר Muse Spark של Meta, ואז כוונן עדין על נתוני סוכנים בהקשר ארוך ועבר חיזוק לשימוש בכלים. Meta השיקה אותו כשהוא כבר מקוונטז: קוונטיזציה של 4-bit מקטינה את טביעת הזיכרון מיותר מ-55 GB בדיוק מלא לפחות מ-20 GB, וזה מה שמכניס אותו למעטפת של GPU צרכני עם 24 GB או 32 GB. Meta בדקה אותו על Nvidia RTX 5090 ועל שבבי Apple M4 Max ו-M5 Max. הוא מקבל קלט טקסט ותמונה, מחזיר טקסט, פועל עם חלון הקשר של 131,072 טוקנים שלדברי Meta ניתן להרחיב ל-262,144, ונושא תאריך חיתוך ידע של ינואר 2026.

Artificial Analysis model page for Muse Glimmer (high), an open-weights model released August 2026, showing an Intelligence Index of 17, an output speed of 143.8 tokens per second, $0.325 per million input tokens and $1.35 per million output tokens, $0.06 per Intelligence Index task, 59M output tokens generated during the Index evaluation, a 131K-token context window and a January 2026 knowledge cutoff.

Claude Sonnet 5.5 הוא המודל השני בדור 5.5 של A​nthropic וזה שהחברה מציבה כשילוב הטוב ביותר של מהירות ואינטליגנציה בהיצע שלה. הוא פועל עם חלון של 1,000,000 טוקנים, עד 128,000 טוקני פלט באופן סינכרוני ו-300,000 ב-Message Batches API מאחורי ה-output-300k-2026-03-24 header, מקבל טקסט, תמונות וקבצים, מציע חשיבה אדפטיבית במאמץ לבחירה עם תאריך חיתוך יוני 2026, וזמין עם אפס שמירת נתונים מההשקה. אחסון הוא $0.20 למיליון טוקנים בקריאות מטמון ו-$2.50 למיליון בכתיבות מטמון. A​nthropic אומרת שהוא פועל 30% מהר יותר מ-Claude Sonnet 5 ועולה עד 30% פחות לכל משימה בתעריפים ללא שינוי — טענות ספק, לא שוחזרו באופן עצמאי.

שווה לראות את הניגוד במפרט במעבר אחד, כי כמעט כל שורה היא סוג אחר של דבר ולא דבר טוב יותר או גרוע יותר:

• משקלים — Muse Glimmer Apache 2.0, ניתן להורדה, מכומת ל-4 ביטים לעומת Claude Sonnet 5.5 סגור

• היכן זה רץ — Muse Glimmer על ה-GPU שלך, אופליין מול Claude Sonnet 5.5 על תשתית Anthropic

• פרמטרים — Muse Glimmer 30B בסך הכול, פחות מ-20 GB ב-4-bit לעומת Claude Sonnet 5.5 שלא נחשף

• הקשר — Muse Glimmer ‏131,072 טוקנים, ניתן להרחבה עד 262,144 לעומת Claude Sonnet 5.5 ‏1,000,000 טוקנים

• מחיר למיליון — Muse Glimmer ללא חיוב לפי טוקן, החומרה שלך לעומת Claude Sonnet 5.5 $2.00 קלט / $10.00 פלט

• מדד האינטליגנציה v4.3.2 — Muse Glimmer 17 מול Claude Sonnet 5.5 56

• עלות לכל משימת Index כפי שנמדדה — Muse Glimmer ‏$0.06 לעומת Claude Sonnet 5.5 ‏$7.60

שני מספרים ברשימה הזו ראויים לניתוח לעומק, מפני ששניהם מלכודות. הראשון הוא מספר ה-$0.06 לכל משימה: זה מה ש-Artificial Analysis הוציאה על קריאות אל Muse Glimmer (high) דרך נקודת קצה מתארחת בתעריף של $0.325 למיליון טוקני קלט ו-$1.35 למיליון טוקני פלט, כך שהוא מודד את הכלכלה של שכירת המודל הזה, לא של הרצתו. באחסון עצמי, העלות השולית לכל טוקן נעלמת ומוחלפת ב-GPU שכבר יש לכם או שעליכם לקנות. השני הוא פער האינדקס עצמו — מודל 30B שעבר קוונטיזציה ל-20GB נמדד באותו סרגל כמו מודלי חזית, ולוח הדירוג אומר זאת בעצמו כשהוא מציב את Muse Glimmer בקומץ העליון של מודלים במשקלים פתוחים, תוך ציון שהוא יקר ביחס לגודלו.

Generated comparison scoreboard titled Claude Sonnet 5.5 vs Muse Glimmer, the scoreboard, contrasting weights closed vs Apache 2.0, where it runs Anthropic infrastructure vs your own GPU offline, parameters undisclosed vs 30B at 4-bit, context window 1,000,000 vs 131,072 tokens, AA Index 56 vs 17, and output speed 138.7 vs 143.8 tokens per second, with a footer reading AA Index and speed per Artificial Analysis v4.3.2; Muse Glimmer specifications per Meta.

איפה Muse Glimmer טוב באמת, ואיפה הדברים מתפרקים

הציון המשולב גס מדי מכדי להיות התשובה כולה, מפני ש-Muse Glimmer אינו שבע־עשרה באופן אחיד. הוא מהיר — Artificial Analysis מודדת 143.8 אסימוני פלט בשנייה, מעל ל-138.7 של Claude Sonnet 5.5 — והוא תמציתי, ומייצר 59M אסימונים בכל הערכת ה-Index לעומת 410M של Claude Sonnet 5.5. ובהערכה אחת הוא מתקרב לחזית: שליפה בהקשר ארוך, שבה הוא משיג 83.3% לעומת 82.7% של Claude Sonnet 5.5. מודל 30B שמתאים ל-Sonnet חדש לגמרי מהחזית בשליפה בהקשר ארוך הוא השורה המפתיעה ביותר בעמוד הזה, והוא עקבי עם הדרך שבה M​eta אימנה אותו — נתוני סוכנים בהקשר ארוך, זיקוק ממורה גדול בהרבה.

התוצאות האג'נטיות הן המקום שבו נראית התקרה של המודל והדירוג מפסיק להיות מחמיא. ב-Terminal-Bench 4.0 ‏Muse Glimmer משיג 0.5% לעומת 63.6% של Claude Sonnet 5.5. ציון מבחן האוטומציה שלו הוא 0.068 לעומת 0.713. Humanity's Last Exam: ‏22.0% לעומת 55.0%. תפוקה בסדר גודל כל כך קטן במבחן ביצועים משמעה שהמודל אינו משלים משימות, ושום חיסכון באירוח מקומי לא הופך משימה שלעולם אינה מסתיימת לזולה יותר.

הספרות המחקרית גם היא בוטה בעניין הזה, וכדאי לומר זאת במקום לקבור אותה: מחקר בתזמור ריבוי סוכנים שעבר ביקורת עמיתים, שבו Muse-Glimmer-30B היה אחד המודלים שנבחנו, מצא שהוא לא אחזר אף אחד מהמועמדים שלו. טבלת הבנצ'מרק של M​eta עבור המודל היא מסמך ספק ומסומנת ככזו כאן; הנתונים של Artificial Analysis שלעיל הם מדידות בלתי תלויות, ואלה הם הנתונים שהמאמר הזה נשען עליהם.

אז החלוקה הזו ברורה. Muse Glimmer חזק יחסית לגודלו בקריאה של קלט ארוך ובמענה עליו, מהיר, זול להרצה, והוא נכנס ל-GPU ברמת מחשב נייד. הוא לא מודל שמוסרים לו משימת תוכנה רב-שלבית ומסתלקים. זה הגבול הכנה, והשוואה שנכתבת סביב ציונים משולבים בלבד תסתיר אותו.

מה שאתה בעצם קונה בתעריף החזית

הפרימיום של Claude Sonnet 5.5 קונה קודם כול יכולת, ופער שבע-עשרה הנקודות ב-Index הוא הביטוי הראשי לכך. אבל שלושה דברים אחרים מגיעים עם תעריף הפלט של $10.00 שלא מופיעים באף לוח דירוג.

הראשון הוא החלון. מיליון טוקנים הם בערך פי שבעה וחצי מ־131,072 של Muse Glimmer, ו-A​nthropic גובה את התעריף הסטנדרטי על כל זה, כאשר קריאות מטמון הן בעשירית ממחיר הקלט, כך שנשיאת הקשר גדול לאורך קריאות רבות היא אפשרית מבחינה כלכלית ולא רק תיאורטית. פרומפט בקנה מידה של מאגר לא נכנס כלל לחלון הקטן יותר, כך שזהו הבדל ביכולת ולא העדפה.

השנייה היא נאמנות הכלים. חמישה התנהגויות השתנו בין Claude Sonnet 5 ל-Claude Sonnet 5.5, וכל החמישה עוסקות בשימוש בכלים ובחשיבה: פרמטרי דגימה שאינם ברירת מחדל מחזירים כעת 400, thinking: {"type": "disabled"} מחזיר כעת 400 והופך ל-between_tools, ובחירה כפויה של כלי "any" או כלי בעל שם נדחית, ולכן לולאות חייבות לעבור ל-auto עם שימוש קפדני בכלים, הכלי הישן יותר computer_20251124 נדחה ב-Claude API וב-Goo​gle Cloud, ובלוקי חשיבה כעת כרוכים במודל ובחשבון שיצרו אותם. שינוי שישי אינו מכשיל דבר אך נעשה שקט: טקסט בין קריאות לכלים מוחזר בתוך בלוקי חשיבה, כך שאפליקציית סטרימינג מפסיקה להציג פלט עד שהיא מגדירה ערך תצוגה או מכבה חשיבה מראש. זהו יום של עבודת מיגרציה לכל מי שנמצא על Sonnet 5, וזהו מחיר הכניסה לאמינות הסוכנית ששורות המדדים שלמעלה מודדות.

השלישי הוא מקור הנתונים והטיפול בהם. שמירת נתונים אפסית זמינה כבר מההשקה, Anthropic מפרסמת תאריך פרישה מינימלי של 28 בספטמבר 2027, והמודל זמין ב-Claude API, ב-Bedrock, ב-Google Cloud וב-Microsoft Foundry. עבור קונה בסביבה מפוקחת, אלו עובדות רכש שמכריעות את הרכישה עוד לפני שהבנצ'מרק עושה זאת.

אופליין הוא דרישה, לא חיסכון בעלויות

הסיבה שהצירוף הזה שייך לעמוד אחד היא שלסוג מסוים של פריסה, Muse Glimmer אינו אפשרות זולה יותר — הוא האפשרות היחידה. בקשה שלא יכולה לצאת מהמכשיר, רצפת ייצור או אתר שטח בלי קישוריות, סביבה מבודדת מרשת שבה קריאת API היא הפרת תאימות, או תקציב השהיה שבו הלוך-חזור הוא כבר יותר מדי: אף אחד מאלה לא נפתר על ידי מודל טוב יותר מאחורי רשת. משקולות Apache 2.0 בנפח של פחות מ-20 GB שרצות באופן לא מקוון הן כל התשובה, ו-Claude Sonnet 5.5 בכל מחיר אינו משתתף בשאלה.

הבדיקות שפרסמה M​eta על שבבי RTX 5090 ו-Apple M4 Max ו-M5 Max הן אמת המידה המעשית למה ש"פועל מקומית" אומר כאן, וקוונטיזציה של 4-bit היא מה שהופך את היעדים האלה לברי-השגה בכלל — טביעת הרגל בדיוק מלא היא מעל 55 GB. כל מי שמתכנן פריסה צריך להתייחס לנתוני החומרה כאל של M​eta ולא ככאלה שנמדדו כאן.

עבור כל השאר, שני המודלים משלימים זה את זה ולא מחליפים זה את זה, והחלק המסורבל מבחינה תפעולית הוא שהחזקה של מודל API של Anthropic ומודל Meta באירוח עצמי משמעה בדרך כלל שתי ערימות נפרדות לחלוטין. OrcaRouter מציבה יותר מ-200 מודלים מאחורי נקודת קצה אחת תואמת OpenAI, כאשר מחיר המחירון של הספקים מועבר כפי שהוא וללא תוספת רווח, מעבר אוטומטי בין ספקים במעלה הזרם וכן DSL לניתוב לצורך הרכבת קריאות — מה שמכסה את החצי המאוחסן של אותו סידור, ומודל המורה Muse Spark 1.2 הגדול יותר של Meta ניתן לניתוב כאן בתור meta/muse-spark-1.2 במחיר של $1.25 לקלט ו-$4.25 לפלט למיליון טוקנים על פני חלון של 1,048,576 טוקנים, עם קריאות מטמון ב-$0.15. הוא מעביר 42.8 מיליון טוקנים של תעבורה בשבוע דרך הקטלוג הזה, וזה החלק השימושי בסידור: מודל המורה המאוחסן נמצא תחת אותו מפתח כמו כל השאר, והמודל שאתם מריצים מקומית לא צריך לגעת ברשת בכלל.

שלוש הערות כנות, כי קל לטעות בהן. Muse Glimmer עצמו אינו אחד מהנתיבים שלנו — כרטיס המודל לא קיים בקטלוג שלנו, והעמוד הזה אומר זאת במקום לרמוז אחרת. הצילום למטה הוא העמוד של המודל שכן קיים, Muse Spark 1.2, שהוא ה-checkpoint שממנו זוקק Muse Glimmer ולא Muse Glimmer עצמו. גם Claude Sonnet 5.5 לא נמצא בקטלוג שלנו, יום אחד לאחר ההשקה; הנתיב אליו הוא ה-API של Athropic עצמה, וניתן לנתב את Claude Sonnet 5 כאן מאז 30 ביוני במחיר 2.00$ ו-10.00$ למי שרוצה את יעד הסטייג'ינג.

OrcaRouter model page for meta/muse-spark-1.2, dated 2026-08-05, showing $1.25 input and $4.25 output per million tokens, a p50 time to first token of 2.05 s, a 1,048,576-token context window, and 42.8M tokens of recent traffic.

איך להחליט

התחל מהאילוץ, לא מהציון. אם הבקשה לא יכולה לצאת ממכונה או מרשת, Muse Glimmer היא התשובה ופער ה-Index לא רלוונטי — מודל 30B תחת Apache 2.0 שרץ באופן לא מקוון ומשתווה למודל חזית בשליפת הקשר ארוך הוא, עבור אותה משימה, הדבר הטוב ביותר שקיים. אם הבקשה צריכה להשלים משימת תוכנה רב-שלבית, מודל 30B שמשיג חצי אחוז ב-Terminal-Bench לא נמצא במירוץ, בלי קשר לחומרה שכבר בבעלותך.

בין שני הקטבים האלה, הגורם המכריע הוא מדידה ולא דעה: טוקנים לכל משימה שהושלמה בעומס העבודה שלך, מתומחרים פעמיים — פעם אחת לפי $2.00 ו-$10.00 של Claude Sonnet 5.5, ופעם אחת לפי העלות המופחתת של ה-GPU. המספר האחד שממסגר מחדש את כל ההשוואה, $0.06 למשימת Index לעומת $7.60, הוא נתון של שכירות מתארחת עבור מודל שרוב האנשים יריצו בעצמם, ולצטט אותו כאילו היה חיסכון של דומה לדומה יהיה הטעות הקלה שדף זה נועד למנוע.

השוואות במאמר הזה1

זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית