Muse Code לעומת Muse Spark 1.1: מה באמת מודד שדרוג 6.7 הנקודות של Meta
Guides & Insights

Muse Code לעומת Muse Spark 1.1: מה באמת מודד שדרוג 6.7 הנקודות של Meta

מחבר

Rowan Sterling

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

עשו את החיסור קודם. מצגת ההשקה של Meta עבור Muse Code, סוכן הקידוד הטרמינלי שהשיקה ב-5 באוגוסט 2026, מדווחת על 82.9% ב-Terminal-Bench 2.1 וזוקפת את זה כשיפור של 6.7 נקודות לעומת Muse Spark 1.1, המודל שרוב האנשים שקוראים את זה כבר משלמים עבורו. הורידו 6.7 מ-82.9 ותקבלו 76.2 — שאינו מספר שפרסמה Meta, אלא בדיוק הציון שמופיע בלוח התוצאות הפומבי של Terminal-Bench 2.1 עבור Muse Spark 1.1 במאמץ xhigh, שהוגש ביולי, שהופעל על ידי תשתית ה-mini-SWE-agent של פרינסטון.

הצירוף המקרי הזה הוא העובדה השימושית ביותר בהשוואה זו, מכיוון ש-mini-SWE-agent הוא שלד מינימלי במכוון — כמה מאות שורות, ללא תת-סוכנים מתמשכים, ללא יומן אירועים, ללא כישורי תכנון. ה-82.9% של Meta הוא Muse Spark 1.2 שפועל בתוך סוכן ייעודי ש-Meta אימנה יחד עם המודל. אם שתי השורות האלה הן מה שטווח 6.7 הנקודות מקיף, אז הרווח הדורי שבכותרת הוא שדרוג מודל ושדרוג מסגרת הארוז במספר אחד, ו-Meta לא פרסמה שום דבר שמפריד ביניהם.

Meta לא ציינה באיזה כלי בדיקה השתמשה לקו הבסיס של 1.1, ולכן ההתאמה היא מרמזת ולא מוכחת. אבל זה ממסגר מחדש את ההחלטה שעומדת בפני כל מי שמבצע כיום קריאות ל-Muse Spark 1.1 דרך API, וזה התיאור הכנה של ההתמודדות: אינך בוחר בין שני מודלים. אתה בוחר בין מודל שאתה מפעיל בעצמך לבין סוכן שמפעיל עבורך מודל חדש יותר, ורק אחד משני הדברים האלה נמדד על ידי מישהו שאינו Meta.

אלה לא מאותה קטגוריה, וכך גם כתוב בגיליון המפרט.

חצי מהבלבול סביב הזיווג הזה נובע מהתייחסות למוז קוד כאל מהדורת מודל. זה לא. זה CLI, ומוז ספארק 1.2 הוא מה שהוא קורא לזה.

מה זה — Muse Code הוא סוכן טרמינל שמותקן בשורת פקודה אחת (curl -fsSL https://dev.meta.ai/install.sh | bash); Muse Spark 1.1 הוא נקודת קצה של מודל שאתה קורא אליה מהקוד שלך, ממסגרת הסוכן שלך, או מכל CLI שמקבל כתובת בסיס מותאמת אישית.

המודל הבסיסי — Muse Code מריץ את Muse Spark 1.2, שאומן יחד עם הסוכן; Muse Spark 1.1 הוא דור יולי, שעדיין מוגש ועדיין מופיע ברשימה.

היכן שזה פועל — Muse Code זמין רק ב-macOS וב-Linux, טרמינל בלבד, ללא GUI, ללא הרחבת IDE; Muse Spark 1.1 פועל בכל מקום ש-HTTPS פועל, כולל Windows.

קלטים — Muse Code מקבל מאגר קוד והנחיה; Muse Spark 1.1 מקבל טקסט, תמונות, וידאו, אודיו ומסמכי PDF בהקשר יחיד של 1,048,576 טוקנים ומחזיר טקסט.

סטטוס — Muse Code הוא בטא ציבורי ומסומן ככזה; Muse Spark 1.1 זמין באופן כללי מאז יולי 2026 ונושא תעבורת ייצור אמיתית.

מחיר מחירון — שניהם מחויבים דרך Meta Model API במחיר של $1.25 למיליון אסימוני קלט, $0.15 עבור קלט במטמון ו-$4.25 עבור פלט בדרגה הרגילה. כרטיס התעריפים הוא אותו כרטיס תעריפים.

השורה האחרונה היא זו שמפתיעה אנשים, והיא הורגת את ההנחה המובנת מאליה. אימוץ Muse Code אינו עולה יותר לכל טוקן ממה שאתם כבר מריצים. מה שזה עולה נמדד במטבעות אחרים — תמיכת פלטפורמות, חביון, מודאליות, ובשכבה הזולה, קוד המקור שלכם. אלה הם ארבעת הצירים שעליהם כדאי להתווכח.

המדד שבו הם מתפצלים, הנקרא עם הרתמה מחוברת

Meta פרסמה שתי פערי דורות לעומת Muse Spark 1.1: +6.7 נקודות ב-Terminal-Bench 2.1 ו-+6.3 ב-DeepSWE 1.1. שתיהן מדווחות על ידי הספק, שתיהן מגיעות מתרשימים שפורסמו כתמונות ללא פירוט מתודולוגיה, ואף אחת מהן לא שוחזרה על ידי צד שלישי. אם נחסיר אותן, קווי הבסיס המשתמעים של Meta ל-1.1 הם בערך 76.2% ו-53.0%.

עכשיו שימו את 82.9% של Meta לצד הלוח שלא ציטטו. לוח התוצאות הציבורי של Terminal-Bench 2.1, נכון לכתיבת שורות אלה, מציג את Claude Code יחד עם Claude Fable 5 ב-83.8% ± 1.2%, ו-Codex עם GPT-5.5 ב-83.1% ± 1.1%, Terminus 2 עם Claude Fable 5 ב-80.4%, ו-Cursor CLI עם Grok 4.5 ב-79.3%, ו-mini-SWE-agent עם Muse Spark 1.1 ב-76.2% במקום השמיני. הדיווח העצמי של Muse Code על 82.9% היה משבץ אותו במקום השלישי — מתחת לשני זוגות של סוכן-מודל שאינם מופיעים כלל במצגת של Meta, שמשווה במקום זאת נגד Claude Opus 5 ב-86.7%, GPT-5.6 Terra ב-81.8% ו-Grok 4.5 ב-81.6% בריצות נפרדות במאמץ מירבי.

שני לוחות תוצאות, benchmark אחד, מספרים שאינם מתיישבים — וקנה מידה שלישי לגמרי אם מסתכלים על Artificial Analysis, שההערכה העצמאית שלה ל-Terminal-Bench v2.1 מגיעה קרוב ל-89.5% עבור GPT-5.6 Sol, מול תקרה של 83.8% בלוח הציבורי. אף אחד מהגורמים האלה אינו משקר. שורת Terminal-Bench היא ציון של רתמה, בתוספת מודל, בתוספת הגדרת מאמץ, בתוספת מכסת חישוב — והחלפת כל אחד מאלה מזיזה את התוצאה ביותר מכל הפער שמטא טוענת שהוא דור.

ולכן הנתון המעניין בלוח הציבורי אינו עמודת הדיוק, אלא עמודת העלות. Muse Spark 1.1 השלים ריצה של 76.2% תמורת $198.05. Claude Code עם Claude Fable 5 קנה את הדיוק של 83.8% תמורת $552.67, ו-Codex עם GPT-5.5 שילם $2,059.19 עבור 83.1%. כלומר, 7.6 נקודות דיוק תמורת פי 2.8 מהכסף במקרה הראשון, ובערך פי 10 במקרה השני — כפי שנמדד על ידי אותו מפעיל, על אותן משימות, תחת אותם כללים, וזו בדיוק ההשוואה ההוגנת ש-Meta לא מספקת בטבלה שלה. הלוח גם מנכה נקודות עבור משימות שנפתרו באמצעות ניצול הסביבה; ההגשה של Muse Spark 1.1 אינה כוללת ניכוי כזה, בעוד שהריצה של Grok 4.5 ב-Cursor CLI נושאת ניכוי של 9 נקודות.

Meta לא פרסמה שום נתון עלות עבור 82.9%.

מה Muse Spark 1.1 כבר עושה ש-Muse Code לא יכול

הטענה של Muse Code היא שסוכן שאומן במשותף עדיף על "מעטפת גנרית סביב מודל חיצוני" — הניסוח של Meta, הקביעה של Meta, שלא נבדקה על ידי אף אחד אחר. זו טענה סבירה. היא גם מכוונת לפער ש-Muse Spark 1.1 נבנה במיוחד כדי לסגור.

Muse Spark 1.1 מדבר את פרוטוקול Model Context Protocol באופן טבעי, מנהל את חיבורי ה-MCP שלו ללא מסגרת חיצונית, מתזמן באופן פנימי תפקידים של סוכן ראשי וסוכני משנה, ומכליל zero-shot לכלים חדשים ומיומנויות מותאמות אישית. נתוני ההשקה שמסרה Meta עבורו היו נתוני שימוש בכלים: 88.1 ב-MCP Atlas לשימוש בכלים בקנה מידה גדול — לפני ה-82.2 שדווח עבור Claude Opus 4.8 וה-75.3 עבור GPT-5.5 — ו-54.7 ב-JobBench. כל אלה דווחו על ידי הספקים, כולם מיולי, ואף אחד לא שוחזר באופן עצמאי. הנקודה עדיין עומדת: 1.1 אינו מודל צ'אט שמישהו חיבר אליו סוכן. הכניסו אותו ל-OpenCode, Cline, או כל CLI שמקבל endpoint מותאם אישית, ויש לכם סוכן כבר היום.

ואז יש את כל מה ש־Muse Code לא יכול לגעת בו מבחינה מבנית. Muse Spark 1.1 מבצע חשיבה על תמונות, וידאו, אודיו וקובצי PDF בחלון הקשר אחד. לסוכן קידוד הפועל במסוף אין שימוש במשטח הזה ואין לו דרך לחשוף אותו. אם עומס העבודה שלך הוא אב־טיפוס עיצובי שהופך לרכיבים, שיחת תמיכה שמתומללת וממוינת, או מפרט של 400 עמודים שמוצלב מול מימוש — הדבר החדש יותר הוא הדבר הפחות מסוגל — והמיצוב של Meta לדור ה־1.2 עבר מ"מחקר עמוק רב־מודאלי על מדיה מעורבת" לריפקטורינג של קבצים מרובים ויצירת מאגר קוד שלם, בלי שתוצאת וידאו או אודיו כלשהי פורסמה עבור 1.2 על ידי אף אחד.

האסימטריה האמיתית פועלת בכיוון ההפוך, וזו תכונת זמן־ריצה ולא יכולת. Muse Code מוסיפה כל קריאת מודל, הרצת כלי, אישור ועריכה ליומן אירועים מקומי, שלפי מטה הופך את ההפעלה לניתנת לשחזור מדויק ובטוחה להפעלה מחדש: אם היא קורסת, הסוכן ממשיך מהמקום שבו עצר במקום לגזור מחדש את ההקשר שלו. הסוכנים ברקע שלה נמשכים לאורך כל ההפעלה במקום להיווצר ולהיהרס עבור כל תת־משימה. הראיה של מטה היא מחקר מקרה יחיד — ריצה בת 24 שעות עם יותר מ־1,000 קריאות כלים, שמטיבה קרנלי GPU על חומרת NVIDIA Hopper. לא פורסם מספר האצה, ולכן משך הזמן הוא הטענה. אם אי פעם איבדת הגירה של תשע שעות בגלל שהתשתית שכחה מה היא עשתה בשלב 300, זה דבר אמיתי לרצות, ושום כמות של תמיכת MCP במודל לא נותנת לך אותו.

אותו מחיר מחירון, עד שתקרא את הדרג השני

מכיוון שהשכבה הסטנדרטית זהה בשני הצדדים, טיעון התמחור בהשוואה הזו חי כולו בשכבה שמטה הציגה לצד Muse Code. שכבת התורמים עולה $0.10 למיליון טוקנים בקלט, $0.002 לקלט במטמון ו-$0.20 לפלט — זול פי 12.5 בקלט, פי 21 בפלט, פי 75 בקלט במטמון — בתמורה להרשאה מפורשת להשתמש בהנחיות ובהשלמות שלך כדי לאמן דגמי Meta עתידיים. תעבורת השכבה הסטנדרטית, לפי דברי Meta, אינה משמשת כך.

הרץ שלב סוכן ריאלי דרכו — 60,000 אסימונים של הקשר מאגר פנימה, 3,000 אסימונים של תכנון-ותיקון החוצה — ואלף שלבים עולים $87.75 בשכבה הסטנדרטית כשהיא קרה, $21.75 כשהקשר של המאגר פוגע במטמון, $6.60 בשכבת התורם כשהיא קרה, ו-$0.72 בשכבת התורם עם מטמון חם. הריצה של מטה עצמה בת 24 שעות של קרנל מגיעה לכמעט תשעים דולר בשכבה שמגנה על הקוד שלך ולפחות מדולר בשכבה שלא.

זו לא החלטת חיוב. ההנחיות של סוכן הקוד הן קוד המקור שלך — ממשקי API פנימיים, ההערה שמסבירה למה קיים הפתרון הזמני, כל מה שהפיקסצ'רים שלך מכילים. בעץ קוד פתוח, דרגת התורם היא כמעט כסף חינם. במאגר קנייני, זו החלטת רישוי נתונים המחופשת להנחה, והיא צריכה לעמוד בפני מי שמאשר את הטיפול בנתונים, ולא בפני מי שצופה בחשבון הענן. Meta קבעה את ההנחה על 12x כי הנתונים שווים לפחות כל כך ל-Meta.

הישארות על Muse Spark 1.1 עוקפת את השאלה לחלוטין, וכדאי לדעת בדיוק מה זה עולה והיכן. Muse Spark 1.1 נמצא בקטלוג OrcaRouter במחיר של $1.25 ו-$4.25 — מחיר המחירון של Meta עד האגורה, כי אנו מוסיפים 0% markup ומעבירים את תמחור הספק ישירות, וזו גם הסיבה לכך ששינוי תעריף של Meta מופיע אצלנו ביום שבו Meta מבצעת אותו במקום אחרי מחזור חוזה. טלמטריית הייצור שלנו לשבעה ימים עבורו מראה p50 time-to-first-token של 1.84 שניות ו-p95 של 6.00 שניות, שהיא ציפייה שימושית בהרבה מכל מה שמנגנון benchmark ייתן לך. Muse Spark 1.2 הוא לאבקטלוג שלנו; הוא מוגש על ידי Meta ישירות ולא ממקום אחר, כך שהחצי החדש יותר של ההשוואה הזו כולל כיום בדיוק ספק אחד ואין לו נתיב failover מעצם הגדרתו. אם אתה מעריך אותו, החשיפה לספק יחיד היא חלק ממה שאתה מעריך.

הפשרה בהשהיה שאף אחד לא מזכיר בסיקור ההשקה

Artificial Analysis, שמודד באופן עצמאי במאמץ החשיבה המקסימלי של כל מודל, מדד את הזמן עד לטוקן הראשון של Muse Spark 1.1 ב-2.90 שניות ואת של Muse Spark 1.2 ב-26.12 שניות. מהירות הפלט ירדה מ-213.5 ל-165 טוקנים בשנייה. הרכישה הייתה שלוש נקודות של מדד האינטליגנציה, מ-51 ל-54, וקפיצה ממקום 22 למקום 13 מתוך 185 מודלים.

אם קוראים את זה כשחרור מודל לשימוש כללי, זו עסקה גרועה — תשע פעמים זמן ההמתנה תמורת שלוש נקודות. אם קוראים את זה כמנוע של סוכן קוד, ברור שזו הבחירה הנכונה, כי אף אחד שמחכה לרפactor של שנים־עשר קבצים לא שם לב לעשרים ושש שניות של תכנון, וכל מי שמחכה להשלמת צ׳אט שם לב לכל זה. זוהי ההצהרה הברורה ביותר למי מיועד כל צד של ההשוואה הזאת, והיא נמדדה על ידי צד שלישי ולא נטענה על ידי מטא.

זה גם אומר שהמעבר אינו חינם, גם אם אכפת לך רק מהקוד. כל דבר אינטראקטיבי שכיוונת אל Muse Spark 1.1 — השלמה אוטומטית, בוט לסקירת קוד, ממשק צ'אט מעל המסמכים שלך — הופך לגרוע משמעותית אם תעביר אותו לדור 1.2 במאמץ רב. השדרוג הוא ממוקד, ולמיקוד יש כיוון.

איזה מהם אתה בעצם צריך להריץ

אם העבודה שלך אינה מאגר, הישאר על Muse Spark 1.1. פייפליינים מולטימודליים, ניתוח הקשר ארוך, מחקר מדיה מעורבת, כל דבר אינטראקטיבי, כל דבר על Windows, כל דבר שכבר מחובר דרך MCP ועובד. שום דבר בהשקת Muse Code לא משפר את אלה, ומדידת השיהוי מחמירה לפחות אחד מהם.

נסה את Muse Code אם מצב הכשל שלך הוא משך הזמן. הגירות מונורפו, שדרוגי תלויות, רפקטורינג שנמשך שבועות — משימות שאתה כיום משגיח עליהן כי הסוכן מאבד את התמונה. יומן האירועים וסוכני הרקע המתמידים מכוונים בדיוק לזה, ופער של כמה נקודות במדדי ביצוע משנה פחות דווקא כשהריצה היא הארוכה ביותר. בטא, על שיבוט חד-פעמי, על מאגר שלא יכאב לך לאבד.

עשו את הניסוי הכנה אם אתם מנסים להחליט על המודל. השאירו את תשתית הבדיקות קבועה והחליפו את Muse Spark 1.1 ב־Muse Spark 1.2 מתחתיה. זה מבודד את המשתנה היחיד שהגרף של Meta מאגד, וזו הדרך היחידה לגלות אם פרמיית ה-co-training אמיתית או ש־1.2 הוא פשוט מודל קידוד מוכשר בכל מקום שבו תשימו אותו. שער יחיד הופך את זה לשינוי מחרוזת במקום תרגיל רכש — Muse Spark 1.1, Claude Opus 5, GPT-5.6 Terra, Grok 4.5 ו־Claude Fable 5 כולם יושבים מאחורי מפתח OrcaRouter אחד במחיר מחירון, עם מעבר אוטומטי בין ספקים, כך שערכת ההשוואה לא עולה לכם דבר כדי לשמור אותה זמינה. Muse Spark 1.2 הוא היוצא מן הכלל והוא חייב להגיע מ־Meta.

שאלות שכדאי לשאול לפני שמתקינים כל דבר

האם אני יכול לכוון את Muse Code ל-Muse Spark 1.1 במקום 1.2?

חומרי ההשקה של Meta אינם אומרים, והשניים נשלחו כזוג מאומן במשותף, וזו טענה נגד היותו נתמך או שימושי. הכיוון ההפוך מתועד היטב: Muse Spark 1.1 עובד בכל סוכן שמקבל נקודת קצה מותאמת אישית, וכך רוב האנשים מריצים אותו כסוכן היום. אם המטרה שלך היא השוואה מבוקרת, הרץ את 1.1 ו-1.2 בתוךשלךרתמה במקום לנסות לכופף את של Meta.

האם דרגת התורם חלה גם על Muse Spark 1.1?

Meta הציגה את המבנה הדו-שכבתי עם השקת Muse Code ו-Muse Spark 1.2, וכרטיס התעריפים שפרסמה מצמיד את תמחור התורמים לגרסה זו. נניח שההנחה של פי 12 היא הצעה מדור 1.2 עד שמטה (Meta) תאמר אחרת, ותמחור כל עומס עבודה בגרסה 1.1 ב-$1.25 וב-$4.25. אם אתה על OrcaRouter אתה במחירון לפי הגדרה, כך שאין שכבה של שיתוף נתונים שאפשר להצטרף אליה או לבטל.

אז האם הטענה בדבר 6.7 הנקודות שגויה?

לא — זה לא עבר ביקורת והוא לא מוגדר דיו, וזה שונה. ייתכן מאוד שמטה הריצה את קו הבסיס 1.1 שלה במסגרת בדיקה דומה לזו של Muse Code, ובמקרה כזה הרווח הוא תוצאה נקייה של מודל מול מודל. אבל לא פורסמה מתודולוגיה, קו הבסיס המשוער נוחת בדיוק על הציון של פיגום צד-שלישי מינימלי, ואותו מדד מניב שלושה סולמות שונים בהתאם למי שמפעיל אותו. התייחס ל-{{1}}+6.7{{/1}} כאל אינדיקציה כיוונית בלבד, והפק מספר משלך לפני שאתה מתכנן סביבו.

מה יפתור את זה?

הגשה אחת. אם מטה תציב את Muse Code בלוח התוצאות הפומבי של Terminal-Bench 2.1 תחת אותם כללים שבהם כולם הוגשו — ללא שינויי timeouts או משאבים, עמודת העלות ממולאת, ניכויי פריצה מיושמים — ה-82.9% הופכים להשוואה ל-76.2% לצד שמו של Muse Spark 1.1 ול-83.8% בראש, וכל הוויכוח הזה נפתר תוך אחר צהריים אחד. עד אז המספר היחיד שאומת באופן בלתי תלוי בהתמודדות שייך לדגם הישן יותר, והוא אומר ש-Muse Spark 1.1 פתר שלושה רבעים מ-Terminal-Bench 2.1 בתוך שלד קטן מספיק כדי לקרוא אותו בישיבה אחת, בפחות ממאתיים דולר.

הדבר השני שכדאי לעקוב אחריו הוא מצומצם יותר ומגיע מוקדם יותר: האם Artificial Analysis תפרסם את תתי-הציונים לקידוד ולביצועים סוכנותיים (agentic) עבור דור 1.2, כפי שהיא כבר מפרסמת עבור 1.1. הביצועים הסוכנותיים (agentic) היו הממד החלש ביותר שפורסם של 1.1 בפער ניכר. זה בדיוק המספר שמטא טוענת שתיקנה, ובדיוק זה שאיש מחוץ למטא עדיין לא מדד.

השוואות במאמר הזה1

זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית

© 2026 OrcaRouter

לספקים

מפעילים פלטפורמת הסקה (inference)? הציגו את המודלים שלכם ב-OrcaRouter.

צרו קשר

הצטרפו לקהילה שלנו

DiscordEmailXGitHubYouTube