Muse Code
Guides & Insights

Muse Code: מטא שחררה סוכן קוד שמפסיד במדד של עצמו

מחבר

Jim Song

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

ספקים בדרך כלל לא מפרסמים תרשים שבו הם במקום השני. Meta פרסמה שלושה כאלה. במצגת ההשקה של Muse Code — סוכן הקידוד למסוף ששחררה Meta Superintelligence Labs ב-5 באוגוסט 2026, כשהוא רץ באותו היום על Muse Spark 1.2Claude Opus 5 מוביל בכל לוח ש-Meta בחרה להראות, כולל בלוח ש-Meta בנתה ושולטת בו בעצמה. ב-Terminal-Bench 2.1 הפער הוא 3.8 נקודות. ב-DeepSWE 1.1 הוא 5.7, כש-GPT-5.6 Terra גם הוא מקדים. במדד הקידוד הפנימי של Meta עצמה הוא 8.8. הגרסה הוויראלית של ההשקה הזו — "59% ב-DeepSWE 1.1, כשהוא עוקף את Grok 4.5 ואת Gemini 3.6 Flash" — היא נכונה, וזוהי ההצהרה האמיתית המצומצמת ביותר שקיימת.

מה שהופך את ההשקה למעניינת יותר, לא פחות. Meta שחררה חבילת בנצ'מרק שאינה מנצחת בה, ושחררה אותה בכל זאת, כי הציון אינו מה שהיא מוכרת. מה שהיא מוכרת הוא זמן ריצה ששורד משימה של 24 שעות, ומחיר שחותך את התחום ביותר מסדר גודל — כל עוד אתה מוכן לתת ל־Meta לקרוא את המאגר שלך. כל נתון בנצ'מרק להלן מגיע מהתרשימים של Meta, שפורסמו ללא מתודולוגיה; היכן שקיימת מדידה בלתי תלויה, המשפט אומר כך.

מה מטא באמת שחררה

שני דברים באותו היום, מחוברים במכוון.

Muse Code — סוכן קידוד טרמינלי, בגרסת בטא ציבורית, מותקן בשורה אחת: curl -fsSL https://dev.meta.ai/install.sh | bash. macOS ו-Linux בלבד; אין build מקורי ל-Windows, אין GUI ואין תוסף IDE. Meta מתארת את תפקידו כנטילת עבודת הנדסת תוכנה מורכבת על פני מאגרי קוד גדולים — תכנון שינויים, כתיבת קוד, ואימות תוצאות.

Muse Spark 1.2 — גרסה ממוקדת קוד של מודל החשיבה של Meta, עם הקשר של 1,048,576 טוקנים, זמינה בתוך Muse Code ודרך Meta Model API בתצוגה מקדימה ציבורית. Meta אומרת שהגדילה את כוח החישוב באימון על משימות קוד והרחיבה את מגוון סביבות האימון, כשהמטרה היא עבודה ארוכת טווח: יצירת מאגר קוד שלם, רפקטורינג של קבצים מרובים וניפוי באגים מורחב.

הצימוד הוא הטענה. Meta מצהירה ששני המודלים אומנו במשותף, וכי הצימוד מפיק אפוא "שימוש טוב יותר בכלים, פחות ניסיונות חוזרים, ותפוקה באיכות גבוהה יותר מאשר עטיפה גנרית של מודל חיצוני." זהו הניסוח של Meta וזוהי טענתה; אף גורם שלישי לא בחן את המודל בתוך מסגרת מתחרה כדי לבדוק אם יתרון האימון המשותף אמיתי, או שמא Muse Spark 1.2 פשוט מתנהג כמו מודל קידוד מוכשר בכל מקום שבו תניח אותו.

שלוש מיומנויות מובנות מגיעות עם הסוכן, והן מתארות את סגנון העבודה הרצוי טוב יותר מנוסח השיווק: /planמייצר תוכנית המאושרת מראש לפני שנכתב דבר, /grillבוחן את התוכנית במבחני לחץ, ו-/goalדוחף להשלמת יעד מוגדר. תכנן, תקף את התוכנית, ואז בצע — זהו הדפוס שמשתמשים מנוסים של Claude Code ו-Codex הגיעו אליו ידנית, וכעת הוא זמין כפקודות מדרגה ראשונה.

חפיסת הבנצ'מרק, בקריאה כנה

Muse Code

Meta פרסמה השוואות על Terminal-Bench 2.1, DeepSWE 1.1, Meta Internal Coding Bench שלה ו-GDPval. המספרים, כפי שדווחו על ידי Meta:

Terminal-Bench 2.1 — Claude Opus 5 במאמץ מרבי ב-Claude Code 86.7%, Muse Spark 1.2 ב-Muse Code 82.9%, GPT-5.6 Terra ב-Codex 81.8%, Grok 4.5 ב-Grok Build 81.6%. מקום שני, והמקומות השני עד הרביעי מופרדים ב-1.3 נקודות.

DeepSWE 1.1 — Claude Opus 5 65.0%, GPT-5.6 Terra 64.8%, Muse Spark 1.2 59.3%. מקום שלישי, והלוח היחיד שבו הפער מכריע ולא קוסמטי.

Meta Internal Coding Bench — Claude Opus 5 79.4%, Muse Spark 1.2 70.6%. המשחק הביתי של Meta, וההפסד הגדול ביותר של Meta.

דור אחרי דור — Meta מדווחת על +6.7 נקודות ב-Terminal-Bench ו-+6.3 ב-DeepSWE לעומת Muse Spark 1.1. אלה המספרים הגדולים ביותר במצגת, והם אלה שמשתמש Muse Spark 1.1 באמת צריך להתעניין בהם.

כדאי לציין תקלה חשבונית אחת, כי היא הסיבה להתייחס לכל האמור לעיל כאל כיווני בלבד. אם מפחיתים את ה-+6.7 של Meta, Muse Spark 1.1 נוחת על כ-76% ב-Terminal-Bench 2.1 — אבל לוח התוצאות הציבורי ב-tbench.ai מציג 80.0% מאומתים עבור Muse Spark 1.1 מאז סוף יולי. שני המספרים יכולים להיות נכונים ועדיין לסתור זה את זה, כי שורה ב-Terminal-Bench אינה ציון של מודל. זהו ציון עבור שילוב של harness, מודל והגדרת מאמץ, וה-harness הפנימי של Meta עבור 1.1 לא היה זה שהריצה tbench. עובדה אחת זו גורמת לנזק גדול יותר להשוואת ביצועים בין ספקים מאשר כל נתון שנוי במחלוקת בודד, והיא מובילה ישירות לסעיף הבא.

זמן הריצה הוא המוצר

Muse Code

הורד את הניקוד ומה שנשאר הוא הצעת הנדסה על אי-מוות. שני מנגנונים נושאים אותה.

הראשון הוא יומן האירועים. Muse Code מוסיף כל קריאת מודל, כל הרצת כלי, כל אישור וכל עריכה ליומן מקומי, ש-Meta מתארת כמי שהופך את הסשן לניתן לשחזור מדויק ובטוח להפעלה מחדש: תהרוג אותו, תקריס אותו, תאבד את המכונה, והסוכן ממשיך בדיוק מהנקודה שבה עצר במקום לגזור מחדש את ההקשר מאפס. למתחרים יש שחזור קריסה ברמות איכות שונות; אף אחד מהם לא הפך את זה לנקודת הדגל. זה גם, אגב, ארטפקט ביקורת — תיעוד מקומי מלא של מה שתהליך אוטונומי עשה לעץ העבודה שלך, וזה בדיוק המסמך שביקורת אבטחה מבקשת, ושמרבית ממשקי ה-CLI של סוכנים אינם מסוגלים להפיק.

השני הוא מה שמטה מכנה סוכני רקע אסינכרוניים. ההבדל מתת-סוכנים רגילים הוא שהם לא מופעלים לכל תת-משימה ואז מושמדים; הם נשארים חיים לאורך כל הסשן, מבצעים את השלבים הבאים בעצמם, ובוחרים מתי לדווח בחזרה ללולאה הראשית. הרווח המוצהר הוא חביון נמוך יותר, משום שהמתזמר לא משלם עלות אתחול בכל פעם שהוא מאציל משימה.

הראיה התומכת של מטא היא מקרה בוחן אחד: Muse Code רץ במשך 24 שעות על פני יותר מ-1,000 קריאות לכלים, תוך אופטימיזציה אוטונומית של ליבות GPU על חומרת NVIDIA Hopper, עם מה שמטא מכנה שיפורים משמעותיים לעומת יישום הבסיס שסופק. לא פורסם נתון האצה, כך שהכמות המעניינת אינה התוצאה אלא משך הזמן. אלף קריאות לכלים ללא חילוץ אנושי הם משטח כשל שונה מרפוקטור של חמישים קריאות, וזו עומס עבודה שבה חסר של 3.8 נקודות במדד ביצועים חשוב הרבה פחות מאשר אם התהליך עדיין חי בשעה התשיעית.

המחיר הוא הנשק — וחלק ממנו משולם בקוד מקור

אין מנוי ל-Muse Code. החיוב הוא בטוקנים, באחת משתי רמות, והפער ביניהן הוא הדבר האגרסיבי ביותר בהשקה הזו:

רגיל — $1.25 למיליון אסימוני קלט, $0.15 למיליון קלט במטמון, $4.25 למיליון פלט. פרומפטים במסלול זה אינם משמשים לשיפור המוצרים של Meta.

תורם — $0.10 למיליון קלט, $0.002 למיליון קלט במטמון, $0.20 למיליון פלט. בתמורה, Meta עשויה להשתמש בנתונים כדי לשפר את המודלים שלה.

זה זול פי 12.5 בקלט, פי 21 בפלט, ופי 75 בקלט שמור במטמון. העבירו את זה דרך שלב סוכן ריאלי — 60,000 טוקנים של הקשר מאגר קוד פנימה, 3,000 טוקנים של תכנון ותיקון החוצה — וארבע הפינות של טבלת התמחור מדהימות. רמה סטנדרטית עם פרומפט קר: 8.8 סנט לשלב, 87.75$ לאלף שלבים. רמה סטנדרטית כשהקשר מאגר הקוד פוגע במטמון: 2.2 סנט, 21.75$ לאלף. רמת תורם קר: 0.66 סנט, 6.60$ לאלף. רמת תורם עם מטמון חם: 0.72$ עבור אותם אלף שלבים.

אותה עבודה, במחיר של פי 122 או חלק אחד מ-122 שלו, תלוי בשתי בחירות. ריצת הקרנל של Meta עצמה, בת 24 שעות ו-1,000 קריאות, עולה בערך תשעים דולר של טוקנים בשכבה שמגנה על הנתונים שלך, ופחות מדולר בשכבה שלא.

וזו ההחלטה האמיתית שההשקה הזו מציבה בפני הצוותים, והיא אינה החלטת תמחור. סוכן קידוד מבוסס מסוף קורא את מאגר הקוד שלך — זה כל תפקידו — ולכן ההנחיות בשכבת התורם מכילות את קוד המקור שלך, את ממשקי ה-API הפנימיים שלך, את ההערות שלך על מדוע קיים הפתרון העקיף, ואת כל מתקני הבדיקה שבמקרה נמצאים במאגר שלך. עבור פרויקט צד או עץ קוד פתוח, שכבת התורם היא כמעט כסף חינם. עבור מאגר קוד קנייני, או כל מאגר שנגיש לנתוני לקוחות, זו החלטת רישוי הלובשת בגדי הנחה, והיא צריכה להיות מוצגת בפני מי שמאשר את הטיפול בנתונים, ולא בפני מי שעוקב אחר חשבון הענן. Meta תמחרה זאת בהנחה של פי 12, כי הנתונים שווים ל-Meta לפחות פי 12.

מה שלא ניתן להשיג דרך ה-API

Muse Code

ה-82.9% שייך ל-Muse Spark 1.2 בתוך Muse Code. אם אתה קורא למודל ממסגרת הסוכן שלך, קנית את חצי המודל של אותו זיווג, ואף לא את חצי הרתמה — אין יומן אירועים, אין סוכני רקע מתמשכים, ואם הטענה של Meta על אימון משותף אומרת משהו, גם אין התנהגות שימוש בכלים מכווננת. אז יש כאן שתי הערכות נפרדות, והערבוב ביניהן הוא הטעות הקלה ביותר לעשות השבוע: האם Muse Code מנצח את הסוכן שאתה כבר מריץ, והאם Muse Spark 1.2 הוא מודל טוב יותר מזה שאתה קורא לו כרגע?

השאלה השנייה היא הזולה יותר לענות עליה, כי היא דורשת רק להחזיק את הרתמה שלך קבועה ולהחליף את המודל שמתחתיה. כדאי לדייק בנוגע לזמינות: Muse Spark 1.2 מסופק ישירות על ידי Meta ואינו בקטלוג של OrcaRouter. Muse Spark 1.1 הוא, במחיר של $1.25 ו-$4.25 — המחיר הרשמי של Meta בדיוק, כי OrcaRouter מוסיף 0% רווח ומעביר את מחירי הספק ישירות, וזו גם הסיבה לכך ששינוי מחיר של ספק מופיע אצלנו ביום שבו הוא קורה במקום לאחר מחזור חוזה. הטלמטריה הייצורית שלנו לשבעה ימים עבור 1.1 מראה כי זמן ה-p50 עד לאסימון הראשון הוא 1.84 שניות ו-p95 הוא 6.00 שניות, וזו ציפיית חביון שימושית יותר מכל כלי benchmark שייתן לך.

הערך המעשי של שער יחיד בשבוע כמו זה הוא שסט ההשוואה — Claude Opus 5, GPT-5.6 Terra, Grok 4.5, Gemini 3.6 Flash ו-Muse Spark 1.1 — נמצא מאחורי מפתח אחד במחיר מחירון, כך שמבחן A/B הוא שינוי מחרוזת ולא תהליך רכש. זה גם מכסה את הסיכון המבני בהצעה של Meta: ל-Muse Spark 1.2 יש בדיוק ספק אחד, מה שהופך אותה לנקודת כשל יחידה מעצם בנייתה. מעבר אוטומטי בין ספקים הוא ההבדל בין אחר צהריים גרוע עבור Meta שיהיה גם אחר צהריים גרוע עבור הסוכן שלך, או לא.

זו גם הסיבה ש-1.2 שוחרר בשקט ובאיטיות

Muse Spark 1.2 הופיע ב-API של Meta ב-5 באוגוסט ללא הודעה וללא שינוי במספרים — אותו הקשר של 1M, אותם $1.25 ו-$4.25, אותה חוגת חשיבה בחמש רמות כמו Muse Spark 1.1. הדבר היחיד שזז נמדד מבחוץ: Artificial Analysis מדדה את הזמן עד לטוקן הראשון ב-26.12 שניות לעומת 2.90 שניות של 1.1 במאמץ חשיבה מרבי, מה שקנה שלוש נקודות במדד האינטליגנציה, מ-51 ל-54. כשקוראים את זה כשחרור של מודל לשימוש כללי, זו עסקה מוזרה — פי תשע מההמתנה תמורת שלוש נקודות.

כשקוראים את זה כחצי המודל של סוכן שאומן במשותף, זהו הטרייד-אוף המובן מאליו. אף אחד שמחכה לריפקטור של שנים-עשר קבצים לא שם לב לעשרים ושש שניות של תכנון; האדם שמחכה להשלמת צ'אט שם לב לכל זה. מטא לא שלחה מודל צ'אט בשקט ובתקווה שאף אחד לא ימדוד את זמן ההשהיה. היא שחררה את המנוע לפני המכונית, וההכרזה הגיעה כשהמכונית הגיעה. דף המפתחים של Muse Spark של מטא מציג כעת גם 1.2.

{{1}}המסקנה הנובעת היא אזהרה לכל מי שאימץ את המשפחה הזו בשל רוחב יריעתה.{{/1}} {{2}}Muse Spark 1.1{{/2}} שווק כמודל חשיבה מולטי-מודאלי — {{3}}טקסט, תמונות, וידאו, אודיו ו-PDF, טוב למחקר מדיה מעורבת.{{/3}} {{4}}המיצוב של גרסה 1.2 הוא עבודת תוכנה{{/4}}, וחומר ההשקה שלה הוא {{5}}סוכן קידוד{{/5}}. {{6}}המשטח המולטי-מודאלי לא הוסר{{/6}}, אבל זה כבר לא מה ש{{7}}Meta{{/7}} ממטב או מפרסמת, ו{{8}}אף אחד מחוץ ל-Meta לא פרסם תוצאת וידאו או אודיו עבור 1.2.{{/8}}

במקום שבו Muse Code עדיין דק

זה בגרסת בטא, ומסומן ככזה. שום דבר לגבי ההבטחה של יומן האירועים לא אומת על ידי אף אחד מחוץ למטא.

macOS ו־Linux בלבד.מפתחי Windows עובדים עם WSL או לא עובדים בכלל, וזו מגבלה אמיתית עבור ציי מחשבים ארגוניים, לא סתם אי־נוחות.

מסוף בלבד.אין ממשק גרפי, אין אינטגרציה עם IDE, ואין סוכנים מקבילים מתארחים בענן מהסוג ש-Codex כבר מציע. חומר ההשקה של Meta אינו מזכיר תמיכה ב-MCP.

אין מתודולוגיה שפורסמה מאחורי אף אחד מתרשימי המדדים, ואין עדיין הערכה עצמאית של הסוכן או של תת-ציוני הקידוד של Muse Spark 1.2. ל-Artificial Analysis יש מדד מורכב עבור 1.2, אבל לא את הפירוט הקידודי והסוכני לפי מדדים שהוא מפרסם עבור 1.1 — וציונו הסוכני של 1.1 היה הממד החלש ביותר שלו בפער גדול, מה שהופך אותו בדיוק למספר שיכול להכריע לגבי הגרסה הזו.

Meta מאחרת.לקלוד קוד ולקודקס יש שנה של הרגל, מערכות אקולוגיות של תוספים וזרימות עבודה צוותיות שנבנו סביבם. יומן אירועים חסין לקריסות הוא סיבה טובה לנסות משהו; הוא כשלעצמו אינו סיבה להעביר צוות.

שאלות שאנשים באמת שואלים

האם Muse Code חינמי?

לא, אבל אין גם מנוי — בניגוד לתוכניות Claude Code ו-Codex שעמן הוא מתחרה, Muse Code מחויב אך ורק לפי אסימון דרך Meta Model API. לכן העלות מושפעת מכמות ההקשר של המאגר שהסשנים שלך דוחפים, ולא ממספר המשתמשים, מה שמעדיף משתמשים כבדים מזדמנים ומעניש סוכנים פעילים תמידית. מסלול התורמים קרוב מספיק לחינם כך שהמחיר אינו חסם אמיתי לנסות אותו.

האם דרגת התורם מתאמנת על הקוד הפרטי שלי?

התנאים של Meta עבור אותה דרגה הם שהנתונים עשויים לשמש לשיפור המודלים שלה, והפרומפטים של סוכן קידוד מכילים את הקוד שלך. Meta מצהירה שפרומפטים בדרגה הסטנדרטית אינם משמשים לשיפור המוצרים שלה; זו הדרגה שבה יש להשתמש עבור כל דבר קנייני. יש להתייחס להחלטה כהחלטה על טיפול בנתונים עם הנחה מצורפת, לא כהעדפת חיוב — ושימו לב שההנחה חלה לכל טוקן, כך שהתמריץ להוריד דרגה בשקט גדל בדיוק ככל שהשימוש שלכם גדל.

האם אני יכול להשתמש ב-Muse Spark 1.2 עם Claude Code או עם סוכן משלי?

המודל זמין דרך ה־Meta Model API באופן עצמאי מ־Muse Code, אז כן — לכל דבר שמקבל endpoint מותאם אישית. מה שלא תקבלו הוא הצימוד שאומן במשותף, ש־Meta זוקפת לזכותו את תוצאות ה־benchmark שלה, והציפייה הכנה היא שמודל שירוץ מחוץ ל־harness שבו כוונן ישיג ציון נמוך מהמספר בתרשים. אם המטרה היא להעריך את המודל ולא את הסוכן, הריצו אותו מול Claude Opus 5 ו־GPT-5.6 Terra ב־harness שלכם והתעלמו מהמצגת לחלוטין.

מי צריך להתקין את זה השבוע

אם אתה מריץ משימות אוטונומיות לטווח ארוך — הגרות, שדרוגי תלויות ברחבי מונוריפו, או כל דבר שבדרך כלל היית צריך להשגיח עליו כי הסוכן מאבד את המקום שלו — Muse Code שווה אחר צהריים על שיבוט חד-פעמי. יומן האירועים וסוכני הרקע הקבועים מכוונים בדיוק למצב הכשל הזה, והפער במדדים הוא הקטן ביותר דווקא במקום שבו משך המשימה הוא הארוך ביותר.

אם אתה עובד על בסיס קוד פתוח או רגישות נמוכה והעלות היא האילוץ המרכזי שלך, שכבת התורם היא המספר המעניין ביותר בשוק סוכני הקידוד כרגע, ו-0.66 סנט לשלב אינו שגיאת הקלדה.

אם אתה מריץ צוות על Claude Code או Codex נגד מאגר קנייני, אין כאן עדיין שום דבר שמכריח מעבר. Muse Code נמצא במקום השני או השלישי בכל לוח שהספק שלו בחר, מחירי השכבה הסטנדרטית עומדים בשוויון עם המתחרים ולא מתחתיהם, והמבדל הוא תכונת אמינות שאף אחד מחוץ ל-Meta לא בדק. הדבר שיש לשים לב אליו הוא לא המדד הבא, אלא האם יומן האירועים מחזיק מעמד כשמישהו שלא עובד ב-Meta מריץ דרכו אלף קריאות לכלים.

השוואות במאמר הזה3

זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית

© 2026 OrcaRouter

לספקים

מפעילים פלטפורמת הסקה (inference)? הציגו את המודלים שלכם ב-OrcaRouter.

צרו קשר

הצטרפו לקהילה שלנו

DiscordEmailXGitHubYouTube