כרטיס כותרת ראשי לחדשות על כך ש-Muse Spark 1.3 עם max reasoning זמין כעת. מעל הכותרת: 'Meta Superintelligence Labs — 4 בספטמבר 2026'; כותרת ראשית: 'Muse Spark 1.3 עם max reasoning זמין כעת'; תת-כותרת: מציינת ש-Meta עברה את בדיקות הבטיחות יומיים לאחר ההשקה, ופתחה את מצב ה-reasoning שמאחורי הציונים המובילים שלה ב-Muse Code וב-Meta Model API באותו מחיר; תגיות: 'reasoning effort: max', 'אותו מחיר מחירון: $1.25 / $4.25', ו-'הקונפיגורציה שמאחורי DeepSWE 75.4'; כותרת תחתונה: 'עכשיו ניתן לבחירה ב-muse-spark-1.3 — אסימוני reasoning מחויבים כפלט'; לוגו OrcaRouter שולב בפינה הימנית התחתונה.
Guides & Insights

Muse Spark 1.3 Max Reasoning זמין כעת: ההגדרה שמאחורי הציונים המובילים של Meta נשלחת כעת לכולם

מחבר

Elias Hawthorne

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים →
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

Muse Spark 1.3 — מודל ההנמקה החלוצי שמעבדות Meta Superintelligence Labs השיקו ב-2 בספטמבר — קיבל זה עתה את המצב שעליו נבנה לוח התוצאות שלו. ב-4 בספטמבר, לאחר יומיים של בדיקות בטיחות נוספות, מטא פתחה למפתחים את הגדרת ההנמקה "max" עתירת המחשוב ביותר של המודל, ב-Meta Model API וב-Muse Code, סוכן הקידוד הטרמינלי שלה. מנהל הבינה המלאכותית הראשי, אלכסנדר וונג, הכריז על ההשקה ב-X וחשבון @AIatMeta של החברה אישר זאת; מה שהיה בהשקה תצורה שהוגבלה למטא ולתצוגה מקדימה לשותפים הוא כעת רמת הנמקה שכל מפתח יכול לבחור.

הרצף הזה חשוב, מכיוון שכמה מהמספרים ששלטו בסיקור ההשקה של Muse Spark 1.3 — 75.4 ב‑DeepSWE v1.1, 66.9 ב‑OSWorld 2.0, 1,754 ב‑GDPval‑AA v2 — הגיעו מתצורת ה‑max, בעוד שהמודל שמפתחים יכלו בפועל לקרוא לו שוגר עם מאמץ חשיבה מוגבל ל‑"xhigh". מטה הייתה מפורשת בהשקה ש‑max עדיין בשלבי בדיקות בטיחות, אבל הפיצול גרם לכך שלוח התוצאות הראשי והמודל הקריא היו שני דברים שונים במשך יומיים. שחרור יום חמישי סוגר את הפער הזה, והוא עושה זאת מבלי לגעת במחיר לאסימון. נתוני האמת מידה ברשימה זו הם של מטה עצמה וטרם שוחזרו על ידי מערך בדיקה בלתי תלוי; כל דיווח של ספק בכתבה זו מסומן ככזה.

מה שנמנע — ומה שהשתנה ב-4 בספטמבר

סולם החשיבה של Muse Spark 1.3 נותר באותה צורה מאז שנפתח ה-API בתשלום של המשפחה: החשיבה תמיד פעילה, ופרמטר המאמץ של המודל ב-Meta Model API מקבל ערכים של minimal, low, medium, high ו-xhigh, כשהמודל משקיע יותר מתקציב הפלט שלו בחשיבה ככל שהרמה עולה. Max נמצא מעל xhigh — יותר כוח עיבוד, יותר טוקנים של חשיבה, ולפי דבריה של Meta, חזק משמעותית בעבודה אגנטית ארוכת טווח. בהשקה ב-2 בספטמבר, Meta שחררה את כל הרמות עד xhigh, אך השאירה את max מחוץ ל-API הציבורי עד להשלמת מה שהיא כינתה בדיקות בטיחות נוספות, ושיתפה אותו רק עם קבוצה מצומצמת של שותפים — מספיק להרצת הערכה עצמאית, אך לא מספיק לעומס ייצור.

ב-4 בספטמבר אמר וואנג שהבדיקות הושלמו. Max הוא כעת הגדרה שניתן לבחור ב־Muse Code — סקריפט ההתקנה נמצא ב־dev.meta.ai/install.sh — ובמודל muse-spark-1.3 דרך Meta Model API, שבו פרמטר המאמץ מקבל כעת ערך max. וואנג תיאר את הפיגור בן היומיים כדרך של Meta להגביל גישה "ברמת התצורה," ואמר ל־Axios ש־Meta לא נאלצה לעצור את העבודה הרחבה יותר שלה בשל חששות בטיחותיים. החלון היה קצר, אבל מדובר בתקדים אמיתי: Meta מוכנה כעת להחזיק מצב חשיבה ספציפי מאחורי סקירת בטיחות, ובמקביל לשחרר את שאר נקודת הביקורת (checkpoint) מיד.

אזהרה מעשית למי שקורא למודל דרך שער גישה (gateway) במקום דרך נקודת הקצה של מטא עצמה: כמה עמודי תיעוד של צד שלישי ורשימות מאגדים נכתבו ביום ההשקה ועדיין מציינים את מאמץ החשיבה (reasoning effort) רק עד xhigh. הערך המקסימלי הוא פריסה בצד של מטא, אז לפני שמניחים ש-max זמין, בדקו שהמסלול שבו אתם קוראים עדכן את שטח הפרמטרים שלו — פרוקסי שאימת את הערכים שהוא מקבל ב-2 בספטמבר עלול לדחות את "max" עד שהמתחזקים שלו ישלימו את הפער.

מה max באמת קונה — ואיפה זה לא עוזר

החומרים שפרסמה Meta ביום חמישי כוללים פיצול מפורש בין max לבין xhigh על פני מדדי הביצועים שהיא מריצה, וזה הדבר השימושי ביותר שפרסמה עד כה על המודל. כל זה מדווח על ידי הספק, הופק בתוך סביבת ה‑Muse Code של Meta עצמה, ו‑Meta אומרת שההשוואות שלה מול Claude Opus 5 ו‑GPT‑5.6 Sol היו ריצות "במיטב המאמץ" בהגדרות המקסימליות של אותן מתחרות, ש"ייתכן שאינן משקפות ביצועים מותאמי ספק". עם הסתייגות זו, הפיצול מספר סיפור כיווני ברור:

• OSWorld 2.0 (משימות של סוכן המשתמש במחשב) — 66.9 ב-max לעומת 57.2 ב-xhigh

• GDPval-AA v2 (ציון Elo של סוכן עבודת ידע) — 1,754 במקסימום לעומת 1,709 ב-xhigh

• JobBench (משימות מקצועיות ארוכות טווח) — 64.9 ב-max לעומת 61.2 ב-xhigh

• DeepSearchQA — תיקו על 89.4

• Terminal-Bench 2.1 (קידוד של סוכן טרמינל) — 89.2 ב‑xhigh לעומת 88.8 ב‑max, הסוויטה היחידה שבה התצורה ששוחררה ב‑2 בספטמבר מנצחת.

A comparison scoreboard titled 'Muse Spark 1.3 — max vs xhigh, the split'. Left column Max (released Sept 4, 2026): OSWorld 2.0 66.9, Terminal-Bench 2.1 88.8, GDPval-AA v2 (Elo) 1,754, JobBench 64.9, DeepSearchQA 89.4, Available to all developers. Right column Xhigh (released Sept 2, 2026): OSWorld 2.0 57.2, Terminal-Bench 2.1 89.2, GDPval-AA v2 (Elo) 1,709, JobBench 61.2, DeepSearchQA 89.4, Available to all developers. Footer: 'Benchmark splits per Meta's Sept 4 release materials — vendor-reported, not independently reproduced. Xhigh wins Terminal-Bench 2.1.' OrcaRouter logo bottom-right.

הדפוס שווה קריאה מדוקדקת. Max עוזר ביותר כשהמשימה היא לולאת סוכן ארוכה — הפעלת מחשב, עבודה על תקציר עבודה אינטלקטואלית, ניהול לוח זמנים של תת-משימות בדרך ש-JobBench עושה. על מדד טרמינל של סיבוב בודד הוא לא הוסיף דבר ועלה קצת: Terminal-Bench הוא תזכורת לכך ש"חשיבה נוספת" אינה שדרוג מונוטוני, וזו הסיבה לבצע A/B בין max ל-xhigh על עומס העבודה שלך במקום להניח שההגדרה הגבוהה יותר עדיפה בכל מקום. Meta גם מסמנת את תוצאת DeepSWE v1.1 של 75.4 — הכותרת של היום הראשון, עלייה מ-59.3 ש-Meta דיווחה על Muse Spark 1.2 שישה שבועות קודם לכן — כמספר של תצורת max. זה הנתון שמעריכים בלתי תלויים יריצו ראשון.

הקריאה העצמאית מתחילה להדביק את הפער

בהשקה לא הייתה אף מדידה בלתי תלויה, והפער הזה נסגר בלוח זמנים שבמקרה תואם לפריסת ה-max. ה-Coding Agent Index של Artificial Analysis — שמדרג כל מודל בתוך סביבת ה-harness המקורית של סוכן הקוד שלו ומשלב משימות DeepSWE, Terminal-Bench ו-SWE-Atlas — הציב את Muse Spark 1.3 (max) השבוע עם ציון 68 בסביבת Muse Code, במקום השני בטבלה אחרי Claude Opus 5 (xhigh) בסביבת Claude Code ולפני Claude Fable 5 (max) עם 67 ו-GPT-5.6 Sol (max) עם 65. אותה טבלה מדרגת את תצורת ה-xhigh המשווקת עם ציון 64 באותה סביבת Muse Code, וזוהי קריאת ה-like-for-like הנקייה ביותר עד כה של מה שה-max מוסיף — כארבע נקודות מדד — על סט משימות בלתי תלוי. שורת הטבלה הזו פורסמה בזמן שה-max עדיין היה בתצוגה מקדימה לשותפים; התצורה שהיא מתארת היא זו שהפכה לזמינה באופן כללי ב-4 בספטמבר.

Artificial Analysis עדכנה גם את כרטיס המודל שלה עבור תצורת ה־max מאז ההשקה. במהלך תקופת התצוגה המקדימה הכרטיס לא ציין שום ספק או מחיר; הכרטיס הנוכחי מציין כעת את Meta במחיר הסטנדרטי של $1.25 למיליון טוקני קלט ו־$4.25 למיליון טוקני פלט — אותו מחיר מחירון כמו Muse Spark 1.2 — ומוסיף אזהרת מילוליות: ריצת ההערכה של AA צרכה כ־130 מיליון טוקנים לעומת חציון של 79 מיליון, עלתה כ־$1,335 בסך הכול, ומגיעה לכ־$0.95 למשימה לפי אומדן המשימה של AA, בקצב של כ־190 טוקני פלט לשנייה.

מספר אחד מהסיקור הקודם מצריך בדיקת גרסה. Artificial Analysis עדכנה השבוע את מדד ה‑Intelligence Index שלה ל‑v4.2 — באותו שבוע שבו max שוחרר — תוך שקלול מחדש של התחום והזזת החציונים. בכרטיס הנוכחי, תצורת ה‑max מקבלת 53 לעומת חציון של 29 במודלים דומים; ה‑62 שהופץ בסיקור שבוע ההשקה נמדד על הגרסה הקודמת של המדד, ואין להשוות בין השניים. הפיצול של xhigh‑versus‑max של Meta המופיע למעלה אינו תלוי במדד של AA ואינו מושפע מעדכון הגרסה.

A screenshot of the Artificial Analysis model page for Muse Spark 1.3 (max), showing a score of 53 on the Artificial Analysis Intelligence Index against a comparable-model median of 29, input pricing of $1.25 and output pricing of $4.25 per 1M tokens with an 88% cache discount, a per-task cost estimate near $0.95, about 190 output tokens per second, a 1M-token context window, and a note that the configuration is 'somewhat verbose' after generating roughly 130M tokens against a 79M median.

מה העלות המקסימלית — החיוב הוא בטוקנים, לא במחירון

Meta אינה מפרסמת מחיר נפרד עבור תצורת המקסימום, וגם לא ניתוח השהיה ייעודי. המחיר לטוקן זהה ל־Muse Spark 1.2 ולכל רמת מאמץ אחרת ב־Muse Spark 1.3: 1.25$ למיליון טוקני קלט, 4.25$ למיליון טוקני פלט, ו־0.15$ עבור קלט במטמון בשכבה הרגילה. טוקני חשיבה מחויבים כטוקני פלט ונספרים כנגד תקציב הפלט, ולכן בחירה במקסימום אינה העלאת מחיר בסעיף נפרד — היא התחייבות לבזבז יותר מתקציב זה על חשיבה לפני מתן תשובה.

זה הופך את שאלת העלות האמיתית לשאלה של נפח טוקנים, והנתונים המוקדמים מראים ש־max יקר בדיוק במקום שבו xhigh חסכוני. הריצה המנוטרת של AA צרכה כ־130 מיליון טוקנים בהערכה בודדת של התצורה. עבור מפתח שכבר מריץ לולאות סוכן ארוכות ב־xhigh, מבחן ה־A/B שבאמת חשוב אינו "האם max עובר יותר משימות", אלא "האם max עובר מספיק משימות נוספות כדי לכסות חשבון טוקנים גדול משמעותית על אותו עומס עבודה".

השכבה Contributor של Meta — 0.10$ לקלט ו-0.20$ לפלט על כל מיליון טוקנים, בתמורה לכך ש־Meta תוכל לאמן על ה־prompts וה־completions שלך — חלה על אותה נקודת checkpoint. לדברי Meta, אחוז דו־ספרתי משמעותי של מפתחים בוחרים בה. תנאי Contributor הופכים כל הגשה לנתוני אימון, ומגבלות הקצב שלה נוקשות, כך שהיא ברירת מחדל גרועה לפיזור צריכה בפרודקשן, אבל דרך לגיטימית להריץ בזול ניסויים מקסימליים יקרים, אם עסקת הנתונים מקובלת עליך.

קל לבדוק את עוגן התמחור של כל זה בלי לסמוך על המילה של Meta, מכיוון שהמחיר של הצ'קפוינט Muse Spark 1.3 זהה למחיר שכבר מופיע ב-OrcaRouter, במחירון הרשמי של Meta עצמה: Muse Spark 1.2 מופיע ב-OrcaRouter במחיר של $1.25 למיליון טוקני קלט ו-$4.25 למיליון טוקני פלט, עם אפס תוספת מחיר, לכן את הטענה בדבר "מחיר ללא שינוי" ניתן לבדוק מול עמוד חי שמציג בדיוק את המספרים האלה. Muse Spark 1.3 עצמו עדיין לא רשום ב-OrcaRouter. כשספק מהספקים שאנו מציעים יתחיל לשרת אותו עם max, המחיר שיוצג אצלנו יהיה מחיר המחירון של Meta כפי שהוא עובר ישירות — אנחנו לא מוסיפים שום תוספת למחירי הספקים — וכל הוזלה של הספק תיכנס לתוקף באותו היום שבו Meta תבצע אותה. בשחרור מהסוג הזה, שבו הכלכלה המעניינת נמצאת בהיקף הטוקנים ולא במחיר המוצהר, ההעברה הישירה הזאת היא מה ששומרת על כך שהמספר שבו תחויב בפועל יהיה שווה למספר ש-Meta מפרסמת.

A screenshot of the OrcaRouter model page for Muse Spark 1.2, the checkpoint Muse Spark 1.3 is priced identically to, showing header stats $1.25 input and $4.25 output per million tokens, p50 time-to-first-token 7.84 s, p50 total 10.00 s and 48.9M, the description 'Muse Spark 1.2 is Meta's reasoning model for complex agentic tasks... a drop-in upgrade rather than a new tier', and the 'Get the Muse Spark 1.2 API' and 'Try in playground' buttons.

מי צריך לעבור ל-max

ההחלטה מתפצלת בחדות:

• Switch עבור עומסי עבודה סוכניים ארוכי-טווח — computer-use, תקצירי עבודת ידע, לולאות כלים רב-שלביות ב־Muse Code — שבהם גם החלוקה של Meta עצמה וגם לוח סוכני־הקוד של AA מראים את הרווחים המקסימליים הגדולים ביותר. בצע עליו בדיקת A/B מול xhigh על מדגם של המשימות האמיתיות שלך תחילה, כי אריכות היתר היא ממשית.

• הישאר על xhigh עבור קריאות בנפח גבוה, רגישות להשהיה, או קצרות של סיבוב בודד, שבהן max בעיקר מוסיף טוקנים. Terminal-Bench הוא ההוכחה שהוא לא תמיד מוסיף יכולת.

• צפו בשלושה דברים מכאן: פרסום המשקלים הפתוחים (open-weights) שצוקרברג הבטיח ללא תאריך, ההשקה הצרכנית של Muse Spark 1.3 לאינסטגרם, פייסבוק ו-Meta AI בשבועות הקרובים, והאם לוח סוכני הקוד של Artificial Analysis מתחיל לתמחר את השורה המקסימלית כעת שהתצורה זמינה באופן כללי.

השער בן היומיים התגלה כקצר, אבל הוא העלה נקודה שמחזיקה מעמד מעבר להשקה עצמה: המספרים החזקים ביותר של Meta עבור Muse Spark 1.3 מעולם לא היו אשליה — הם רק חיכו לבדיקת בטיחות. החל מה-4 בספטמבר, המודל שמפתח יכול לזמן והמודל בלוח התוצאות הם סוף סוף אותו מודל. השאלה אם max שווה את הטוקנים שלו היא כעת שאלה אמפירית שכל מפתח יכול לענות עליה, ב-API של Meta או בכל דרך שבה הם כבר משתמשים כדי להגיע למשפחת Muse Spark.