
Muse Spark 1.3 Max Reasoning זמין כעת: ההגדרה שמאחורי הציונים המובילים של Meta נשלחת כעת לכולם
- openaiחדשOpenAI: GPT-6.1 Sol2026-09-2952אינטליגנציה
- anthropicחדשAnthropic: Claude Sonnet 5.52026-09-2856אינטליגנציה
- typesafeחדשTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 לכל 1M טוקנים · 221 tok/s
- OpenAIחדשOpenAI: GPT-6 Luna2026-09-2238אינטליגנציה
- OpenAIחדשOpenAI: GPT-6 Sol2026-09-2248אינטליגנציה
- AnthropicחדשAnthropic: Claude Opus 5.52026-09-2258אינטליגנציה
- xAIחדשGrok 4.72026-09-2146אינטליגנציה
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 לכל 1M טוקנים · 110 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 לכל 1M טוקנים · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040אינטליגנציה
- OpenAIOpenAI: GPT-6 Astra2026-09-0453אינטליגנציה77כתיבת קוד
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241אינטליגנציה76כתיבת קוד
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245אינטליגנציה76כתיבת קוד
- AnthropicAnthropic: Claude Fable 5.12026-09-0153אינטליגנציה82כתיבת קוד
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 לכל 1M טוקנים · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 לכל 1M טוקנים · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642אינטליגנציה72כתיבת קוד
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 לכל 1M טוקנים · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845אינטליגנציה75כתיבת קוד
- obsidianQwen3.8 27B2026-08-1534אינטליגנציה68כתיבת קוד
Muse Spark 1.3 — מודל ההנמקה החלוצי שמעבדות Meta Superintelligence Labs השיקו ב-2 בספטמבר — קיבל זה עתה את המצב שעליו נבנה לוח התוצאות שלו. ב-4 בספטמבר, לאחר יומיים של בדיקות בטיחות נוספות, מטא פתחה למפתחים את הגדרת ההנמקה "max" עתירת המחשוב ביותר של המודל, ב-Meta Model API וב-Muse Code, סוכן הקידוד הטרמינלי שלה. מנהל הבינה המלאכותית הראשי, אלכסנדר וונג, הכריז על ההשקה ב-X וחשבון @AIatMeta של החברה אישר זאת; מה שהיה בהשקה תצורה שהוגבלה למטא ולתצוגה מקדימה לשותפים הוא כעת רמת הנמקה שכל מפתח יכול לבחור.
הרצף הזה חשוב, מכיוון שכמה מהמספרים ששלטו בסיקור ההשקה של Muse Spark 1.3 — 75.4 ב‑DeepSWE v1.1, 66.9 ב‑OSWorld 2.0, 1,754 ב‑GDPval‑AA v2 — הגיעו מתצורת ה‑max, בעוד שהמודל שמפתחים יכלו בפועל לקרוא לו שוגר עם מאמץ חשיבה מוגבל ל‑"xhigh". מטה הייתה מפורשת בהשקה ש‑max עדיין בשלבי בדיקות בטיחות, אבל הפיצול גרם לכך שלוח התוצאות הראשי והמודל הקריא היו שני דברים שונים במשך יומיים. שחרור יום חמישי סוגר את הפער הזה, והוא עושה זאת מבלי לגעת במחיר לאסימון. נתוני האמת מידה ברשימה זו הם של מטה עצמה וטרם שוחזרו על ידי מערך בדיקה בלתי תלוי; כל דיווח של ספק בכתבה זו מסומן ככזה.
מה שנמנע — ומה שהשתנה ב-4 בספטמבר
סולם החשיבה של Muse Spark 1.3 נותר באותה צורה מאז שנפתח ה-API בתשלום של המשפחה: החשיבה תמיד פעילה, ופרמטר המאמץ של המודל ב-Meta Model API מקבל ערכים של minimal, low, medium, high ו-xhigh, כשהמודל משקיע יותר מתקציב הפלט שלו בחשיבה ככל שהרמה עולה. Max נמצא מעל xhigh — יותר כוח עיבוד, יותר טוקנים של חשיבה, ולפי דבריה של Meta, חזק משמעותית בעבודה אגנטית ארוכת טווח. בהשקה ב-2 בספטמבר, Meta שחררה את כל הרמות עד xhigh, אך השאירה את max מחוץ ל-API הציבורי עד להשלמת מה שהיא כינתה בדיקות בטיחות נוספות, ושיתפה אותו רק עם קבוצה מצומצמת של שותפים — מספיק להרצת הערכה עצמאית, אך לא מספיק לעומס ייצור.
ב-4 בספטמבר אמר וואנג שהבדיקות הושלמו. Max הוא כעת הגדרה שניתן לבחור ב־Muse Code — סקריפט ההתקנה נמצא ב־dev.meta.ai/install.sh — ובמודל muse-spark-1.3 דרך Meta Model API, שבו פרמטר המאמץ מקבל כעת ערך max. וואנג תיאר את הפיגור בן היומיים כדרך של Meta להגביל גישה "ברמת התצורה," ואמר ל־Axios ש־Meta לא נאלצה לעצור את העבודה הרחבה יותר שלה בשל חששות בטיחותיים. החלון היה קצר, אבל מדובר בתקדים אמיתי: Meta מוכנה כעת להחזיק מצב חשיבה ספציפי מאחורי סקירת בטיחות, ובמקביל לשחרר את שאר נקודת הביקורת (checkpoint) מיד.
אזהרה מעשית למי שקורא למודל דרך שער גישה (gateway) במקום דרך נקודת הקצה של מטא עצמה: כמה עמודי תיעוד של צד שלישי ורשימות מאגדים נכתבו ביום ההשקה ועדיין מציינים את מאמץ החשיבה (reasoning effort) רק עד xhigh. הערך המקסימלי הוא פריסה בצד של מטא, אז לפני שמניחים ש-max זמין, בדקו שהמסלול שבו אתם קוראים עדכן את שטח הפרמטרים שלו — פרוקסי שאימת את הערכים שהוא מקבל ב-2 בספטמבר עלול לדחות את "max" עד שהמתחזקים שלו ישלימו את הפער.
מה max באמת קונה — ואיפה זה לא עוזר
החומרים שפרסמה Meta ביום חמישי כוללים פיצול מפורש בין max לבין xhigh על פני מדדי הביצועים שהיא מריצה, וזה הדבר השימושי ביותר שפרסמה עד כה על המודל. כל זה מדווח על ידי הספק, הופק בתוך סביבת ה‑Muse Code של Meta עצמה, ו‑Meta אומרת שההשוואות שלה מול Claude Opus 5 ו‑GPT‑5.6 Sol היו ריצות "במיטב המאמץ" בהגדרות המקסימליות של אותן מתחרות, ש"ייתכן שאינן משקפות ביצועים מותאמי ספק". עם הסתייגות זו, הפיצול מספר סיפור כיווני ברור:
• OSWorld 2.0 (משימות של סוכן המשתמש במחשב) — 66.9 ב-max לעומת 57.2 ב-xhigh
• GDPval-AA v2 (ציון Elo של סוכן עבודת ידע) — 1,754 במקסימום לעומת 1,709 ב-xhigh
• JobBench (משימות מקצועיות ארוכות טווח) — 64.9 ב-max לעומת 61.2 ב-xhigh
• DeepSearchQA — תיקו על 89.4
• Terminal-Bench 2.1 (קידוד של סוכן טרמינל) — 89.2 ב‑xhigh לעומת 88.8 ב‑max, הסוויטה היחידה שבה התצורה ששוחררה ב‑2 בספטמבר מנצחת.

הדפוס שווה קריאה מדוקדקת. Max עוזר ביותר כשהמשימה היא לולאת סוכן ארוכה — הפעלת מחשב, עבודה על תקציר עבודה אינטלקטואלית, ניהול לוח זמנים של תת-משימות בדרך ש-JobBench עושה. על מדד טרמינל של סיבוב בודד הוא לא הוסיף דבר ועלה קצת: Terminal-Bench הוא תזכורת לכך ש"חשיבה נוספת" אינה שדרוג מונוטוני, וזו הסיבה לבצע A/B בין max ל-xhigh על עומס העבודה שלך במקום להניח שההגדרה הגבוהה יותר עדיפה בכל מקום. Meta גם מסמנת את תוצאת DeepSWE v1.1 של 75.4 — הכותרת של היום הראשון, עלייה מ-59.3 ש-Meta דיווחה על Muse Spark 1.2 שישה שבועות קודם לכן — כמספר של תצורת max. זה הנתון שמעריכים בלתי תלויים יריצו ראשון.
הקריאה העצמאית מתחילה להדביק את הפער
בהשקה לא הייתה אף מדידה בלתי תלויה, והפער הזה נסגר בלוח זמנים שבמקרה תואם לפריסת ה-max. ה-Coding Agent Index של Artificial Analysis — שמדרג כל מודל בתוך סביבת ה-harness המקורית של סוכן הקוד שלו ומשלב משימות DeepSWE, Terminal-Bench ו-SWE-Atlas — הציב את Muse Spark 1.3 (max) השבוע עם ציון 68 בסביבת Muse Code, במקום השני בטבלה אחרי Claude Opus 5 (xhigh) בסביבת Claude Code ולפני Claude Fable 5 (max) עם 67 ו-GPT-5.6 Sol (max) עם 65. אותה טבלה מדרגת את תצורת ה-xhigh המשווקת עם ציון 64 באותה סביבת Muse Code, וזוהי קריאת ה-like-for-like הנקייה ביותר עד כה של מה שה-max מוסיף — כארבע נקודות מדד — על סט משימות בלתי תלוי. שורת הטבלה הזו פורסמה בזמן שה-max עדיין היה בתצוגה מקדימה לשותפים; התצורה שהיא מתארת היא זו שהפכה לזמינה באופן כללי ב-4 בספטמבר.
Artificial Analysis עדכנה גם את כרטיס המודל שלה עבור תצורת ה־max מאז ההשקה. במהלך תקופת התצוגה המקדימה הכרטיס לא ציין שום ספק או מחיר; הכרטיס הנוכחי מציין כעת את Meta במחיר הסטנדרטי של $1.25 למיליון טוקני קלט ו־$4.25 למיליון טוקני פלט — אותו מחיר מחירון כמו Muse Spark 1.2 — ומוסיף אזהרת מילוליות: ריצת ההערכה של AA צרכה כ־130 מיליון טוקנים לעומת חציון של 79 מיליון, עלתה כ־$1,335 בסך הכול, ומגיעה לכ־$0.95 למשימה לפי אומדן המשימה של AA, בקצב של כ־190 טוקני פלט לשנייה.
מספר אחד מהסיקור הקודם מצריך בדיקת גרסה. Artificial Analysis עדכנה השבוע את מדד ה‑Intelligence Index שלה ל‑v4.2 — באותו שבוע שבו max שוחרר — תוך שקלול מחדש של התחום והזזת החציונים. בכרטיס הנוכחי, תצורת ה‑max מקבלת 53 לעומת חציון של 29 במודלים דומים; ה‑62 שהופץ בסיקור שבוע ההשקה נמדד על הגרסה הקודמת של המדד, ואין להשוות בין השניים. הפיצול של xhigh‑versus‑max של Meta המופיע למעלה אינו תלוי במדד של AA ואינו מושפע מעדכון הגרסה.

מה העלות המקסימלית — החיוב הוא בטוקנים, לא במחירון
Meta אינה מפרסמת מחיר נפרד עבור תצורת המקסימום, וגם לא ניתוח השהיה ייעודי. המחיר לטוקן זהה ל־Muse Spark 1.2 ולכל רמת מאמץ אחרת ב־Muse Spark 1.3: 1.25$ למיליון טוקני קלט, 4.25$ למיליון טוקני פלט, ו־0.15$ עבור קלט במטמון בשכבה הרגילה. טוקני חשיבה מחויבים כטוקני פלט ונספרים כנגד תקציב הפלט, ולכן בחירה במקסימום אינה העלאת מחיר בסעיף נפרד — היא התחייבות לבזבז יותר מתקציב זה על חשיבה לפני מתן תשובה.
זה הופך את שאלת העלות האמיתית לשאלה של נפח טוקנים, והנתונים המוקדמים מראים ש־max יקר בדיוק במקום שבו xhigh חסכוני. הריצה המנוטרת של AA צרכה כ־130 מיליון טוקנים בהערכה בודדת של התצורה. עבור מפתח שכבר מריץ לולאות סוכן ארוכות ב־xhigh, מבחן ה־A/B שבאמת חשוב אינו "האם max עובר יותר משימות", אלא "האם max עובר מספיק משימות נוספות כדי לכסות חשבון טוקנים גדול משמעותית על אותו עומס עבודה".
השכבה Contributor של Meta — 0.10$ לקלט ו-0.20$ לפלט על כל מיליון טוקנים, בתמורה לכך ש־Meta תוכל לאמן על ה־prompts וה־completions שלך — חלה על אותה נקודת checkpoint. לדברי Meta, אחוז דו־ספרתי משמעותי של מפתחים בוחרים בה. תנאי Contributor הופכים כל הגשה לנתוני אימון, ומגבלות הקצב שלה נוקשות, כך שהיא ברירת מחדל גרועה לפיזור צריכה בפרודקשן, אבל דרך לגיטימית להריץ בזול ניסויים מקסימליים יקרים, אם עסקת הנתונים מקובלת עליך.
קל לבדוק את עוגן התמחור של כל זה בלי לסמוך על המילה של Meta, מכיוון שהמחיר של הצ'קפוינט Muse Spark 1.3 זהה למחיר שכבר מופיע ב-OrcaRouter, במחירון הרשמי של Meta עצמה: Muse Spark 1.2 מופיע ב-OrcaRouter במחיר של $1.25 למיליון טוקני קלט ו-$4.25 למיליון טוקני פלט, עם אפס תוספת מחיר, לכן את הטענה בדבר "מחיר ללא שינוי" ניתן לבדוק מול עמוד חי שמציג בדיוק את המספרים האלה. Muse Spark 1.3 עצמו עדיין לא רשום ב-OrcaRouter. כשספק מהספקים שאנו מציעים יתחיל לשרת אותו עם max, המחיר שיוצג אצלנו יהיה מחיר המחירון של Meta כפי שהוא עובר ישירות — אנחנו לא מוסיפים שום תוספת למחירי הספקים — וכל הוזלה של הספק תיכנס לתוקף באותו היום שבו Meta תבצע אותה. בשחרור מהסוג הזה, שבו הכלכלה המעניינת נמצאת בהיקף הטוקנים ולא במחיר המוצהר, ההעברה הישירה הזאת היא מה ששומרת על כך שהמספר שבו תחויב בפועל יהיה שווה למספר ש-Meta מפרסמת.

מי צריך לעבור ל-max
ההחלטה מתפצלת בחדות:
• Switch עבור עומסי עבודה סוכניים ארוכי-טווח — computer-use, תקצירי עבודת ידע, לולאות כלים רב-שלביות ב־Muse Code — שבהם גם החלוקה של Meta עצמה וגם לוח סוכני־הקוד של AA מראים את הרווחים המקסימליים הגדולים ביותר. בצע עליו בדיקת A/B מול xhigh על מדגם של המשימות האמיתיות שלך תחילה, כי אריכות היתר היא ממשית.
• הישאר על xhigh עבור קריאות בנפח גבוה, רגישות להשהיה, או קצרות של סיבוב בודד, שבהן max בעיקר מוסיף טוקנים. Terminal-Bench הוא ההוכחה שהוא לא תמיד מוסיף יכולת.
• צפו בשלושה דברים מכאן: פרסום המשקלים הפתוחים (open-weights) שצוקרברג הבטיח ללא תאריך, ההשקה הצרכנית של Muse Spark 1.3 לאינסטגרם, פייסבוק ו-Meta AI בשבועות הקרובים, והאם לוח סוכני הקוד של Artificial Analysis מתחיל לתמחר את השורה המקסימלית כעת שהתצורה זמינה באופן כללי.
השער בן היומיים התגלה כקצר, אבל הוא העלה נקודה שמחזיקה מעמד מעבר להשקה עצמה: המספרים החזקים ביותר של Meta עבור Muse Spark 1.3 מעולם לא היו אשליה — הם רק חיכו לבדיקת בטיחות. החל מה-4 בספטמבר, המודל שמפתח יכול לזמן והמודל בלוח התוצאות הם סוף סוף אותו מודל. השאלה אם max שווה את הטוקנים שלו היא כעת שאלה אמפירית שכל מפתח יכול לענות עליה, ב-API של Meta או בכל דרך שבה הם כבר משתמשים כדי להגיע למשפחת Muse Spark.
