Muse Spark 1.2 לעומת Claude Haiku 4.5: מחיר משולב זהה, תפיסות מנוגדות בנוגע לחשיבה
Guides & Insights

Muse Spark 1.2 לעומת Claude Haiku 4.5: מחיר משולב זהה, תפיסות מנוגדות בנוגע לחשיבה

מחבר

Jim Song

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

Artificial Analysis מתמחרת Muse Spark 1.2 ב-0.78 דולר למיליון טוקנים בממוצע, ו־Claude Haiku 4.5 ב-0.77 דולר. ההפרש בין המחירים הוא סנט אחד, והמודלים מגיעים משתי מעבדות שלא הסכימו על שום דבר אחר. המודל של Meta לא יכול להפסיק לחשוב; Claude Haiku 4.5 חושב רק כשמבקשים ממנו. Meta נותנת לך 1,048,576 טוקנים של קונטקסט; Claude Haiku 4.5 נותן לך 200,000. Meta שחררה את המודל הזה ב-5 באוגוסט 2026 כמודל קידוד עם סוכן טרמינל צמוד; Claude Haiku 4.5 שוחרר באוקטובר 2025 כעובד המהיר והזול שמודל גדול יותר אומר לו מה לעשות. אותו מחיר לטוקן, מכונות שונות לחלוטין.

הצירוף המקרי הזה הוא נקודת המוצא השימושית להשוואה, משום שהוא מסיר את המשתנה שבדרך כלל מכריעים על פיו ומאלץ את השאלה לעסוק בצורה במקום זאת. בהמשך נעשה שימוש במספרים בלתי תלויים היכן שהם קיימים — Artificial Analysis עבור ציוני מדדים וזמן השהיה במעבדה, וטלמטריית הייצור בת שבעת הימים של OrcaRouter עצמו עבור זמן השהיה בתעבורה אמיתית — ומסמן נתונים המדווחים על ידי הספק ככאלה, כולל כותרת מדד אחת של הספק שאין לה מקבילה מצד שלישי.

השוואת המפרטים, ממד אחד בכל פעם

מחיר — Muse Spark 1.2 ב-$1.25 כניסה / $4.25 יציאה למיליון; Claude Haiku 4.5 ב-$1.00 כניסה / $5.00 יציאה. Meta זול יותר בכניסה, Claude Haiku 4.5 ביציאה.

מטמון — $0.15 למיליון על פגיעת מטמון של Muse Spark 1.2, הנחה של 88%; $0.10 למיליון על קריאת מטמון של Claude Haiku 4.5, הנחה של 90%, כאשר כתיבת מטמון מחויבת ב-$1.25.

הקשר — 1,048,576 טוקנים לעומת 200,000. הבדל של פי 5.2, והפער הגדול ביותר ביניהם.

פלט מקסימלי — Claude Haiku 4.5 מצהיר על תקרה של 64,000 טוקנים; נקודת הקצה Muse Spark 1.2 מצהירה שאין אורך השלמה מקסימלי כלל, וזה חריג מספיק כדי לבדוק ולא להניח.

חשיבה — חובה ב-Muse Spark 1.2, עם חמש רמות מאמץ ממינימלית ל-xhigh וברירת מחדל של בינונית; אופציונלית ב-Claude Haiku 4.5, שהוא מודל ללא חשיבה עד שמפעילים חשיבה מורחבת ומקצים לו תקציב חשיבה.

קלטים — Meta מפרסמת טקסט, תמונות, וידאו, אודיו ו-PDF; Claude Haiku 4.5 מקבל טקסט ותמונות. שניהם מחזירים טקסט.

משקלים וספקים — שניהם סגורים. Muse Spark 1.2 מוגש רק דרך ה-Model API של Meta עצמה; Claude Haiku 4.5 זמין מהספק ובאמצעות משווקי הענן והמצרנים הרגילים.

גיל — Muse Spark 1.2 בן ימים ספורים. Claude Haiku 4.5 נמצא בייצור מאז 15 באוקטובר 2025, עם מועד חיתוך ידע ביולי 2025 ותשעה חודשים של ניסיון שטח מצטבר מאחוריו.

פער המדד הוא אמיתי. המספר שכולם יזכירו אינו.

Artificial Analysis מעניקה ל-Muse Spark 1.2 ציון 54 במדד האינטליגנציה שלה, במקום 13 מתוך 185. הערך הנוכחי שלה עבור Claude Haiku 4.5 הוא 24. שים אותם זה לצד זה ויש לך כותרת; תסתכל על מה שהערכים האלה באמת — והכותרת מתפרקת.

ה-54 הוא Muse Spark 1.2 שהוערך ב-xhigh, הגדרת החשיבה היקרה ביותר שלו. ה-24 הוא Claude Haiku 4.5 שהוערך כמודל ללא חשיבה — חשיבה כבויה — ו-Artificial Analysis מסמנת אותו כאומדן ולא כריצה שהושלמה. בגרסה מוקדמת יותר של אותו מדד, לפני השקלול מחדש של v4.1, Artificial Analysis העריכה את Claude Haiku 4.5 על 55 עם חשיבה מופעלת ועל 42 בלעדיה. גם את המספרים הישנים האלה אי אפשר להשוות ל-54, מכיוון שגרסאות המדד מבצעות קנה מידה מחודש, וציון מתקופת v3 אינו ציון של v4.1.

אז האמירה הכנה צרה יותר משנדמה מלוח התוצאות: Muse Spark 1.2 במאמץ מרבי מקבל ציון 54 במדד הנוכחי; אין ציון v4.1 שפורסם עבור Claude Haiku 4.5 עם חשיבה מורחבת מופעלת, ולכן עדיין אין השוואה ישירה בין השניים במאמץ מלא. כל מי שמראה לך 54 לעומת 24 משווה מודל בחשיבה מלאה למודל שנאמר לו לא לחשוב לעומק.

כאשר הספק פרסם מספר, מדובר במספר ספציפי: Claude Haiku 4.5 משיג 73.3% ב-SWE-bench Verified, בממוצע על פני 50 ניסויים עם תקציב חשיבה של 128K. זהו נתון של הספק, ותקציב החשיבה בו עצום עבור מודל שמשווק בזכות מהירותו — אבל זהו אותו מדד שהתעשייה מצטטת עבור מודלים פורצי דרך, וזה מציב את Haiku בקטגוריה שמחירו אינו מרמז עליה. הטענות המקבילות של Meta לגבי Muse Spark 1.2 הן: Terminal-Bench 2.1 ב-82.9% ו-DeepSWE v1.1 ב-59.3%, גם הן בהרצת הספק, על גבי מערך הבדיקה של Meta עצמה, עם כל מתחרה המזווג למוצר הסוכן שלו. שני ספקים, שני מדדים, ללא חפיפה. אין כיום אף הערכה אחת שבה לשני המודלים הללו יש ציון שפורסם על ידי אותו מעריך.

ארבעה מספרי אחזור, שני סיפורים שונים

השהיה היא המקום שבו המסגור של "אותו מחיר" מפסיק להיות קוריוז ומתחיל להיות החלטה, וזה גם המקום שבו למקור המדידה יש את החשיבות הגדולה ביותר.

במסגרת מדידת הביצועים, Artificial Analysis מתעדת זמן של 26.12 שניות עד לאסימון הראשון עבור Muse Spark 1.2 ב-xhigh, ו-1.00 שנייה עבור Claude Haiku 4.5. פער של פי 26, ואילו זה היה התמונה המלאה, ההשוואה הייתה מסתיימת.

בייצור, המצב מתהפך. לאורך שבעה ימים של תעבורה אמיתית על OrcaRouter — מתקשרים שמשתמשים בכל רמת מאמץ שהם באמת רוצים — Claude Haiku 4.5 מציג p50 של 3.84 שניות לזמן עד לטוקן הראשון ו-p95 של 10.00 שניות, עם 214 טוקנים לשנייה ושיעור שגיאות של 1.0%. Muse Spark 1.1, הגרסה של המודל של Meta שנמצאת בקטלוג, מציגה p50 של 1.84 שניות ו-p95 של 6.00 שניות, עם 519 טוקנים לשנייה וללא שגיאות שתועדו. בתעבורה חיה, המודל של Meta הוא המהיר יותר.

שתי קבוצות המספרים נכונות, והן מודדות דברים שונים. נתון המעבדה הוא כל מודל בחשיבה מקסימלית עם מטמון קר — מבחן הוגן לתקרה אך מבחן גרוע לתיבת צ'אט. נתון הייצור כולל פגיעות מטמון, פרומפטים קצרים, רמות מאמץ נמוכות וכל מה שיישומים אמיתיים עושים — מבחן הוגן לחציון ולא מבחן כלל למקרה הגרוע ביותר. המלכודת היא לצטט את האחד ולהסיק מסקנות על השני. אם אתם קובעים את גודל ה-timeout שמול המשתמש, ה-p95 הוא המספר שלכם. אם אתם שואלים כמה עולה צעד סוכני עמוק בזמן שעון (wall-clock), נתון ה-benchmark קרוב יותר לאמת — והסתייגות הכנה היא שעדיין לא קיים נתון ייצור כזה עבור Muse Spark 1.2 עצמו, כי הוא חדש מדי ולא מנותב באופן נרחב.

שתי המעבדות מכרו לך סוכן משנה. הן התכוונו לדברים שונים.

המסר השיווקי של הספק עבור Claude Haiku 4.5 היה מפורש לגבי ההיררכיה: מודלים ברמת Sonnet מתכננים ומתזמנים, מופעי Haiku מבצעים במקביל מתחתיהם. זולים, מהירים, חד־פעמיים, רבים בבת אחת. עיצוב המוצר עוקב אחר כך — חלון של 200K מספיק למשימת משנה מוגדרת ובכוונה לא מספיק למאגר קוד שלם, חשיבה כבויה כברירת מחדל, כי עובד שמהרהר הוא עובד שעולה כסף למתזמן, והשיווק של הספק עצמו מזהה צ'אט בזמן אמת, שירות לקוחות ותכנות זוגי כיעדים.

הטיעון של Meta עבור Muse Spark 1.2 טוען לשני הקצוות של אותה היררכיה. הטקסט של Meta אומר שהמודל יכול להיות הסוכן הראשי שאוסף הקשר, מתכנן ומאציל, או סוכן משנה שפועל במקביל תחתיו. Muse Code, סוכן הטרמינל שהושק לצידו, מתאם מספר סוכני משנה קבועים לכל משימה ב-worktrees מבודדים, בסביבת ריצה של event-log מדויק להפעלה חוזרת. חלון המיליון טוקנים והחשיבה התמידית הם מה שמתכנן צריך; הם בדיוק מה שלא היית בוחר עבור עובד מסוג fan-out, כי כל מופע מקביל משלם על חשיבה שלא ביקשת.

קריאה כארכיטקטורה ולא כשיווק, זה ההבדל האמיתי: הספק בנה עובד ומצפה ממך להביא מתזמן; Meta בנתה מתזמן וטוענת שהוא גם יכול לעבוד. אם אתה כבר מריץ היררכיה, הניסוי המעניין אינו לבחור ביניהם — אלא ש-Muse Spark 1.2 מתכנן ו-Claude Haiku 4.5 מבצע, שהיא צורה שאף ספק לא ימכור לך כחבילה.

מה עולה צעד אמיתי לכל אחד

תעריפים למיליון לא קובעים כלום במודלי חשיבה, כי המודל בוחר כמה טוקנים להשקיע. תמחרו במקום זאת את השלב.

קחו משימת קוד מוגדרת: 60,000 טוקנים של קונטקסט מאגר פנימה, 3,000 טוקנים של patch החוצה. במצב קר, Claude Haiku 4.5 עולה $0.060 עבור קלט ועוד $0.015 עבור פלט — 7.5 סנט. Muse Spark 1.2 עולה $0.075 ועוד $0.013 — 8.8 סנט. קרוב מספיק כדי להיות רעש, בדיוק כפי שהתעריף המשולב הבטיח.

כעת הוסיפו את מה שהתעריף הממוצע מסתיר. Muse Spark 1.2 לא יכול לכבות את החשיבה, ובמצב ברירת המחדל הבינוני, שלב כזה פולט ככל הנראה כמה אלפי טוקני חשיבה לפני התיקון — והם מחויבים כפלט. הוסיפו 3,000 ואותו שלב עולה $0.075 + $0.026 = 10.1 סנטים, כלומר גבוה בכ-35% מ-Haiku על קלטים זהים. Claude Haiku 4.5 עם חשיבה כבויה לא משלם כלום על החשיבה ונשאר על 7.5 סנטים; עם תקציב חשיבה גדול, הוא יעלה על Muse Spark 1.2, כיוון ש-Claude Haiku 4.5 גובה $5.00 למיליון טוקני פלט לעומת $4.25 של Meta.

הקאשינג הופך שוב את סדר העדיפויות. שמרו על הקשר של המאגר יציב כך שהוא פוגע במטמון, והקלט של Haiku יורד ל-$0.006 ושל Muse Spark 1.2 ל-$0.009 — צד הקלט מפסיק להיות רלוונטי לחלוטין, וכל ההשוואה הופכת למאבק על טוקני פלט, שהוא מאבק על כמה כל מודל חושב. בעומס עבודה שחוזר על הקשר, יציבות מפתח המטמון שווה יותר מבחירת המודל, וזה נכון לגבי שני המודלים הללו.

חלון ה-1M הוא המקום היחיד שבו החשבון לא מסתדר. כל דבר שבאמת צריך יותר מ-200,000 טוקנים בקריאה אחת לא יכול לרוץ על Claude Haiku 4.5 בשום מחיר. או שאתה מפרק ומתזמר — וזו כוונת הספק — או שאתה משתמש במודל עם המרווח.

מנסה את שניהם ללא חוזה שני

{{1}}קלוד הייקו 4.5 נמצא בקטלוג OrcaRouter במחיר של 1.00$ ו-5.00${{/1}} — {{2}}מחיר המחירון של הספק, מכיוון ש-OrcaRouter פועל עם 0% תוספת ומעביר את מחירי הספקים ללא שינוי{{/2}}, {{3}}מה שאומר גם ששינוי מחיר של ספק נכנס לתוקף אצלנו באותו היום במקום במחזור החוזה הבא{{/3}}. {{4}}נתוני זמן ההשהיה בייצור שלמעלה מגיעים מאותה שכבת ניתוב{{/4}}.

Muse Spark 1.2 אינו בקטלוג. Model API של Meta הוא כרגע המקום היחיד לקרוא לו, כך שהשוואה ישירה אמיתית היום משמעותה אינטגרציה אחת דרכנו ואחת ישירות מול Meta. Muse Spark 1.1 מתארח במחירים הזהים של $1.25 ו-$4.25 ש-Meta גובה עבור 1.2, מה שהופך אותו לתחליף סביר לצורת העלות והשהות של המשפחה, אבל לא לרווחי הקידוד ש-1.2 משווק עליהם. כשהניתוב ל-1.2 יופעל, ההשוואה הופכת לשינוי של שורת מודל אחת מול אותו מפתח — ובניסוי של מתזמן-פלוס-עובד שתואר לעיל, ה-DSL לניתוב הוא הדרך שבה מחברים מתכנן ועובד פנימה לקריאה אחת, במקום לבנות את ההעברה ידנית.

בחר לפי צורת העבודה, לא לפי הציון.

בחר Claude Haiku 4.5 כאשר העבודה מוגבלת והמשתמש ממתין. סוכני תמיכה, סיווג, חילוץ, צ'אט, השלמות תכנות זוגי, ושכבת העובדים המקבילים בהיררכיית סוכנים. זהו מוצר ידוע עם תשעה חודשי היסטוריה בשטח, חשיבה היא אופציונלית כך שמשלמים רק על עיון כשמתחשק, ו-200K מספיק כמעט לכל תת-משימה ממוקדת. התוצאה שפורסמה ב-SWE-bench Verified אומרת שהוא מסוגל הרבה יותר ממה שהמחיר מרמז, בתנאי שמוכנים להשקיע את תקציב החשיבה שבו השתמשה התוצאה.

בחר את Muse Spark 1.2 כאשר יחידת העבודה היא מאגר ולא בקשה. ריפקטורינג מרובה קבצים, ניפוי באגים ממושך, יצירת פרויקט שלם, לולאות סוכן ארוכות טווח שאף אחד לא צופה בספינר. חלון של מיליון טוקנים מסיר בעיית חלוקה ש-Haiku לא יכול לפתור בשום מחיר, והחשיבה המחייבת שהורסת את זה לצ'אט היא ברירת המחדל הנכונה כאשר תוכנית שגויה עולה יותר מאשר תוכנית איטית.

מה שאמור להכריע אינו מספר האינדקס. שאל במקום זאת שתי שאלות: האם קריאה בודדת צריכה אי פעם לראות יותר מ-200,000 טוקנים, והאם יש אדם שממתין לטוקן הראשון? כן לראשונה מצביע על Meta. כן לשנייה מצביע על הספק. כן לשתיהן פירושו שאתה רוצה שני מודלים, וזו התשובה הכנה לעתים קרובות יותר ממה שהשיווק של כל אחד מהספקים מודה.

השוואות במאמר הזה1

זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית

© 2026 OrcaRouter

לספקים

מפעילים פלטפורמת הסקה (inference)? הציגו את המודלים שלכם ב-OrcaRouter.

צרו קשר

הצטרפו לקהילה שלנו

DiscordEmailXGitHubYouTube