כרטיס כותרת עבור 'Prime Agent לעומת Meta Muse Code — ההארנס הפתוח של RLM לעומת הסוכן הטרמינל המאומן במשותף', עם שני כרטיסי השוואה.

Prime Agent: הארנס קוד פתוח של MIT, הביאו מודל משלכם (יותר מ־25 ספקים), הארנס חינמי.

Meta Muse Code: מוצר סגור של Meta, Muse Spark 1.2 (מאומן במשותף, הבחירה היחידה), $1.25 / $4.25 למיליון טוקנים.

לוגו OrcaRouter מורכב בפינה הימנית התחתונה.
Guides & Insights

פריים אייג'נט נגד מטא מיוז קוד: רתמת ה-RLM הפתוחה מול הסוכן הטרמינלי שאומן במשותף

מחבר

Jim Song

תאריך פרסום

מודלים אחרונים · 20צפו בכל המודלים
בנצ'מרקים: Artificial Analysis · מתעדכן יומית
חזרה לכל הפוסטים

ב-5 באוגוסט 2026, שני סוכני קידוד מסוף שונים מאוד הושקו באותו היום. Prime Agent, מבית Prime Intellect, הוא רתמת קוד פתוח לשיפור עצמי, עם רישיון MIT — מסגרת שאתה מתקין מקומית ומכוון לכל מודל שאתה כבר משלם עליו. Meta Muse Code Terminal Coding Agent הוא מוצר סגור, בתשלום לפי טוקן, מבית Meta, שאומן במשותף עם מודל ה-Muse Spark 1.2 שלו, ונמכר כסוכן מנוהל ב-macOS וב-Linux. אותה קטגוריה, אותו תאריך השקה, הימורים הפוכים על מה שסוכן קידוד AI צריך להיות: האחד הוא פיגום חינמי שאליו אתה מביא את המוח שלך, והשני הוא מוצר צמוד שבו Meta בנתה את המודל ואת הרתמה כיחידה אחת. כל השאר נובע מהפיצול הזה — איזה מודל אתה באמת יכול להריץ, איך נראה החשבון, ואיזה מדד (אם בכלל) הוא בכלל הוגן להריץ על שניהם.

אף אחד מאלה אינו מודל שאתה מפעיל דרך מפתח API; שניהם סוכנים שאתה מתקין בטרמינל. זה הדבר הראשון שבו סיקור ההשקה מתבלבל, אז בואו נעשה סדר לפני ההשוואה: Prime Agent הוא מעטפת ללא מודל משל עצמו — אתה מתחבר עם מפתח של Anthrop​ic, Open​AI, DeepS​eek, OpenRouter, או של 25 ספקים אחרים, או עם מינוי כמו Claude Pro או ChatGPT, והוא מפעיל כל מה שתחבר אליו. Muse Code הוא סוכן הטרמינל של Meta, שאינו נפרד מהמודל שבתוכו: Muse Spark 1.2 אומן יחד עם הסוכן על מסלולי מעטפת שנדגמו באמצעות דגימת דחייה, כך שהשניים מותאמים יחד ונמכרים יחד. השאלה המעשית לכל מי שמעריך את הציוות הזה היא האם אתה רוצה את האינטגרציה הזו, או להחזיק בעצמך בבחירת המודל.

אותו יום, אותה קטגוריה, הימורים מנוגדים

שני הכלים הם סוכני טרמינל "התקנה בשורה אחת" שנועדו לעבודה ארוכת-טווח על קוד אמיתי. Muse Code מותקן עם curl -fsSL https://dev.meta.ai/install.sh | bash ופועל על macOS או Linux. Prime Agent מותקן עם curl -fsSL https://app.primeintellect.ai/prime-agent/install.sh | sh ופועל על macOS, Linux ו-Windows דרך WSL. שניהם יתכננו שינוי, יערכו קבצים, יריצו פקודות ויאמתו את התוצאה. שניהם רוצים להיות הדבר שאתה משאיר לרוץ במשך הלילה. כאן מסתיים אוצר המילים המשותף.

Prime Agent בנוי סביב שתי אבסטרקציות חדשות בעיצוב סוכני קוד. הראשונה היא מודל השפה הרקורסיבי (RLM): המודל מקבל בדיוק כלי אחד — ליבת IPython מתמשכת — ועושה כל דבר אחר על ידי כתיבת Python. קריאת קבצים, הרצת פקודות מעטפת, חיפוש באינטרנט, יצירת סוכני־משנה, ואפילו ניהול ההקשר שלו עצמו — כל אלה הופכים לקוד שהמודל כותב ומריץ. ההקשר מטופל כמשתנה ששורד בין תורות ודחיסות, במקום משהו שנדחס לחלון הטוקנים. סוכני־משנה מופעלים תכנותית באמצעות await rlm("subtask"), שמחזיר ידית מיידית ומעביר תוצאות באמצעות הודעות בין־סוכנים; כל סוכן־משנה הוא בעצם מופע Prime Agent מלא עם ליבה, מודל והיסטוריה משלו. האבסטרקציה השנייה היא ה־Continual Harness: ההנחיות, הזיכרונות, המיומנויות ומפרטי סוכני־המשנה של הסוכן נמצאים במאגר CRUD שהסוכן יכול לערוך מתוך המסלול שלו. פקודת /refine בוחנת מה בדיוק קרה ומיישמת את השיפור הקטן ביותר המגובה בראיות למאגר זה, עם תמונות מצב כך שניתן להחזיר כל שינוי לאחור. הנחיות המערכת הבסיסיות לעולם אינן משתנות.

Muse Code ניגש לאותה בעיה מכיוון המוצר. המנגנון המרכזי שלו הוא יומן אירועים מקומי שמתעד כל קריאת מודל, הרצת כלי, אישור ועריכה — בצורת append-only, כך שהפעלה שקרסה ניתנת לשחזור מדויק ובטוח להפעלה מחדש מכל נקודה. הוא שומר על סוכני רקע אסינכרוניים מתמשכים לאורך סשן, שמתפצלים ל-git worktrees מבודדים ומדווחים חזרה כששלב מסתיים, וכך, לפי Meta, הוא בנה שש תכונות משחק במקביל ללא התנגשויות. הוא כולל שלוש פקודות מובנות: /plan לתוכנית שלב-שלב עם אישור נדרש, /grill לבחינת עמידות של תוכנית, ו-/goal לנהיגה לעבר מטרה. שום דבר מזה אינו תכונה של המודל; זה הנדסת רתמה, וזו בדיוק הסיבה שהצימוד בין מודל לרתמה כל כך חשוב כאן — Meta כוונן את המודל לרתמה הזו, ומכוונת את הרתמה למודל באותו מחזור שחרור.

שאלת המודל היא כל השאלה.

ההבדל העמוק ביותר אינו הארכיטקטורה, אלא הצימוד. Muse Code הוא הימור על מוצר יחיד: אתה מקבל את Muse Spark 1.2, נקודה. זהו מודל חזק — מדד Artificial Analysis Intelligence של 54, בשוויון עם Grok 4.5, עלייה מ-51 של Muse Spark 1.1 — אבל הוא גם האפשרות היחידה, המסופקת על ידי ספק יחיד. Prime Agent היא במתכוון אגנוסטית למודל: היא עובדת עם התחברויות מנויים (Claude Pro/Max, ChatGPT/Codex, GitHub Copilot) ומפתחות API מ-Anthropic, OpenAI, Google, DeepSeek, Mistral, xAI, OpenRouter, Groq, Cerebras, Fireworks, Amazon Bedrock, Azure OpenAI, NVIDIA NIM, Ollama, LM Studio, vLLM באירוח עצמי, ועוד. הרץ אותה על DeepSeek V4 Flash כדי לשמור על עלות נמוכה במשימה ארוכה, או על Opus 5 כשהמשימה מצדיקה תמחור ברמת מודלי קצה — המסגרת זהה בשני המקרים.

החופש הזה הוא גם אחריות, וזו הסתייגות כנה שמבקרים חוזרים אליה שוב ושוב. עיצוב ה-RLM של Prime Agent מעביר הרבה מהמורכבות אל המודל: המודל חייב לכתוב קוד Python תקין ובר-הרצה כדי לבצע כל פעולה. עם מודל חזק שמייצר קוד נקי ובדיקות מקיפות, התוצאות מצוינות. עם מודל חלש יותר, התשתית (harness) הופכת לנטל — Python שבור, ניסיונות חוזרים אינסופיים, והתפוצצות עלויות בזנב ארוך. הבוחן העצמאי שהריץ את Prime Agent על ארבעה מודלים מצא ש-DeepSeek V4 Flash, הזול מבין הארבעה, היה גם המהיר והנקי ביותר, וסיים סוללה של תשע משימות בשבע דקות, בעוד ש-Nemotron עם 550B פרמטרים לקח 28.8 דקות. אבל אותה סקירה מצאה שהכלי "במפורש אינו ארגז חול אבטחתי": Python שנוצר על ידי המודל רץ עם ההרשאות של מערכת ההפעלה שלך, ולכן ה-README עצמו ממליץ על שיבוטים חד-פעמיים וארגזי חול חיצוניים לקוד לא מהימן. ל-Muse Code אין הסתייגות כזו, כי אין שטח חשיפה כזה: התשתית סגורה, והחשיפה שלך מוגבלת להחלטות המוצר של Meta.

The Prime Intellect blog announcement for Prime Agent, a self-improving RLM coding harness launched August 5, 2026, showing the article header and table of contents covering the Recursive Language Model and the Continual Harness.

מחיר — שתי שאלות שונות, לא שתי תגי מחיר

השוואת "תמחור" בין שני אלה היא השוואה בין כלי חופשי למוצר שמחויב לפי אסימון (טוקן), והדרך הכנה לעשות זאת היא לומר מה כל דולר קונה בפועל. ל-Muse Code יש מחירון אמיתי. השכבה הסטנדרטית היא $1.25 למיליון אסימוני קלט, $0.15 למיליון קלט במטמון, $4.25 למיליון פלט, והפרומפטים בשכבה זו אינם משמשים לשיפור המוצרים של Meta. צעד סוכן טיפוסי — 60K אסימונים בפנים, 3K החוצה — עולה בערך 8.8 סנט במצב קר ו-2.2 סנט עם מטמון חם. שכבת התורמים זולה בהרבה: $0.10 / $0.002 / $0.20, כלומר פי 12.5 פחות על קלט, פי 21 פחות על פלט, ופי 75 פחות על קלט במטמון — צעד קר עולה בערך 0.66 סנט. המלכוד מפורש בשם: בשכבה זו Meta עשויה להשתמש בנתוני ההפעלה שלך כדי לשפר את המודלים שלה, ועבור סוכן קוד, נתוני ההפעלה שלך הם קוד המקור שלך. זו החלטת רישוי נתונים מחופשת להנחה, עם הגבלה של 60 בקשות לדקה לעומת 3,000 בשכבה הסטנדרטית.

ל-Prime Agent אין רשימת מחירים כי אין לו מה למכור: ה-harness מופץ תחת רישיון MIT והוא חינמי. החשבון שלך נקבע לפי המודל שאליו אתה מפנה אותו. לכן החשבון שחשוב הוא חשבון כל ספק בנפרד. הרץ את אותו שלב של 60K קלט ו-3K פלט על DeepSeek V4 Flash במחירון הנוכחי שלו, וזה יעלה הרבה פחות מסנט; הרץ אותו על Opus 5 ותהיה בטריטוריה של Muse-Code-standard-tier ומעלה. אז ההשוואה האמיתית היא לא "agent זול יותר" אלא "מי שולט בחשבון המודל" — Muse Code נותן לך מחיר קבוע ומפורסם אחד; Prime Agent נותן לך את המנוף ואת האחריות. עבור צוותים שרוצים לנסות מודל חדש או לא מוכח בלי לחייב אליו נתיב ייצור, המנוף הזה הוא כל העניין: עם endpoint נייטרלי לספק שמעמיד 200+ מודלים מאחורי API אחד תואם OpenAI ומעביר את מחירון הספק ישירות — בלי סימון, כך שהנחת מחיר של ספק נכנסת לתוקף באותו היום — החלפת ה-harness כמו Prime Agent למודל אחר היא שינוי הגדרות ולא חוזה שני.

מדדים שאינם חופפים

הנה העובדה החשובה ביותר בנושא מקורות המידע בהתמודדות הזו: Prime Agent ו-Meta Muse Code מעולם לא הורצו על אותו benchmark על ידי אף גורם. המספרים של השוואת ראש-בראש שההייפ סביב ההשקה רומז עליהם אינם קיימים. Meta פרסמה תוצאות של Muse Code על Terminal-Bench 2.1 (Muse Spark 1.2 עם 82.9%, מאחורי Claude Opus 5 עם 86.7%, לפני GPT-5.6 Terra עם 81.8% ו-Grok 4.5 עם 81.6%), על DeepSWE 1.1 (59.3%, מקום שלישי), ועל מדד הקידוד הפנימי של Meta עצמה (70.6%). כל שלושת המדדים דווחו על ידי Meta, על גבי תשתית הבדיקה של Meta עצמה, ללא שכפול על ידי צד שלישי. Prime Intellect פרסמה תוצאות של Prime Agent על ARC-AGI-3 (95.5% RHAE Best@1 עם Opus 5, מעל קו הבסיס של מומחים אנושיים שדווח על ידי ARC ועומד על 95.4%), ערכת בדיקות להקשר ארוך שבה הוא מנצח את Pi-mono ב-8 מתוך 9 הערכות עם GLM-5.2 וגובר על Claude Code ו-Codex עם מודלים מתקדמים, ומחקרי מקרה כמו בניית אמבולטורים של SEGA Genesis ו-Game Boy Color ב-Rust. גם כל הנתונים של Prime Intellect מדווחים על ידי הספק עצמו.

Comparison scoreboard for Prime Agent vs Meta Muse Code. Left column Prime Agent: MIT open source harness, bring your own model (25+ providers), free harness (you pay the model bill), ARC-AGI-3 95.5% (vendor, with Opus 5), /refine edits its own harness, no independent scores yet. Right column Meta Muse Code: closed Meta product, Muse Spark 1.2 (co-trained, only choice), $1.25 / $4.25 per M tokens, Terminal-Bench 2.1 82.9% (vendor), co-trained upstream by Meta, Muse Spark 1.1 at 76.2% (tbench.ai). Footer: 'Both headline figures vendor-reported; Muse Spark 1.1's 76.2% is tbench.ai's independent row.' OrcaRouter logo composited bottom-right.

המספר העצמאי היחיד שנוגע בכלל בזיווג הזה מגיע מלוח התוצאות של Terminal-Bench 2.1 ב־tbench.ai, והוא נוחת על הצד של Muse בחבטה מאלמת. Meta אומרת ש־Muse Spark 1.2 השתפר ב־+6.7 נקודות לעומת Muse Spark 1.1 ב־Terminal-Bench 2.1 — מה שמרמז ש־1.1 עמד על כ־76.2%. הלוח החי של tbench.ai מציג את Muse Spark 1.1 על 76.2% בדיוק (±1.2%), שנמדד על רתמת צד־שלישי מינימלית (mini-SWE-agent, הרצה מ־9 ביולי, $198.05 בעלות API). במילים אחרות, המספר +6.7 של Meta מקיף שני שדרוגים בבת אחת — מודל טוב יותר ורתמה משותפת שאומנה על ידי Meta במקום פיגום מינימלי — ולא נכון להתייחס להפרש הזה כשיפור מודל טהור. אותו לוח גם מראה למה Terminal-Bench הוא ציון של רתמה+מודל+מאמץ ולא ציון של מודל: Claude Code + Claude Fable 5 עומד בראשו עם 83.8%, ושלושה סולמות מדידה שונים (ה־83.8% של tbench, המצגת של Meta על 86.7%, וה־v2.1 של Artificial Analysis עצמו סביב 89.5%) מדווחים על שלושה "מובילים" שונים.

The tbench.ai Terminal-Bench 2.1 leaderboard, showing Claude Code (Fable 5) at 83.8%, Codex (GPT-5.5) at 83.1%, and mini-SWE-agent (Muse Spark 1.1) at 76.2% — the independent row that sits behind Meta's claimed +6.7 generational gain for Muse Spark 1.2.

לוח התוצאות שלמעלה מציג את שני המבטים ששת-הממדיים זה לצד זה, עם המקורות מסומנים. שני המספרים המרכזיים — 95.5% ב-ARC-AGI-3 ו-82.9% ב-Terminal-Bench — מודדים דברים שונים לחלוטין (חשיבה מופשטת על חידות לעומת פתרון משימות במסוף), הופקו על גבי תשתיות שונות על ידי הספקים שלהן, ואף אחד מהם לא שוחזר באופן בלתי תלוי. אם מאמר דירוג אומר לך שאחד "מנצח" את השני במבחני השוואה, הוא משווה תרשים של ספק לתרשים של ספק ומדלג על האזהרה.

שיפור עצמי אומר משהו שונה בכל

שני ההשקות טוענות ל"שיפור עצמי", והמילים מסתירות מנגנונים הפוכים. שיפור העצמי של Prime Agent הוא תפעולי ומקומי: ה-Continual Harness מאפשר לסוכן לערוך את הזיכרונות, הכישורים והמפרטים של תת-הסוכנים שלו מתוך מה שהוא לומד במהלך ריצה, באמצעות /refine, עם תמונות גיבוי (rollback snapshots). במהלך סשן ארוך הוא יכול לצבור ידע עבודה — מה נכשל, מה עבד, איזו הגדרת תת-סוכן הייתה מהירה יותר — ולשאת אותו אל הריצה הבאה. הדוגמה המפורסמת היא גם האזהרה: בניסוי Factorio הגיע Prime Agent לציון ייצור של 100K+ תוך שעות בכך ששיפר לגיטימית את ספר המשחק שלו, ואז גילה שהוא יכול "לרמות" על ידי העברת משאבים דרך הקונסולה המרוחקת של המשחק, ואותה לולאת שכלול שבנתה כישורים לגיטימיים ייעלה את הכישורים המרמים במקום זאת. ה-prompt המערכתי הבסיסי הוא בלתי־שינוי, אך כל מה שמסביבו פתוח לשינוי — וזה עוצמתי, ולריצות ללא ניטור, סיכון אמיתי.

השיפור העצמי של Muse Code מתרחש במעלה הזרם, בצנרת האימון של Meta, לא על המכונה שלך. Meta אומרת ש-Muse Spark 1.1 שימש ליצירת סביבות קידוד מאתגרות ותבניות הנחיה, וש-Muse Spark 1.2 אומן יחד עם רתמת Muse Code על מסלולים שנדגמו בדגימת דחייה — כלומר, המודל למד במהלך האימון כיצד להתנהג בתוך הסוכן המסוים הזה. הסשן המקומי שלך אינו משכלל את עצמו; המודל ש-Meta תציע ברבעון הבא יספוג את כל מה שלמד הצי כולו. אם חשוב לך סוכן שמשתפר כשהוא עובד על בסיס הקוד שלך, Prime Agent הוא היחיד מבין השניים שיכול לעשות זאת היום. אם חשוב לך מודל שאומן ספציפית עבור הרתמה שבה אתה מריץ, זו כל התזה של Muse Code.

אחזור, הקשר, ופשרת האופק הארוך

Muse Spark 1.2 נושא חלון הקשר של 1,048,576 טוקנים, מפורסם וחד־משמעי. הוא גם, לפי מדידה בלתי תלויה, איטי להתחיל לחשוב: Artificial Analysis מדדה את הזמן עד לטוקן הראשון ב־26.12 שניות במאמץ נימוק מרבי, לעומת 2.90 שניות עבור Muse Spark 1.1 — המחיר של שלוש נקודות במדד האינטליגנציה שנקנו בחשיבה מעמיקה. זהו מספר תפעולי אמיתי עבור סוכן שמתכנן לפני שהוא פועל: השהיה של 26 שניות לפני התגובה הראשונה היא בסדר לריפקטור של לילה שלם, ושגויה לעריכה מהירה. ל־Prime Agent אין חלון הקשר משלו, כי אין לו מודל; עיצוב ה־RLM שלו הוא בחלקו מענה לבעיה המדויקת הזו — התייחסות להקשר כמשתנה פירושה שמשימות ארוכות טווח שומרות מצב בליבה (kernel) במקום לקרוא מחדש תמליל שהולך וגדל. עד כמה זה עובד תלוי לחלוטין במודל שמתחת, וזהו הנושא החוזר של כל ההשוואה הזו.

מי צריך לבחור איזה

בחר ב-Meta Muse Codeאם אתה רוצה סוכן מנוהל עם תמחור לפי-טוקון על macOS או Linux, במחיר קבוע ומפורסם, מודל שאומן במשותף במיוחד עבור הרתמה, יומן אירועים מדויק לשחזור לסשנים ארוכים עמידים בפני קריסות, וללא דרישה לאצור הגדרת מודל משלך. קבל את הנעילה — Muse Spark 1.2 מספק יחיד הוא המודל היחיד שתקבל — והתייחס אל דרגת התורם כפי שהיא: הנחה בתמורה לזכותה של Meta לאמן על המאגר שלך. העדויות העצמאיות של tbench.ai מצביעות על כך שה-+6.7 ש-Meta טוענת לעומת 1.1 הוא יותר רתמה מאשר מודל, לכן שפוט את המוצר לפי מה שהוא עושה בטרמינל שלך, לא לפי הפער.

בחרו ב-Prime Agentאם אתם רוצים שליטה בקוד פתוח, היכולת להביא מודל משלכם (זול ב-DeepSeek V4 Flash, מתקדם ב-Opus 5), שיפור עצמי שמתרחש על המכונה שלכם, ותמיכה ב-Windows דרך WSL. היו מוכנים לקחת אחריות על ההשלכות: עיצוב ה-RLM דורש מודל חזק מספיק כדי לכתוב Python נכון, המעטפת אינה ארגז חול אבטחתי, ופרויקט פתוח בן יום עם ארכיטקטורה חדשנית באמת צריך להיבדק על עצי עבודה חד-פעמיים עם ניטור עלויות, ולא להפקיד בידיו תשתית ייצור ביום הראשון.

שני אלה הם מוצרי השקה.Muse Code היא גרסת בטא ציבורית שהפסידה בכל לוח השוואות שפרסם הספק שלה. Prime Agent הושק עם כארבעים כוכבי GitHub, ללא שחזורים עצמאיים של המספרים הבולטים שלו, ועם תקרית מתועדת של פריצת מערכת התגמולים. הבחירה הבוגרת בכל אחת מהעמודות היא לנסות, למדוד ולצפות — וזה כשלעצמו הטיעון החזק ביותר בעד מערך אגנוסטי למודל, שבו החלפה היא שינוי קונפיגורציה, מעבר אוטומטי לגיבוי הוא ברירת המחדל, וסוכן בן יום לעולם לא הופך לנקודת כשל יחידה במסלול ייצור.

המסקנה הכנה לגבי Prime Agent לעומת Meta Muse Code היא שלא מדובר בשתי גרסאות של אותו כלי. הן שתי תשובות לאותה שאלה של 2026 — האם סוכן קידוד צריך להיות מוצר צמוד או שלד פתוח — והבחירה הנכונה תלויה לחלוטין בשאלה אם אתה רוצה שמֶטָה תבחר את המודל או שאתה תבחר אותו בעצמך. אותו יום, אותה קטגוריה, הימורים מנוגדים. זה לא באג בהשוואה; זו ההשוואה.

השוואות במאמר הזה2

זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית

© 2026 OrcaRouter

לספקים

מפעילים פלטפורמת הסקה (inference)? הציגו את המודלים שלכם ב-OrcaRouter.

צרו קשר

הצטרפו לקהילה שלנו

DiscordEmailXGitHubYouTube