
Muse Spark 1.2 לעומת Gemini 3.5 Flash-Lite: שתי מעבדות, שתי הגדרות של סוכן משנה
- metaחדשMeta: Muse Spark 1.22026-08-0557אינטליגנציה72כתיבת קוד
- qwenחדשQwen: Qwen3.8 Max2026-08-0358אינטליגנציה72כתיבת קוד
- deepseekחדשDeepSeek: DeepSeek V4 Flash 07312026-07-3152אינטליגנציה69כתיבת קוד
- minimaxחדשMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 לכל 1M טוקנים · 2046 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463אינטליגנציה78כתיבת קוד
- googleGoogle: Gemini 3.6 Flash2026-07-2152אינטליגנציה69כתיבת קוד
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137אינטליגנציה49כתיבת קוד
- metaMeta: Muse Spark 1.12026-07-1653אינטליגנציה71כתיבת קוד
- kimiMoonshotAI: Kimi K32026-07-1560אינטליגנציה76כתיבת קוד
- openaiOpenAI: GPT-5.6 Luna2026-07-0952אינטליגנציה71כתיבת קוד
- openaiOpenAI: GPT-5.6 Terra2026-07-0957אינטליגנציה77כתיבת קוד
- openaiOpenAI: GPT-5.6 Sol2026-07-0961אינטליגנציה77כתיבת קוד
- grokxAI: Grok 4.52026-07-0856אינטליגנציה72כתיבת קוד
- tencentTencent: Hy32026-07-0642אינטליגנציה59כתיבת קוד
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232אינטליגנציה42כתיבת קוד
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226אינטליגנציה39כתיבת קוד
- anthropicAnthropic: Claude Sonnet 52026-06-3055אינטליגנציה72כתיבת קוד
- klingKling: Kling 3.0 Turbo2026-06-1757אינטליגנציה52כתיבת קוד57מתמטיקה
בתוך שבועיים זה מזה, שתי מעבדות שחררו מודל ותיארו אותו באותה מילה. לפי כרטיס המודל שלו, Gemini 3.5 Flash-Lite הוא "מתאים לסוכני-משנה שמבצעים משימות ממוקדות בתוך זרימות עבודה מרובות-סוכנים." Meta אומרת ש Muse Spark 1.2 יכול לשמש "כסוכן ראשי לתכנון והאצלה או כסוכן משנה הפועל במקביל." אותו אוצר מילים, ולקח ל-Artificial Analysis להריץ את שניהם דרך ה-Intelligence Index כדי להראות עד כמה הם מתכוונים לזה אחרת: Flash-Lite סיים את הסוויטה ב-43 מיליון טוקני פלט, ואילו Muse Spark 1.2 נזקק ל-95 מיליון. אחד מהמודלים הללו חושב בקצרה ולעתים קרובות; השני חושב קשה ולאורך זמן. שניהם מכנים את התוצאה 'סוכן משנה'.
יחס הטוקנים הזה הוא המספר הכי רלוונטי להחלטה בהשוואה, כי דרגת תת-סוכן היא דבר שמפצלים אותו — עשרים בכל פעם, מאה בכל פעם — והפיצול מכפיל את כל ההרגלים של המודל לכל קריאה. בהמשך נעבור על מה שכל מעבדה בנתה בפועל, איך נראה חשבון הפיצול במחירים אמיתיים, ואיפה הזולה מביניהן מתגלה כבחירה היקרה.
מה כל מעבדה מתכוונת במילה
גרסת ה-Flash-Lite היא הגדרת תפקיד לפי גודל. Gemini 3.5 Flash-Lite היא השכבה הזולה ביותר במשפחתה, ומיצוב זה בולט בכך שהוא מקשר בין רמות החשיבה ישירות לעומסי עבודה של תת-סוכנים מרובי-שלבים — הפעם הראשונה שבה שכבה במשפחה זו תוארה לפי תפקיד סוכן במקום לפי גודל או מהירות. הסקה היא חובה, אך מאמץ ברירת המחדל הוא מינימלי, החוגה מגיעה עד לגבוה, והמודל בנוי כדי להיות משוגר בכמויות ולענות במהירות. הספק מדווח על 54.2% ב-SWE-Bench Pro לעומת 49.6% עבור Gemini 3 Flash, ועל 74.0% ב-OSWorld-Verified לעומת 65.1% — שני הנתונים מדווחים על ידי הספק, לא שוחזרו באופן עצמאי, ושניהם ממוסגרים כרווחים סוכנותיים ולא כרווחי אינטליגנציה גולמית.
הגרסה של Meta היא הגדרת תפקיד לפי טופולוגיה. תיאור המוצר של Muse Spark 1.2 מתאר מודל שיכול לאסוף הקשר, לערוך תוכנית, ולהאציל ביצוע בין סוכני משנה מקבילים — או להיות בעצמו אחד מסוכני המשנה הללו. חוגת ההיגיון שלו נעה ממינימלי עד xhigh עם ברירת מחדל של בינוני, ו-Meta מציינת במפורש את עומסי העבודה המיועדים: רפקטורינג של קבצים מרובים, סשנים ממושכים של ניפוי באגים, ויצירת מאגר קוד שלם. זהו מודל שנועד להיות המתזמן שיכול גם לבצע את העבודה, וזהו מוצר שונה ממודל שנועד להיות מופעל בעשרים מופעים במקביל.
אף מעבדה לא פרסמה מדד ביצועים לטענה הספציפית. Meta שחררה את 1.2 ב-5 באוגוסט ללא פוסט השקה כלל — דף ההכרזה של Muse Spark 1.1 עדיין מתאר את הגרסה הקודמת.
הפער שהמדד בפועל מודד

ציונים עצמאיים, מ-Artificial Analysis שהריצה את אותו קומפוזיט של תשע הערכות על שניהם:
• מדד האינטליגנציה — Muse Spark 1.2 (xhigh) 54, מקום 13 מתוך 185. Gemini 3.5 Flash-Lite 36, מקום 20 מתוך 163. שמונה עשרה נקודות, לעומת חציון כיתתי של 32.
• מהירות פלט — 165.0 אסימונים לשנייה לעומת 343.6. Flash-Lite מזרים יותר מפי שניים מהר.
• זמן עד לאסימון הראשון — 26.12 שניות לעומת 10.30, שניהם במאמץ מרבי. Artificial Analysis מציין שנתון ה-10.30s של Flash-Lite הוא עצמו בקצה הגבוה עבור מודלי חשיבה בטווח המחירים שלו.
• מילוליות — 95M אסימוני פלט לעומת 43M עבור אותה חבילה, עם חציון של 65M בכל הדגמים. Muse Spark 1.2 גבוה ב-46% מהחציון; Flash-Lite נמוך ב-34%.
• עלות הפעלת המדד — 637.85$ לעומת 153.08$.
• לפי ממד — מדדי המשנה של Artificial Analysis ממקמים את Gemini 3.5 Flash-Lite על 49.3 בקידוד ו-26.8 בסוכנות. אין עדיין פירוט שפורסם עבור Muse Spark 1.2; קודמו השיג 71.3 ו-37.5.
שמונה עשרה נקודות אינדקס אינן הפרש עיגול. אלה אינם שני מועמדים לאותו מקום.
אריתמטיקת הפאן-אאוט
מחיר לכל טוקן הוא המבט השגוי לגבי שכבה של תת-סוכן, כי כל הרעיון של השכבה הוא שאתה מריץ רבים מהם. עבדו דוגמה במחירי רשימה — 0.30$ פנימה ו-2.50$ החוצה עבור Gemini 3.5 Flash-Lite, 1.25$ פנימה ו-4.25$ החוצה עבור Muse Spark 1.2.
מתזמן שולח עשרים תת-סוכנים. כל אחד קורא 25,000 טוקנים של הקשר ממוקד וכותב 1,500 טוקנים בחזרה.
• Gemini 3.5 Flash-Lite — 20 × ($0.0075 + $0.00375) = בערך 22.5 סנט לכל פאן-אאוט.
• Muse Spark 1.2 — 20 × ($0.03125 + $0.006375) = בערך 75 סנטים לכל fan-out.
שלוש פעמים ושליש, וזה נשמע בר-ביצוע. כעת יישמו את הפרש המלל שנמדד. אם Muse Spark 1.2 כותב באופן יחסי יותר מ-Flash-Lite, כפי שעשה באינדקס — בערך פי 2.2 יותר טוקני פלט עבור אותה עבודה — אותן תשובות בנות 1,500 טוקנים הופכות לכ-3,300, והפיזור (fan-out) עולה לכ-91 סנט. ארבע פעמים, לא שלוש. במאה fan-outs לשעה במערכת סוכנים עמוסה, זה ההפרש בין 22$ ל-91$ לשעה, או הפרש של כ-600,000$ בשנה בעומס רציף.
שני פרטי תמחור הופכים את הפער האמיתי לרחב עוד יותר בכיוון אחד וצר יותר בכיוון השני:
• Flash-Lite מחייב חשיבה פנימית בתעריף הפלט. התמחור של אסימוני חשיבה פנימית הוא $2.50 למיליון — זהה לפלט הגלוי. חשיבה אינה בחינם, היא פשוט בלתי נראית בתשובה. אם תת-סוכן מהרהר 2,000 אסימונים לפני שמשיב, הוסף חצי סנט לכל קריאה, או 10 סנטים על פני כל הפיצול.
• המטמון מיטיב עם Muse Spark 1.2 במונחי יחס. קריאות קלט מהמטמון מתומחרות ב-$0.15 למיליון לעומת מחירון של $1.25 — הנחה של 88%. Flash-Lite קורא קלט מהמטמון ב-$0.03 לעומת $0.30, הנחה של 90%, אך גם גובה כ-$0.083 למיליון עבור כתיבת המטמון, בעוד ש-Muse Spark 1.2 אינו מפרסם עמלת כתיבת מטמון נפרדת. במקרה של fan-out שבו כל תת-סוכן חולק את אותה קידומת גדולה, הפער מצטמצם באופן משמעותי.

השהיית הייצור היא התחום שבו Flash-Lite מובילה בפער הגדול ביותר, ומספרי הבנצ'מרק מסתירים זאת. ב-OrcaRouter, לאורך שבוע מתגלגל של תעבורה אמיתית, Gemini 3.5 Flash-Lite מראה זמן p50 עד לטוקן הראשון של 816 מילישניות ו-p95 של 4.57 שניות. Muse Spark 1.1 — הפרוקסי הקרוב ביותר שזמין, מאחר של-1.2 אין עדיין טלמטריה — מראה p50 של 1.84 שניות ו-p95 של 6.00 שניות. כאשר עשרים תת-סוכנים פועלים במקביל, האיטי ביותר הוא שקובע את שעון הקיר, ולכן p95 הוא המספר שקובע את השהיית ה-fan-out שלך, לא p50.
כשהזול הוא הבחירה השגויה
ארבע מגבלות על Gemini 3.5 Flash-Lite שאינן מופיעות בהשוואת מחירים ויופיעו בסקירת אירוע.
• תקרת פלט של 65,536 טוקנים. חצי ממה שרוב המודלים בקטגוריה זו מאפשרים, וקיר קשיח עבור סוכן משנה שמתבקש לייצר קובץ גדול או להחזיר מסמך מובנה ארוך. ה-endpoint של Muse Spark 1.2 אינו מצהיר על אורך השלמה מרבי כלל — דבר חריג מספיק כדי לבחון ולא לסמוך, אבל זו לא מגבלה מתועדת.
• זוהי נקודת קצה לא מנוהלת.הרישום של Flash-Lite אינו נושא דגל ניהול; הרישום של Meta עבור Muse Spark 1.2 כן. זהו יתרון אמיתי עבור עומסי עבודה מסוימים ובעיית ציות עבור אחרים, וזה צריך להיות בחירה מודעת ולא תגלית.
• חיפוש מובנה יקר.כלי חיפוש האינטרנט של Flash-Lite מתומחר בכ־14 דולר לאלף קריאות, לעומת 2.50 דולר עבור Muse Spark 1.2. אם תת־הסוכנים שלך חוקרים ולא רק קוראים, המודל הזול הופך ליקר — פי חמישה וחצי — ונפח החיפוש בארכיטקטורת fan-out גדל עם ה־fan-out.
• מחירו עלה, לא ירד.Gemini 3.5 Flash-Lite מתומחר ב-$0.30 ו-$2.50, בעוד ש-Gemini 3.1 Flash-Lite הקודם היה $0.25 ו-$1.50. התפוקה יקרה ב-67% מהדרגה שהיא מחליפה. אם תקצבת תקציב תת-סוכן לפי המודל הישן, שנה את גודלו.

עוד א-סימטריה שראוי להציג במפורש: Muse Spark 1.2 מוגש על ידי ספק אחד בלבד — Meta — ללא מארחים של צד שלישי וללא גיבוי. ל-Gemini 3.5 Flash-Lite יש טביעת רגל שרת רגילה של ספק ראשוני בריבוי אזורים. עבור אורקסטרטור זה מהווה נקודת כשל יחידה לכל עץ הסוכנים שלך; עבור שכבת עובדים זו נקודת כשל יחידה להסתעפות (fan-out).
הזיווג שרוב הצוותים בפועל יגיעו אליו
כשקוראים אותן זו מול זו, שני המודלים הללו אינם מתחרים, אלא שני חצאים של ארכיטקטורה אחת, והטקסט המוצרי של מטה עצמו אומר זאת במפורש כשהוא מתאר את תפקיד הסוכן הראשי בנפרד מתפקיד סוכן המשנה.
הצורה הנובעת מהמספרים: Muse Spark 1.2 כמתזמר, ו-Gemini 3.5 Flash-Lite כעובדים. קריאה אחת יקרה ומחושבת שקוראת את המאגר, מחזיקה את התוכנית ומחליטה מה להאציל — שבה 26 שניות של חשיבה וורבליות בקנה מידה של 95M טוקנים קונות לך תוכנית שכדאי לבצע — ואחריהן עשרים קריאות זולות, מהירות וממוקדות, שכל אחת עושה דבר אחד מוגדר וחוזרת תוך פחות משנייה ב-p50. אתה משלם תעריפים קרובים ל-frontier פעם אחת לכל משימה, ותעריפי תקציב לכל יחידת עבודה — וזה בדיוק עקומת העלויות שארכיטקטורת fan-out רוצה.
הפוך את זה והכלכלה קורסת. עשרים תת-סוכנים של Muse Spark 1.2 ב-91 סנט לפאן-אאוט הם פי ארבעה מהחשבון עבור עבודה שמודל חלש יותר ב-18 נקודות מסיים בשליש מהזמן, ואורקסטרטור Flash-Lite באינדקס 36 יפיק תוכניות שהעובדים לא יוכלו להציל.
המבנה שהתפצל בין שני ספקים היה החלק המביך. Gemini 3.5 Flash-Lite נמצא בקטלוג OrcaRouter במחיר של $0.30 ו-$2.50 — מחיר המחירון של הספק, מועבר ב-0% תוספת, כך ששינוי מחיר מגיע אלינו באותו היום במקום אחרי מחזור חוזה — ו-Muse Spark 1.1 נמצא שם ב-$1.25 ו-$4.25 על אותו בסיס, שניהם מאחורי נקודת קצה אחת תואמת OpenAI. זה אומר שתבנית ה-orchestrator-and-workers היא שתי מחרוזות מודל בקוד אחד במקום שני SDK, שני מפתחות ושתי חשבוניות, ו-failover אוטומטי מכסה את המקרה שבו לספק אחד יש אחר צהריים רע באמצע fan-out. כדי להיות מדויקים לגבי מה שזמין: Muse Spark 1.2 עצמו עדיין לא בקטלוג — Meta מספקת אותו ישירות כספקית הבלעדית שלו — אז היום הגרסה הקרובה ביותר של המחסנית הזו מריצה 1.1 בתפקיד ה-orchestrator.
בחר לפי תפקיד, לא לפי ניקוד
אם אתה בוחר שכבת עובד — ניתוח מסמכים, חילוץ נתונים, עריכות קבצים ממוקדות, סיווג, החלק האמצעי הצר והחוזרני של עץ סוכן — Gemini 3.5 Flash-Lite הוא הכלי הטוב יותר, ופער המדד של 18 הנקודות הוא ברובו לא רלוונטי כי אתה לא מבקש ממנו לחשוב. שים לב לתקרת הפלט ולמחירי החיפוש.
אם אתה בוחר את המודל שמחליט מה העובדים עושים, Muse Spark 1.2 הוא המועמד החזק יותר מבין השניים, עם הסתייגויות שאין לו ציון סוכני עצמאי לכל ממד, אין לו שום רשומת ארנה, אין טלמטריה ייצורית, ויש רק ספק אחד. אלה הפערים שצריך לסגור לפני שהוא מחזיק בתוכנית ייצור.
ואם קיווית שמודל אחד יוכל לבצע את שתי העבודות, התשובה הכנה מהמדידות היא שאף אחד מהם לא יכול. Flash-Lite לא יכול לתכנן באינדקס 36; Muse Spark 1.2 לא ניתן להפעיל עשרים בבת אחת ב-91 סנט לפיזור. המילה "תת-סוכן" המופיעה בשני תיאורי המוצרים היא צירוף מקרים שיווקי, לא סימן שהם שייכים לאותו משבצת.
השוואות במאמר הזה3
זוהה מתוך המאמר הזה · בנצ'מרקים: Artificial Analysis · מתעדכן יומית
