
Muse Spark 1.2 vs Gemini 3.5 Flash-Lite: Två labb, två definitioner av subagent
- metaNYMeta: Muse Spark 1.22026-08-0557Intelligens72Kodning
- qwenNYQwen: Qwen3.8 Max2026-08-0358Intelligens72Kodning
- deepseekNYDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligens69Kodning
- minimaxNYMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens · 2046 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligens78Kodning
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligens69Kodning
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligens49Kodning
- metaMeta: Muse Spark 1.12026-07-1653Intelligens71Kodning
- kimiMoonshotAI: Kimi K32026-07-1560Intelligens76Kodning
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligens71Kodning
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligens77Kodning
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Intelligens77Kodning
- grokxAI: Grok 4.52026-07-0856Intelligens72Kodning
- tencentTencent: Hy32026-07-0642Intelligens59Kodning
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Intelligens42Kodning
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Intelligens39Kodning
- anthropicAnthropic: Claude Sonnet 52026-06-3055Intelligens72Kodning
- klingKling: Kling 3.0 Turbo2026-06-1757Intelligens52Kodning57Matematik
Med bara två veckors mellanrum lanserade två labb var sin modell och beskrev den med samma ord. Enligt sitt eget modellkort är Gemini 3.5 Flash-Lite "lämpad för subagenter som utför fokuserade uppgifter inom komplexa multi-agentarbetsflöden." Meta säger att Muse Spark 1.2 kan användas "som antingen en primär agent för planering och delegering eller som en subagent som utför uppgifter parallellt." Samma vokabulär, men det krävdes att Artificial Analysis körde båda genom sitt Intelligence Index för att visa hur olika de menar det: Flash-Lite klarade sviten med 43 miljoner output-tokens, medan Muse Spark 1.2 behövde 95 miljoner. En av dessa modeller tänker kort och ofta; den andra tänker hårt och länge. Båda kallar resultatet en subagent.
Den tokenkvoten är det mest beslutsrelevanta talet i jämförelsen, eftersom en subagentnivå är något du skalar ut — tjugo åt gången, hundra åt gången — och utskalning multiplicerar alla per-anrop-vanor som modellen har. Det följande går igenom vad varje labb faktiskt byggde, hur utskalningsaritmetiken ser ut vid verkliga priser, och där den billiga visar sig vara det dyra valet.
Vad varje labb menar med ordet
Flash-Lite-versionen är en rolldefinition baserad på storlek. Gemini 3.5 Flash-Lite är den billigaste nivån i sin familj, och den positioneringen är anmärkningsvärd eftersom den kopplar tanknivåer direkt till flerstegsarbetsbelastningar med delagenter — första gången en nivå i den familjen har beskrivits utifrån agentroll snarare än storlek eller hastighet. Resonemang är obligatoriskt men standardinsatsen är minimal, ratten toppar på hög, och modellen är byggd för att instansieras i bulk och svara snabbt. Leverantören rapporterar 54,2 % på SWE-Bench Pro mot 49,6 % för Gemini 3 Flash, och 74,0 % på OSWorld-Verified mot 65,1 % — båda leverantörsrapporterade siffror, inte oberoende reproducerade, och båda framställda som agentbaserade vinster snarare än rena intelligensvinster.
Metas version är en rolldefinition baserad på topologi. Muse Spark 1.2:s produkttext beskriver en modell som kan samla in kontext, skapa en plan och delegera exekvering till parallella underagenter — eller själv vara en av dessa underagenter. Dess resonemangsreglage går från minimal till xhigh med standardinställningen medium, och Meta anger uttryckligen de avsedda arbetsbelastningarna: refaktorering av flera filer, längre felsökningssessioner och generering av hela kodbaser. Detta är en modell utformad för att vara orkestreraren som också kan utföra arbetet, vilket är en annan produkt än en modell utformad för att instansieras tjugo åt gången.
Inget labb publicerade ett benchmark för det specifika påståendet. Meta släppte 1.2 den 5 augusti utan något lanseringsinlägg alls — dess Muse Spark 1.1-tillkännagivandesida beskriver fortfarande den tidigare versionen.
Det gap som indexet faktiskt mäter

Oberoende poäng, från Artificial Analysis som kör samma nio-utvärderingskomposit på båda:
• Intelligence Index — Muse Spark 1.2 (xhigh) 54, rank #13 av 185. Gemini 3.5 Flash-Lite 36, rank #20 av 163. Arton poäng, mot en klassmedian på 32.
• Utmatningshastighet — 165.0 tokens per sekund mot 343.6. Flash-Lite strömmar mer än dubbelt så snabbt.
• Tid till första token — 26,12 sekunder mot 10,30, båda vid maximal ansträngning. Artificial Analysis noterar att Flash-Lites 10,30s i sig ligger i den övre delen för resonemangsmodeller i sin priskategori.
• Mångordighet — 95M utdatatokens mot 43M för samma svit, med en median på 65M över alla modeller. Muse Spark 1.2 ligger 46% över medianen; Flash-Lite ligger 34% under.
• Kostnad för att driva indexet — $637.85 jämfört med $153.08.
• Per dimension — Artificial Analysis delindex placerar Gemini 3.5 Flash-Lite på 49,3 i kodning och 26,8 i agentisk förmåga. Det finns ännu ingen publicerad uppdelning för Muse Spark 1.2; dess föregångare fick 71,3 och 37,5.
Arton indexpoäng är inte en avrundningsskillnad. Det här är inte två kandidater för samma plats.
Fan-out-aritmetiken
Per-token-pris är fel måttstock för en subagentnivå, eftersom hela poängen med nivån är att du kör många av dem. Räkna igenom ett exempel med listpriser — $0.30 in och $2.50 ut för Gemini 3.5 Flash-Lite, $1.25 in och $4.25 ut för Muse Spark 1.2.
En orkestrerare skickar ut tjugo subagenter. Var och en läser 25 000 tokens av avgränsad kontext och skriver tillbaka 1 500 tokens.
• Gemini 3.5 Flash-Lite — 20 × ($0.0075 + $0.00375) = ungefär 22,5 cent per fan-out.
• Muse Spark 1.2 — 20 × ($0.03125 + $0.006375) = ungefär 75 cent per fan-out.
Tre och en tredjedel gånger, vilket låter hanterbart. Applicera nu den uppmätta skillnaden i mångordighet. Om Muse Spark 1.2 skriver proportionellt mer än Flash-Lite, på det sätt som den gjorde på indexet — ungefär 2,2 gånger så många utdata-tokens för identiskt arbete — blir de svar på 1 500 token omkring 3 300, och fan-outen stiger till ungefär 91 cent. Fyra gånger, inte tre. Vid hundra fan-outs i timmen i ett hektiskt agentsystem är det skillnaden mellan $22 och $91 i timmen, eller ungefär $600 000 per år i skillnad vid kontinuerlig belastning.
Två prisdetaljer gör den verkliga klyftan ännu bredare i ena riktningen och smalare i den andra:
• Flash-Lite fakturerar intern resonering till samma taxa som utdata. Dess listpris för interna resonemangstokens är 2,50 dollar per miljon — samma som synlig utdata. Tänkande är inte gratis, det är bara osynligt i svaret. Om en underagent överväger 2 000 tokens innan den svarar, lägg till en halv cent per anrop, eller 10 cent över hela fan-outen.
• Cachning gynnar Muse Spark 1.2 i relativa tal. Cachad inläsning kostar 0,15 USD per miljon mot ett listpris på 1,25 USD — en rabatt på 88 %. Flash-Lite läser cachad data för 0,03 USD mot 0,30 USD, en rabatt på 90 %, men tar också ut cirka 0,083 USD per miljon för att skriva cachen, medan Muse Spark 1.2 inte publicerar någon separat avgift för cache-skrivning. Vid en fan-out där varje delagent delar samma stora prefix minskar skillnaden påtagligt.

Produktionslatens är där Flash-Lite drar ifrån som mest, och benchmarksiffror döljer det. På OrcaRouter, över en rullande vecka med verklig trafik, visar Gemini 3.5 Flash-Lite en p50-tid till första token på 816 millisekunder och en p95 på 4,57 sekunder. Muse Spark 1.1 — den närmaste tillgängliga motsvarigheten, eftersom 1.2 ännu inte har någon telemetri — visar en p50 på 1,84 sekunder och en p95 på 6,00 sekunder. När tjugo underagenter kör parallellt är det den långsammaste som bestämmer väggklockan, så p95 är det tal som styr din fan-out-latens, inte p50.
Där den billiga är fel val.
Fyra begränsningar i Gemini 3.5 Flash-Lite som inte visas i en prisjämförelse och som kommer att visas i en incidentgranskning.
• Ett utdatatak på 65 536 tokens. Hälften av vad de flesta modellerna i den här klassen tillåter, och en hård gräns för en subagent som ombeds generera en stor fil eller returnera ett långt strukturerat dokument. Muse Spark 1.2:s slutpunkt deklarerar ingen maximal fullbordandelängd alls — vilket är ovanligt nog att testa snarare än att lita på, men det är inte ett dokumenterat tak.
• Det är en omodererad slutpunkt. Flash-Lite-listningen har ingen modereringsflagga; Metas för Muse Spark 1.2 har det. Det är en verklig fördel för vissa arbetsbelastningar och ett efterlevnadsproblem för andra, och det borde vara ett medvetet val snarare än en upptäckt.
• Dyr inbyggd sökning. Flash-Lites webbsökningsverktyg är prissatt till ungefär 14 dollar per tusen anrop jämfört med 2,50 dollar för Muse Spark 1.2. Om dina underagenter forskar snarare än bara läser, blir den billiga modellen den dyra — fem och en halv gånger så dyr — och sökvolymen i en fan-out-arkitektur skalar med fan-out.
• Dess pris gick upp, inte ner.Gemini 3.5 Flash-Lite listas till $0,30 och $2,50 medan den tidigare Gemini 3.1 Flash-Lite var $0,25 och $1,50. Utdata är 67% dyrare än den nivå den ersätter. Om du har storleksanpassat en subagentbudget efter den äldre modellen, justera den.

Ännu en asymmetri värd att säga rakt ut: Muse Spark 1.2 tillhandahålls av exakt en leverantör — Meta — utan tredjepartsvärdar och utan fallback. Gemini 3.5 Flash-Lite har det vanliga förstaparts multi-region-leveransfotavtrycket. För en orkestrerare innebär det en enda felpunkt för hela ditt agentträd; för en worker-nivå innebär det en enda felpunkt för fan-out.
Den kombination som de flesta team faktiskt kommer att landa på
Lästa mot varandra är dessa två modeller inte så mycket konkurrenter som två halvor av en och samma arkitektur, och Metas egen produkttext säger lika mycket när den beskriver primäragentrollen separat från subagentrollen.
Den form som följer av siffrorna: Muse Spark 1.2 som orkestreraren, Gemini 3.5 Flash-Lite som arbetarna. Ett kostsamt, omsorgsfullt anrop som läser repositoryt, håller planen och beslutar vad som ska delegeras — där 26 sekunders tänkande och mångordighet i 95M-token-skala ger dig en plan värd att genomföra — följt av tjugo billiga, snabba, avgränsade anrop som var och en gör en avgränsad sak och returnerar på under en sekund vid p50. Du betalar frontier-nära priser en gång per uppgift och budgetpriser per arbetsenhet, vilket är exakt den kostnadskurva en fan-out-arkitektur vill ha.
Vänd på det så kollapsar ekonomin. Tjugo Muse Spark 1.2-subagenter till 91 cent per fan-out ger en nota som är fyra gånger så hög för arbete som en 18 poäng svagare modell slutför på en tredjedel av tiden, och en Flash-Lite-orkestrerare med index 36 kommer att producera planer som arbetarna inte kan rädda.
Att bygga den där uppdelningen mellan två leverantörer brukade vara den besvärliga delen. Gemini 3.5 Flash-Lite finns i OrcaRouter-katalogen för $0.30 och $2.50 — leverantörens listpris, vidarefakturerat med 0 % påslag, så en prisändring hamnar hos oss samma dag i stället för efter en avtalsperiod — och Muse Spark 1.1 finns där för $1.25 och $4.25 på samma villkor, båda bakom en OpenAI-kompatibel slutpunkt. Det betyder att mönstret med orkestrerare och arbetare är två modellsträngar i en kodbas i stället för två SDK:er, två nycklar och två fakturor, och automatisk failover täcker fallet där en leverantör har en dålig eftermiddag mitt i en fan-out. För att vara exakt med vad som finns tillgängligt: Muse Spark 1.2 i sig finns inte i katalogen ännu — Meta tillhandahåller den direkt som enda leverantör — så idag kör den närmaste versionen av den här stacken 1.1 i orkestrerarplatsen.
Välj efter roll, inte efter poäng
Om du väljer en arbetarnivå — dokumenttolkning, dataextraktion, avgränsade filändringar, klassificering, den smala repetitiva mitten av ett agentträd — är Gemini 3.5 Flash-Lite det bättre verktyget, och indexunderskottet på 18 punkter är mestadels irrelevant eftersom du inte ber den att resonera. Håll koll på utdatataket och sökprissättningen.
Om du väljer den modell som avgör vad arbetarna gör, är Muse Spark 1.2 den starkare kandidaten av de två, med förbehållen att den saknar oberoende agentiskt betyg per dimension, arenarekord av något slag, produktionstelemetri och har endast en leverantör. Det är de luckor som måste stängas innan den kan hålla en produktionsplan.
Och om du hoppades att en enda modell skulle kunna göra båda jobben, är det ärliga svaret från mätningarna att ingen av dem gör det. Flash-Lite kan inte planera vid index 36; Muse Spark 1.2 kan inte instansieras tjugo åt gången för 91 cent per fan-out. Ordet "subagent" som förekommer i båda produktbeskrivningarna är en marknadsföringssammanträffande, inte ett tecken på att de hör hemma i samma fack.
Jämförda i den här artikeln3
Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen
