Genererat titelkort med texten GPT-6 Sol vs Muse Spark 1.2, en av dem har öron, med statistikkort som anger indatamodaliteter text bild fil vs text bild video fil ljud, utdatapris $10,00 vs $4,25 per miljon, och tredjeparts-GPQA Diamond 96,1 vs 90,4, med en sidfot som anger Muse Spark 1.2-priser enligt Meta och GPT-6 Sol-priser enligt OpenAIs prislista; benchmarkvärden enligt Artificial Analysis.
Guides & Insights

GPT-6 Sol vs Muse Spark 1.2: En av dem har öron

Författare

Elias Hawthorne

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller →
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Ställ GPT-6 Sol och Muse Spark 1.2 sida vid sida och priskolumnerna är bara olika, medan modalitetskolumnerna inte ens är i närheten av varandra. Muse Spark 1.2 tar emot text, bild, video, fil och ljud. GPT-6 Sol tar emot text, bild och fil. Ljud och video är skillnaden, och de är inte en avrundningsdetalj: de skiljer en modell som kan ges en mötesinspelning från en som måste ges en transkription av den. GPT-6 Sol, mellannivån i den generationen, släpptes den 22 september 2026; Muse Spark 1.2, Metas nuvarande checkpoint i Muse Spark-familjen, släpptes den 5 augusti 2026 som en drop-in-uppdatering av Muse Spark 1.1 på samma Standard-nivå till identiskt pris.

Den sista punkten har betydelse för hur den här sidan bör läsas. Muse Spark 1.2 är inte en ny generation och bör inte beskrivas som en – Metas egen beskrivning är en uppdaterad checkpoint med något högre prestanda, som erbjuds till oförändrade priser. Så den intressanta frågan är inte vad 1.2 tillför jämfört med 1.1. Det är vad Muse Spark-familjen har som GPT-6-familjen inte har, och om du behöver det.

De två specifikationsbladen, avseende de dimensioner som skiljer sig.

• Inmatningsmodaliteter — GPT-6 Sol text, bild och fil vs Muse Spark 1.2 text, bild, video, fil och ljud

• Utdata – endast båda texterna

• Inputpris — GPT-6 Sol $2,00 per miljon vs Muse Spark 1.2 $1,25 per miljon

• Pris för utdata — GPT-6 Sol $10,00 per miljon vs Muse Spark 1.2 $4,25 per miljon

• Cachad indata — GPT-6 Sol $0.20 per miljon mot Muse Spark 1.2 $0.15 per miljon

• Kontextfönster — 1 050 000 tokens vs 1 048 576 tokens, i praktiken samma

• Steg för långa förfrågningar — GPT-6 Sol omprissätter hela förfrågan över 272 000 indatatokens till $4.00 / $15.00, jämfört med Muse Spark 1.2 som inte har något sådant steg på sitt kort

• GPQA Diamond — GPT-6 Sol 96,1 mot Muse Spark 1.2 90,4

• Mänsklighetens sista prov — GPT-6 Sol 47,9 mot Muse Spark 1.2 45,5

• Återkallelse över lång kontext — GPT-6 Sol 83,7 mot Muse Spark 1.2 79,0

• tau-banking — GPT-6 Sol inte publicerad i denna revision vs Muse Spark 1.2 34.8

• Vikter — båda stängda, endast API

Posten för långa förfrågningar gör tyst arbete i den listan. Muse Spark 1.2 har ingen klausul om omprissättning för lång kontext på sitt publicerade priskort, så dess $1,25 / $4,25 gäller över hela fönstret. GPT-6 Sols rubrikpris gör det inte: efter 272 000 indatatokens flyttas hela förfrågan till $4,00 / $15,00. Vid en prompt med full kontext är jämförelsen av utdata därför inte tio dollar mot $4,25, utan femton mot $4,25 – tre och en halv gånger, inte två och en tredjedel.

Och benchmarkgapet är mindre än vad prisskillnaden antyder. GPQA Diamond, 96,1 mot 90,4, är ungefär den spridning man skulle förvänta sig från två olika inställningar för resonemangsinsats snarare än från en kapacitetsskillnad, och på Humanity's Last Exam ligger de två på 47,9 och 45,5, vilket är 2,4 punkter på en hundrapoängsskala. Muse Spark 1.2 är den billigare modellen och den mer generellt kapabla läsaren; GPT-6 Sol ligger före i resonemangssiffrorna men inte med den marginal som priset antyder. Ingen av kolumnerna dominerar, vilket är det som gör att valet är värt att göra medvetet.

Generated comparison scoreboard titled GPT-6 Sol vs Muse Spark 1.2, the scoreboard, with six matched rows. GPT-6 Sol: input $2.00 per million, output $10.00 per million, modalities text image file, GPQA Diamond 96.1, long-context recall 83.7, reprices above 272K input tokens. Muse Spark 1.2: input $1.25 per million, output $4.25 per million, modalities text image video file audio, GPQA Diamond 90.4, long-context recall 79.0, no long-request step. A footer reads Muse Spark 1.2 figures per Artificial Analysis and Meta; GPT-6 Sol figures per Artificial Analysis and OpenAI.

Vad ljud- och videoingångar faktiskt förändrar

En modell som tar emot ljud kan få en inspelning i stället för en transkription. Det låter som en bekvämlighet och är i själva verket en förändring av vad som är möjligt: transkription är ett förlustbringande steg som kastar bort ton, överlappning, skratt och skillnaden mellan en fråga och ett påstående när de bara läses från text. En modell som hör filen direkt ser allt detta. Samma argument gäller för video, där beskrivning bild för bild förlorar tidsinformation och en modell som tar in klippet inte gör det.

GPT-6 Sols svar är en pipeline snarare än en modalitet – transkribera eller undertexta först och skicka sedan texten. Det är en fullt fungerande arkitektur och för många arbetsbelastningar är den den bättre, eftersom en transkription är inspekterbar, cachebar och billig att lagra. Den är sämre just när ljudet eller rörelsen är signalen: kvalitetsgranskning av callcenter, medialoggning, allt där en talares tvekan bär betydelsen.

Metas hållning i den här frågan är värd att läsa noga, eftersom ljudtaggen inte är en dekoration. Muse Spark 1.2 listas med ljud bland sina förmågor vid sidan av vision, verktyg, JSON och resonemang, och Meta har lanserat familjen som sin multimodala linje, medan den mindre Muse Glimmer destillerades från en Muse Spark-lärare. Om du väljer mellan dessa två utifrån indataytan står valet inte mellan ett något bredare specifikationsblad och ett något smalare. Det står mellan att ha modaliteten och att bygga en pipeline för att approximera den.

Där de två verkligen skiljs åt

Den tydligaste separationen är agentisk verktygsanvändning mot en simulerad tjänst, och det är det enda stället där siffrorna är tillräckligt långt ifrån varandra för att man ska kunna agera på dem. Muse Spark 1.2 uppnår 34,8 på tau-banking och bara 7,1 på den nyare revisionen av Terminal-Bench 4.0 – båda är tredjepartsmätningar, och båda beskriver samma svaghet från två håll. En modell som tolkar ett möte väl och sedan räknar fel på en kunds saldo när den ombeds anropa ett API är inte en dålig modell; det är en modell med en tydligt avgränsad uppgift.

Kör samma kontroll på GPT-6 Sol och bilden är konsekvent men tunnare. Dess återkallning över lång kontext ligger på 83,7, SciCode på 57,6 och dess Terminal-Bench 4.0 på 43,9, alla från tredje part. Dess siffror för kodning och terminalagent i v2.1-revisionen saknas helt, och frånvaron av en siffra är inte en låg siffra – den som fyller den cellen med en uppskattning hittar på.

En asymmetri som är värd att nämna innan siffrorna jämförs alltför ivrigt. Muse Spark 1.2 har en fullständig leverantörsbenchmark-svit från Meta vid sidan av tredjepartssviten, och Artificial Analysys egen lanseringsanalys placerade den på 54 i Intelligence Index vid dess xhigh-reasoninginställning, tre punkter över Muse Spark 1.1. GPT-6 Sol hamnar på 47,6 i samma index i vår katalog. De två siffrorna går inte att subtrahera: de kommer från olika konfigurationer uppmätta vid olika tidpunkter, och ett index som reviderats mellan dem är inte samma instrument. De ärliga jämförande påståendena är de som gäller en enskild benchmark ovan, där båda modellerna har en siffra från samma utvärderare. När en modell har fler publicerade siffror kommer den alltid att se bättre dokumenterad ut än en som har färre, och i detta par handlar mycket av den skillnaden om vem som rapporterar snarare än vad modellerna kan göra.

OrcaRouter model page for Muse Spark 1.2 (meta/muse-spark-1.2) by Meta, dated 2026-08-05, tagged Vision, Audio, Tools, JSON and Reasoning, showing text, image, video, file and audio input with text output, a list price of $1.25 per million input and $4.25 per million output, and page copy describing it as Meta's reasoning model for complex agentic tasks and the current checkpoint of the Muse Spark family.

Att servera två modeller som beter sig olika under belastning

Båda finns på OrcaRouter, med en nyckel, och paret är en naturlig dirigerad uppdelning snarare än ett antingen-eller. Skicka den multimodala trafiken – inspelningarna, klippen, dokumentsamlingarna med skannade bilagor – till Muse Spark 1.2 för $1.25 / $4.25 utan något stup vid lång kontext. Skicka den resonemangstunga och agentiska trafiken till GPT-6 Sol och acceptera den högre taxan för de förfrågningar där svaret måste tåla granskning. Via en enda slutpunkt är den uppdelningen en dirigeringsregel, inte två integrationer.

En siffra på serveringssidan strider mot prislogiken. Muse Spark 1.2 mäts till ungefär 420 utdatatokens per sekund i vårt rullande sjudagarsfönster mot GPT-6 Sols ungefär 244 – Metas modell är både billigare och snabbare på våra rutter. Latensen går åt andra hållet för första token: en p50-tid till första token på omkring 5,2 sekunder för Muse Spark 1.2 mot ungefär 6,8 för GPT-6 Sol i samma fönster, så den billigare modellen börjar också svara tidigare. Båda är rullande mätningar på delad infrastruktur snarare än ett kontrollerat benchmark, och båda förändras mellan avläsningar.

Automatisk failover förtjänar sin plats i en blandad pipeline som den här. När en begäran kan komma in som ljud och lämna som text via en väg, eller som ett obligatoriskt transkriberingssteg via en annan, är det felbeteende du bryr dig om en leverantör som accepterar begäran och sedan fastnar vid mediauppladdningen – en andra konfigurerad väg gör det till ett nytt försök i stället för ett jobb som någon måste upptäcka och köra om. Vår katalog förmedlar leverantörernas listpriser oförändrade, så om Meta flyttar raden på 4,25 $, eller lägger till en klausul om lång kontext i Muse Spark-kortet på samma sätt som andra leverantörer redan har, når ändringen dig samma dag som den sker i stället för efter att en återförsäljare har upptäckt den.

Artificial Analysis launch analysis for Muse Spark 1.2 dated August 5, 2026, titled Muse Spark 1.2: Improved Agentic Performance at Higher Cost per Task, reporting that Muse Spark 1.2 scores 54 on the Artificial Analysis Intelligence Index, up 3 points from Muse Spark 1.1 at 51 and 11 points from Muse Spark 1.0 at 43, and describing it as Meta's third release in four months, tying with SpaceXAI for third place among US labs.

Beslutet, enkelt uttryckt

Om din indata är en inspelning eller ett klipp och tajmingen eller tonen är en del av betydelsen, använd Muse Spark 1.2. Det finns ingen konfiguration av GPT-6 Sol som når den förmågan via API:et, och inget pris där den ersättande pipelinen blir likvärdig. Om din indata är text och bilder och utdatan ska användas för åtgärder, ligger GPT-6 Sols resonemangssiffror före och dess verktygsanvändningsprofil är den säkrare — Muse Spark 1.2:s tau-banking- och Terminal-Bench 4.0-poäng är den starkaste signalen på båda bladen, och de pekar bort från agentiskt arbete.

Och notera vad Muse Spark 1.2 inte är: en ny generation. Det är Metas nuvarande checkpoint av en befintlig familj, en drop-in-ersättning för 1.1 till oförändrat pris, vilket gör uppgraderingsbeslutet kostnadsfritt och jämförelsen med GPT-6 Sol till en separat fråga. Å andra sidan har GPT-6 Sol redan ersatts av GPT-6.1 Sol till identiska priser för kort kontext, med cachad indata halverad från $0.20 till $0.10, och OpenAIs egen modellsida hänvisar nu läsare till den. Om anledningen till att du väger Sol i stället för Muse Spark är den åtta dagar gamla integrationen, så håller det. Om det är kapacitet, kontrollera efterträdaren först.

Jämförda i den här artikeln2

Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen