Gegenereerde titelkaart met de tekst GPT-6 Sol vs Muse Spark 1.2, een van hen heeft oren, met statkaarten met de tekst invoermodaliteiten tekst, afbeelding, bestand vs tekst, afbeelding, video, bestand, audio, uitvoerprijs $10,00 vs $4,25 per miljoen, en GPQA Diamond van derden 96,1 vs 90,4, met een voettekst met de tekst Muse Spark 1.2 tarieven volgens Meta en GPT-6 Sol tarieven volgens OpenAI's tariefkaart; benchmarkcijfers volgens Artificial Analysis.
Guides & Insights

GPT-6 Sol vs Muse Spark 1.2: Een van hen heeft oren

Auteur

Elias Hawthorne

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen →
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Zet GPT-6 Sol en Muse Spark 1.2 naast elkaar en de prijskolommen zijn simpelweg anders, terwijl de modaliteitskolommen helemaal niet in elkaars buurt liggen. Muse Spark 1.2 accepteert tekst, afbeelding, video, bestand en audio. GPT-6 Sol accepteert tekst, afbeelding en bestand. Audio en video vormen het verschil, en dat is geen afrondingsdetail: ze scheiden een model waaraan je een vergaderopname kunt geven van een model waaraan je een transcript ervan moet geven. GPT-6 Sol, de middelste tier van die generatie, werd uitgebracht op 22 september 2026; Muse Spark 1.2, Meta's huidige checkpoint in de Muse Spark-familie, verscheen op 5 augustus 2026 als drop-in update voor Muse Spark 1.1 op dezelfde Standard-tier tegen identieke prijzen.

Dat laatste punt is van belang voor hoe deze pagina gelezen moet worden. Muse Spark 1.2 is geen nieuwe generatie en moet ook niet als zodanig worden beschreven — Meta's eigen beschrijving is een bijgewerkte checkpoint met iets hogere prestaties, aangeboden tegen ongewijzigde tarieven. De interessante vraag is dus niet wat 1.2 toevoegt ten opzichte van 1.1. Het is wat de Muse Spark-familie heeft dat de GPT-6-familie niet heeft, en of je het nodig hebt.

De twee specsheets, over de afmetingen die verschillen

Invoermodaliteiten — GPT-6 Sol tekst, afbeelding en bestand vs Muse Spark 1.2 tekst, afbeelding, video, bestand en audio

Uitvoer — beide alleen tekst

• Invoerprijs — GPT-6 Sol $2,00 per miljoen vs. Muse Spark 1.2 $1,25 per miljoen

• Uitvoerprijs — GPT-6 Sol $10,00 per miljoen versus Muse Spark 1.2 $4,25 per miljoen

• Gecachte invoer — GPT-6 Sol $ 0,20 per miljoen vs Muse Spark 1.2 $ 0,15 per miljoen

• Contextvenster — 1,050,000 tokens vs 1,048,576 tokens, in de praktijk hetzelfde

• Stap voor lange verzoeken — GPT-6 Sol rep het hele verzoek boven 272.000 inputtokens tegen $4,00 / $15,00 vs Muse Spark 1.2 geen stap op zijn kaart

• GPQA Diamond — GPT-6 Sol 96,1 vs Muse Spark 1.2 90,4

• Humanity's Last Exam — GPT-6 Sol 47,9 tegen Muse Spark 1.2 45,5

• Recall over lange context — GPT-6 Sol 83,7 vs Muse Spark 1.2 79,0

• tau-banking — GPT-6 Sol niet gepubliceerd in deze revisie vs Muse Spark 1.2 34.8

• Gewichten — beide gesloten, alleen API

De regel voor lange aanvragen doet in die lijst stilletjes zijn werk. Muse Spark 1.2 heeft geen clausule voor herprijzing bij lange context op zijn gepubliceerde kaart, dus zijn $1,25 / $4,25 blijft gelden voor het hele venster. Het hoofdtarief van GPT-6 Sol doet dat niet: na 272.000 invoertokens gaat de hele aanvraag naar $4,00 / $15,00. Bij een prompt met volledige context is de outputvergelijking dus niet tien dollar tegenover $4,25, maar vijftien tegenover $4,25 — drieënhalf keer, niet twee en een derde.

En de benchmarkkloof is kleiner dan de prijskloof doet vermoeden. GPQA Diamond, 96,1 tegen 90,4, is ongeveer de spreiding die je zou verwachten bij twee verschillende instellingen voor redeneerinspanning, niet bij een verschil in capaciteit, en bij Humanity's Last Exam zijn die twee 47,9 en 45,5, wat 2,4 punten op een schaal van honderd is. Muse Spark 1.2 is het goedkopere model en de breder capabele lezer; GPT-6 Sol loopt voor op de redeneercijfers, maar niet met de marge die de prijs suggereert. Geen van beide kolommen domineert, en juist daarom is het de moeite waard om deze keuze bewust te maken.

Generated comparison scoreboard titled GPT-6 Sol vs Muse Spark 1.2, the scoreboard, with six matched rows. GPT-6 Sol: input $2.00 per million, output $10.00 per million, modalities text image file, GPQA Diamond 96.1, long-context recall 83.7, reprices above 272K input tokens. Muse Spark 1.2: input $1.25 per million, output $4.25 per million, modalities text image video file audio, GPQA Diamond 90.4, long-context recall 79.0, no long-request step. A footer reads Muse Spark 1.2 figures per Artificial Analysis and Meta; GPT-6 Sol figures per Artificial Analysis and OpenAI.

Wat audio- en video-invoer daadwerkelijk verandert

Een model dat audio accepteert, kan een opname krijgen in plaats van een transcript. Dat klinkt als een gemak, maar is in werkelijkheid een verandering in wat mogelijk is: transcriptie is een verlieslatende stap die toon, overlapping, gelach en het verschil tussen een vraag en een mededeling dat alleen uit tekst valt op te maken, weggooit. Een model dat het bestand rechtstreeks hoort, ziet dat allemaal. Hetzelfde argument geldt voor video, waar een beschrijving frame voor frame de timing verliest en een model dat de clip verwerkt dat niet.

GPT-6 Sol's antwoord is een pipeline in plaats van een modaliteit: eerst transcriberen of ondertitelen, daarna tekst doorgeven. Dat is een volkomen werkbare architectuur, en voor veel workloads is die beter, omdat een transcript controleerbaar, cachebaar en goedkoop op te slaan is. Het is juist slechter wanneer de audio of de beweging het signaal is: kwaliteitsbeoordeling in callcenters, medialogging, alles waarbij de aarzeling van een spreker de betekenis draagt.

De positie van Meta hierover is het zorgvuldig lezen waard, want de audio-tag is geen decoratie. Muse Spark 1.2 wordt met audio vermeld onder zijn capaciteiten, naast visie, tools, JSON en redeneervermogen, en Meta heeft de familie uitgebracht als zijn multimodale lijn, terwijl de kleinere Muse Glimmer werd gedistilleerd uit een Muse Spark-teacher. Als je op het gebied van invoeroppervlak tussen deze twee kiest, gaat de keuze niet tussen een iets uitgebreider specificatieblad en een iets beperkter specificatieblad. Het is een kwestie van de modaliteit hebben versus een pipeline bouwen om die te benaderen.

Waar de twee werkelijk uiteengaan

Het duidelijkste onderscheid is agentisch toolgebruik tegen een gesimuleerde service, en het is de enige plek waar de cijfers ver genoeg uiteenliggen om er iets mee te doen. Muse Spark 1.2 scoort 34,8 op tau-banking en slechts 7,1 op de nieuwere Terminal-Bench 4.0-revisie — beide metingen van derden, en beide beschrijven dezelfde zwakte vanuit twee richtingen. Een model dat een vergadering goed leest en vervolgens het saldo van een klant verkeerd berekent wanneer het wordt gevraagd een API aan te roepen, is geen slecht model; het is een model met een duidelijk afgebakende taak.

Voer dezelfde controle uit op GPT-6 Sol en het beeld is consistent maar dunner. De long-context recall staat op 83.7, SciCode op 57.6 en Terminal-Bench 4.0 op 43.9, allemaal van derden. De cijfers voor coding en terminal-agent in de v2.1-revisie ontbreken simpelweg, en het ontbreken van een getal is geen laag getal — wie die cel met een schatting vult, verzint iets.

Eén asymmetrie die het benoemen waard is voordat de cijfers al te gretig worden vergeleken. Muse Spark 1.2 heeft een volledige leveranciersbenchmarksuite van Meta naast de set van derden, en de eigen lanceeranalyse van Artificial Analysis plaatste het op 54 op de Intelligence Index bij zijn xhigh-redeneerinstelling, drie punten boven Muse Spark 1.1. GPT-6 Sol komt uit op 47,6 op dezelfde index in onze catalogus. Die twee cijfers zijn niet van elkaar af te trekken: ze komen uit verschillende configuraties die op verschillende momenten zijn gemeten, en een index die tussen beide is herzien, is niet hetzelfde instrument. De eerlijke vergelijkende claims zijn de single-benchmarkclaims hierboven, waarbij beide modellen een cijfer van dezelfde evaluator hebben. Wanneer een model meer gepubliceerde cijfers heeft, zal het altijd beter gedocumenteerd lijken dan een model dat er minder heeft, en bij dit paar gaat veel van dat verschil over wie rapporteert in plaats van wat de modellen kunnen.

OrcaRouter model page for Muse Spark 1.2 (meta/muse-spark-1.2) by Meta, dated 2026-08-05, tagged Vision, Audio, Tools, JSON and Reasoning, showing text, image, video, file and audio input with text output, a list price of $1.25 per million input and $4.25 per million output, and page copy describing it as Meta's reasoning model for complex agentic tasks and the current checkpoint of the Muse Spark family.

Twee modellen serveren die zich anders gedragen onder belasting

Beide staan op OrcaRouter, één sleutel, en het duo vormt een natuurlijke routeringssplitsing in plaats van een of-of-keuze. Stuur het multimodale verkeer — de opnames, de clips, de documentbundels met gescande bijlagen — naar Muse Spark 1.2 tegen $1,25 / $4,25 zonder long-context-cliff. Stuur het redeneerintensieve en agentische verkeer naar GPT-6 Sol en accepteer het hogere tarief voor de verzoeken waarbij het antwoord kritische toetsing moet doorstaan. Via één endpoint is die splitsing een routeringsregel, geen twee integraties.

Eén cijfer aan de serveerzijde druist in tegen de prijslogica. Muse Spark 1.2 wordt gemeten op ongeveer 420 outputtokens per seconde in ons rollende venster van zeven dagen, tegenover ongeveer 244 voor GPT-6 Sol — Meta's model is zowel goedkoper als sneller op onze routes. De latentie loopt bij de eerste token de andere kant op: een p50-tijd-tot-eerste-token van ongeveer 5,2 seconden voor Muse Spark 1.2 tegenover ongeveer 6,8 voor GPT-6 Sol in hetzelfde venster, dus het goedkopere model begint ook eerder te antwoorden. Beide zijn rollende metingen op gedeelde infrastructuur in plaats van een gecontroleerde benchmark, en beide verschuiven tussen aflezingen.

Automatische failover verdient zijn plaats op een gemengde pijplijn zoals deze. Wanneer een verzoek via de ene route als audio kan binnenkomen en als tekst kan vertrekken, of via een andere route een verplichte transcriptiestap moet ondergaan, is de faalmodus waar je op let een provider die het verzoek accepteert en vervolgens blijft hangen bij de media-upload — een tweede geconfigureerde route maakt daar een nieuwe poging van in plaats van een taak die iemand moet opmerken en opnieuw moet uitvoeren. Onze catalogus geeft de lijstprijzen van providers ongewijzigd door, dus als Meta de $4.25-regel aanpast, of een clausule voor lange context toevoegt aan de Muse Spark-kaart zoals andere leveranciers al hebben gedaan, bereikt de wijziging je op de dag dat die gebeurt, in plaats van nadat een wederverkoper het opmerkt.

Artificial Analysis launch analysis for Muse Spark 1.2 dated August 5, 2026, titled Muse Spark 1.2: Improved Agentic Performance at Higher Cost per Task, reporting that Muse Spark 1.2 scores 54 on the Artificial Analysis Intelligence Index, up 3 points from Muse Spark 1.1 at 51 and 11 points from Muse Spark 1.0 at 43, and describing it as Meta's third release in four months, tying with SpaceXAI for third place among US labs.

De beslissing, simpel gezegd

Als je invoer een opname of een clip is en de timing of toon deel uitmaakt van de betekenis, gebruik dan Muse Spark 1.2. Er is geen configuratie van GPT-6 Sol die die capaciteit via de API bereikt, en geen prijs waarbij de vervangende pipeline gelijkwaardig wordt. Als je invoer tekst en afbeeldingen is en er wordt gehandeld op de uitvoer, staan de redeneercijfers van GPT-6 Sol voorop en is het profiel voor toolgebruik het veiligere — de tau-banking- en Terminal-Bench 4.0-scores van Muse Spark 1.2 zijn het luidste signaal op beide bladen, en ze wijzen weg van agentisch werk.

En let op wat Muse Spark 1.2 niet is: een nieuwe generatie. Het is Meta's huidige checkpoint van een bestaande familie, een drop-invervanging voor 1.1 tegen ongewijzigde prijzen, waardoor de upgradebeslissing gratis is en de vergelijking met GPT-6 Sol een aparte kwestie wordt. Aan de andere kant is GPT-6 Sol al opgevolgd door GPT-6.1 Sol tegen identieke tarieven voor korte context, waarbij gecachte input is gehalveerd van $0,20 naar $0,10, en OpenAI's eigen modelpagina verwijst lezers nu daarnaar. Als de reden dat je Sol overweegt in plaats van Muse Spark de acht dagen oude integratie is, dan staat die. Als het om capaciteiten gaat, kijk dan eerst naar de opvolger.

Vergeleken in dit artikel1

Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt