
GPT-6 Sol vs Muse Spark 1.2: Een van hen heeft oren
- openaiNIEUWOpenAI: GPT-6.1 Sol2026-09-2952Intelligentie
- anthropicNIEUWAnthropic: Claude Sonnet 5.52026-09-2856Intelligentie
- typesafeNIEUWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 mln tokens · 127 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligentie
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- xAIGrok 4.72026-09-2146Intelligentie
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 mln tokens · 58 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 mln tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 350 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
Zet GPT-6 Sol en Muse Spark 1.2 naast elkaar en de prijskolommen zijn simpelweg anders, terwijl de modaliteitskolommen helemaal niet in elkaars buurt liggen. Muse Spark 1.2 accepteert tekst, afbeelding, video, bestand en audio. GPT-6 Sol accepteert tekst, afbeelding en bestand. Audio en video vormen het verschil, en dat is geen afrondingsdetail: ze scheiden een model waaraan je een vergaderopname kunt geven van een model waaraan je een transcript ervan moet geven. GPT-6 Sol, de middelste tier van die generatie, werd uitgebracht op 22 september 2026; Muse Spark 1.2, Meta's huidige checkpoint in de Muse Spark-familie, verscheen op 5 augustus 2026 als drop-in update voor Muse Spark 1.1 op dezelfde Standard-tier tegen identieke prijzen.
Dat laatste punt is van belang voor hoe deze pagina gelezen moet worden. Muse Spark 1.2 is geen nieuwe generatie en moet ook niet als zodanig worden beschreven — Meta's eigen beschrijving is een bijgewerkte checkpoint met iets hogere prestaties, aangeboden tegen ongewijzigde tarieven. De interessante vraag is dus niet wat 1.2 toevoegt ten opzichte van 1.1. Het is wat de Muse Spark-familie heeft dat de GPT-6-familie niet heeft, en of je het nodig hebt.
De twee specsheets, over de afmetingen die verschillen
Invoermodaliteiten — GPT-6 Sol tekst, afbeelding en bestand vs Muse Spark 1.2 tekst, afbeelding, video, bestand en audio
Uitvoer — beide alleen tekst
• Invoerprijs — GPT-6 Sol $2,00 per miljoen vs. Muse Spark 1.2 $1,25 per miljoen
• Uitvoerprijs — GPT-6 Sol $10,00 per miljoen versus Muse Spark 1.2 $4,25 per miljoen
• Gecachte invoer — GPT-6 Sol $ 0,20 per miljoen vs Muse Spark 1.2 $ 0,15 per miljoen
• Contextvenster — 1,050,000 tokens vs 1,048,576 tokens, in de praktijk hetzelfde
• Stap voor lange verzoeken — GPT-6 Sol rep het hele verzoek boven 272.000 inputtokens tegen $4,00 / $15,00 vs Muse Spark 1.2 geen stap op zijn kaart
• GPQA Diamond — GPT-6 Sol 96,1 vs Muse Spark 1.2 90,4
• Humanity's Last Exam — GPT-6 Sol 47,9 tegen Muse Spark 1.2 45,5
• Recall over lange context — GPT-6 Sol 83,7 vs Muse Spark 1.2 79,0
• tau-banking — GPT-6 Sol niet gepubliceerd in deze revisie vs Muse Spark 1.2 34.8
• Gewichten — beide gesloten, alleen API
De regel voor lange aanvragen doet in die lijst stilletjes zijn werk. Muse Spark 1.2 heeft geen clausule voor herprijzing bij lange context op zijn gepubliceerde kaart, dus zijn $1,25 / $4,25 blijft gelden voor het hele venster. Het hoofdtarief van GPT-6 Sol doet dat niet: na 272.000 invoertokens gaat de hele aanvraag naar $4,00 / $15,00. Bij een prompt met volledige context is de outputvergelijking dus niet tien dollar tegenover $4,25, maar vijftien tegenover $4,25 — drieënhalf keer, niet twee en een derde.
En de benchmarkkloof is kleiner dan de prijskloof doet vermoeden. GPQA Diamond, 96,1 tegen 90,4, is ongeveer de spreiding die je zou verwachten bij twee verschillende instellingen voor redeneerinspanning, niet bij een verschil in capaciteit, en bij Humanity's Last Exam zijn die twee 47,9 en 45,5, wat 2,4 punten op een schaal van honderd is. Muse Spark 1.2 is het goedkopere model en de breder capabele lezer; GPT-6 Sol loopt voor op de redeneercijfers, maar niet met de marge die de prijs suggereert. Geen van beide kolommen domineert, en juist daarom is het de moeite waard om deze keuze bewust te maken.

Wat audio- en video-invoer daadwerkelijk verandert
Een model dat audio accepteert, kan een opname krijgen in plaats van een transcript. Dat klinkt als een gemak, maar is in werkelijkheid een verandering in wat mogelijk is: transcriptie is een verlieslatende stap die toon, overlapping, gelach en het verschil tussen een vraag en een mededeling dat alleen uit tekst valt op te maken, weggooit. Een model dat het bestand rechtstreeks hoort, ziet dat allemaal. Hetzelfde argument geldt voor video, waar een beschrijving frame voor frame de timing verliest en een model dat de clip verwerkt dat niet.
GPT-6 Sol's antwoord is een pipeline in plaats van een modaliteit: eerst transcriberen of ondertitelen, daarna tekst doorgeven. Dat is een volkomen werkbare architectuur, en voor veel workloads is die beter, omdat een transcript controleerbaar, cachebaar en goedkoop op te slaan is. Het is juist slechter wanneer de audio of de beweging het signaal is: kwaliteitsbeoordeling in callcenters, medialogging, alles waarbij de aarzeling van een spreker de betekenis draagt.
De positie van Meta hierover is het zorgvuldig lezen waard, want de audio-tag is geen decoratie. Muse Spark 1.2 wordt met audio vermeld onder zijn capaciteiten, naast visie, tools, JSON en redeneervermogen, en Meta heeft de familie uitgebracht als zijn multimodale lijn, terwijl de kleinere Muse Glimmer werd gedistilleerd uit een Muse Spark-teacher. Als je op het gebied van invoeroppervlak tussen deze twee kiest, gaat de keuze niet tussen een iets uitgebreider specificatieblad en een iets beperkter specificatieblad. Het is een kwestie van de modaliteit hebben versus een pipeline bouwen om die te benaderen.
Waar de twee werkelijk uiteengaan
Het duidelijkste onderscheid is agentisch toolgebruik tegen een gesimuleerde service, en het is de enige plek waar de cijfers ver genoeg uiteenliggen om er iets mee te doen. Muse Spark 1.2 scoort 34,8 op tau-banking en slechts 7,1 op de nieuwere Terminal-Bench 4.0-revisie — beide metingen van derden, en beide beschrijven dezelfde zwakte vanuit twee richtingen. Een model dat een vergadering goed leest en vervolgens het saldo van een klant verkeerd berekent wanneer het wordt gevraagd een API aan te roepen, is geen slecht model; het is een model met een duidelijk afgebakende taak.
Voer dezelfde controle uit op GPT-6 Sol en het beeld is consistent maar dunner. De long-context recall staat op 83.7, SciCode op 57.6 en Terminal-Bench 4.0 op 43.9, allemaal van derden. De cijfers voor coding en terminal-agent in de v2.1-revisie ontbreken simpelweg, en het ontbreken van een getal is geen laag getal — wie die cel met een schatting vult, verzint iets.
Eén asymmetrie die het benoemen waard is voordat de cijfers al te gretig worden vergeleken. Muse Spark 1.2 heeft een volledige leveranciersbenchmarksuite van Meta naast de set van derden, en de eigen lanceeranalyse van Artificial Analysis plaatste het op 54 op de Intelligence Index bij zijn xhigh-redeneerinstelling, drie punten boven Muse Spark 1.1. GPT-6 Sol komt uit op 47,6 op dezelfde index in onze catalogus. Die twee cijfers zijn niet van elkaar af te trekken: ze komen uit verschillende configuraties die op verschillende momenten zijn gemeten, en een index die tussen beide is herzien, is niet hetzelfde instrument. De eerlijke vergelijkende claims zijn de single-benchmarkclaims hierboven, waarbij beide modellen een cijfer van dezelfde evaluator hebben. Wanneer een model meer gepubliceerde cijfers heeft, zal het altijd beter gedocumenteerd lijken dan een model dat er minder heeft, en bij dit paar gaat veel van dat verschil over wie rapporteert in plaats van wat de modellen kunnen.

Twee modellen serveren die zich anders gedragen onder belasting
Beide staan op OrcaRouter, één sleutel, en het duo vormt een natuurlijke routeringssplitsing in plaats van een of-of-keuze. Stuur het multimodale verkeer — de opnames, de clips, de documentbundels met gescande bijlagen — naar Muse Spark 1.2 tegen $1,25 / $4,25 zonder long-context-cliff. Stuur het redeneerintensieve en agentische verkeer naar GPT-6 Sol en accepteer het hogere tarief voor de verzoeken waarbij het antwoord kritische toetsing moet doorstaan. Via één endpoint is die splitsing een routeringsregel, geen twee integraties.
Eén cijfer aan de serveerzijde druist in tegen de prijslogica. Muse Spark 1.2 wordt gemeten op ongeveer 420 outputtokens per seconde in ons rollende venster van zeven dagen, tegenover ongeveer 244 voor GPT-6 Sol — Meta's model is zowel goedkoper als sneller op onze routes. De latentie loopt bij de eerste token de andere kant op: een p50-tijd-tot-eerste-token van ongeveer 5,2 seconden voor Muse Spark 1.2 tegenover ongeveer 6,8 voor GPT-6 Sol in hetzelfde venster, dus het goedkopere model begint ook eerder te antwoorden. Beide zijn rollende metingen op gedeelde infrastructuur in plaats van een gecontroleerde benchmark, en beide verschuiven tussen aflezingen.
Automatische failover verdient zijn plaats op een gemengde pijplijn zoals deze. Wanneer een verzoek via de ene route als audio kan binnenkomen en als tekst kan vertrekken, of via een andere route een verplichte transcriptiestap moet ondergaan, is de faalmodus waar je op let een provider die het verzoek accepteert en vervolgens blijft hangen bij de media-upload — een tweede geconfigureerde route maakt daar een nieuwe poging van in plaats van een taak die iemand moet opmerken en opnieuw moet uitvoeren. Onze catalogus geeft de lijstprijzen van providers ongewijzigd door, dus als Meta de $4.25-regel aanpast, of een clausule voor lange context toevoegt aan de Muse Spark-kaart zoals andere leveranciers al hebben gedaan, bereikt de wijziging je op de dag dat die gebeurt, in plaats van nadat een wederverkoper het opmerkt.

De beslissing, simpel gezegd
Als je invoer een opname of een clip is en de timing of toon deel uitmaakt van de betekenis, gebruik dan Muse Spark 1.2. Er is geen configuratie van GPT-6 Sol die die capaciteit via de API bereikt, en geen prijs waarbij de vervangende pipeline gelijkwaardig wordt. Als je invoer tekst en afbeeldingen is en er wordt gehandeld op de uitvoer, staan de redeneercijfers van GPT-6 Sol voorop en is het profiel voor toolgebruik het veiligere — de tau-banking- en Terminal-Bench 4.0-scores van Muse Spark 1.2 zijn het luidste signaal op beide bladen, en ze wijzen weg van agentisch werk.
En let op wat Muse Spark 1.2 niet is: een nieuwe generatie. Het is Meta's huidige checkpoint van een bestaande familie, een drop-invervanging voor 1.1 tegen ongewijzigde prijzen, waardoor de upgradebeslissing gratis is en de vergelijking met GPT-6 Sol een aparte kwestie wordt. Aan de andere kant is GPT-6 Sol al opgevolgd door GPT-6.1 Sol tegen identieke tarieven voor korte context, waarbij gecachte input is gehalveerd van $0,20 naar $0,10, en OpenAI's eigen modelpagina verwijst lezers nu daarnaar. Als de reden dat je Sol overweegt in plaats van Muse Spark de acht dagen oude integratie is, dan staat die. Als het om capaciteiten gaat, kijk dan eerst naar de opvolger.
Vergeleken in dit artikel1
Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt
