
GPT-6 Sol vs Muse Spark 1.2: Einer von ihnen hat Ohren
- openaiNEUOpenAI: GPT-6.1 Sol2026-09-2952Intelligenz
- anthropicNEUAnthropic: Claude Sonnet 5.52026-09-2856Intelligenz
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 127 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligenz
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- xAIGrok 4.72026-09-2146Intelligenz
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 pro 1 Mio. Tokens · 58 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 pro 1 Mio. Tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 350 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
Stellen Sie GPT-6 Sol und Muse Spark 1.2 nebeneinander, so sind die Preisspalten lediglich unterschiedlich, während sich die Modalitätsspalten überhaupt nicht ähneln. Muse Spark 1.2 akzeptiert Text, Bild, Video, Datei und Audio. GPT-6 Sol akzeptiert Text, Bild und Datei. Audio und Video sind der Unterschied, und sie sind kein Rundungsdetail: Sie trennen ein Modell, dem man eine Besprechungsaufnahme übergeben kann, von einem, dem man ein Transkript davon übergeben muss. GPT-6 Sol, die mittlere Stufe dieser Generation, erschien am 22. September 2026; Muse Spark 1.2, Metas aktueller Checkpoint in der Muse-Spark-Familie, erschien am 5. August 2026 als Drop-in-Update für Muse Spark 1.1 auf derselben Standard-Stufe zu identischen Preisen.
Der letzte Punkt ist entscheidend dafür, wie diese Seite gelesen werden sollte. Muse Spark 1.2 ist keine neue Generation und sollte auch nicht als eine beschrieben werden – Metas eigene Beschreibung lautet: ein aktualisierter Checkpoint mit etwas höherer Leistung, angeboten zu unveränderten Konditionen. Die interessante Frage ist also nicht, was 1.2 gegenüber 1.1 hinzufügt, sondern was die Muse Spark-Familie hat, das der GPT-6-Familie fehlt, und ob Sie es brauchen.
Die beiden Datenblätter, zu den Maßen, die voneinander abweichen
• Eingabemodalitäten — GPT-6 Sol Text, Bild und Datei vs. Muse Spark 1.2 Text, Bild, Video, Datei und Audio
• Ausgabe — beide nur Text
• Eingabepreis — GPT-6 Sol 2,00 $ pro Million vs. Muse Spark 1.2 1,25 $ pro Million
• Ausgabepreis — GPT-6 Sol 10,00 $ pro Million vs. Muse Spark 1.2 4,25 $ pro Million
• Zwischengespeicherte Eingabe — GPT-6 Sol 0,20 $ pro Million vs. Muse Spark 1.2 0,15 $ pro Million
• Kontextfenster — 1.050.000 Token vs. 1.048.576 Token, praktisch identisch
• Stufe für lange Anfragen — GPT-6 Sol berechnet die gesamte Anfrage oberhalb von 272.000 Input-Tokens neu auf 4,00 $ / 15,00 $, während Muse Spark 1.2 keine solche Stufe auf seiner Karte hat
• GPQA Diamond — GPT-6 Sol 96,1 vs. Muse Spark 1.2 90,4
• Die letzte Prüfung der Menschheit — GPT-6 Sol 47,9 vs. Muse Spark 1.2 45,5
• Langkontext-Erinnerung — GPT-6 Sol 83,7 vs. Muse Spark 1.2 79,0
• tau-banking — GPT-6 Sol in dieser Revision nicht veröffentlicht vs. Muse Spark 1.2 34.8
• Gewichte — beide geschlossen, nur API
Die Zeile für lange Anfragen leistet in dieser Liste stille Arbeit. Muse Spark 1.2 hat keine Klausel zur Neubepreisung für langen Kontext auf seiner veröffentlichten Tarifkarte, daher gelten seine $1,25 / $4,25 über das gesamte Fenster. Bei GPT-6 Sol gilt die beworbene Angabe jedoch nicht: Ab 272.000 Eingabe-Tokens wechselt die gesamte Anfrage auf $4,00 / $15,00. Bei einem Prompt mit vollem Kontext ist der Ausgabe-Vergleich daher nicht zehn Dollar gegen $4,25, sondern fünfzehn gegen $4,25 — das Dreieinhalbfache, nicht das Zweieindrittelfache.
Und die Benchmark-Lücke ist schmaler, als die Preisdifferenz vermuten lässt. GPQA Diamond, 96,1 gegen 90,4, entspricht ungefähr der Spanne, die man von zwei unterschiedlichen Einstellungen für den Reasoning-Aufwand erwarten würde, nicht von einem Fähigkeitsunterschied, und bei Humanity's Last Exam liegen die beiden bei 47,9 und 45,5, was 2,4 Punkte auf einer Hundert-Punkte-Skala sind. Muse Spark 1.2 ist das günstigere Modell und der vielseitiger einsetzbare Reader; GPT-6 Sol liegt bei den Reasoning-Werten vorn, aber nicht in dem Maß, das der Preis impliziert. Keine der beiden Spalten dominiert, und genau das macht die Wahl zu einer, die man bewusst treffen sollte.

Was ändern Audio- und Videoeingänge tatsächlich?
Ein Modell, das Audio akzeptiert, kann eine Aufnahme statt eines Transkripts erhalten. Das klingt nach einer Annehmlichkeit und ist wirklich eine Veränderung dessen, was möglich ist: Transkription ist ein verlustbehafteter Schritt, der Ton, Überlappung, Lachen und den Unterschied zwischen einer Frage und einer Aussage verwirft, wenn man sie nur aus dem Text liest. Ein Modell, das die Datei direkt hört, sieht all das. Dasselbe Argument gilt für Video, wo eine Einzelbildbeschreibung das Timing verliert, ein Modell, das den Clip verarbeitet, hingegen nicht.
Die Antwort von GPT-6 Sol ist eine Pipeline und keine Modalität – zuerst transkribieren oder untertiteln, dann Text weiterreichen. Das ist eine vollkommen praktikable Architektur, und für viele Workloads ist sie die bessere, weil ein Transkript inspizierbar, cachebar und kostengünstig zu speichern ist. Sie ist genau dann schlechter, wenn das Audio oder die Bewegung das Signal ist: Qualitätsprüfung im Callcenter, Medienprotokollierung, alles, wo das Zögern eines Sprechers die Bedeutung trägt.
Metas Position hierzu sollte man sorgfältig lesen, denn das Audio-Tag ist keine Dekoration. Muse Spark 1.2 wird mit Audio als einer seiner Fähigkeiten neben Vision, Tools, JSON und Reasoning aufgeführt, und Meta hat die Familie als seine multimodale Produktlinie veröffentlicht, während das kleinere Muse Glimmer aus einem Muse Spark Teacher destilliert wurde. Wenn Sie anhand der Eingabeoberfläche zwischen diesen beiden wählen, ist die Entscheidung nicht die zwischen einem etwas breiteren und einem etwas schmaleren Datenblatt. Es geht um die Entscheidung zwischen dem Haben der Modalität und dem Bau einer Pipeline, die sie annähert.
Wo sich die beiden wirklich trennen
Die deutlichste Trennung ist die agentische Werkzeugnutzung gegen einen simulierten Dienst, und es ist die eine Stelle, an der die Zahlen weit genug auseinanderliegen, um darauf zu reagieren. Muse Spark 1.2 verzeichnet 34,8 bei tau-banking und nur 7,1 bei der neueren Terminal-Bench 4.0 Revision — beides Messungen von Drittanbietern, und beide beschreiben dieselbe Schwäche aus zwei Richtungen. Ein Modell, das ein Meeting gut einschätzen kann und dann den Kontostand eines Kunden falsch berechnet, wenn es eine API aufrufen soll, ist kein schlechtes Modell; es ist ein Modell mit einer klar begrenzten Aufgabe.
Führt man dieselbe Prüfung bei GPT-6 Sol durch, ist das Bild konsistent, aber dünner. Sein Long-Context-Recall liegt bei 83,7, SciCode bei 57,6 und sein Terminal-Bench 4.0 bei 43,9, alle von Drittanbietern. Seine Coding- und Terminal-Agent-Werte zur Revision v2.1 fehlen schlicht, und das Fehlen einer Zahl ist keine niedrige Zahl – wer diese Zelle mit einer Schätzung füllt, erfindet etwas.
Eine Asymmetrie, die es zu benennen lohnt, bevor die Zahlen allzu eifrig verglichen werden. Muse Spark 1.2 bringt neben dem Drittanbieter-Set eine vollständige herstellereigene Benchmark-Suite von Meta mit, und die eigene Launch-Analyse von Artificial Analysis setzte es bei seiner xhigh-Reasoning-Einstellung auf 54 im Intelligence Index, drei Punkte über Muse Spark 1.1. GPT-6 Sol landet in unserem Katalog bei 47,6 auf demselben Index. Diese beiden Zahlen lassen sich nicht voneinander subtrahieren: Sie stammen aus unterschiedlichen Konfigurationen, die zu unterschiedlichen Zeitpunkten gemessen wurden, und ein zwischen ihnen überarbeiteter Index ist nicht dasselbe Instrument. Die ehrlichen Vergleichsaussagen sind die oben genannten zu einzelnen Benchmarks, bei denen beide Modelle einen Wert vom selben Evaluator aufweisen. Wenn ein Modell mehr veröffentlichte Zahlen hat, wird es immer besser dokumentiert erscheinen als eines, das weniger hat, und bei diesem Paar geht ein Großteil dieses Unterschieds darauf zurück, wer berichtet, statt darauf, was die Modelle leisten können.

Zwei Modelle bereitstellen, die sich unter Last unterschiedlich verhalten
Beide liegen auf OrcaRouter, ein Schlüssel, und das Paar ist eine natürlich geroutete Aufteilung statt eines Entweder-oder. Schicken Sie den multimodalen Traffic — die Aufzeichnungen, die Clips, die Dokumentenbündel mit gescannten Anhängen — an Muse Spark 1.2 zu $1.25 / $4.25 ohne Long-Context-Absturz. Schicken Sie den reasoning-lastigen und agentischen Traffic an GPT-6 Sol und akzeptieren Sie den höheren Preis für die Anfragen, bei denen die Antwort einer Prüfung standhalten muss. Über einen einzigen Endpunkt ist diese Aufteilung eine Routing-Regel, nicht zwei Integrationen.
Eine Zahl auf der Serving-Seite widerspricht der Preislogik. Muse Spark 1.2 wird in einem gleitenden Sieben-Tage-Fenster mit etwa 420 Ausgabe-Tokens pro Sekunde gemessen, gegenüber etwa 244 bei GPT-6 Sol — das Modell von Meta ist auf unseren Routen sowohl günstiger als auch schneller. Bei der Latenz verhält es sich beim ersten Token umgekehrt: eine p50-Zeit bis zum ersten Token von rund 5,2 Sekunden für Muse Spark 1.2 gegenüber etwa 6,8 für GPT-6 Sol im selben Fenster, sodass das günstigere Modell auch früher zu antworten beginnt. Beide sind gleitende Messungen auf gemeinsam genutzter Infrastruktur statt eines kontrollierten Benchmarks, und beide verändern sich von Messung zu Messung.
Automatisches Failover hat auf einer gemischten Pipeline wie dieser seine Berechtigung. Wenn eine Anfrage über eine Route als Audio eingehen und als Text hinausgehen kann oder über eine andere als obligatorischer Transkriptionsschritt, dann ist der Fehlerfall, der Ihnen wichtig ist, ein Anbieter, der die Anfrage annimmt und dann beim Medien-Upload hängen bleibt – eine zweite konfigurierte Route macht daraus einen erneuten Versuch statt eines Jobs, den jemand bemerken und erneut ausführen muss. Unser Katalog gibt die Listenpreise der Anbieter unverändert weiter. Wenn Meta also die 4,25-$-Zeile ändert oder der Muse-Spark-Karte eine Long-Context-Klausel hinzufügt, wie es andere Anbieter bereits tun, erreicht Sie die Änderung am Tag ihres Inkrafttretens und nicht erst, nachdem ein Wiederverkäufer sie bemerkt hat.

Die Entscheidung, einfach ausgedrückt
Wenn Ihre Eingabe eine Aufnahme oder ein Clip ist und Timing oder Tonalität Teil der Bedeutung sind, verwenden Sie Muse Spark 1.2. Es gibt keine Konfiguration von GPT-6 Sol, die diese Fähigkeit über die API erreicht, und keinen Preis, zu dem die Ersatz-Pipeline gleichwertig wird. Wenn Ihre Eingabe Text und Bilder umfasst und aufgrund der Ausgabe gehandelt wird, liegen die Reasoning-Werte von GPT-6 Sol vorn und sein Tool-Use-Profil ist das sicherere – die tau-banking- und Terminal-Bench-4.0-Werte von Muse Spark 1.2 sind das lauteste Signal auf beiden Tabellen, und sie weisen von agentischer Arbeit weg.
Und beachten Sie, was Muse Spark 1.2 nicht ist: eine neue Generation. Es ist Metas aktueller Checkpoint einer bestehenden Familie, ein Drop-in-Ersatz für 1.1 bei unveränderten Preisen, was die Upgrade-Entscheidung kostenlos macht und den Vergleich mit GPT-6 Sol zu einer separaten Frage. Auf der anderen Seite wurde GPT-6 Sol bereits durch GPT-6.1 Sol ersetzt – bei identischen Kurzkontext-Tarifen, wobei der gecachte Input von 0,20 $ auf 0,10 $ halbiert wurde, und OpenAIs eigene Modellseite verweist Leserinnen und Leser jetzt darauf. Wenn der Grund, warum Sie Sol statt Muse Spark abwägen, die acht Tage alte Integration ist, dann gilt das weiterhin. Wenn es die Leistungsfähigkeit ist, prüfen Sie zuerst den Nachfolger.
In diesem Artikel verglichen1
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
