
Meta Muse Spark 1.1 im Test: Immer noch der Schnelle, nicht mehr der Günstige
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 984 tok/s
- openaiNEUOpenAI: GPT-6 Luna2026-09-2237Intelligenz
- openaiNEUOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- anthropicNEUAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- grokNEUGrok 4.72026-09-2146Intelligenz
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens · 195 tok/s
- orcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 pro 1 Mio. Tokens
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
Vier Wochen lang war die Argumentation für Meta Muse Spark 1.1 eine reine Rechenaufgabe. 1,25 Dollar pro Million Tokens für Eingaben, 4,25 Dollar für Ausgaben, für ein nativ multimodales Modell, das Tools besser bediente als fast alles andere in seiner Preisklasse. Dann, am 5. August 2026, brachte Meta Muse Spark 1.2 zusammen mit Muse Code auf den Markt – seinem ersten Terminal-Coding-Agenten – und fügte dem neuen Modell etwas hinzu, das 1.1 nie bekommen hatte: eine Contributor-Stufe für 0,10 Dollar bei Eingaben und 0,20 Dollar bei Ausgaben. Zwölfmal billiger bei den Eingaben, einundzwanzigmal billiger bei den Ausgaben, im Tausch dafür, dass Meta mit deinen Prompts trainieren darf. Der Preis von Muse Spark 1.1 bewegte sich keinen Cent. Seine Position jedoch schon.
Das ist der ehrliche Rahmen, um dieses Modell jetzt zu bewerten. Muse Spark 1.1 wurde nicht abgekündigt, nicht neu bepreist und ist immer noch der schnellere und besser dokumentierte der beiden Reasoning-Checkpoints von Meta – aber es ist nicht mehr der günstigste Weg, ein Meta-Modell zu mieten, und der Agent, den Meta am stärksten vorantreibt, läuft nicht darauf. Diese Rezension behandelt, was 1.1 ist, worin es messbar gut ist, was die Veröffentlichung im August geändert hat, und das engere Aufgabenspektrum, bei dem es immer noch die richtige Wahl ist. Wo eine Zahl aus Metas eigenen Evaluierungen stammt, sagt der Satz das; wo sie von Artificial Analysis oder aus dem Produktionsverkehr stammt, sagt er das ebenfalls.
Kurzes Fazit
• Was es ist — ein nativ multimodales Reasoning-Modell (Text, Bild, Video, PDF und Audio als Eingabe, Text als Ausgabe) mit konfigurierbarem Reasoning-Aufwand, entwickelt, um Tools auszuführen und einen Computer zu bedienen. Geschlossene Gewichte, bereitgestellt von Meta.
• Preis — $1.25 Eingabe / $4.25 Ausgabe pro Million Tokens, $0.15 bei einem Cache-Treffer. Unverändert seit der Markteinführung und immer noch etwa ein Viertel des Ausgabepreises von GPT-5.6 Sol ($5/$30) und ein Sechstel des Ausgabepreises von Claude Opus 4.8 ($5/$25).
• Intelligence — 51 im Artificial Analysis Intelligence Index, Rang #22 von 185 in seiner Klasse bei einem Klassenmedian von 32. Eine unabhängige Messung, keine Behauptung von Meta.
• Stärke — Tool-Nutzung und agentisches Denken, plus echte Geschwindigkeit: 213,5 Ausgabe-Token pro Sekunde, womit es bei Artificial Analysis auf Platz 2 von 185 liegt.
• Schwäche — reines Denken und rohes Coden liegen im Mittelfeld, der Abruf bei langen Kontexten ist nicht Spitzenklasse, und es ist wortreich: 94M Ausgabe-Token, um den Intelligence Index abzuschließen, gegenüber einem Median von 65M.
• Der neue Haken — Muse Spark 1.2 erzielt jetzt drei Punkte mehr und kostet in seiner Contributor-Stufe nur ein Zwanzigstel so viel. Der verbleibende Vorteil von 1.1 ist die Latenz, und die ist beträchtlich.
Was Meta am 5. August veröffentlichte — und was es mit 1.1 machte
Muse Code ist ein Terminal-Coding-Agent, derzeit in der Beta, der über ein einzeiliges Shell-Skript auf macOS und Linux installiert wird (keine Windows-Version) und als muse-Binary läuft. Er übernimmt vollständige Software-Engineering-Aufgaben in großen Repositorys: die Änderung planen, den Code schreiben, das Ergebnis validieren. Metas Pitch ist architektonische Kohäsion — der Agent und das Modell wurden gemeinsam trainiert, statt zusammengeschraubt zu werden — und die Feature-Liste zielt direkt auf Claude Code und Codex ab: Hintergrund-Agents, die nach dem Schließen des Terminals weiterarbeiten, Event-Log-Wiederaufnahme, parallele Sub-Agent-Worktrees und eine OS-Sandbox mit standardmäßig aktivierten Genehmigungen. Die Demo, die Meta dafür veröffentlicht hat, ist eine GPU-Kernel-Optimierungsschleife mit mehr als 1.000 Tool-Aufrufen über bis zu 24 Stunden auf NVIDIA-Hopper-Hardware.
Muse Code läuft mit Muse Spark 1.2, nicht 1.1. Das ist die erste praktische Konsequenz für alle, die diese Rezension lesen: Wenn Sie Metas Agenten wollen, sind Sie auf dem neuen Checkpoint.
Die zweite Konsequenz ist die Preisgestaltung, und sie ist die interessantere. Meta hat 1.2 mit zwei unterschiedlichen Modell-IDs statt einer ausgeliefert:
• Standard (muse-spark-1.2) — 1,25 $ Eingabe, 0,15 $ gecachte Eingabe, 4,25 $ Ausgabe pro Million Tokens. Identisch mit Muse Spark 1.1. Meta verpflichtet sich, dass Prompts und Vervollständigungen auf dieser Stufe nicht zur Verbesserung seiner Produkte verwendet werden.
• Mitwirkender (muse-spark-1.2-contributor) — 0,10 $ Eingabe, 0,002 $ zwischengespeicherte Eingabe, 0,20 $ Ausgabe. Im Gegenzug erteilen Sie Meta die Erlaubnis, zukünftige Modelle mit Ihren Prompts und Antworten zu trainieren.
• Muse Spark 1.1 — es gibt keine Contributor-Stufe. Es bleibt beim Standardpreis, und Meta hat keine Einstellung angekündigt.
Metas eigene Darstellung für die Beitragsstufe lautet, dass sie „mehr als zehnmal günstiger ist als selbst die nutzungsbasierte Stufe“ – was eine Untertreibung ist: Die tatsächlichen Faktoren betragen 12,5× beim Input und 21,25× beim Output, mit zwischengespeichertem Input zu einem nahezu kostenlosen Preis von 0,002 $. Genau das ist die „Niedrigpreis“-Schlagzeile, die der Start erzeugt hat, und sie gilt allein für 1.2.

Die Preisgeschichte, neu geschrieben
Bevor du dein Budget um $0,20 pro Ausgabe-Token herum neu aufstellst, lies die übrigen Bedingungen des Contributor-Tarifs, denn genau die machen ihn günstig. Die Ratenlimits sinken von dokumentierten 3.000 Anfragen pro Minute im Standard-Tarif auf 60 im Contributor-Tarif – ein Limit, das einem Entwickler, der auf einem Laptop herumexperimentiert, Spielraum lässt, aber einer Produktionsumgebung mit Agentenflotte eine Absage erteilt. Und der Datenhandel ist keine Formalität: Deine Prompts und die Ausgaben deines Modells werden zu Trainingsmaterial. Für alle, die Kundendaten, proprietären Quellcode oder etwas unter einer Geheimhaltungspflicht verarbeiten, ist der Contributor-Tarif keine günstigere Version desselben Produkts, sondern ein anderes Produkt. Meta räumte das beim selben Launch ein, indem es eine Option ohne Datenspeicherung für Enterprise-Kunden im kostenpflichtigen Pfad hinzufügte.
Der ehrliche Vergleich ist also nicht „1.1 für 4,25 $ gegenüber 1.2 für 0,20 $.“ Er ist: Bei Standardpreisen kosten die beiden Modelle genau dasselbe, und 1.2 ist das besser bewertete. Die 0,20-$-Stufe ist ein echtes und aggressives Angebot, richtet sich jedoch an Einzelpersonen und Experimente und ist nur beim neueren Modell verfügbar.
Was die Rechnung bei beiden Modellen tatsächlich in die Höhe treibt, ist Caching, nicht der Listenpreis. Nehmen wir einen repräsentativen Agent-Schritt: 60.000 Tokens Repository- oder Dokumentkontext hinein, 3.000 Tokens Plan-und-Antwort heraus. Kalt sind das 0,075 $ Eingabe plus 0,013 $ Ausgabe – also etwa 8,8 Cent oder 88 $ über tausend Schritte. Bleibt das Kontext-Präfix stabil, greift der Cache bei 0,15 $ pro Million, und die Eingabekosten fallen auf 0,009 $ – der Schritt kostet dann etwa 2,2 Cent und die tausend Schritte 22 $. Ein Unterschied von 75 %, der vollständig davon abhängt, ob Ihr Agent-Framework ein stabiles Präfix wiederverwendet oder den Prompt bei jeder Runde neu aufbaut. Wenn Sie aus dieser Bewertung eine einzige technische Maßnahme mitnehmen, dann machen Sie Cache-Key-Stabilität zu Ihrer Priorität – nicht die Modellauswahl.
Eine strukturelle Anmerkung dazu, wo Sie es mieten: Muse Spark 1.1 ist im OrcaRouter-Katalog zu 1,25 $ und 4,25 $ mit einem Cache-Read für 0,15 $ erhältlich – dieselben Preise, die Meta verlangt, denn OrcaRouter arbeitet mit 0 % Aufschlag und reicht den Listenpreis des Anbieters unverändert durch, sodass eine Preisänderung des Anbieters hier an dem Tag ankommt, an dem sie dort ankommt. Muse Spark 1.2 ist noch nicht im Katalog und wird direkt von Meta bereitgestellt. Das ist wichtig für den Vergleich, den Sie wahrscheinlich gleich durchführen möchten: GPT-5.6 Sol, Claude Opus 4.8, Grok 4.5 und Gemini 3.1 Pro liegen alle hinter einem einzigen Key zum Listenpreis, sodass Sie sie ohne einen zweiten Vertrag anhand eines einzigen Evaluierungssatzes gegen Muse Spark 1.1 benchmarken können, und die Zahl in Ihrer Tabelle ist die Zahl auf der Rechnung.
Was Muse Spark 1.1 eigentlich ist
Muse Spark ist die Flaggschiff-Reasoning-Linie von Meta Superintelligence Labs, der Gruppe, die Mark Zuckerberg unter Alexandr Wang ins Leben gerufen hat. Es markiert eine strategische Kehrtwende: Während Metas Llama-Modelle offene Gewichte hatten, ist die Muse-Familie – Spark sowie die Bild- und Video-Generatoren – geschlossen und wird als Produkt und API angeboten. Spark 1.0 erschien am 8. April 2026; 1.1 folgte am 9. Juli zusammen mit der öffentlichen Vorschau der Meta Model API. Die praktische Änderung für Entwickler besteht darin, dass Meta nun ein First-Party-API-Anbieter ist, der direkt mit den beiden etablierten API-Anbietern konkurriert, und nicht nur ein Herausgeber von Gewichten – und der Start eines Coding-Agenten am 5. August ist die deutlichste Bestätigung dafür.
Version 1.1 war ein substantieller Schritt nach oben und nicht nur ein Point Release. Auf Artificial Analysis gewann sie in drei Monaten acht Intelligenz-Index-Punkte, von 43 auf 51. Ihr Coding-Index stieg um 12 Punkte auf 71, SciCode verbesserte sich auf 58 %, und Humanity's Last Exam stieg auf 45 %. Meta sagte, die größten Zugewinne gab es bei Tool-Nutzung, Computer-Nutzung, Coding und multimodalem Verständnis – konsistent mit einem Modell, das darauf ausgerichtet ist, zu handeln und nicht nur zu antworten.
Im Kontext hat sich die anfängliche Verwirrung gelegt: Artificial Analysis und OrcaRouter listen das Fenster beide mit 1.048.576 Token auf, und Meta beschreibt ein Fenster, das das Modell aktiv komprimiert. Eine Million Token zu halten ist jedoch nicht dasselbe wie daraus abzurufen, und 1.1 erzielt beim Long-Context-Retrieval einen Wert von etwa 54,1 – der Abruf ist also durchschnittlich. Behandle das Fenster als Kapazität, nicht als Garantie.
Überlegungsaufwand: Sofort, Nachdenken und das darunterliegende Einstellrad
Auf Metas Verbraucheroberfläche bietet Muse Spark zwei benannte Modi: Sofortantworten ohne erweitertes Denken, wie eine normale Chat-Antwort; Contemplating führt mehrere Agenten parallel aus, mithilfe einer aus dem Reinforcement Learning übernommenen Technik der „Gedankenkompression", und Meta positioniert es gegen DeepMind Deep Think und GPT-5.4 Pro bei anspruchsvoller wissenschaftlicher und analytischer Arbeit. Über die API erscheint dieselbe Fähigkeit als konfigurierbarer Reasoning-Effort-Parameter — Artificial Analysis veröffentlicht seine Ergebnisse bei der xhigh-Einstellung des Modells, der teuersten, die es anbietet.
Behandeln Sie diesen Regler als Kostenhebel, nicht als Qualitätsregler. Parallele Agentenlogik verbrennt weit mehr Token als ein einzelner Durchlauf, und die Benchmark-Zahlen, die Sie gelesen haben, wurden mit maximalem Aufwand erzeugt. Nutzen Sie für Routineaufrufe standardmäßig das untere Ende und reservieren Sie hohen Aufwand für die Fälle, in denen eine falsche erste Antwort teuer ist.
Wie es bewertet wird: stark mit Werkzeugen, mittelmäßig ohne.
Der klarste Weg, Muse Spark 1.1 zu lesen, ist der Vergleich mit Werkzeugen versus ohne Werkzeuge. Mit Werkzeugen führt es die agentischen Tests an: MCP Atlas 88,1 gegenüber 82,2 von Claude Opus 4.8, JobBench 54,7 gegenüber 48,4, Legal Agent Bench 20,0 gegenüber 12,9 von Grok 4.5 und bei Humanity's Last Exam mit Werkzeugen 62,1 gegenüber 57,9. Ohne Werkzeuge ist es gewöhnlich — das einfache Humanity's Last Exam liegt bei etwa 45, weit hinter den rund 77 von Gemini 3.1 Pro im selben Test.
Auch bei der Ausführungsgenauigkeit bleibt es hinter den Spitzenreitern zurück: OSWorld-Verified Computer Use 80,8 gegenüber 83,4 bei Opus 4.8, SWE-Bench Pro Coding 61,5 gegenüber 69,2, DeepSWE 1.1 Long-Horizon Coding 53,3 gegenüber 67,0 bei GPT-5.5 und BabyVision Visual Reasoning 76,3 gegenüber 83,6. Viele dieser Zahlen stammen von den Anbietern, einige aus Metas eigenen Auswertungen, und sie laufen auf unterschiedlichen Testumgebungen – betrachten Sie sie also als Richtwerte und testen Sie sie erneut anhand Ihrer eigenen Aufgaben.

Das unabhängige Bild von Artificial Analysis ist kompakter und nützlicher. Intelligenz-Index 51, Rang #22 von 185, gegenüber einem Klassenmedian von 32. Geschwindigkeit 213,5 Ausgabe-Token pro Sekunde, Rang #2 von 185 – das ist ein wirklich schnelles Modell. Preis-Rang #31, Cache-Treffer-Preis 0,15 $ bei 88 % Rabatt. Ausführlichkeit 94M Ausgabe-Token, um den Index zu durchlaufen, gegenüber einem Median von 65M – genau dort entsteht ein Großteil der tatsächlichen Rechnung. Gesamtausgaben für die Bewertung auf der gesamten Suite: 548,07 $.
Ein Vorbehalt, den man im Hinterkopf behalten sollte: Meta bewirbt Text, Bild, Video, Audio und PDF als Eingabe, aber die technische Spezifikation von Artificial Analysis für 1.1 verzeichnet nur Text und Bild als evaluiert. Beides kann zutreffen – die API akzeptiert mehr, als die Benchmark-Umgebung getestet hat – aber niemand außerhalb von Meta hat Ergebnisse für Video- oder Audio-Workloads veröffentlicht. Wenn Mixed-Media-Analyse der Grund ist, warum Sie hier sind, planen Sie Zeit ein, um es selbst zu verifizieren.
Sollten Sie zu 1.2 wechseln? Die Latenz-Antwort
Beim Programmieren sagt Meta Ja, und seine Zahlen sind in sich stimmig: Terminal-Bench 2.1 steigt von 76,2 % auf 82,9 %, DeepSWE v1.1 von 53,0 % auf 59,3 % und sein interner Programmier-Benchmark von 68,3 % auf 70,6 %. Dies sind von Meta durchgeführte Evaluierungen, bewertet mit pass@1 über fünf Versuche in Metas eigener Testumgebung – es gilt der übliche Vorbehalt, dass konkurrierende Modelle in der Testumgebung eines Anbieters häufig nicht optimal abgestimmt sind. Unabhängig davon hat Artificial Analysis Muse Spark 1.2 auf 54 im Intelligence Index angehoben, Rang #13 von 185, drei Punkte über 1.1.
Womit Meta diese Punkte erkauft hat, ist Bedachtsamkeit, und sie zeigt sich in jeder Zeitmessung. Artificial Analysis misst die Zeit bis zum ersten Token bei 26,12 Sekunden für 1.2 gegenüber 2,90 Sekunden für 1.1 – jeweils bei maximalem Reasoning-Aufwand der Modelle. Die Ausgabegeschwindigkeit fiel von 213,5 auf 165 Token pro Sekunde. Die Ausführlichkeit stieg leicht an, 95M gegenüber 94M Token, und die Kosten für die Ausführung derselben Benchmark-Suite stiegen bei identischer Preisgestaltung pro Token von 548,07 $ auf 637,85 $. Diese letzte Zahl ist die klarste Aussage über den Trade: gleiche Preisliste, 16 % mehr verbrauchte Token, drei weitere Indexpunkte.
Lesen Sie den 26-Sekunden-Wert sorgfältig, denn er ist leicht falsch zu verstehen. Es handelt sich um eine Benchmark-Messung mit maximalem Aufwand, und die API verwendet standardmäßig eine mittlere Einstellung. Als Referenzpunkt für echten Datenverkehr zeigt Muse Spark 1.1 auf OrcaRouter – das den tatsächlich angeforderten Aufwand der Aufrufer bedient – einen p50-Wert für die Zeit bis zum ersten Token von 1,84 Sekunden und einen p95-Wert von 6,00 Sekunden über eine Woche Produktionsverkehr, mit einer Fehlerrate von null. Die Benchmark-Latenz bei maximalem Aufwand und die Produktionslatenz bei Standardaufwand sind unterschiedliche Größen, und die Lücke zwischen ihnen beträgt normalerweise mehr als eine Größenordnung.
Die Entscheidung fällt also eindeutig nach der Form der Arbeitslast. Wenn Sie langfristig laufende Coding-Agenten betreiben, die ein Repository im Kontext halten und minutenlang arbeiten, ist 1.2 das bessere Modell, und der Latenznachteil amortisiert sich über eine Aufgabe, die ohnehin nie sofort wirken würde. Wenn Sie etwas Interaktives bedienen – eine Chat-Oberfläche, eine Tool-Calling-Schleife mit einem wartenden Menschen, ein Latenz-SLO, gemessen in Sekunden – bleibt Muse Spark 1.1 das besser geformte Modell in der Familie, und sein Geschwindigkeitsrang ist kein Rundungsfehler. Nichts an der August-Veröffentlichung ändert daran etwas.
Entwicklererfahrung und Grenzen
Die Meta Model API bleibt eine öffentliche Vorschau, auch wenn der Start im August den globalen Zugriff erweiterte und die Option zur Null-Datenspeicherung für Unternehmen hinzufügte. Meta liefert eine OpenAI-artige Schnittstelle und SDK-Zugriff, und Spark ist für Verbraucher im „Thinking“-Modus von Meta AI verfügbar. Die Ratenlimits sind jetzt veröffentlicht statt geraten – 3.000 Anfragen pro Minute für die Standard-Stufe sind dokumentiert – aber Vorschaustatus bleibt Vorschaustatus, also halten Sie eine Fallback-Route für die Tage bereit, an denen die Kapazität eingeschränkt ist. Automatisches Failover über Anbieter hinweg ist genau die Art von Infrastruktur, die ein Vorschau-Endpunkt rechtfertigt, und es ist der Grund, warum das Routen eines Vorschau-Modells über ein Gateway Sie nichts kostet und Ihnen einen zweiten Pfad verschafft.

Über OrcaRouter ist die Modell-ID meta/muse-spark-1.1 und sowohl /v1/chat/completions als auch /v1/responses sind verfügbar, sodass ein bestehender OpenAI-kompatibler Client lediglich eine Basis-URL und eine Modellzeichenfolge und sonst nichts benötigt:
import openai as openai_client
client = openai_client.Client(base_url="https://api.orcarouter.ai/v1", api_key="YOUR_API_KEY")
response = client.chat.completions.create(model="meta/muse-spark-1.1", messages=[{"role": "user", "content": "Planen und führen Sie die Tools aus, um dieses Problem zu beheben."}])
print(response.choices[0].message.content)
Wo es passt — und wo nicht
Gut geeignet: Tool-Ausführung und Computer-Use-Automatisierung, bei denen die Antwortzeit für eine Person sichtbar ist; kostensensitives Reasoning im großen Maßstab auf Daten, die Sie nicht an einen Trainingsdatensatz übergeben können; Workflows, die Text mit Bildern, Video, PDFs oder Audio kombinieren, mit eigener Verifizierung im Medienpfad; und Teams, die eine schnelle, günstige Standardoption möchten, mit einem Premium-Modell als Reserve für die schwierigsten Schritte.
Schwache Eignung: Codiergenauigkeit an der Spitze der Rangliste und die schwierigsten Greenfield-Engineering-Aufgaben, die weiterhin Claude Opus 4.8 und GPT-5.6 Sol gehören; reine Denkaufgaben ohne Werkzeuge; Aufgaben mit visueller Präzision, bei denen Gemini 3.1 Pro führend ist; langfristige Repository-Arbeit, die jetzt ausdrücklich Aufgabe von 1.2 und Muse Code ist; und alles, wofür man Metas günstigstmögliches Token benötigt, denn diese Preisstufe gibt es bei diesem Modell nicht.
FAQ
Ist Muse Spark 1.1 noch verfügbar, jetzt wo 1.2 veröffentlicht wurde?
Ja. Meta hat bei der Einführung am 5. August keine Einstellung und keine Preisänderung angekündigt – 1.1 bleibt in der Meta Model API zu 1,25 $ und 4,25 $ pro Million Tokens, und es ist im OrcaRouter-Katalog zu denselben Preisen enthalten. Die Berichterstattung über die Einführung beschreibt durchgängig, dass es zu den bestehenden API-Preisen weitergeführt wird. Allerdings hat sich Metas technische Aufmerksamkeit sichtbar verlagert: Der Coding-Agent, die neuen Benchmarks und die günstige Preisstufe beziehen sich alle auf 1.2.
Kann ich Muse Spark 1.1 im 0,10-$-Unterstützer-Tarif bekommen?
Nein. Die Contributor-Stufe ist eine separate Modell-ID auf dem neueren Checkpoint, muse-spark-1.2-contributor. Es gibt kein 1.1-Äquivalent, daher erfordern die günstigsten Meta-Reasoning-Token einen Versionswechsel – und die Akzeptanz eines Limits von 60 Anfragen pro Minute sowie die Erlaubnis, dass Meta auf deinen Prompts und Completions trainieren darf.
Sollte ich auf Muse Spark 1.2 upgraden?
Wenn Ihre Arbeitslast langlaufende Codier- oder Repository-weite Agentenarbeit ist, dann ja: Es schneidet sowohl bei Metas eigenen Codierbewertungen als auch im unabhängigen Index von Artificial Analysis besser ab, zum gleichen Standardpreis. Wenn Ihre Arbeitslast interaktiv oder latenzempfindlich ist, nein: 1.2 tauscht etwa die neunfache Zeit bis zum ersten Token und 23 % der Ausgabegeschwindigkeit gegen drei Indexpunkte ein, und sein Reasoning kann nicht abgeschaltet werden. Beide nutzen dieselbe API, daher ist der Wechsel so oder so nur ein Modell-String – was der günstigste mögliche A/B-Test ist und es wert ist, mit eigenem Traffic durchgeführt zu werden, bevor man sich entscheidet.
Ist Muse Spark 1.1 Open Source?
Nein, und genau darum geht es bei dieser Produktlinie. Im Gegensatz zu Metas Llama-Modellen ist die Muse-Familie Closed-Weight und wird als Produkt und über eine API angeboten. Es gibt keine Gewichte auf Hugging Face, keinen Selbsthosting-Pfad und keine Drittanbieter – Meta ist der einzige Anbieter, der dieses Modell bereitstellt, was eine Routing-Schicht mit Failover zur praktischen Antwort auf das Einzelanbieter-Risiko macht, anstatt auf einen zweiten Anbieter zu setzen.
Das Urteil, eine Version später.
Muse Spark 1.1 ist ein schnelles, günstiges, wirklich multimodales agentisches Modell, das bei der Werkzeugnutzung stark ist und bei reiner Codierung und logischem Denken ehrlich gesagt im Mittelfeld liegt. Im August wurde nichts von dem, was gemessen wurde, schlechter. Was sich geändert hat, ist die Form der Familie um es herum: Meta hat jetzt ein besser bewertetes Modell zum gleichen Standardpreis, eine deutlich günstigere Stufe für Entwickler, die bereit sind, ihre Daten zu tauschen, und ein Agentenprodukt, das weder auf 1.1 läuft noch auf irgendetwas, das man auf 1.1 ausrichten kann.
Übrig bleibt eine engere, aber echte Empfehlung. Wenn Sie Metas Denkqualität mit einer für Menschen wahrnehmbaren Geschwindigkeit benötigen — eine Sekunde bis zum ersten Token in Produktion, danach 213 Token pro Sekunde — ist 1.1 weiterhin die Version der Wahl, und die drei Indexpunkte, die 1.2 hinzufügt, sind das neunfache Warten nicht wert. Wenn Sie diese Geschwindigkeit nicht benötigen, gibt es keinen großen Grund mehr, dabei zu bleiben. So oder so ist es nur eine Modellzeichenkette, daher ist der ehrliche Rat, beide einen Tag lang mit Ihrem eigenen Auswertungssatz laufen zu lassen und Ihr Latenzbudget entscheiden zu lassen.
In diesem Artikel verglichen4
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
