
Muse Spark 1.2 i Muse Code: Trzeci model Meta w cztery miesiące remisuje z Grok 4.5
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów
- orcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów
- deepseekNOWOŚĆDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencja76Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Meta wydała Muse Spark 1.2 5 sierpnia 2026 r., cztery tygodnie po Muse Spark 1.1 i mniej więcej cztery miesiące po pierwszym Muse Spark. Ten model pojawił się z czymś, czego nie miały dwa poprzednie: z własnym agentem do kodowania Meta, Muse Code, udostępniony w wersji beta i współtrenowany z modelem, na którym działa. I w jedynym rankingu, nad którym ani Meta, ani jej rywale nie mają kontroli, wydanie sprawia, że Meta remisuje ze SpaceXAI — Muse Spark 1.2 i Grok 4.5 uzyskują teraz po 54 punkty w Artificial Analysis Intelligence Index. Pięć dni później nadeszło ważniejsze wydarzenie: 10 sierpnia Meta oświadczyła, że udostępni wagi Muse Spark 1.2 — zapowiedź, która, jeśli dojdzie do skutku, uczyni ten model najsilniejszym obecnie amerykańskim rywalem o otwartych wagach dla chińskich modeli.
Zanim którakolwiek z poniższych liczb zacznie cokolwiek znaczyć, warto oddzielić od siebie dwie rzeczy. Wynik Intelligence Index, wartości opóźnień i liczby tokenów pochodzą od Artificial Analysis, która prowadzi własne ewaluacje i publikuje rachunek; te są niezależne. Wyniki dotyczące kodowania, od których Meta zaczęła swoje ogłoszenie — Terminal-Bench 2.1, DeepSWE v1.1 oraz wewnętrzny benchmark — zostały uzyskane przez Meta, na platformie testowej Meta, przy czym każdy porównywany model był sparowany z własnym produktem agenckim. Oba rodzaje liczb są użyteczne. Nie stanowią jednak tego samego rodzaju dowodów, dlatego w tym artykule są one trzymane osobno.
Co Meta faktycznie wypuściła

Ogłoszenie, opublikowane na blogu badawczym Meta poświęconym sztucznej inteligencji i datowane na 5 sierpnia, obejmuje jednocześnie dwa produkty.
• Muse Spark 1.2 — aktualizacja rodziny Muse Spark skupiona na kodowaniu. Meta twierdzi, że zwiększyła moc obliczeniową treningu w zadaniach kodowania i poszerzyła różnorodność środowisk treningowych, zachowując przy tym ogólną zdolność agenta, na której opierała się wersja 1.1. Zadeklarowane cele treningowe obejmują długi horyzont: generowanie całych repozytoriów, duże projekty end-to-end oraz to, co Meta nazywa auto-research, z planowaniem sekwencjonowania pracy, warunkowaniem celów w celu utrzymania kierunku na wielu krokach oraz kompresją kontekstu, aby utrzymać istotny stan podczas długiej sesji.
• Muse Code — terminalowy agent kodujący w wersji beta, instalowany za pomocą jednowierszowego skryptu powłoki z domeny deweloperskiej Meta. Uruchamia trwałe asynchroniczne agenty w tle, które przetrwają całą sesję i działają na lokalnym środowisku uruchomieniowym opartym na dzienniku zdarzeń, które Meta opisuje jako dokładnie odtwarzalne i bezpieczne przy ponownym uruchomieniu. Koordynuje również wiele podagentów na zadanie w izolowanych drzewach roboczych. Wyposażony jest w trzy wbudowane umiejętności: /plan do planowania wymagającego zatwierdzenia, /grill do sprawdzania już wykonanej pracy pod kątem słabych punktów oraz /goal do doprowadzania zadania do końca.
To powiązanie nie jest przypadkowe. Meta mówi, że oba te elementy były trenowane wspólnie – model dostrajano na trajektoriach z próbkowania z odrzucaniem z harnessa, z optymalizacjami przepisu dla celów, kompakcji i subagentów. To ta sama gra współtrenowania, która zaowocowała Claude Code i Codex, i ma ona konsekwencje dla każdego, kto czyta wyniki benchmarków: główne wyniki kodowania modelu zostały osiągnięte wewnątrz harnessa, przeciwko któremu był trenowany. To nie jest oszustwo; tak obecnie działa ocena agentowa. Oznacza to jednak, że wynik 1.2 uzyskany przez inny scaffold pozostaje otwartą kwestią, a nie bezpiecznym założeniem.
Pozostała część specyfikacji pozostaje niezmieniona względem wersji 1.1, która sama w sobie ma charakter wyłącznie informacyjny. Kontekst pozostaje na poziomie 1 048 576 tokenów. Rozumowanie pozostaje obowiązkowe na pięciu poziomach wysiłku — minimal, low, medium, high, xhigh — z poziomem medium jako domyślnym; nie ma konfiguracji, w której można otrzymać wagi bez poświęcenia czasu na deliberację. W momencie premiery wagi były zamknięte: nie było repozytorium na Hugging Face, a Meta Model API było jedynym miejscem first-party, w którym można było wywołać model. To ma się teraz zmienić — 10 sierpnia Meta ogłosiła, że otworzy wagi, odchodząc tym samym od polityki zamkniętych wag, która obowiązywała przy pierwszych trzech wydaniach Muse Spark.
43, potem 51, potem 54

Artificial Analysis przyznaje Muse Spark 1.2 wynik 54 w swoim Indeksie Inteligencji przy ustawieniu rozumowania xhigh, plasując go na 13. miejscu spośród 185 modeli wobec mediany klasy wynoszącej 32. Indeks to ważona kompozycja dziewięciu ocen — GDPval-AA v2, τ³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience i AA-LCR — podzielonych równomiernie na agentów, kodowanie, ogólne możliwości i rozumowanie naukowe.
Odczytana jako seria, a nie migawka, trajektoria Meta to właściwa historia. Oryginalny Muse Spark uzyskał 43 punkty w kwietniu. Muse Spark 1.1 osiągnął 51 punktów 9 lipca, co oznacza wzrost o osiem punktów w ciągu kwartału. Muse Spark 1.2 dodaje kolejne trzy w niecały miesiąc. Meta przesunęła się o 11 punktów indeksu w ciągu czterech miesięcy i obecnie wypuszcza nowe wersje szybciej, niż ekosystem oceny jest w stanie nadążyć — wciąż nie ma opublikowanego zestawienia wyników poszczególnych benchmarków dla 1.2, a dla Design Arena nie ma żadnego wpisu, podczas gdy 1.1 ma oba.
Pięćdziesiąt cztery punkty plasują Meta na równi z Grok 4.5, modelem, który SpaceXAI wypuścił dzień przed Muse Spark 1.1, i za zwartą czołówką: Claude Opus 5 na 61, Claude Fable 5 na 60, GPT-5.6 Sol na 59. Dystans do szczytu wynosi sześć lub siedem punktów. Dystans od poziomu z początku roku Meta wynosi jedenaście. Czy ten dystans się zmniejszy, zależy od tego, czy utrzyma się tempo, a Meta jest obecnie w czterotygodniowym rytmie wydawniczym.
Remis w indeksie złożonym nie jest jednak remisem w zadaniu i warto powiedzieć, co liczba 54 rozstrzyga, a czego nie. Rozstrzyga, że Muse Spark 1.2 należy do tej samej rozmowy co Grok 4.5 pod względem zagregowanej zdolności. Nie mówi natomiast, który z nich pisze lepsze łatki, ponieważ podindeks programowania, który mógłby to odpowiedzieć, nie został jeszcze opublikowany dla wersji 1.2.
Numery kodowania Meta, czytaj uważnie
Ogłoszenie Meta prowadzi na trzech wykresach. Na własnych przebiegach, raportowane jako pass@1 przy pięciu próbach, z każdym konkurującym modelem sparowanym z własnym produktem agentowym:
• Terminal-Bench 2.1 — 82,9% dla Muse Spark 1.2, wzrost z 76,2% dla 1.1. Claude Opus 5 znajduje się na czele z wynikiem 86,7%.
• DeepSWE v1.1 — 59,3%, wzrost z 53,0%.
• Wewnętrzny benchmark kodowania Meta — 70,6%, wzrost z 68,3%.
Przyrosty to wiarygodna część. Wzrost o 6,7 punktu na Terminal-Bench i 6,3 na DeepSWE — zmierzony w ten sam sposób na tym samym harnessie przez ten sam zespół w odstępie miesiąca — to rozsądny odczyt tego, o ile 1.2 poprawiło się względem 1.1 w tym, co Meta optymalizowała. Pozycja między dostawcami to część, którą należy traktować z rezerwą: dobór harnessa to duży stopień swobody, a laboratorium, które wraz ze swoim modelem dostraja własny harness, nie jest w stanie równie dobrze dostroić harnessów wszystkich innych. Meta była druga na własnym slajdzie, co przynajmniej nie jest typowym kształtem benchmarku producenta, ale w chwili pisania tego tekstu żadna strona trzecia nie powtórzyła żadnego z tych wyników.
Drugi cennik
Najważniejszą rzeczą w tym wydaniu nie są wykresy benchmarków. Muse Spark 1.2 jest dostarczany z dwoma cennikami.
• Poziom standardowy — 1,25 USD za milion tokenów wejściowych, 0,15 USD za milion przy trafieniu w pamięć podręczną, 4,25 USD za milion tokenów wyjściowych. Bez zmian w stosunku do wersji 1.1, co do centa. Limit szybkości wynosi około 3000 żądań na minutę. Grounding wyszukiwania internetowego rozliczany jest osobno w wysokości 2,50 USD za tysiąc zapytań.
• Poziom Contributor — 0,10 $ za wejście, 0,002 $ za wejście z pamięci podręcznej, 0,20 $ za wyjście. To 12,5× taniej dla wejścia i 21,25× taniej dla wyjścia. Ceną wstępu jest zgoda na to, by Meta trenowała przyszłe modele na twoim ruchu, a także limit 60 żądań na minutę — 2% standardowego budżetu.
Przy cenach 0,10 i 0,20 dolara {{1}}Muse Spark 1.2{{/1}} przebiłby cenowo niemal każdy model zbliżony do czołówki na rynku, w tym budżetowy segment modeli o otwartych wagach, któremu poza tym ustępuje ceną. To jest ta interesująca liczba w tej premierze i nie jest to tak naprawdę decyzja cenowa. {{2}}Sześćdziesiąt żądań na minutę{{/2}} samo w sobie wyklucza większość produkcyjnych wzorców fan-out, więc ten poziom jest skierowany do eksperymentów i pracy małych zespołów, a nie do serwowania ruchu. A „{{3}}możemy trenować na waszym ruchu{{/3}}” to pytanie dla tego, kto zatwierdza {{4}}zarządzanie danymi{{/4}} w waszej organizacji, a nie dla tego, kto wybiera modele. Traktujcie to jako {{5}}przegląd prawny z dołączonym rabatem{{/5}}, a nie {{6}}tańszy SKU{{/6}}.
Ile kosztuje wyprodukowanie 54

Artificial Analysis publikuje, ile kosztują jej własne przebiegi ewaluacyjne, i w tej kolumnie ujawnia się charakter Muse Spark 1.2. Przejście przez zestaw dziewięciu benchmarków kosztowało 637,85 USD i zużyło 95 milionów tokenów wyjściowych, wobec 548,07 USD i 94 milionów dla Muse Spark 1.1 — przy identycznych cenach za token. Dodatkowe 16% to czysta deliberacja.
Wartości opóźnienia zmieniają się w ten sam sposób. Zmierzone przy xhigh, czas do pierwszego tokenu wynosi 26,12 sekundy dla 1.2 wobec 2,90 sekundy dla 1.1, a prędkość generowania spada z 213,5 do 165,0 tokenów na sekundę. Meta kupiła trzy punkty indeksowe kosztem czasu myślenia, a obowiązkowy projekt rozumowania oznacza, że nie możesz odmówić zakupu — możesz tylko wybrać, jak dużego zakupu dokonasz.
Ta liczba 26 sekund będzie cytowana błędnie, więc z góry podaję korektę: to pomiar przy najdroższym poziomie wysiłku, jaki udostępnia model, a API domyślnie używa poziomu średniego. Jako punkt odniesienia z realnego ruchu, a nie ze środowiska benchmarkowego, Muse Spark 1.1 serwowany przez OrcaRouter — przy dowolnym poziomie wysiłku, o który faktycznie proszą klienci — pokazuje 7-dniowe p50 czasu do pierwszego tokena wynoszące 1,84 sekundy i p95 równe 6,00 sekund, przy 519 tokenach na sekundę i zerowym wskaźniku błędów. Opóźnienie w benchmarku przy maksymalnym wysiłku i opóźnienie produkcyjne przy domyślnym wysiłku to różne wielkości i zwykle różnią się o rząd wielkości. Odczytuj 26,12 s jako górny limit głębokiego rozumowania, a nie jako coś, co odczuje użytkownik podczas zapytania.
Gdzie możesz dziś do tego zadzwonić
Muse Spark 1.2 jest serwowane przez własne API modeli Meta i – w chwili pisania tego tekstu – nigdzie indziej: nadal nie ma repozytorium na Hugging Face, a model nie znajduje się w katalogu OrcaRouter. To ma zmienić ogłoszenie z 10 sierpnia: Meta twierdzi, że wagi zostaną udostępnione „w nadchodzących tygodniach”, a gdy to nastąpi, pytanie o dostępność przesunie się z „gdzie jest serwowane?” na „które wagi, na jakiej licencji i w jakich środowiskach uruchomieniowych”. Muse Spark 1.1 znajduje się w katalogu OrcaRouter, w cenach 1,25 USD i 4,25 USD – tych samych, które pobiera Meta, ponieważ OrcaRouter nie dolicza marży (0%) i przekazuje cenę katalogową dostawcy wprost.
To ma większe znaczenie dla porównania niż dla samego modelu. Jeśli budujesz model kosztów dla tej wersji, modele, z którymi byś ją porównywał — Claude Opus 5, Claude Fable 5, GPT-5.6 Sol, Grok 4.5, DeepSeek V4 Flash — są dostępne za jednym kluczem w cenie katalogowej, więc kwota w twoim arkuszu kalkulacyjnym to kwota na fakturze, a obniżka ceny dostawcy obowiązuje tego samego dnia, a nie po przedłużeniu umowy. W przypadku Muse Spark 1.2 konkretnie, dziś odpowiedzią jest endpoint Meta, drugi kontrakt i osobny rachunek — a gdy wagi się pojawią, instalacja self-hosted staje się trzecią opcją.
Co się zmieniło 10 sierpnia
Pięć dni po premierze Meta zmieniła nastawienie do własnego flagowca. W ogłoszeniu z 10 sierpnia Meta poinformowała, że „w nadchodzących tygodniach” otworzy wagi Muse Spark 1.2, co czyni go pierwszą wersją Muse Spark, którą zespół będzie mógł uruchomić samodzielnie. To jednak zapowiedź ze strony kierownictwa, a nie wydany produkt: na razie nie ma repozytorium na Hugging Face, a dokładna data, liczba parametrów i licencja pozostają niepotwierdzone.
Stawką jest wyścig o wagi graniczne. Muse Spark 1.2 uzyskuje 54 punkty w indeksie Artificial Analysis Intelligence Index — więcej niż każdy amerykański model o otwartych wagach, który jest obecnie dostępny do pobrania — więc jeśli wagi spełnią obietnice, będzie to najsilniejszy amerykański rywal o otwartych wagach dla chińskich laboratoriów, co jest narracją, którą Zuckerberg obszernie argumentował 10 sierpnia w eseju liczącym 6500 słów, oskarżając amerykańskie ograniczenia dotyczące danych treningowych o oddanie prowadzenia w otwartych wagach zagranicznym laboratoriom. Zmiana kursu ma już pierwszą dostawę: Muse Glimmer, model z 30 miliardami parametrów wydany tego samego dnia na licencji Apache 2.0, wydestylowany z Muse Spark i stworzony do lokalnych zadań agentowych. Własne benchmarki Meta umieszczają go przed Google Gemma4-31B i Qwen3.6-27B w zadaniach agentowych; te liczby są jednak uzyskane przez dostawcę i dotychczas niezweryfikowane.
Na co ogłoszenie nie odpowiedziało
• Brak niezależnego wyniku kodowania. Artificial Analysis publikuje indeks zbiorczy dla wersji 1.2, ale nie opublikowała jeszcze podindeksów kodowania i agentowych, które opublikowała dla wersji 1.1 (odpowiednio 71.3 i 37.5). Ponieważ praca agentowa była najsłabszym wymiarem wersji 1.1 z dużą przewagą, a kodowanie agentowe jest dokładnie tym, co wersja 1.2 twierdzi, że naprawiła, to właśnie ten wynik przesądziłby o wydaniu.
• Wyniki z platformy testowej nie zostały odtworzone. Każda liczba dotycząca kodowania w ogłoszeniu została wygenerowana przez Meta. Nikt jeszcze nie opublikował wyników Muse Spark 1.2 z neutralnego środowiska.
• Brak weryfikacji multimodalnej.Oferta Muse Spark reklamuje obsługę tekstu, obrazu, wideo, audio i PDF. Niezależna ocena obejmuje tekst i obraz. Przekaz Meta 1.2 przesunął się prawie całkowicie w kierunku prac programistycznych, a przypadek użycia multimediów 1.1, który był wyraźnie sprzedawany, nie ma obecnie ani marketingu, ani pomiarów.
• Brak historii przepustowości. Wolumen ruchu na punkcie końcowym jest nadal zbyt niski, aby typowe kroczące statystyki opóźnień mogły zostać wygenerowane.
Co warto obejrzeć przez najbliższe cztery tygodnie
Cztery kwestie przesądzą o tym, czy ta wersja jest tym, za co podaje ją Meta. Pierwszą jest niezależny wynik agentowy dla wersji 1.2 — jeśli subindeks, który w wersji 1.1 wynosił 37,5, znacząco się przesunął, argument dotyczący kodowania jest realny. Drugą jest to, czy ktokolwiek odtworzy wynik Terminal-Bench poza Muse Code; model, który sprawdza się tylko we własnym środowisku testowym, jest produktem, a nie możliwością. Trzecią jest to, co stanie się z poziomem dla kontrybutorów: jeśli limit 60 żądań zostanie poluzowany, model bliski granicy możliwości z ceną 0,10 USD za wejście i 0,20 USD za wyjście zmieni arytmetykę poziomu budżetowego tak, jak nigdy nie zmieniłby jej trzypunktowy wzrost indeksu. Czwartą jest obietnica udostępnienia wag: Meta twierdzi, że wagi Muse Spark 1.2 zostaną otwarte „w nadchodzących tygodniach”, a to, czy repozytorium trafi w tym terminie — na jakiej licencji i jak szybko podchwycą je lokalne środowiska uruchomieniowe — zadecyduje o tym, czy zwrot w stronę otwartych wag jest realny.
Jeśli tempo się utrzyma, Muse Spark 1.3 pojawi się na początku września. Sądząc po tych dowodach, liczbą, na którą warto zwrócić uwagę, gdy się ukaże, nie jest wynik indeksu. Chodzi o to, czy Meta zdoła dodać funkcje bez dodawania kolejnych dwudziestu sekund myślenia na początku każdego zapytania. Pierwszy owoc tej zmiany kursu już jest: Muse Glimmer, model open-weight o 30 miliardach parametrów, który Meta wydała 10 sierpnia na licencji Apache 2.0, stworzony do lokalnego uruchamiania agentów — najbliższy dotychczas podgląd tego, jak wygląda otwarty Muse Spark 1.2.
Porównane w tym artykule3
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
