Muse Spark 1.2 i Muse Code-1
Guides & Insights

Muse Spark 1.2 i Muse Code: Trzeci model Meta w cztery miesiące remisuje z Grok 4.5

Autor

Jim Song

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Meta wydała Muse Spark 1.2 5 sierpnia 2026 r., cztery tygodnie po Muse Spark 1.1 i około cztery miesiące po pierwszym Muse Spark. Ten model pojawił się z czymś, czego nie miały dwa poprzednie: z własnym agentem programistycznym Meta, Muse Code, wydanym w wersji beta i współtrenowanym z modelem, na którym działa. A na jedynej tablicy wyników, której nie kontrolują ani Meta, ani jej rywale, premiera doprowadza do remisu Meta z SpaceXAI — Muse Spark 1.2 i Grok 4.5 uzyskują teraz po 54 punkty w indeksie Artificial Analysis Intelligence.

Zanim którakolwiek z poniższych liczb zacznie cokolwiek znaczyć, warto oddzielić od siebie dwie rzeczy. Wynik Intelligence Index, wartości opóźnień i liczby tokenów pochodzą od Artificial Analysis, która prowadzi własne ewaluacje i publikuje rachunek; te są niezależne. Wyniki dotyczące kodowania, od których Meta zaczęła swoje ogłoszenie — Terminal-Bench 2.1, DeepSWE v1.1 oraz wewnętrzny benchmark — zostały uzyskane przez Meta, na platformie testowej Meta, przy czym każdy porównywany model był sparowany z własnym produktem agenckim. Oba rodzaje liczb są użyteczne. Nie stanowią jednak tego samego rodzaju dowodów, dlatego w tym artykule są one trzymane osobno.

Co Meta faktycznie wypuściła

Muse Spark 1.2 and Muse Code-2

Ogłoszenie, opublikowane na blogu badawczym Meta poświęconym sztucznej inteligencji i datowane na 5 sierpnia, obejmuje jednocześnie dwa produkty.

Muse Spark 1.2 — aktualizacja rodziny Muse Spark skupiona na kodowaniu. Meta twierdzi, że zwiększyła moc obliczeniową treningu w zadaniach kodowania i poszerzyła różnorodność środowisk treningowych, zachowując przy tym ogólną zdolność agenta, na której opierała się wersja 1.1. Zadeklarowane cele treningowe obejmują długi horyzont: generowanie całych repozytoriów, duże projekty end-to-end oraz to, co Meta nazywa auto-research, z planowaniem sekwencjonowania pracy, warunkowaniem celów w celu utrzymania kierunku na wielu krokach oraz kompresją kontekstu, aby utrzymać istotny stan podczas długiej sesji.

Muse Code — terminalowy agent kodujący w wersji beta, instalowany za pomocą jednowierszowego skryptu powłoki z domeny deweloperskiej Meta. Uruchamia trwałe asynchroniczne agenty w tle, które przetrwają całą sesję i działają na lokalnym środowisku uruchomieniowym opartym na dzienniku zdarzeń, które Meta opisuje jako dokładnie odtwarzalne i bezpieczne przy ponownym uruchomieniu. Koordynuje również wiele podagentów na zadanie w izolowanych drzewach roboczych. Wyposażony jest w trzy wbudowane umiejętności: /plan do planowania wymagającego zatwierdzenia, /grill do sprawdzania już wykonanej pracy pod kątem słabych punktów oraz /goal do doprowadzania zadania do końca.

To powiązanie nie jest przypadkowe. Meta mówi, że oba te elementy były trenowane wspólnie – model dostrajano na trajektoriach z próbkowania z odrzucaniem z harnessa, z optymalizacjami przepisu dla celów, kompakcji i subagentów. To ta sama gra współtrenowania, która zaowocowała Claude Code i Codex, i ma ona konsekwencje dla każdego, kto czyta wyniki benchmarków: główne wyniki kodowania modelu zostały osiągnięte wewnątrz harnessa, przeciwko któremu był trenowany. To nie jest oszustwo; tak obecnie działa ocena agentowa. Oznacza to jednak, że wynik 1.2 uzyskany przez inny scaffold pozostaje otwartą kwestią, a nie bezpiecznym założeniem.

Pozostała część specyfikacji jest niezmieniona względem 1.1, która sama ma charakter informacyjny. Kontekst pozostaje na poziomie 1 048 576 tokenów. Rozumowanie pozostaje obowiązkowe na pięciu poziomach wysiłku — minimalny, niski, średni, wysoki, xhigh — przy czym średni jest domyślny; nie ma konfiguracji, w której otrzymujesz wagi bez płacenia za pewną deliberację. Wagi są zamknięte, bez repozytorium Hugging Face, a własne API modelu Meta pozostaje jedynym miejscem pierwszej strony, przez które można go wywołać.

43, potem 51, potem 54

Muse Spark 1.2 and Muse Code-3

Artificial Analysis przyznaje Muse Spark 1.2 wynik 54 w swoim Indeksie Inteligencji przy ustawieniu rozumowania xhigh, plasując go na 13. miejscu spośród 185 modeli wobec mediany klasy wynoszącej 32. Indeks to ważona kompozycja dziewięciu ocen — GDPval-AA v2, τ³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience i AA-LCR — podzielonych równomiernie na agentów, kodowanie, ogólne możliwości i rozumowanie naukowe.

Odczytana jako seria, a nie migawka, trajektoria Meta to właściwa historia. Oryginalny Muse Spark uzyskał 43 punkty w kwietniu. Muse Spark 1.1 osiągnął 51 punktów 9 lipca, co oznacza wzrost o osiem punktów w ciągu kwartału. Muse Spark 1.2 dodaje kolejne trzy w niecały miesiąc. Meta przesunęła się o 11 punktów indeksu w ciągu czterech miesięcy i obecnie wypuszcza nowe wersje szybciej, niż ekosystem oceny jest w stanie nadążyć — wciąż nie ma opublikowanego zestawienia wyników poszczególnych benchmarków dla 1.2, a dla Design Arena nie ma żadnego wpisu, podczas gdy 1.1 ma oba.

Pięćdziesiąt cztery punkty plasują Meta na równi z Grok 4.5, modelem, który SpaceXAI wypuścił dzień przed Muse Spark 1.1, i za zwartą czołówką: Claude Opus 5 na 61, Claude Fable 5 na 60, GPT-5.6 Sol na 59. Dystans do szczytu wynosi sześć lub siedem punktów. Dystans od poziomu z początku roku Meta wynosi jedenaście. Czy ten dystans się zmniejszy, zależy od tego, czy utrzyma się tempo, a Meta jest obecnie w czterotygodniowym rytmie wydawniczym.

Remis w indeksie złożonym nie jest jednak remisem w zadaniu i warto powiedzieć, co liczba 54 rozstrzyga, a czego nie. Rozstrzyga, że Muse Spark 1.2 należy do tej samej rozmowy co Grok 4.5 pod względem zagregowanej zdolności. Nie mówi natomiast, który z nich pisze lepsze łatki, ponieważ podindeks programowania, który mógłby to odpowiedzieć, nie został jeszcze opublikowany dla wersji 1.2.

Numery kodowania Meta, czytaj uważnie

Ogłoszenie Meta prowadzi na trzech wykresach. Na własnych przebiegach, raportowane jako pass@1 przy pięciu próbach, z każdym konkurującym modelem sparowanym z własnym produktem agentowym:

Terminal-Bench 2.1 — 82,9% dla Muse Spark 1.2, wzrost z 76,2% dla 1.1. Claude Opus 5 znajduje się na czele z wynikiem 86,7%.

DeepSWE v1.1 — 59,3%, wzrost z 53,0%.

Wewnętrzny benchmark kodowania Meta — 70,6%, wzrost z 68,3%.

Przyrosty to wiarygodna część. Wzrost o 6,7 punktu na Terminal-Bench i 6,3 na DeepSWE — zmierzony w ten sam sposób na tym samym harnessie przez ten sam zespół w odstępie miesiąca — to rozsądny odczyt tego, o ile 1.2 poprawiło się względem 1.1 w tym, co Meta optymalizowała. Pozycja między dostawcami to część, którą należy traktować z rezerwą: dobór harnessa to duży stopień swobody, a laboratorium, które wraz ze swoim modelem dostraja własny harness, nie jest w stanie równie dobrze dostroić harnessów wszystkich innych. Meta była druga na własnym slajdzie, co przynajmniej nie jest typowym kształtem benchmarku producenta, ale w chwili pisania tego tekstu żadna strona trzecia nie powtórzyła żadnego z tych wyników.

Drugi cennik

Najważniejszą rzeczą w tym wydaniu nie są wykresy benchmarków. Muse Spark 1.2 jest dostarczany z dwoma cennikami.

Poziom standardowy — 1,25 USD za milion tokenów wejściowych, 0,15 USD za milion przy trafieniu w pamięć podręczną, 4,25 USD za milion tokenów wyjściowych. Bez zmian w stosunku do wersji 1.1, co do centa. Limit szybkości wynosi około 3000 żądań na minutę. Grounding wyszukiwania internetowego rozliczany jest osobno w wysokości 2,50 USD za tysiąc zapytań.

Poziom Contributor — 0,10 $ za wejście, 0,002 $ za wejście z pamięci podręcznej, 0,20 $ za wyjście. To 12,5× taniej dla wejścia i 21,25× taniej dla wyjścia. Ceną wstępu jest zgoda na to, by Meta trenowała przyszłe modele na twoim ruchu, a także limit 60 żądań na minutę — 2% standardowego budżetu.

Przy cenach 0,10 i 0,20 dolara {{1}}Muse Spark 1.2{{/1}} przebiłby cenowo niemal każdy model zbliżony do czołówki na rynku, w tym budżetowy segment modeli o otwartych wagach, któremu poza tym ustępuje ceną. To jest ta interesująca liczba w tej premierze i nie jest to tak naprawdę decyzja cenowa. {{2}}Sześćdziesiąt żądań na minutę{{/2}} samo w sobie wyklucza większość produkcyjnych wzorców fan-out, więc ten poziom jest skierowany do eksperymentów i pracy małych zespołów, a nie do serwowania ruchu. A „{{3}}możemy trenować na waszym ruchu{{/3}}” to pytanie dla tego, kto zatwierdza {{4}}zarządzanie danymi{{/4}} w waszej organizacji, a nie dla tego, kto wybiera modele. Traktujcie to jako {{5}}przegląd prawny z dołączonym rabatem{{/5}}, a nie {{6}}tańszy SKU{{/6}}.

Ile kosztuje wyprodukowanie 54

Muse Spark 1.2 and Muse Code-4

Artificial Analysis publikuje, ile kosztują jej własne przebiegi ewaluacyjne, i w tej kolumnie ujawnia się charakter Muse Spark 1.2. Przejście przez zestaw dziewięciu benchmarków kosztowało 637,85 USD i zużyło 95 milionów tokenów wyjściowych, wobec 548,07 USD i 94 milionów dla Muse Spark 1.1 — przy identycznych cenach za token. Dodatkowe 16% to czysta deliberacja.

Wartości opóźnienia zmieniają się w ten sam sposób. Zmierzone przy xhigh, czas do pierwszego tokenu wynosi 26,12 sekundy dla 1.2 wobec 2,90 sekundy dla 1.1, a prędkość generowania spada z 213,5 do 165,0 tokenów na sekundę. Meta kupiła trzy punkty indeksowe kosztem czasu myślenia, a obowiązkowy projekt rozumowania oznacza, że nie możesz odmówić zakupu — możesz tylko wybrać, jak dużego zakupu dokonasz.

Ta liczba 26 sekund będzie cytowana błędnie, więc z góry podaję korektę: to pomiar przy najdroższym poziomie wysiłku, jaki udostępnia model, a API domyślnie używa poziomu średniego. Jako punkt odniesienia z realnego ruchu, a nie ze środowiska benchmarkowego, Muse Spark 1.1 serwowany przez OrcaRouter — przy dowolnym poziomie wysiłku, o który faktycznie proszą klienci — pokazuje 7-dniowe p50 czasu do pierwszego tokena wynoszące 1,84 sekundy i p95 równe 6,00 sekund, przy 519 tokenach na sekundę i zerowym wskaźniku błędów. Opóźnienie w benchmarku przy maksymalnym wysiłku i opóźnienie produkcyjne przy domyślnym wysiłku to różne wielkości i zwykle różnią się o rząd wielkości. Odczytuj 26,12 s jako górny limit głębokiego rozumowania, a nie jako coś, co odczuje użytkownik podczas zapytania.

Gdzie możesz dziś do tego zadzwonić

Muse Spark 1.2 jest udostępniany przez własne Model API Meta i w chwili pisania tego tekstu nigdzie indziej — nie został przekierowany do OpenRouter w momencie premiery, nie ma repozytorium Hugging Face i nie ma go w katalogu OrcaRouter. Muse Spark 1.1 jest dostępny za $1.25 i $4.25 — te same kwoty, które pobiera Meta, ponieważ OrcaRouter nie dolicza marży i przekazuje cenę katalogową dostawcy wprost.

To ma większe znaczenie dla porównania niż dla samego modelu. Jeśli budujesz model kosztów dla tej wersji, modele, z którymi będziesz ją porównywać — Claude Opus 5, Claude Fable 5, GPT-5.6 Sol, Grok 4.5, DeepSeek V4 Flash — są dostępne za pomocą jednego klucza w cenie katalogowej, więc kwota w twoim arkuszu kalkulacyjnym jest kwotą na fakturze, a obniżka cen dostawcy pojawia się tego samego dnia, a nie po odnowieniu. W przypadku Muse Spark 1.2 odpowiedzią na dziś jest endpoint Meta, drugi kontrakt i osobna faktura.

Na co ogłoszenie nie odpowiedziało

Brak niezależnego wyniku kodowania. Artificial Analysis publikuje indeks zbiorczy dla wersji 1.2, ale nie opublikowała jeszcze podindeksów kodowania i agentowych, które opublikowała dla wersji 1.1 (odpowiednio 71.3 i 37.5). Ponieważ praca agentowa była najsłabszym wymiarem wersji 1.1 z dużą przewagą, a kodowanie agentowe jest dokładnie tym, co wersja 1.2 twierdzi, że naprawiła, to właśnie ten wynik przesądziłby o wydaniu.

Wyniki z platformy testowej nie zostały odtworzone. Każda liczba dotycząca kodowania w ogłoszeniu została wygenerowana przez Meta. Nikt jeszcze nie opublikował wyników Muse Spark 1.2 z neutralnego środowiska.

Brak weryfikacji multimodalnej.Oferta Muse Spark reklamuje obsługę tekstu, obrazu, wideo, audio i PDF. Niezależna ocena obejmuje tekst i obraz. Przekaz Meta 1.2 przesunął się prawie całkowicie w kierunku prac programistycznych, a przypadek użycia multimediów 1.1, który był wyraźnie sprzedawany, nie ma obecnie ani marketingu, ani pomiarów.

Brak historii przepustowości. Wolumen ruchu na punkcie końcowym jest nadal zbyt niski, aby typowe kroczące statystyki opóźnień mogły zostać wygenerowane.

Co warto obejrzeć przez najbliższe cztery tygodnie

O tym, czy ta wersja jest tym, za co podaje ją Meta, zadecydują trzy rzeczy. Po pierwsze, niezależny wynik agentowy dla wersji 1.2 — jeśli subindeks, który w wersji 1.1 wynosił 37,5, znacząco się przesunie, to kodowanie jest realne. Po drugie, czy ktoś odtworzy wynik Terminal-Bench poza Muse Code; model, który działa tylko we własnym środowisku, jest produktem, a nie możliwością. Po trzecie, co stanie się z warstwą dla kontrybutorów: jeśli limit 60 zapytań zostanie poluzowany, model zbliżony do granicy możliwości przy $0,10 za wejście i $0,20 za wyjście zmienia arytmetykę budżetu w sposób, w jaki nigdy nie zrobiłby tego trójpunktowy wzrost indeksu.

A jeśli tempo się utrzyma, Muse Spark 1.3 ma się ukazać na początku września. Sądząc po tych danych, liczbą, na którą warto zwracać uwagę, gdy się pojawi, nie jest wynik indeksu. Pytanie brzmi, czy Meta może dodać funkcje bez dodawania kolejnych dwudziestu sekund myślenia na początku każdego zapytania.

Porównane w tym artykule3

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie

© 2026 OrcaRouter

Dla dostawców

Prowadzisz platformę inferencyjną? Udostępnij swoje modele w OrcaRouter.

Skontaktuj się z nami

Dołącz do społeczności

DiscordEmailXGitHubYouTube