Karta hero z tytułem wiadomości o tym, że Muse Spark 1.3 z max reasoning jest już dostępny. Nadtytuł: „Meta Superintelligence Labs — 4 września 2026”. Nagłówek: „Muse Spark 1.3 z max reasoning jest już dostępny”. Podtytuł informujący, że Meta dwa dni po premierze przeszła testy bezpieczeństwa i udostępniła tryb rozumowania stojący za jej najlepszymi wynikami w Muse Code i Meta Model API — w tej samej cenie. Plakietki: „reasoning effort: max”, „ta sama cena katalogowa $1.25 / $4.25” oraz „konfiguracja stojąca za DeepSWE 75.4”. Stopka: „Teraz do wyboru w muse-spark-1.3 — tokeny rozumowania rozliczane jako dane wyjściowe”. Logo OrcaRouter wkomponowane w prawym dolnym rogu.
Guides & Insights

Muse Spark 1.3 Max Reasoning jest już dostępny: ustawienie stojące za najlepszymi wynikami Meta trafia teraz do wszystkich

Autor

Elias Hawthorne

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Muse Spark 1.3 — najbardziej zaawansowany model rozumowania, wydany przez Meta Superintelligence Labs 2 września — właśnie zyskał tryb, na którym oparto jego własną tablicę wyników. 4 września, po dwóch dniach dodatkowych testów bezpieczeństwa, Meta udostępniła deweloperom najbardziej zasobożerny tryb rozumowania „max” modelu w Meta Model API oraz w Muse Code, swoim terminalowym agencie do kodowania. Dyrektor ds. AI Alexandr Wang ogłosił udostępnienie na X, a konto firmy @AIatMeta potwierdziło to; to, co przy premierze było konfiguracją ograniczoną do Meta i podglądu partnerskiego, jest teraz poziomem rozumowania, który każdy deweloper może wybrać.

Ta sekwencja ma znaczenie, ponieważ kilka liczb, które zdominowały doniesienia o premierze Muse Spark 1.3 — 75,4 na DeepSWE v1.1, 66,9 na OSWorld 2.0, 1754 na GDPval-AA v2 — pochodziło z konfiguracji max, podczas gdy model, który deweloperzy mogli faktycznie wywoływać, był dostarczany z wysiłkiem rozumowania ograniczonym do „xhigh”. Meta podczas premiery wprost przyznała, że tryb max wciąż przechodzi testy bezpieczeństwa, ale ten podział sprawił, że przez dwa dni wyniki z nagłówków i model dostępny do wywołania to były dwie różne rzeczy. Czwartkowa publikacja niweluje tę różnicę i robi to bez zmiany ceny za token. Wyniki benchmarków z tej listy to dane samej Meta i jak dotąd nie zostały odtworzone przez niezależny harness; wszystkie wartości podane przez producenta w tym artykule są jako takie oznaczone.

Co zostało ukryte — i co zmieniło się 4 września

Drabina rozumowania Muse Spark 1.3 ma ten sam kształt od czasu otwarcia płatnego API tej rodziny: rozumowanie jest zawsze włączone, a parametr effort modelu w Meta Model API przyjmuje wartości minimal, low, medium, high i xhigh, przy czym model poświęca coraz większą część swojego budżetu wyjściowego na myślenie w miarę wzrostu poziomu. Max znajduje się powyżej xhigh — więcej mocy obliczeniowej, więcej tokenów rozumowania i, według Meta, znacząco lepszy w długoterminowych zadaniach agentowych. Podczas premiery 2 września Meta udostępniła wszystkie poziomy aż do xhigh, ale pozostawiła max poza publicznym API do czasu, jak to określiła, dodatkowych testów bezpieczeństwa, dzieląc się nim tylko z ograniczoną grupą partnerów — na tyle dużą, by przeprowadzić niezależną ocenę, ale nie na tyle, by udźwignąć obciążenia produkcyjne.

4 września Wang powiedział, że testy zostały zakończone. Max jest teraz opcją do wyboru w Muse Code — skrypt instalacyjny znajduje się pod adresem dev.meta.ai/install.sh — oraz dla identyfikatora modelu muse-spark-1.3 przez Meta Model API, gdzie parametr effort przyjmuje teraz wartość max. Wang opisał dwudniowe rozłożenie w czasie jako sposób Meta na kontrolowanie dostępu „na poziomie konfiguracji” i powiedział Axios, że Meta nie musiała wstrzymywać swoich szerszych prac ze względu na obawy dotyczące bezpieczeństwa. Okno było krótkie, ale to prawdziwy precedens: Meta jest teraz gotowa wstrzymać określony tryb rozumowania za przeglądem bezpieczeństwa, jednocześnie natychmiast udostępniając resztę punktu kontrolnego.

Jedna praktyczna uwaga dla każdego, kto wywołuje model przez bramę (gateway), a nie przez własny endpoint Meta: kilka zewnętrznych stron dokumentacji i wpisów w agregatorach powstało w dniu premiery i nadal wymienia poziomy reasoning effort tylko do xhigh. Wartość max jest częścią wdrożenia po stronie Meta, więc zanim założysz, że max jest osiągalne, sprawdź, czy trasa, przez którą wykonujesz wywołania, ma już zaktualizowany zestaw parametrów — proxy, które 2 września walidowało swoje dozwolone wartości, może odrzucać „max”, dopóki jego opiekunowie nie nadążą z aktualizacją.

Co tak naprawdę daje max — i gdzie nie pomaga

Materiały Meta z czwartku zawierają wyraźny podział max-versus-xhigh w uruchamianych przez nią benchmarkach i jest to najbardziej przydatna rzecz, jaką firma dotychczas opublikowała na temat tego modelu. Wszystko to jest raportowane przez dostawcę, powstało we własnym harnessie Muse Code Meta, a Meta twierdzi, że jej porównania z Claude Opus 5 i GPT-5.6 Sol były próbami „best-effort” przy maksymalnych ustawieniach tych rywali, które „mogą nie odzwierciedlać wydajności zoptymalizowanej przez dostawcę”. Z tym zastrzeżeniem podział ten opowiada jasną historię kierunkową:

• OSWorld 2.0 (zadania agenta korzystającego z komputera) — 66.9 przy max vs 57.2 przy xhigh

• GDPval-AA v2 (agent Elo pracy opartej na wiedzy) — 1 754 przy max vs 1 709 przy xhigh

JobBench (długoterminowe zadania profesjonalne) — 64,9 przy max vs 61,2 przy xhigh

• DeepSearchQA — remis z wynikiem 89.4

• Terminal-Bench 2.1 (kodowanie agenta terminalowego) — 89,2 przy xhigh wobec 88,8 przy max, jedyny zestaw, w którym wygrywa konfiguracja wydana 2 września.

A comparison scoreboard titled 'Muse Spark 1.3 — max vs xhigh, the split'. Left column Max (released Sept 4, 2026): OSWorld 2.0 66.9, Terminal-Bench 2.1 88.8, GDPval-AA v2 (Elo) 1,754, JobBench 64.9, DeepSearchQA 89.4, Available to all developers. Right column Xhigh (released Sept 2, 2026): OSWorld 2.0 57.2, Terminal-Bench 2.1 89.2, GDPval-AA v2 (Elo) 1,709, JobBench 61.2, DeepSearchQA 89.4, Available to all developers. Footer: 'Benchmark splits per Meta's Sept 4 release materials — vendor-reported, not independently reproduced. Xhigh wins Terminal-Bench 2.1.' OrcaRouter logo bottom-right.

Ten wzorzec warto przeczytać uważnie. Max pomaga najbardziej tam, gdzie zadanie to długa pętla agentowa — obsługa komputera, praca nad briefem wymagającym pracy wiedzowej, utrzymywanie harmonogramu podzadań tak jak w JobBench. W benchmarku terminalowym na jedną turę nic nie dodał, a kosztował trochę: Terminal-Bench przypomina, że „więcej rozumowania” nie jest monotonicznym ulepszeniem, i jest powodem, aby testować A/B Maxa względem xhigh na własnym obciążeniu, zamiast zakładać, że wyższe ustawienie jest wszędzie lepsze. Meta zaznacza też, że wynik DeepSWE v1.1 wynoszący 75,4 — nagłówek z pierwszego dnia, wzrost z 59,3, które Meta podawała dla Muse Spark 1.2 sześć tygodni wcześniej — jest liczbą z konfiguracji max. To właśnie tę wartość niezależni ewaluatorzy najpierw uruchomią ponownie.

Niezależny odczyt zaczyna doganiać.

Przy premierze brakowało jakiegokolwiek niezależnego pomiaru, a ta luka zamyka się w harmonogramie, który akurat pokrywa się z wdrożeniem max. Indeks Coding Agent serwisu Artificial Analysis — który ocenia każdy model w jego natywnym harnessie agenta kodującego i łączy zadania DeepSWE, Terminal-Bench oraz SWE-Atlas — umieścił w tym tygodniu Muse Spark 1.3 (max) w harnessie Muse Code z wynikiem 68, na drugim miejscu listy: za modelem Claude Opus 5 (xhigh) w Claude Code, a przed modelami Claude Fable 5 (max) z 67 punktami i GPT-5.6 Sol (max) z 65 punktami. Ta sama tablica ocenia produkcyjną konfigurację xhigh na 64 punkty w tym samym harnessie Muse Code, co jest najczystszym jak dotąd porównaniem wprost tego, ile wnosi max — mniej więcej cztery punkty indeksowe — na niezależnym zestawie zadań. Ten wiersz tablicy został opublikowany, gdy max był wciąż w podglądzie dla partnerów; konfiguracja, którą opisuje, to ta, która stała się ogólnie dostępna 4 września.

Artificial Analysis zaktualizowało również swoją kartę modelu dla konfiguracji max od czasu premiery. W okresie przedpremierowym karta nie podawała dostawcy ani ceny; obecna karta wymienia Meta w standardowej cenie 1,25 USD za milion tokenów wejściowych i 4,25 USD za milion tokenów wyjściowych — taka sama cena katalogowa jak w przypadku Muse Spark 1.2 — dodając przy tym zastrzeżenie dotyczące gadatliwości: przebieg ewaluacji AA zużył około 130 milionów tokenów w porównaniu z medianą 79 milionów, kosztował łącznie około 1 335 USD i przy szybkości około 190 tokenów wyjściowych na sekundę daje prawie 0,95 USD za zadanie według szacunków AA.

Jedna liczba z wcześniejszego omówienia zasługuje na weryfikację wersji. Artificial Analysis odświeżyło w tym tygodniu swój Intelligence Index do wersji v4.2 — w tym samym tygodniu, w którym pojawił się max — przeliczając wyniki i przesuwając mediany. Na aktualnej karcie konfiguracja max osiąga 53, przy medianie porównywalnych modeli wynoszącej 29; wynik 62, który pojawił się w materiałach z tygodnia premiery, został zmierzony na poprzedniej wersji indeksu i obie wartości nie są porównywalne. Własny podział Meta na xhigh i max powyżej jest niezależny od indeksu AA i nie został zmieniony przez odświeżenie.

A screenshot of the Artificial Analysis model page for Muse Spark 1.3 (max), showing a score of 53 on the Artificial Analysis Intelligence Index against a comparable-model median of 29, input pricing of $1.25 and output pricing of $4.25 per 1M tokens with an 88% cache discount, a per-task cost estimate near $0.95, about 190 output tokens per second, a 1M-token context window, and a note that the configuration is 'somewhat verbose' after generating roughly 130M tokens against a 79M median.

Jaki jest maksymalny koszt — rozliczenie odbywa się w tokenach, a nie według cennika.

Meta nie publikuje osobnej ceny za konfigurację max, ani też nie udostępnia dedykowanej analizy opóźnień. Cena za token jest identyczna jak w Muse Spark 1.2 i na każdym innym poziomie nakładów w Muse Spark 1.3: 1,25 USD za milion tokenów wejściowych, 4,25 USD za milion tokenów wyjściowych i 0,15 USD za wejściowe tokeny z pamięci podręcznej w standardowej warstwie. Tokeny rozumowania są rozliczane jako tokeny wyjściowe i wliczane do limitu wyjściowego, więc wybór trybu max nie oznacza podwyżki w pozycji cennika — to obietnica wydania większej części tego limitu na myślenie przed udzieleniem odpowiedzi.

To sprawia, że prawdziwe pytanie o koszt sprowadza się do wolumenu tokenów, a wstępne dane wskazują, że max jest kosztowny dokładnie tam, gdzie xhigh jest oszczędny. Instrumentowany przebieg AA zużył około 130 milionów tokenów podczas pojedynczej ewaluacji tej konfiguracji. Dla programisty, który już prowadzi długie pętle agentowe na xhigh, test A/B, który ma znaczenie, nie brzmi: „czy max rozwiązuje więcej zadań?”, lecz „czy max rozwiązuje wystarczająco więcej zadań, aby pokryć znacznie większy rachunek za tokeny przy tym samym obciążeniu?”.

Warstwa Contributor Meta — 0,10 USD za wejście i 0,20 USD za wyjście na milion tokenów w zamian za pozwolenie Meta na trenowanie na Twoich promptach i odpowiedziach — dotyczy tego samego punktu kontrolnego, a Meta twierdzi, że wybiera ją znaczący, dwucyfrowy odsetek programistów. Warunki Contributor sprawiają, że każde przesłane dane stają się danymi treningowymi, a limity szybkości są napięte, więc to słaba opcja domyślna dla produkcyjnego fan-outu, ale uzasadniony sposób na tanie przeprowadzanie kosztownych eksperymentów maksymalnych, jeśli akceptujesz taką wymianę danych.

Kotwicę cenową dla tego wszystkiego można łatwo sprawdzić bez polegania na słowie Meta, ponieważ cena checkpointu Muse Spark 1.3 jest taka sama jak cena modelu już wystawionego na OrcaRouter po cenie katalogowej Meta: Muse Spark 1.2 jest na OrcaRouter po $1.25 za milion tokenów wejściowych i $4.25 za milion tokenów wyjściowych, z zerową marżą, więc twierdzenie o „niezmienionej cenie” można zweryfikować na działającej stronie, która pokazuje dokładnie te liczby. Sam model Muse Spark 1.3 nie jest jeszcze dostępny na OrcaRouter. Gdy dostawca z naszej oferty zacznie go serwować z max, cena widoczna po naszej stronie będzie ceną katalogową Meta przekazaną wprost — nie podnosimy cen dostawców — a każda obniżka ze strony Meta wejdzie w życie tego samego dnia, w którym Meta ją wprowadzi. W przypadku wydania takiego jak to, w którym ciekawsze aspekty ekonomiczne leżą w wolumenie tokenów, a nie w cenie w nagłówku, to właśnie bezpośrednie przeniesienie ceny sprawia, że kwota faktycznie naliczana jest równa kwocie publikowanej przez Meta.

A screenshot of the OrcaRouter model page for Muse Spark 1.2, the checkpoint Muse Spark 1.3 is priced identically to, showing header stats $1.25 input and $4.25 output per million tokens, p50 time-to-first-token 7.84 s, p50 total 10.00 s and 48.9M, the description 'Muse Spark 1.2 is Meta's reasoning model for complex agentic tasks... a drop-in upgrade rather than a new tier', and the 'Get the Muse Spark 1.2 API' and 'Try in playground' buttons.

Kto powinien przejść na max

Decyzja dzieli się wyraźnie:

• Przełącznik dla zadań agentowych o długim horyzoncie — obsługa komputera, krótkie zlecenia pracy intelektualnej, wieloetapowe pętle narzędziowe w Muse Code — gdzie zarówno własny split Meta, jak i ranking agentów kodujących AA wykazują największe maksymalne zyski. Przetestuj go metodą A/B względem xhigh na próbce swoich rzeczywistych zadań, bo rozwlekłość to realny problem.

• Pozostań przy xhigh w przypadku wywołań o dużej objętości, wrażliwych na opóźnienia lub krótkich, jednoturowych, gdzie max w większości dodaje tylko tokeny. Terminal-Bench to dowód, że nie zawsze zwiększa on możliwości.

• Obserwuj od teraz trzy rzeczy: wydanie otwartych wag, które Zuckerberg obiecał bez podania terminu; konsumenckie wdrożenie Muse Spark 1.3 na Instagramie, Facebooku i Meta AI w nadchodzących tygodniach; oraz to, czy tablica agentów kodujących Artificial Analysis zacznie wyceniać wiersz „max”, teraz gdy konfiguracja jest ogólnie dostępna.

Dwudniowy okres wstrzymania okazał się krótki, ale pokazał coś, co przetrwa samo wdrożenie: najlepsze wyniki Meta dla Muse Spark 1.3 nigdy nie były mirażem — po prostu czekały na przegląd bezpieczeństwa. Od 4 września model, który może wywołać programista, i model na tablicy wyników to wreszcie ten sam model. To, czy max jest wart swoich tokenów, jest teraz pytaniem empirycznym, na które każdy programista może odpowiedzieć — przez API Meta lub dowolną ścieżką, której już używa, aby dotrzeć do rodziny Muse Spark.

Porównane w tym artykule1

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie