
Muse Spark 1.3 Max Reasoning jest już dostępny: ustawienie stojące za najlepszymi wynikami Meta trafia teraz do wszystkich
- openaiNOWOŚĆOpenAI: GPT-6.1 Sol2026-09-2952Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Sonnet 5.52026-09-2856Inteligencja
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 221 tok/s
- OpenAINOWOŚĆOpenAI: GPT-6 Luna2026-09-2238Inteligencja
- OpenAINOWOŚĆOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- AnthropicNOWOŚĆAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- xAINOWOŚĆGrok 4.72026-09-2146Inteligencja
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 za 1 mln tokenów · 110 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 za 1 mln tokenów · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
Muse Spark 1.3 — najbardziej zaawansowany model rozumowania, wydany przez Meta Superintelligence Labs 2 września — właśnie zyskał tryb, na którym oparto jego własną tablicę wyników. 4 września, po dwóch dniach dodatkowych testów bezpieczeństwa, Meta udostępniła deweloperom najbardziej zasobożerny tryb rozumowania „max” modelu w Meta Model API oraz w Muse Code, swoim terminalowym agencie do kodowania. Dyrektor ds. AI Alexandr Wang ogłosił udostępnienie na X, a konto firmy @AIatMeta potwierdziło to; to, co przy premierze było konfiguracją ograniczoną do Meta i podglądu partnerskiego, jest teraz poziomem rozumowania, który każdy deweloper może wybrać.
Ta sekwencja ma znaczenie, ponieważ kilka liczb, które zdominowały doniesienia o premierze Muse Spark 1.3 — 75,4 na DeepSWE v1.1, 66,9 na OSWorld 2.0, 1754 na GDPval-AA v2 — pochodziło z konfiguracji max, podczas gdy model, który deweloperzy mogli faktycznie wywoływać, był dostarczany z wysiłkiem rozumowania ograniczonym do „xhigh”. Meta podczas premiery wprost przyznała, że tryb max wciąż przechodzi testy bezpieczeństwa, ale ten podział sprawił, że przez dwa dni wyniki z nagłówków i model dostępny do wywołania to były dwie różne rzeczy. Czwartkowa publikacja niweluje tę różnicę i robi to bez zmiany ceny za token. Wyniki benchmarków z tej listy to dane samej Meta i jak dotąd nie zostały odtworzone przez niezależny harness; wszystkie wartości podane przez producenta w tym artykule są jako takie oznaczone.
Co zostało ukryte — i co zmieniło się 4 września
Drabina rozumowania Muse Spark 1.3 ma ten sam kształt od czasu otwarcia płatnego API tej rodziny: rozumowanie jest zawsze włączone, a parametr effort modelu w Meta Model API przyjmuje wartości minimal, low, medium, high i xhigh, przy czym model poświęca coraz większą część swojego budżetu wyjściowego na myślenie w miarę wzrostu poziomu. Max znajduje się powyżej xhigh — więcej mocy obliczeniowej, więcej tokenów rozumowania i, według Meta, znacząco lepszy w długoterminowych zadaniach agentowych. Podczas premiery 2 września Meta udostępniła wszystkie poziomy aż do xhigh, ale pozostawiła max poza publicznym API do czasu, jak to określiła, dodatkowych testów bezpieczeństwa, dzieląc się nim tylko z ograniczoną grupą partnerów — na tyle dużą, by przeprowadzić niezależną ocenę, ale nie na tyle, by udźwignąć obciążenia produkcyjne.
4 września Wang powiedział, że testy zostały zakończone. Max jest teraz opcją do wyboru w Muse Code — skrypt instalacyjny znajduje się pod adresem dev.meta.ai/install.sh — oraz dla identyfikatora modelu muse-spark-1.3 przez Meta Model API, gdzie parametr effort przyjmuje teraz wartość max. Wang opisał dwudniowe rozłożenie w czasie jako sposób Meta na kontrolowanie dostępu „na poziomie konfiguracji” i powiedział Axios, że Meta nie musiała wstrzymywać swoich szerszych prac ze względu na obawy dotyczące bezpieczeństwa. Okno było krótkie, ale to prawdziwy precedens: Meta jest teraz gotowa wstrzymać określony tryb rozumowania za przeglądem bezpieczeństwa, jednocześnie natychmiast udostępniając resztę punktu kontrolnego.
Jedna praktyczna uwaga dla każdego, kto wywołuje model przez bramę (gateway), a nie przez własny endpoint Meta: kilka zewnętrznych stron dokumentacji i wpisów w agregatorach powstało w dniu premiery i nadal wymienia poziomy reasoning effort tylko do xhigh. Wartość max jest częścią wdrożenia po stronie Meta, więc zanim założysz, że max jest osiągalne, sprawdź, czy trasa, przez którą wykonujesz wywołania, ma już zaktualizowany zestaw parametrów — proxy, które 2 września walidowało swoje dozwolone wartości, może odrzucać „max”, dopóki jego opiekunowie nie nadążą z aktualizacją.
Co tak naprawdę daje max — i gdzie nie pomaga
Materiały Meta z czwartku zawierają wyraźny podział max-versus-xhigh w uruchamianych przez nią benchmarkach i jest to najbardziej przydatna rzecz, jaką firma dotychczas opublikowała na temat tego modelu. Wszystko to jest raportowane przez dostawcę, powstało we własnym harnessie Muse Code Meta, a Meta twierdzi, że jej porównania z Claude Opus 5 i GPT-5.6 Sol były próbami „best-effort” przy maksymalnych ustawieniach tych rywali, które „mogą nie odzwierciedlać wydajności zoptymalizowanej przez dostawcę”. Z tym zastrzeżeniem podział ten opowiada jasną historię kierunkową:
• OSWorld 2.0 (zadania agenta korzystającego z komputera) — 66.9 przy max vs 57.2 przy xhigh
• GDPval-AA v2 (agent Elo pracy opartej na wiedzy) — 1 754 przy max vs 1 709 przy xhigh
JobBench (długoterminowe zadania profesjonalne) — 64,9 przy max vs 61,2 przy xhigh
• DeepSearchQA — remis z wynikiem 89.4
• Terminal-Bench 2.1 (kodowanie agenta terminalowego) — 89,2 przy xhigh wobec 88,8 przy max, jedyny zestaw, w którym wygrywa konfiguracja wydana 2 września.

Ten wzorzec warto przeczytać uważnie. Max pomaga najbardziej tam, gdzie zadanie to długa pętla agentowa — obsługa komputera, praca nad briefem wymagającym pracy wiedzowej, utrzymywanie harmonogramu podzadań tak jak w JobBench. W benchmarku terminalowym na jedną turę nic nie dodał, a kosztował trochę: Terminal-Bench przypomina, że „więcej rozumowania” nie jest monotonicznym ulepszeniem, i jest powodem, aby testować A/B Maxa względem xhigh na własnym obciążeniu, zamiast zakładać, że wyższe ustawienie jest wszędzie lepsze. Meta zaznacza też, że wynik DeepSWE v1.1 wynoszący 75,4 — nagłówek z pierwszego dnia, wzrost z 59,3, które Meta podawała dla Muse Spark 1.2 sześć tygodni wcześniej — jest liczbą z konfiguracji max. To właśnie tę wartość niezależni ewaluatorzy najpierw uruchomią ponownie.
Niezależny odczyt zaczyna doganiać.
Przy premierze brakowało jakiegokolwiek niezależnego pomiaru, a ta luka zamyka się w harmonogramie, który akurat pokrywa się z wdrożeniem max. Indeks Coding Agent serwisu Artificial Analysis — który ocenia każdy model w jego natywnym harnessie agenta kodującego i łączy zadania DeepSWE, Terminal-Bench oraz SWE-Atlas — umieścił w tym tygodniu Muse Spark 1.3 (max) w harnessie Muse Code z wynikiem 68, na drugim miejscu listy: za modelem Claude Opus 5 (xhigh) w Claude Code, a przed modelami Claude Fable 5 (max) z 67 punktami i GPT-5.6 Sol (max) z 65 punktami. Ta sama tablica ocenia produkcyjną konfigurację xhigh na 64 punkty w tym samym harnessie Muse Code, co jest najczystszym jak dotąd porównaniem wprost tego, ile wnosi max — mniej więcej cztery punkty indeksowe — na niezależnym zestawie zadań. Ten wiersz tablicy został opublikowany, gdy max był wciąż w podglądzie dla partnerów; konfiguracja, którą opisuje, to ta, która stała się ogólnie dostępna 4 września.
Artificial Analysis zaktualizowało również swoją kartę modelu dla konfiguracji max od czasu premiery. W okresie przedpremierowym karta nie podawała dostawcy ani ceny; obecna karta wymienia Meta w standardowej cenie 1,25 USD za milion tokenów wejściowych i 4,25 USD za milion tokenów wyjściowych — taka sama cena katalogowa jak w przypadku Muse Spark 1.2 — dodając przy tym zastrzeżenie dotyczące gadatliwości: przebieg ewaluacji AA zużył około 130 milionów tokenów w porównaniu z medianą 79 milionów, kosztował łącznie około 1 335 USD i przy szybkości około 190 tokenów wyjściowych na sekundę daje prawie 0,95 USD za zadanie według szacunków AA.
Jedna liczba z wcześniejszego omówienia zasługuje na weryfikację wersji. Artificial Analysis odświeżyło w tym tygodniu swój Intelligence Index do wersji v4.2 — w tym samym tygodniu, w którym pojawił się max — przeliczając wyniki i przesuwając mediany. Na aktualnej karcie konfiguracja max osiąga 53, przy medianie porównywalnych modeli wynoszącej 29; wynik 62, który pojawił się w materiałach z tygodnia premiery, został zmierzony na poprzedniej wersji indeksu i obie wartości nie są porównywalne. Własny podział Meta na xhigh i max powyżej jest niezależny od indeksu AA i nie został zmieniony przez odświeżenie.

Jaki jest maksymalny koszt — rozliczenie odbywa się w tokenach, a nie według cennika.
Meta nie publikuje osobnej ceny za konfigurację max, ani też nie udostępnia dedykowanej analizy opóźnień. Cena za token jest identyczna jak w Muse Spark 1.2 i na każdym innym poziomie nakładów w Muse Spark 1.3: 1,25 USD za milion tokenów wejściowych, 4,25 USD za milion tokenów wyjściowych i 0,15 USD za wejściowe tokeny z pamięci podręcznej w standardowej warstwie. Tokeny rozumowania są rozliczane jako tokeny wyjściowe i wliczane do limitu wyjściowego, więc wybór trybu max nie oznacza podwyżki w pozycji cennika — to obietnica wydania większej części tego limitu na myślenie przed udzieleniem odpowiedzi.
To sprawia, że prawdziwe pytanie o koszt sprowadza się do wolumenu tokenów, a wstępne dane wskazują, że max jest kosztowny dokładnie tam, gdzie xhigh jest oszczędny. Instrumentowany przebieg AA zużył około 130 milionów tokenów podczas pojedynczej ewaluacji tej konfiguracji. Dla programisty, który już prowadzi długie pętle agentowe na xhigh, test A/B, który ma znaczenie, nie brzmi: „czy max rozwiązuje więcej zadań?”, lecz „czy max rozwiązuje wystarczająco więcej zadań, aby pokryć znacznie większy rachunek za tokeny przy tym samym obciążeniu?”.
Warstwa Contributor Meta — 0,10 USD za wejście i 0,20 USD za wyjście na milion tokenów w zamian za pozwolenie Meta na trenowanie na Twoich promptach i odpowiedziach — dotyczy tego samego punktu kontrolnego, a Meta twierdzi, że wybiera ją znaczący, dwucyfrowy odsetek programistów. Warunki Contributor sprawiają, że każde przesłane dane stają się danymi treningowymi, a limity szybkości są napięte, więc to słaba opcja domyślna dla produkcyjnego fan-outu, ale uzasadniony sposób na tanie przeprowadzanie kosztownych eksperymentów maksymalnych, jeśli akceptujesz taką wymianę danych.
Kotwicę cenową dla tego wszystkiego można łatwo sprawdzić bez polegania na słowie Meta, ponieważ cena checkpointu Muse Spark 1.3 jest taka sama jak cena modelu już wystawionego na OrcaRouter po cenie katalogowej Meta: Muse Spark 1.2 jest na OrcaRouter po $1.25 za milion tokenów wejściowych i $4.25 za milion tokenów wyjściowych, z zerową marżą, więc twierdzenie o „niezmienionej cenie” można zweryfikować na działającej stronie, która pokazuje dokładnie te liczby. Sam model Muse Spark 1.3 nie jest jeszcze dostępny na OrcaRouter. Gdy dostawca z naszej oferty zacznie go serwować z max, cena widoczna po naszej stronie będzie ceną katalogową Meta przekazaną wprost — nie podnosimy cen dostawców — a każda obniżka ze strony Meta wejdzie w życie tego samego dnia, w którym Meta ją wprowadzi. W przypadku wydania takiego jak to, w którym ciekawsze aspekty ekonomiczne leżą w wolumenie tokenów, a nie w cenie w nagłówku, to właśnie bezpośrednie przeniesienie ceny sprawia, że kwota faktycznie naliczana jest równa kwocie publikowanej przez Meta.

Kto powinien przejść na max
Decyzja dzieli się wyraźnie:
• Przełącznik dla zadań agentowych o długim horyzoncie — obsługa komputera, krótkie zlecenia pracy intelektualnej, wieloetapowe pętle narzędziowe w Muse Code — gdzie zarówno własny split Meta, jak i ranking agentów kodujących AA wykazują największe maksymalne zyski. Przetestuj go metodą A/B względem xhigh na próbce swoich rzeczywistych zadań, bo rozwlekłość to realny problem.
• Pozostań przy xhigh w przypadku wywołań o dużej objętości, wrażliwych na opóźnienia lub krótkich, jednoturowych, gdzie max w większości dodaje tylko tokeny. Terminal-Bench to dowód, że nie zawsze zwiększa on możliwości.
• Obserwuj od teraz trzy rzeczy: wydanie otwartych wag, które Zuckerberg obiecał bez podania terminu; konsumenckie wdrożenie Muse Spark 1.3 na Instagramie, Facebooku i Meta AI w nadchodzących tygodniach; oraz to, czy tablica agentów kodujących Artificial Analysis zacznie wyceniać wiersz „max”, teraz gdy konfiguracja jest ogólnie dostępna.
Dwudniowy okres wstrzymania okazał się krótki, ale pokazał coś, co przetrwa samo wdrożenie: najlepsze wyniki Meta dla Muse Spark 1.3 nigdy nie były mirażem — po prostu czekały na przegląd bezpieczeństwa. Od 4 września model, który może wywołać programista, i model na tablicy wyników to wreszcie ten sam model. To, czy max jest wart swoich tokenów, jest teraz pytaniem empirycznym, na które każdy programista może odpowiedzieć — przez API Meta lub dowolną ścieżką, której już używa, aby dotrzeć do rodziny Muse Spark.
Porównane w tym artykule1
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
