
Muse Spark 1.2 vs Muse Spark 1.1: Czy warto zaktualizować?
- metaNOWOŚĆMeta: Muse Spark 1.22026-08-0557Inteligencja72Kod
- qwenNOWOŚĆQwen: Qwen3.8 Max2026-08-0358Inteligencja72Kod
- deepseekNOWOŚĆDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligencja69Kod
- qwenNOWOŚĆQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów · 2038 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligencja78Kod
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligencja69Kod
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligencja49Kod
- metaMeta: Muse Spark 1.12026-07-1653Inteligencja71Kod
- kimiMoonshotAI: Kimi K32026-07-1560Inteligencja76Kod
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligencja71Kod
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Inteligencja77Kod
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Inteligencja77Kod
- grokxAI: Grok 4.52026-07-0856Inteligencja72Kod
- tencentTencent: Hy32026-07-0642Inteligencja59Kod
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Inteligencja42Kod
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Inteligencja39Kod
- anthropicAnthropic: Claude Sonnet 52026-06-3055Inteligencja72Kod
- klingKling: Kling 3.0 Turbo2026-06-1757Inteligencja52Kod57Matematyka
- z-aiZ.ai: GLM 5.22026-06-1653Inteligencja69Kod60Matematyka
Meta zastąpiła Muse Spark 1.1 wersją Muse Spark 1.2 5 sierpnia 2026 roku, bez zmiany ceny, okna kontekstu, listy modalności, obsługiwanych parametrów ani pokrętła rozumowania. Migracja wygląda więc na bezpłatną — ta sama rodzina identyfikatorów modelu, te same rozliczenia, nic do renegocjacji. Nie jest bezpłatna. Niezależne pomiary pokazują, że czas do pierwszego tokena w nowej wersji wynosi 26,12 sekundy, podczas gdy w starej wersji 2,90, a ciągła wydajność to 165 tokenów na sekundę wobec 213,5. Kupujesz trzy punkty zmierzonej inteligencji, z około dziewięciokrotnie dłuższym oczekiwaniem na jakąkolwiek odpowiedź.
Czy warto to zrobić, zależy prawie wyłącznie od tego, jak długo działają Twoje zadania. Oto, co faktycznie się różni, co pozostało identyczne, a czego nikt jeszcze nie może Ci powiedzieć.
Decyzja w czterech linijkach
• Indeks Inteligencji: 51 → 54, niezależnie zmierzony przez Artificial Analysis dla każdej wersji przy ustawieniu xhigh.
• Czas do pierwszego tokena: 2.90s → 26.12s, to samo źródło, te same warunki.
• Koszt uruchomienia identycznego zestawu benchmarków: $548.07 → $637.85, przy identycznych cenach za token. Dodatkowe 16% to czyste spalanie tokenów.
• Wszystko, o co pyta formularz zakupowy: bez zmian.

Co jest naprawdę identyczne
Warto to wyliczyć, ponieważ to jest powód, dla którego migracja na papierze wygląda trywialnie, oraz dlatego, że różnica, która nie istnieje, to taka, której nie trzeba testować.
• Cena — 1,25 USD za milion tokenów wejściowych, 4,25 USD za milion tokenów wyjściowych, 0,15 USD za milion przy trafieniu w pamięć podręczną, 2,50 USD za tysiąc wbudowanych wyszukiwań internetowych. Każda z tych kwot jest taka sama w obu wersjach.
• Kontekst — 1 048 576 tokenów w obu przypadkach, bez dodatkowych opłat za długi kontekst w żadnym z nich.
• Modalności — tekst, obrazy, wideo, audio i PDF na wejściu; tekst na wyjściu. Oba wpisy reklamują te same pięć typów wejściowych.
• Pokrętło rozumowania — obowiązkowe w obu wersjach, pięć poziomów (minimal, low, medium, high, xhigh), domyślnie medium w obu. W żadnej wersji nie ma ustawienia, które wyłącza myślenie.
• Parametry — tools, tool_choice, structured_outputs, response_format, reasoning_effort, include_reasoning, max_tokens, temperature, top_p, top_k, repetition_penalty. Identyczne listy.
• Serwowanie — jeden dostawca, sama Meta, na obu. Żadnych hostów stron trzecich, żadnych wariantów kwantyzacji.
• Cena mieszana — Artificial Analysis wycenia oba na 0,78 USD za milion tokenów według swojej mieszanej metodologii ważenia, czego można się spodziewać po identycznych cennikach.
Jeśli liczyliście, że aktualizacja przyniesie więcej kontekstu, gwarancję długości odpowiedzi albo tańszy cache – nic z tego. To wydanie oparte na wagach i post-treningu, z cennikiem skopiowanym z poprzedniego.
Co tak naprawdę się poruszyło
Artificial Analysis jest obecnie jedynym niezależnym podmiotem, który ocenił obie wersje, i to przy najwyższym wysiłku rozumowania, więc porównanie jest miarodajne.
• Indeks inteligencji — 51 dla 1.1 (pozycja #22 z 185) do 54 dla 1.2 (pozycja #13). Dziewięć miejsc na tablicy wyników, gdzie mediana klasy wynosi 32, więc zysk daje realną pozycję, a nie tylko ułamek.
• Czas do pierwszego tokenu — od 2,90 s do 26,12 s. To jest najważniejsza regresja i nie jest marginalna.
• Prędkość generowania — od 213,5 do 165,0 tokenów na sekundę. Nadal zajmuje 16. miejsce na 185 i nadal jest opisywany przez Artificial Analysis jako „zauważalnie szybki”, ale o 23% wolniejszy niż model, który zastępuje.
• Rozwlekłość — 94 mln tokenów wyjściowych, aby przejść przez indeks, w porównaniu z 95 mln. Praktycznie bez zmian, a oba wyniki są o około 45% powyżej mediany 65 mln.
• Całkowite wydatki na ewaluację — od 548,07 do 637,85 USD. Ponieważ rozwlekłość odpowiedzi prawie się nie zmieniła, a ceny w ogóle się nie zmieniły, ten wzrost o 16% pochodzi z czegoś innego niż widoczny wynik: dłuższe wewnętrzne ślady rozumowania, więcej ponownych prób lub więcej wywołań narzędzi na zadanie.
Ten wzorzec jest spójny. Meta nie uczyniła modelu tańszym, szybszym ani większym. Sprawiła, że model dłużej rozważał przed podjęciem decyzji, a dodatkowe rozważanie objawia się jako opóźnienie, nieco wolniejsze strumieniowanie oraz rachunek wyższy o 16% za identyczną pracę. Trzy punkty indeksu — oto, co to kupiło.
Jak naprawdę zła jest latencja
Wartość 26,12 sekundy będzie cytowana bez kontekstu, więc potraktuj ją właściwie: jest mierzona przy poziomie xhigh, najdroższym z pięciu poziomów wysiłku, w zestawie testów porównawczych zaprojektowanym tak, aby był trudny. API domyślnie używa medium.
Aby poczuć, jak naprawdę wygląda domyślny tryb, Muse Spark 1.1 na OrcaRouter — obsługujący prawdziwych klientów przy dowolnym poziomie wysiłku, o jaki proszą — pokazuje p50 czasu do pierwszego tokena na poziomie 1,84 sekundy oraz p95 na poziomie 6,00 sekund w ciągu tygodnia kroczącego. To są dane produkcyjne przy produkcyjnych poziomach wysiłku, i są one o ponad rząd wielkości niższe od wartości referencyjnej. Wersja 1.2 nie ma jeszcze telemetrii produkcyjnej.

Zatem uczciwa interpretacja nie mówi: „1.2 odpowiada w 26 sekund”. Mówi ona: przy ustawieniu, w którym 1.2 zdobywa swoje trzy dodatkowe punkty, pierwszy token kosztuje cię 26 sekund, a przy tym samym ustawieniu stary model kosztował cię trzy sekundy. Jeśli działałeś już na xhigh — czyli dokładnie w konfiguracji, w której występuje zysk inteligencji — to jest liczba, którą dziedziczysz. Jeśli działasz na medium lub niżej, zobaczysz coś znacznie krótszego, a także zobaczysz mniej tej poprawy.
To sprzężenie jest prawdziwą pułapką w tym ulepszeniu. Nie możesz uzyskać inteligencji bez namysłu, ponieważ to właśnie z namysłu pochodzi inteligencja.
Repozycjonowanie kryjące się za liczbami
Meta nie opublikowała postu o premierze 1.2 — strona z ogłoszeniem Muse Spark nadal opisuje 1.1 — ale przepisała opis produktu, a przepisana wersja wyjaśnia ten kompromis.
Muse Spark 1.1 był sprzedawany jako multimodalny model rozumowania z niezwykle szerokim zakresem danych wejściowych, przeznaczony do „agentów multimodalnych, dogłębnych badań nad mieszanymi mediami i analizy długiego kontekstu”: długich raportów, bibliotek mediów, nagrań oraz wideo obok tekstu.
Opis Muse Spark 1.2 pomija prawie wszystko to i zamiast tego wymienia inżynierię oprogramowania — refaktoryzacje wielu plików, rozszerzone sesje debugowania, generowanie całego repozytorium — po czym dodaje wyraźną deklarację dotyczącą wielu agentów: model może działać jako główny agent, który gromadzi kontekst, planuje i deleguje, lub jako subagent wykonujący zadania równolegle pod nim. Twierdzi również, że buforowanie promptów może obniżyć efektywny koszt o 60–80%, w zależności od tego, ile kontekstu powtarza się między wywołaniami. Ta ostatnia liczba to szacunek Meta, a nie zmierzony wynik, choć stawka buforowania wynosząca $0.15 czyni ją arytmetycznie wiarygodną.
Przeczytaj regresję opóźnień w kontekście tego przestawienia, a przestanie to wyglądać na błąd. Nikt, kto refaktoryzuje kilkanaście plików, nie przejmuje się 26 sekundami planowania. Meta wybrała klienta, i to nie tego, któremu sprzedano 1.1.
Co 1.1 nadal ma, czego 1.2 nie ma.
Cztery tygodnie istnienia to za mało, aby zgromadzić historię osiągnięć, a na trzy konkretne sposoby starszy model jest obecnie produktem z lepszą dokumentacją.
• Rekord areny. Muse Spark 1.1 ma obszerną historię w Design Arena: 1334 Elo na 5. miejscu w tworzeniu gier, 1334 na 7. miejscu w komponentach UI, 1320 na 3. miejscu w sztuce ASCII, 1318 w wizualizacji danych, 1309 w ogólnych kategoriach kodu, a także pełną drabinkę agents-arena obejmującą aplikacje webowe, slajdy HTML i tworzenie gier w Godocie. Muse Spark 1.2 nie ma żadnych wpisów. Na osi, którą Meta obecnie najmocniej promuje w marketingu, brak jest jakichkolwiek danych porównawczych dla nowego modelu.
• Wyniki subindeksów. Artificial Analysis publikuje indeks kodowania wynoszący 71,3 oraz indeks agentowy wynoszący 37,5 dla wersji 1.1. Nie ma opublikowanego odpowiednika dla wersji 1.2. Ponieważ wynik agentowy był zdecydowanie najsłabszym wymiarem wersji 1.1, a zdolności agentowe są dokładnie tym, co wersja 1.2 twierdzi, że poprawia, to właśnie ta liczba rozstrzygnęłaby kwestię aktualizacji — a ona jeszcze nie istnieje.
• Telemetria produkcyjna. Wersja 1.1 ma za sobą tydzień rzeczywistych opóźnień p50 i p95 oraz 4,4 mln tokenów ruchu na żywo na OrcaRouter. Wersja 1.2 nie ma ani jednego; jej punkt końcowy obecnie nie raportuje żadnych statystyk opóźnień ani przepustowości, ponieważ wolumen jest zbyt niski do próbkowania.
• Gdzieś, gdzie można to wypożyczyć poza Meta. Muse Spark 1.1 jest w katalogu OrcaRouter w cenie $1.25 i $4.25 — cena listowa Meta, przekazana z 0% narzutu. Muse Spark 1.2 nie jest tam jeszcze, więc obecnie jest to bezpośrednia integracja z Meta z jednym dostawcą i bez ścieżki awaryjnej.

Nie oznacza to, że 1.2 jest gorsze. Oznacza to, że dowody dla 1.2 składają się z jednego wyniku zbiorczego od jednego ewaluatora, podczas gdy dowody dla 1.1 to miesiąc aren, podindeksów i ruchu na żywo. Ta asymetria powinna wpływać na to, jak przeprowadzisz migrację, a nie na to, czy w ogóle ją podejmiesz.
Lista kontrolna migracji, która naprawdę jest krótka
Ponieważ karta stawek i powierzchnia parametrów są identyczne, zamiana jest zmianą stringu modelu. Praca polega na zweryfikowaniu trzech rzeczy, które się przesunęły.
• Zmierz własny czas do pierwszego tokena przy swoim ustawieniu effort. Nie przyjmuj ani wartości 2.90s, ani 26.12s. Uruchom swoje rzeczywiste prompty z takim reasoning_effort, jakie faktycznie przekazujesz, i porównaj bezpośrednio. To jedyna liczba, która może całkowicie zabić migrację.
• Sprawdź swoją konfigurację limitu czasu i przesyłania strumieniowego. 9-krotny wzrost opóźnienia pierwszego tokena przy wysokim nakładzie pracy przekroczy limity czasu klienta dostrojone pod wersję 1.1 i sprawi, że każda integracja bez przesyłania strumieniowego będzie wyglądać jak zawieszenie.
• Przelicz koszt na podstawie zmierzonej liczby tokenów, a nie z cennika. Ceny są identyczne, więc każda zmiana kosztu ma charakter behawioralny. Artificial Analysis odnotowało 16% wyższe wydatki przy tej samej pracy; czy u Ciebie tak będzie, zależy od miksu zadań.
• Zweryfikuj najpierw stabilność klucza pamięci podręcznej. Przy stabilnym prefiksie 60 000 tokenów typowy krok agenta spada z około 8,8 centa do około 2,2 centa w obu wersjach. Ten 75% spadek jest większy niż cokolwiek, co robi zmiana wersji, i jest całkowicie pod twoją kontrolą.
• Ponownie przetestuj ścieżki audio i wideo wprost.Oba wpisy reklamują te same pięć modalności wejściowych, ale karta specyfikacji Artificial Analysis dla 1.2 odnotowuje tylko tekst i obraz jako ocenione. Meta przepisała przekaz, odchodząc od pracy nad mediami mieszanymi. Nikt niezależny nie sprawdził, czy ta zdolność się utrzymała.
• Zachowaj wersję 1.1 dostępną jako rozwiązanie zapasowe. Uruchomienie obu za jednym kluczem oznacza, że wycofanie to zmiana konfiguracji, a nie incydent, i pozwala przetestować obie wersje metodą A/B na ruchu produkcyjnym zamiast spierać się o benchmark.
Kto działa teraz, a kto czeka
Przejdź teraz, jeśli uruchamiasz agenty kodujące o długim horyzoncie działania przy wysokim nakładzie rozumowania. Zadania i tak zajmują minuty, kara za opóźnienie znika w tym czasie, przyrost inteligencji jest mierzony przez stronę trzecią, a nie deklarowany przez Metę, a trzy punkty indeksu to znaczący skok na tym poziomie — dziewięć pozycji w rankingu 185 modeli.
Czekaj jeśli cokolwiek, co serwujesz, jest interaktywne. Nie ma konfiguracji, w której 1.2 byłby bardziej responsywny niż 1.1, a obowiązkowe rozumowanie oznacza, że nie możesz odzyskać responsywności, wyłączając myślenie. Wersja 1.1 pozostaje szybszym modelem na każdym poziomie wysiłku i kosztuje dokładnie tyle samo.
Poczekaj jeśli twoje zadanie to analiza mieszanych mediów — przypadek użycia długich raportów, wideo i audio, dla którego 1.1 został wprost zbudowany i reklamowany. Meta przestała go reklamować, a jedyna niezależna ocena 1.2 obejmuje tekst i obrazy. Ta funkcja może być nadal nienaruszona; po prostu nie ma dowodów ani za, ani przeciw, a 1.1 ma miesiąc dowodów.
Poczekaj, jeśli potrzebujesz danych z areny. Model sprzedawany pod hasłem generowania całego repozytorium, bez żadnych wpisów w Design Arenie i bez opublikowanego podindeksu agentowego, prosi cię, żebyś uwierzył Meta na słowo w kwestii tego, co zmieniła. Odczekaj trzy albo cztery tygodnie, a to przestanie być prawdą — wtedy tę decyzję będzie znacznie łatwiej podjąć na podstawie dowodów, a nie pojedynczej zbiorczej liczby.
Porównane w tym artykule1
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
