
Recenzja Meta Muse Spark 1.1: Nadal najszybszy, już nie najtańszy
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 984 tok/s
- openaiNOWOŚĆOpenAI: GPT-6 Luna2026-09-2237Inteligencja
- openaiNOWOŚĆOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- grokNOWOŚĆGrok 4.72026-09-2146Inteligencja
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów · 195 tok/s
- orcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 za 1 mln tokenów
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
Przez cztery tygodnie argument za Meta Muse Spark 1.1 opierał się na arytmetyce. 1,25 dolara za milion tokenów na wejściu, 4,25 na wyjściu, za natywnie multimodalny model, który obsługiwał narzędzia lepiej niż niemal wszystko w zbliżonej cenie. Następnie 5 sierpnia 2026 roku Meta wypuściła Muse Spark 1.2 wraz z Muse Code — swoim pierwszym terminalowym agentem do kodowania — i dołączyła do nowego modelu coś, czego 1.1 nigdy nie dostał: warstwę dla kontrybutorów w cenie 0,10 dolara na wejściu i 0,20 na wyjściu. Dwanaście razy taniej na wejściu, dwadzieścia jeden razy taniej na wyjściu, w zamian za pozwolenie Meta na trenowanie na twoich promptach. Cena Muse Spark 1.1 nie zmieniła się ani o cent. Jego pozycja — owszem.
Oto uczciwe ramy oceny tego modelu w obecnej chwili. Muse Spark 1.1 nie został wycofany, nie zmieniono jego ceny i nadal pozostaje szybszym i lepiej udokumentowanym z dwóch punktów kontrolnych rozumowania Meta — ale nie jest już najtańszym sposobem wynajęcia modelu Meta, a agent, którego Meta najmocniej promuje, na nim nie działa. Ta recenzja omawia, czym jest 1.1, w czym jest mierzalnie dobry, co zmieniła sierpniowa premiera oraz węższy zestaw zadań, w których wciąż jest właściwym wyborem. Tam, gdzie liczba pochodzi z własnych ewaluacji Meta, jest to powiedziane wprost; tam, gdzie pochodzi z Artificial Analysis lub z ruchu produkcyjnego — również.
Szybki werdykt
• Co to jest — natywnie multimodalny model rozumowania (tekst, obraz, wideo, PDF i audio na wejściu, tekst na wyjściu) z konfigurowalnym poziomem rozumowania, stworzony do uruchamiania narzędzi i obsługi komputera. Zamknięte wagi, serwowany przez Meta.
• Cena — $1.25 za wejście / $4.25 za wyjście na milion tokenów, $0.15 przy trafieniu w pamięć podręczną. Niezmieniona od premiery i nadal stanowi mniej więcej ćwierć ceny wyjściowej GPT-5.6 Sol ($5/$30) oraz jedną szóstą ceny Claude Opus 4.8 ($5/$25).
• Inteligencja — 51 w indeksie inteligencji Artificial Analysis, pozycja #22 z 185 w swojej klasie przy medianie klasy wynoszącej 32. Niezależny pomiar, a nie deklaracja Meta.
• Siła — korzystanie z narzędzi i rozumowanie agentowe, a do tego prawdziwa szybkość: 213,5 tokenów wyjściowych na sekundę, co według Artificial Analysis plasuje ją na 2. miejscu spośród 185.
• Słabość — czyste rozumowanie i surowe kodowanie są w środku stawki, przywoływanie długiego kontekstu nie jest czołowe, a do tego jest rozwlekły: 94M tokenów wyjściowych do ukończenia Intelligence Index wobec mediany 65M.
• Nowe zastrzeżenie — Muse Spark 1.2 uzyskuje teraz o trzy punkty więcej i, w planie dla współtwórców, kosztuje jedną dwudziestą poprzedniej ceny. Pozostałą przewagą wersji 1.1 jest opóźnienie, i to duże.
Co Meta wypuściła 5 sierpnia — i co to zrobiło z 1.1
Muse Code to terminalowy agent kodowania, obecnie w fazie beta, który instaluje się za pomocą jednowierszowego skryptu powłoki na macOS i Linux (bez wersji na Windows) i uruchamia się jako muse (binarny plik). Podejmuje się pełnych zadań inżynierii oprogramowania w dużych repozytoriach: planowanie zmiany, pisanie kodu, weryfikacja wyniku. Argument Meta to architektoniczna spójność — agent i model trenowano razem, a nie łączono na siłę — a lista funkcji celuje wprost w Claude Code i Codex: agenci działający w tle, którzy kontynuują pracę po zamknięciu terminala, wznawianie z dziennika zdarzeń, równoległe drzewa robocze pod-agentów oraz piaskownica systemowa z zatwierdzeniami domyślnie włączonymi. Demo opublikowane przez Meta to pętla optymalizacji jąder GPU wykonująca ponad 1000 wywołań narzędzi przez nawet 24 godziny na sprzęcie NVIDIA Hopper.
Muse Code korzysta z Muse Spark 1.2, a nie 1.1. To pierwsza praktyczna konsekwencja dla każdego, kto czyta tę recenzję: jeśli chcesz agenta Meta, jesteś na nowym punkcie kontrolnym.
Druga konsekwencja dotyczy cen i jest bardziej interesująca. Meta wydała wersję 1.2 z dwoma odrębnymi identyfikatorami modeli zamiast jednego:
• Standard (muse-spark-1.2) — 1,25 USD za wejście, 0,15 USD za wejście z pamięci podręcznej, 4,25 USD za wyjście na milion tokenów. Identyczny z Muse Spark 1.1. Meta zobowiązuje się, że monity i uzupełnienia w tej warstwie nie są wykorzystywane do ulepszania jej produktów.
• Contributor (muse-spark-1.2-contributor) — $0.10 za wejście, $0.002 za wejście z pamięci podręcznej, $0.20 za wyjście. W zamian udzielasz Meta pozwolenia na trenowanie przyszłych modeli na Twoich promptach i odpowiedziach.
• Muse Spark 1.1 — nie istnieje poziom dla kontrybutorów. Pozostaje przy standardowej cenie, a Meta nie ogłosiła jego wycofania.
Meta sama określa poziom dla kontrybutorów jako {{1}}ponad 10 razy tańszy niż nawet poziom pay-as-you-go{{/1}}, co jest niedopowiedzeniem: rzeczywiste wielokrotności to 12,5× na wejściu i 21,25× na wyjściu, z buforowanym wejściem po niemal darmowych 0,002 USD. To właśnie ten nagłówek o {{2}}niskiej cenie{{/2}} został wygenerowany przez premierę i należy wyłącznie do 1.2.

Historia ceny, napisana na nowo
Zanim przebudujesz swój budżet wokół 0,20 USD za tokeny wyjściowe, przeczytaj pozostałe warunki warstwy kontrybutorskiej, bo to one sprawiają, że jest tania. Limity liczby żądań spadają z udokumentowanych 3000 żądań na minutę w warstwie standardowej do 60 w warstwie kontrybutorskiej — limit, który pozwala programiście eksperymentować na laptopie, a zabrania flocie agentów produkcyjnych. A wymiana danych nie jest formalnością: twoje prompty i odpowiedzi modelu stają się materiałem treningowym. Dla każdego, kto przetwarza dane klientów, zastrzeżony kod źródłowy lub cokolwiek objęte obowiązkiem poufności, warstwa kontrybutorska nie jest tańszą wersją tego samego produktu; to inny produkt. Meta przyznała to zresztą podczas tej samej premiery, dodając opcję zerowego przechowywania danych dla klientów korporacyjnych na płatnej ścieżce.
Zatem uczciwe porównanie to nie „1.1 za 4,25 USD versus 1.2 za 0,20 USD”. Jest tak: przy standardowych cenach oba modele kosztują dokładnie tyle samo, a 1.2 ma lepszy wynik. Próg 0,20 USD to prawdziwa i agresywna oferta, ale jest skierowana do indywidualnych użytkowników i eksperymentów i jest dostępna tylko w nowszym modelu.
To, co naprawdę kształtuje rachunek w obu modelach, to cache, a nie cena z cennika. Weźmy reprezentatywny krok agenta: 60 000 tokenów kontekstu z repozytorium lub dokumentu na wejściu, 3 000 tokenów planu-i-odpowiedzi na wyjściu. Na zimno to 0,075 USD za wejście plus 0,013 USD za wyjście — czyli około 8,8 centa, albo 88 USD na tysiąc kroków. Jeśli utrzymasz stały prefiks kontekstu, trafi on do cache przy cenie 0,15 USD za milion, a koszt wejścia spadnie do 0,009 USD, co daje krok za około 2,2 centa i 22 USD za tysiąc kroków. To różnica 75%, w całości zależna od tego, czy framework agenta używa ponownie stabilnego prefiksu, czy odbudowuje prompt przy każdym kroku. Jeśli po przeczytaniu tej recenzji zdecydujesz się na jedno działanie inżynieryjne, niech będzie to stabilność klucza cache, a nie wybór modelu.
Jedna uwaga strukturalna na temat tego, gdzie to wynajmujesz. Muse Spark 1.1 znajduje się w katalogu OrcaRouter w cenie 1,25 USD i 4,25 USD, z odczytem cache za 0,15 USD — to te same stawki, które pobiera Meta, ponieważ OrcaRouter nie dolicza marży i przekazuje cenę katalogową dostawcy bez zmian, więc zmiana ceny dostawcy pojawia się tutaj tego samego dnia, w którym pojawia się u niego. Muse Spark 1.2 nie znajduje się jeszcze w katalogu i jest udostępniany bezpośrednio przez Metę. To ma znaczenie dla porównania, które prawdopodobnie zamierzasz przeprowadzić: GPT-5.6 Sol, Claude Opus 4.8, Grok 4.5 i Gemini 3.1 Pro są dostępne za pomocą jednego klucza po cenie katalogowej, więc możesz je porównać z Muse Spark 1.1 na jednym zestawie ewaluacyjnym bez drugiej umowy, a liczba w twoim arkuszu kalkulacyjnym to liczba na fakturze.
Czym tak naprawdę jest Muse Spark 1.1
Muse Spark to flagowa linia modeli rozumujących z Meta Superintelligence Labs, grupy, którą Mark Zuckerberg powołał pod kierownictwem Alexandra Wanga. Oznacza to strategiczny zwrot: podczas gdy modele Meta z serii Llama miały otwarte wagi, rodzina Muse — Spark oraz generatory obrazu i wideo — jest zamknięta i dostarczana jako produkt i API. Spark 1.0 pojawił się 8 kwietnia 2026; wersja 1.1 ukazała się 9 lipca wraz z publiczną wersją zapoznawczą Meta Model API. Praktyczna zmiana dla programistów polega na tym, że Meta jest teraz bezpośrednim dostawcą API, konkurującym z dwoma istniejącymi dostawcami API, a nie tylko wydawcą wag — a premiera agenta programistycznego 5 sierpnia jest tego jak dotąd najwyraźniejszym potwierdzeniem.
Wersja 1.1 była znaczącym krokiem naprzód, a nie zwykłą aktualizacją punktową. W Artificial Analysis zyskała osiem punktów w indeksie inteligencji w ciągu trzech miesięcy, z 43 do 51. Jej indeks kodowania wzrósł o 12 punktów do 71, wynik SciCode poprawił się do 58%, a Humanity's Last Exam wzrósł do 45%. Meta stwierdziła, że największe zyski odnotowano w korzystaniu z narzędzi, obsłudze komputera, kodowaniu i rozumieniu multimodalnym — co jest spójne z modelem dostrojonym do działania, a nie tylko odpowiadania.
Jeśli chodzi o kontekst, wcześniejsze zamieszanie już się wyjaśniło: Artificial Analysis i OrcaRouter podają okno na 1 048 576 tokenów, a Meta opisuje okno, które model aktywnie kompaktuje. Przechowywanie miliona tokenów to jednak nie to samo, co przywoływanie z nich informacji, a wynik 1.1 w wyszukiwaniu w długim kontekście wynoszący około 54.1 wskazuje, że przypominanie jest przeciętne. Traktuj okno jako pojemność, a nie gwarancję.
Wysiłek rozumowania: Natychmiast, Kontemplacja i pokrętło poniżej
Na konsumenckiej powierzchni Meta, Muse Spark udostępnia dwa nazwane tryby: Instant — natychmiastowe odpowiedzi bez rozszerzonego rozumowania, jak standardowa tura czatu; Contemplating — uruchamia wiele agentów równolegle, wykorzystując technikę „kompresji myśli” zapożyczoną z uczenia przez wzmacnianie, a Meta pozycjonuje go przeciwko DeepMind Deep Think i GPT-5.4 Pro w wymagających pracach naukowych i analitycznych. Przez API ta sama funkcja pojawia się jako konfigurowalny parametr wysiłku rozumowania — Artificial Analysis publikuje swoje wyniki przy ustawieniu xhigh modelu, najdroższym, jakie on udostępnia.
Traktuj to pokrętło jak dźwignię kosztów, a nie suwak jakości. Rozumowanie równoległych agentów pochłania znacznie więcej tokenów niż pojedyncze przejście, a liczby z benchmarków, które czytałeś, powstały przy maksymalnym wysiłku. Domyślnie ustawiaj niski poziom dla rutynowych wywołań i rezerwuj wysoki wysiłek na przypadki, w których błędna pierwsza odpowiedź jest kosztowna.
Jak wypada: mocno z narzędziami, przeciętnie bez.
Najczytelniejszym sposobem interpretacji Muse Spark 1.1 jest porównanie trybu z narzędziami i bez narzędzi. Z narzędziami prowadzi w testach agentowych: MCP Atlas 88,1 wobec 82,2 Claude Opus 4.8, JobBench 54,7 wobec 48,4, Legal Agent Bench 20,0 wobec 12,9 Grok 4.5, a Humanity's Last Exam z narzędziami 62,1 wobec 57,9. Bez narzędzi jest zwyczajny — samo Humanity's Last Exam osiąga około 45, daleko za mniej więcej 77 Gemini 3.1 Pro w tym samym teście.
Pod względem precyzji wykonania również pozostaje w tyle za liderami: {{1}}OSWorld-Verified computer use 80.8 wobec 83.4 dla Opus 4.8{{/1}}, {{2}}SWE-Bench Pro coding 61.5 wobec 69.2{{/2}}, {{3}}DeepSWE 1.1 long-horizon coding 53.3 wobec 67.0 dla GPT-5.5{{/3}} oraz {{4}}BabyVision visual reasoning 76.3 wobec 83.6{{/4}}. {{5}}Wiele z tych wartości pochodzi od dostawców, część z własnych ewaluacji Meta, a uzyskano je na różnych platformach testowych — traktuj je jako orientacyjne i przetestuj ponownie na własnych zadaniach.{{/5}}

Niezależny obraz z Artificial Analysis jest bardziej zwięzły i bardziej przydatny. Intelligence Index 51, pozycja #22 na 185, przy medianie klasy wynoszącej 32. Prędkość 213,5 tokenów wyjściowych na sekundę, pozycja #2 na 185 — to naprawdę szybki model. Cena: pozycja #31, cena przy trafieniu w pamięć podręczną: 0,15 USD, co daje 88% zniżki. Rozwlekłość: 94 mln tokenów wyjściowych na przejście przez indeks, przy medianie 65 mln — to właśnie stąd pochodzi znaczna część rzeczywistego rachunku. Łączny koszt oceny modelu na całym zestawie: 548,07 USD.
Jedno zastrzeżenie warte zapamiętania: Meta reklamuje obsługę tekstu, obrazu, wideo, audio i PDF, ale karta specyfikacji technicznej Artificial Analysis dla 1.1 odnotowuje tylko tekst i obraz jako przetestowane. Obie te rzeczy mogą być prawdziwe — API przyjmuje więcej niż to, co zostało przetestowane w ramach benchmarku — ale nikt spoza Meta nie opublikował wyników dla obciążenia wideo ani audio. Jeśli analiza multimediów to powód, dla którego tu jesteś, zaplanuj czas na samodzielne sprawdzenie tego.
Czy powinieneś przejść na 1.2? Odpowiedź dotycząca opóźnienia.
W kwestii kodowania Meta mówi: tak, a jej liczby są wewnętrznie spójne: Terminal-Bench 2.1 wzrósł z 76,2% do 82,9%, DeepSWE v1.1 z 53,0% do 59,3%, a jej wewnętrzny benchmark kodowania z 68,3% do 70,6%. To ewaluacje przeprowadzone przez Meta, oceniane jako pass@1 przy pięciu próbach we własnym harnessie Meta — obowiązuje tu standardowe zastrzeżenie, że modele konkurencyjne w harnessie danego dostawcy są często niedostrojone. Niezależnie, Artificial Analysis przesunął Muse Spark 1.2 na 54 punkty w Intelligence Index, co daje 13. miejsce na 185, czyli trzy punkty powyżej wersji 1.1.
{{1}}Meta zapłaciła za te punkty deliberacją, co widać w każdym pomiarze czasu.{{/1}} {{2}}Artificial Analysis mierzy czas do pierwszego tokena na 26.12 sekundy dla 1.2 wobec 2.90 sekundy dla 1.1 — oba przy najwyższym wysiłku rozumowania każdego modelu.{{/2}} {{3}}Prędkość generowania spadła z 213.5 do 165 tokenów na sekundę.{{/3}} {{4}}Rozwlekłość wzrosła nieznacznie — 95M wobec 94M tokenów — a koszt uruchomienia identycznego zestawu benchmarków wzrósł z $548.07 do $637.85 przy identycznych cenach za token.{{/4}} {{5}}Ta ostatnia liczba to najczystsze podsumowanie tego kompromisu: ten sam cennik, 16% więcej spalonych tokenów, trzy punkty indeksowe więcej.{{/5}}
Przeczytaj uważnie wykres dla 26 sekund, ponieważ łatwo go źle odczytać. Jest to pomiar benchmarku przy maksymalnym wysiłku, a API domyślnie używa ustawienia środkowego. Dla punktu odniesienia z rzeczywistym ruchem, Muse Spark 1.1 na OrcaRouter — obsługujący dowolny wysiłek, o który faktycznie proszą wywołujący — pokazuje p50 czasu do pierwszego tokenu wynoszące 1,84 sekundy i p95 wynoszące 6,00 sekundy w ciągu tygodnia ruchu produkcyjnego, przy zerowym wskaźniku błędów. Opóźnienie benchmarku przy maksymalnym wysiłku a opóźnienie produkcyjne przy domyślnym wysiłku to różne wielkości, a różnica między nimi jest zwykle większa niż rząd wielkości.
Tak więc decyzja rozstrzyga się jednoznacznie w zależności od kształtu obciążenia. Jeśli używasz długoterminowych agentów kodowania, które trzymają repozytorium w kontekście i pracują przez kilka minut, to 1.2 jest lepszym modelem, a kara za opóźnienie amortyzuje się w zadaniu, które i tak nigdy nie miało być natychmiastowe. Jeśli obsługujesz cokolwiek interaktywnego — czat, pętlę wywoływania narzędzi z czekającym człowiekiem, SLO opóźnienia mierzone w sekundach — Muse Spark 1.1 pozostaje lepiej ukształtowanym modelem w rodzinie, a jego pozycja pod względem szybkości to nie błąd zaokrąglenia. Nic w sierpniowej premierze tego nie zmienia.
Doświadczenie programisty i limity
Meta Model API pozostaje w publicznej wersji zapoznawczej, choć sierpniowe udostępnienie rozszerzyło globalny dostęp i dodało opcję zerowej retencji danych dla przedsiębiorstw. Meta udostępnia interfejs w stylu OpenAI oraz dostęp do SDK, a Spark jest już dostępny dla konsumentów w trybie „Thinking” w Meta AI. Limity żądań są teraz publikowane, a nie zgadywane — dla standardowego poziomu udokumentowano 3000 żądań na minutę — ale status wersji zapoznawczej pozostaje statusem wersji zapoznawczej, więc miej zapasową ścieżkę na dni, gdy przepustowość jest ograniczona. Automatyczne przełączanie awaryjne między dostawcami to dokładnie taka infrastruktura, za jaką przemawia punkt końcowy klasy preview, i dlatego kierowanie modelu preview przez bramę nic nie kosztuje, a daje drugą ścieżkę.

Za pośrednictwem OrcaRouter identyfikator modelu to meta/muse-spark-1.1, a zarówno /v1/chat/completions, jak i /v1/responses są dostępne, więc istniejący klient zgodny z OpenAI potrzebuje tylko adresu bazowego i nazwy modelu – niczego więcej:
import openai as openai_client
client = openai_client.Client(base_url="https://api.orcarouter.ai/v1", api_key="YOUR_API_KEY")
response = client.chat.completions.create(model="meta/muse-spark-1.1", messages=[{"role": "user", "content": "Zaplanuj i uruchom narzędzia, aby naprawić ten problem."}])
print(response.choices[0].message.content)
Gdzie pasuje — a gdzie nie
Dobre dopasowanie: automatyzacja obsługi narzędzi i komputera, gdzie czas odpowiedzi jest widoczny dla człowieka; tanie rozumowanie na dużą skalę na danych, których nie można przekazać do zbioru treningowego; przepływy pracy łączące tekst z obrazami, wideo, PDF-ami lub audio, z własną weryfikacją na ścieżce medialnej; oraz zespoły, które chcą szybkiego i taniego rozwiązania domyślnego, z modelem premium trzymanym w rezerwie na najtrudniejsze kroki.
Słabe dopasowanie: najwyższa dokładność kodowania w rankingach i najtrudniejsza inżynieria greenfield, które wciąż należą do Claude Opus 4.8 i GPT-5.6 Sol; problemy czysto rozumowe bez narzędzi; zadania wymagające precyzji wizualnej, w których prowadzi Gemini 3.1 Pro; długoterminowa praca nad repozytorium, która jest teraz wyraźnie zadaniem 1.2 i Muse Code; oraz wszystko, gdzie potrzebujesz najtańszego możliwego tokenu Meta, ponieważ ta warstwa nie istnieje w tym modelu.
Najczęściej zadawane pytania
Czy Muse Spark 1.1 jest nadal dostępny, skoro 1.2 już się ukazało?
Tak. Meta ogłosiła brak wycofania i brak zmian cen podczas premiery 5 sierpnia — wersja 1.1 pozostaje w Meta Model API w cenie 1,25 i 4,25 dolara za milion tokenów, a w katalogu OrcaRouter widnieje po tych samych cenach. Relacje z premiery konsekwentnie opisują ją jako kontynuację dotychczasowych cen API. To powiedziawszy, uwaga inżynierów Meta wyraźnie się przesunęła: agent kodujący, nowe benchmarki i tani poziom — wszystko to dotyczy wersji 1.2.
Czy mogę dostać Muse Spark 1.1 w ramach poziomu dla współtwórców za 0,10 USD?
Nie. Poziom contributor to osobny identyfikator modelu na nowszym punkcie kontrolnym, muse-spark-1.2-contributor. Nie ma odpowiednika w wersji 1.1, więc najtańsze tokeny rozumowania Meta wymagają zmiany wersji — oraz zaakceptowania limitu 60 żądań na minutę i zgody na to, aby Meta trenowała na Twoich promptach i odpowiedziach.
Czy powinienem zaktualizować do Muse Spark 1.2?
Jeśli Twoje zadania to długotrwałe kodowanie lub praca agenta na skalę repozytorium, to tak: osiąga wyższe wyniki zarówno we własnych ewaluacjach kodowania Meta, jak i w niezależnym indeksie Artificial Analysis, w tej samej standardowej cenie. Jeśli Twoje zadania są interaktywne lub wrażliwe na opóźnienia, to nie: 1.2 płaci za trzy punkty indeksu około dziewięciokrotnym czasem do pierwszego tokena i 23% prędkości generowania, a jego rozumowanie nie może być wyłączone. Oba działają w tym samym API, więc przełączenie to w obu przypadkach zmiana identyfikatora modelu — co jest najtańszym możliwym testem A/B i warto przeprowadzić go na własnym ruchu przed podjęciem decyzji.
Czy Muse Spark 1.1 jest open source?
Nie, i właśnie na tym polega sedno tej linii. W przeciwieństwie do modeli Llama od Meta, rodzina Muse ma zamknięte wagi i jest dostarczana jako produkt oraz API. Nie ma wag na Hugging Face, nie ma możliwości samodzielnego hostingu ani zewnętrznych dostawców — Meta jest jedynym podmiotem serwującym ten model, co czyni warstwę routingu z przełączaniem awaryjnym praktyczną odpowiedzią na ryzyko pojedynczego dostawcy, a nie drugiego sprzedawcę.
Werdykt, jedna wersja później
Muse Spark 1.1 to szybki, tani, prawdziwie multimodalny model agentowy, który świetnie radzi sobie z korzystaniem z narzędzi i, szczerze mówiąc, plasuje się w środku stawki w czystym kodowaniu i rozumowaniu. Nic, co zostało zmierzone, nie pogorszyło się w sierpniu. Zmienił się kształt rodziny wokół niego: Meta ma teraz model osiągający lepsze wyniki w tej samej standardowej cenie, znacznie tańszy poziom dla programistów gotowych wymienić swoje dane, oraz produkt agentowy, który nie działa ani na 1.1, ani na niczym, co można wskazać jako 1.1.
To, co pozostaje, to węższa, ale realna rekomendacja. Jeśli potrzebujesz jakości rozumowania Meta w tempie odczuwalnym dla człowieka — sekundę do pierwszego tokena w produkcji, a potem 213 tokenów na sekundę — 1.1 wciąż jest wersją, do której warto sięgnąć, a trzy punkty indeksu, które dodaje 1.2, nie są warte dziewięciokrotnego czekania. Jeśli nie potrzebujesz tej prędkości, nie ma już większego powodu, aby zostać. Tak czy inaczej to jeden ciąg modeli, więc uczciwa rada brzmi: uruchom oba na własnym zbiorze ewaluacyjnym przez jeden dzień i pozwól swojemu budżetowi opóźnień zdecydować.
Porównane w tym artykule4
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
