
Muse Spark 1.2 kontra Claude Fable 5: Ile tak naprawdę kosztuje sześć punktów indeksowych
- metaNOWOŚĆMeta: Muse Spark 1.22026-08-0557Inteligencja72Kod
- qwenNOWOŚĆQwen: Qwen3.8 Max2026-08-0358Inteligencja72Kod
- deepseekNOWOŚĆDeepSeek: DeepSeek V4 Flash 07312026-07-3152Inteligencja69Kod
- qwenNOWOŚĆQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów · 197 tok/s
- orcaNOWOŚĆOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Inteligencja78Kod
- googleGoogle: Gemini 3.6 Flash2026-07-2152Inteligencja69Kod
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Inteligencja49Kod
- metaMeta: Muse Spark 1.12026-07-1653Inteligencja71Kod
- kimiMoonshotAI: Kimi K32026-07-1560Inteligencja76Kod
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Inteligencja71Kod
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Inteligencja77Kod
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Inteligencja77Kod
- grokxAI: Grok 4.52026-07-0856Inteligencja72Kod
- tencentTencent: Hy32026-07-0642Inteligencja59Kod
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Inteligencja42Kod
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Inteligencja39Kod
- anthropicAnthropic: Claude Sonnet 52026-06-3055Inteligencja72Kod
- klingKling: Kling 3.0 Turbo2026-06-1757Inteligencja52Kod57Matematyka
- z-aiZ.ai: GLM 5.22026-06-1653Inteligencja69Kod60Matematyka
Artificial Analysis publikuje coś, czego większość tabel benchmarków nie podaje: ile to kosztowało. Przeprowadzenie swojego dziewięcioczęściowego testu Intelligence Index kosztowało $637.85 na Muse Spark 1.2 i $5,630.52 na Claude Fable 5. Identyczny zestaw testów, identyczna infrastruktura, a jeden rachunek był 8,8 razy większy od drugiego. Fable 5 uzyskał 60 punktów, a Muse Spark 1.2 – 54.
Podziel różnicę, a otrzymasz liczbę, o którą tak naprawdę chodzi w tym porównaniu: przy tym obciążeniu ostatnie sześć punktów inteligencji kosztuje mniej więcej $832 za punkt. To, czy powinieneś za to zapłacić, nie jest pytaniem o benchmark. To pytanie o to, jaka część Twojego ruchu faktycznie potrzebuje tych punktów, a odpowiedź dla większości zespołów to niewielki i identyfikowalny ułamek.
Marginalny punkt indeksowy ma swoją cenę, i jest ona wysoka.
Obie liczby pochodzą od tego samego niezależnego ewaluatora uruchamiającego ten sam zestaw — GDPval-AA v2, τ³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience i AA-LCR. Żadne z nich nie jest twierdzeniem producenta. Fable 5 zajmuje miejsce #3 z 185 modeli; Muse Spark 1.2 — miejsce #13, przy medianie klasy wynoszącej 32. Oba są znacznie powyżej średniej; tylko jeden znajduje się na granicy.

Ceny katalogowe wyjaśniają większość różnicy i zaniżają resztę:
• Wejście — Muse Spark 1.2 1,25 USD za milion, Claude Fable 5 10,00 USD. Osiem razy.
• Wynik — 4,25 USD wobec 50,00 USD. Prawie dwanaście razy.
• Dane wejściowe z pamięci podręcznej — 0,15 USD w porównaniu z 1,00 USD. To mniej więcej siedem razy więcej, a Fable 5 dodatkowo pobiera 12,50 USD za milion zapisów do pamięci podręcznej lub 20,00 USD za godzinny TTL, podczas gdy Muse Spark 1.2 nie publikuje żadnej oddzielnej opłaty za zapis do pamięci podręcznej.
• Stawka mieszana — Artificial Analysis wycenia Muse Spark 1.2 na 0,78 USD za milion tokenów, a Fable 5 na 7,70 USD. To niecałe dziesięć razy więcej.
Fable 5 był najdroższym modelem, jaki Artificial Analysis kiedykolwiek testował, gdy zadebiutował, i nadal dzierży ten tytuł. Warto być precyzyjnym co do tego, dlaczego: model spalił mniej tokenów wyjściowych niż Muse Spark 1.2 podczas przechodzenia przez indeks — 87M wobec 95M — więc cała różnica w koszcie to stawka, a nie gadatliwość. Fable 5 nie jest rozrzutny. Jest po prostu wyceniony jak produkt z najwyższej półki.
W przeliczeniu na krok agenta czytającego 60 000 tokenów kontekstu repozytorium i zapisującego 3 000 tokenów poprawki: około 8,8 centa na Muse Spark 1.2, około 75 centów na Claude Fable 5. Tysiąc kroków dziennie to 88 dolarów wobec 750 dolarów. W ciągu roku 32 000 dolarów wobec 274 000 dolarów.
Gdzie Claude Fable 5 nie może zostać zastąpiony
Argument kosztowy byłby jednostronny, gdyby sześć punktów stanowiło całą różnicę. Jednak tak nie jest, a przepaść powiększa się dokładnie tam, gdzie Meta zmieniła pozycjonowanie Muse Spark 1.2, by konkurować.
Fable 5 zajmuje pierwsze miejsce w szerokim przekroju rankingów bezpośrednich Design Arena: 1399 Elo i 1. miejsce w tworzeniu gier, 1367 i 1. miejsce w ASCII art, 1353 i 1. miejsce w generowaniu SVG, a także 1. miejsce w arenie agentów dla tworzenia gier w Godocie (1344), Androida natywnego (1318), agentowego tworzenia gier (1300) i slajdów HTML (1260), z drugim miejscem w aplikacjach webowych i pracy full-stack. Muse Spark 1.2 nie ma żadnych wpisów w Design Arena — jego poprzednik zgromadził przyzwoity dorobek w środku tabeli (1334 w tworzeniu gier na 5. miejscu, 1309 w ogólnych kategoriach kodu na 9. miejscu), ale nowa wersja nie została ani razu oceniona.
Wskaźniki dla poszczególnych wymiarów wskazują ten sam kierunek. Artificial Analysis ocenia Claude Fable 5 na 76,5 w indeksie kodowania i 52,8 w indeksie agentowym. Muse Spark 1.1 uzyskał 71,3 i 37,5 — pięć punktów mniej w kodowaniu i piętnaście mniej w pracy agentowej. Dla wersji 1.2 nie opublikowano jeszcze danych dla poszczególnych wymiarów, więc uczciwe stwierdzenie brzmi: wiemy, że wynik złożony zmniejszył dystans o trzy punkty, ale nie wiemy, ile z tego przypadło na oś agentową.

Pozycjonowanie produktu Fable 5 twierdzi, że przewaga rośnie wraz z długością i złożonością zadania. Jest to deklaracja producenta, niezweryfikowana w tej formie, ale spójna z kształtem niezależnych danych: największe przewagi Fable 5 występują w obszarze agentów, gdzie model musi utrzymać plan w całości przez wiele tur, a nie w generacji jednorazowej.
Gdzie Muse Spark 1.2 jest po prostu właściwą odpowiedzią
Trzy rzeczy sprawiają, że jest to właściwy wybór, niezależnie od sześciu punktów.
• Wejście audio i wideo.Lista Meta reklamuje tekst, obrazy, wideo, audio i PDF jako wejście. Claude Fable 5 akceptuje tekst, obrazy i pliki — bez audio, bez wideo. Dla każdego potoku przetwarzającego nagrania lub materiał wideo to nie jest kompromis, lecz twardy filtr. Jedno uczciwe zastrzeżenie: karta specyfikacji Artificial Analysis dla Muse Spark 1.2 odnotowuje tylko tekst i obraz jako ocenione, a więc szersza powierzchnia jest reklamowana, a nie niezależnie zweryfikowana.
• Prędkość. 165.0 tokenów na sekundę wobec 71.7. Muse Spark 1.2 strumieniuje wyniki ponad dwa razy szybciej i zajmuje #16 z 185 pod względem szybkości, przy medianie klasy wynoszącej 71 — Fable 5 znajduje się na medianie.
• Koszt przy wolumenie. Wszystko w poprzedniej sekcji.
Dodaj czwarty punkt dla każdego, czyje zapytania są naprawdę ogromne: oba modele reklamują mniej więcej milion tokenów kontekstu — 1 048 576 dla Muse Spark 1.2, 1 000 000 dla Fable 5 — ale Muse Spark 1.2 pobiera stałą stawkę za całość, podczas gdy cennik zapisu do pamięci podręcznej Fable 5 oznacza, że utrzymywanie dużego stabilnego prefiksu kosztuje prawdziwe pieniądze z góry, zanim zacznie cokolwiek oszczędzać.
Żaden z tych nie jest szybkim modelem.
To sekcja, którą pomija większość porównań bezpośrednich, i która zmienia architekturę, a nie fakturę.
Przy maksymalnym wysiłku rozumowania Artificial Analysis mierzy czas do pierwszego tokena na 26,12 sekundy dla Muse Spark 1.2 i 141,26 sekundy dla Claude Fable 5, a czas odpowiedzi end-to-end dla Fable 5 wynosi 148,24 sekundy. Żaden z nich nie powinien znajdować się przed użytkownikiem przy takich ustawieniach.
Liczby produkcyjne są znacznie łaskawsze i warto je znać. Na OrcaRouter, Claude Fable 5 pokazuje p50 czasu do pierwszego tokena wynoszące 7,04 sekundy oraz p95 — 10,00 sekund w ciągu tygodnia kroczącego — to prawdziwy ruch przy dowolnym poziomie wysiłku, o jaki proszą wywołujący, a nie benchmark przy maksymalnym obciążeniu. Muse Spark 1.1 dla porównania osiąga p50 równe 1,84 sekundy. Muse Spark 1.2 nie ma jeszcze telemetrii produkcyjnej.

Strukturalnie rzecz ujmując: oba modele mają obowiązkowe rozumowanie. Suwak wysiłku w Fable 5 ma zakres od niskiego do maksymalnego, a domyślnie ustawiony jest na wysoki; w Muse Spark 1.2 od minimalnego do xhigh, a domyślnie na średni. Żaden z nich nie pozwala wyłączyć myślenia. Jeśli potrzebujesz odpowiedzi w czasie krótszym niż sekunda, całe to porównanie to nie ta półka — do tego służy model klasy Luna lub Flash-Lite.
Dwumodelowy stos, wyceniony.
Ujmowanie tego jako wyboru, w którym zwycięzca bierze wszystko, jest błędem, ponieważ ruch nie jest jednorodny. Niemal każdy agent produkcyjny ma długi ogon rutynowych kroków — przeczytanie pliku, podsumowanie diffa, sformatowanie łatki, zdecydowanie, które narzędzie wywołać dalej — oraz krótką głowę naprawdę trudnych zadań, w przypadku których błędna odpowiedź kosztuje godzinę.
Weźmy ten sam tysiąc kroków agenta dziennie. Wszystkie na Claude Fable 5: około $750. Wszystkie na Muse Spark 1.2: około $88. Podziel 900 rutynowych na tani model, a 100 trudnych na ten drogi: około $79 plus $75, czyli $154 dziennie. To jedna piąta rachunku za samego Fable’a, przy zachowaniu możliwości z najwyższej półki na dziesiątej części wywołań, które naprawdę tego wymagają — i to mniej więcej 220 000 dolarów różnicy rocznie na jednej pętli agenta.
Powodem, dla którego warto zbudować ten podział, a nie tylko go opisać, jest to, że wcześniej wymagał on dwóch relacji z dostawcami, dwóch zestawów SDK i dwóch zestawów poświadczeń. Teraz już nie. Claude Fable 5 znajduje się w katalogu OrcaRouter w cenie 10,00 USD i 50,00 USD — cena katalogowa dostawcy, przenoszona z zerową marżą — a Muse Spark 1.1 jest tam w cenie 1,25 USD i 4,25 USD na tych samych zasadach, za tym samym punktem końcowym zgodnym z OpenAI. DSL routingu pozwala wyrazić „najpierw tani model, eskalacja przy niskiej pewności lub po nieudanym przebiegu testów” jako pojedyncze wywołanie, a nie jako kod orkiestracji, który sam utrzymujesz, a fuzja modeli pozwala wysłać naprawdę niejednoznaczne kroki do panelu modeli jednocześnie i porównać je. Sam Muse Spark 1.2 nie jest jeszcze w katalogu — Meta udostępnia go bezpośrednio jako jego jedyny dostawca — więc obecnie najbliższe temu stosowi rozwiązanie, jakie można zbudować, wykorzystuje wersję 1.1 na taniej odnodze.
Ten szczegół o pojedynczym dostawcy zasługuje na osobną pozycję w ocenie ryzyka. Claude Fable 5 ma wiele tras serwowania i automatyczne przełączanie awaryjne między nimi. Muse Spark 1.2 ma dokładnie jeden punkt końcowy, zarządzany przez Meta. Jeśli ulegnie awarii, nie ma żadnego rozwiązania zapasowego, które byłoby tym samym modelem.
Model kosztów, a nie werdykt
Użytecznym wynikiem tego porównania nie jest „który model wygrywa”. To próg, który możesz obliczyć dla własnego obciążenia.
Oszacuj, w jakim odsetku wywołań odpowiedź klasy Muse Spark 1.2 zawodzi, a odpowiedź klasy Fable 5 się sprawdza. Pomnóż to przez koszt porażki — minuty inżyniera, nieudany merge, pętlę ponawiania, utratę klienta. Porównaj to z 66 centami za krok, czyli tyle, ile kosztuje ulepszenie pojedynczego wywołania z Muse Spark 1.2 do Claude Fable 5 w powyższym przykładzie 60K-in / 3K-out. Jeśli oczekiwana strata wynikająca z błędnej odpowiedzi przekracza 66 centów, kieruj ten krok do Fable 5. Jeśli nie — nie rób tego.
Dla większości zespołów ta kalkulacja umieszcza Fable 5 po stronie przeglądu kodu, generowania końcowych łatek, planowania architektury i wszystkiego, co dotyka danych produkcyjnych, a Muse Spark 1.2 po stronie wszystkiego innego — czytania plików, streszczania, triażu testów, wyboru narzędzi, środkowej części pętli agenta o dużej objętości, gdzie koszt jest realny, ale stawka za pojedyncze wywołanie już nie.
Jedna rzecz, którą warto śledzić: drabinki Design Arena oraz indeksy dla poszczególnych wymiarów Muse Spark 1.2, z których żadne jeszcze nie istnieją. Najmocniejszy dowód Fable 5 leży właśnie w bezpośrednich starciach na arenach, gdzie nowy model Meta nie ma żadnych wyników. Gdy te wyniki się pojawią, ten próg się przesunie — być może o wiele.
Porównane w tym artykule2
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
