
Fugu Max vs Grok 4.6: Identyczne cenniki, jeden opublikowany wynik
- deepseekNOWOŚĆDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiNOWOŚĆOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleNOWOŚĆGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenNOWOŚĆQwen: Qwen3.8 Max (0902)2026-09-0240Inteligencja72Kod
- anthropicNOWOŚĆAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 za 1 mln tokenów
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0340Inteligencja72Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligencja78Kod
- googleGoogle: Gemini 3.6 Flash2026-07-2134Inteligencja69Kod
Fugu Max i Grok 4.6 kosztują dokładnie tyle samo. Sakana AI wydała Fugu Max 11 września 2026 r. w cenie 2,00 USD za milion tokenów wejściowych i 6,00 USD za milion tokenów wyjściowych — i to jest dokładnie ten sam cennik, jaki SpaceXAI stosuje dla Grok 4.6 od czasu jego premiery 12 sierpnia. Ten zbieg okoliczności jest najużyteczniejszym faktem w tym porównaniu, ponieważ usuwa cenę z równania. Gdy dwa produkty rozliczają się identycznie, pozostaje tylko pytanie, co dostajemy za te pieniądze, i tutaj drogi obu produktów całkowicie się rozchodzą. Grok 4.6 to pojedynczy model, który można przypiąć do wersji, sprawdzić w tabeli benchmarków i zweryfikować względem niezależnego indeksu. Fugu Max to wytrenowany koordynator, który kieruje każde zadanie do najtańszego modelu w swojej puli, a ogłoszenie Sakany twierdzi, że uzyskuje najlepszy ogólny wynik w sześciu benchmarkach, nie podając przy tym żadnej liczby z żadnego z nich. Jeden z tych zakupów da się zmierzyć, zanim go dokonasz. Drugiego nie.
Dwa produkty, jedna karta stawek
• Dane wejściowe — Fugu Max 2,00 USD za 1 mln tokenów vs Grok 4.6 2,00 USD za 1 mln tokenów
• Wyjście — Fugu Max 6,00 USD za 1 mln tokenów vs Grok 4.6 6,00 USD za 1 mln tokenów
• Dane wejściowe z pamięci podręcznej — Fugu Max $0.25 za 1 mln tokenów vs Grok 4.6 $0.50 za 1 mln tokenów, jedyny wiersz, w którym te dwie ceny w ogóle się różnią
• Okno kontekstu — Fugu Max niepublikowane przez dostawcę vs Grok 4.6 500 000 tokenów, bez zmian względem Grok 4.5
• Zmiana cen długich promptów — Fugu Max: w komunikacie nie podano żadnego progu, podczas gdy Grok 4.6 podwaja stawkę do $4.00 / $12.00, gdy pojedyncze żądanie przekroczy 200 000 tokenów; opłata dotyczy całego żądania, a nie tylko nadwyżki
• Kontrola rozumowania — nieudostępniona w Fugu Max w przeciwieństwie do Grok 4.6 z czterema poziomami wysiłku, od low do xhigh, domyślnie high i bez możliwości wyłączenia
• Architektura — Fugu Max to wytrenowany koordynator nieujawnionej puli, która obejmuje modele z otwartymi wagami i modele specjalistyczne, rozszerzony dla Max o rodzinę NVIDIA Nemotron dzięki współpracy z NVIDIA, w przeciwieństwie do Grok 4.6, jednego modelu w jednej wersji
• Niezależna ocena — Fugu Max: nie opublikowano żadnej, a dla żadnego modelu Fugu nie istnieje strona Artificial Analysis; natomiast Grok 4.6 ma aktualny Artificial Analysis Intelligence Index wynoszący 44 i zajmuje #20 z 200.
Tania kolumna to ta nieprognozowalna.
Spójrz, gdzie Fugu Max faktycznie wygrywa na cenie: odczyt z pamięci podręcznej, o połowę tańszy niż w Grok 4.6. To realna przewaga i dokładnie złe miejsce na budowanie modelu kosztów, ponieważ ceny pamięci podręcznej zwracają się tylko proporcjonalnie do wskaźnika trafień pamięci podręcznej — a Sakana nie publikuje go dla Fugu Max. W informacji o wydaniu nie podano też okna kontekstu ani poziomu długiego kontekstu, ani górnego limitu wyjścia. Tak więc jedyna kolumna, w której Fugu Max jest tańszy od Grok 4.6, to zniżka o nieznanej wielkości zastosowana do nieznanej części twoich tokenów.
Słabości modelu Grok 4.6 są przynajmniej widoczne. Jego próg 200 000 tokenów jest agresywny — powoduje ponowną wycenę całego żądania, więc prompt o długości 250 000 tokenów jest rozliczany po podwójnej stawce od pierwszego tokenu, a nie od 200 001. Ale widzisz ten klif, możesz zmierzyć względem niego swoje prompty i zdecydować, czy dzielić je na fragmenty. Na tym polega tu różnica jakościowa: jeden system publikuje cennik, którego kształt pozwala planować, a drugi publikuje stawkę nagłówkową bez dołączonego harmonogramu.
Sześć zwycięstw i ani jednego punktu
Benchmarki, które wymienia Sakana, to Terminal Bench 2.1, GPQAD, AA-LCR, GDP.pdf, AutomationBench i SWEFish. Pięć z nich to uznane publiczne ewaluacje. Szósty, SWEFish, to własny benchmark kodowania Sakany, co oznacza, że jedno z sześciu deklarowanych zwycięstw zostało ocenione w teście napisanym przez dostawcę i nieudostępnionym. W przypadku pozostałych pięciu publikacja mówi, że Fugu Max osiąga najlepszy ogólny wynik, i na tym poprzestaje — bez wyniku, bez marginesu, bez liczby konkurenta, obok której można by go postawić.
Zestaw to z tabelą opublikowaną przez SpaceXAI dla Grok 4.6, która w całości opiera się na danych dostawcy, ale przynajmniej jest tabelą: GDPVal-AA v2 na poziomie 1 753, AA-Briefcase na poziomie 1 577, DeepSWE v1.1 na poziomie 65,9%, CursorBench v3.2 na poziomie 69,9% i GPQA Diamond na poziomie 94,9%. Materiały premierowe podają również około 53 tur i około pół miliarda tokenów wejściowych potrzebnych do rozwiązania zadań długoterminowych w AA-Briefcase, w porównaniu z około 103 turami i dwoma miliardami tokenów w przypadku konkurencyjnego modelu frontier — argument, ponownie oparty na danych dostawcy, że Grok jest tani w przeliczeniu na ukończone zadanie, nawet przy umiarkowanej stawce za token.
Dwie z tych liczb dotyczących Groka wymagają odpowiedniego potraktowania, zanim je przytoczysz. Pierwsza to fakt, że jego główny wynik GPQA Diamond na poziomie 94,9% pochodzi z benchmarku, który został od tego czasu wycofany przez Artificial Analysis jako nasycony, więc nie oddziela już modeli frontier tak, jak kiedyś. Druga to liczba, którą zobaczysz w starszych materiałach: wskaźnik Artificial Analysis Intelligence Index wynoszący 61 dla Grok 4.6. To była skala sprzed korekty. Artificial Analysis ponownie skalibrowała ten wskaźnik we wrześniu 2026 r., a aktualna wartość to 44 na 20. miejscu spośród 200, przy koszcie 1,86 USD za zadanie Intelligence Index. Każdy, kto zestawia w rankingu Grok 4.6 z Claude Fable 5 lub GPT-5.6 Sol na podstawie 61, porównuje odczyty z dwóch różnych przyrządów.

Czego nie obejmuje cena tokena orkiestratora
Własny materiał Sakany na temat premiery przyznaje, że problem ma charakter strukturalny. Ponieważ Fugu Max przełącza się między modelami w ramach jednego zadania, „może zmniejszać ponowne wykorzystanie pamięci podręcznej kontekstu, a także generować dodatkowe tokeny orkiestracji” — a firma nie ujawniła wynikowego wskaźnika trafień pamięci podręcznej ani całkowitego kosztu tokenów na zadanie. Każdy agent tworzony przez koordynatora zapisuje tekst rozumowania i tekst wyjściowy, a wszystko to jest rozliczane według stawki 6,00 USD za milion. Stawka jest identyczna jak w Grok 4.6. Wolumen już nie, a wolumen to zmienna, której strona z cennikiem nie może pokazać.
Obaj dostawcy popychają cię ku tej samej korekcie — przestań porównywać stawki, zacznij porównywać koszt przypadający na ukończone zadanie — ale tylko jeden z nich podaje ci liczbę, od której możesz zacząć. Grok 4.6 pojawia się z opublikowanym profilem tur i tokenów. Fugu Max pojawia się z instrukcją, byś zmierzył go samodzielnie.
Istnieje uczciwa interpretacja milczenia Fugu Max i zasługuje na przedstawienie. Max to zoptymalizowany kosztowo poziom linii Fugu, wydany tego samego dnia co Fugu Ultra v2, który jest skokiem możliwości w cenie 5,00 USD za wejście i 30,00 USD za wyjście. Wizualnym argumentem Sakany za Maxem jest wykres Pareto — możliwości względem kosztu — a na wykresie Pareto surowy wynik benchmarku nie ma znaczenia; wynik na dolara to cała teza. Jeśli taki jest argument, podanie sześciu zwycięskich wyników bez ich kosztów byłoby wykresem wprowadzającym w błąd, a nie brakującym. To, co wydanie wciąż jest winne kupującemu, to mianownik — a tego nie zapewnia.
Gdzie Grok 4.6 jest naprawdę narażony
Najsłabszym opublikowanym obszarem modelu Grok 4.6 jest praca w terminalu. Jego wynik w Terminal-Bench v3.0 wynosi 26%, daleko za czołówką. Uważaj na sąsiednią liczbę: ten sam model osiąga 88,4% w Terminal-Bench v2.1, a to są różne testy. W omówieniach zobaczysz, że te dwa są mieszane, a takie mieszanie znacznie faworyzuje Groka.
Drugą ekspozycją jest to, że rozumowania nie można wyłączyć. Tokeny myślenia są naliczane przy każdym żądaniu, więc efektywny koszt wyjściowy Grok 4.6 zależy od tego, jak intensywnie model zdecyduje się myśleć nad twoim promptem. Suwak wysiłku daje ci kontrolę w dolnym zakresie, ale nie ma ustawienia zerowego.
W przeciwieństwie do tego Grok 4.6 ma coś, czego Fugu Max obecnie nie może zaoferować za żadną cenę: liczbę. Każdy wiersz powyżej może zostać zweryfikowany przez stronę trzecią, a wpis w Artificial Analysis oznacza, że jeden już został zweryfikowany. Sześć zwycięstw Fugu Max opublikowano tego samego dnia co model, przez firmę, która go zbudowała, a w chwili pisania nikt poza Sakana go nie uruchomił.
Wzywanie jednego, pilotowanie drugiego
Grok 4.6 jest dostępny w OrcaRouter w cenie katalogowej SpaceXAI — 2,00 USD za milion tokenów wejściowych, 0,50 USD przy trafieniu w pamięć podręczną, 6,00 USD za milion tokenów wyjściowych — przekazywana dalej z 0% marży, dzięki czemu zmiana ceny u dostawcy dociera do naszej bramy tego samego dnia, a nie zgodnie z harmonogramem migracji. Jest zgodny z OpenAI pod tym samym bazowym adresem URL co reszta katalogu, co oznacza, że możesz umieścić go w łańcuchu przełączania awaryjnego albo za warunkową regułą routingu, zamiast wpisywać dostawcę na sztywno w ścieżkę produkcyjną, a także przeprowadzić na nim test A/B względem innego modelu bez drugiej umowy. W ciągu ostatnich siedmiu dni przepuścił przez bramę 46,6 miliona tokenów.
Fugu Max nie znajduje się w naszym katalogu. Dociera do Ciebie przez własne API Sakany zgodne z OpenAI oraz kilka platform zewnętrznych, a firma twierdzi, że istniejąca integracja z Fugu aktualizuje się do niego po zmianie jednego parametru. Ponieważ oba używają tego samego formatu żądań, ocena, która stawia je za jedną flagą, jest podmianą bazowego adresu URL, a nie przepisaniem — i to jest właściwy sposób rozstrzygnięcia tego konkretnego sporu, ponieważ spór dotyczy tokenów na ukończone zadanie, a tę liczbę może wygenerować tylko Twoje własne obciążenie.

Który kupić?
Grok 4.6 to uzasadniony domyślny wybór. Przy cenniku identycznym z Fugu Max daje ci okno kontekstowe 500K, na którym możesz planować, wersję, którą możesz przypiąć, cztery poziomy kontroli rozumowania, niezależną pozycję w indeksie na 44 z podaną obok wartością kosztu na zadanie oraz miesiące niezależnych pomiarów. Jego koszty są konkretne i znane: próg zmiany ceny przy 200K, rozumowanie, które zawsze jest rozliczane, oraz profil pracy końcowej, który odstaje od konkurencji.
Fugu Max to ciekawszy zakład i, na podstawie dostępnych dowodów, ten trudniejszy do zweryfikowania. Argument za projektem jest słuszny — jeśli koordynator niezawodnie wybiera najtańszy model, który potrafi ukończyć twoje zadanie, mediana kosztu na ukończone zlecenie spada, nawet gdy twój cennik tego nie robi. Jednak przy $2.00 / $6.00 stawka za token nie jest tym, gdzie tkwi przewaga Fugu Max; ta stawka jest dokładnie taka jak w Grok 4.6. Przewaga musi wynikać ze zużycia mniejszej liczby tokenów, a Sakana nie opublikowała pomiaru, który by to wykazał.
Więc przeprowadź porównanie tak, jak proszą cię obaj dostawcy. Umieść Grok 4.6 na swojej bramie, wywołaj Fugu Max za flagą funkcji i licz tokeny wyjściowe na ukończone zadanie w pracy, która wygląda jak twoja. Jeśli Fugu Max kończy przy mniejszej liczbie tokenów niż pojedynczy model przy tej samej stawce, zniżka na cache i koordynacja to prawdziwe pieniądze, a przejście jest uzasadnione. Jeśli nie, płacisz identyczne stawki za system, którego skład może zmienić się pod tobą bez zmiany numeru wersji.
We wszystkim, co możesz zdecydować w tym kwartale bez tego pomiaru, zacznij od modelu, który ma tablicę wyników.

Porównane w tym artykule1
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
