Karta bohatera dla starcia Fugu Ultra v2 z Grok 4.6, zestawiająca system orkiestracji z pojedynczym modelem rozumowania o dużym kontekście.
Guides & Insights

Fugu Ultra v2 vs Grok 4.6: Pięć razy wyższa cena za output, jeden wspólny benchmark

Autor

Magnus Corvin

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Istnieje dokładnie jeden benchmark, na którym Fugu Ultra v2 i Grok 4.6 oba publikują wynik liczbowy, a jest nim DeepSWE: Sakana AI podaje 74,3 dla Fugu Ultra v2 w swoim ogłoszeniu z 11 września 2026 r., podczas gdy materiał premierowy xAI dla Grok 4.6 podaje własny wynik DeepSWE v1.1 na poziomie 65,9%. To różnica 8,4 punktu i jedyne czyste porównanie, jakie oferują obie firmy. Wszystko inne, co można zestawić — Chartography i SWEFish Sakany przeciwko GPQA Diamond i CursorBench Groka — jest mierzone na różnych instrumentach przez różne laboratoria. Zatem uczciwe pytanie nie brzmi: „który jest mądrzejszy”. Brzmi ono: czy deklarowana przewaga Fugu Ultra v2 jest warta płacenia 30 dolarów za milion tokenów wyjściowych, skoro Grok 4.6 pobiera 6 dolarów.

Dwie różne odpowiedzi na ten sam problem

Grok 4.6 to pojedynczy model i obecny flagowiec linii Grok — wymieniany jako „Latest” w dokumentacji deweloperskiej samego dostawcy, następca Grok 4.5 z tym samym oknem kontekstowym 500 000 tokenów, tym samym zakresem danych wejściowych (tekst/obraz/plik) i tą samą ceną bazową. Ma punkt odcięcia wiedzy na 1 lutego 2026 r. i udostępnia wysiłek rozumowania na poziomach low, medium, high oraz xhigh, domyślnie high. Jeden szczegół, który zaskakuje ludzi: rozumowania nie można wyłączyć. Tokeny myślenia są rozliczane przy każdym żądaniu, co sprawia, że rzeczywisty koszt odpowiedzi Grok 4.6 zależy od tego, jak ciężko model zdecyduje się myśleć.

Fugu Ultra v2 nie jest w ogóle modelem w zwykłym tego słowa znaczeniu. To szczytowy poziom możliwości linii orkiestracji Sakana AI — pojedynczy endpoint zgodny z OpenAI, który rozkłada zadanie i rozdziela je pomiędzy pulę innych modeli, częściowo open-weight, częściowo wyspecjalizowanych. Sakana ujmuje to tak, że osiąga wyniki na poziomie frontier „bez nieodzownego polegania na modelach frontier, którymi orkiestruje”, i wprost stwierdza, że Claude Fable 5, Claude Fable 5.1 i GPT-6 Astra są wykluczone z tej puli. Płacisz za warstwę harmonogramowania oraz za każdy token, który spalą podagenci.

Ta różnica nie jest kosmetyczna. To cały powód, dla którego istnieje luka cenowa, i to jedyna rzecz, która sprawia, że tę lukę można obronić.

Karty stawek, w tym część, która się powtarza

Wejście — Fugu Ultra v2 5,00 USD za 1 mln vs Grok 4.6 2,00 USD za 1 mln. Fugu jest 2,5× droższy, zanim nastąpią jakiekolwiek wywołania podrzędne.

Wyjście — Fugu Ultra v2 30,00 USD za 1 mln vs Grok 4.6 6,00 USD za 1 mln. Różnica 5×, i to ta, która decyduje o większości rachunków.

Zbuforowane dane wejściowe — $0.50 za 1 mln w obu przypadkach. Identycznie. Dwaj dostawcy, którzy poza tym nie mają ze sobą nic wspólnego, przyjęli tę samą cenę odczytu z pamięci podręcznej, co sprawia, że pętle agentowe mocno oparte na pamięci podręcznej to jedyny rodzaj obciążenia, w którym oba rozwiązania można naprawdę porównać linijka po linijce.

Zmiana cen dla długiego kontekstu — Grok 4.6 podwaja stawkę do 4,00 / 12,00 USD, gdy prompt przekroczy 200 000 tokenów, a nowa cena dotyczy całego żądania, a nie tylko nadwyżki. Raportowany próg Fugu Ultra v2 powyżej około 272 000 tokenów wejściowych przechodzi na około 10,00 / 45,00 USD, również w przypadku całego żądania. Oba karzą długie prompty; Grok zaczyna karać o 72 tys. tokenów wcześniej.

Okno kontekstu — Grok 4.6 500 tys. tokenów vs Fugu Ultra v2 1 mln, zgodnie z danymi z zewnętrznych zestawień. Strona z ogłoszeniem Sakany nie podaje w ogóle żadnej liczby dotyczącej kontekstu, więc jej 1 mln należy traktować jako niepotwierdzony przez dostawcę.

Spór o długi kontekst działa w obie strony i warto zrobić na tym arytmetykę. Prompt o długości 300 tys. tokenów kosztuje 4,00 USD za milion tokenów wejściowych w Grok 4.6 i około 10,00 USD w Fugu Ultra v2. Prompt o długości 150 tys. tokenów kosztuje 2,00 USD w Grok i 5,00 USD w Fugu. Model Sakany jest droższy przy każdej długości promptu — pozostaje tylko pytanie, jak często trzeba go wywoływać.

Two-column comparison scoreboard for Fugu Ultra v2 and Grok 4.6 covering type, release date, input price ($5.00 vs $2.00 per million tokens), output price ($30.00 vs $6.00), cached input ($0.50 on both) and context window (1M reported vs 500K).

Argument za płaceniem 5× za wynik

Argument za orkiestratorem nie polega na tym, że jest tańszy w przeliczeniu na token. Polega na tym, że potrzebuje mniej prób, a tokeny, które zużywa na koordynację, są tańsze niż tokeny, które wydałbyś na niepowodzenia.

To prawdziwy argument, i Sakana formułuje go wprost: Fugu Ultra v2 jest ukierunkowany na złożoną, wieloetapową pracę — autonomiczne badania, rozwój full-stack — w której trybem awarii pojedynczego modelu jest zbaczanie z torów w połowie długiego przebiegu. Jeśli stawka 30 USD za token wyjściowy pozwala ukończyć zadanie za pierwszym podejściem zamiast za trzecim, premia za token jest nieistotna.

Istnieją dowody wspierające ze strony samego dostawcy, choć są one korzystne dla dostawcy i tak należy je odczytywać. Materiały premierowe xAI dotyczące Grok 4.6 podają około 53 tur i około 0,5 miliarda tokenów wejściowych potrzebnych do rozwiązania zadań o długim horyzoncie, w porównaniu z około 103 turami i 2,0 miliarda tokenów wejściowych w przypadku konkurencyjnego modelu frontier — co ma być argumentem, że sam Grok jest ekonomiczny na zadanie nawet przy niskiej cenie za token. Obie firmy wykonują ten sam ruch: odwodzą cię od cennika stawek i kierują w stronę kosztu na ukończone zadanie.

Co oznacza, że rozstrzygająca liczba to ta, której nie publikuje żaden z dostawców, i którą musisz zmierzyć samodzielnie: spalone tokeny, od początku do końca, na zadaniu, które wygląda podobnie do twojego.

Gdzie każdy z nich jest naprawdę słaby

Opublikowanym słabym punktem Grok 4.6 jest praca w terminalu. Jego wynik w Terminal-Bench v3.0 wynosi 26%, znacznie poniżej czołówki, mimo że ten sam model notuje dużo lepsze 88,4% w starszym Terminal-Bench v2.1 — to różne testy, a ich mieszanie to błąd, który zobaczysz w wielu omówieniach. Ma także najwyższy wynik GPQA Diamond w swojej kohorcie — 94,9% — ale GPQA Diamond został od tego czasu usunięty z indeksu Artificial Analysis jako nasycony, więc wysoki wynik tam nie odróżnia już modeli frontierowych tak, jak robił to rok temu.

W niezależnym ujęciu Artificial Analysis przyznaje Grokowi 4.6 wynik 44 w swoim Indeksie Inteligencji v4.3, co daje pozycję #20 na 200, przy koszcie na zadanie wynoszącym 1,86 USD. Często krążąca liczba 61 pochodzi z zastąpionej skali indeksu i nie należy jej cytować bez podania, która wersja ją wygenerowała.

Słabym punktem Fugu Ultra v2 jest weryfikacja. Na dzień publikacji nic, co Sakana o nim twierdzi — pięć najlepszych lub ex aequo najlepszych wyników, wynik 48,3 w Chartography w porównaniu z wynikami 27,3 Opus 5 i 29,5 Fable 5, a także wynik 74,3 w DeepSWE — nie zostało niezależnie odtworzone. Nie opublikowano również żadnej wartości opóźnienia ani przepustowości, co ma większe znaczenie w przypadku orkiestratora niż pojedynczego modelu, ponieważ jego czas odpowiedzi zależy wyłącznie od tego, co zdecyduje się wywołać. W przypadku poprzedniego Fugu Ultra testerzy publicznie raportowali przebiegi ciągnące się do około 30 minut; to model z czerwca 2026 r., a nie v2, ale właśnie ten tryb awarii należy przetestować, zanim zdecydujesz się na ścieżkę produkcyjną.

Screenshot of the Sakana AI announcement page titled 'Introducing Fugu Max and Fugu Ultra v2: Orchestrating the Pareto Frontier', dated September 11 2026, showing the cost-versus-performance frontier chart, the Two Axes One Strategy section, and the Fugu Journey timeline.

Uwaga dotycząca nazwy dostawcy

Jeden szczegół wart poznania, zanim zaczniesz szukać Grok 4.6 w konsoli deweloperskiej: model jest konsekwentnie nazywany Grok 4.6, ale branding dostawcy wokół niego wciąż się zmienia. Własna dokumentacja x​AI nosi teraz nazwę SpaceXAI — zmiana, za którą większość relacji z premiery jeszcze nie nadążyła. Identyfikatory modelu i powierzchnia API pozostały niezmienione — Grok 4.6 to pełnoprawny model Ope​nAI Responses i wpina się w istniejące pętle wywołań narzędzi bez warstwy tłumaczeniowej — ale jeśli szukasz karty modelu, a branding wygląda źle, to nie twój błąd.

Wywoływanie którejkolwiek z nich w praktyce

Grok 4.6 jest dostępny w OrcaRouter w cenie ustalonej przez dostawcę — 2,00 USD za milion tokenów wejściowych i 6,00 USD za milion tokenów wyjściowych, przekazywanej z zerowym narzutem, więc zmiana ceny przez dostawcę dociera tutaj tego samego dnia, a nie zgodnie z harmonogramem migracji. Jest zgodny z OpenAI na tym samym bazowym adresie URL co wszystko inne w katalogu, co oznacza, że możesz umieścić go w łańcuchu awaryjnym lub regule routingu zamiast zakodować go na sztywno, a także porównać go w teście A/B z innym modelem bez drugiej umowy i bez zmiany kodu.

Fugu Ultra v2 nie jest przez nas routowany. Jest dostępny we własnym API Sakana AI zgodnym z OpenAI, a firma twierdzi, że istniejąca integracja Fugu przechodzi na nie po zmianie jednego parametru. Jeśli chcesz porównać oba na swoim obciążeniu, najtańszym rozwiązaniem jest pozostawienie Grok 4.6 na swojej bramie i wywoływanie Fugu Ultra v2 bezpośrednio od Sakana za flagą funkcji — oba używają tego samego formatu żądań, więc ten sam zestaw testowy działa w obu przypadkach.

Screenshot of the OrcaRouter model page for Grok 4.6 showing the grok/grok-4.6 identifier, a 500K token context window, and pricing of $2.00 per million input tokens and $6.00 per million output tokens.

Werdykt

Grok 4.6 to racjonalny domyślny wybór dla większości zespołów i pod względem ceny nie ma nawet bliskiej konkurencji. Przy cenie 2,00 / 6,00 USD, odczycie z pamięci podręcznej za 0,50 USD i oknie 500K obsługuje rozumowanie na długich dokumentach, agentów kodujących i multimodalną pracę na plikach za jedną piątą stawki wyjściowej Fugu Ultra v2, a do tego jest niezależnie oceniany i niezależnie benchmarkowany. Jego słabości to długość promptu — próg 200K podwaja koszt całego zapytania — oraz pętle agentów intensywnie korzystających z terminala, gdzie jego publikowane wyniki nie są konkurencyjne.

Fugu Ultra v2 jest wart swojej ceny premium tylko wtedy, gdy masz określony rodzaj obciążenia: długie, wieloetapowe zadania wymagające dużej autonomii, w których pojedynczy model zwykle wypada z torów, i w których chcesz też właściwości architektonicznej, którą sprzedaje Sakana — poziomu możliwości, który nie zależy od tego, czy jakikolwiek czołowy dostawca pozostanie dostępny lub pozostanie tani. To naprawdę jest coś, czego można chcieć. Ale to twierdzenie, a jeszcze nie pomiar, a luka DeepSWE, która sprawia, że wygląda to wiarygodnie, to pojedynczy benchmark od pojedynczego dostawcy w dniu premiery.

Jeśli nie potrafisz powiedzieć, które z twoich zadań obecnie nie udaje się za drugim lub trzecim podejściem, nie masz jeszcze liczby, która uzasadniałaby różnicę w cenie. Zmierz to najpierw. Karty stawek mówią ci już całą resztę.

Porównane w tym artykule1

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie