Karta hero dla starcia Fugu Ultra v2 z GLM 5.2, przedstawiająca system orkiestracji przeciwstawiony pojedynczemu modelowi typu Mixture-of-Experts, pod hasłem „Płacisz za koordynację, nie za parametry”.
Guides & Insights

Fugu Ultra v2 kontra GLM 5.2: Płacisz za koordynację, nie za parametry

Autor

Gideon Frost

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Postaw obie tabele cen obok siebie, a to zestawienie wygląda jak pomyłka. Fugu Ultra v2, ogłoszony przez Sakana AI 11 września 2026 roku, rozlicza 5 dolarów za milion tokenów wejściowych i 30 dolarów za milion tokenów wyjściowych. GLM 5.2, flagowy model Z.ai z 16 czerwca 2026 roku, rozlicza 1,40 dolara i 4,40 dolara. Oba deklarują okno kontekstowe rzędu miliona tokenów. Oba są adresowane do dokładnie tego samego odbiorcy — zespołu prowadzącego długotrwałą, wieloetapową pracę agentową w skali całego repozytorium. Jeden jest około 3,6× droższy na wejściu i 6,8× droższy na wyjściu od drugiego, a tańszy to ten, który można pobrać i zachować. Całe porównanie sprowadza się więc do jednego pytania: co tak naprawdę kupuje się za te dodatkowe pieniądze i czy kupuje się coś, czym pojedynczy model nie może być?

Nie są tym samym rodzajem obiektu.

Powód, dla którego istnieje różnica w cenie, jest taki, że te dwie rzeczy rozwiązują zadania długoterminowe za pomocą zupełnie innych mechanizmów, a różnica ta daje o sobie znać, zanim jeszcze uruchomisz jakikolwiek test porównawczy.

Fugu Ultra v2 — system orkiestracji, a nie model bazowy. To poziom maksymalizujący możliwości w linii Fugu od Sakana AI: pojedynczy endpoint zgodny z OpenAI, który rozkłada przychodzące zadanie i rozdziela jego części między pulę innych modeli, częściowo open-weights, a częściowo wyspecjalizowanych. Sakana sam opisuje to tak, że „winduje szczytową wydajność wyżej niż kiedykolwiek wcześniej, bez nieodzownego polegania na modelach frontier, którymi orkiestruje”. Kupujesz harmonogram, a płacisz za każdy token, który ten harmonogram zużywa na myślenie, w tym za wewnętrzne tokeny orkiestracji.

GLM 5.2 — pojedynczy model typu Mixture-of-Experts. Z.ai udostępnia go jako model tekst-wejściowy / tekst-wyjściowy z „naprawdę użytecznym” oknem kontekstowym 1 mln tokenów i do 128 tys. tokenów wyjściowych, rozumowaniem hybrydowym kontrolowanym przez reasoning_effort oraz natywnym wywoływaniem narzędzi. Podawana architektura to około 753 mld parametrów łącznie, z około 40 mld aktywnych na token, choć Z.ai nie potwierdziło liczby aktywnych parametrów konkretnie dla wersji 5.2 — traktuj tę wartość jako przeniesioną z GLM-5.1.

To jest rozwidlenie dróg. Jedno z nich to coś, co wywołujesz; drugie to coś, co wywołuje rzeczy.

Czego nie powiedziałby nam Fugu Ultra v2

Strona z ogłoszeniem Sakany jest niezwykle szczera w jednej sprawie i niezwykle milcząca w innej, a jedno i drugie ma znaczenie dla decyzji o zakupie.

Szczera część: firma wprost stwierdza, że Claude Fable 5, Claude Fable 5.1 i GPT-6 Astra nie znajdują się w puli modeli Fugu Ultra v2, mimo że twierdzi, iż przewyższa je w benchmarkach. Podawane uzasadnienie to odporność — wymienna pula otwartych i specjalistycznych modeli, których nie można odebrać, którym nie można zmienić ceny ani których nie można odciąć przez dostawcę lub zmianę geopolityczną. Data odcięcia treningowego jest podana jako 20260828. Cokolwiek sądzisz o tym argumencie, jest to realne stanowisko architektoniczne i najwyraźniejszy powód, by wybrać Fugu Ultra v2 zamiast stosu złożonego samodzielnie.

Przemilczana część: ogłoszenie nie podaje rozmiaru okna kontekstowego ani nie podaje na samej stronie ceny tokenów Fugu Ultra v2. Zestawienia modeli firm trzecich podają okno na 1 mln tokenów, a stawki na 5 USD / 0,50 USD za tokeny z pamięci podręcznej / 30 USD, z progiem zmiany ceny powyżej około 272 tys. tokenów wejściowych, który przechodzi na około 10 USD / 1,00 USD / 45 USD. To liczby, których używa reszta tego artykułu, ale są to zestawienia, a nie dokumentacja dostawcy — potwierdź je w aktualnym cenniku Sakany, zanim zaczniesz na ich podstawie planować budżet.

Pytanie o koszty, na które nikt nie odpowiada w przeliczeniu na token

Cennik za token to niewłaściwa jednostka do tego porównania, a każda strona, która obecnie się w nim pozycjonuje, popełnia ten sam błąd. Rachunek orkiestratora to nie rozmiar twojego promptu pomnożony przez stawkę; to rozmiar twojego promptu plus każde wywołanie podrzędne, które zdecyduje się wykonać, plus tokeny rozumowania modeli, które wynajmuje — wszystko z narzutem według własnej stawki orkiestratora.

Sakana przyznaje to wprost: tokeny orkiestracji zużywane wewnętrznie są rozliczane jako zwykłe tokeny wejściowe i wyjściowe. Oznacza to, że uczciwym sposobem porównania Fugu Ultra v2 z GLM 5.2 jest koszt przypadający na ukończone zadanie, a żaden z dostawców nie publikuje tej liczby.

Niektóre punkty strukturalne, które mimo wszystko pozostają w mocy:

Cena wejściowa — Fugu Ultra v2 $5.00 / 1 mln vs GLM 5.2 $1.40 / 1 mln w OrcaRouter po stawce dostawcy Z.ai. Fugu jest 3,6× droższe, zanim wykona choć jedno wywołanie podrzędne.

Cena za dane wyjściowe — Fugu Ultra v2 30,00 USD / 1 mln vs GLM 5.2 4,40 USD / 1 mln. To liczba, która boli, ponieważ agenci generują dużo danych wyjściowych, a orkiestrator generuje dane wyjściowe, o które nie prosiłeś.

Wejście z pamięci podręcznej — Fugu Ultra v2 podaje $0.50 / 1M; GLM 5.2 korzysta z pamięci podręcznej po $0.26 / 1M, co stanowi 81% zniżki względem własnej stawki wejściowej. Właśnie przy powtarzanych pętlach agenta na stabilnym prompcie systemowym przewaga GLM 5.2 kumuluje się najmocniej.

Zmiana cen za długi kontekst — Podawany próg Fugu Ultra v2 powyżej ~272 tys. tokenów wejściowych przenosi całe żądanie na w przybliżeniu podwójną stawkę za wejście i 1,5× stawkę za wyjście. GLM 5.2 nie ma żadnego progowania kontekstu: 1,40 / 4,40 USD flat, aż do 1 mln.

Ten ostatni wiersz to ten, który trzeba zakreślić. Długoterminowe uruchomienie agenta spędza większość swojego życia powyżej 272K tokenów. Stała stawka GLM 5.2 jest warta prawdziwych pieniędzy dokładnie tam, gdzie stawka Fugu Ultra v2 się podwaja.

Two-column comparison scoreboard for Fugu Ultra v2 and GLM 5.2 covering type, release date, input price ($5.00 vs $1.40 per million tokens), output price ($30.00 vs $4.40), cached input ($0.50 vs $0.26) and long-context pricing (reprices above roughly 272K vs flat to 1M).

Benchmarki ledwo dotykają

Oto naprawdę dziwna rzecz w tym porównaniu — i to, czego żadna obecna strona z rankingiem nie mówi wprost: te dwa modele prawie nigdy nie są mierzone na tym samym teście.

Sakana podaje, że Fugu Ultra v2 jest najlepszy lub ex aequo najlepszy w pięciu z ośmiu benchmarków — GDP.pdf, Chartography, SWEFish, DeepSWE i Toolathon — oraz w pierwszej dwójce w siedmiu z ośmiu. Dwie główne podawane przez nią liczby to Chartography na poziomie 48,3 wobec Opus 5 na 27,3 i Fable 5 na 29,5 oraz DeepSWE na 74,3. SWEFish i Toolathon to własne wewnętrzne benchmarki Sakany. Wszystko to jest raportowane przez dostawcę i żadne z tego nie zostało niezależnie odtworzone na moment publikacji.

Liczby Z.ai dla GLM 5.2 pochodzą z zupełnie innej półki: Terminal-Bench 2.1 na 81,0, SWE-bench Pro na 62,1, GPQA-Diamond na 91,2, AIME 2026 na 99,2, HLE na 40,5 — również raportowane przez dostawcę. Po niezależnej stronie GLM 5.2 ma AA Coding Index na poziomie 68,8 i Intelligence Index na poziomie 39 na stronie Artificial Analysis z ponowną oceną, gdzie oznaczono go jako wstępne oszacowanie, na 7. miejscu spośród 113. Starsze cytowania wartości 51 lub 53 dla GLM 5.2 pochodzą z zastąpionej skali indeksu i nie powinny być cytowane.

Jeśli więc chcesz uzyskać czysty wynik bezpośredniego porównania, taki nie istnieje. Najbliżej wspólnej osi jest to, że obie są mocne w programowaniu agentowym, a uczciwa interpretacja jest taka, że każda firma opublikowała wyniki testów, w których wypada dobrze. To powód, by przeprowadzić własną ocenę, a nie wybierać wyższą liczbę.

Jedna rzecz warta podkreślenia dla każdego, kto dziś rozważa zakup GLM 5.2: to już nie jest najnowszy model Z.ai. GLM-5.3 pojawił się około 14 sierpnia 2026 roku w tej samej cenie katalogowej, ale na własnej licencji, która ogranicza dużych dostawców chmury — co czyni GLM 5.2 ostatnim w pełni objętym licencją MIT flagowym modelem Z.ai i powodem, dla którego nadal ma odrębne uzasadnienie zakupu.

Screenshot of the Sakana AI announcement page titled 'Introducing Fugu Max and Fugu Ultra v2: Orchestrating the Pareto Frontier', dated September 11 2026, showing the cost-versus-performance frontier chart, the Two Axes One Strategy section, and the Fugu Journey timeline.

Licencja jest najostrzejszym podziałem

Odłóżmy na bok benchmarki, a różnica strukturalna jest wyraźniejsza niż jakikolwiek wynik.

GLM 5.2 jest udostępniany jako otwarte wagi na licencji MIT na Hugging Face, bez ograniczeń regionalnych. Możesz go pobrać, uruchomić na własnym sprzęcie, dostroić i wbudować w produkt, nie pytając nikogo o zgodę ani nie płacąc w ogóle stawki za token. Z.ai wytrenowało go — co warte podkreślenia, według własnego twierdzenia tej firmy, w całości na akceleratorach Huawei Ascend, a nie Nvidia.

Fugu Ultra v2 nie daje ci nic z tego. To usługa hostowana: polityka orkiestracji nad pulą modeli, której skład Sakana opisała jedynie ogólnikowo. Nie możesz jej pobrać, przejrzeć, przypiąć do konkretnej wersji ani uruchomić w środowisku odizolowanym od sieci. Zamiast tego otrzymujesz abstrakcję — pojedynczy punkt końcowy, którego działanie jest co do zasady odporne na zniknięcie dowolnego modelu źródłowego. To autentyczna korzyść dla systemu produkcyjnego, który nie może sobie pozwolić na zniknięcie zależności. To także autentyczny koszt, ponieważ w zamian oddałeś kontrolę.

Jeśli twoim ograniczeniem jest „model nie może się zmienić pode mną”, to tylko jedna z tych odpowiedzi je spełnia. Jeśli twoim ograniczeniem jest „model nie może dać się usunąć przez kogoś innego”, to tylko druga je spełnia.

Szybkość i co testerzy mówili o ostatnim

GLM 5.2 w wymierny sposób nie jest szybki: Artificial Analysis odnotowało około 66,3 tokena na sekundę przy czasie do pierwszego tokenu wynoszącym około 4,03 sekundy, co jest umiarkowanym wynikiem jak na model klasy frontier, a sami użytkownicy Z.ai skarżyli się na przeciążenie obsługi w godzinach szczytu.

Sakana nie publikuje żadnych danych dotyczących opóźnień ani przepustowości dla Fugu Ultra v2, co samo w sobie jest wymowne — system, który kieruje zadania do wielu modeli, ma profil opóźnień zależny w całości od tego, co zdecyduje się wywołać, więc pojedyncza wartość przepustowości byłaby niemal pozbawiona znaczenia. Dla poprzedniego Fugu Ultra testerzy publicznie raportowali przebiegi sięgające około 30 minut i koszty znacznie przewyższające stawkę pojedynczego modelu przy tym samym zadaniu. To model z czerwca 2026 r. i nie dowód dotyczący v2 — ale to właśnie ten tryb awarii należy testować, i powód, dla którego porównanie na token schlebia orkiestratorom.

Screenshot of the OrcaRouter model page for GLM 5.2 showing the z-ai/glm-5.2 identifier, a 1M token context window, 128K maximum output, and input pricing of $1.40 per million tokens with output at $4.40.

Jak właściwie wywołałbyś każdy z nich?

GLM 5.2 jest już dostępny na OrcaRouter w stawkach samego providera Z.ai — 1,40 USD za milion tokenów wejściowych i 4,40 USD za milion tokenów wyjściowych, przekazywanych z zerową marżą, więc każda obniżka wprowadzona przez Z.ai trafia tutaj tego samego dnia. Jest zgodny z OpenAI, więc przejście na niego to zmiana base-URL i identyfikatora modelu w SDK, które już masz, a możesz umieścić go za łańcuchem failover lub regułą routingu, zamiast stawiać ścieżkę produkcyjną na jednego providera.

Fugu Ultra v2 nie jest czymś, co routujemy. Jest dostępny we własnym, kompatybilnym z OpenAI API Sakana AI, a zmiana jednego parametru przenosi istniejącą integrację Fugu na niego. Jeśli oceniasz go w zestawieniu z GLM 5.2, praktycznym rozwiązaniem jest pozostawienie GLM 5.2 w istniejącej bramie i wywoływanie Fugu Ultra v2 bezpośrednio od Sakana, dopóki nie podejmiesz decyzji — oba są kompatybilne z OpenAI, więc mogą znajdować się w tej samej ścieżce kodu za flagą.

Który wybrać

Wybierz GLM 5.2 jeśli chcesz sprawdzonego produktu w znanej cenie: wagi na licencji MIT, które mógłbyś samodzielnie hostować już jutro, stałą stawkę $1.40 / $4.40 bez kary za długi kontekst, naprawdę użyteczne okno 1M oraz rabat, który kumuluje się w buforowanych pętlach agenta. Zaakceptuj, że obsługuje tylko tekst, że jest o generację starszy od GLM-5.3 i że jego niezależny wynik indeksu jest wstępny.

Wybierz Fugu Ultra v2, jeśli to, co kupujesz, to odporność plus szczytowe możliwości w trudnej, wieloetapowej pracy, a przy tym jesteś gotów płacić za koordynację za każdy token i zrezygnować z możliwości sprawdzenia lub samodzielnego hostowania tego, co wywołujesz. Sam dostawca twierdzi, że osiąga wyniki na poziomie frontier bez polegania na modelach frontier — to realna i nietypowa propozycja, i taka, której na dzień dzisiejszy dosłownie nikt spoza Sakana nie był w stanie zweryfikować.

Czego byśmy nie zrobili, to wybierania między nimi na podstawie tabeli benchmarków. Testy ledwie się pokrywają, obaj dostawcy opublikowali wyniki na swoim najsilniejszym gruncie, a rozstrzygająca liczba — koszt przypadający na ukończone zadanie długoterminowe — to ta, której żadna z firm nie umieściła na żadnej stronie.

Porównane w tym artykule2

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie