Karta tytułowa hero dla „Fugu Max vs GLM-5.3” z podtytułem „Model wartościowy jest podkopywany przez model wolumenowy”, trzy plakietki typu pill z napisami „$6.00 vs $3.96 wyjście”, „7 962,7 mln tokenów na 7 dni”, „$2.00 vs $1.26 wejście”, wiersz stopki o treści „Sakana AI vs Z.ai – wrzesień 2026” oraz logo OrcaRouter w prawym dolnym rogu.
Engineering & Research

Fugu Max vs GLM-5.3: model oparty na wartości jest podkopywany przez model wolumenowy

Autor

Magnus Corvin

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Fugu Max został wyceniony tak, by wygrywać kosztami, a GLM-5.3 jest tańszy w obu wymiarach. Koordynator Sakana AI zadebiutował 11 września 2026 roku w cenie 2,00 USD za milion tokenów wejściowych i 6,00 USD za milion tokenów wyjściowych, stworzony po to, by kierować każde zadanie do najtańszego modelu, który jest w stanie je obsłużyć. GLM-5.3 od Z.ai, notowany od 18 sierpnia 2026 roku, kosztuje 1,26 USD za wejście i 3,96 USD za wyjście za milion w OrcaRouter — od jednej trzeciej do dwóch piątych mniej niż Fugu Max w obu przypadkach, i to w ramach pojedynczego modelu wyłącznie tekstowego z publikowanym oknem kontekstu 1M i limitem wyjścia 128K. GLM-5.3 jest zresztą najczęściej używanym modelem w naszym katalogu, i to z dużą przewagą. Ta kombinacja — niższy koszt za token i udokumentowane obsługiwanie produkcyjnego ruchu na dużą skalę — sprawia, że właśnie w tym zestawieniu dopłatę za orkiestrację najtrudniej uzasadnić.

Taniej na obu osiach, z opublikowaną specyfikacją

To porównanie jest niekomfortowe dla Fugu Max, jeszcze zanim w ogóle pojawi się jakikolwiek benchmark, ponieważ nie chodzi tu o wymianę możliwości na cenę. GLM-5.3 to sam w sobie flagowy model z pogranicza czołówki — Z.ai opisuje go jako zapewniający około 50% poprawę w kodowaniu względem GLM-5.2 i dorównujący Mythos 5 w wybranych zdolnościach cyberbezpieczeństwa. Nie jest to model budżetowy oferowany jako tania alternatywa. To flagowiec, który akurat jest wyceniony poniżej zoptymalizowanego kosztowo orkiestratora.

• Cena wejściowa — Fugu Max 2,00 USD za 1 mln tokenów vs GLM-5.3 1,26 USD za 1 mln tokenów

• Cena wyjściowa — Fugu Max 6,00 USD za 1 mln tokenów vs GLM-5.3 3,96 USD za 1 mln tokenów

• Wejście z pamięci podręcznej — Fugu Max 0,25 USD za 1 mln tokenów w porównaniu z buforowaniem GLM-5.3 wycenianym jako rabat od podstawowej stawki za wejście

• Kontekst — Fugu Max nieopublikowany vs GLM-5.3 1 mln tokenów

• Limit wyjściowy — Fugu Max: nie podano vs GLM-5.3: 128 tys. tokenów

• Modalność — Fugu Max nieopublikowany vs GLM-5.3 wyłącznie tekstowy, udokumentowane jako takie

• Tagi możliwości — Fugu Max: brak opublikowanych vs GLM-5.3: użycie narzędzi, tryb JSON, rozumowanie

• Dane benchmarkowe — sześć zwycięstw Fugu Max zadeklarowanych bez wyników w porównaniu z GLM-5.3, zgłoszony przez dostawcę wynik DeepSWE od 46,2 do 66,9 względem poprzedniej generacji, plus opublikowany wskaźnik inteligencji Artificial Analysis

• Wagi — Fugu Max zamknięte, pula nieujawniona vs GLM-5.3 z laboratorium o tradycji otwartych wag

• Zaobserwowany ruch w OrcaRouter — Fugu Max: brak, nieobsługiwany w porównaniu z GLM-5.3: 7 962,7 mln tokenów w ciągu ostatnich siedmiu dni

Zauważ, co ostatnie dwa wiersze robią razem. GLM-5.3 pochodzi z linii z otwartymi wagami, co jest najsilniejszą dostępną formą argumentu o niezależności od dostawcy, który Sakana sprzedaje jako cały fundament Fugu Max. Ma też obserwowalny wskaźnik ruchu o rząd wielkości przewyższający większość modeli, które obsługujemy. Jeśli pytanie brzmi „co uruchomić do pracy produkcyjnej z dużą ilością tekstu po niskiej stawce”, dowody wskazują gdzie indziej niż na orkiestrator.

A two-column scoreboard titled "Fugu Max vs GLM-5.3 - the scoreboard". Left column Fugu Max: Output price $6.00 / 1M, Input price $2.00 / 1M, Context not published, Output ceiling not published, Modality not published, Observed traffic not carried. Right column GLM-5.3: Output price $3.96 / 1M, Input price $1.26 / 1M, Context 1M tokens, Output ceiling 128K tokens, Modality text-only and documented, Observed traffic 7,962.7M tokens over 7 days. Footer reading "Fugu Max figures vendor-reported by Sakana AI; GLM-5.3 pricing and traffic from OrcaRouter, September 11 2026.", with the OrcaRouter logo bottom-right.

Argument dotyczący wolumenu — i dlaczego to nie tylko plebiscyt popularności

Liczba ruchu to nie liczba jakości i nie należy jej tak odczytywać. To, co pokazuje 7,96 miliarda tokenów w siedem dni, to fakt, że GLM-5.3 był uruchamiany na skalę produkcyjną przez wiele niezależnych zespołów, na rzeczywistych obciążeniach, i nie wywołał masowej migracji od niego. To słaby sygnał dotyczący jakości i silny sygnał dotyczący zdolności operacyjnej: opóźnienie jest stabilne, przepustowość się utrzymuje, API zachowuje się pod obciążeniem, a tryby awarii są znane wystarczająco dużej populacji, że ujawniają się publicznie. Model wydany w tym samym tygodniu co Fugu Max nie ma niczego z tego za sobą.

Wiersz dotyczący opóźnień wyostrza tę kwestię. GLM-5.3 osiąga p50 czasu do pierwszego tokenu na poziomie 4,33 sekundy w ruchu, który obsługujemy. W przypadku pracy agentowej — obciążenia, na które ukierunkowane są oba te produkty — czas do pierwszego tokenu kumuluje się przy każdej turze każdego subagenta uruchamianego przez koordynatora. Tańszy orkiestrator, który uruchamia cztery agenty, nie jest tańszy, jeśli każdy z nich czeka kilka sekund, zanim cokolwiek wygeneruje, a ten koszt nigdy nie pojawia się w tabeli stawek.

Kontrargument Fugu Maxa jest taki, że jego koordynator kieruje każde żądanie do najlżejszego modelu zdolnego je obsłużyć, co w zasadzie oznacza, że wiele zadań w ogóle nie trafia do drogiego backendu. Rozszerzenie puli przez Sakanę w tym wydaniu dodało modele z otwartymi wagami i modele specjalistyczne, w tym rodzinę NVIDIA Nemotron, dzięki współpracy z NVIDIA, więc tanie szczeble tej drabiny są realne. Pytanie brzmi, czy te szczeble są tańsze niż 3,96 dolara za milion tokenów wyjściowych. W przypadku większości zadań tekstowych nie są — to niski próg, a modele z otwartymi wagami działające w stawkach hostingowych na ogół przekraczają go tylko o niewielki margines.

Pytania, które warto zadać przed wyborem

Czy orkiestrator jest tańszy niż pojedynczy model open-weights? Domyślnie nie, a intuicja podpowiada coś przeciwnego. Orkiestracja dodaje tokeny syntezy koordynatora, a w przypadku uruchomień wieloagentowych — także wynik każdego agenta w zespole. Cennik Fugu firmy Sakana eliminuje najgorszy scenariusz, rozliczając jedną uśrednioną stawkę na podstawie najlepszego uczestniczącego modelu, zamiast sumować agentów, co jest autentycznym ustępstwem. Jednak stawka bazowa, którą uśredniasz, wynosi 6,00 USD za wynik, a pojedynczy model, do którego w przeciwnym razie byś się zwrócił, kosztuje 3,96 USD. Orkiestracja oszczędza pieniądze, gdy zapobiega ponownym próbom, a nie gdy dodaje równoległość dla samej równoległości.

Czy ograniczenie wyłącznie do tekstu ma znaczenie dla któregokolwiek z nich? W przypadku GLM-5.3 jest to udokumentowane, więc to ograniczenie, z którym można planować — brak wizji, brak dźwięku, brak wideo, i katalog to potwierdza. W przypadku Fugu Max modalność po prostu nie jest publikowana. To jest gorsze niż ograniczenie, ponieważ nie można stwierdzić, czy pipeline wysyłający PDF będzie działać, dopóki się go nie wypróbuje. Nieujawnione ograniczenie to nie to samo co brak ograniczenia.

Co dzieje się z każdym z nich, gdy bazowe modele się zmieniają? GLM-5.3 to jeden model w jednej wersji, trenowany i udostępniany przez Z.ai. Jeśli Z.ai zmieni cennik, zmiana trafia na twój klucz tego samego dnia przez OrcaRouter przy 0% marży, a ty możesz ją zobaczyć i zareagować. Zachowanie Fugu Max jest funkcją puli, której członków Sakana nie ujawnia, więc wycofanie lub zmiana ceny przez czołowe laboratorium po cichu zmienia to, co kupujesz, mimo że nazwa produktu się nie zmienia. Sakana przedstawia to jako odporność. To odporność dla dostawcy i nieprzejrzystość dla kupującego.

A screenshot of the Sakana AI release page at sakana.ai/fugu-max-release (captured September 11, 2026, English UI), showing the sakana.ai wordmark, the headline 'Introducing Fugu Max and Fugu Ultra v2: Orchestrating the Pareto Frontier' dated September 11, 2026, the opening copy arguing that the frontier which matters is two-dimensional with capability on one axis and cost on the other, a 'Try Sakana Fugu Max and Fugu Ultra v2' link, and a Pareto chart plotting performance against cost with a red 'Fugu Max' point at the low-cost end, a red 'Fugu Ultra' point at the top, a shaded 'Frontier formed by Fugu models' region and grey points labelled 'Frontier formed by single models'.

Gdzie faktycznie zapadają decyzje o trasowaniu

Oba te przypadki to w istocie decyzje routingowe — Fugu Max podejmuje je wewnątrz nieprzejrzystego koordynatora, a Ty podejmujesz je na poziomie API. OrcaRouter jest tego drugiego rodzaju: jedno API dla ponad 200 modeli z DSL do routingu, które pozwala jawnie wyrazić politykę, automatyczne przełączanie awaryjne, gdy ścieżka dostawcy ulegnie degradacji, oraz fuzję modeli, gdy chcesz świadomie łączyć wyniki, zamiast ufać, że zrobi to czarna skrzynka. GLM-5.3 znajduje się w tym katalogu w cenie katalogowej Z.ai z 0% marży, co jest warte więcej niż zwykle w przypadku modelu, za którym stoi tak duży ruch: stawka, którą widzisz, to stawka publikowana przez Z.ai, przekazana bez zmian.

Praktyczna różnica polega na audytowalności. Gdy Fugu Max wybiera model dla Twojego zapytania, nie dowiesz się, który to model ani dlaczego. Gdy sam piszesz politykę routingu, decyzja znajduje się w Twoim repozytorium, może ją przejrzeć każdy, kto recenzuje Twój kod, i można ją zmienić bez czekania na dostawcę. Dla zespołów podlegających jakimkolwiek obowiązkom w zakresie zgodności lub rozliczania kosztów nie jest to różnica filozoficzna.

Werdykt

GLM-5.3 wygrywa to porównanie pod względem kryteriów, które mają największe znaczenie dla zespołu produkcyjnego: jest tańszy na wejściu i wyjściu, jego okno kontekstowe i limit wyjścia są publikowane, jego ograniczenia modalności są podane, obsługuje użycie narzędzi, tryb JSON i rozumowanie jako udokumentowane możliwości, wywodzi się z linii otwartych wag, a jego siedmiodniowy ruch zbliża się do ośmiu miliardów tokenów. Nie ma takiej interpretacji publicznych dowodów, w której Fugu Max byłby lepiej udokumentowanym zakupem w tym punkcie cenowym.

Fugu Max ma jeden argument i jest on prawdziwy: w zadaniach, w których druga iteracja koordynatora wychwytuje błąd, który pierwsza iteracja by wypuściła, koszt na ukończone zadanie może być niższy niż koszt na token. To warte ograniczonego pilotażu, jeśli twoja praca jest weryfikowalna, masowa, a ty znajdujesz się poza UE/EOG — z górnym limitem tokenów wyjściowych ustalonym z góry i pomiarem tokenów na ukończone zadanie. W przeciwnym razie odpowiedzią jest pojedynczy model, który kosztuje o jedną trzecią mniej i od miesiąca działa pod obciążeniem produkcyjnym, a jest dostępny na OrcaRouter w cenie katalogowej Z.ai z przekazaną stawką dostawcy.

A screenshot of the OrcaRouter model page for GLM 5.3 (z-ai/glm-5.3, captured September 11, 2026, English UI), showing the NEW and Featured badges, the z-ai/glm-5.3 model ID, the Tools, JSON and Reasoning tags over a text-only model, the listing date 2026-08-18, the /v1/chat/completions endpoint, the pricing tiles reading INPUT $1.26 and OUTPUT $3.96 per 1M tokens with p50 TTFT 4.33s and 7,962.7M tokens of 7-day traffic, the 1M token context with 128K max output, and the OpenAI-compatible Python sample pointing at api.orcarouter.ai/v1.

Porównane w tym artykule1

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie