Karta tytułowa hero z napisem 'Fugu Max vs Qwen3.8-Max' i podtytułem 'Ta sama cena, ten sam benchmark, jedna liczba', trzy plakietki typu pill z napisami '$2.00 / $6.00 w obu przypadkach', 'Terminal Bench 2.1: 86,6 vs niepodane' i 'Niezależny wynik: brak vs 40', wiersz stopki z napisem 'Sakana AI, wrzesień 2026 vs Alibaba, sierpień 2026' oraz logo OrcaRouter w prawym dolnym rogu.
Guides & Insights

Fugu Max vs Qwen3.8-Max: ta sama cena, ten sam benchmark, jedna opublikowana liczba

Autor

Magnus Corvin

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Fugu Max i Qwen3.8-Max mają identyczną stawkę: 2,00 USD za milion tokenów wejściowych i 6,00 USD za milion tokenów wyjściowych. Sakana AI wypuściła Fugu Max 11 września 2026 r., a Ali​baba udostępnia Qwen3.8-Max od początku sierpnia — i obaj dostawcy doszli do identycznego cennika z przeciwnych kierunków: jeden wycenia politykę routingu, drugi wycenia model o 2,4 biliona parametrów. Ten remis całkowicie usuwa cenę z równania decyzyjnego, co jest wyjątkowo klarowne. Zostają dowody, a obie strony różnią się tu bardziej niż gdziekolwiek indziej. Obie tabele dostawców wymieniają Terminal Bench 2.1. Ali​baba podaje 86,6 dla Qwen3.8-Max. Sakana twierdzi, że Fugu Max uzyskuje najlepszy wynik ogólny w Terminal Bench 2.1, i nie podaje żadnej liczby — ani dla tego testu, ani dla pozostałych pięciu, w których — jak twierdzi — zwycięża.

Jedyny punkt odniesienia, który wymieniają obie strony

To całe starcie ściśnięte w jednym wierszu, więc warto podejść do tego precyzyjnie.

Komunikat Sakany wymienia sześć benchmarków, w których Fugu Max osiąga najlepszy wynik ogólny: Terminal Bench 2.1, GPQAD, AA-LCR, GDP.pdf, AutomationBench i SWEFish. Pięć z nich to uznane publiczne ewaluacje, a szósty, SWEFish, to własny benchmark kodowania Sakany. W przypadku żadnego z tych sześciu komunikat nie podaje wartości, marginesu ani liczby konkurenta, którą można by postawić obok. Równoległe twierdzenie — że Fugu Max przesuwa granicę Pareto koszt–wydajność na siedmiu z dziesięciu benchmarków — również jest stwierdzeniem o pozycji na wykresie, a nie o punkcie na osi.

Opublikowane przez Alibabę wiersze wyników dla Qwen3.8-Max obejmują Terminal-Bench 2.1 na poziomie 86,6, OSWorld-Verified na poziomie 86,1, GPQA Diamond na poziomie 92,6 i SWE-bench Pro na poziomie 67,7. Wszystkie zgłoszone przez dostawcę, wszystkie liczbowe. Zatem w jedynym teście, który obie firmy zdecydowały się wymienić, jedna opublikowała konkretną liczbę, a druga opublikowała pozycję w rankingu. Nie można na tej podstawie wywnioskować, który system jest lepszy — „najlepszy ogólnie” według Sakany może oznaczać 91 albo 87. Można natomiast wywnioskować, że na moment publikacji żadne publiczne dowody nie odpowiadają na to pytanie, a dostawca formułujący większe twierdzenie to ten, który uchyla się od podania jego liczby.

Identyczne ceny, odwrotna konstrukcja

• Wejście — Fugu Max 2,00 USD za 1 mln tokenów vs Qwen3.8-Max 2,00 USD za 1 mln tokenów

• Wyjście — Fugu Max 6,00 USD za 1 mln tokenów vs Qwen3.8-Max 6,00 USD za 1 mln tokenów

• Wejście z pamięci podręcznej — Fugu Max 0,25 USD za 1 mln tokenów vs Qwen3.8-Max 0,25 USD za 1 mln tokenów, a Artificial Analysis niezależnie mierzy 88-procentową zniżkę na pamięć podręczną po stronie Qw​en

• Dopłata za długi prompt — Fugu Max: w komunikacie prasowym nie podano żadnego progu, w porównaniu z Qwen3.8-Max, gdzie stawka jest stała aż do pełnego okna, bez dopłaty

• Kontekst i wyjście — w przypadku Fugu Max nie opublikowano żadnej z tych wartości, w porównaniu z Qwen3.8-Max, który ma okno 1M tokenów i limit wyjścia około 128K

• Modalność wejściowa — tekst Fugu Max, wspierany własnymi możliwościami puli, kontra Qwen3.8-Max: tekst, obraz, wideo i PDF

• Architektura — Fugu Max: wytrenowany koordynator nad nieujawnioną pulą, rozszerzony na potrzeby Max o modele o otwartych wagach i modele wyspecjalizowane, w tym rodzinę NVIDIA Nemotron, dzięki współpracy z NVIDIA, w porównaniu z Qwen3.8-Max: jednym rzadkim modelem mieszaniny ekspertów o łącznej liczbie około 2,4 biliona parametrów i około 95 miliardach aktywnych na token

• Wagi — Fugu Max zamknięty, członkostwo w puli nieujawnione celowo vs Qwen3.8-Max otwarte wagi opublikowane dla punktu kontrolnego klasy Max na licencji niestandardowej

• Niezależna ocena — dla Fugu Max nie opublikowano żadnej, a dla żadnego modelu Fugu nie istnieje strona Artificial Analysis, w przeciwieństwie do Qwen3.8-Max, który ma aktywny wpis w Artificial Analysis z opublikowanymi danymi dotyczącymi szybkości, rozwlekłości i kosztu na zadanie

Cztery z tych wierszy po stronie Fugu mają adnotację „nie opublikowano”, a po stronie Qw​en zawierają liczbę. Gdy stawki są identyczne, na tym polega całe porównanie: te same pieniądze kupują jeden system, który możesz opisać, i jeden, którego nie możesz.

A two-column scoreboard titled 'Fugu Max vs Qwen3.8-Max - the scoreboard' contrasting six dimensions. Fugu Max: output price $6.00 per 1M, input price $2.00 per 1M, cached input $0.25 per 1M, context not published, Terminal Bench 2.1 best with no figure, evidence vendor-reported only. Qwen3.8-Max: output price $6.00 per 1M, input price $2.00 per 1M, cached input $0.25 per 1M, context 1M with a 128K output ceiling, Terminal Bench 2.1 at 86.6, evidence Artificial Analysis Index 40 and $2.67 per task. Footer reads 'Fugu Max figures vendor-reported by Sakana AI; Qwen3.8-Max rows Alibaba-reported and per Artificial Analysis.' OrcaRouter logo bottom-right.

Za jedną kolumną stoi podmiot trzeci.

Artificial Analysis przyznaje Qwen3.8-Max 40 punktów w ponownie przedstawionym v4.3 Intelligence Index, klasyfikując go na 30. miejscu spośród 200, przy koszcie 2,67 USD za zadanie Intelligence Index i 37,8 tokenów wyjściowych na sekundę — wystarczająco wolno, by zająć 154. miejsce spośród 200 pod względem szybkości. Ten sam wpis odnotowuje 180 milionów tokenów wyjściowych wygenerowanych w ramach indeksu, ponad dwukrotnie więcej niż 89 milionów medianowego modelu, oraz 88-procentowy rabat na pamięć podręczną.

Zanim cokolwiek z tego zostanie zacytowane, trzeba uwzględnić dwie korekty. Pierwsza z nich dotyczy tego, że szeroko rozpowszechniona liczba 58 — czy 58,1, czy 58,4 — dla Qwen3.8-Max pochodzi sprzed ponownej kalibracji indeksu przez Artificial Analysis we wrześniu 2026 r., a bieżąca strona nosi plakietkę „Updated”, która oznacza wynik po korekcie. Starsze opracowania podawały też inny narzut wysiłkowy z poprzedniej skali: 64 tury na zadanie w porównaniu z 14 dla poprzedniej generacji Qwen przy około 1,14 USD na zadanie Intelligence Index; obecna strona pokazuje 2,67 USD. Druga to prawdziwe ostrzeżenie, a nie artefakt skali: Artificial Analysis niezależnie zmierzyło wzrost wskaźnika halucynacji Qwen3.8-Max z 23 procent do 40 procent w porównaniu z poprzednią generacją. W przypadku modelu reklamowanego jako przeznaczony do autonomicznej pracy wieloetapowej jest to koszt, który uwzględnia się w budżecie na weryfikatory, a nie przypis.

Fugu Max nie ma jakiegokolwiek niezależnego wpisu. Każda przypisana mu liczba pochodzi od Sakana, a w chwili pisania nie istnieje żadna strona Artificial Analysis dla Fugu Max ani dla żadnego z jego modeli siostrzanych. To nie jest oskarżenie — model wydany kilka godzin temu nie będzie miał omówienia ze strony podmiotów trzecich — ale oznacza to, że obie kolumny nie są równie łatwe do sprawdzenia i tak pozostanie, dopóki ktoś spoza Sakana nie uruchomi tego modelu.

Dwa sposoby, by wydać za dużo

Oba te systemy oderwały koszt odpowiedzi od kosztu tokena i robią to w przeciwnych kierunkach. Qwen3.8-Max jest oszczędny pod względem tokenów, a hojny pod względem odpowiedzi: 180 milionów tokenów wyjściowych w Intelligence Index, dwa razy więcej niż mediana, przy $2.67 za zadanie. Działa długo, a nie jest duży, a 88-procentowa zniżka na cache to dźwignia kontrolująca rachunek — długie uruchomienie agenta, które stale odczytuje ten sam kontekst, pozostaje tanie, natomiast takie, które stale generuje nowy tekst, już nie.

Fugu Max jest drogi w przeliczeniu na token i nieprzewidywalny w odpowiedzi. Jego koordynator tworzy podagentów, z których każdy generuje tekst rozumowania i tekst wyjściowy rozliczane po 6,00 USD za milion, a do tego dochodzi własna synteza koordynatora. Sakana zobowiązuje się, że uruchomienia wieloagentowe są rozliczane według jednej mieszanej stawki powiązanej z modelem najwyższej klasy spośród uczestniczących oraz że dodawanie agentów nie mnoży rachunku, co eliminuje najgorszy scenariusz eksplozji fan-out, który czyni naiwne systemy wieloagentowe nieosiągalnymi finansowo. Nie eliminuje to jednak wolumenu. A w kwestii wolumenu komunikat o wydaniu milczy w sposób, który ma znaczenie: własny materiał Sakany stwierdza, że przełączanie modeli w trakcie zadania może zmniejszyć ponowne wykorzystywanie pamięci podręcznej kontekstu i generować dodatkowe tokeny orkiestracji, i potwierdza, że firma nie ujawniła współczynnika trafień pamięci podręcznej Maxa ani całkowitego kosztu tokenów na zadanie.

Zatem ta sama stawka $2.00 / $6.00 to z jednej strony przewidywalna liczba, a z drugiej nieograniczona wielokrotność z dolnym progiem. Gadatliwość Qwen3.8-Max jest mierzalna, zanim się zobowiążesz; w przypadku Fugu Max nie jest.

Test wyjścia awaryjnego

To tutaj zwykły argument o zamknięciu ulega odwróceniu i jest to najcenniejsza rzecz w tym połączeniu.

Argument Sakany na rzecz Fugu Max to odporność. Pula obejmująca modele open-weight i wyspecjalizowane modele, rozszerzona na potrzeby Max o rodzinę NVIDIA Nemotron, oznacza, że zaprzestanie wsparcia, zmiana cen lub wycofanie się z danego regionu przez pojedynczego wiodącego dostawcę nie może unieruchomić Twojego produktu — to prawdziwe zabezpieczenie i firma otwarcie mówi, że je sprzedaje. Ale tego zabezpieczenia nie da się zweryfikować z zewnątrz. Nie możesz zobaczyć tej puli, nie możesz włączyć ani wyłączyć żadnego jej elementu, nie możesz samodzielnie hostować żadnej jej części ani w ogóle uruchomić jej w UE/EOG. Obietnica dotycząca puli, której nie wolno Ci sprawdzić, jest słabszą gwarancją, niż brzmi.

Qwen3.8-Max prowadzi ten argument w drugą stronę. To model jednego dostawcy i dlatego jest narażony na decyzje jednego dostawcy — ale Ali​baba opublikowała otwarte wagi dla checkpointu Qwen3.8-2.4T-A95B klasy Max na własnej licencji, co oznacza, że furtka ucieczki jest prawdziwa, a nie retoryczna: jeśli ceny lub warunki ulegną zmianie, model można serwować z własnej infrastruktury. Dla zespołu, którego rzeczywistą obawą jest to, że dostawca wyciągnie dywan spod nóg, checkpoint do pobrania bije opis puli.

Wywołanie któregokolwiek z nich

Qwen3.8-Max jest w naszym katalogu w cenie 2,00 USD za wejście i 6,00 USD za wyjście za milion tokenów, co stanowi cenę katalogową Ali­baby z przeniesioną 0% marżą, więc zmiana ceny u dostawcy trafia na ten sam klucz tego samego dnia, a nie zgodnie z harmonogramem migracji. Jest zgodny z OpenAI pod tym samym bazowym adresem URL co reszta katalogu, co oznacza, że możesz umieścić go za warunkową regułą routingu, łańcuchem przełączania awaryjnego lub panelem fuzji modeli bez drugiej umowy i bez zmian w kodzie — a automatyczne przełączanie awaryjne obejmuje ścieżkę dostawcy z ograniczeniem szybkości lub o obniżonej wydajności. W ciągu ostatnich siedmiu dni przez bramę przeszło 127,7 miliona tokenów.

Fugu Max nie jest dostępny w OrcaRouter. Dociera do Ciebie przez własne API Sakany zgodne z OpenAI oraz kilka platform zewnętrznych, a firma twierdzi, że istniejącą integrację Fugu można zaktualizować, zmieniając jeden parametr. Ponieważ oba posługują się tym samym formatem żądań, najtańszym sposobem rozstrzygnięcia luki w benchmarku jest przestać czekać, aż Sakana go opublikuje: uruchom oba za jednym przełącznikiem na własnym obciążeniu i licz tokeny wyjściowe na ukończone zadanie. To pomiar, którego nie dostarczył żaden z dostawców.

A screenshot of the Sakana AI announcement page (English UI, captured September 11, 2026) headed 'Introducing Fugu Max and Fugu Ultra v2: Orchestrating the Pareto Frontier' and dated September 11, 2026, showing the argument that the industry has raced along a single axis of bigger and more expensive foundation models while the frontier that matters is two-dimensional, capability on one axis and cost on the other.

Który i kiedy

Qwen3.8-Max to wybór, który możesz audytować, wycenić i porzucić. Przy identycznym cenniku daje okno 1M tokenów bez dopłaty za długie podpowiedzi, obsługę danych wejściowych w postaci obrazu, wideo i PDF, możliwy do pobrania checkpoint klasy Max, bieżący niezależny wpis mierzący to, co wpływa na Twój rachunek, oraz 88 procent zniżki na buforowane dane wejściowe. Jego koszty są równie konkretne: jest powolny — 37,8 tokena na sekundę, plasuje się w dolnych rejonach stawki pod względem szybkości, jest ogromnie gadatliwy — 180 milionów tokenów w indeksie, a jego zmierzony wskaźnik halucynacji w przybliżeniu podwoił się w stosunku do poprzedniej generacji — co jest poważnym zmartwieniem dokładnie w przypadku autonomicznej pracy, do której jest sprzedawany. Wykorzystaj mocno zniżkę na pamięć podręczną i zaplanuj budżet na weryfikator.

Fugu Max to zakład, że koordynacja bije możliwości. Jeśli twoja praca jest długoterminowa i weryfikowalna, a koordynator, który powołuje weryfikatora, kończy zadania, na których pojedynczy model dwukrotnie zawodzi, to tokeny orkiestracji są tańsze niż ponowne próby, a identyczna tabela stawek wcale nie oznacza remisu. Kupujesz wytrwałość w systemie, którego puli nie możesz przypiąć, którego okno kontekstowe nie jest publikowane i którego sześć zwycięstw w benchmarkach nie ma przypisanych żadnych wartości — od dostawcy, który zdecydował się nazwać test i nie podać liczby.

Oba produkty kosztują tyle samo za token. Tylko jeden z nich mówi, co się za to dostaje.

A screenshot of the OrcaRouter model page for Qwen3.8 Max (English UI, captured September 11, 2026), showing the Featured badge, the identifier qwen/qwen3.8-max, by Qwen dated 2026-08-03, vision, tools, JSON and reasoning capability tags, a 1M-token context window with text, image and video input, list pricing of $2.00 per 1M input tokens and $6.00 per 1M output tokens, a p50 TTFT of 10.00 seconds, traffic of 127.7 million tokens over 7 days, and an OpenAI-compatible base URL with Python and cURL code samples.

Porównane w tym artykule1

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie