
Fugu Max vs Qwen3.8-Max: ta sama cena, ten sam benchmark, jedna opublikowana liczba
- deepseekNOWOŚĆDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiNOWOŚĆOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleNOWOŚĆGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenNOWOŚĆQwen: Qwen3.8 Max (0902)2026-09-0240Inteligencja72Kod
- anthropicNOWOŚĆAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 za 1 mln tokenów
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0340Inteligencja72Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligencja78Kod
- googleGoogle: Gemini 3.6 Flash2026-07-2134Inteligencja69Kod
Fugu Max i Qwen3.8-Max mają identyczną stawkę: 2,00 USD za milion tokenów wejściowych i 6,00 USD za milion tokenów wyjściowych. Sakana AI wypuściła Fugu Max 11 września 2026 r., a Alibaba udostępnia Qwen3.8-Max od początku sierpnia — i obaj dostawcy doszli do identycznego cennika z przeciwnych kierunków: jeden wycenia politykę routingu, drugi wycenia model o 2,4 biliona parametrów. Ten remis całkowicie usuwa cenę z równania decyzyjnego, co jest wyjątkowo klarowne. Zostają dowody, a obie strony różnią się tu bardziej niż gdziekolwiek indziej. Obie tabele dostawców wymieniają Terminal Bench 2.1. Alibaba podaje 86,6 dla Qwen3.8-Max. Sakana twierdzi, że Fugu Max uzyskuje najlepszy wynik ogólny w Terminal Bench 2.1, i nie podaje żadnej liczby — ani dla tego testu, ani dla pozostałych pięciu, w których — jak twierdzi — zwycięża.
Jedyny punkt odniesienia, który wymieniają obie strony
To całe starcie ściśnięte w jednym wierszu, więc warto podejść do tego precyzyjnie.
Komunikat Sakany wymienia sześć benchmarków, w których Fugu Max osiąga najlepszy wynik ogólny: Terminal Bench 2.1, GPQAD, AA-LCR, GDP.pdf, AutomationBench i SWEFish. Pięć z nich to uznane publiczne ewaluacje, a szósty, SWEFish, to własny benchmark kodowania Sakany. W przypadku żadnego z tych sześciu komunikat nie podaje wartości, marginesu ani liczby konkurenta, którą można by postawić obok. Równoległe twierdzenie — że Fugu Max przesuwa granicę Pareto koszt–wydajność na siedmiu z dziesięciu benchmarków — również jest stwierdzeniem o pozycji na wykresie, a nie o punkcie na osi.
Opublikowane przez Alibabę wiersze wyników dla Qwen3.8-Max obejmują Terminal-Bench 2.1 na poziomie 86,6, OSWorld-Verified na poziomie 86,1, GPQA Diamond na poziomie 92,6 i SWE-bench Pro na poziomie 67,7. Wszystkie zgłoszone przez dostawcę, wszystkie liczbowe. Zatem w jedynym teście, który obie firmy zdecydowały się wymienić, jedna opublikowała konkretną liczbę, a druga opublikowała pozycję w rankingu. Nie można na tej podstawie wywnioskować, który system jest lepszy — „najlepszy ogólnie” według Sakany może oznaczać 91 albo 87. Można natomiast wywnioskować, że na moment publikacji żadne publiczne dowody nie odpowiadają na to pytanie, a dostawca formułujący większe twierdzenie to ten, który uchyla się od podania jego liczby.
Identyczne ceny, odwrotna konstrukcja
• Wejście — Fugu Max 2,00 USD za 1 mln tokenów vs Qwen3.8-Max 2,00 USD za 1 mln tokenów
• Wyjście — Fugu Max 6,00 USD za 1 mln tokenów vs Qwen3.8-Max 6,00 USD za 1 mln tokenów
• Wejście z pamięci podręcznej — Fugu Max 0,25 USD za 1 mln tokenów vs Qwen3.8-Max 0,25 USD za 1 mln tokenów, a Artificial Analysis niezależnie mierzy 88-procentową zniżkę na pamięć podręczną po stronie Qwen
• Dopłata za długi prompt — Fugu Max: w komunikacie prasowym nie podano żadnego progu, w porównaniu z Qwen3.8-Max, gdzie stawka jest stała aż do pełnego okna, bez dopłaty
• Kontekst i wyjście — w przypadku Fugu Max nie opublikowano żadnej z tych wartości, w porównaniu z Qwen3.8-Max, który ma okno 1M tokenów i limit wyjścia około 128K
• Modalność wejściowa — tekst Fugu Max, wspierany własnymi możliwościami puli, kontra Qwen3.8-Max: tekst, obraz, wideo i PDF
• Architektura — Fugu Max: wytrenowany koordynator nad nieujawnioną pulą, rozszerzony na potrzeby Max o modele o otwartych wagach i modele wyspecjalizowane, w tym rodzinę NVIDIA Nemotron, dzięki współpracy z NVIDIA, w porównaniu z Qwen3.8-Max: jednym rzadkim modelem mieszaniny ekspertów o łącznej liczbie około 2,4 biliona parametrów i około 95 miliardach aktywnych na token
• Wagi — Fugu Max zamknięty, członkostwo w puli nieujawnione celowo vs Qwen3.8-Max otwarte wagi opublikowane dla punktu kontrolnego klasy Max na licencji niestandardowej
• Niezależna ocena — dla Fugu Max nie opublikowano żadnej, a dla żadnego modelu Fugu nie istnieje strona Artificial Analysis, w przeciwieństwie do Qwen3.8-Max, który ma aktywny wpis w Artificial Analysis z opublikowanymi danymi dotyczącymi szybkości, rozwlekłości i kosztu na zadanie
Cztery z tych wierszy po stronie Fugu mają adnotację „nie opublikowano”, a po stronie Qwen zawierają liczbę. Gdy stawki są identyczne, na tym polega całe porównanie: te same pieniądze kupują jeden system, który możesz opisać, i jeden, którego nie możesz.

Za jedną kolumną stoi podmiot trzeci.
Artificial Analysis przyznaje Qwen3.8-Max 40 punktów w ponownie przedstawionym v4.3 Intelligence Index, klasyfikując go na 30. miejscu spośród 200, przy koszcie 2,67 USD za zadanie Intelligence Index i 37,8 tokenów wyjściowych na sekundę — wystarczająco wolno, by zająć 154. miejsce spośród 200 pod względem szybkości. Ten sam wpis odnotowuje 180 milionów tokenów wyjściowych wygenerowanych w ramach indeksu, ponad dwukrotnie więcej niż 89 milionów medianowego modelu, oraz 88-procentowy rabat na pamięć podręczną.
Zanim cokolwiek z tego zostanie zacytowane, trzeba uwzględnić dwie korekty. Pierwsza z nich dotyczy tego, że szeroko rozpowszechniona liczba 58 — czy 58,1, czy 58,4 — dla Qwen3.8-Max pochodzi sprzed ponownej kalibracji indeksu przez Artificial Analysis we wrześniu 2026 r., a bieżąca strona nosi plakietkę „Updated”, która oznacza wynik po korekcie. Starsze opracowania podawały też inny narzut wysiłkowy z poprzedniej skali: 64 tury na zadanie w porównaniu z 14 dla poprzedniej generacji Qwen przy około 1,14 USD na zadanie Intelligence Index; obecna strona pokazuje 2,67 USD. Druga to prawdziwe ostrzeżenie, a nie artefakt skali: Artificial Analysis niezależnie zmierzyło wzrost wskaźnika halucynacji Qwen3.8-Max z 23 procent do 40 procent w porównaniu z poprzednią generacją. W przypadku modelu reklamowanego jako przeznaczony do autonomicznej pracy wieloetapowej jest to koszt, który uwzględnia się w budżecie na weryfikatory, a nie przypis.
Fugu Max nie ma jakiegokolwiek niezależnego wpisu. Każda przypisana mu liczba pochodzi od Sakana, a w chwili pisania nie istnieje żadna strona Artificial Analysis dla Fugu Max ani dla żadnego z jego modeli siostrzanych. To nie jest oskarżenie — model wydany kilka godzin temu nie będzie miał omówienia ze strony podmiotów trzecich — ale oznacza to, że obie kolumny nie są równie łatwe do sprawdzenia i tak pozostanie, dopóki ktoś spoza Sakana nie uruchomi tego modelu.
Dwa sposoby, by wydać za dużo
Oba te systemy oderwały koszt odpowiedzi od kosztu tokena i robią to w przeciwnych kierunkach. Qwen3.8-Max jest oszczędny pod względem tokenów, a hojny pod względem odpowiedzi: 180 milionów tokenów wyjściowych w Intelligence Index, dwa razy więcej niż mediana, przy $2.67 za zadanie. Działa długo, a nie jest duży, a 88-procentowa zniżka na cache to dźwignia kontrolująca rachunek — długie uruchomienie agenta, które stale odczytuje ten sam kontekst, pozostaje tanie, natomiast takie, które stale generuje nowy tekst, już nie.
Fugu Max jest drogi w przeliczeniu na token i nieprzewidywalny w odpowiedzi. Jego koordynator tworzy podagentów, z których każdy generuje tekst rozumowania i tekst wyjściowy rozliczane po 6,00 USD za milion, a do tego dochodzi własna synteza koordynatora. Sakana zobowiązuje się, że uruchomienia wieloagentowe są rozliczane według jednej mieszanej stawki powiązanej z modelem najwyższej klasy spośród uczestniczących oraz że dodawanie agentów nie mnoży rachunku, co eliminuje najgorszy scenariusz eksplozji fan-out, który czyni naiwne systemy wieloagentowe nieosiągalnymi finansowo. Nie eliminuje to jednak wolumenu. A w kwestii wolumenu komunikat o wydaniu milczy w sposób, który ma znaczenie: własny materiał Sakany stwierdza, że przełączanie modeli w trakcie zadania może zmniejszyć ponowne wykorzystywanie pamięci podręcznej kontekstu i generować dodatkowe tokeny orkiestracji, i potwierdza, że firma nie ujawniła współczynnika trafień pamięci podręcznej Maxa ani całkowitego kosztu tokenów na zadanie.
Zatem ta sama stawka $2.00 / $6.00 to z jednej strony przewidywalna liczba, a z drugiej nieograniczona wielokrotność z dolnym progiem. Gadatliwość Qwen3.8-Max jest mierzalna, zanim się zobowiążesz; w przypadku Fugu Max nie jest.
Test wyjścia awaryjnego
To tutaj zwykły argument o zamknięciu ulega odwróceniu i jest to najcenniejsza rzecz w tym połączeniu.
Argument Sakany na rzecz Fugu Max to odporność. Pula obejmująca modele open-weight i wyspecjalizowane modele, rozszerzona na potrzeby Max o rodzinę NVIDIA Nemotron, oznacza, że zaprzestanie wsparcia, zmiana cen lub wycofanie się z danego regionu przez pojedynczego wiodącego dostawcę nie może unieruchomić Twojego produktu — to prawdziwe zabezpieczenie i firma otwarcie mówi, że je sprzedaje. Ale tego zabezpieczenia nie da się zweryfikować z zewnątrz. Nie możesz zobaczyć tej puli, nie możesz włączyć ani wyłączyć żadnego jej elementu, nie możesz samodzielnie hostować żadnej jej części ani w ogóle uruchomić jej w UE/EOG. Obietnica dotycząca puli, której nie wolno Ci sprawdzić, jest słabszą gwarancją, niż brzmi.
Qwen3.8-Max prowadzi ten argument w drugą stronę. To model jednego dostawcy i dlatego jest narażony na decyzje jednego dostawcy — ale Alibaba opublikowała otwarte wagi dla checkpointu Qwen3.8-2.4T-A95B klasy Max na własnej licencji, co oznacza, że furtka ucieczki jest prawdziwa, a nie retoryczna: jeśli ceny lub warunki ulegną zmianie, model można serwować z własnej infrastruktury. Dla zespołu, którego rzeczywistą obawą jest to, że dostawca wyciągnie dywan spod nóg, checkpoint do pobrania bije opis puli.
Wywołanie któregokolwiek z nich
Qwen3.8-Max jest w naszym katalogu w cenie 2,00 USD za wejście i 6,00 USD za wyjście za milion tokenów, co stanowi cenę katalogową Alibaby z przeniesioną 0% marżą, więc zmiana ceny u dostawcy trafia na ten sam klucz tego samego dnia, a nie zgodnie z harmonogramem migracji. Jest zgodny z OpenAI pod tym samym bazowym adresem URL co reszta katalogu, co oznacza, że możesz umieścić go za warunkową regułą routingu, łańcuchem przełączania awaryjnego lub panelem fuzji modeli bez drugiej umowy i bez zmian w kodzie — a automatyczne przełączanie awaryjne obejmuje ścieżkę dostawcy z ograniczeniem szybkości lub o obniżonej wydajności. W ciągu ostatnich siedmiu dni przez bramę przeszło 127,7 miliona tokenów.
Fugu Max nie jest dostępny w OrcaRouter. Dociera do Ciebie przez własne API Sakany zgodne z OpenAI oraz kilka platform zewnętrznych, a firma twierdzi, że istniejącą integrację Fugu można zaktualizować, zmieniając jeden parametr. Ponieważ oba posługują się tym samym formatem żądań, najtańszym sposobem rozstrzygnięcia luki w benchmarku jest przestać czekać, aż Sakana go opublikuje: uruchom oba za jednym przełącznikiem na własnym obciążeniu i licz tokeny wyjściowe na ukończone zadanie. To pomiar, którego nie dostarczył żaden z dostawców.

Który i kiedy
Qwen3.8-Max to wybór, który możesz audytować, wycenić i porzucić. Przy identycznym cenniku daje okno 1M tokenów bez dopłaty za długie podpowiedzi, obsługę danych wejściowych w postaci obrazu, wideo i PDF, możliwy do pobrania checkpoint klasy Max, bieżący niezależny wpis mierzący to, co wpływa na Twój rachunek, oraz 88 procent zniżki na buforowane dane wejściowe. Jego koszty są równie konkretne: jest powolny — 37,8 tokena na sekundę, plasuje się w dolnych rejonach stawki pod względem szybkości, jest ogromnie gadatliwy — 180 milionów tokenów w indeksie, a jego zmierzony wskaźnik halucynacji w przybliżeniu podwoił się w stosunku do poprzedniej generacji — co jest poważnym zmartwieniem dokładnie w przypadku autonomicznej pracy, do której jest sprzedawany. Wykorzystaj mocno zniżkę na pamięć podręczną i zaplanuj budżet na weryfikator.
Fugu Max to zakład, że koordynacja bije możliwości. Jeśli twoja praca jest długoterminowa i weryfikowalna, a koordynator, który powołuje weryfikatora, kończy zadania, na których pojedynczy model dwukrotnie zawodzi, to tokeny orkiestracji są tańsze niż ponowne próby, a identyczna tabela stawek wcale nie oznacza remisu. Kupujesz wytrwałość w systemie, którego puli nie możesz przypiąć, którego okno kontekstowe nie jest publikowane i którego sześć zwycięstw w benchmarkach nie ma przypisanych żadnych wartości — od dostawcy, który zdecydował się nazwać test i nie podać liczby.
Oba produkty kosztują tyle samo za token. Tylko jeden z nich mówi, co się za to dostaje.

Porównane w tym artykule1
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
