
Fugu Ultra v2 vs Qwen3.8-Max: dlaczego metka z ceną to niewłaściwa liczba
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów
- orcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów
- deepseekNOWOŚĆDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencja76Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Fugu Ultra v2 kosztuje 30,00 USD za milion tokenów wyjściowych. Qwen3.8-Max kosztuje 6,00 USD. To pięciokrotna różnica, a jeśli wybierzesz między tymi dwoma systemami agentowymi, kierując się tym stosunkiem, wybierzesz źle — bo żaden z nich w rzeczywistości nie jest rozliczany tak, jak sugeruje jego cennik. Według własnych pomiarów Artificial Analysis Qwen3.8-Max wygenerował 180 milionów tokenów wyjściowych, aby ukończyć Intelligence Index — ponad dwa razy więcej niż 89 milionów tokenów modelu medianowego — przy koszcie 2,67 USD na zadanie. Pod względem tokenów to model oszczędny, a pod względem odpowiedzi — rozrzutny. Fugu Ultra v2 od Sakana AI, wydany 11 września 2026 r., ma odwrotny kształt: nieujawniona pula modeli innych laboratoriów, które uruchamia i koordynuje przy każdym żądaniu, rozliczana według jednej mieszanej stawki, która — jak twierdzi Sakana — nie mnoży się wraz z dodawaniem agentów. Jeden to pojedynczy model o 2,4 biliona parametrów, który długo myśli na głos. Drugi to niewielki koordynator, który wynajmuje pomoc. Porównywanie ich cen tokenów niemal nic nie mówi o tym, który jest tańszy w eksploatacji.
Dwa przeciwne sposoby na bycie drogim
Zacznij od mechanizmu, ponieważ wyjaśnia on każdą inną różnicę w tym porównaniu.
Qwen3.8-Max to rzadki model mieszaniny ekspertów — 2,4 biliona parametrów łącznie, około 95 miliardów aktywnych na token — który osiąga wyniki zbliżone do czołówki, pracując dłużej, a nie dzięki temu, że jest większy. Artificial Analysis zmierzyło go na 37,8 tokenu wyjściowego na sekundę, plasując go na #154 miejscu spośród 200 modeli pod względem szybkości, przy 180 milionach tokenów wyjściowych wyemitowanych w ramach Intelligence Index (#70 z 200 pod względem gadatliwości). Jego koszt na zadanie Intelligence Index wynosi 2,67 USD, a zniżka za pamięć podręczną jest wyjątkowo głęboka — 88% — i to właśnie ta dźwignia faktycznie kontroluje tutaj rachunek: długie uruchomienie agenta, które wciąż odczytuje ten sam kontekst, jest tanie, a takie, które wciąż generuje nowy tekst, już nie.
Fugu Ultra v2 podchodzi do tego samego problemu z drugiej strony. Jest orkiestratorem — niewielkim wytrenowanym koordynatorem, według doniesień mającym około 7 miliardów parametrów, który odczytuje żądanie, tworzy zespół agentów w rolach Thinker, Worker i Verifier z pracy TRINITY Sakany, a następnie syntetyzuje odpowiedź. Jego rachunek za tokeny to suma tego, co wygenerują jego podagenci, plus własny tekst syntezy koordynatora. Sakana zobowiązuje się w swoim FAQ dotyczącym cen, że naliczana jest jedna uśredniona stawka powiązana z zaangażowanym modelem najwyższej klasy oraz że dodawanie agentów nie mnoży rachunku, co eliminuje klasyczną eksplozję kosztów w systemach wieloagentowych, gdzie rozgałęzianie mnoży koszty. Nie eliminuje natomiast wolumenu. Przy 30,00 USD za milion tokenów wyjściowych liczba, która ma znaczenie, to ile agentów zostało uruchomionych i ile napisały, a tego ani Ty, ani Sakana nie możecie przewidzieć na podstawie strony z cennikiem.
To uczciwe ujęcie różnicy cenowej: to stawka, a nie suma. Pięciokrotnie wyższa stawka zastosowana do obciążenia, którego wolumenu wyników nie da się prognozować, to nie pięciokrotny koszt — to nieograniczona krotność z przewidywalnym dolnym progiem.

Karta specyfikacji i ten jeden wiersz, który o tym decyduje
• Cena — Fugu Ultra v2: $5.00 za wejście / $30.00 za wyjście za 1 mln tokenów vs Qwen3.8-Max: $2.00 za wejście / $6.00 za wyjście
• Buforowane dane wejściowe — Fugu Ultra v2 0,50 USD za 1 mln w porównaniu z Qwen3.8-Max 0,25 USD za 1 mln odczytu oraz 88-procentowa zniżka na pamięć podręczną zmierzona przez Artificial Analysis
• Dopłata za długi kontekst — w Fugu Ultra v2 koszt wejścia podwaja się do 10,00 USD, a koszt wyjścia do 45,00 USD powyżej 272 tys. tokenów, podczas gdy Qwen3.8-Max nie ma dopłaty za długie prompty i stawka jest stała w całym oknie.
• Okno kontekstowe — Fugu Ultra v2 1 mln tokenów vs Qwen3.8-Max 1 mln tokenów
• Limit wyjściowy — Fugu Ultra v2 nie został podany jako pojedyncza liczba, w porównaniu z Qwen3.8-Max: około 128 tys. tokenów
• Modalność wejściowa — Fugu Ultra v2 w wersji tekstowej, za którą stoją własne możliwości puli, kontra Qwen3.8-Max w wersjach: tekstowej, obrazowej, wideo i PDF
• Wagi — Fugu Ultra v2 zamknięte, członkostwo w puli celowo nieujawnione, w przeciwieństwie do otwartych wag Qwen3.8-Max opublikowanych dla checkpointu klasy Max na niestandardowej licencji
• Dostępność regionalna — Fugu Ultra v2 nie jest sprzedawany w UE/EOG, podczas gdy Qwen3.8-Max jest dostępny bez ograniczeń regionalnych
• Niezależna ocena — Fugu Ultra v2: brak opublikowanych danych, a dla żadnego modelu Fugu nie istnieje strona Artificial Analysis w porównaniu z Qwen3.8-Max — aktywnym wpisem w Artificial Analysis z opublikowanymi danymi dotyczącymi szybkości, gadatliwości i kosztu na zadanie
Przeczytaj dwa ostatnie wiersze razem, a zestawienie się wyostrza. Qwen3.8-Max to model, który możesz przypiąć do konkretnej wersji, przeczytać jego licencję, pobrać jego checkpoint i zweryfikować na podstawie tablicy wyników strony trzeciej. Fugu Ultra v2 to system, którego nie możesz sprawdzić, nie możesz hostować samodzielnie, nie możesz kupić w Europie i nie możesz zweryfikować za pomocą nikogo poza Sakana. Dopłata za 272K jeszcze to pogłębia: po przekroczeniu tego progu stawka za tokeny wejściowe Fugu Ultra v2 podwaja się, a stawka za tokeny wyjściowe rośnie o połowę, podczas gdy stawka Qwen3.8-Max się nie zmienia. W przypadku długoterminowej pracy nad dokumentami i repozytoriami, do której oba systemy są stworzone, tańsza cena z nagłówka jest również bardziej płaska.
Liczba Qwen3.8-Max, którą wszyscy przytaczają, jest nieaktualna.
Jeśli w ciągu ostatnich dwóch tygodni czytałeś gdziekolwiek o tym modelu, prawdopodobnie natrafiłeś na Artificial Analysis Intelligence Index wynoszący 58, 58,1 lub 58,4. Te liczby były prawdziwe i nie są już aktualne. Artificial Analysis przekalibrowało swój indeks do wersji v4.3 7 września 2026 r., kompresując wyniki w całym zakresie, a bieżąca strona Qwen3.8-Max pokazuje teraz 40, co plasuje go na 30. miejscu spośród 200 modeli — wraz z plakietką „Zaktualizowano”, która oznacza skorygowany wynik. Starsze opracowania zawierały także podatek za wysiłek mierzony w poprzedniej skali: 64 tury na zadanie wobec 14 w przypadku poprzedniej generacji Qwen oraz około 1,14 USD na zadanie Intelligence Index. Obecna strona pokazuje 2,67 USD na zadanie, 37,8 tokenów wyjściowych na sekundę i 180 milionów tokenów wyjściowych w indeksie.
Z tego wynikają dwie rzeczy. Po pierwsze, na skali po ponownej kalibracji Qwen3.8-Max znajduje się w tym samym przedziale co reszta drugiego szeregu czołówki, a nie na tym samym poziomie co ona, a każde porównanie, w którym zestawia się go z Claude Opus 5 lub Kimi K3 na poziomie 58, porównuje migawki z różnych skal. Po drugie, co jest bardziej przydatne w tym starciu, korekta jest jednokierunkowa: Qwen3.8-Max ma liczbę, która może być błędna, a potem poprawiona. Fugu Ultra v2 nie ma liczby. Każdy wynik Fugu w tym artykule pochodzi z własnej ewaluacji Sakany, a na dzień 11 września nie ma strony Artificial Analysis dla Fugu Ultra v2 ani żadnego innego modelu Fugu — adres URL zwraca 404. Gdy dostawca publikuje tablicę wyników, a żadna niezależna strona nie uruchomiła modelu, tablica wyników jest całym zapisem.
Gdzie faktycznie się pokrywają, a gdzie nie
Sakana podaje, że Fugu Ultra v2 jest najlepszy lub ex aequo najlepszy w pięciu z ośmiu benchmarków — GDP.pdf, Chartography, SWEFish, DeepSWE i Toolathon — oraz w pierwszej dwójce w siedmiu z ośmiu. Dwie konkretne liczby w komunikacie to Chartography na poziomie 48,3 w porównaniu z 27,3 dla Claude Opus 5 i 29,5 dla Claude Fable 5 w tej samej tabeli oraz DeepSWE na poziomie 74,3. Opublikowane przez samą Alibabę wiersze dla Qwen3.8-Max obejmują Terminal-Bench 2.1 na poziomie 86,6, OSWorld-Verified na poziomie 86,1, GPQA Diamond na poziomie 92,6 i SWE-bench Pro na poziomie 67,7.
Zauważ, co łączy te dwie listy: nic. Żaden benchmark nie pojawia się w obu tabelach dostawców. Nie ma wiersza, w którym można zestawić obok siebie wynik Sakana i wynik Alibaba i odczytać zwycięzcę, co oznacza, że uczciwa odpowiedź na pytanie „który jest lepszy w zadaniach agentów kodujących” brzmi: żadne opublikowane dowody nie dają na to odpowiedzi. Istnieje jeden system z ośmioma wierszami wybranymi przez dostawcę i bez zewnętrznej weryfikacji oraz jeden system z wierszami dostawcy plus niezależnym wpisem, który mierzy koszt i szybkość, a nie bezpośrednie porównanie możliwości. To luka w dowodach, a nie luka w modelach, i powinna zmienić sposób, w jaki kupujesz: nie możesz wybierać między nimi na podstawie benchmarków, więc wybieraj na podstawie właściwości, które faktycznie możesz zweryfikować.

Otwarte wagi kontra nieujawniona pula
Właśnie tutaj typowy argument o uzależnieniu od dostawcy się odwraca, i to jest najciekawsze w tym zestawieniu.
Argument Sakany za Fugu Ultra v2 to suwerenność. Wymienna pula otwartych i wyspecjalizowanych modeli sprawia, że żadna decyzja cenowa jednego dostawcy, harmonogram wycofywania ani zmiana polityki nie może pogrążyć Twojego produktu, a wydanie wprost to podkreśla, zauważając, że skład puli zmienił się w v2. Firma stwierdza również wprost, że wyniki Fugu Ultra v2 osiągnięto bez Claude Fable 5, Claude Fable 5.1 lub GPT-6 Astra w puli agentów — twierdząc, że wygrywa z trzema najsilniejszymi dostępnymi modelami, jednocześnie potwierdzając, że nie wywołuje żadnego z nich. Cokolwiek zawiera pula, według własnych rachunków Sakany nie jest ona czołówką rynku.
Ale to zabezpieczenie ma koszt, którego nie ma w cenniku. Nie możesz zobaczyć puli, nie możesz włączyć ani wyłączyć członka z poziomu Ultra, nie możesz samodzielnie hostować żadnego z tych elementów i nie możesz w ogóle uruchomić tego w UE/EOG — orkiestracja z Singapuru nad wagami innych laboratoriów to inny profil ryzyka niż posiadanie wag. Qwen3.8-Max odwraca to dokładnie. To model jednego dostawcy, a więc narażony na decyzje jednego dostawcy, ale Alibaba opublikowała otwarte wagi dla checkpointu Qwen3.8-2.4T-A95B klasy Max na podstawie niestandardowej licencji, co oznacza, że furtka ucieczki jest realna, a nie retoryczna: jeśli zmienią się ceny lub warunki, model można uruchomić z własnej infrastruktury. Dla zespołu, którego rzeczywistym lękiem jest dostawca wycofujący dywan spod nóg, możliwy do pobrania checkpoint jest silniejszą gwarancją niż obietnica dotycząca puli, której nie wolno ci sprawdzić.
Jest jeszcze punkt drugiego rzędu dla każdego, kto uruchamia agentów na obu z nich. Qwen3.8-Max jest w naszym katalogu w cenie $2.00 za wejście i $6.00 za wyjście, czyli cena katalogowa Alibaby z 0% narzutu przekazanego dalej — zmiana ceny dostawcy trafia na ten sam klucz tego samego dnia, a automatyczne przełączanie awaryjne obejmuje ścieżkę dostawcy z limitem zapytań lub działającą z degradacją. Fugu Ultra v2 nie ma w OrcaRouter. Dociera do ciebie przez własne API Sakany zgodne z OpenAI oraz kilka platform zewnętrznych, a przejście z wcześniejszego Fugu to zmiana jednego parametru w jednej linii. Router nie zastępuje koordynatora, a koordynator nie zastępuje możliwości przełączenia awaryjnego; jeśli chcesz mieć obie te właściwości, uruchamiasz systemy dwóch dostawców i powinieneś zaplanować dwa rachunki.
Który powinieneś wybrać
Wybierz Qwen3.8-Max, jeśli potrzebujesz modelu, który możesz przewidzieć, zweryfikować i od którego możesz odejść. Jego szybkość wyjściowa to jedna trzecia szybkości Fugu Ultra v2 w cenniku, nie ma klifu przy długim kontekście, przyjmuje obrazy, wideo i pliki PDF, podczas gdy modalność puli Fugu jest taka, jaką akurat obsługują bazowe agenty, publikuje punkt kontrolny, do którego możesz wrócić, jest sprzedawany wszędzie i ma niezależny, bieżący wpis mierzący to, co faktycznie napędza twój rachunek — 37,8 tokena na sekundę oraz wskaźnik kosztu na zadanie, który możesz zamodelować, zanim się zobowiążesz. Jego słabości są równie konkretne i warte wymienienia: jest wolny, sklasyfikowany na pozycji #154 na 200 pod względem szybkości, jest ogromnie gadatliwy przy 180 milionach tokenów w indeksie, a Artificial Analysis osobno zmierzyło, że jego wskaźnik halucynacji wzrósł z 23% do 40% względem poprzedniej generacji, co jest poważnym problemem dokładnie w przypadku autonomicznej wieloetapowej pracy, do której jest reklamowany. Zaplanuj budżet na weryfikator i agresywnie korzystaj ze zniżki na głęboki cache.
Wybierz Fugu Ultra v2, jeśli Twoja praca jest długoterminowa i weryfikowalna, Twój budżet ma charakter eksploracyjny, a nie produkcyjny, i znajdujesz się poza UE/EOG. Strukturalny argument za koordynatorem jest realny, a własne przykłady dostawcy konsekwentnie na niego wskazują — automatyczne badanie z 123 eksperymentami przez czternaście godzin na pojedynczym H100, solver kostki Rubika w czystym Pythonie, który ukończył wszystkie 300 pomieszanych kostek, podczas gdy dwie anonimowe bazowe linie odniesienia zawiodły całkowicie. To przykłady wybrane przez dostawcę z anonimowymi liniami bazowymi i dowodzą mniej, niż się wydaje, ale wzorzec jest spójny: w zadaniach, w których poprawność jest weryfikowalna, a trudną częścią jest wytrwałość, wygenerowanie weryfikatora bije proszenie jednego modelu o większy wysiłek. To, co kupujesz, to ta wytrwałość, w tempie pięciokrotnie wyższym niż Qwen3.8-Max, w systemie, którego jakości nie możesz audytować, a którego puli nie możesz przypiąć. Przetestuj to w ograniczonym zakresie, mierz tokeny wyjściowe na ukończone zadanie, a nie na token, i ustaw limit przed pierwszym uruchomieniem.

Powód, dla którego metka z ceną podaje niewłaściwą liczbę, jest taki, że oba te produkty oderwały koszt odpowiedzi od kosztu tokena. Fugu Ultra v2 robi to, rozgałęziając się do modeli, których nie wymienia z nazwy. Qwen3.8-Max robi to, myśląc przez 180 milionów tokenów. Jeśli znasz już swój wolumen tokenów na zadanie, arytmetyka jest trywialna i powinieneś to zrobić. Większość zespołów nie zna tej liczby, a dla nich decyzja sprowadza się do czegoś prostszego: Qwen3.8-Max to wybór, który możesz poddać audytowi, wycenić i porzucić, a Fugu Ultra v2 to wybór, który stawia na to, że koordynacja bije możliwości. Oba da się obronić. Tylko jeden z nich przychodzi z dowodami.
Porównane w tym artykule1
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
