
Sakana Fugu Ultra v2, wyjaśnienie: pula się zmniejszyła, a wynik wzrósł
- deepseekNOWOŚĆDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiNOWOŚĆOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleNOWOŚĆGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenNOWOŚĆQwen: Qwen3.8 Max (0902)2026-09-0240Inteligencja72Kod
- anthropicNOWOŚĆAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 za 1 mln tokenów
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0340Inteligencja72Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligencja78Kod
- googleGoogle: Gemini 3.6 Flash2026-07-2134Inteligencja69Kod
Fugu Ultra v2 to dziwny rodzaj ulepszenia: Sakana AI wypuściła go 11 września 2026 r. z pulą modeli, która nie zawiera już Claude Fable 5, Claude Fable 5.1 ani GPT-6 Astra — trzech najsilniejszych systemów obecnie dostępnych — a mimo to wciąż twierdzi, że bije wszystkie trzy. Nowy flagowiec tokijskiego laboratorium z wyższej półki jakościowej, wydany tego samego dnia co tańszy model siostrzany o nazwie Fugu Max, jest najlepszy lub ex aequo najlepszy w pięciu z ośmiu benchmarków w własnej ewaluacji Sakany, w tym 48,3 w Chartography wobec 27,3 Claude Opus 5 i 29,5 Claude Fable 5 oraz 74,3 w DeepSWE. Żadna z tych liczb nie została niezależnie odtworzona, a nadal nie ma strony Artificial Analysis dla żadnego modelu Fugu. Ta luka to sedno sprawy: to, co próbuje się wam sprzedać, to warstwa koordynacyjna, której cały argument sprzedażowy sprowadza się do tego, że nie potrzebuje najlepszych modeli, by dawać najlepsze odpowiedzi.
Sakana AI zostało założone w 2023 roku przez Lliona Jonesa, współautora pracy o Transformerze, oraz Davida Ha. Linia Fugu zadebiutowała w czerwcu 2026 roku jako system wieloagentowy dostarczany jako pojedynczy model: wywołujesz jeden endpoint zgodny z OpenAI, a za nim wytrenowany koordynator rozkłada żądanie, uruchamia agentów i syntetyzuje wynik. Badania są prawdziwe i opublikowane — TRINITY (arXiv 2512.04695) wyewoluowała lekkiego koordynatora, który przypisuje role Thinker, Worker i Verifier; Conductor (arXiv 2512.04388) nauczył się koordynacji między agentami w języku naturalnym; raport techniczny Fugu można znaleźć pod arXiv 2606.21228. Tym, czego Sakana nigdy nie opublikowała, jest to, czego wszyscy naprawdę pragną: tożsamości modeli w puli oraz decyzji routingu dla poszczególnych zadań.
Co właściwie zmieniło się względem czerwcowego Fugu Ultra?
Wersja 2.0 to odświeżenie punktowe mniej więcej jedenaście tygodni po oryginale, a nie nowa architektura. Według samego dostawcy Fugu Ultra v2 i Fugu Max to „ta sama podstawowa architektura orkiestracji” dostrojona do dwóch różnych misji: Max przesuwa granicę stosunku kosztów do wydajności w dół, a Ultra podnosi szczytowe możliwości w górę. Identyfikator modelu to fugu-ultra-v2.0, a Sakana twierdzi, że migracja z wcześniejszego Fugu to zmiana jednego parametru w jednej linii, bez migracji SDK — co jest najbardziej przyjaznym dla konsumenta elementem tego wydania.
Zasadnicze zmiany to dwa elementy tworzące klamrę. Po pierwsze, data odcięcia treningu przesunęła się na 20260828, więc koordynator został dostrojony na nowo względem obecnej generacji modeli frontierowych. Po drugie — i znacznie ciekawiej — skład puli zmienił się w sposób, który Sakana postanowiła nagłośnić: Claude Fable 5, Claude Fable 5.1 i GPT-6 Astra są wprost wykluczone. Argument Sakany jest taki, że dowodzi to, iż wyniki nie zależą od pojedynczego własnościowego modelu frontierowego, co ma znaczenie, jeśli obawiasz się uzależnienia od dostawcy, cofnięć dostępu do API lub zniknięcia modelu wskutek kontroli eksportowych.
Istnieje konsekwencja drugiego rzędu, nad którą Sakana się nie rozwodzi. Jeśli pula wyklucza trzy najsilniejsze dostępne modele, to porównania benchmarkowe z Fable 5 i Fable 5.1 są przeprowadzane z systemami, których orkiestrator nie mógłby wywołać, nawet gdyby chciał. Porównanie jest zasadne — to twierdzenie o architekturze, a nie o dostępie — ale nie jest to test w identycznych warunkach odpowiadający na pytanie, kto ma lepszy model. To test tego, czy koordynacja przewyższa surowe możliwości. To naprawdę interesujące pytanie. Po prostu nie jest to pytanie, które tabela wyników sugeruje na pierwszy rzut oka.

Liczby i to, kto je wygenerował
Każda liczba w tej sekcji jest raportowana przez dostawcę. Sakana nie udostępniła żadnego zestawu narzędzi do ewaluacji, żadnej siatki wyników dla poszczególnych zadań ani żadnego przepisu na reprodukcję, a konstrukcja orkiestracji sprawia, że niezależna replikacja jest trudniejsza, a nie łatwiejsza: odtworzenie wyniku wymaga dostępu do każdego modelu w puli w tych samych wersjach i z tą samą topologią, a z założenia topologia różni się w zależności od żądania.
• Chartografia (rozumowanie wizualne na wykresach i dokumentach strukturalnych) — Fugu Ultra v2 48,3, Claude Opus 5 27,3, Claude Fable 5 29,5 — według danych dostawcy
• DeepSWE (rzeczywista inżynieria oprogramowania) — Fugu Ultra v2 74,3 — według dostawcy; podobno przewyższa modele kosztujące za token od trzech do pięciu razy więcej
• Najlepsza lub ex aequo najlepsza pozycja — w pięciu z ośmiu benchmarków: GDP.pdf, Chartography, SWEFish, DeepSWE i Toolathon — według dostawcy
• Miejsce w pierwszej dwójce — siedem z ośmiu benchmarków — według danych dostawcy
• Poprzedni Fugu Ultra (czerwiec 2026, dla porównania) — LiveCodeBench 93.2, GPQA-Diamond 95.5, TerminalBench 82.1, SWE-Bench Pro 73.7 — raportowane przez dostawcę
Wiersz Chartography zasługuje na nacisk, jaki otrzymuje, ponieważ to jedyna kategoria, w której luka do nazwanego, aktualnego flagowego modelu nie jest marginalna. Przewaga 21 punktów nad Claude Opus 5 w benchmarku rozumowania wizualnego to liczba, która zwykle pojawia się w niezależnym rankingu w ciągu kilku dni. Na moment pisania tego tekstu nie pojawił się żaden. Traktuj ten wiersz jako hipotezę z przypisaną do niej kwotą w dolarach, a nie jako ustalony wynik.
Ceny: bez zmian od czerwca, a pod względem wyników — po prostu drogo.
Fugu Ultra v2 kosztuje 5 USD za milion tokenów wejściowych, 30 USD za milion tokenów wyjściowych i 0,50 USD za milion tokenów wejściowych z pamięci podręcznej. Powyżej 272 000 tokenów kontekstu stawki te wynoszą odpowiednio 10 USD, 45 USD i 1,00 USD. Fugu Max ma zupełnie inny układ: 2 USD za wejście, 6 USD za wyjście, 0,25 USD za pamięć podręczną, stałe niezależnie od długości kontekstu, plus 0,007 USD za wyszukiwanie w internecie lub wywołanie pobrania.
Dwie rzeczy w tej tabeli cen warto uważnie przeczytać. Pierwsza: wyjście jest sześć razy większe niż wejście — agresywny współczynnik, który wycenia gadatliwość modelu, a orkiestracja to rozwlekła działalność. Koordynator, który tworzy agentów i syntetyzuje ich odpowiedzi, emituje mnóstwo tokenów, a płacisz za wszystkie po $30 za milion. Deklaracja efektywności Sakany dotyczy bazowej puli, a nie tego, ile tekstu system wytwarza w twoim imieniu — a to są różne liczby. Planuj budżet na podstawie zaobserwowanej liczby tokenów, a nie stawki z nagłówka.
Drugi to klif 272K. Podwojenie stawki za token powyżej progu to uzasadniony sposób wyceniania pracy z długim kontekstem, ale oznacza, że rzeczywisty koszt uruchomienia agenta z długim kontekstem to nie liczba ze strony z cennikiem. Jeśli Twoje obciążenie znajduje się blisko granicy, arytmetyka zmienia się istotnie po obu jej stronach.
Poziomy subskrypcji Fugu — Standard za $20, Pro za $100, Max za $200 miesięcznie, z przydziałami 10x i 20x — wszystkie obejmują dostęp do Fugu, Fugu Ultra i Fugu Max. Sakana wycenia również bazowy model Fugu według najwyższego poziomu obecnego w puli dla danego żądania i jasno stwierdza, że dodawanie kolejnych agentów nie mnoży rachunku. To rzeczywista różnica względem modelu kosztów fan-out, jaki uzyskałbyś, samodzielnie wywołując kilka modeli frontierowych.
Czego Sakana ci nie powie
Zapytaj, które modele odpowiedziały na Twoje pytanie, a FAQ odpowiada wprost: „te informacje o routingu nie są ujawniane celowo”. Pule Ultra i Max są stałe, więc nie możesz zrezygnować z dostawcy; tylko bazowy model Fugu obsługuje rezygnację z poszczególnych modeli w ustawieniach konsoli. Klienci Enterprise mogą negocjować niestandardowe konfiguracje.
Ta nieprzejrzystość jest sednem krytyki, z jaką linia Fugu spotyka się od czerwca, i jest to krytyka uzasadniona, a nie wroga. Kiedy orkiestrator osiąga dobry wynik, łącząc modele innych laboratoriów, wynik należy do systemu — co jest rzeczą realną i możliwą do obrony w sprzedaży — ale nie przenosi się na żaden pojedynczy model i nie można go audytować. Recenzenci ujęli to bez ogródek: Fugu nie pobił flagowca, tylko go zatrudnił. W przypadku zadań weryfikowalnych z tanim mechanizmem sprawdzającym, takich jak benchmark kodowania z zestawem testów, komitet naprawdę może przewyższyć swojego najlepszego członka. W przypadku zadań bez takiego mechanizmu panel próbkujący kilka modeli frontier i raportujący najlepszy wynik częściowo raportuje szczęście. Własne wybory kategorii Sakany — Chartography, DeepSWE, Toolathon — skłaniają się ku weryfikowalnemu końcowi, co jest właściwym miejscem na wysunięcie tego twierdzenia, a także powodem, dla którego twierdzenia tego nie można uogólnić za darmo.
Niezależni testerzy również zwrócili uwagę na zmienność opóźnień jako praktyczny koszt orkiestracji: przy trudnych zadaniach koordynator prowadzi deliberacje, a przy łatwych zadaniach takie rozważanie jest czystym narzutem. Według doniesień zadanie jednego badacza dotyczące shadera zajęło około trzydziestu minut, a jakość oceniono jedynie jako akceptowalną.

Gdzie faktycznie można to dostać
Fugu Ultra v2 jest już dostępny przez własne API Sakany kompatybilne z OpenAI — wystarczy skierować istniejącego klienta na endpoint z kluczem API i zmienić jedną linię — oraz przez kilka platform zewnętrznych. OrcaRouter nie oferuje modeli Fugu; jeśli chcesz wywołać Fugu Ultra v2, bezpośrednią drogą jest własne API dostawcy.
Warto zauważyć, z jaką alternatywą Sakana konkuruje w sposób dorozumiany. Pula, dzięki której działa Fugu Ultra v2, składa się z modeli, które można dziś wywoływać pojedynczo, a rywale, z którymi jest porównywany, to ci, których zespoły już używają. Claude Opus 5, DeepSeek V4 Pro i Gemini 3.1 Pro są dostępne w OrcaRouter w cenach katalogowych swoich dostawców z 0% marży, co oznacza, że obniżka cen od któregokolwiek z tych dostawców obowiązuje u nas tego samego dnia, w którym zostanie ogłoszona. Jeśli powodem, dla którego rozważasz orkiestrator, jest odporność — niechęć do tego, by ścieżka produkcyjna zależała od dostępności jednego dostawcy albo polityki jednego dostawcy — to warstwa routingu z automatycznym przełączaniem awaryjnym między dostawcami rozwiązuje część tego problemu na poziomie modelu, a Fugu Ultra v2 rozwiązuje inną część na poziomie rozumowania.Jedno API dla ponad 200 modeli z automatycznym przełączaniem awaryjnym nie zastępuje wytrenowanego koordynatora, a wytrenowany koordynator nie zastępuje braku zależności od jednego dostawcy. Niektóre zespoły będą chciały obu.
Haczyk zgodności
Fugu nie jest dostępny w Unii Europejskiej ani w Europejskim Obszarze Gospodarczym. Sformułowanie dostawcy jest jednoznaczne: jeszcze niedostępny w UE/EOG, ponieważ pracuje nad zgodnością z RODO i przepisami specyficznymi dla UE, a w innych regionach dostęp może być ograniczony przez warunki sieciowe lub lokalne przepisy. Jeśli w zakresie działania Twojej organizacji znajdują się podmioty w UE, wyklucza to linię Fugu z rozważań niezależnie od wyników testów porównawczych, co warto wiedzieć przed oceną, a nie po niej.

Co obejrzeć
Trzy rzeczy przesunęłyby Fugu Ultra v2 z interesującego twierdzenia do wyboru, na którym można się oprzeć. Niezależna ocena — wpis w Artificial Analysis, pozycja w LMArena, cokolwiek, za czym stoi stanowisko testowe — rozstrzygnęłaby kwestię Chartography w ciągu tygodnia. Powtórzone przez stronę trzecią liczby na weryfikowalnych benchmarkach kodowania potwierdziłyby zysk na poziomie systemu, który przewiduje architektura. A ujawniona pula, albo choćby częściowa, pozwoliłaby nabywcom ocenić, na jakie dokładnie pojedyncze punkty awarii się godzą, gdy kierują ruch produkcyjny przez koordynatora, którego nie mogą sprawdzić.
Do tego czasu uczciwe stanowisko jest takie. Fugu Ultra v2 to najpoważniejsza jak dotąd próba sprzedaży orkiestracji jako produktu, a nie badawczego demo, ze strony laboratorium z opublikowanymi pracami na koncie, w cenie, która czyni premię za orkiestrację jawną, a nie ukrytą. Jeśli twoje obciążenie jest długoterminowe, weryfikowalne i ograniczone do regionu, w którym Sakana może cię obsłużyć, warto przeprowadzić pilotaż o ograniczonym zakresie z włączonym rozliczaniem tokenów. Jeśli nie, modele, z którymi porównuje się Fugu Ultra v2, są o jedno wywołanie API dalej, w cenie katalogowej, z dowodami potwierdzającymi, co potrafią.
Porównane w tym artykule3
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
