
Fugu Ultra v2 vs Claude Opus 5: ta sama cena wejściowa, dwa różne zakłady
- deepseekNOWOŚĆDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiNOWOŚĆOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleNOWOŚĆGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenNOWOŚĆQwen: Qwen3.8 Max (0902)2026-09-0240Inteligencja72Kod
- anthropicNOWOŚĆAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 za 1 mln tokenów
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0340Inteligencja72Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligencja78Kod
- googleGoogle: Gemini 3.6 Flash2026-07-2134Inteligencja69Kod
Fugu Ultra v2 and Claude Opus 5 cost exactly the same amount to ask a question and wildly different amounts to get an answer out of. Both list at $5.00 per million input tokens. Then Fugu Ultra v2 charges $30.00 per million output tokens against Claude Opus 5's $25.00 — and the gap between those two numbers is not a rounding difference, because the two systems emit very different quantities of text to reach an answer. Sakana AI shipped Fugu Ultra v2 on September 11, 2026 as an orchestration system that coordinates a pool of other labs' models behind one OpenAI-compatible endpoint; Anthropic's Claude Opus 5, live since late July 2026, is a single model. That difference decides most of this comparison before a benchmark is consulted, and Sakana's own scoreboard has an awkward row in it: the vendor reports 48.3 on Chartography against Claude Opus 5's 27.3, which is the largest margin in the release and also the number with the least outside evidence behind it.
Zbieg okoliczności, który kształtuje wszystko
Zacznij od tego, w czym oba produkty się zgadzają, ponieważ to wykracza poza cenę z nagłówka.
• Cena wejściowa — Fugu Ultra v2 5,00 USD za 1 mln tokenów vs Claude Opus 5 5,00 USD za 1 mln tokenów
• Cena wyjściowa — Fugu Ultra v2 30,00 USD za 1 mln tokenów vs Claude Opus 5 25,00 USD za 1 mln tokenów
• Dane wejściowe z pamięci podręcznej — Fugu Ultra v2: 0,50 USD za 1 mln powyżej stawki podstawowej w porównaniu z Claude Opus 5, który wycenia buforowanie jako zniżkę do 90% na danych wejściowych z pamięci podręcznej
• Kontekst — Fugu Ultra v2: 1 mln tokenów, przy czym stawki podwajają się powyżej 272 tys., w porównaniu z Claude Opus 5: 1 mln tokenów, stawki stałe
• Limit wyjściowy — Fugu Ultra v2 nie jest podany jako pojedyncza wartość w porównaniu z Claude Opus 5 128K tokenów
• Dostępność — Fugu Ultra v2 nie jest sprzedawany w UE/EOG, podczas gdy Claude Opus 5 jest ogólnie dostępny na standardowych warunkach API
• Dowody — benchmarki Fugu Ultra v2 raportowane przez dostawcę, brak jeszcze niezależnej oceny w porównaniu z benchmarkami Claude Opus 5 raportowanymi przez dostawcę oraz wielomiesięcznymi pozycjami w rankingach stron trzecich
Ten ostatni wiersz to miejsce, w którym porównanie faktycznie się przechyla. Przy tej samej cenie wejściowej wybierasz między systemem, którego wyniki musisz przyjmować na wiarę, a modelem, którego wyniki odtworzyli inni. Próg 272K dodatkowo to potęguje: po przekroczeniu tego progu stawka wejściowa Fugu Ultra v2 podwaja się do $10, a wyjściowa do $45, podczas gdy stawka Claude Opus 5 się nie zmienia. W przypadku długokontekstowych uruchomień agentowych — dokładnie tego obciążenia, dla którego zbudowano Fugu Ultra v2 — przewaga cenowa niższej ceny z nagłówka znika dokładnie tam, gdzie system ma błyszczeć.

Czym każdy z nich właściwie jest
Claude Opus 5 is Anthropic's production flagship, and its design is legible from the outside. It runs adaptive thinking by default, deciding how long to reason before it answers, with an explicit effort dial from low to max when you want to force deeper deliberation and pay for it. It carries a 1M-token context window, a 128K output ceiling, vision, tool use and JSON mode. Anthropic reports 96.0% on SWE-bench Verified and 79.2% on SWE-bench Pro, more than doubling its predecessor's Frontier-Bench v0.1 result, and roughly 30.2% on ARC-AGI 3 against 7.8% for GPT-5.6 Sol — all vendor figures, and all of them measured on a single model you can pin by version. It also routes flagged requests to an older model rather than erroring, which is an operational detail that matters if you have compliance review in the loop.
Fugu Ultra v2 nie jest tym, a różnica nie jest kosmetyczna. To koordynator — niewielki wytrenowany model, według doniesień o około 7 mld parametrów, który odczytuje Twoje żądanie, kompletuje zespół agentów, przydziela role Thinker, Worker i Verifier z pracy Sakany nad TRINITY i syntetyzuje ostateczną odpowiedź. Modele leżące u podstaw nie są ujawniane, decyzje dotyczące routingu nie są z założenia ujawniane, a w przypadku poziomu Ultra pula jest stała: nie można wykluczyć żadnego dostawcy. Sama Sakana ujmuje wersję 2 tak: data odcięcia danych treningowych przesunęła się na 28 sierpnia 2026 r., a skład puli się zmienił — konkretnie po to, by wykluczyć Claude Fable 5, Claude Fable 5.1 i GPT-6 Astra.
To wykluczenie jest najbardziej wymownym szczegółem w tym komunikacie. Fugu Ultra v2 twierdzi, że wygrywa benchmarki z trzema najsilniejszymi dostępnymi modelami, jednocześnie potwierdzając, że nie wywołuje żadnego z nich. Cokolwiek ta pula zawiera, nie jest to czołówka rynku według własnych obliczeń Sakany. Przekaz jest taki, że koordynacja bije możliwości. To prawdziwa teza, a w przypadku weryfikowalnych zadań z tanim mechanizmem sprawdzającym to teza poparta dowodami. To nie to samo co twierdzenie „ten system jest mądrzejszy niż Claude Opus 5”, a tablica wyników jest ułożona tak, że łatwo pomylić jedno z drugim.
Tablica wyników, którą wybrała Sakana
Każda liczba poniżej pochodzi z własnej ewaluacji Fugu Ultra v2 przeprowadzonej przez Sakanę. Dane Claude’a Opus 5 pochodzą z pomiarów wykonanych przez Sakanę w tym samym porównaniu, z wyjątkiem przypadków, w których zaznaczono inaczej. Żadna niezależna strona trzecia nie odtworzyła kolumny Fugu, a w chwili pisania tego tekstu nie istnieje wpis Artificial Analysis dla żadnego modelu Fugu.
• Chartography — Fugu Ultra v2 48,3 vs Claude Opus 5 27,3 — według dostawcy, 21-punktowa różnica
• DeepSWE — Fugu Ultra v2 74,3 w porównaniu z brakiem opublikowanego wyniku dla Claude Opus 5 w tej samej tabeli — raportowane przez dostawcę
• Pozycja w benchmarkach — Fugu Ultra v2 najlepszy lub ex aequo najlepszy w pięciu z ośmiu, w pierwszej dwójce w siedmiu z ośmiu — dane producenta
• SWE-bench Verified — brak wyniku dla Fugu Ultra v2 w porównaniu z Claude Opus 5 96,0% — według Anthropic
• SWE-bench Pro — brak wyniku dla Fugu Ultra v2 w porównaniu z Claude Opus 5 79,2% — według Anthropic
• ARC-AGI 3 — brak wyniku dla Fugu Ultra v2 w porównaniu z Claude Opus 5 ~30,2% — zgłoszone przez Anthropic
Odczytaj to jako kształt, a nie ranking. Sakana opublikowała tablicę ośmiu benchmarków, na której wygrywa w pięciu, a najsilniejsze publicznie udokumentowane wyniki Claude'a Opus 5 — wiersze SWE-bench, ARC-AGI 3 — po prostu się na niej nie znajdują. To nie jest oskarżenie o złą wiarę; tak wygląda tablica wyników dostawcy, w tym każdego dostawcy. Ale to oznacza, że nie można wywnioskować z tej publikacji, że Fugu Ultra v2 bije Claude'a Opus 5 w inżynierii oprogramowania, ponieważ oba systemy nie były mierzone na tych samych wierszach wystarczająco często, by to stwierdzić. W jednym wierszu, w którym oba się pojawiają i obie liczby są publiczne — Chartography — Fugu Ultra v2 twierdzi, że odniosła duże zwycięstwo. W najszerszych wierszach rozumowania i kodowania tylko jedna strona opublikowała.

Koszt za zadanie, nie koszt za token
Rachunek orkiestratora za tokeny to nie jego stawka za token. Fugu Ultra v2 uruchamia agentów, z których każdy wnosi tokeny rozumowania i wyjściowe, a sam koordynator generuje tekst syntezy. FAQ Sakany dotyczące cen zawiera tu naprawdę przydatne zobowiązanie — naliczana jest jedna uśredniona stawka oparta na użytym modelu najwyższej klasy, a dodawanie agentów nie mnoży rachunku — co usuwa mnożenie przy rozgałęzieniu w najgorszym przypadku, które czyni naiwne konfiguracje wieloagentowe kosztownymi. Nie usuwa jednak wolumenu. Ilość rozliczanych tokenów wyjściowych nadal zależy od tego, ilu agentów działało i ile napisały, a przy $30 za milion ten wolumen jest zmienną, której nie da się przewidzieć ze strony cennika.
Kształt kosztów Claude Opus 5 jest odwrotny. Jedno wywołanie, jeden model, pokrętło wysiłku, które kontrolujesz, oraz stawka 25 USD za wyjście, z przetwarzaniem wsadowym dostępnym 50% taniej w przypadku pracy niewymagającej czasu rzeczywistego. Możesz to prognozować. W przypadku obciążenia uruchamianego dziesięć tysięcy razy dziennie przewidywalność jest warta znacznie więcej niż przewaga benchmarkowa w zadaniu polegającym na czytaniu wykresów.
This is also where the routing question separates cleanly from the model question. Claude Opus 5 sits on OrcaRouter at Anthropic's list price with 0% markup — the provider's rate passed through, so a vendor price change is live on the same key the same day, with automatic failover across provider paths if one is rate-limited or down. Fugu Ultra v2 is not on our catalogue; it reaches you through Sakana's own OpenAI-compatible API and several third-party platforms, and migrating from an earlier Fugu is a one-line parameter change. If what you actually want is Claude Opus 5's predictability with less single-provider exposure, the router is the answer and the orchestrator is not. If what you want is a system that tries several approaches to a hard problem without you writing the fan-out, Fugu Ultra v2 is the thing that does that — and you should pilot it with token accounting on.
Gdzie Fugu Ultra v2 naprawdę wygrywa
Oddajmy systemowi, co mu się należy. Wynik Chartography, jeśli się utrzyma, jest rodzajem zwycięstwa, które pojedynczym modelom trudno podrobić: rozumowanie wizualne nad ustrukturyzowanymi dokumentami nagradza próbę odczytu, sprawdzenie go z dokumentem i próbę ponowną — i właśnie do tego służy rola Verifier. Ta sama logika odnosi się do Toolathon i DeepSWE, gdzie odpowiedź można przetestować, a nie spierać się o nią. Opublikowane studia przypadków Sakany wskazują w tym samym kierunku: przebieg AutoResearch z 123 eksperymentami przez czternaście godzin na jednym H100, solver kostki Rubika w czystym Pythonie, który rozwiązał wszystkie 300 pomieszanych kostek tam, gdzie dwa anonimowe modele bazowe frontier uległy całkowitej awarii, mechaniczna przesłona irysowa CAD, która naprawdę się otwiera i zamyka. To przykłady wybrane przez dostawcę, z anonimowymi modelami bazowymi, więc dowodzą mniej, niż się wydaje. Ale wzorzec jest spójny i wskazuje na realną kategorię: zadania, w których poprawność można sprawdzić, a trudna część to wytrwałość.
Jest też argument strukturalny, który nie ma nic wspólnego z benchmarkami. Claude Opus 5 to model jednego dostawcy, podlegający decyzjom cenowym, harmonogramowi wycofania i polityce tego samego dostawcy. Fugu Ultra v2 został zaprojektowany tak, by przetrwać, gdy którakolwiek z tych rzeczy się zmieni, a Sakana wprost mówi, że właśnie o to chodzi — uzależnienie od dostawcy, cofanie dostępów do API, kontrole eksportu. Na rynku, na którym modele bywają wycofywane z regionów niemal bez ostrzeżenia, nie jest to hipotetyczne. To zabezpieczenie, a zabezpieczenia kosztują: 5 dolarów więcej za milion tokenów wyjściowych to w przybliżeniu cena tego zabezpieczenia.
Werdykt
Claude Opus 5 wygrywa decyzję, którą większość zespołów faktycznie podejmuje. Ma za sobą miesiące niezależnej ewaluacji, okno 1 mln tokenów, którego cena nie podwaja się w połowie dokumentu, limit wyjściowy 128K, publikowaną cenę, którą można prognozować, pokrętło wysiłku pozwalające kupować rozumowanie tylko wtedy, gdy zadanie na to zasługuje, oraz wyniki stron trzecich na dokładnie tych benchmarkach — SWE-bench Verified, SWE-bench Pro, ARC-AGI 3 — na których zespołom zajmującym się agentami i kodowaniem zależy najbardziej. Fugu Ultra v2 wygrywa węższe i ciekawsze pytanie: czy koordynator z mniejszą pulą może przewyższyć model flagowy w zadaniach, w których odpowiedź da się sprawdzić. Własna tablica wyników Sakany mówi, że tak, w pięciu z ośmiu wierszy, a wykluczenie z puli wskazuje, że zwycięstwo odniesiono bez trzech najlepszych modeli świata.
If you run verifiable, long-horizon, checkable work and you are outside the EU/EEA, Fugu Ultra v2 is worth a scoped pilot — measure output tokens per completed task, not per token, and set a ceiling before you start. If you need a production path today with evidence behind it and a bill you can forecast, Claude Opus 5 remains the better-evidenced call, and it is one API key away at Anthropic's list price with the provider's rate passed through untouched.

Porównane w tym artykule1
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
