
Fugu Ultra v2 kontra Gemini 3.1 Pro: przeciwnik, który może już być wewnątrz maszyny
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów
- orcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów
- deepseekNOWOŚĆDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencja76Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Istnieje wersja porównania Fugu Ultra v2 vs Gemini 3.1 Pro, w której Gemini wygrywa niezależnie od tego, jak wypadnie benchmark — ponieważ może wykonywać część pracy. System orkiestracji Sakana AI, wydany 11 września 2026 r., nie ujawnia, które modele koordynuje; raportowana pula modeli czerwcowego Fugu Ultra obejmowała między innymi Gemini 3.1 Pro, a wersja 2.0 mówi nam tylko, co usunęła, wymieniając Claude Fable 5, Claude Fable 5.1 i GPT-6 Astra jako wykluczone. Gemini 3.1 Pro od Google to pojedynczy multimodalny model frontierowy z kontekstem 1 mln tokenów, obsługujący tekst, obrazy, pliki PDF, dźwięk i wideo, ogólnie dostępny od maja 2026 r. w cenie 2,00 USD za milion tokenów wejściowych i 12,00 USD za milion tokenów wyjściowych. Jeden z nich to model, który możesz zbadać. Drugi to system, którego zwycięstwa w benchmarkach mogą przechodzić przez ten pierwszy, a żaden z dostawców nie powie ci, czy tak jest.
Czym tak naprawdę jest każdy system
Gemini 3.1 Pro jest czytelny w sposób, który stał się rzadkością wśród wydań modeli frontier. To rzadki transformer typu mixture-of-experts opracowany przez Google DeepMind, po raz pierwszy udostępniony w wersji zapoznawczej 19 lutego 2026 r., a jedno źródło datuje ogólną dostępność na maj 2026 r. — nasz własny wykaz zawiera go pod identyfikatorem modelu w wersji zapoznawczej. Ma okno wejściowe o rozmiarze 1 mln tokenów i limit wyjściowy 65 tys. tokenów, obsługuje tekst, obrazy, pliki PDF, dźwięk, wideo i kod oraz udostępnia trójstopniową kontrolę rozumowania — niski, średni lub wysoki — przy czym poziom wysoki jest domyślny w API. Google podaje 77,1% w ARC-AGI-2, ponad dwukrotnie więcej niż 31,1% w poprzedniej generacji; 94,3% w GPQA Diamond; 80,6% w SWE-bench Verified; 68,5% w Terminal-Bench 2.0; 85,9% w BrowseComp; i 44,4% w Humanity's Last Exam bez narzędzi, a przy wyszukiwaniu i wykonywaniu kodu wzrasta do 51,4%. To dane producenta. Jego data odcięcia wiedzy to styczeń 2025 r., co warto zaznaczyć, jeśli Twoja praca zależy od ostatnich wydarzeń.
Fugu Ultra v2 to koordynator. Jest to wytrenowany model, o którym mówi się, że ma około 7 mld parametrów, który czyta żądanie, tworzy zespół agentów z rolami Thinker, Worker i Verifier zaczerpniętymi z badań Sakany nad TRINITY i syntetyzuje odpowiedź za punktem końcowym zgodnym z OpenAI. Nie ma własnej opublikowanej listy modalności — cokolwiek może zobaczyć, widzi, ponieważ widzi to model z jego puli. Jego kontekst wynosi 1 mln tokenów, z ostrym progiem cenowym przy 272 tys., gdzie stawki podwajają się do 10 USD za wejście i 45 USD za wyjście. Jego limit wyjściowy nie został opublikowany. Jego pula nie jest ujawniona, jego decyzje dotyczące routingu są „celowo nieujawniane”, a dla poziomu Ultra pula jest stała, więc nie można wykluczyć dostawcy.
Ta asymetria to cała istota tego starcia. Gemini 3.1 Pro to komponent, który można kupić bezpośrednio i o którym można rozumować. Fugu Ultra v2 to z kolei złożenie, którego części nie można zobaczyć, a którego najśmielsze twierdzenia dotyczące benchmarków mogą być częściowo wynikami samego Gemini połączonymi z wynikami kogoś innego.

Porównanie, w którym te dwa się pokrywają
Bardzo niewiele opublikowanych danych pozwala zestawić te dwa systemy w tym samym wierszu. Podane poniżej wyniki Gemini 3.1 Pro są danymi samego Google'a; wyniki Fugu Ultra v2 są danymi samej Sakany; tam, gdzie agregator zewnętrzny opublikował wspólny wiersz, jest to oznaczone i opatrzone zastrzeżeniem, że ma charakter orientacyjny, a nie rozstrzygający.
• Rozumowanie multimodalne (CharXiv, wspólny wiersz) — Fugu Ultra v2 86,6% vs Gemini 3.1 Pro 80,2%, według BenchLM, który określa tę kategorię jako orientacyjną i odmawia wskazania zwycięzcy
• TerminalBench 2.1 — brak wyniku dla Fugu Ultra v2 v2.0 w porównaniu z Gemini 3.1 Pro; brak porównywalnego opublikowanego wyniku; czerwcowy Fugu Ultra odnotował 82,1% wobec 70,3% Gemini 3.1 Pro w agregacji podmiotów trzecich
• SWE-Bench Pro — brak danych dla Fugu Ultra v2 v2.0 w porównaniu z Gemini 3.1 Pro; brak porównywalnych opublikowanych danych; czerwcowy Fugu Ultra odnotował 73,7% wobec 54,2% Gemini 3.1 Pro
• ARC-AGI-2 — brak wyniku dla Fugu Ultra v2 w porównaniu z Gemini 3.1 Pro 77,1%, według dostawcy
• Humanity's Last Exam — brak wyniku dla Fugu Ultra v2 v2.0 w porównaniu z Gemini 3.1 Pro: 44,4% bez narzędzi, 51,4% z narzędziami, dane dostawcy
• Zakres modalności — Fugu Ultra v2 dziedziczy wszystko, co obsługuje jego pula; nieujawniony w przeciwieństwie do Gemini 3.1 Pro: tekst, obraz, PDF, audio, wideo i kod, udokumentowane
Cena wejścia / wyjścia — Fugu Ultra v2: 5,00 / 30,00 USD za 1 mln, podwaja się powyżej 272 tys. w porównaniu z Gemini 3.1 Pro: 2,00 / 12,00 USD za 1 mln do 200 tys., 4,00 / 18,00 USD powyżej, cena wejścia z pamięci podręcznej: 0,20 / 0,40 USD
• Kontekst i wyjście — Fugu Ultra v2: kontekst 1M, niepublikowany limit wyjścia vs Gemini 3.1 Pro: 1M wejścia, 65K wyjścia
• Wagi i dostęp — Fugu Ultra v2 zamknięty, z wyłączeniem UE/EOG vs Gemini 3.1 Pro zastrzeżony, ale szeroko dostępny w usługach Google
Wiersz multimodalny to ten, który trzeba traktować ostrożnie, bo jest najczęściej cytowany, a zarazem najmniej solidny. Agregacja CharXiv w BenchLM stawia Fugu Ultra v2 wyżej o 6,4 punktu znormalizowanego — a ta sama strona wprost stwierdza, że wiersze kierunkowe nigdy nie otrzymują zwycięzcy, że Gemini nie miał zmierzonych wyników w kategoriach agentowych, kodowania, wiedzy ani wielojęzyczności, oraz że Fugu nie miał żadnych w matematyce ani wielojęzyczności. Kategoria, w której w większości wierszy zmierzono tylko jedną stronę, nie może dać werdyktu. Jeśli z tego porównania nie wyniesiesz nic innego, wynieś to: konkretnie w zakresie zadań multimodalnych opublikowane dowody nie pozwalają wyciągnąć wniosku w żadną stronę, a jedyny istniejący wiersz wprost nie jest rozstrzygniętym wynikiem.
Możliwość, która zmienia ramę
Sakana nie powie, co znajduje się w puli. To udokumentowana decyzja projektowa, a nie przeoczenie — FAQ mówi, że informacje o routingu nie są ujawniane celowo i nie istnieje żaden mechanizm, by je sprawdzić. Wiemy z generacji czerwcowej, że wśród zgłoszonych członków puli znalazł się Gemini 3.1 Pro obok innych modeli frontier. Wersja 2.0 zmieniła pulę, a Sakana opisała tę zmianę wyłącznie przez odejmowanie: Claude Fable 5, Claude Fable 5.1 i GPT-6 Astra wypadają. Nic w informacji o wydaniu nie mówi, że Gemini nadal w niej jest.
Jeśli Gemini 3.1 Pro jest w puli, wynikają z tego trzy konsekwencje — wszystkie trzy praktyczne, a nie filozoficzne. Po pierwsze, pewna część multimodalnej wydajności Fugu Ultra v2 to wydajność Gemini połączona z wydajnością innych modeli — co oznacza, że płacisz premię za koordynację ponad stawkę za token, którą mógłbyś zapłacić bezpośrednio. Po drugie, Fugu Ultra v2 przy 30 USD za milion tokenów wyjściowych w porównaniu z Gemini 3.1 Pro przy 12 USD to premia za złożenie, a nie za surową zdolność; jeśli twoje zadanie to pojedyncze pytanie multimodalne, Gemini odpowie taniej, a ty możesz dokładnie zobaczyć, który model odpowiedział. Po trzecie — i najprzydatniejsze — uczciwy benchmark orkiestratora to nie pytanie „czy przewyższa swoje komponenty?”, lecz „czy przewyższa swój najlepszy komponent, gdy używasz go samodzielnie?”. Architektura Sakany opiera się na twierdzeniu, że tak jest w przypadku zadań weryfikowalnych. To twierdzenie warto sprawdzić na własnym obciążeniu roboczym, zanim zaakceptujesz je na podstawie benchmarku czytania wykresów.
Istnieje wersja, w której odpowiedź brzmi „nie”, a orkiestrator nadal zasługuje na swoje miejsce. Jeśli Gemini jest w puli, a wynik Fugu Ultra v2 w Chartography wynoszący 48,3 w zestawieniu z 27,3 Claude Opus 5 się utrzyma, to to, co zbudowała Sakana, jest warstwą koordynacyjną, która niezawodnie wydobywa z tego samego modelu więcej, niż można uzyskać, wywołując go raz. To prawdziwy produkt, a otwartym pytaniem pozostaje tylko, czy marża pokrywa cenę. Nikt nie opublikował tego eksperymentu.

Gdzie są uczciwe krawędzie
Zalety Gemini 3.1 Pro są konkretne. Jest to około dwóch piątych ceny Fugu Ultra v2 za dane wejściowe i wyjściowe, a w przeciwieństwie do Fugu jego stawki nie podwajają się po przekroczeniu progu kontekstu — skok przy 200K jest łagodniejszy niż klif przy 272K. Dokumentuje swoje modalności, zamiast je dziedziczyć, co oznacza, że praca z dźwiękiem i wideo jest obsługiwaną funkcją, a nie nadzieją. Ma opublikowany limit wyjściowy. Jest dostępny za pośrednictwem własnych powierzchni Google i, podobnie jak inne modele, z którymi porównywany jest Fugu Ultra v2, można go wywołać w OrcaRouter — jako google/gemini-3.1-pro-preview, w cenie katalogowej Google z 0% narzutu, więc zmiana ceny Google trafia na ten sam klucz tego samego dnia, w którym zostanie ogłoszona.
Zalety Fugu Ultra v2 są węższe i rzeczywiste. Atakuje trudny problem więcej niż raz, a rola Weryfikatora sprawdza wykonaną pracę, dlatego jego najmocniejsze twierdzenia opierają się na benchmarkach, w których poprawność można sprawdzić — Chartography, DeepSWE, Toolathon — a nie na odtwarzaniu wiedzy. Opublikowane studia przypadków Sakany wskazują w tym samym kierunku: mechaniczna przysłona CAD, która otwiera się i zamyka poprawnie tam, gdzie inne modele pozostawiły luki i słabe połączenia; rozwiązywacz kostki Rubika w czystym Pythonie, który ukończył wszystkie 300 pomieszanych kostek, podczas gdy dwie zanonimizowane wiodące modele referencyjne uległy całkowitej awarii. Te modele referencyjne są zanonimizowane i wybrane przez dostawcę, więc traktuj je jako ilustrację, a nie dowód. Ale ten wzorzec jest spójny w całym wydaniu i opisuje autentyczną zdolność, której nie ma pojedyncze wywołanie modelu: uporczywość w pracy nad problemem, dopóki odpowiedź nie przejdzie sprawdzenia.
Weź też pod uwagę ograniczenia. Fugu Ultra v2 nie jest sprzedawany w UE ani w EOG, a Sakana wyraźnie deklaruje, że pracuje nad zgodnością z RODO. Gemini 3.1 Pro nie ma takiego ograniczenia i ma za sobą znacznie dłuższą historię niezależnych ocen.

Werdykt
Dla większości zadań multimodalnych Gemini 3.1 Pro to właściwy wybór i nie ma tu nawet bliskiej konkurencji. Jest tańszy w przeliczeniu na token, tańszy w przeliczeniu na dokument, udokumentowany pod kątem audio i wideo, ograniczony progiem kontekstu, który nie podwaja rachunku w trakcie pracy, a — co tutaj najważniejsze — widzisz, co ci odpowiedziało. Jeśli potrzebujesz jednego modelu, który przeczyta PDF, obejrzy klip i odpowie na pytanie, nie ma żadnego argumentu za kierowaniem tego przez nieujawnioną pulę przy dwuipółkrotnie wyższej cenie wyjściowej.
Fugu Ultra v2 to właściwy wybór dla konkretnego i znacznie węższego rodzaju pracy: zadań długoterminowych z weryfikowalną odpowiedzią, gdzie próbowanie rozwiązania problemu trzema sposobami i weryfikowanie wyniku jest lepsze niż próbowanie raz, a marginalny punkt jakości jest wart tej wielokrotności. Nie wchodzi w ogóle w rachubę, jeśli w zakresie masz użytkowników z UE lub EOG.
Niewygodne pytanie, które pozostawia otwarte to starcie, jest tym, którego nikt nie zmierzył. Jeśli Gemini 3.1 Pro znajduje się w puli — a jedyną uczciwą odpowiedzią dzisiaj jest to, że Sakana nie powiedziała, że go tam nie ma — to część tego, co kupujesz wraz z Fugu Ultra v2, stanowi Gemini 3.1 Pro z warstwą koordynacyjną na wierzchu, w cenie, która sugeruje, że warstwa jest warta około dwa i pół raza tyle, co model. To może być jak najbardziej prawdą. Architektura Sakany powstała, by uczynić to prawdą. Ale to hipoteza, za którą stoi tabela wyników dostawcy, a nie niezależny test, i dopóki ktoś tego nie przetestuje, model, który widzisz, jest tym, którego możesz bronić.
