
Fugu Ultra v2 vs Kimi K3: Dwa routery, dwie wysokości
- deepseekNOWOŚĆDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiNOWOŚĆOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleNOWOŚĆGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenNOWOŚĆQwen: Qwen3.8 Max (0902)2026-09-0240Inteligencja72Kod
- anthropicNOWOŚĆAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 za 1 mln tokenów
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0340Inteligencja72Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Inteligencja78Kod
- googleGoogle: Gemini 3.6 Flash2026-07-2134Inteligencja69Kod
Oba te systemy to routery i to jest pierwsza rzecz, którą pomija większość omówień. Kimi K3 to model Mixture-of-Experts o 2,8 biliona parametrów, który aktywuje około 104 miliardów parametrów na token — co oznacza, że przy każdym pojedynczym tokenie, który generuje, podejmuje decyzję routingową, wybierając 16 ze swoich 896 ekspertów do wykonania pracy. Fugu Ultra v2, ogłoszony przez Sakana AI 11 września 2026 roku, jest routerem na zupełnie innym poziomie: bierze przychodzące zadanie, dzieli je i rozdziela jego części między pulę osobnych modeli. Jeden routuje wewnątrz pojedynczego przejścia w przód; drugi routuje w obrębie całej floty. Zrozumienie, że to ten sam pomysł w dwóch skalach, to najszybszy sposób, by dostrzec, dlaczego ich ceny różnią się 2× na wejściu i 5× na wyjściu.
Dwa routery, obok siebie
• Kimi K3 — flagowy model Moonshot AI, wydany w połowie lipca 2026 r., a otwarte wagi opublikowano 27 lipca 2026 r. Architektura jest nietypowa nawet jak na standardy 2026 r.: 69 warstw Kimi Delta Attention przeplatanych z 24 warstwami Gated MLA, Attention Residuals, projekt „Stable LatentMoE” oraz enkoder wizyjny MoonViT-V2 z 401 mln parametrów. Wagi są dostarczane w MXFP4 z aktywacjami MXFP8 w ramach treningu świadomego kwantyzacji. Jego hostowane API udostępnia poziom wysiłku rozumowania z dokładnie jedną obsługiwaną wartością — max.
• Fugu Ultra v2 — warstwa orkiestracji o szczytowych możliwościach Sakana AI, a nie model bazowy w zwykłym tego słowa znaczeniu. To pojedynczy punkt końcowy zgodny z OpenAI, który rozkłada zadania i rozdziela je między pulę modeli o otwartych wagach i modeli wyspecjalizowanych. Sakana podaje, że Claude Fable 5, Claude Fable 5.1 i GPT-6 Astra są wykluczone z tej puli, oraz podaje datę odcięcia danych treningowych na 20260828. Nie opublikowano liczby parametrów, ponieważ nie ma parametrów do policzenia w taki sposób, jak w przypadku K3 — możliwości tkwią w polityce szeregowania.
Konsekwencją jest to, że K3 jest komponentem, a Fugu Ultra v2 jest złożeniem. To sprawia, że porównanie to jest nietypowe: te dwa elementy nie tylko konkurują ze sobą, ale mogą być potencjalnymi składnikami. Model taki jak K3 to dokładnie ten rodzaj otwarto‑wagowego, długokontekstowego systemu wywoływania narzędzi, jaki orchestrator mógłby prawdopodobnie wynająć. Sakana nie publikuje składu puli, więc nie wiadomo, czy K3 znajduje się wewnątrz Fugu Ultra v2 — ale jeśli tak, część tego, za co płacisz według stawki Fugu, to tokeny K3 z narzutem.
Czym właściwie jest różnica cen
• Wejście — Fugu Ultra v2 w zgłaszanej cenie 5,00 USD za 1 mln (oferty firm trzecich; strona z ogłoszeniem Sakany nie publikuje własnych stawek) w porównaniu z Kimi K3 w cenie 3,00 USD za 1 mln, przy trafieniach w cache po 0,30 USD.
• Wyjście — Fugu Ultra v2 w podawanej cenie 30,00 USD za 1 mln vs Kimi K3 za 15,00 USD za 1 mln. Połowa ceny za model, który możesz również pobrać.
• Wejście z pamięci podręcznej — Fugu Ultra v2 0,50 USD za 1 mln vs Kimi K3 0,30 USD za 1 mln przy trafieniu w pamięć podręczną. W długiej pętli agenta ze stałym promptem systemowym ta różnica kumuluje się z każdą turą.
• Podział kontekstu na poziomy — Kimi K3 ma stałą stawkę w całym oknie o rozmiarze 1 048 576 tokenów, bez kary za długi kontekst. Podany dla Fugu Ultra v2 poziom cenowy powyżej około 272 000 tokenów wejściowych przenosi całe żądanie do około $10.00 / $45.00.
Ten ostatni wiersz decyduje o rzeczywistych rachunkach. Przebieg agenta o długim horyzoncie przez większość czasu znajduje się powyżej 272 tys. tokenów, czyli dokładnie tam, gdzie stawka ryczałtowa K3 pozostaje stała, a stawka Fugu Ultra v2 się podwaja. Jeśli Twoje obciążenie wygląda podobnie, efektywna różnica po stronie danych wejściowych jest bliższa 3,3× niż 1,7×.

Jedyna liczba, którą mają wspólną
Obaj dostawcy raportują DeepSWE, a porównanie wypada mniej pochlebnie dla Fugu, niż sugeruje narracja z jego premiery. Sakana podaje Fugu Ultra v2 na 74,3. Moonshot podaje Kimi K3 na 67,5 — dane deklarowane przez dostawcę, z karty modelu. To różnica 6,8 punktu w benchmarku dla agentów kodujących — realna, ale to jeden test z dużo większego opublikowanego zestawu i ten sam test, w którym Sakana wyprzedza GPT-5.6 Sol o 1,6 punktu. Benchmark, w którym trzech różnych dostawców mieści się w granicach siedmiu punktów, mierzy coś realnego, ale nie rozdziela ich w rozstrzygający sposób.
Poza tym oba publikują na zupełnie różnych półkach. Wyniki K3 od Moonshot obejmują Terminal-Bench 2.1 na poziomie 88,3, GPQA Diamond 93,5, HLE-Full 43,5 (56,0 z narzędziami), SWE-Marathon 42,0, OSWorld-Verified 84,8 i MCPMark-Verified 94,5 — wszystkie raportowane przez dostawcę, wszystkie na karcie modelu. Osiem wyników Sakany dla Fugu Ultra v2 obejmuje dwa wewnętrzne benchmarki, SWEFish i Toolathon, których nikt poza Sakaną nie jest w stanie odtworzyć.
Niezależnie, tylko jeden z nich został w ogóle zmierzony. Kimi K3 uzyskuje 44 punkty w Artificial Analysis Intelligence Index v4.3 — drugie miejsce wśród modeli o otwartych wagach, za GLM-5.3 z 45 — oraz 93,40% w SWE-bench Verified w standaryzowanym harnessie agentowym Vals AI, za Claude Opus 5 i DeepSeek V4 Pro, ale blisko. Prowadzi także w Frontend Code Arena z wynikiem 1679 Elo, przed Fable 5 z 1631 i GPT-5.6 Sol z 1618. Jeśli widziałeś K3 cytowane z wynikiem 57 lub 60, to jest to zastąpiona skala indeksu i nie należy jej powtarzać.
Fugu Ultra v2 nie ma żadnego niezależnego wyniku. Ogłoszono go 11 września 2026 roku i nikt poza Sakaną go nie uruchomił.
Prędkość: jedna zmierzona, jedna nie
Kimi K3 jest wolny, i jest to zmierzone, a nie twierdzone: Artificial Analysis odnotowuje 37,9 tokena na sekundę przy czasie do pierwszego tokena wynoszącym 3,80 sekundy i oznacza go jako wyraźnie rozwlekły. W przypadku modelu zbudowanego wokół kodowania agentowego w długim horyzoncie przepustowość jest realnym ograniczeniem — wolny model w długiej pętli kosztuje czas rzeczywisty, a nie tylko pieniądze.
Sakana nie publikuje żadnych danych o opóźnieniach ani przepustowości dla Fugu Ultra v2. Jak na orkiestratora, można to uznać za szczere, a nie wymijające, ponieważ czas odpowiedzi zależy w całości od tego, które modele zdecyduje się wywołać i ile przejść wykona. Oznacza to jednak również, że nie można modelować kosztu rzeczywistego czasu przejścia na niego bez samodzielnego zmierzenia go. W przypadku poprzedniego Fugu Ultra testerzy publicznie raportowali przebiegi wydłużające się do około 30 minut; to model z czerwca 2026 r., a nie dowód dotyczący v2, ale to liczba, którą trzeba pobić, gdy przeprowadzasz benchmark.

Otwarte wagi, ale z haczykiem, który warto przeczytać
Wagi Kimi K3 można pobrać, co stanowi rzeczywistą różnicę względem dostępnego wyłącznie w formie hostowanej modelu Fugu Ultra v2 — ale licencja jest węższa, niż zwykle sugeruje sformułowanie „otwarte wagi”. K3 jest udostępniany na licencji Kimi K3, a nie na zatwierdzonej przez OSI licencji MIT lub Apache, a szeroko powtarzane twierdzenie, że jest to „zmodyfikowany MIT”, jest kwestionowane. Warunki wymagają odrębnej umowy z Moonshot w przypadku firm oferujących model jako usługę, których przychody przekraczają 20 mln USD w dowolnych dwunastu kolejnych miesiącach, a także podania atrybucji w produktach przekraczających 100 mln użytkowników miesięcznie lub 20 mln USD miesięcznego przychodu. Użycie wewnętrzne jest zwolnione.
Szczere ujęcie jest takie: K3 daje ci wagi, które możesz mieć, przeglądać, dostrajać i hostować samodzielnie, z zastrzeżeniem komercyjnego warunku uzależnionego od przychodów. Fugu Ultra v2 nie daje ci niczego z tego — żadnych wag, żadnej możliwej do zbadania puli, żadnego samodzielnego hostowania — ale też nie nakłada żadnego warunku dotyczącego przychodów, ponieważ nie ma czego licencjonować. To, które z nich jest bardziej permisywne, zależy wyłącznie od tego, czy jesteś tego rodzaju firmą, do której skierowana jest licencja K3.
Jedno praktyczne zastrzeżenie, jeśli planowany jest self-hosting: checkpoint K3 ma około 1,5 terabajta, a dostawca zaleca 64 lub więcej akceleratorów. „Otwarte wagi” oznaczają tu decyzję o klastrze inferencyjnym, a nie o laptopie. Dla większości zespołów API i tak jest rozsądną ścieżką — dlatego wsparcie dla vLLM i SGLang od dnia zerowego ma większe znaczenie niż samo pobranie.
Co mówi nasz własny ruch
Jeden punkt danych, którego nie publikuje żaden z dostawców, a który jest wart więcej, niż się wydaje: w bramie OrcaRouter Kimi K3 jest najczęściej używanym modelem spośród wszystkich omawianych w tym artykule, i to z dużą przewagą — w ciągu ostatnich siedmiu dni przetworzył około 3,27 miliarda tokenów.
To nie jest benchmark i nie rozstrzyga niczego o jakości. Ale to duża próbka tego, co deweloperzy faktycznie wybierają, gdy decyzja kosztuje ich tylko cenę tokenów, i mówi, że połączenie w K3 okna 1M w stałej stawce, otwartych wag i mocnej pozycji w coding-arena zdobyło już znaczący udział w rzeczywistej pracy agentowej z długim kontekstem. Fugu Ultra v2 nie ma porównywalnego sygnału, ponieważ zadebiutował dziś.

Docieranie do każdego z nich
Kimi K3 jest dostępny w OrcaRouter po stawce samego Moonshot — $3.00 za milion tokenów wejściowych, $0.30 przy trafieniu w pamięć podręczną, $15.00 za milion tokenów wyjściowych — przekazywanej bez marży, więc zmiana ceny przez dostawcę trafia tutaj tego samego dnia, a nie zgodnie z harmonogramem migracji. Jest kompatybilny z OpenAI na tym samym bazowym adresie URL co reszta katalogu, a ponieważ stoi za tą samą bramą co wszystko inne, możesz umieścić go w łańcuchu przełączania awaryjnego lub kierować do niego ruch warunkowo, zamiast zakodowywać jednego dostawcę na sztywno w ścieżce produkcyjnej. Ma to tu większe znaczenie niż zwykle: model o 2,8 biliona parametrów obsługiwany z prędkością 37,9 tokena na sekundę to dokładnie ten rodzaj zależności, za którym warto mieć mechanizm awaryjny.
Fugu Ultra v2 nie przechodzi przez nasz routing. Jest dostępny we własnym API Sakana AI zgodnym z OpenAI, a firma twierdzi, że istniejące integracje Fugu przechodzą na nie po zmianie jednego parametru. Oba modele obsługują ten sam format żądań, więc ewaluacja, która umieszcza je pod jedną flagą, to podmiana bazowego URL-a, a nie przepisanie kodu.
Które wybrać
Kimi K3 to zakup łatwiejszy do obrony w przypadku niemal każdego obciążenia. Jest o połowę tańszy niż Fugu Ultra v2 zarówno na wejściu, jak i na wyjściu, ma stałą stawkę w oknie 1M bez skoku przy długim kontekście, został niezależnie oceniony na 44 w aktualnym indeksie Artificial Analysis, można go hostować samodzielnie na licencji warunkowanej przychodem i już jest modelem o największym ruchu w tym porównaniu, i to z dużą przewagą. Jego koszt to szybkość i gadatliwość: 37,9 tokena na sekundę to naprawdę wolno w pętlach agentowych, a licencja ma ostre zapisy, jeśli prowadzisz duży biznes model-as-a-service.
Fugu Ultra v2 to zakup dla ciebie, jeśli chcesz konkretnej właściwości, którą sprzedaje Sakana — poziomu możliwości, który rozkłada trudną wieloetapową pracę na pulę, która strukturalnie wyklucza dostawców frontier, tak aby żaden pojedynczy model źródłowy nie mógł zostać odwołany, zmieniony cenowo ani odcięty pod tobą. Jego przewaga DeepSWE nad K3 jest prawdziwa i raportowana przez dostawcę; jego miejsce w pierwszej dwójce w siedmiu z ośmiu benchmarków również jest raportowane przez dostawcę, a na testach, które częściowo nie istnieją nigdzie indziej.
Warto zauważyć, że oba te przypadki to decyzje routingowe, a od ciebie oczekuje się wyboru wysokości. K3 kieruje tokeny do ekspertów wewnątrz modelu, który możesz pobrać i kontrolować. Fugu Ultra v2 kieruje zadania do modeli, których nie możesz zobaczyć. Druga z tych decyzji jest większą, potężniejszą ideą. Jest też tą, którą możesz przyjąć wyłącznie na wiarę — a przyjęcie jej na wiarę kosztuje pięć razy więcej za token.
Porównane w tym artykule1
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
