Wygenerowana karta tytułowa z napisem „FrogNano-4B-2609 vs Qwen 3.8” i podtytułem „agent 4B na twoim własnym GPU kontra hostowany flagowiec 2,4T”, trzy plakietki z napisami „9,32 GB do pobrania”, „2 USD za wejście / 6 USD za wyjście za milion” i „do 150 kroków na zadanie”, stopka z napisem „Dane FrogNano za Microsoftem; ceny Qwen3.8-Max za Alibabą. Nic tutaj nie jest niezależne” oraz logo OrcaRouter złożone w prawym dolnym rogu.
Guides & Insights

FrogNano-4B-2609 vs Qwen 3.8: Ile kosztuje agent kodujący, gdy wagi są Twoje

Autor

Magnus Corvin

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

microsoft/FrogNano-4B-2609 to agent repozytorium klasy czterech miliardów parametrów oparty na Qwen3.5-4B, który samodzielnie pobierasz i hostujesz. Qwen3.8-Max to hostowany model flagowy — rzadka mieszanka ekspertów o 2,4 biliona parametrów, z około 95 miliardami parametrów aktywnych na token, multimodalnym oknem miliona tokenów oraz cennikiem 2,00 USD za milion tokenów wejściowych i 6,00 USD za milion tokenów wyjściowych — dostępny za pomocą klucza API od 3 sierpnia 2026 r. Jeden z nich kosztuje GPU i popołudnie. Drugi nie kosztuje nic, dopóki go nie użyjesz, a potem nalicza opłaty za token w przypadku najdłuższych trajektorii powszechnie używanych. Tym prawdziwym starciem jest właśnie ten kompromis, a nie tabela benchmarków.

Podane tutaj wartości FrogNano pochodzą z karty modelu i raportu technicznego Microsoftu; wartości Qwen3.8-Max pochodzą z opublikowanego cennika Alibaba oraz wpisu modelu w naszym własnym katalogu, a niezależne wyniki są oznaczone jako dane Artificial Analysis wszędzie tam, gdzie się pojawiają. Proszę uważnie zwrócić uwagę na nazewnictwo: Qwen3.8, wydanie open-weights, zostało ogłoszone, ale nie zostało jeszcze udostępnione, natomiast Qwen3.8-Max jest już dostępny i ma dzisiejszą cenę. Wszystko, co można wywołać w tym artykule, dotyczy tego drugiego.

Arytmetyka, która decyduje o porównaniu

Zacznij od tego, ile kosztuje pojedyncze zadanie, bo to nie jest oczywiste i nie jest małe.

Ewaluacje FrogNano przeprowadzały każdą trajektorię z budżetem 150 kroków w łącznym limicie około 131K tokenów, przy maksymalnie 8192 wygenerowanych tokenach na turę asystenta i pułapie 10 800 sekund. Pomnóż dwa opublikowane limity, a otrzymasz pułap około 1,23 mln wygenerowanych tokenów dla jednej trajektorii w najgorszym scenariuszu — co przy stawce Qwen3.8-Max wynoszącej $6.00 za milion tokenów wyjściowych daje około $7.00 za pojedyncze zadanie, które dotrwało do końca swojego budżetu. To arytmetyka na dwóch opublikowanych liczbach, a nie pomiar: rzeczywiste trajektorie zatrzymują się wcześniej, średnia jest znacznie poniżej pułapu, a wyniki narzędzi i dane wyjściowe powłoki są rozliczane według tańszej stawki wejściowej, a nie wyjściowej. Ale to ustala kształt zjawiska. Agent kodujący nie zużywa kilkuset tokenów na pytanie; odbywa długą, pełną rozumowania rozmowę z samym sobą, a każdy token tej rozmowy jest generowany.

Teraz postaw obok tego drugą stronę bilansu. FrogNano-4B-2609 to 9,32 GB wag BF16 w dwóch shardach, do pobrania bez bramki. Do jego serwowania potrzebny jest SGLang z parserem rozumowania Qwen3 i parserem wywołań narzędzi Qwen3 coder, a do tego izolowany sandbox dla pięciu narzędzi. Potem koszt krańcowy trajektorii to prąd, a pamięć, którą zajmuje, to to, do czego rozrośnie się twój kontekst, a nie to, ile ważą wagi.

• Model kosztów — FrogNano-4B-2609 to stały koszt sprzętowy i niemal zerowy koszt krańcowy. Qwen3.8-Max to zerowy koszt stały i rozliczanie za token, z podziałem $2.00 / $6.00, który nic nie obciąża z góry, a wszystko obciąża na końcu według stawki wyjściowej.

• Co dostajesz za te pieniądze — agent klasy 4B na własnym sprzęcie kontra model w skali frontier, którego nigdy nie musisz planować pod kątem przepustowości.

• Próg rentowności — osiąga się go, gdy miesięczny wolumen trajektorii pomnożony przez średni koszt tokenów na trajektorię przewyższa koszt GPU, który w przeciwnym razie musiałbyś wynająć. Dla zespołu wykonującego kilka zadań w repozytorium dziennie do tej granicy jeszcze daleko, a model hostowany wygrywa już samą wygodą.

Dwa modele, które nie robią tego samego

Porównanie kosztów jest uczciwe tylko wtedy, gdy wyniki są porównywalne, a tutaj takie nie są — i to jest właśnie ten element, który większość kart specyfikacji pomija.

FrogNano-4B-2609 was post-trained exclusively on repository-level software engineering. Its whole interface is a five-tool loop — Read, Write, Edit, Glob and Bash — executed by the Leaf harness in an isolated sandbox, iterating until the model stops calling. Microsoft's card states its supported language as English and its validated programming domain as Python, and says outright that image and video components in the checkpoint were never post-trained and are not supported. It does not reason about your architecture, answer questions about your business, or read a screenshot.

Qwen3.8-Max to model ogólnego przeznaczenia. Rekord katalogowy firmy Alibaba określa, że przyjmuje tekst, obraz i wideo na wejściu, zwraca tekst na wyjściu i ma okno kontekstowe o długości 1 000 000 tokenów. Rozumuje, pisze, czyta dokumenty i prowadzi rozmowę, a jego wywoływanie funkcji jest cechą modelu ogólnego przeznaczenia, a nie całym sensem tego checkpointu. Jego wyniki Artificial Analysis, odczytane z rekordu 2 września 2026 r., to Intelligence Index wynoszący 45,4 i Coding Index wynoszący 76,2.

• Dane wejściowe — FrogNano-4B-2609 obsługuje wyłącznie tekst. Qwen3.8-Max przyjmuje tekst, obrazy i wideo.

• Kontekst — około 131 tys. łącznych tokenów w ocenianej konfiguracji FrogNano, w porównaniu z 1 000 000 dla Qwen3.8-Max. To czynnik siedmiu i pół, a ma to największe znaczenie dokładnie w przypadku danych wejściowych o rozmiarze repozytorium, jakie otrzymuje agent kodujący.

• Wyjście na turę — zwalidowana konfiguracja FrogNano ogranicza pojedynczą turę asystenta do 8 192 tokenów. Qwen3.8-Max nie publikuje równoważnego limitu na odpowiedź.

• Format wyjściowy — FrogNano emituje strukturalne wywołania narzędzi Leaf i potrzebuje harnessu, który je wykona. Qwen3.8-Max zwraca prozę lub wywołanie funkcji do dowolnego klienta, którego już masz.

• Niezależne wyniki — brak dla FrogNano-4B-2609 poza jego własną kartą; powyższe dane Qwen3.8-Max pochodzą od stron trzecich, z Artificial Analysis.

• Parametry — około 4,66 mld dla FrogNano według opisu na jego własnej karcie, w porównaniu z 2,4 biliona łącznie i około 95 mld aktywnych dla Qwen3.8-Max.

A screenshot of the OrcaRouter model page for Qwen3.8 Max showing the breadcrumb Home, Models, Qwen; the model name and the qwen/qwen3.8-max model id; the FEATURED badge with Vision, Tools, JSON and Reasoning capability chips; the 1M-token context, text, image and video input and text output row; the $2.00 and $6.00 per-million price cards with the p50 TTFT figure; the byline 'by Qwen, 2026-08-03'; the on-page section list for Code samples, Pricing, Performance, Public benchmarks, Community buzz, How it compares and FAQ; and the opening of the long description describing Qwen3.8-Max as Alibaba's newest flagship.

Gdzie 4B faktycznie zasługuje na swoje miejsce

Istnieje jedna oś, na której agent 4B bezapelacyjnie pokonuje model klasy frontier — i nie jest to dokładność.

Praca FrogNano zaczyna od Qwen3.5-4B, który jako zwykły model ogólnego przeznaczenia uzyskał 39,4% w SWE-bench Verified za pośrednictwem harnessa Leaf. Pięć iteracji uczenia ze wzmocnieniem na około 1500 syntetycznych zadaniach podniosło go do 61,5%, a aneks tej samej pracy podaje progresję w poszczególnych iteracjach jako 48,2%, 53,4%, 58,3%, 58,6% i 61,6%. Metoda — generowanie zadań skalibrowanych do granicy uczenia się bieżącego modelu, bez destylacji z silniejszego modelu — jest wkładem tej pracy i powodem, dla którego grupa badawcza niemająca modelu z czołówki miałaby się tym zainteresować.

Przeczytaj, co to oznacza dla porównania. Karta Microsoftu otwarcie przyznaje, że FrogNano nie jest jednolicie lepszy od modelu, z którego powstał: jego wskaźnik równoległych wywołań narzędzi wynosi 1,71%, ponieważ późniejsze iteracje utraciły zdolność do wysyłania równoległych wywołań, a zespół dodał etap konsolidacji, aby spróbować go odzyskać. Model, który rozwiązuje więcej problemów, a jednocześnie staje się gorszy w jednym konkretnym zachowaniu, jest prawdziwym artefaktem inżynieryjnym z widocznymi szwami, a jego karta mówi o tym wprost, zamiast to ukrywać.

A liczba dla SWE-bench to zamknięta pętla. Wynik bazowy modelu bazowego, harness i końcowy rezultat pochodzą z tego samego laboratorium, a dwie tabele w tym samym artykule podają dwie różne drabinki dla tego samego eksperymentu. Wynik Qwen3.8-Max w zakresie kodowania został natomiast uzyskany przez Artificial Analysis, a nie przez Alibaba — inny rodzaj dowodu, inny rodzaj pewności, i tych dwóch nigdy nie należy odejmować od siebie.

4B, którego nie da się jeszcze do końca uwzględnić w planach

Dwie rzeczy stoją między FrogNano-4B-2609 a slotem produkcyjnym, i obie znajdują się w jego własnej dokumentacji, a nie w opinii jakiegokolwiek recenzenta.

Pierwszy to sprzęt. Karta podaje wymaganie dotyczące wag BF16 na około 9,3 GB, a następnie dodaje, że pamięć „znacznie rośnie, gdy połączony kontekst zbliża się do około 131 tys. tokenów”, po czym stwierdza, że dokładny minimalny model GPU, konfiguracja VRAM, wersje środowiska uruchomieniowego i profil wydajności „muszą jeszcze zostać zweryfikowane przed wydaniem” — zdanie, które pojawia się przy modelu już dostępnym do pobrania. Nikt nie opublikował wartości VRAM dla ocenianej konfiguracji, a karta jej nie zawiera.

Drugą jest postawa wobec bezpieczeństwa. Sama notatka Microsoftu dotycząca alignmentu mówi, że dostrajanie po treningu specyficzne dla agenta nie wykorzystywało żadnych zestawów danych dotyczących preferencji bezpieczeństwa, odmów, szkodliwych treści ani danych adwersarialnych, że zamiast tego zoptymalizowano je pod kątem poprawności funkcjonalnej i unikania regresji oraz że modelu „nie należy uznawać za niezależnie wyrównanego pod względem bezpieczeństwa do nieograniczonego wdrożenia autonomicznego”. Karta kończy się wymienieniem konkretnych ryzyk: łatki mogą być niepoprawne lub niebezpieczne, mimo że przechodzą testy, skuteczność jest wrażliwa na jakość tych testów, a każda kandydacka łatka wymaga przed użyciem wykwalifikowanego przeglądu przez człowieka oraz niezależnych testów regresyjnych i bezpieczeństwa. Ogólny model hostowany nie ma żadnych z tych konkretnych zastrzeżeń, a ponadto nie uruchomi polecenia powłoki w Twoim repozytorium.

Jeden klucz dla dowolnej strony, którą wybierzesz

Przydatne w praktycznym przeprowadzeniu tego porównania jest to, że tylko jedna jego połowa to pobieranie. Qwen3.8-Max oraz modele ogólnego przeznaczenia, z którymi porównywałbyś agenta hostowanego samodzielnie, są dostępne przez jeden punkt końcowy zgodny z OpenAI na OrcaRouter przy 0% narzutu — cena katalogowa dostawcy przekazywana bez zmian, więc zmiana ceny u dostawcy trafia na naszą stronę tego samego dnia, a to jest liczba, która faktycznie się zmienia, gdy rachunek za tokeny wyjściowe agenta kodującego jest tym, co próbujesz kontrolować. To dodatkowo upraszcza kwestię przełączania awaryjnego: jeśli hostowana połowa twojego potoku ulegnie degradacji, ponowna próba następuje automatycznie i eksperyment toczy się dalej.

FrogNano-4B-2609 nie jest jedną z naszych tras i nie ma dla niego daty. Wagi są do Twojej dyspozycji, a karta uczciwie informuje, że konfiguracja serwowania nie została w pełni zwalidowana. Możemy natomiast sprawić, że druga strona porównania będzie kosztować nic, jeśli chodzi o przygotowanie, dzięki czemu pytanie, na które ostatecznie odpowiesz, będzie tym właściwym — czy zgłaszany przez dostawcę agent SWE-bench z wynikiem 61,5% na Twoim własnym GPU pokonuje rozliczany model frontier na Twoich własnych zadaniach, przy Twoim własnym wolumenie.

A generated two-column scoreboard titled 'FrogNano-4B-2609 vs Qwen3.8-Max'. The left column reads Cost your GPU, electricity; Output tool calls and patches; Context about 131K evaluated; Input text only; Published score 61.5% SWE-bench Verified, vendor, unreproduced; Turn cap 8,192 tokens. The right column reads Cost $2.00 in / $6.00 out per million; Output prose or function call; Context 1,000,000 tokens; Input text, image, video; Published score AA Intelligence 45.4 and AA Coding 76.2, third-party; Turn cap not published. A footer reads 'FrogNano figures per Microsoft; Qwen3.8-Max scores per Artificial Analysis. Different benchmarks; not comparable.'

Po który sięgnąć?

Sięgaj po Qwen3.8-Max, gdy praca ma charakter ogólny, gdy za moce powinien odpowiadać zespół operacyjny kogoś innego, gdy dane wejściowe mogą zawierać obraz lub długi dokument albo gdy odpowiedź jest potrzebna jeszcze dziś, a nie stos serwujący do piątku. Jego wyniki od stron trzecich oznaczają, że można z grubsza przewidzieć, co się kupuje, a rozliczenie za token to koszt zmienny, który widzisz przed podjęciem zobowiązania. Dla zespołu realizującego umiarkowaną liczbę zadań repozytoryjnych miesięcznie kalkulacja nie pozostawia wątpliwości.

Sięgnij po FrogNano-4B-2609, gdy wolumen jest na tyle wysoki, że ograniczeniem staje się rozliczanie za token przy długich trajektoriach, gdy dane nie mogą opuścić Twojej infrastruktury albo gdy pytanie badawcze — czy małego agenta można wytrenować do kompetencji na poziomie repozytorium bez nauczyciela — jest tym, co faktycznie testujesz. Przystępując do tego, wiedz o trzech rzeczach: te 61,5% to własny pomiar laboratorium na utrzymywanym przez laboratorium harnessie, nikt nie opublikował wartości VRAM dla ocenianej konfiguracji, a sama karta mówi, że konfiguracja serwowania nie została jeszcze zweryfikowana.

Co czyni to zestawienie wartym opisania, to fakt, że mają wspólnego przodka dwa pokolenia wstecz. FrogNano wywodzi się z Qwen3.5-4B — modelu ogólnego przeznaczenia od tej samej firmy, której flagowy model o 2,4 biliona parametrów znajduje się po drugiej stronie tej strony. Microsoft wziął ten mały model, przeprowadził pięć iteracji RL na syntetycznych repozytoriach i uzyskał specjalistę. Alibaba poszła odwrotną drogą i postawiła na skalowanie. Oba rozwiązania są opublikowane, a różnica między tym, ile kosztuje pobranie, a tym, ile kosztuje API, to uczciwy sposób wyboru między nimi.

A screenshot of the microsoft/FrogNano GitHub repository README showing the description that FrogNano evaluates coding agents with the Leaf harness in isolated Kubernetes sandboxes against OpenAI-compatible endpoints and five tools Read, Write, Edit, Glob and Bash; the requirements list naming a Kubernetes cluster with pod and network-policy permissions and an OpenAI-compatible endpoint with reasoning and tool-call parsers configured for Qwen3.5; the frognano-eval run commands; and the benchmark table listing SWE-bench Verified at 500 tasks with an 8,192-token cap, SWE-bench Pro at 731 with 32,000, Terminal-Bench 2.0 Verified at 89 with 32,000 and PatchEval Verified at 230 with 8,192.

Porównane w tym artykule1

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie