Wygenerowana karta tytułowa z napisem „FrogNano-4B-2609 vs Gemma 4 12B” i podtytułem „agent repozytoriów 4B kontra multimodalny generalista 11,95B”, trzy plakietki z napisami „61,5% SWE-bench, zgłoszone przez dostawcę”, „72,0% LiveCodeBench, zgłoszone przez dostawcę” i „brak wspólnego benchmarku”, stopka z napisem „Różne benchmarki bez nakładania się; obie tablice wyników zgłoszone przez dostawcę” oraz logo OrcaRouter nałożone w prawym dolnym rogu.
Guides & Insights

FrogNano-4B-2609 vs Gemma 4 12B: 61,5% w SWE-bench i nikt tego nie sprawdził

Autor

Elias Hawthorne

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

firmy MicrosoftFrogNano-4B-2609 to agent kodujący klasy czterech miliardów wywodzący się z Qwen3.5-4B, który osiąga 61,5% w SWE-bench Verified. Gemma 4 12B to multimodalny model DeepMind bez enkodera o 11,95 miliarda parametrów, a jego karta podaje 72,0% w LiveCodeBench v6. To są te dwie liczby, które kupujący postawi obok siebie, a stawianie ich obok siebie jest błędem. Pochodzą z różnych benchmarków, różnych systemów testowych, różnych laboratoriów i — co ważniejsze — tylko jedna z nich ma opublikowaną metodologię oceny, którą przeczytał ktoś z zewnątrz. Wszystko inne w tym zestawieniu sprowadza się do pytania, czym każdy z modeli faktycznie jest, a odpowiedź brzmi: nie są one wcale tą samą kategorią rzeczy.

Dane liczbowe FrogNano poniżej pochodzą z karty modelu Microsoftu i jego raportu technicznego; oba są publicznie dostępne od września i żadnego z nich nie odtworzył nikt spoza laboratorium. Dane liczbowe Gemma 4 12B pochodzą z karty modelu Google'a, która również jest dokumentem dostawcy — różnica polega na tym, że za liczbami Gemmy stoi dwadzieścia tygodni wnikliwej analizy i około 2,6 miliona pobrań, a FrogNano ma za sobą dwa tygodnie i licznik pobrań, który nie wyszedł poza jednocyfrowe wartości.

Do czego służy każdy model

To jest ta część, którą ukrywa karta specyfikacji. FrogNano-4B-2609 nie jest modelem ogólnym, który przypadkiem dobrze radzi sobie z kodem. To checkpoint, którego cały trening po wstępnym stanowiła inżynieria oprogramowania na poziomie repozytorium i który zaprojektowano tak, by sterował nim harness, a nie by prowadzić z nim rozmowy.

Jego pięć narzędzi to Read, Write, Edit, Glob i Bash. Emituje do nich wywołania, piaskownica wykonuje je i zwraca dane wyjściowe, a pętla działa, dopóki model nie przestanie ich żądać. Oceniana konfiguracja obejmuje 150 kroków interakcji w ramach około 131 tys. łącznych tokenów i wygenerowała kandydującą łatę dla każdego zadania. Karta Microsoftu wyraźnie stwierdza, że model jest przeznaczony dla repozytoriów angielskojęzycznych, w dużym stopniu opartych na Pythonie, z odtwarzalnymi środowiskami i wykonywalnymi zestawami testów, oraz że komponenty obrazu i wideo odziedziczone z modelu bazowego nigdy nie były poddawane dostrajaniu i nie są obsługiwane.

Gemma 4 12B ma przeciwny kształt. To 48-warstwowy zunifikowany model z kontekstem 256K i bez osobnego kodera wizji ani audio — surowe fragmenty obrazu i przebiegi fal dźwiękowych są rzutowane bezpośrednio do przestrzeni osadzeń pojedynczego dekodera przez lekkie warstwy liniowe. Przyjmuje tekst, obraz i dźwięk, a wyprowadza tekst. Ma tryb myślenia wyzwalany tokenem w prompcie systemowym, natywne wywoływanie funkcji, a karta Google celowo wymienia przepływy pracy agentowej wśród zamierzonych zastosowań.

Tak więc prawdziwym pytaniem nie jest to, który z nich jest mądrzejszy. Jest nim to, czy chcesz wyspecjalizowanego komponentu, który działa tylko w ramach zestawu, który musisz obsługiwać, czy ogólnego modelu, który przyzwoicie radzi sobie z wieloma rzeczami i może być wywoływany przez cokolwiek.

A screenshot of the google/gemma-4-12B-it model card on Hugging Face showing the Gemma 4 12B Unified heading, the Any-to-Any, Transformers, Safetensors and image-text-to-text tags, the Apache 2.0 license line credited to Google DeepMind, and the model overview explaining that text, audio, image and video inputs are handled without separate encoders.

Linia po linii, tam gdzie faktycznie się różnią.

• Parametry — FrogNano-4B-2609 podaje przedział „500M-5B” na karcie, której własny opis mówi o około 4,66 miliarda; pobranie rozstrzyga to na 9,32 GB wag BF16. Gemma 4 12B ma 11,95B, podane raz i bez żadnych zastrzeżeń. Stosunek wynosi około 2,6 do jednego i widać go bezpośrednio w tym, co musisz wynająć.

• Kontekst — oceniana konfiguracja FrogNano obejmuje około 131 tys. łącznych tokenów, przy czym rozumowanie i dane wyjściowe narzędzi dzielą ten budżet. Gemma 4 12B ma 256 000 tokenów, a samodzielnie w wierszu dotyczącym długiego kontekstu osiąga 43,4% w MRCR v2 z ośmioma igłami przy 128K. Niemal dwukrotnie większe okno, a druga liczba to opublikowany pomiar, a nie deklaracja możliwości.

• Modalność — FrogNano-4B-2609 to tekst na wejściu i tekst na wyjściu, mimo że w jego checkpointcie znajduje się wieża wizyjna. Gemma 4 12B przyjmuje tekst, obrazy i dźwięk.

• Limit wyjściowy — zwalidowana konfiguracja FrogNano pozwala na 8192 wygenerowanych tokenów na turę asystenta, a w jej karcie odnotowano, że konfiguracja treningu RL używała tego samego limitu. Gemma 4 12B nie publikuje równoważnego limitu dla pojedynczej tury; ograniczeniem jest tam okno 256K.

• Interfejs agentowy — FrogNano emituje strukturalne wywołania Leaf i potrzebuje środowiska wykonawczego, aby je wykonywać. Gemma 4 12B oferuje natywne wywoływanie funkcji w wersji dostrojonej do instrukcji i można ją wywoływać bezpośrednio.

• Licencja — Gemma 4 12B jest objęta licencją Apache 2.0 na warunkach Google dotyczących Gemma 4, co jest jasno podane. Karta FrogNano wskazuje MIT w części wstępnej, a Apache 2.0 w samej treści, co jest rodzajem niejednoznaczności, która trafia raczej do przeglądu prawnego niż do przypisu.

• Liczby — FrogNano podaje 61,5% w SWE-bench Verified, 37,6% w SWE-bench Pro, 31,1% w Terminal-Bench 2.0 i 47,3% w PatchEval-Verified. Gemma 4 12B podaje 77,2% w MMLU Pro, 72,0% w LiveCodeBench v6, ELO 1659 w Codeforces, 78,8% w GPQA Diamond i 69,0% w Tau2. Karta Google nie publikuje wiersza SWE-bench, a karta Microsoftu nie publikuje LiveCodeBench. Te dwie tablice wyników w ogóle się nie pokrywają.

Ten ostatni punkt powinien położyć kres instynktowi porównywania na podstawie liczb. Ani jeden benchmark nie występuje na obu kartach. Czytelnik, który zestawia 61,5 z 72,0, porównał wskaźnik rozwiązywania repozytoriów ze wskaźnikiem zaliczeń w programowaniu konkurencyjnym, co jest mniej więcej jak porównywanie czasu maratonu z czasem biegu na sto metrów, ponieważ oba są wyrażone w sekundach.

Dlaczego milczenie Google w sprawie SWE-bench nie jest sygnałem ostrzegawczym

Kuszący wniosek z listy wypunktowanej jest taki, że FrogNano ma prawdziwy wynik SWE-bench, a Gemma nie, więc FrogNano wygrywa w kwestii kodowania. To jednak nie wynika, z powodu, który warto precyzyjnie wyjaśnić.

Gemma 4 12B raportuje Tau2 na poziomie 69,0% — benchmark użycia narzędzi w trybie agentowym w trzech przebiegach — wraz z obsługą wywoływania funkcji i wyraźnym pozycjonowaniem do przepływów pracy agentowych. Model, który uzyskuje 69,0 w Tau2, nie jest modelem, który nie potrafi wykonywać pracy agentowej; to model, którego dostawca zdecydował się raportować wydajność użycia narzędzi, a nie rozwiązywanie repozytoriów. Google nie podaje również wierszy SWE-bench dla 26B ani 31B, co jest redakcyjnym wyborem dla całej rodziny, a nie słabością 12B.

Tymczasem kontrintuicyjny wynik z samego artykułu Microsoftu powinien uważnie przeczytać każdy nabywca Gemmy. FrogNano wychodzi od Qwen3.5-4B, modelu ogólnego, który uzyskał 39,4% w SWE-bench Verified dzięki harnessowi Leaf. Pięć rund uczenia ze wzmocnieniem na około 1500 zadaniach syntetycznych przesunęło go do 61,5%. Wniosek nie brzmi „małe modele nie potrafią kodować” — chodzi o to, że ogólny checkpoint 4B z wynikiem 39,4% już rozwiązywał ponad jedną trzecią trudnego, zweryfikowanego przez ludzi zestawu zgłoszeń, gdy ktoś uruchomił go w kompetentnej pętli agentowej. Gemma 4 12B jest trzykrotnie większa i dojrzalsza o dwadzieścia tygodni. Nikt nie uruchomił jej przez Leaf i dopóki ktoś tego nie zrobi, „Gemma nie jest agentem repozytoryjnym” pozostaje założeniem, a nie ustaleniem.

Podatek od harnessu, który tablice wyników całkowicie ukrywają

Oto praktyczna asymetria — i to ona decyduje o zakupie.

Gemma 4 12B to model. Pobierz 11,95 mld wag, skieruj na nie Transformers, vLLM lub SGLang, wyślij tekst, otrzymaj tekst. Google publikuje ścieżkę serwowania, licencja jest jednoznaczna, a ludzie stojący za 2,6 mln pobrań już natrafili na niedoskonałości i je udokumentowali. Jeśli zadanie brzmi „podsumuj ten ślad stosu”, „przeczytaj ten zrzut ekranu i powiedz, co jest zepsute” albo „wywołaj tę funkcję z tymi argumentami”, to działa już dziś.

FrogNano-4B-2609 to model oraz harness, a własne README Microsoftu czyni ten harness obowiązkowym. Repozytorium pod adresem github.com/microsoft/FrogNano to zestaw ewaluacyjny Leaf, a nie kod treningowy — wymaga klastra Kubernetes, istniejącej przestrzeni nazw, uprawnień do zarządzania podami i politykami sieciowymi, dostępu do pobierania obrazów kontenerów benchmarkowych oraz punktu końcowego zgodnego z OpenAI, skonfigurowanego z właściwymi parserami rozumowania i wywołań narzędzi. Karta Microsoftu stwierdza bez ogródek warunek dopasowania: identyczne wyniki wymagają zgodnego checkpointu, tokenizera, konfiguracji serwowania, obrazów zadań i protokołu ewaluacji. Połowa wydania, która generuje wynik, to ta połowa, na którą karta wskazuje linkiem do GitHuba.

Jest w tym realna wartość i warto ją nazwać, a nie odrzucać. Wkład FrogNano to pętla syntezy zadań, która na nowo generuje problemy treningowe względem możliwości aktualnej polityki — teza artykułu głosi, że małego agenta można wyszkolić do poziomu konkurencyjnego na zadaniach syntetycznych bez żadnej destylacji, co otwiera ścieżkę dla każdego, kogo nie stać na nauczyciela z czołówki. Jego API jest publiczne. Jego metody są zasadniczo odtwarzalne. To silniejszy wkład niż kolejny przyrostowy checkpoint, a przy tym więcej pracy, niż większość zespołów, które się na to decydują, jest gotowa włożyć.

A generated two-column scoreboard titled 'FrogNano-4B-2609 vs Gemma 4 12B'. The left column reads Parameters approx 4.66B with the card saying 500M-5B, Context about 131K evaluated, Input text only, Harness required Leaf with 5 tools, SWE-bench Verified 61.5% vendor, and Independent evals none. The right column reads Parameters 11.95B, Context 256,000 tokens, Input text, image, audio, Harness none required, LiveCodeBench v6 72.0% vendor, and Independent evals widely run. A footer reads 'Different benchmarks, no overlap; both scoreboards vendor-reported.'

Jeśli wybierasz jeden, wybierz go pod kątem zadania.

Wybierz Gemma 4 12B, jeśli praca łączy różne modalności, jeśli cokolwiek musi zobaczyć obraz lub usłyszeć dźwięk, jeśli kontekst musi jednocześnie pomieścić duże drzewo plików i długi transkrypt, albo jeśli chcesz model, który dowolny framework może załadować bez zaplecza w postaci drugiego systemu. Wynik 69,0 w Tau2 i natywne wywoływanie funkcji czynią go wyborem dla potoków agentowych, a nikt nie musi wierzyć laboratorium na słowo — model został oceniony przez tysiące osób, a wyniki nie są tajemnicą.

Weź FrogNano-4B-2609, jeśli już używasz agenta repozytorium w piaskownicy i chcesz wrzucić do niego checkpoint klasy 4B, oraz jeśli 9,32 GB pobierania, które zmieści się na skromnym sprzęcie, jest ograniczeniem kierującym decyzją. Zachowaj trzeźwe spojrzenie na kolejność działań: nie kupujesz wyniku, stawiasz na metodę, a pierwszą rzeczą, którą odkryjesz, jest to, czy twoja pętla odpytywania i twój parser wywołań narzędzi wyglądają wystarczająco podobnie do Leaf. Niektóre zespoły uzyskają zachowanie zbliżone do 61,5% trzeciego popołudnia, a niektóre spędzą dwa tygodnie, odkrywając, że ich zestaw ewaluacyjny był łatwiejszy niż SWE-bench Verified, i nikt spoza laboratorium nie może jeszcze powiedzieć, którym z nich jesteś.

Jeśli decyzja jest naprawdę bliska, tanim eksperymentem jest uruchomienie obu w tym samym środowisku testowym na własnych problemach, zamiast debatować nad publikowanymi liczbami, które nie mają wspólnego benchmarku. OrcaRouter oferuje ponad 200 modeli za jednym kluczem zgodnym z OpenAI przy 0% marży, więc ceny katalogowe dostawców są przekazywane bez zmian — co pozwala umieścić hostowany model ogólnego przeznaczenia i resztę swojego zestawu kandydatów za jednym punktem końcowym i jedną pozycją rozliczeniową, gdy podejmujesz decyzję. FrogNano nie jest jedną z naszych tras i nie ma dla niego daty; wagi to plik do pobrania, który hostujesz samodzielnie. To, co możemy usunąć, to tarcie po drugiej stronie porównania: podmienianie modeli kandydatów we własnym środowisku testowym bez drugiej umowy, drugiego SDK czy drugiego zestawu poświadczeń.

A generated timeline card headed 'Two releases, twenty weeks apart' showing an upper bar labelled Gemma 4 12B uploaded 23 May 2026 with 2.6 million downloads across the family, and a lower bar labelled FrogNano-4B-2609 uploaded 17 September 2026 with no announcement, with a span marker of 20 weeks between them and a footer reading 'Download figures from Hugging Face on 3 October 2026.'

Uczciwe podsumowanie jest takie, że liczba 61.5 to prawdziwa praca laboratorium, które ją stworzyło, i że obecnie jest to jedyny powód, by preferować FrogNano w kodowaniu. Kiedy ktoś spoza Microsoftu odtworzy 61.5 na tych samych 500 zadaniach — albo tego nie zrobi — to starcie otrzyma prawdziwą odpowiedź. Do tego czasu bezpieczniejszym domyślnym wyborem dla większości zespołów jest model 11.95B z czystą licencją, opublikowanym pomiarem długiego kontekstu i dwudziestoma tygodniami cudzych błędów już wchłoniętych przez jego dokumentację.