
FrogNano-4B-2609 vs Gemma 4 12B: 61,5% w SWE-bench i nikt tego nie sprawdził
- openaiNOWOŚĆOpenAI: GPT-6.1 Sol2026-09-2952Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Sonnet 5.52026-09-2856Inteligencja
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 219 tok/s
- OpenAINOWOŚĆOpenAI: GPT-6 Luna2026-09-2238Inteligencja
- OpenAINOWOŚĆOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- AnthropicNOWOŚĆAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- xAINOWOŚĆGrok 4.72026-09-2146Inteligencja
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 za 1 mln tokenów · 114 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 za 1 mln tokenów · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
firmy MicrosoftFrogNano-4B-2609 to agent kodujący klasy czterech miliardów wywodzący się z Qwen3.5-4B, który osiąga 61,5% w SWE-bench Verified. Gemma 4 12B to multimodalny model DeepMind bez enkodera o 11,95 miliarda parametrów, a jego karta podaje 72,0% w LiveCodeBench v6. To są te dwie liczby, które kupujący postawi obok siebie, a stawianie ich obok siebie jest błędem. Pochodzą z różnych benchmarków, różnych systemów testowych, różnych laboratoriów i — co ważniejsze — tylko jedna z nich ma opublikowaną metodologię oceny, którą przeczytał ktoś z zewnątrz. Wszystko inne w tym zestawieniu sprowadza się do pytania, czym każdy z modeli faktycznie jest, a odpowiedź brzmi: nie są one wcale tą samą kategorią rzeczy.
Dane liczbowe FrogNano poniżej pochodzą z karty modelu Microsoftu i jego raportu technicznego; oba są publicznie dostępne od września i żadnego z nich nie odtworzył nikt spoza laboratorium. Dane liczbowe Gemma 4 12B pochodzą z karty modelu Google'a, która również jest dokumentem dostawcy — różnica polega na tym, że za liczbami Gemmy stoi dwadzieścia tygodni wnikliwej analizy i około 2,6 miliona pobrań, a FrogNano ma za sobą dwa tygodnie i licznik pobrań, który nie wyszedł poza jednocyfrowe wartości.
Do czego służy każdy model
To jest ta część, którą ukrywa karta specyfikacji. FrogNano-4B-2609 nie jest modelem ogólnym, który przypadkiem dobrze radzi sobie z kodem. To checkpoint, którego cały trening po wstępnym stanowiła inżynieria oprogramowania na poziomie repozytorium i który zaprojektowano tak, by sterował nim harness, a nie by prowadzić z nim rozmowy.
Jego pięć narzędzi to Read, Write, Edit, Glob i Bash. Emituje do nich wywołania, piaskownica wykonuje je i zwraca dane wyjściowe, a pętla działa, dopóki model nie przestanie ich żądać. Oceniana konfiguracja obejmuje 150 kroków interakcji w ramach około 131 tys. łącznych tokenów i wygenerowała kandydującą łatę dla każdego zadania. Karta Microsoftu wyraźnie stwierdza, że model jest przeznaczony dla repozytoriów angielskojęzycznych, w dużym stopniu opartych na Pythonie, z odtwarzalnymi środowiskami i wykonywalnymi zestawami testów, oraz że komponenty obrazu i wideo odziedziczone z modelu bazowego nigdy nie były poddawane dostrajaniu i nie są obsługiwane.
Gemma 4 12B ma przeciwny kształt. To 48-warstwowy zunifikowany model z kontekstem 256K i bez osobnego kodera wizji ani audio — surowe fragmenty obrazu i przebiegi fal dźwiękowych są rzutowane bezpośrednio do przestrzeni osadzeń pojedynczego dekodera przez lekkie warstwy liniowe. Przyjmuje tekst, obraz i dźwięk, a wyprowadza tekst. Ma tryb myślenia wyzwalany tokenem w prompcie systemowym, natywne wywoływanie funkcji, a karta Google celowo wymienia przepływy pracy agentowej wśród zamierzonych zastosowań.
Tak więc prawdziwym pytaniem nie jest to, który z nich jest mądrzejszy. Jest nim to, czy chcesz wyspecjalizowanego komponentu, który działa tylko w ramach zestawu, który musisz obsługiwać, czy ogólnego modelu, który przyzwoicie radzi sobie z wieloma rzeczami i może być wywoływany przez cokolwiek.

Linia po linii, tam gdzie faktycznie się różnią.
• Parametry — FrogNano-4B-2609 podaje przedział „500M-5B” na karcie, której własny opis mówi o około 4,66 miliarda; pobranie rozstrzyga to na 9,32 GB wag BF16. Gemma 4 12B ma 11,95B, podane raz i bez żadnych zastrzeżeń. Stosunek wynosi około 2,6 do jednego i widać go bezpośrednio w tym, co musisz wynająć.
• Kontekst — oceniana konfiguracja FrogNano obejmuje około 131 tys. łącznych tokenów, przy czym rozumowanie i dane wyjściowe narzędzi dzielą ten budżet. Gemma 4 12B ma 256 000 tokenów, a samodzielnie w wierszu dotyczącym długiego kontekstu osiąga 43,4% w MRCR v2 z ośmioma igłami przy 128K. Niemal dwukrotnie większe okno, a druga liczba to opublikowany pomiar, a nie deklaracja możliwości.
• Modalność — FrogNano-4B-2609 to tekst na wejściu i tekst na wyjściu, mimo że w jego checkpointcie znajduje się wieża wizyjna. Gemma 4 12B przyjmuje tekst, obrazy i dźwięk.
• Limit wyjściowy — zwalidowana konfiguracja FrogNano pozwala na 8192 wygenerowanych tokenów na turę asystenta, a w jej karcie odnotowano, że konfiguracja treningu RL używała tego samego limitu. Gemma 4 12B nie publikuje równoważnego limitu dla pojedynczej tury; ograniczeniem jest tam okno 256K.
• Interfejs agentowy — FrogNano emituje strukturalne wywołania Leaf i potrzebuje środowiska wykonawczego, aby je wykonywać. Gemma 4 12B oferuje natywne wywoływanie funkcji w wersji dostrojonej do instrukcji i można ją wywoływać bezpośrednio.
• Licencja — Gemma 4 12B jest objęta licencją Apache 2.0 na warunkach Google dotyczących Gemma 4, co jest jasno podane. Karta FrogNano wskazuje MIT w części wstępnej, a Apache 2.0 w samej treści, co jest rodzajem niejednoznaczności, która trafia raczej do przeglądu prawnego niż do przypisu.
• Liczby — FrogNano podaje 61,5% w SWE-bench Verified, 37,6% w SWE-bench Pro, 31,1% w Terminal-Bench 2.0 i 47,3% w PatchEval-Verified. Gemma 4 12B podaje 77,2% w MMLU Pro, 72,0% w LiveCodeBench v6, ELO 1659 w Codeforces, 78,8% w GPQA Diamond i 69,0% w Tau2. Karta Google nie publikuje wiersza SWE-bench, a karta Microsoftu nie publikuje LiveCodeBench. Te dwie tablice wyników w ogóle się nie pokrywają.
Ten ostatni punkt powinien położyć kres instynktowi porównywania na podstawie liczb. Ani jeden benchmark nie występuje na obu kartach. Czytelnik, który zestawia 61,5 z 72,0, porównał wskaźnik rozwiązywania repozytoriów ze wskaźnikiem zaliczeń w programowaniu konkurencyjnym, co jest mniej więcej jak porównywanie czasu maratonu z czasem biegu na sto metrów, ponieważ oba są wyrażone w sekundach.
Dlaczego milczenie Google w sprawie SWE-bench nie jest sygnałem ostrzegawczym
Kuszący wniosek z listy wypunktowanej jest taki, że FrogNano ma prawdziwy wynik SWE-bench, a Gemma nie, więc FrogNano wygrywa w kwestii kodowania. To jednak nie wynika, z powodu, który warto precyzyjnie wyjaśnić.
Gemma 4 12B raportuje Tau2 na poziomie 69,0% — benchmark użycia narzędzi w trybie agentowym w trzech przebiegach — wraz z obsługą wywoływania funkcji i wyraźnym pozycjonowaniem do przepływów pracy agentowych. Model, który uzyskuje 69,0 w Tau2, nie jest modelem, który nie potrafi wykonywać pracy agentowej; to model, którego dostawca zdecydował się raportować wydajność użycia narzędzi, a nie rozwiązywanie repozytoriów. Google nie podaje również wierszy SWE-bench dla 26B ani 31B, co jest redakcyjnym wyborem dla całej rodziny, a nie słabością 12B.
Tymczasem kontrintuicyjny wynik z samego artykułu Microsoftu powinien uważnie przeczytać każdy nabywca Gemmy. FrogNano wychodzi od Qwen3.5-4B, modelu ogólnego, który uzyskał 39,4% w SWE-bench Verified dzięki harnessowi Leaf. Pięć rund uczenia ze wzmocnieniem na około 1500 zadaniach syntetycznych przesunęło go do 61,5%. Wniosek nie brzmi „małe modele nie potrafią kodować” — chodzi o to, że ogólny checkpoint 4B z wynikiem 39,4% już rozwiązywał ponad jedną trzecią trudnego, zweryfikowanego przez ludzi zestawu zgłoszeń, gdy ktoś uruchomił go w kompetentnej pętli agentowej. Gemma 4 12B jest trzykrotnie większa i dojrzalsza o dwadzieścia tygodni. Nikt nie uruchomił jej przez Leaf i dopóki ktoś tego nie zrobi, „Gemma nie jest agentem repozytoryjnym” pozostaje założeniem, a nie ustaleniem.
Podatek od harnessu, który tablice wyników całkowicie ukrywają
Oto praktyczna asymetria — i to ona decyduje o zakupie.
Gemma 4 12B to model. Pobierz 11,95 mld wag, skieruj na nie Transformers, vLLM lub SGLang, wyślij tekst, otrzymaj tekst. Google publikuje ścieżkę serwowania, licencja jest jednoznaczna, a ludzie stojący za 2,6 mln pobrań już natrafili na niedoskonałości i je udokumentowali. Jeśli zadanie brzmi „podsumuj ten ślad stosu”, „przeczytaj ten zrzut ekranu i powiedz, co jest zepsute” albo „wywołaj tę funkcję z tymi argumentami”, to działa już dziś.
FrogNano-4B-2609 to model oraz harness, a własne README Microsoftu czyni ten harness obowiązkowym. Repozytorium pod adresem github.com/microsoft/FrogNano to zestaw ewaluacyjny Leaf, a nie kod treningowy — wymaga klastra Kubernetes, istniejącej przestrzeni nazw, uprawnień do zarządzania podami i politykami sieciowymi, dostępu do pobierania obrazów kontenerów benchmarkowych oraz punktu końcowego zgodnego z OpenAI, skonfigurowanego z właściwymi parserami rozumowania i wywołań narzędzi. Karta Microsoftu stwierdza bez ogródek warunek dopasowania: identyczne wyniki wymagają zgodnego checkpointu, tokenizera, konfiguracji serwowania, obrazów zadań i protokołu ewaluacji. Połowa wydania, która generuje wynik, to ta połowa, na którą karta wskazuje linkiem do GitHuba.
Jest w tym realna wartość i warto ją nazwać, a nie odrzucać. Wkład FrogNano to pętla syntezy zadań, która na nowo generuje problemy treningowe względem możliwości aktualnej polityki — teza artykułu głosi, że małego agenta można wyszkolić do poziomu konkurencyjnego na zadaniach syntetycznych bez żadnej destylacji, co otwiera ścieżkę dla każdego, kogo nie stać na nauczyciela z czołówki. Jego API jest publiczne. Jego metody są zasadniczo odtwarzalne. To silniejszy wkład niż kolejny przyrostowy checkpoint, a przy tym więcej pracy, niż większość zespołów, które się na to decydują, jest gotowa włożyć.

Jeśli wybierasz jeden, wybierz go pod kątem zadania.
Wybierz Gemma 4 12B, jeśli praca łączy różne modalności, jeśli cokolwiek musi zobaczyć obraz lub usłyszeć dźwięk, jeśli kontekst musi jednocześnie pomieścić duże drzewo plików i długi transkrypt, albo jeśli chcesz model, który dowolny framework może załadować bez zaplecza w postaci drugiego systemu. Wynik 69,0 w Tau2 i natywne wywoływanie funkcji czynią go wyborem dla potoków agentowych, a nikt nie musi wierzyć laboratorium na słowo — model został oceniony przez tysiące osób, a wyniki nie są tajemnicą.
Weź FrogNano-4B-2609, jeśli już używasz agenta repozytorium w piaskownicy i chcesz wrzucić do niego checkpoint klasy 4B, oraz jeśli 9,32 GB pobierania, które zmieści się na skromnym sprzęcie, jest ograniczeniem kierującym decyzją. Zachowaj trzeźwe spojrzenie na kolejność działań: nie kupujesz wyniku, stawiasz na metodę, a pierwszą rzeczą, którą odkryjesz, jest to, czy twoja pętla odpytywania i twój parser wywołań narzędzi wyglądają wystarczająco podobnie do Leaf. Niektóre zespoły uzyskają zachowanie zbliżone do 61,5% trzeciego popołudnia, a niektóre spędzą dwa tygodnie, odkrywając, że ich zestaw ewaluacyjny był łatwiejszy niż SWE-bench Verified, i nikt spoza laboratorium nie może jeszcze powiedzieć, którym z nich jesteś.
Jeśli decyzja jest naprawdę bliska, tanim eksperymentem jest uruchomienie obu w tym samym środowisku testowym na własnych problemach, zamiast debatować nad publikowanymi liczbami, które nie mają wspólnego benchmarku. OrcaRouter oferuje ponad 200 modeli za jednym kluczem zgodnym z OpenAI przy 0% marży, więc ceny katalogowe dostawców są przekazywane bez zmian — co pozwala umieścić hostowany model ogólnego przeznaczenia i resztę swojego zestawu kandydatów za jednym punktem końcowym i jedną pozycją rozliczeniową, gdy podejmujesz decyzję. FrogNano nie jest jedną z naszych tras i nie ma dla niego daty; wagi to plik do pobrania, który hostujesz samodzielnie. To, co możemy usunąć, to tarcie po drugiej stronie porównania: podmienianie modeli kandydatów we własnym środowisku testowym bez drugiej umowy, drugiego SDK czy drugiego zestawu poświadczeń.

Uczciwe podsumowanie jest takie, że liczba 61.5 to prawdziwa praca laboratorium, które ją stworzyło, i że obecnie jest to jedyny powód, by preferować FrogNano w kodowaniu. Kiedy ktoś spoza Microsoftu odtworzy 61.5 na tych samych 500 zadaniach — albo tego nie zrobi — to starcie otrzyma prawdziwą odpowiedź. Do tego czasu bezpieczniejszym domyślnym wyborem dla większości zespołów jest model 11.95B z czystą licencją, opublikowanym pomiarem długiego kontekstu i dwudziestoma tygodniami cudzych błędów już wchłoniętych przez jego dokumentację.
