
FrogNano-4B-2609: Microsoft wypuścił 4B agenta kodującego na Hugging Face i nigdy tego nie ogłosił
- openaiNOWOŚĆOpenAI: GPT-6.1 Sol2026-09-2952Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Sonnet 5.52026-09-2856Inteligencja
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 219 tok/s
- OpenAINOWOŚĆOpenAI: GPT-6 Luna2026-09-2238Inteligencja
- OpenAINOWOŚĆOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- AnthropicNOWOŚĆAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- xAINOWOŚĆGrok 4.72026-09-2146Inteligencja
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 za 1 mln tokenów · 114 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 za 1 mln tokenów · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
Repozytorium pojawiło się 17 września 2026 roku wraz z początkowym commitem, a sam checkpoint trafił tam cztery minuty później. Potem nic. Żadnego wpisu na Twitterze od Microsoft AI, żadnego wpisu na blogu Microsoft Research, żadnej strony premierowej. Siedem tygodni później microsoft/FrogNano-4B-2609 — agent kodujący klasy czterech miliardów zbudowany na Qwen3.5-4B — wciąż nie ma za sobą żadnego ogłoszenia, a ta cisza to najważniejszy pojedynczy fakt dotyczący publikacji tego modelu. Ma natomiast kartę modelu, która powołuje się na artykuł i na harness, repozytorium GitHub, które okazuje się być harnessem, a nie artykułem, oraz createdAt z 17 września widniejący pod kartą, na której napisano „Data wydania 22-SEP-2026”. Obie daty są improwizowane; żadna nie jest błędna; obie nie zgadzają się ze sobą.
Co jest tak naprawdę publikowane?
Wszystko poniżej można teraz sprawdzić na hubie, a każda liczba w tym tekście pochodzi z własnej karty Microsoftu albo ze zliczeń bajtów w samym repozytorium. Żadna strona trzecia niczego nie odtworzyła — nie ma wpisu Artificial Analysis, nie ma oceny areny i nie ma nigdzie niezależnej ewaluacji FrogNano.
• Wagi — jedno publiczne repozytorium w organizacji Microsoft, bez ograniczeń dostępu, oznaczone licencją MIT na hubie, 15 plików, bez bramki pobierania i bez umowy do podpisania.
• Wagi na dysku — 9,32 GB w dwóch shardach safetensors, 59,6 miliarda bajtów danych repozytorium, w tym zestaw plików bez optymalizatora, 738 tensorów w indeksie.
• Architektura — Qwen3_5ForConditionalGeneration, gęsty 32-warstwowy stos hybrydowy odziedziczony po Qwen3.5-4B, z 24-warstwową wieżą wizyjną, która według karty została odziedziczona i nigdy nie została poddana post-trainingowi.
• Pole parametru samej karty — „500M-5B”. To zakres, a nie liczba, a dokument do pobrania jest dokładniejszy.
• Licencja — część wstępna karty podaje MIT. Sam korpus karty podaje Apache License 2.0, a zestaw narzędzi na GitHubie rzeczywiście zawiera plik LICENSE z licencją MIT. Te dwa stwierdzenia dotyczą różnych artefaktów w tym samym wydaniu.
• Ogłoszenie — brak. Ani na blogu Microsoft Research, ani na własnej stronie badawczej zespołu, ani w kanale organizacji Hugging Face jako cokolwiek innego niż wpis repozytorium.
To właśnie ta ostatnia linijka powinna ustawić nastawienie czytelnika na resztę tego tekstu. Cicho wgrany checkpoint nie jest gorszym artefaktem niż ogłoszony — jego karta jest często dłuższa, bo nikt nie skraca jej na potrzeby komunikatu prasowego. Ale nie przeszedł przez jedyny filtr, który ogłoszone wydanie dostaje za darmo: spojrzenie innych ludzi.

Wyniki i to, kto je wszystkie zdobył
Microsoft podaje, że FrogNano osiąga 61,5% na SWE-bench Verified, 37,6% na SWE-bench Pro, 31,1% na Terminal-Bench 2.0 i 47,3% na PatchEval-Verified — wszystkie jako wskaźniki rozwiązania Avg@3 mierzone za pomocą Leaf harness. Ta sama karta podaje punkt wyjścia: Qwen3.5-4B uzyskał 39,4% na SWE-bench Verified w identycznym środowisku testowym i przy identycznym budżecie. Pięć iteracji uczenia ze wzmocnieniem poprowadziło go przez 49,1%, 53,1%, 56,7%, 59,1% i 61,5% — o 22,1 punktu ponad model bazowy, co w ujęciu samego Microsoftu zaokrągla się do około 56% względnej poprawy.
Warto zatrzymać się przy dwóch rzeczach związanych z tą drabiną, ponieważ to miejsca, w których podsumowanie może się pomylić, a nie miejsca, w których pomylił się dostawca.
Pierwsza to rozbieżność w Iter 5. Główna tabela karty podaje 61,5% dla ostatniej iteracji; własny aneks artykułu dotyczący efektywności podaje tę samą progresję pięciu punktów kontrolnych jako 48,2%, 53,4%, 58,3%, 58,6% i 61,6%. Tylko ostatnia liczba jest zbliżona i tylko ostatnia liczba jest tą, którą ktokolwiek cytuje. Ostatnią wartość traktuj jako stabilny wynik, a pośrednie szczeble jako pomiary różnych rzeczy, ponieważ przy innej agregacji ewidentnie nimi są.
Po drugie, FrogNano nie jest jednolicie lepszy od modelu, od którego wyszedł, pod każdym względem. Opublikowany wskaźnik równoległych wywołań narzędzi wynosi 1,71%. Karta wprost przyznaje, że późniejsze iteracje utraciły zdolność do wysyłania kilku wywołań narzędzi w jednej turze i że prace zespołu nad konsolidacją istnieją częściowo po to, by to odzyskać. Model, który rozwiązuje więcej problemów, nie wykonując żadnych równoległych wywołań, to prawdziwy kompromis inżynieryjny, a nie przypis.

Uprząż jest produktem, a repozytorium jest uprzężą
FrogNano nie działa samodzielnie. Emituje ustrukturyzowane wywołania pięciu narzędzi — Read, Write, Edit, Glob i Bash — a coś musi je wykonać w izolowanym środowisku i przekazać z powrotem wynik. Tym czymś jest Leaf, a tutaj ślad robi coś nieco nietypowego.
Wiersz „dodatkowe powiązane zasoby” w karcie modelu zawiera odsyłacz do raportu technicznego pod adresem aka.ms/frognano-tech-report oraz do harnessu pod adresem github.com/microsoft/FrogNano. Odsyłacz aka.ms nie prowadzi do pliku PDF; przekierowuje bezpośrednio na stronę streszczenia na arXiv, gdzie faktycznie znajduje się raport. Repozytorium GitHub nie zawiera natomiast kodu treningowego, przepisu RL ani checkpointów. Jego własny plik README opisuje harness ewaluacyjny, który uruchamia agentów kodujących w piaskownicach Kubernetes wobec punktu końcowego zgodnego z OpenAI, i odsyła z powrotem do artykułu na arXiv po historię treningu. Tak więc dwa odsyłacze do zasobów w karcie to wskaźnik do artykułu i wskaźnik do odpowiedzi artykułu, a nazwa jest wspólna.
Ma to praktyczne znaczenie dla każdego, kto planuje używać modelu. Udokumentowany przepis serwowania to SGLang z --reasoning-parser qwen3 i --tool-call-parser qwen3_coder, a środowisko testowe oczekuje endpointu, który już obsługuje wywołania narzędzi i rozumowanie. Wystarczy drobny błąd w konfiguracji parsowania, a model produkuje tekst tam, gdzie środowisko testowe oczekuje JSON, co z zewnątrz wygląda dokładnie jak zły model, a nie jak zła konfiguracja. Karta wyraźnie stwierdza, że każdy porównywalny wynik wymaga zgodnego checkpointu, tokenizera, konfiguracji serwowania, obrazów zadań i protokołu ewaluacji — to dostawca mówi ci, że środowisko testowe to połowa wyniku.
Warto też powiedzieć wprost każdemu, kto dobiera sprzęt: checkpoint o rozmiarze 9,32 GB przy ocenianym na karcie modelu kontekście nie jest problemem wnioskowania o rozmiarze 9,32 GB. Ewaluacje przeprowadzono przy łącznie około 131 tys. tokenów i budżecie 150 kroków. Pamięć skaluje się wraz z kontekstem, a nie z wagami, a karta modelu mówi, że minimalna konfiguracja GPU wciąż „musi zostać zweryfikowana przed wydaniem” — fraza, która widnieje na modelu, który można już pobrać.
Co ten trening faktycznie zrobił, w jednym akapicie
Wkładem artykułu nie jest model, lecz pętla. TaskPilot generuje kandydujące zadania z zakresu inżynierii oprogramowania na podstawie rzeczywistych snapshotów repozytoriów, przeprowadza rollouts z bieżącego checkpointu na tych zadaniach, zatrzymuje te znajdujące się blisko granicy tego, co polityka jest w stanie czasami rozwiązać, a odrzuca kandydatów, którzy są trwale trywialni lub trwale niemożliwi. Zaakceptowany zbiór trenuje kolejny checkpoint. Ten kolejny checkpoint kalibruje następną rundę generowania zadań, więc rozkład zadań przesuwa się wraz z polityką. W sumie około 1500 zwalidowanych środowisk. Bez destylacji: karta stwierdza wprost, że dostrajanie po szkoleniu wstępnym (post-training) specyficzne dla agenta nie wykorzystywało trajektorii rozwiązań, działań, śladów rozumowania ani celów patchy z mocniejszego modelu. Mocniejsze modele piszą zadania; nie demonstrują odpowiedzi.
Microsoft przeprowadził tę pętlę przez pięć iteracji i raportuje wzrost o 8,7 punktu przed jakąkolwiek konsolidacją, z karą za długość logu dodaną w trakcie, ponieważ ślady rozumowania rosły szybciej, niż się poprawiały.
Karta modelu jest niezwykle bezpośrednia co do tego, gdzie całe podejście jest kruche. Dane treningowe w dużej mierze dotyczą Pythona i są głównie angielskojęzyczne; deklarowany w karcie obsługiwany zestaw języków naturalnych to angielski i nic więcej, przy czym szersze wielojęzyczne pokrycie modelu bazowego wyraźnie nie jest deklarowane. Wydajność jest wrażliwa na harness i na jakość testów. Generowane poprawki „mogą być niepoprawne lub niebezpieczne, mimo że przechodzą dostępne testy”. Karta modelu dla 4B zamyka ten akapit zdaniem, które każdy czytelnik powinien zapamiętać: nie używać bez kwalifikowanego przeglądu przez człowieka oraz niezależnego testowania regresji i bezpieczeństwa. To oświadczenie dostawcy o artefakcie dostawcy i jest to zdanie bardziej użyteczne niż którykolwiek z wierszy tabeli wyników powyżej.
Co to oznacza dla kupującego i gdzie pasuje router
FrogNano to nie model, który się wywołuje. Nie ma API first-party, hostowanego endpointu ani obrazu serverless. To checkpoint, a korzystanie z niego oznacza albo postawienie własnego wdrożenia SGLang za sandboxem hostowanym na Kubernetes, albo ocenianie go jako komponentu w stosie agentowym, który już utrzymujesz. To cała ścieżka adopcji dzisiaj i żadne ogłoszenie nie zmieniłoby jej kształtu.
To, co warstwa routingu może tu uczciwie zrobić, jest węższym zagadnieniem, niż początkowo się wydaje. Jeśli plan zakłada porównanie samodzielnie hostowanego FrogNano z hostowanym modelem do kodowania we własnym środowisku testowym, to właśnie ta hostowana połowa zyskuje na tym, że stoi za jednym kluczem, a nie za drugą umową: OrcaRouter udostępnia ponad 200 modeli za jednym punktem końcowym zgodnym z OpenAI przy 0% marży, co oznacza, że cenniki katalogowe dostawców przechodzą w niezmienionej formie, a zmiana ceny przez dostawcę jest widoczna po naszej stronie tego samego dnia. Ma to znaczenie w przypadku porównania, którego wynik rozstrzyga koszt na rozwiązany problem, a nie pojedynczy wynik benchmarku. Nie hostujemy FrogNano i nie ma na to terminu; wagi i prace nad serwowaniem należą do Ciebie.

Trzy rzeczy, które by to rozstrzygnęły
Po pierwsze, niezależne odtworzenie. Każda liczba w tym artykule — 61.5, 37.6, 31.1, 47.3 — została uzyskana przez laboratorium, które wytrenowało model, na narzędziu testowym utrzymywanym przez to samo laboratorium, względem wartości modelu bazowego zmierzonej przez to samo laboratorium. To kompletny i wewnętrznie spójny obraz, a także zamknięta pętla. Przydatny test polega na tym, czy ktoś bez żadnego interesu odtworzy skok z 39.4 do 61.5 na tych samych 500 zadaniach bez pracy kalibracyjnej Microsoftu nad zestawem zadań.
Po drugie, ktoś musi zweryfikować twierdzenie o harnessie od początku do końca. Repozytorium jest publiczne, co i tak jest więcej, niż udaje się osiągnąć wielu wydaniom, ale to jest stanowisko ewaluacyjne. Jeśli pięć narzędzi i izolacja piaskownicy rzeczywiście stanowią mechanizm wydajności, strona trzecia uruchamiająca opublikowaną konfigurację powinna osiągnąć wyniki zbliżone do opublikowanych liczb. Jeśli tak się nie stanie, różnica jest prawdziwym ustaleniem.
Po trzecie, i najtaniej będzie na to odpowiedzieć: Microsoft powinien powiedzieć, czy to produkt, czy artefakt publikacji. Sekcja dystrybucji karty traktuje wagi, kartę i harness jako produkt dostarczany, co brzmi jak publikacja, a nie premiera. „Data wydania 22-SEP-2026” brzmi jak premiera. Ogłoszony model rozwiałby tę niejednoznaczność w pierwszym zdaniu wpisu na blogu, a wpisu na blogu nie ma.
Do tego czasu właściwą postawą jest ta, którą sugeruje samo wydanie. FrogNano-4B-2609 to prawdziwy, dostępny do pobrania checkpoint na licencji MIT i Apache, a może i nie, z wyjątkowo dokładną kartą, publicznym narzędziem do ewaluacji, autentycznym pomysłem metodologicznym i tablicą wyników, której nigdy nie dotknął nikt bez adresu Microsoftu. Dla laboratorium to kompletny i interesujący artefakt. Dla zespołu, który ma zamiar postawić agenta przed repozytorium o trzeciej nad ranem, to trop, za którym warto pójść, ale jeszcze nie decyzja warta podjęcia.
