
FrogNano-4B-2609: Microsoft veröffentlichte einen 4B-Coding-Agenten auf Hugging Face und kündigte es nie an
- openaiNEUOpenAI: GPT-6.1 Sol2026-09-2952Intelligenz
- anthropicNEUAnthropic: Claude Sonnet 5.52026-09-2856Intelligenz
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 219 tok/s
- OpenAINEUOpenAI: GPT-6 Luna2026-09-2238Intelligenz
- OpenAINEUOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- AnthropicNEUAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- xAINEUGrok 4.72026-09-2146Intelligenz
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 pro 1 Mio. Tokens · 114 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 pro 1 Mio. Tokens · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
Das Repository ging am 17. September 2026 mit dem ersten Commit online, und der Checkpoint selbst landete vier Minuten später. Dann nichts. Kein Tweet von Microsoft AI, kein Eintrag im Microsoft-Research-Blog, keine Launch-Seite. Sieben Wochen später microsoft/FrogNano-4B-2609 — ein Coding-Agent der Vier-Milliarden-Klasse, gebaut auf Qwen3.5-4B — steht immer noch keine Ankündigung dahinter, und dieses Schweigen ist die single most important Tatsache über die Veröffentlichung dieses Modells. Was es dagegen gibt, ist eine Modellkarte, die ein Paper und ein Harness behauptet, ein GitHub-Repository, das sich als das Harness und nicht als das Paper entpuppt, und ein createdAt vom 17. September, das unter einer Karte steht, auf der „Release date 22-SEP-2026“ zu lesen ist. Beide Daten sind improvisiert; keines ist falsch; sie widersprechen einander.
Was wird tatsächlich veröffentlicht?
Alles unten Stehende lässt sich gerade jetzt auf dem Hub überprüfen, und jede Zahl in diesem Beitrag stammt aus Microsofts eigener Karte oder aus den Byte-Zählungen im Repository selbst. Nichts wurde von Dritten reproduziert — es gibt keinen Eintrag bei Artificial Analysis, keine Arena-Bewertung und nirgendwo eine unabhängige Bewertung von FrogNano.
• Gewichte — ein öffentliches Repository innerhalb der Microsoft-Organisation, ohne Zugangsbeschränkung, auf dem Hub mit MIT-Tag versehen, 15 Dateien, keine Download-Schranke und keine zu unterzeichnende Vereinbarung.
• Gewichte auf der Festplatte — 9,32 GB über zwei safetensors-Shards, 59,6 Milliarden Bytes an Repository-Daten einschließlich des optimizer-freien Dateisatzes, 738 Tensoren im Index.
• Architektur — Qwen3_5ForConditionalGeneration, der dichte Hybrid-Stack mit 32 Schichten, übernommen aus Qwen3.5-4B, mit einem 24-schichtigen Vision-Tower, der laut Model Card übernommen und nie nachtrainiert wurde.
• Das eigene Parameterfeld der Karte – „500M-5B“. Das ist ein Bereich, keine Zahl, und der Download ist das präzisere Dokument.
• Lizenz — der Vorspann der Karte sagt MIT. Der Hauptteil der Karte selbst sagt Apache License 2.0, und das GitHub-Harness liefert tatsächlich eine MIT-LICENSE-Datei mit. Diese beiden Aussagen beziehen sich auf unterschiedliche Artefakte in derselben Veröffentlichung.
• Ankündigung — keine. Nicht im Microsoft Research Blog, nicht auf der eigenen Forschungsseite des Teams, nicht im Hugging Face-Organisationsfeed als irgendetwas anderes denn als ein Repository-Eintrag.
Diese letzte Zeile ist diejenige, die die Haltung der Lesenden für den Rest dieses Beitrags prägen sollte. Ein im Stillen hochgeladener Checkpoint ist kein minderwertigeres Artefakt als ein angekündigter – seine Karte ist oft länger, weil niemand sie für eine Pressemitteilung herunterkürzt. Aber er hat nicht den einen Filter durchlaufen, den eine angekündigte Veröffentlichung gratis bekommt: dass andere Leute einen Blick darauf werfen.

Die Partituren, und wer jede einzelne davon produziert hat
Microsoft berichtet, dass FrogNano auf SWE-bench Verified 61,5 % erreicht, 37,6 % auf SWE-bench Pro, 31,1 % auf Terminal-Bench 2.0 und 47,3 % auf PatchEval-Verified, alle als Avg@3-Lösungsraten, gemessen mithilfe der Leaf-Harness. Dieselbe Karte nennt den Ausgangspunkt: Qwen3.5-4B erzielte unter identischer Harness und identischem Budget 39,4 % auf SWE-bench Verified. Fünf Iterationen des bestärkenden Lernens brachten es auf 49,1 %, 53,1 %, 56,7 %, 59,1 % und 61,5 % — 22,1 Punkte über dem Basismodell, was Microsofts eigene Darstellung auf etwa 56 % relative Verbesserung rundet.
Zwei Dinge an dieser Leiter verdienen es, kurz innezuhalten, denn sie sind Stellen, an denen eine Zusammenfassung schiefgehen kann, und nicht Stellen, an denen der Anbieter etwas falsch gemacht hat.
Das erste ist die Iter-5-Diskrepanz. Die Schlagzeilentabelle der Karte gibt 61,5 % für die letzte Iteration an; der Effizienzanhang des Papers selbst berichtet für dieselbe Fünf-Checkpoint-Folge 48,2 %, 53,4 %, 58,3 %, 58,6 % und 61,6 %. Nur die letzte Zahl liegt nah dran, und nur die letzte Zahl ist diejenige, die überhaupt zitiert wird. Behandle die endgültige Zahl als das stabile Ergebnis und die Zwischenstufen als Messungen unterschiedlicher Dinge, denn unter einer anderen Aggregation sind sie das ganz offensichtlich.
Zweitens ist FrogNano nicht in jeder Dimension durchgängig besser als das Modell, von dem es ausging. Seine veröffentlichte Rate paralleler Tool-Aufrufe beträgt 1,71 %. Die Karte räumt offen ein, dass spätere Iterationen die Fähigkeit verloren haben, mehrere Tool-Aufrufe in einem einzigen Turn auszulösen, und dass die Konsolidierungsarbeit des Teams teilweise dazu dient, sie zurückzugewinnen. Ein Modell, das mehr Probleme löst und dabei nahezu keine gleichzeitigen Aufrufe absetzt, ist ein echter Engineering-Kompromiss, keine Fußnote.

Der Harness ist das Produkt, und das Repository ist der Harness.
FrogNano läuft nicht von selbst. Es sendet strukturierte Aufrufe an fünf Tools — Read, Write, Edit, Glob und Bash — und etwas muss sie in einer isolierten Umgebung ausführen und die Ausgabe zurückgeben. Dieses Etwas ist Leaf, und hier macht die Spur etwas leicht Ungewöhnliches.
Die Zeile „zusätzliche zugehörige Assets" der Modellkarte verlinkt einen technischen Bericht unter aka.ms/frognano-tech-report sowie ein Harness unter github.com/microsoft/FrogNano. Der aka.ms-Link verweist nicht auf ein PDF; er leitet direkt auf die arXiv-Abstract-Seite weiter, auf der der eigentliche Bericht liegt. Das GitHub-Repository hingegen enthält keinen Trainingscode, kein RL-Rezept und keine Checkpoints. Die eigene README beschreibt ein Evaluations-Harness, das Coding-Agents in Kubernetes-Sandboxes gegen einen OpenAI-kompatiblen Endpunkt ausführt, und verweist für die Trainingsgeschichte zurück auf das arXiv-Paper. Die beiden Asset-Links der Karte sind also ein Verweis auf das Paper und ein Verweis auf die Antwort auf das Paper, und der Name ist beiden gemeinsam.
Das ist aus einem praktischen Grund für jeden wichtig, der das Modell nutzen möchte. Das dokumentierte Serving-Rezept lautet SGLang mit --reasoning-parser qwen3 und --tool-call-parser qwen3_coder, und die Harness möchte einen Endpunkt, der bereits Tool-Calls und Reasoning spricht. Macht man die Parsing-Konfiguration leicht falsch, erzeugt das Modell Text, wo die Harness JSON erwartet, was von außen betrachtet genau wie ein schlechtes Modell aussieht und nicht wie eine schlechte Konfiguration. Die Karte macht ausdrücklich klar, dass jeder übereinstimmende Score einen übereinstimmenden Checkpoint, Tokenizer, eine übereinstimmende Serving-Konfiguration, übereinstimmende Task-Bilder und ein übereinstimmendes Evaluationsprotokoll erfordert — das ist der Hersteller, der einem sagt, dass die Harness die Hälfte des Ergebnisses ausmacht.
Außerdem sollte man es für alle, die Hardware dimensionieren, klar sagen: Ein 9,32-GB-Checkpoint beim evaluierten Kontext der Modellkarte ist kein 9,32-GB-Inferenzproblem. Die Evaluierungen liefen mit ungefähr 131K kombinierten Tokens und einem Budget von 150 Schritten. Der Speicher skaliert mit dem Kontext, nicht mit den Gewichten, und die Modellkarte besagt, dass die minimale GPU-Konfiguration weiterhin „vor der Veröffentlichung validiert werden muss“ – eine Formulierung, die auf einem Modell erscheint, das bereits herunterladbar ist.
Was das Training tatsächlich bewirkt hat, in einem Absatz
Der Beitrag des Papers ist nicht das Modell, sondern die Schleife. TaskPilot generiert Kandidaten für Software-Engineering-Aufgaben aus echten Repository-Snapshots, führt Rollouts vom aktuellen Checkpoint gegen sie aus, behält diejenigen, die nahe an der Grenze dessen liegen, was die Policy manchmal lösen kann, und verwirft Kandidaten, die dauerhaft trivial oder dauerhaft unmöglich sind. Mit der akzeptierten Menge wird der nächste Checkpoint trainiert. Dieser nächste Checkpoint kalibriert dann die folgende Runde der Aufgabengenerierung, sodass sich die Aufgabenverteilung mit der Policy verschiebt. Insgesamt rund 1.500 validierte Umgebungen. Keine Destillation: Die Karte stellt unmissverständlich fest, dass das agentenspezifische Post-Training keine Lösungstrajektorien, Aktionen, Reasoning-Traces oder Patch-Ziele stärkerer Modelle verwendet hat. Stärkere Modelle schreiben Aufgaben; sie demonstrieren keine Antworten.
Microsoft ließ diese Schleife fünf Iterationen lang laufen und berichtet von einem Zuwachs von 8,7 Punkten vor jeglicher Konsolidierung, wobei mitten im Durchlauf eine Strafe für die Log-Länge hinzugefügt wurde, weil die Reasoning-Traces schneller wuchsen, als sie sich verbesserten.
Die Modellkarte ist ungewöhnlich direkt in der Frage, wo der gesamte Ansatz fragil ist. Die Trainingsdaten sind stark Python-lastig und überwiegend englischsprachig; die auf der Karte angegebene unterstützte Menge natürlicher Sprachen besteht aus Englisch und sonst nichts, wobei eine breitere mehrsprachige Abdeckung des Basismodells ausdrücklich nicht beansprucht wird. Die Leistung reagiert empfindlich auf das Harness und auf die Qualität der Tests. Generierte Patches „können falsch oder unsicher sein, obwohl sie die verfügbaren Tests bestehen.“ Die Modellkarte für das 4B-Modell schließt diesen Absatz mit dem Satz, den jeder Leser mitnehmen sollte: nicht ohne qualifizierte menschliche Prüfung und unabhängige Regressions- und Sicherheitstests zu verwenden. Das ist eine Anbieteraussage über ein Anbieterartefakt, und sie ist ein nützlicherer Satz als jede der Scoreboard-Zeilen darüber.
Was das für einen Käufer bedeutet und wo ein Router ins Spiel kommt
FrogNano ist kein Modell, das man aufruft. Es gibt keine First-Party-API, keinen gehosteten Endpunkt und kein serverloses Image. Es ist ein Checkpoint, und seine Nutzung bedeutet entweder, eine eigene SGLang-Bereitstellung hinter einer Kubernetes-gehosteten Sandbox aufzusetzen oder es als Komponente in einem Agent-Stack zu evaluieren, den Sie bereits betreiben. Das ist heute der gesamte Einführungspfad, und keine Ankündigung hätte seine Gestalt geändert.
Was eine Routing-Schicht hier ehrlicherweise leisten kann, ist enger gefasst, als es zunächst klingt. Wenn der Plan darin besteht, ein selbst gehostetes FrogNano gegen ein gehostetes Coding-Modell in Ihrem eigenen Harness zu vergleichen, dann ist die gehostete Hälfte diejenige, die davon profitiert, hinter einem einzigen Schlüssel statt hinter einem zweiten Vertrag zu stehen: OrcaRouter bietet über 200 Modelle hinter einem einzigen OpenAI-kompatiblen Endpunkt mit 0 % Aufschlag, was bedeutet, dass die Listenpreise der Anbieter unverändert weitergegeben werden und eine Preisänderung eines Anbieters bei uns noch am selben Tag live ist. Das ist wichtig für ein Bake-off, dessen Ergebnis durch die Kosten pro gelöstem Issue statt durch eine einzelne Benchmark-Zahl entschieden wird. Wir hosten FrogNano nicht, und es gibt dafür keinen Termin; die Gewichte und die Serving-Arbeit liegen bei Ihnen.

Die drei Dinge, die es klären würden
Zuerst eine unabhängige Reproduktion. Jede Zahl in diesem Artikel — 61,5, 37,6, 31,1, 47,3 — wurde von dem Labor erzeugt, das das Modell trainiert hat, auf einer Testumgebung, die dasselbe Labor pflegt, gegen einen Basiswert des Basismodells, den dasselbe Labor gemessen hat. Das ist ein vollständiges und in sich stimmiges Bild, und es ist zugleich eine geschlossene Schleife. Der nützliche Test ist, ob jemand ohne Eigeninteresse den Sprung von 39,4 auf 61,5 bei denselben 500 Aufgaben reproduziert, ohne Microsofts Kalibrierungsarbeit am Aufgabensatz.
Zweitens muss jemand die Harness-Behauptung von Anfang bis Ende überprüfen. Das Repository ist öffentlich, was mehr ist, als viele Releases schaffen, aber es ist die Evaluierungsvorrichtung. Wenn die fünf Tools und die Sandbox-Isolation tatsächlich der Performance-Mechanismus sind, sollte ein Dritter, der die veröffentlichte Konfiguration ausführt, nahe an die veröffentlichten Zahlen herankommen. Wenn nicht, ist die Lücke der eigentliche Befund.
Drittens, und am kostengünstigsten zu beantworten: Microsoft sollte sagen, ob es sich um ein Produkt oder ein Papier-Artefakt handelt. Der Abschnitt zur Distribution der Karte behandelt die Gewichte, die Karte und das Harness als den Liefergegenstand, was eher nach Veröffentlichung als nach Markteinführung klingt. „Veröffentlichungsdatum 22-SEP-2026“ klingt nach einer Markteinführung. Ein angekündigtes Modell hätte diese Mehrdeutigkeit im ersten Satz eines Blogbeitrags ausgeräumt, und es gibt keinen Blogbeitrag.
Bis dahin ist die richtige Haltung die, die das Release selbst nahelegt. FrogNano-4B-2609 ist ein echter, herunterladbarer MIT-und-Apache-und-vielleicht-auch-nicht-Checkpoint mit einer ungewöhnlich gründlichen Modellkarte, einem öffentlichen Evaluations-Harness, einer echten methodischen Idee und einer Bestenliste, die noch nie von jemandem ohne Microsoft-Adresse berührt wurde. Für ein Labor ist das ein vollständiges und interessantes Artefakt. Für ein Team, das im Begriff ist, um drei Uhr morgens einen Agenten vor ein Repository zu setzen, ist es eine Spur, der es sich zu folgen lohnt, und noch keine Entscheidung, die es zu treffen lohnt.
