
FrogNano-4B-2609 vs. Gemma 4 12B: 61,5 % auf SWE-bench und niemand hat es überprüft
- openaiNEUOpenAI: GPT-6.1 Sol2026-09-2952Intelligenz
- anthropicNEUAnthropic: Claude Sonnet 5.52026-09-2856Intelligenz
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 219 tok/s
- OpenAINEUOpenAI: GPT-6 Luna2026-09-2238Intelligenz
- OpenAINEUOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- AnthropicNEUAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- xAINEUGrok 4.72026-09-2146Intelligenz
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 pro 1 Mio. Tokens · 114 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 pro 1 Mio. Tokens · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
Microsofts FrogNano-4B-2609 ist ein Coding-Agent der Vier-Milliarden-Klasse, abgeleitet von Qwen3.5-4B, der 61,5 % bei SWE-bench Verified meldet. Gemma 4 12B ist das encoderfreie multimodale Modell von DeepMind mit 11,95 Milliarden Parametern, und seine Modellkarte gibt 72,0 % bei LiveCodeBench v6 an. Das sind die beiden Zahlen, die ein Käufer nebeneinanderstellen wird, und genau dieses Nebeneinanderstellen ist der Fehler. Sie stammen aus unterschiedlichen Benchmarks, unterschiedlichen Testumgebungen, unterschiedlichen Laboren, und – was wichtiger ist – nur für eine von ihnen gibt es eine veröffentlichte Evaluierungsmethodik, die ein Außenstehender gelesen hat. Alles andere an diesem Vergleich ist die Frage, was jedes Modell tatsächlich ist, und die Antwort lautet, dass sie überhaupt nicht derselben Kategorie angehören.
Die unten stehenden FrogNano-Zahlen stammen aus Microsofts Model Card und dem zugehörigen technischen Bericht; beide sind seit September öffentlich, und keines von beiden wurde von jemandem außerhalb des Labors reproduziert. Die Gemma 4 12B-Zahlen stammen aus Googles Model Card, die ebenfalls ein Herstellerdokument ist – der Unterschied ist, dass hinter Gemmas Zahlen zwanzig Wochen und rund 2,6 Millionen Downloads an Prüfung stehen, während FrogNano zwei Wochen und einen Download-Zähler vorzuweisen hat, der noch keine zweistellige Zahl erreicht hat.
Wofür jedes Modell gedacht ist
Dies ist der Teil, den ein Datenblatt verbirgt. FrogNano-4B-2609 ist kein allgemeines Modell, das zufällig gut im Programmieren ist. Es ist ein Checkpoint, dessen gesamtes Post-Training Softwareentwicklung auf Repository-Ebene war und der darauf ausgelegt ist, von einem Harness gesteuert statt angesprochen zu werden.
Seine fünf Werkzeuge sind Read, Write, Edit, Glob und Bash. Es sendet Aufrufe an sie, eine Sandbox führt sie aus und gibt Ausgaben zurück, und die Schleife läuft, bis das Modell aufhört zu fragen. Die evaluierte Konfiguration umfasst 150 Interaktionsschritte innerhalb von ungefähr 131K kombinierten Token, und sie erzeugte einen Kandidaten-Patch pro Aufgabe. Microsofts Karte ist explizit, dass das Modell für englischsprachige, Python-lastige Repositorys mit reproduzierbaren Umgebungen und ausführbaren Testsuiten gedacht ist, und dass Bild- und Videokomponenten, die vom Basismodell geerbt wurden, nie nachtrainiert wurden und nicht unterstützt werden.
Gemma 4 12B hat die entgegengesetzte Form. Es ist ein vereinheitlichtes Modell mit 48 Schichten und einem 256K-Kontext und ohne separaten Vision- oder Audio-Encoder – rohe Bild-Patches und Audio-Wellenformen werden durch leichtgewichtige lineare Layer direkt in den Embedding-Raum des einzelnen Decoders projiziert. Es nimmt Text, Bild und Audio entgegen und gibt Text aus. Es besitzt einen Denkmodus, der durch ein Token im System-Prompt ausgelöst wird, natives Function Calling, und Googles Model Card führt ausdrücklich agentische Workflows unter den vorgesehenen Anwendungsfällen auf.
Also ist die eigentliche Frage nicht, welches klüger ist. Sondern ob du eine spezialisierte Komponente willst, die nur innerhalb eines Aufbaus funktioniert, den du bedienen musst, oder ein allgemeines Modell, das bei vielen Dingen eine ordentliche Leistung bringt und von allem aufgerufen werden kann.

Zeile für Zeile, wo sie sich tatsächlich unterscheiden
• Parameter — FrogNano-4B-2609 veröffentlicht eine Spanne, „500M-5B“, auf einer Karte, deren eigene Beschreibung etwa 4,66 Milliarden angibt; der Download legt es auf 9,32 GB BF16-Gewichte fest. Gemma 4 12B liegt bei 11,95B, einmal genannt und nie relativiert. Das Verhältnis beträgt ungefähr 2,6 zu eins, und es zeigt sich direkt in dem, was man anmieten muss.
• Kontext — FrogNanos evaluierte Konfiguration umfasst etwa 131K kombinierte Token, wobei sich Reasoning- und Tool-Ausgaben das Budget teilen. Gemma 4 12B verfügt über 256.000 Token und erzielt in seiner eigenen Long-Context-Zeile 43,4 % bei MRCR v2 mit acht Needles bei 128K. Fast doppelt so großes Fenster, und bei der zweiten Zahl handelt es sich um eine veröffentlichte Messung statt um eine Fähigkeitsbehauptung.
• Modalität — FrogNano-4B-2609 ist Text rein, Text raus, ungeachtet des Vision-Towers, der in seinem Checkpoint sitzt. Gemma 4 12B nimmt Text, Bilder und Audio als Eingabe.
• Ausgabegrenze — die validierte FrogNano-Konfiguration erlaubt 8.192 generierte Token pro Assistant-Turn, und die Modellkarte vermerkt, dass die RL-Trainingskonfiguration dieselbe Obergrenze verwendete. Gemma 4 12B veröffentlicht keine entsprechende Obergrenze für einen einzelnen Turn; die Einschränkung dort ist das 256K-Fenster.
• Agentische Schnittstelle — FrogNano emittiert strukturierte Leaf-Aufrufe und benötigt ein Harness, um sie auszuführen. Gemma 4 12B liefert natives Function Calling in seiner instruktionsabgestimmten Form und ist direkt aufrufbar.
• Lizenz — Gemma 4 12B ist Apache 2.0 unter Googles Gemma-4-Bedingungen, sauber angegeben. FrogNanos Karte ist MIT im Frontmatter und Apache 2.0 im Hauptteil – genau die Art von Mehrdeutigkeit, die in einer rechtlichen Prüfung statt in einer Fußnote landet.
• Zahlen — FrogNano meldet 61,5 % SWE-bench Verified, 37,6 % SWE-bench Pro, 31,1 % Terminal-Bench 2.0 und 47,3 % PatchEval-Verified. Gemma 4 12B meldet 77,2 % MMLU Pro, 72,0 % LiveCodeBench v6, eine Codeforces-ELO von 1659, 78,8 % GPQA Diamond und 69,0 % bei Tau2. In Googles Card wird keine SWE-bench-Zeile veröffentlicht, und in Microsofts Card wird LiveCodeBench nicht veröffentlicht. Zwischen den beiden Scoreboards gibt es überhaupt keine Überschneidung.
Der letzte Aufzählungspunkt ist derjenige, der den Instinkt, nach Zahlen zu vergleichen, beenden sollte. Kein einziger Benchmark erscheint auf beiden Karten. Wer 61,5 neben 72,0 stellt, hat eine Repository-Auflösungsrate mit einer Pass-Rate im kompetitiven Programmieren verglichen – ungefähr so, als würde man eine Marathonzeit mit einer Hundert-Meter-Zeit vergleichen, weil beide in Sekunden gemessen werden.
Warum Googles Schweigen zu SWE-bench kein Warnsignal ist
Die verlockende Schlussfolgerung aus der Aufzählung ist, dass FrogNano eine echte SWE-bench-Zahl hat und Gemma nicht, also gewinnt FrogNano die Coding-Frage. Das lässt sich daraus nicht schließen, und zwar aus einem Grund, bei dem es sich lohnt, präzise zu sein.
Gemma 4 12B meldet Tau2 mit 69,0 % – ein agentischer Tool-Use-Benchmark über drei Durchläufe – zusammen mit seiner Function-Calling-Unterstützung und seiner expliziten Positionierung für agentische Workflows. Ein Modell, das 69,0 bei Tau2 erreicht, ist kein Modell, das keine agentische Arbeit leisten kann; es ist ein Modell, dessen Anbieter sich dafür entschieden hat, Tool-Use-Leistung statt Repository-Auflösung zu melden. Google meldet außerdem keine SWE-bench-Zeilen für das 26B- oder das 31B-Modell, was eher eine familienweite redaktionelle Entscheidung als eine Schwäche des 12B ist.
Das kontraintuitive Ergebnis in Microsofts eigenem Papier sollte ein Gemma-Käufer dagegen sorgfältig lesen. FrogNano geht von Qwen3.5-4B aus, einem allgemeinen Modell, das im Leaf-Harness 39,4 % bei SWE-bench Verified erzielte. Fünf Runden Reinforcement Learning auf ungefähr 1.500 synthetischen Aufgaben brachten es auf 61,5 %. Die Lehre ist nicht „kleine Modelle können nicht programmieren“ – sondern dass ein allgemeiner 4B-Checkpoint mit 39,4 % bereits mehr als ein Drittel eines schwierigen, von Menschen validierten Issue-Sets löste, als jemand ihn in einer kompetenten Agent-Schleife laufen ließ. Gemma 4 12B ist dreimal so groß und zwanzig Wochen reifer. Niemand hat es durch Leaf laufen lassen, und bis jemand das tut, ist „Gemma ist kein Repo-Agent“ eine Annahme und keine Feststellung.
Die Harness-Steuer, die die Scoreboards vollständig verbergen
Hier ist die praktische Asymmetrie, und sie ist diejenige, die den Kauf entscheidet.
Gemma 4 12B ist ein Modell. Lade 11,95B Gewichte herunter, richte Transformers, vLLM oder SGLang darauf aus, sende Text, erhalte Text. Google veröffentlicht den Serving-Pfad, die Lizenz ist eindeutig, und die Menschen hinter 2,6 Millionen Downloads sind bereits auf die rauen Kanten gestoßen und haben sie dokumentiert. Wenn die Aufgabe „diesen Stacktrace zusammenfassen“, „diesen Screenshot lesen und mir sagen, was kaputt ist“ oder „diese Funktion mit diesen Argumenten aufrufen“ lautet, funktioniert es heute.
FrogNano-4B-2609 ist ein Modell plus ein Harness, und Microsofts eigenen README macht das Harness nicht optional. Das Repository unter github.com/microsoft/FrogNano ist der Leaf-Evaluierungsaufbau, nicht der Trainingscode – es benötigt einen Kubernetes-Cluster, einen bestehenden Namespace, Berechtigungen zur Verwaltung von Pods und Netzwerkrichtlinien, Pull-Zugriff auf Benchmark-Container-Images sowie einen OpenAI-kompatiblen Endpunkt, der mit den richtigen Reasoning- und Tool-Call-Parsern konfiguriert ist. Microsofts Karte benennt die Übereinstimmungsbedingung unverblümt: Identische Ergebnisse erfordern übereinstimmenden Checkpoint, Tokenizer, Serving-Konfiguration, Task-Images und Evaluierungsprotokoll. Die Hälfte des Releases, die das Ergebnis erzeugt, ist die Hälfte, auf die die Karte mit einem GitHub-Link verweist.
Darin steckt echter Wert, und es lohnt sich, ihn zu benennen, statt ihn abzutun. FrogNanos Beitrag ist eine Task-Synthese-Schleife, die Trainingsprobleme gegen die aktuelle Fähigkeit der Policy neu generiert – die These des Papers lautet, dass ein kleiner Agent ganz ohne Destillation auf synthetischen Aufgaben zu einem wettbewerbsfähigen Niveau trainiert werden kann, und das eröffnet einen Weg für alle, die sich keinen Frontier-Lehrer leisten können. Die API ist öffentlich. Die Methoden sind prinzipiell reproduzierbar. Das ist ein stärkerer Beitrag als ein weiterer inkrementeller Checkpoint, und es ist zugleich mehr Arbeit, als die meisten Teams, die sich darauf einlassen, stemmen wollen.

Wenn du eines auswählst, wähle nach dem Einsatzzweck.
Nimm Gemma 4 12B, wenn die Arbeit Modalitäten mischt, wenn irgendetwas ein Bild sehen oder Audio hören muss, wenn der Kontext gleichzeitig einen großen Dateibaum und ein langes Transkript halten muss, oder wenn du ein Modell willst, das jedes Framework ohne ein zweites System dahinter laden kann. Sein Tau2-Wert von 69,0 und natives Function Calling machen es zu einer vertretbaren Wahl für agentische Pipelines, und niemand muss sich dabei auf das Wort eines Labors verlassen – das Modell wurde von Tausenden von Menschen evaluiert und die Ergebnisse sind kein Geheimnis.
Nehmen Sie FrogNano-4B-2609, wenn Sie bereits einen Repository-Agenten in einer Sandbox betreiben und einen Checkpoint der 4B-Klasse möchten, um ihn dort einzusetzen, und wenn ein 9,32 GB großer Download, der auf bescheidene Hardware passt, die Einschränkung ist, die die Entscheidung bestimmt. Seien Sie realistisch, was die Abfolge angeht: Sie kaufen keine Punktzahl, Sie setzen auf eine Methode, und das Erste, was Sie herausfinden werden, ist, ob Ihre Polling-Schleife und Ihr Tool-Call-Parser genug wie Leaf aussehen. Manche Teams werden am dritten Nachmittag ein Verhalten nahe 61,5 % erzielen, und manche werden zwei Wochen damit verbringen, herauszufinden, dass ihr Evaluationsset einfacher war als SWE-bench Verified, und niemand außerhalb des Labors kann Ihnen derzeit sagen, welcher der beiden Fälle Sie sind.
Wenn die Entscheidung wirklich knapp ist, besteht das günstige Experiment darin, beide im selben Harness an deinen eigenen Aufgaben laufen zu lassen, statt veröffentlichte Zahlen zu debattieren, für die es keinen gemeinsamen Benchmark gibt. OrcaRouter bietet über 200 Modelle hinter einem OpenAI-kompatiblen Schlüssel bei 0 % Aufschlag, sodass die Listenpreise der Anbieter unverändert weitergegeben werden — was es möglich macht, ein gehostetes allgemeines Modell und den Rest deiner Kandidatenmodelle hinter einem einzigen Endpunkt und einer einzigen Abrechnungszeile zu platzieren, während du entscheidest. FrogNano ist keine unserer Routen, und es gibt kein Datum dafür; die Gewichte sind ein Download, den du selbst hostest. Was wir entfernen können, ist die Reibung auf der anderen Seite des Vergleichs: Kandidatenmodelle in deinem eigenen Harness auszutauschen, ohne einen zweiten Vertrag, ein zweites SDK oder einen zweiten Satz Anmeldedaten.

Die ehrliche Zusammenfassung ist, dass die Zahl 61,5 echte Arbeit des Labors darstellt, das sie hervorgebracht hat, und dass sie derzeit der einzige Grund ist, FrogNano beim Coding zu bevorzugen. Wenn jemand außerhalb von Microsoft die 61,5 bei denselben 500 Aufgaben reproduziert – oder daran scheitert –, erhält dieser Vergleich eine echte Antwort. Bis dahin ist die sicherere Standardwahl für die meisten Teams das 11,95B-Modell mit der sauberen Lizenz, der veröffentlichten Langkontext-Messung und zwanzig Wochen fremder Fehler, die bereits in seine Dokumentation eingeflossen sind.
