
FrogNano-4B-2609 vs. Qwen 3.8: Was ein Coding-Agent kostet, wenn die Gewichte Ihnen gehören
- openaiNEUOpenAI: GPT-6.1 Sol2026-09-2952Intelligenz
- anthropicNEUAnthropic: Claude Sonnet 5.52026-09-2856Intelligenz
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 219 tok/s
- OpenAINEUOpenAI: GPT-6 Luna2026-09-2238Intelligenz
- OpenAINEUOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- AnthropicNEUAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- xAINEUGrok 4.72026-09-2146Intelligenz
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 pro 1 Mio. Tokens · 114 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 pro 1 Mio. Tokens · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
microsoft/FrogNano-4B-2609 ist ein Repository-Agent der Vier-Milliarden-Klasse, abgeleitet von Qwen3.5-4B, den Sie selbst herunterladen und bereitstellen. Qwen3.8-Max ist das gehostete Flaggschiff – ein Sparse-Mixture-of-Experts-Modell mit 2,4 Billionen Parametern, von denen pro Token rund 95 Milliarden aktiv sind, einem multimodalen Fenster von einer Million Token und einer Preisliste von 2,00 US-Dollar pro Million Eingabe-Token und 6,00 US-Dollar pro Million Ausgabe-Token – seit dem 3. August 2026 mit einem API-Schlüssel erreichbar. Das eine kostet eine GPU und einen Nachmittag. Das andere kostet nichts, bis Sie es verwenden, und dann rechnet es pro Token auf den längsten gängigen Trajektorien ab. Dieser Trade-off, und nicht die Benchmark-Tabelle, ist das eigentliche Duell.
Die FrogNano-Zahlen hier stammen aus Microsofts Model Card und technischem Bericht; die Qwen3.8-Max-Zahlen stammen aus Alibabas veröffentlichten Preisangaben und dem Modelleintrag in unserem eigenen Katalog, wobei die unabhängigen Bewertungen überall, wo sie auftauchen, als Artificial-Analysis-Werte gekennzeichnet sind. Achte genau auf die Benennung: Qwen3.8, das Open-Weights-Release, wurde angekündigt, aber noch nicht ausgeliefert, während Qwen3.8-Max heute live und bepreist ist. Alles, was in diesem Artikel aufrufbar ist, ist Letzteres.
Die Arithmetik, die den Vergleich entscheidet
Beginne damit, was eine einzelne Aufgabe kostet, denn es ist nicht offensichtlich und es ist nicht klein.
Die Evaluierungen von FrogNano ließen jede Trajektorie mit einem Budget von 150 Schritten innerhalb von ungefähr 131K kombinierten Tokens laufen, bei bis zu 8.192 generierten Tokens pro Assistenten-Turn und einer Obergrenze von 10.800 Sekunden. Multipliziert man die beiden veröffentlichten Grenzwerte, erhält man eine Obergrenze von etwa 1,23 Millionen generierten Tokens für eine Worst-Case-Trajektorie – was bei 6,00 $ pro Million Ausgabe-Tokens von Qwen3.8-Max ungefähr 7,38 $ für eine einzelne Aufgabe ist, die bis zum Ende ihres Budgets lief. Das ist Arithmetik mit zwei veröffentlichten Zahlen, keine Messung: Reale Trajektorien stoppen früh, der Durchschnitt liegt weit unter der Obergrenze, und Tool-Ergebnisse sowie Shell-Ausgaben werden zum günstigeren Eingabe-Tarif statt zum Ausgabe-Tarif abgerechnet. Aber es umreißt die Sache. Ein Coding-Agent gibt nicht ein paar Hundert Tokens für eine Frage aus; er führt eine lange, reasoning-intensive Unterhaltung mit sich selbst, und jedes Token dieser Unterhaltung wird generiert.
Lege nun die andere Seite der Bilanz daneben. FrogNano-4B-2609 umfasst 9,32 GB BF16-Gewichte in zwei Shards und ist ohne Zugangsbeschränkung herunterladbar. Für sein Serving braucht es SGLang mit einem Qwen3-Reasoning-Parser und einem Qwen3-Coder-Tool-Call-Parser sowie eine isolierte Sandbox für die fünf Tools. Danach sind die Grenzkosten einer Trajektorie Strom, und der Speicher, den sie belegt, richtet sich danach, wozu dein Kontext anwächst, und nicht danach, was die Gewichte wiegen.
• Kostenmodell — FrogNano-4B-2609 hat feste Hardwarekosten und nahezu null Grenzkosten. Qwen3.8-Max hat null Fixkosten und Abrechnung pro Token, mit einer Aufteilung von 2,00 $ / 6,00 $, die nichts vorab verlagert und alles zum Ausgabetarif nach hinten verlagert.
• Was das Geld kauft — ein Agent der 4B-Klasse auf Ihrem eigenen Silizium, gegen ein Modell in Frontier-Größenordnung, für das Sie nie Kapazitätsplanung betreiben müssen.
• Break-even — er ist erreicht, wenn Ihr monatliches Trajektorienvolumen multipliziert mit der durchschnittlichen Token-Rechnung pro Trajektorie die Kosten der GPU übersteigt, die Sie andernfalls mieten würden. Für ein Team, das täglich eine Handvoll Repository-Aufgaben ausführt, ist diese Grenze weit entfernt, und das gehostete Modell gewinnt allein schon wegen seiner Bequemlichkeit.
Zwei Modelle, die nicht dieselbe Aufgabe erfüllen
Der Kostenvergleich ist nur fair, wenn die Ergebnisse vergleichbar sind, und hier sind sie es nicht – und genau das ist der Punkt, den die meisten Datenblätter verschweigen.
FrogNano-4B-2609 wurde ausschließlich auf Software-Engineering auf Repository-Ebene nachtrainiert. Seine gesamte Schnittstelle ist eine Schleife aus fünf Werkzeugen – Read, Write, Edit, Glob und Bash – ausgeführt von der Leaf-Harness in einer isolierten Sandbox, wobei so lange iteriert wird, bis das Modell keine Aufrufe mehr tätigt. In Microsofts Modellkarte werden Englisch als unterstützte Sprache und Python als validierte Programmierdomäne angegeben, und es wird unumwunden gesagt, dass Bild- und Videokomponenten im Checkpoint nie nachtrainiert wurden und nicht unterstützt werden. Es denkt nicht über Ihre Architektur nach, beantwortet keine Fragen zu Ihrem Unternehmen und liest keinen Screenshot.
Qwen3.8-Max ist ein allgemeines Modell. Der Katalogeintrag von Alibaba gibt ihm Text-, Bild- und Videoeingabe bei Textausgabe und ein Kontextfenster von 1.000.000 Token. Es kann schlussfolgern, schreiben, Dokumente lesen und ein Gespräch führen, und sein Function Calling ist eine Funktion eines allgemeinen Modells und nicht der eigentliche Zweck des Checkpoints. Seine Artificial Analysis-Zahlen, ausgelesen aus dem Eintrag am 2. September 2026, sind ein Intelligence Index von 45,4 und ein Coding Index von 76,2.
• Eingabe — FrogNano-4B-2609 ist nur Text. Qwen3.8-Max verarbeitet Text, Bilder und Videos.
• Kontext — etwa 131K kombinierte Token für FrogNanos evaluierte Konfiguration, gegenüber 1.000.000 für Qwen3.8-Max. Das ist ein Faktor von siebeneinhalb, und er fällt genau bei den repositorygroßen Eingaben am stärksten ins Gewicht, die ein Coding-Agent erhält.
• Ausgabe pro Turn — Die validierte Konfiguration von FrogNano begrenzt einen einzelnen Assistenten-Turn auf 8.192 Token. Qwen3.8-Max veröffentlicht keine entsprechende Obergrenze pro Antwort.
• Ausgabeformat — FrogNano gibt strukturierte Leaf-Tool-Aufrufe aus und benötigt eine Ausführungsumgebung, um sie auszuführen. Qwen3.8-Max gibt Prosa oder einen Funktionsaufruf an den Client zurück, den Sie bereits verwenden.
• Unabhängige Bewertungen – keine für FrogNano-4B-2609 über seine eigene Karte hinaus; die oben genannten Qwen3.8-Max-Werte sind Drittanbieter-Angaben von Artificial Analysis.
• Parameter – laut Beschreibung auf seiner eigenen Modellkarte etwa 4,66 Mrd. für FrogNano, gegenüber 2,4 Billionen insgesamt und rund 95 Mrd. aktiven Parametern für Qwen3.8-Max.

Wo der 4B tatsächlich seinen Platz verdient
Es gibt eine Achse, auf der ein 4B-Agent ein Frontier-Modell eindeutig schlägt, und es ist nicht die Genauigkeit.
FrogNanos Paper geht von Qwen3.5-4B aus, das als einfaches allgemeines Modell über den Leaf-Harness 39,4 % auf SWE-bench Verified erreichte. Fünf Reinforcement-Learning-Iterationen auf rund 1.500 synthetischen Aufgaben brachten es auf 61,5 %, wobei der Anhang desselben Papers den Fortschritt pro Iteration mit 48,2 %, 53,4 %, 58,3 %, 58,6 % und 61,6 % angibt. Die Methode – das Generieren von Aufgaben, die auf die Lernbarkeitsgrenze der aktuellen Policy kalibriert sind, ohne Destillation von einem stärkeren Modell – ist der Beitrag und der Grund, warum sich eine Forschungsgruppe ohne Budget für Frontier-Modelle dafür interessieren würde.
Lies, was das für den Vergleich bedeutet. Microsofts Model Card räumt offen ein, dass FrogNano nicht durchgängig besser ist als das Modell, von dem es abstammt: Seine Rate paralleler Tool-Aufrufe liegt bei 1,71 %, weil spätere Iterationen die Fähigkeit verloren haben, gleichzeitige Aufrufe auszulösen, und das Team eine Konsolidierungsstufe hinzugefügt hat, um sie zurückzugewinnen. Ein Modell, das mehr Probleme löst, während es bei einem bestimmten Verhalten schlechter wird, ist ein echtes Ingenieursartefakt mit sichtbaren Nahtstellen – und seine Model Card sagt das, statt es zu verschweigen.
Und die SWE-bench-Zahl ist ein geschlossener Kreislauf. Die Baseline des Basismodells, der Harness und die Endpunktzahl stammen alle aus demselben Labor, und die beiden Tabellen desselben Papers ergeben zwei unterschiedliche Rangfolgen für dasselbe Experiment. Der Coding-Wert von Qwen3.8-Max hingegen wurde von Artificial Analysis erzeugt und nicht von Alibaba – eine andere Art von Beleg, eine andere Art von Aussagekraft, und die beiden sollten niemals voneinander abgezogen werden.
Die 4B, die man noch nicht ganz einplanen kann
Zwei Dinge stehen zwischen FrogNano-4B-2609 und einem Produktionsslot, und beide liegen in seiner eigenen Dokumentation und nicht in der Meinung irgendeines Reviewers.
Der erste Punkt ist die Hardware. Die Karte gibt den BF16-Gewichtsbedarf mit etwa 9,3 GB an und ergänzt dann, dass der Speicherbedarf „deutlich zunimmt, wenn sich der kombinierte Kontext ungefähr 131K Token nähert“, bevor sie feststellt, dass das genaue minimale GPU-Modell, die VRAM-Konfiguration, die Runtime-Versionen und das Leistungsprofil „vor der Veröffentlichung noch validiert werden müssen“ – ein Satz, der auf einem bereits herunterladbaren Modell erscheint. Niemand hat eine VRAM-Angabe für die evaluierte Konfiguration veröffentlicht, und die Karte enthält keine.
Der zweite Punkt ist die Sicherheitshaltung. Microsofts Alignment-Hinweis besagt, dass das agentenspezifische Post-Training keine Datensätze zu Sicherheitspräferenzen, Verweigerung, schädlichen Inhalten oder adversarialen Daten verwendet hat, dass stattdessen auf funktionale Korrektheit und Vermeidung von Regressionen optimiert wurde und dass das Modell „nicht als unabhängig sicherheitsausgerichtet für den uneingeschränkten autonomen Einsatz betrachtet werden sollte“. Die Karte schließt mit der Benennung der konkreten Risiken: Patches können auch trotz Bestehens ihrer Tests falsch sein, die Leistung ist empfindlich gegenüber der Qualität dieser Tests, und jeder Kandidaten-Patch benötigt vor der Verwendung eine qualifizierte menschliche Überprüfung sowie unabhängige Regressions- und Sicherheitstests. Ein allgemeines gehostetes Modell bringt keine dieser spezifischen Einschränkungen mit und wird auch keinen Shell-Befehl in Ihrem Repository ausführen.
Ein Schlüssel, egal für welche Seite du dich entscheidest
Das Nützliche daran, diesen Vergleich in der Praxis durchzuführen, ist, dass nur eine Hälfte davon ein Download ist. Qwen3.8-Max und die allgemeinen Modelle, mit denen man einen selbst gehosteten Agenten vergleichen würde, sind alle über einen OpenAI-kompatiblen Endpunkt auf OrcaRouter erreichbar bei 0 % Aufschlag — Listenpreis des Anbieters durchgereicht, sodass eine Preisänderung eines Anbieters noch am selben Tag bei uns ankommt, und das ist die Zahl, die sich tatsächlich bewegt, wenn die Rechnung für Ausgabe-Token eines Coding-Agenten das ist, was man unter Kontrolle bringen will. Das macht auch die Failover-Frage einfach: Wenn die gehostete Hälfte der Pipeline beeinträchtigt wird, erfolgt der erneute Versuch automatisch und das Experiment läuft weiter.
FrogNano-4B-2609 ist keine unserer Routen, und dafür gibt es keinen Termin. Die Gewichte können Sie selbst servieren, und die Karte gibt ehrlich an, dass die Serving-Konfiguration nicht vollständig validiert wurde. Was wir tun können, ist dafür zu sorgen, dass die Einrichtung der anderen Seite des Vergleichs nichts kostet, sodass die Frage, die Sie am Ende beantworten, die eigentliche ist – ob ein vom Anbieter angegebener SWE-bench-Agent mit 61,5 % auf Ihrer eigenen GPU ein nutzungsabhängig abgerechnetes Frontier-Modell bei Ihren eigenen Aufgaben und in Ihrem eigenen Umfang schlägt.

Zu welchem man greifen sollte
Greifen Sie zu Qwen3.8-Max, wenn die Arbeit allgemein ist, wenn das Operations-Team von jemand anderem die Kapazität tragen sollte, wenn die Eingabe ein Bild oder ein langes Dokument enthalten könnte oder wenn Sie heute eine Antwort brauchen und nicht erst bis Freitag einen Serving-Stack. Seine Third-Party-Bewertungen bedeuten, dass Sie ungefähr vorhersagen können, was Sie kaufen, und seine Abrechnung pro Token ist ein variabler Kostenfaktor, den Sie sehen, bevor Sie sich festlegen. Für ein Team, das monatlich eine überschaubare Anzahl an Repository-Aufgaben ausführt, fällt die Rechnung nicht knapp aus.
Greifen Sie auf FrogNano-4B-2609 zurück, wenn das Volumen hoch genug ist, dass die Abrechnung pro Token bei langen Trajektorien die einschränkende Bedingung ist, wenn die Daten Ihre Infrastruktur nicht verlassen dürfen, oder wenn die Forschungsfrage – kann ein kleiner Agent ohne Lehrer zu Repository-Level-Kompetenz trainiert werden – das ist, was Sie tatsächlich testen. Gehen Sie mit dem Wissen an die Sache, dass drei Dinge gelten: Die 61,5 % sind eine eigene Messung eines Labors auf einem vom Labor gepflegten Harness, niemand hat eine VRAM-Zahl für die evaluierte Konfiguration veröffentlicht, und die Karte selbst sagt, dass das Serving-Setup noch nicht validiert ist.
Das Bemerkenswerte an dieser Paarung ist, dass sie einen gemeinsamen Vorfahren zwei Generationen zurück haben. FrogNano stammt von Qwen3.5-4B ab – einem allgemeinen Modell desselben Unternehmens, dessen Flaggschiff mit 2,4 Billionen Parametern auf der gegenüberliegenden Seite steht. Microsoft nahm das kleine Modell, investierte fünf RL-Iterationen in synthetische Repositories und erhielt einen Spezialisten. Alibaba ging den anderen Weg und skalierte. Beide Antworten sind veröffentlicht, und die Differenz zwischen dem, was der Download kostet, und dem, was die API kostet, ist der ehrliche Weg, zwischen ihnen zu wählen.

In diesem Artikel verglichen1
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
