
FrogNano-4B-2609 vs Intern Decision 4B: Ein Basismodell, zwei völlig unterschiedliche Wetten
- openaiNEUOpenAI: GPT-6.1 Sol2026-09-2952Intelligenz
- anthropicNEUAnthropic: Claude Sonnet 5.52026-09-2856Intelligenz
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 219 tok/s
- OpenAINEUOpenAI: GPT-6 Luna2026-09-2238Intelligenz
- OpenAINEUOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- AnthropicNEUAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- xAINEUGrok 4.72026-09-2146Intelligenz
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 pro 1 Mio. Tokens · 114 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 pro 1 Mio. Tokens · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
Zwei Labore nahmen denselben Checkpoint, Qwen3.5-4B, und trieben ihn in Richtungen, die einander nicht ähneln. microsoft/FrogNano-4B-2609 wurde mit Reinforcement Learning auf rund 1.500 synthetischen Software-Engineering-Umgebungen nachtrainiert, bis es strukturierte Tool-Aufrufe und Multi-File-Patches über ein Fünf-Tool-Harness ausgeben konnte. internlm/Intern-Decision-4B wurde darauf feinabgestimmt, überhaupt keinen Text auszugeben — es nimmt einen Zustand plus ein Schema benannter Fragen entgegen und liefert in einem einzigen Vorwärtsdurchlauf für jede Option eine kalibrierte Wahrscheinlichkeit. Der eine schreibt Code. Der andere weigert sich, überhaupt etwas zu schreiben, und gibt eine Verteilung zurück. Sie anhand der Qualität zu vergleichen, ist sinnlos; sie danach zu vergleichen, was sie dich im Betrieb kosten und womit man ihnen vertrauen kann, ist die ehrliche Übung.
Beide wurden ohne Ankündigung veröffentlicht – die andere Gemeinsamkeit, die sie teilen. Keines von beiden hat einen Eintrag bei Artificial Analysis, eine Arena-Bewertung oder auch nur eine einzige unabhängige Evaluation. Jede unten stehende Zahl – die SWE-bench-Leiter auf der einen Seite, die Brier- und ECE-Kalibrierungszeilen auf der anderen – wurde von dem Labor erzeugt, das das Modell trainiert hat, auf dessen eigenem Harness, und ist noch nie auf einen Testsatz gestoßen, aus dem sie nicht selbst stammte.
Der Fork geschah, bevor es eines der beiden Modelle gab.
Der Basis-Checkpoint ist ein dichtes 32-schichtiges hybrides Gated-DeltaNet- und Gated-Attention-Modell, und beide Derivate erben sein Skelett. Danach haben die beiden Post-Training-Pipelines nichts gemeinsam.
Microsofts Pipeline ist ein geschlossener Kreislauf. TaskPilot generiert Kandidaten-Repository-Aufgaben aus echten Snapshots, führt Rollouts vom aktuellen Checkpoint aus durch, um solche zu finden, die die Policy manchmal löst, behält diese und trainiert. Fünf Iterationen, jede kalibriert gegen die Policy der vorherigen Iteration, endend bei 61,5 % auf SWE-bench Verified und 37,6 % auf SWE-bench Pro. Keine Destillation – die Model Card gibt an, dass keine Trajektorien, Aktionen oder Reasoning-Spuren eines stärkeren Modells als Ziele verwendet wurden.
Die Pipeline von InternLM ist eine einzige überwachte Zielfunktion für eine feste Aufgabenform. Dem Modell werden ein System-Prompt, ein Zustand, ein Entscheidungsschema und ein vollständiges Assistant-JSON-Gerüst mit einem Platzhalter pro Feld vorgegeben. Es führt einen kausalen Vorwärtsdurchlauf aus, liest die Logits an jeder Platzhalterposition und bildet eine Softmax nur über die für dieses Feld zulässigen Kandidatensymbole. Die InternLM-Karte sagt es unverblümt: Dieser Pfad „ruft nicht generate() auf und sampelt keinen Freitext.“
Dieser Unterschied ist kein Skalenunterschied. Es ist ein Unterschied darin, was das Artefakt überhaupt ist. FrogNano-4B-2609 ist ein Agent, der auf hundert interessante Arten falschliegen und durch Tests korrigiert werden kann. Intern-Decision-4B ist ein Scorer, dessen Fehlermodus eine selbstsichere Zahl ist.
Zwei Verträge, und keiner davon ist „einen Prompt senden“.
FrogNanos Vertrag ist eine Schleife. Das Modell sendet Aufrufe an Read, Write, Edit, Glob und Bash; die Leaf-Harness führt sie in einer isolierten Repository-Sandbox aus und gibt die Ausgabe zurück; die Schleife läuft weiter, bis das Modell aufhört aufzurufen. Die Evaluierungen liefen bei 150 Schritten innerhalb von ungefähr 131K kombinierten Tokens, mit bis zu 8.192 generierten Tokens pro Assistentenrunde. Das Serving erfordert SGLang mit einem Qwen3-Reasoning-Parser und einem Qwen3-Coder-Tool-Call-Parser – macht man das falsch, erzeugt das Modell Prosa, wo die Harness JSON erwartet, was von außen betrachtet genau wie ein defektes Modell aussieht.
Der Kontrakt von Intern-Decision-4B ist ein einziger Versuch mit harten Grenzen. Fragen und Optionen behalten ihre Reihenfolge. Optionen werden auf Ein-Token-Symbole abgebildet — A bis Z, dann a bis z, dann 0 bis 9, was der arithmetische Grund dafür ist, dass eine Frage bei maximal 62 Optionen endet. Die Obergrenze des Wrappers liegt bei 8.192 Tokens, und die Modellkarte von InternLM stellt ausdrücklich klar, dass längere Eingaben ohne Kürzung abgelehnt werden. Drei Fragetypen werden unterstützt: choice mit einer geordneten Kriterienzuordnung, score mit einer Liste oder einer Map mit numerischen Schlüsseln, und noul, ein Binärwert. Bis zu acht Bilder sind erlaubt, und ihre Tokens werden auf dieselben 8.192 angerechnet.
• Ausgabeform — FrogNano-4B-2609 gibt Tool-Aufrufe, Reasoning-Text und einen Patch aus. Intern-Decision-4B gibt ein Symbol pro Feld und sonst nichts aus.
Determinismus: FrogNation zieht bei Temperatur 0,6 über drei Seeds hinweg Stichproben, ist also konstruktionsbedingt probabilistisch. Der Argmax von Intern-Decision-4B ist durch den Forward-Pass festgelegt; die angepasste Temperatur verschiebt nur seine Konfidenz.
• Fehlerfläche — FrogNano kann eine API halluzinieren, eine Änderung zu weit fassen oder Tests bestehen, während es eine Schwachstelle einführt – all dies benennt seine Karte. Intern-Decision-4B kann keine Antwort halluzinieren, weil es nur aus den von dir vorgegebenen Optionen auswählen kann – es kann nur fehlkalibriert sein.
• Eingabeobergrenze — etwa 131K kombinierte Tokens für FrogNano in seiner evaluierten Konfiguration, gegenüber einem harten Limit von 8.192 für Intern-Decision-4B, was dem Sechzehnfachen entspricht, und es gibt keinen Workaround.
• Kostenprofil — FrogNano rechnet nach der Trajektorie ab, und Trajektorien sind lang. Intern-Decision-4B hat überhaupt keine Output-Tokens, die abgerechnet werden könnten.
• Parameter — die FrogNano-Karte gibt einen Bereich von „500M-5B“ an und beschreibt ungefähr 4,66B, mit einem 9,32 GB großen BF16-Download; Intern-Decision-4B wird mit 4,54B angegeben, mit einem 612 MB großen Vision-Tower und einem 54 MB großen Projektor zusammen mit seinen Sprach-Shards.
Die Zahl, die diese Paarung entscheidet
InternLMs Karte gibt Intern-Decision-4B mit 44,16 ms mittlerer Latenz und 44,03 ms Median auf einer einzelnen RTX 4090 über den lokalen Hugging-Face-Pfad an, mit einem P95 von 44,60 ms. Lesen Sie diese Streuung noch einmal: Vom Median bis zum Tail liegt deutlich unter einer Millisekunde, weil ein Forward-Pass mit fester Form fast nichts hat, was variieren kann. Das ist das ganze Argument für die Architektur.
FrogNanos entsprechender Wert ist nicht in Millisekunden angegeben. Seine Evaluationen erlaubten ein Budget von 150 Schritten mit einer Obergrenze von 10.800 Sekunden pro Aufgabe für den Agenten. Das sind keine vergleichbaren Einheiten und sollte niemals im selben Satz wie eine Latenzaussage stehen — aber sie verraten dir die Form des Kompromisses. Ein Modell beantwortet eine Entscheidung in vierundvierzig Millisekunden, das andere verbringt Minuten mit Tool-Aufrufen, um einen Patch zu jagen. Wenn dein Problem lautet „dieses Ticket in eine von sechs Warteschlangen zu leiten und mir zu sagen, wie sicher du bist“, dann ist das erste keine billigere Version des zweiten, sondern eine andere Maschine.
Beide Labore haben sich selbst sorgfältig gemessen, und beide Messreihen sollten als Absichten statt als Ergebnisse gelesen werden. InternLM meldet einen Durchschnitt über sieben Sets von 90,02 bei einem Brier-Score von 0,347 und einem erwarteten Kalibrierungsfehler von 0,065, angepasst bei einer Temperatur von 1,99241824 auf 1.728 designierten Kalibrierungsfällen. Microsoft meldet einen Anstieg über fünf Iterationen von 39,4 % auf 61,5 % bei SWE-bench Verified, und der Anhang derselben Arbeit gibt dieselbe Entwicklung mit 48,2 %, 53,4 %, 58,3 %, 58,6 % und 61,6 % an – eine Erinnerung daran, dass selbst innerhalb eines Labors dieselbe Tatsache, auf zwei Arten gemessen, zwei Leitern ergibt.

Das Verräterische liegt darin, wovor jede Karte beschließt, Sie zu warnen.
Beide Karten sind ungewöhnlich ehrlich, und die Ehrlichkeit weist in entgegengesetzte Richtungen – was das Nützlichste an diesem Vergleich ist.
Der Abschnitt zu bekannten Einschränkungen von Microsoft liest sich wie eine Einsatzwarnung. Nur Englisch und Python. Die Leistung reagiert empfindlich auf Harness- und Testqualität. Patches, die trotz bestandener Tests falsch oder unsicher sein können. Der Satz auf der Karte selbst lautet, dass FrogNano „nicht als eigenständig sicherheitsausgerichtet für uneingeschränkten autonomen Einsatz betrachtet werden sollte“, und er benennt die konkrete Lücke: Das agentenspezifische Post-Training verwendete keine Sicherheitspräferenz-, Verweigerungs- oder Adversarial-Daten, weil es stattdessen auf funktionale Korrektheit und Vermeidung von Regressionen optimiert wurde. Sie gibt außerdem unaufgefordert die Parallel-Tool-Call-Rate von 1,71 % an, was bedeutet, dass das Modell fast nie zwei Tools in einem Turn aufruft, obwohl das Harness dies zulässt – eine echte Fähigkeitsregression gegenüber dem Basismodell, die das Team mit einer hinzugefügten Konsolidierungsphase wiederherzustellen versuchte.
Die Modellkarte von InternLM warnt vor der genau entgegengesetzten Art von Problem. Es gibt keine Halluzinationsoberfläche, vor der gewarnt werden müsste, daher betreffen die Vorbehalte die Eingaben: die Ablehnung bei 8.192, die Obergrenze von 62 Optionen, die Tatsache, dass der zugrunde liegende Text-Tower ein Positionslimit von 262.144 Token deklariert, das der veröffentlichte Wrapper nicht verwenden will. Sein Risiko besteht darin, dass einer selbstsicheren Zahl mehr vertraut wird, als es ihr zusteht, und die Modellkarte räumt offen ein, dass die Kalibrierung eine Lücke zur Jev-Baseline verringert, ohne sie in jedem Slice zu schließen.
Zusammen gelesen beschreiben sie zwei unterschiedliche Vertrauenshaltungen. FrogNano braucht Aufsicht, weil es handelt. Intern-Decision-4B braucht ein Audit, weil es bewertet – und eine Zahl, die eine Produktionsentscheidung beeinflusst, ist genau die Art von Ausgabe, die zu testen niemand auf die Idee kommt.
Wo ein Router passt, und eine ehrliche Anmerkung zu beiden
Keines der beiden Modelle ist ein gehosteter Endpunkt. FrogNano wird als Gewichte plus ein Kubernetes-Evaluierungsharness ausgeliefert; Intern-Decision-4B wird als Python-Klasse ausgeliefert, die man importiert, nachdem man vier Shards heruntergeladen hat. Für ein Team, das eines von beiden vor etwas Realem ausprobieren möchte, ist das sichere Muster für beide dasselbe, und es ist nicht glamourös: die experimentelle Komponente hinter einen Fallback zu stellen, sodass eine schlechte Trajektorie oder ein fehlkalibrierter Tag einen erneuten Versuch statt eines Vorfalls kostet.
Genau dafür ist eine Routing-Schicht da. OrcaRouter betreibt über 200 Modelle hinter einem einzigen OpenAI-kompatiblen Schlüssel mit 0 % Aufschlag — der Listenpreis des Anbieters wird durchgereicht, sodass eine Preisänderung eines Anbieters noch am selben Tag bei uns ankommt — und sein Failover sitzt vor dem allgemeinen Modell, auf das Sie zurückgreifen, nicht vor diesen beiden. Um es klar zu sagen: Wir führen FrogNano-4B-2609 oder Intern-Decision-4B nicht, und für keines von beiden gibt es ein Datum. Was Ihnen ein einzelner Endpunkt hier verschafft, ist, dass der Vergleich selbst günstig wird — ein einziger Zugangsschlüssel, eine Abrechnungszeile und keine zweite Integration jedes Mal, wenn Sie das allgemeine Modell austauschen, gegen das Sie den Spezialisten benchmarken.

Welches, und wann
Nimm Intern-Decision-4B, wenn die Antwort bereits in deinem Prompt steht und du sie ausgewählt brauchst, mit einer zugehörigen Konfidenz, mit einer Rate von Tausenden pro Sekunde. Routing mit fester Taxonomie, Rubrikbewertung, schemaeingeschränkte Extraktion, Moderation gegen ein geschlossenes Label-Set. Der 44-Millisekunden-Forward-Pass und die Abrechnung ohne Ausgabe-Tokens sind das Produkt, und die Kalibrierung ist der Punkt, den du prüfen musst, bevor du ihr vertraust.
Nimm FrogNano-4B-2609, wenn die Antwort noch nicht existiert und erst durch das Lesen eines Repositorys und das Ausführen seiner Tests entdeckt werden muss. Das ist ein minutenlanger, in einer Sandbox ablaufender, überprüfbarer Prozess, und die 61,5 % bei SWE-bench Verified – vom Anbieter gemeldet, nicht reproduziert – sind der derzeit beste Beleg dafür, dass ein 4B-Checkpoint das überhaupt schaffen kann.
Was in keinem Fall durchgehen darf, ist die Angewohnheit, ihre Ergebnisse zu vergleichen. Ein Durchschnitt von 90,02 über sieben Sätze und eine SWE-bench-Verified-Rate von 61,5 sind Messungen zweier verschiedener Fragen, erzeugt von zwei Labors, auf zwei Testumgebungen, und keine der beiden Zahlen ist durch die Hände eines Dritten gegangen. Sie teilen einen Vorfahren und sonst nichts.

Die einzige wirklich nützliche Vorhersage aus dem gemeinsamen Vorfahren: Weil beide Modelle vom selben 4B-Checkpoint ausgehen, liegt der Unterschied zwischen ihnen fast vollständig im Post-Training, was bedeutet, dass die interessante Frage für alle, die auf Qwen3.5-4B aufbauen, lautet, welche dieser beiden Reward-Strukturen sich auf ihre eigene Domäne übertragen lässt. Eine synthetische Task-Schleife, die sich an ihrer eigenen Policy kalibriert, oder ein Scoring-Head mit fester Form und angepasster Temperatur. Das sind zwei Rezepte, beide veröffentlicht, beide aus Labors, die noch niemand anderen sie haben ausführen lassen. Das ist eine seltene Situation und es lohnt sich, sie zu beobachten, statt sich darauf einzulassen.
