
FrogNano-4B-2609 vs Intern Decision 4B: Jeden model bazowy, dwa całkowicie różne zakłady
- openaiNOWOŚĆOpenAI: GPT-6.1 Sol2026-09-2952Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Sonnet 5.52026-09-2856Inteligencja
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 219 tok/s
- OpenAINOWOŚĆOpenAI: GPT-6 Luna2026-09-2238Inteligencja
- OpenAINOWOŚĆOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- AnthropicNOWOŚĆAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- xAINOWOŚĆGrok 4.72026-09-2146Inteligencja
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 za 1 mln tokenów · 114 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 za 1 mln tokenów · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
Dwa laboratoria wzięły ten sam checkpoint, Qwen3.5-4B, i pchnęły go w kierunkach, które wcale nie są do siebie podobne. microsoft/FrogNano-4B-2609 został dotrenowany uczeniem ze wzmocnieniem na około 1500 syntetycznych środowiskach inżynierii oprogramowania, aż potrafił emitować ustrukturyzowane wywołania narzędzi i patche obejmujące wiele plików przez harness z pięcioma narzędziami. internlm/Intern-Decision-4B został dostrojony tak, by nie emitować żadnego tekstu — przyjmuje stan wraz ze schematem nazwanych pytań i zwraca skalibrowane prawdopodobieństwo dla każdej opcji w pojedynczym przebiegu w przód. Jeden pisze kod. Drugi odmawia napisania czegokolwiek i zwraca rozkład. Porównywanie ich pod względem jakości nie ma sensu; uczciwym ćwiczeniem jest porównanie ich pod względem kosztu uruchomienia i tego, z czym można im zaufać.
Oba trafiły na rynek bez zapowiedzi — to kolejna rzecz, którą mają wspólną. Żaden z nich nie ma wpisu w Artificial Analysis, oceny w rankingu arenowym ani ani jednej niezależnej ewaluacji. Każda liczba poniżej — drabinka SWE-bench po jednej stronie, wiersze kalibracji Brier i ECE po drugiej — została wytworzona przez laboratorium, które wytrenowało model, przy użyciu własnego środowiska testowego tego laboratorium, i nigdy nie spotkała zbioru testowego, z którego nie pochodziłaby.
Fork nastąpił, zanim istniał którykolwiek z tych modeli.
Bazowy checkpoint to gęsty, 32-warstwowy hybrydowy model Gated DeltaNet i bramkowanej uwagi, a oba warianty pochodne dziedziczą jego szkielet. Po tym jednak dwa potoki po treningu nie mają już ze sobą nic wspólnego.
Pipeline Microsoftu to zamknięta pętla. TaskPilot generuje kandydatów na zadania w repozytorium na podstawie rzeczywistych snapshotów, uruchamia rolouty z bieżącego checkpointu, aby znaleźć te, które polityka czasami rozwiązuje, zachowuje je i trenuje. Pięć iteracji, każda kalibrowana względem polityki z poprzedniej iteracji, kończąc na 61,5% w SWE-bench Verified i 37,6% w SWE-bench Pro. Bez destylacji — karta stwierdza, że jako cele nie zostały użyte żadne trajektorie, działania ani ślady rozumowania silniejszego modelu.
Pipeline InternLM-a to pojedynczy nadzorowany cel na ustalonym kształcie zadania. Model otrzymuje prompt systemowy, stan, schemat decyzji oraz kompletny szkielet JSON asystenta z jednym symbolem zastępczym na pole. Wykonuje jeden przyczynowy przebieg w przód, odczytuje logity na pozycji każdego symbolu zastępczego i wykonuje softmax wyłącznie po dozwolonych symbolach-kandydatach danego pola. Karta InternLM-a mówi to wprost: ta ścieżka „nie wywołuje generate() ani nie próbkuje swobodnego tekstu”.
Ta różnica nie jest różnicą skali. To różnica w tym, czym ten artefakt w ogóle jest. FrogNano-4B-2609 to agent, który może się mylić na sto interesujących sposobów i być korygowany przez testy. Intern-Decision-4B to oceniający, którego tryb awarii to liczba pełna pewności siebie.
Dwa kontrakty, a żaden z nich nie jest „wysłaniem promptu”
Kontrakt FrogNano to pętla. Model emituje wywołania do Read, Write, Edit, Glob i Bash; harness Leaf wykonuje je wewnątrz odizolowanego sandboxa repozytorium i zwraca wynik; pętla trwa, dopóki model nie przestanie wywoływać. Ewaluacje przebiegały przez 150 kroków w ramach łącznie około 131 tys. tokenów, z maksymalnie 8192 generowanymi tokenami na turę asystenta. Serwowanie wymaga SGLang z parserem rozumowania Qwen3 i parserem wywołań narzędzi Qwen3 coder — jeśli zrobisz to źle, model generuje prozę tam, gdzie harness oczekuje JSON, co z zewnątrz wygląda dokładnie jak zepsuty model.
Kontrakt Intern-Decision-4B jest jednorazowy z twardym ograniczeniem. Pytania i opcje zachowują swoją kolejność. Opcje są mapowane na symbole będące pojedynczymi tokenami — A do Z, potem a do z, potem 0 do 9, co jest arytmetycznym powodem, dla którego pytanie ma maksymalnie 62 opcje. Górny limit wrappera to 8 192 tokeny, a karta modelu InternLM wyraźnie mówi, że dłuższe dane wejściowe są odrzucane bez obcinania. Obsługiwane są trzy typy pytań: wybór z uporządkowaną mapą kryteriów, punktacja z listą lub mapą z kluczami numerycznymi, oraz noul, binarny. Dozwolone jest maksymalnie osiem obrazów, a ich tokeny wliczają się do tych samych 8 192 tokenów.
• Kształt wyjścia — FrogNano-4B-2609 generuje wywołania narzędzi, tekst rozumowania i patch. Intern-Decision-4B generuje jeden symbol na pole i nic więcej.
• Determinizm — FrogNano próbkuje przy temperaturze 0,6 dla trzech ziaren, więc jest probabilistyczny z założenia. Argmax Intern-Decision-4B jest ustalony przez przejście w przód; dopasowana temperatura wpływa jedynie na jego pewność.
• Powierzchnia awarii — FrogNano może halucynować API, zbyt mocno rozszerzyć edycję lub przechodzić testy, wprowadzając przy tym podatność — a jego karta wymienia je wszystkie. Intern-Decision-4B nie może halucynować odpowiedzi, ponieważ może wybierać tylko spośród opcji, które podałeś — może być jedynie źle skalibrowany.
• Limit wejściowy — około 131 tys. łącznych tokenów dla FrogNano w jego ocenianej konfiguracji, w porównaniu z twardym limitem 8192 dla Intern-Decision-4B, co stanowi szesnastokrotność i nie ma na to obejścia.
• Struktura kosztów — FrogNano rozlicza według trajektorii, a trajektorie są długie. Intern-Decision-4B nie ma w ogóle tokenów wyjściowych do rozliczenia.
• Parametry — karta FrogNano podaje zakres „500M-5B” i wskazuje około 4,66B, z pobraniem 9,32 GB w BF16; dla Intern-Decision-4B podaje się 4,54B, z wieżą wizyjną 612 MB i projektorem 54 MB obok jego shardów językowych.
Liczba, która decyduje o tym dopasowaniu
Karta InternLM podaje dla Intern-Decision-4B średnie opóźnienie 44,16 ms i medianę 44,03 ms na pojedynczym RTX 4090 w lokalnej ścieżce Hugging Face, przy P95 wynoszącym 44,60 ms. Spójrz jeszcze raz na ten rozrzut: od mediany do ogona jest znacznie poniżej milisekundy, ponieważ przebieg w przód o stałym kształcie nie ma prawie nic, co mogłoby się zmieniać. To jest cały argument za tą architekturą.
Odpowiadająca temu wartość dla FrogNano nie jest podana w milisekundach. Jego ewaluacje zakładały budżet 150 kroków oraz górny limit 10 800 sekund dla agenta na zadanie. To nie są porównywalne jednostki i nigdy nie należy umieszczać ich w jednym zdaniu z twierdzeniem o opóźnieniu — ale mówią ci one, jaki jest charakter tego kompromisu. Jeden model odpowiada decyzją w czterdzieści cztery milisekundy, a drugi spędza minuty na wywołaniach narzędzi w pogoni za poprawką. Jeśli twoim problemem jest „skieruj to zgłoszenie do jednej z sześciu kolejek i powiedz mi, jak bardzo jesteś pewien”, ten pierwszy nie jest tańszą wersją drugiego, to inna maszyna.
Oba laboratoria mierzyły się starannie i oba zestawy pomiarów należy odczytywać jako intencje, a nie wyniki. InternLM podaje średnią z siedmiu zestawów wynoszącą 90,02, wynik Brier 0,347 i oczekiwany błąd kalibracji 0,065; dopasowanie przeprowadzono przy temperaturze 1,99241824 na 1728 wyznaczonych przypadkach kalibracyjnych. Microsoft podaje wzrost w ciągu pięciu iteracji z 39,4% do 61,5% na SWE-bench Verified, a aneks tego samego artykułu podaje ten sam postęp jako 48,2%, 53,4%, 58,3%, 58,6% i 61,6% — przypomnienie, że nawet w obrębie jednego laboratorium ten sam fakt mierzony na dwa sposoby daje dwie drabiny.

Sygnał tkwi w tym, przed czym każda karta postanawia cię ostrzec.
Obie karty są niezwykle szczere, a ta szczerość wskazuje w przeciwnych kierunkach — co jest najbardziej użyteczną rzeczą w tym porównaniu.
Sekcja znanych ograniczeń Microsoftu czyta się jak ostrzeżenie o wdrożeniu. Tylko angielski i Python. Wydajność jest wrażliwa na jakość harnessu i testów. Patche, które mogą być niepoprawne lub niezabezpieczone, mimo że przechodzą swoje testy. Samo zdanie z karty mówi, że FrogNano „nie należy uznawać za niezależnie dostosowany pod kątem bezpieczeństwa do nieograniczonego autonomicznego wdrażania”, i wskazuje konkretną lukę: post-training specyficzny dla agenta nie korzystał z danych dotyczących preferencji bezpieczeństwa, preferencji ani danych adwersarialnych, ponieważ zamiast tego optymalizowano go pod kątem poprawności funkcjonalnej i unikania regresji. Ujawnia też wskaźnik równoległych wywołań narzędzi wynoszący 1,71%, co oznacza, że model prawie nigdy nie wywołuje dwóch narzędzi w jednej turze, mimo że harness na to pozwala — prawdziwa regresja możliwości względem modelu bazowego, którą zespół próbował odwrócić, dodając etap konsolidacji.
Karta InternLM ostrzega przed przeciwną klasą zjawisk. Nie ma powierzchni halucynacji, przed którą trzeba ostrzegać, więc zastrzeżenia dotyczą danych wejściowych: odrzucania przy 8,192, pułapu 62 opcji oraz faktu, że bazowa wieża tekstowa deklaruje limit pozycji 262 144 tokenów, z którego udostępniony wrapper odmawia skorzystać. Jego ryzyko polega na tym, że liczbie podanej z dużą pewnością ufa się bardziej, niż na to zasługuje, a karta otwarcie przyznaje, że kalibracja zawęża lukę względem baseline’u Jev, nie zamykając jej jednak na każdym wycinku.
Czytane razem opisują dwie różne postawy wobec zaufania. FrogNano wymaga nadzoru, bo działa. Intern-Decision-4B wymaga audytu, bo ocenia — a liczba, która przesądza o decyzji produkcyjnej, jest dokładnie tym rodzajem wyniku, którego nikomu nie przyjdzie do głowy testować.
Gdzie pasuje router, i szczera uwaga na temat obu
Żaden z tych modeli nie jest hostowanym endpointem. FrogNano jest dostarczany jako wagi plus harness ewaluacyjny na Kubernetesie; Intern-Decision-4B jest dostarczany jako klasa Pythona, którą importujesz po pobraniu czterech shardów. Dla zespołu, który chce wypróbować którykolwiek z nich w realnym otoczeniu, bezpieczny wzorzec jest taki sam dla obu i nie jest efektowny: postaw komponent eksperymentalny za fallbackiem, tak aby zła trajektoria lub źle skalibrowany dzień kosztowały ponowną próbę, a nie incydent.
Ten wzorzec to właśnie zadanie dla warstwy routingu. OrcaRouter uruchamia ponad 200 modeli za jednym kluczem zgodnym z OpenAI bez marży — cena katalogowa dostawcy przekazywana dalej, więc zmiana ceny u dostawcy trafia na naszą stronę tego samego dnia — a jego przełączanie awaryjne stoi przed ogólnym modelem, do którego sięgasz w razie potrzeby, a nie przed tymi dwoma. Mówiąc wprost: nie mamy w ofercie FrogNano-4B-2609 ani Intern-Decision-4B i nie ma daty dla żadnego z nich. Jeden endpoint daje ci tu to, że samo porównanie staje się tanie — jedno poświadczenie, jedna linia rozliczeniowa i brak drugiej integracji za każdym razem, gdy zmieniasz ogólny model, względem którego testujesz specjalistę.

Który i kiedy
Sięgnij po Intern-Decision-4B, gdy odpowiedź już znajduje się w Twoim promptcie i chcesz, aby została wybrana wraz z dołączonym poziomem pewności, w tempie tysięcy na sekundę. Routing ze stałą taksonomią, ocenianie według rubryk, ekstrakcja ograniczona schematem, moderacja względem zamkniętego zestawu etykiet. 44-milisekundowe przejście w przód i zerowy rachunek za tokeny wyjściowe to produkt, a kalibracja jest tym, co należy poddać audytowi, zanim jej zaufasz.
Weź FrogNano-4B-2609, gdy odpowiedź jeszcze nie istnieje i trzeba ją odkryć, czytając repozytorium i uruchamiając jego testy. To proces trwający wiele minut, uruchamiany w piaskownicy i poddawany przeglądowi, a 61,5% w SWE-bench Verified — zgłoszone przez dostawcę, nieodtworzone — to obecnie najlepszy dowód, że checkpoint 4B w ogóle jest w stanie to zrobić.
To, czego nie należy w żadnym razie akceptować, to nawyk porównywania ich wyników. Średnia 90,02 z siedmiu zestawów i wskaźnik 61,5 w SWE-bench Verified to pomiary dwóch różnych pytań, uzyskane przez dwa laboratoria, na dwóch różnych środowiskach testowych, a żadna z tych liczb nie przeszła przez ręce strony trzeciej. Mają wspólnego przodka i nic poza tym.

Jedyna naprawdę użyteczna prognoza płynąca ze wspólnego przodka: ponieważ oba modele startują z tego samego checkpointu 4B, różnica między nimi tkwi niemal w całości w post-trainingu, co oznacza, że interesującym pytaniem dla każdego, kto buduje na Qwen3.5-4B, jest to, która z tych dwóch struktur nagród przenosi się do jego własnej domeny. Pętla zadań syntetycznych, która kalibruje się względem własnej polityki, albo głowica oceniająca o stałym kształcie z dopasowaną temperaturą. To dwie receptury, obie opublikowane, obie z laboratoriów, które jeszcze nie pozwoliły nikomu innemu ich uruchomić. To rzadka sytuacja i warto ją obserwować, a nie przyjmować bezkrytycznie.
