Wygenerowana karta tytułowa z napisem „Intern-Decision-2B vs MiniCPM5-2B”, z podtytułem „Dwa budżety 2B, dwadzieścia dni od siebie”, z plakietkami „oceniający decyzje” i „gęsty generalista”, z logo OrcaRouter wkomponowanym w róg.
Guides & Insights

Intern-Decision-2B vs MiniCPM5-2B: Dwa checkpointy 2B, dwadzieścia dni od siebie, przeciwne sposoby wykorzystania parametrów

Autor

Alistair Wren

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

internlm/Intern-Decision-2B i openbmb/MiniCPM5-2B są tej samej wielkości, wydane w odstępie dwudziestu dni, licencjonowane w ten sam sposób i stworzone do zadań, które nie mają ze sobą nic wspólnego. Checkpoint InternLM to 2,213,241,664 parametrów scorera decyzyjnego: przyjmuje stan i typowane pytania, wykonuje jeden przebieg w przód i zwraca skalibrowane prawdopodobieństwa, nie generując ani jednego tokenu, odrzucając każde wejście dłuższe niż 8,192 tokenów. Model OpenBMB to 2,516,756,480 parametrów gęstego generalisty: 42-warstwowa Llama oparta na przepisie MiniCPM5, przyjmująca 131,072 tokeny kontekstu, pisząca kod, wywołująca narzędzia i uprawiająca matematykę, ze wskaźnikiem Artificial Analysis Intelligence Index wynoszącym 12,5 i 726,518 pobrań w zeszłym miesiącu. Ich pobranie kosztuje tyle samo, a kupują zupełnie różne rzeczy.

Najciekawsze w tym zestawieniu nie jest to, jaka dzieli je luka w benchmarkach — właściwie nie ma nakładającego się benchmarku, który można by porównać. Chodzi o to, na co można przeznaczyć budżet 2,2 miliarda i 2,5 miliarda parametrów, oraz o to, co ten wybór mówi o tym, który z nich jest ukończony. MiniCPM5-2B to drugi model w swojej serii, następujący po MiniCPM5-1B z maja, i pojawił się z pełnym zapleczem wydawniczym. Intern-Decision-2B to środkowy z trzech rozmiarów, które InternLM wypchnął na Hugging Face o 05:36 UTC 26 września 2026 bez zapowiedzi, a jego zaplecze wydawnicze — baza kodu treningowego, zweryfikowany hashem pakiet ewaluacyjny, benchmark kalibracyjny obejmujący 96 przypadków — stało się publiczne dopiero dziś rano o 08:58 UTC.

Dokąd poszły dwa budżety

Oba modele to dostrojone wersje architektury stworzonej przez kogoś innego i oba mają około 2,5 miliarda parametrów. I tu podobieństwa się kończą.

A screenshot of the Hugging Face model card for openbmb/MiniCPM5-2B, showing the OpenBMB organisation, the tags Text Generation, Transformers, Safetensors, English, Chinese, llama, minicpm5, long-context, tool-calling, on-device and edge-ai, an Apache 2.0 licence, the MiniCPM Tech Report, MiniCPM Wiki, GitHub Repo, UltraData and Online Demo links, and the model title.

MiniCPM5-2B to gęsty Transformer z 42 warstwami, wymiarem ukrytym 2048, 16 głowami uwagi, rozmiarem pośrednim 6144, słownikiem 130 560 tokenów i kontekstem 131 072 tokenów, wytrenowany na mieszance otwartych korpusów, które OpenBMB opublikowało wraz z nim: UltraX do wstępnego treningu na danych webowych, UltraData-Code z warstwowym zarządzaniem kodem L0–L3, UltraData-Math oraz 500 000 próbek SFT dla agentów z ponad 80 000 próbek RL w UltraData-RL-2609. Jego etap post-trainingu obejmuje SFT, następnie wyspecjalizowanych nauczycieli RL w matematyce, kodzie i zadaniach agentowych, a potem destylację on-policy z powrotem do jednego modelu. To model ogólnego przeznaczenia, którego cały budżet parametrów jest udostępniony jako zdolności, które można wywoływać promptami.

Intern-Decision-2B to Qwen3_5ForConditionalGeneration z 24 warstwami — powtarzający się wzorzec trzech warstw uwagi liniowej na jedną warstwę pełnej uwagi — rozmiar ukryty 2 048, 8 głów zapytań przeciwko 2 głowom klucz-wartość, wymiar głowy 256, zachowana warstwa przewidywania wielu tokenów i pułap osadzania 262 144 pozycji. Jest dostarczany z wieżą wizyjną o rozmiarze 612,5 MB i projektorem o rozmiarze 50,3 MB. Prawie żadna część tego budżetu nie jest dostępna dla ciebie jako podpowiedź: model odpowiada na stały schemat pytań, a jego architektura jest mechanizmem dostarczania softmaxu, a nie generatorem tekstu.

Jeden szczegół z nowo opublikowanego repozytorium InternLM zasługuje na wyodrębnienie, ponieważ stawia w nowym świetle znacznik multimodalny na karcie modelu. Dostrajanie decyzyjne „dostraja szkielet językowy Qwen3.5, jednocześnie zamrażając wieżę wizyjną i projektor”. Zarówno checkpointy decyzyjne 2B, jak i 4B zawierają shard wizyjny o dokładnie 612 517 440 bajtów — w obu przypadkach ten sam rozmiar — co jest spójne z tym, że te komponenty odziedziczono z bazy Qwen, a nie wytrenowano. Ścieżka obrazowa jest prawdziwa i można z niej korzystać, ale nie jest tym, na czym skupiło się dostrajanie decyzyjne InternLM. Jeśli twoje obciążenie to wyłącznie tekstowe ocenianie decyzyjne, około 660 MB z tego 4,46 GB pobrania nic dla ciebie nie robi.

Tablica wyników

A two-column comparison scoreboard titled 'Intern-Decision-2B vs MiniCPM5-2B'. The left column reads: Parameters 2,213,241,664 plus vision tower; Context 8,192 tokens, refused above; Output calibrated probabilities, no text; Modality text plus up to 8 images; Published evidence vendor table, unreproduced; Adoption one like, zero downloads. The right column reads: Parameters 2,516,756,480 dense; Context 131,072 tokens; Output generated text, token by token; Modality text only; Published evidence OpenBMB card, AA Index 12.5; Adoption 726,518 downloads last month. A footer notes the Intern-Decision-2B figures are vendor-reported and unreproduced while the MiniCPM5-2B figures are OpenBMB's own card plus an independent Artificial Analysis index.

• Parametry — Intern-Decision-2B 2 213 241 664 w BF16 plus około 660 MB na wieżę wizyjną i projektor, około 4,46 GB repozytorium; MiniCPM5-2B 2 516 756 480 w BF16, jeden plik safetensors o rozmiarze 5,03 GB.

• Kontekst — 8192 tokeny dla Intern-Decision-2B, odrzucany bez obcinania powyżej tej wartości; 131 072 tokeny dla MiniCPM5-2B.

• Dane wyjściowe — skalibrowany rozkład plus argmax dla każdego pola, żadnego tekstu; generowany tekst, token po tokenie.

• Trening — dostrajanie decyzyjne szkieletu Qwen3.5-2B z zamrożoną wieżą wizyjną, dane treningowe nieujawnione; pełny przebieg wstępnego treningu, treningu pośredniego oraz SFT w zakresie głębokiego myślenia na 400 miliardów tokenów, po którym następują RL i destylacja on-policy, wraz z równolegle opublikowanymi korpusami.

• Opublikowane dowody — tabela dostawcy z siedmioma zestawami, ze średnią 84,68, Brier 0,437 i ECE 0,100, nieodtworzona przez żadną stronę trzecią, jedno polubienie i zero pobrań; karta OpenBMB ze średnią 53,9 w obrębie własnego zestawu porównawczego oraz niezależny Artificial Analysis Intelligence Index wynoszący 12,5, z 726 518 pobraniami w ostatnim miesiącu.

• Licencja — Apache-2.0 z zachowaniem warunków Qwen z upstreamu jako LICENSE-QWEN, a w repozytorium kodu nie podano w ogóle żadnej licencji; Apache-2.0 w całym zakresie, łącznie z kodem.

W czym każdy z nich jest tak naprawdę lepszy — i nie jest to nawet blisko

Porównanie jest asymetryczne do tego stopnia, że stanowi błąd kategorii, dlatego bardziej użyteczne jest nazwanie zadań.

MiniCPM5-2B wygrywa we wszystkim, co polega na generowaniu odpowiedzi, a nie na jej wybieraniu. Pisze kod; Intern-Decision-2B nie ma ścieżki kodu. Obsługuje kontekst 131 072 tokenów; Intern-Decision-2B zatrzymuje się na 8 192 i głośno zawodzi. Wywołuje narzędzia, z wynikiem BFCL v4 66,6 w tabeli OpenBMB, oraz zajmuje się matematyką, z MATH-500 na 94,6 i GPQA-Diamond na 70,2 — dane z karty producenta, przy czym wiersz GPQA zawiera przypis dostarczony przez samą kartę. Osiąga 70,8 na MMLU-Pro i 84,7 na MMLU-Redux. Działa w llama.cpp i MLX, jest dostarczany w wariantach GGUF, GPTQ i DSpark, i ma publiczny demo Space na Hubie, w przeciwieństwie do 401, na który wskazuje karta Intern-Decision.

Intern-Decision-2B wygrywa dokładnie dwie rzeczy i one są powodem jego istnienia. Po pierwsze, decyzja o zamkniętym zbiorze ze schematem, który sam napiszesz, zwraca prawdopodobieństwo, które można odczytać, w jednym przebiegu w przód, w około 33 milisekund, bez parsera i bez — kształtu, którego MiniCPM5-2B nie potrafi wytworzyć inaczej niż generując tekst i licząc, że liczba w nim będzie poprawna. Po drugie, jest to reprodukowalny artefakt: repozytorium zawiera teraz cel treningowy, siedem zestawów dokładności z hashami SHA-256 i liczbami wierszy dla każdego zestawu, kod oceniający, skrypty dopasowywania temperatury i odtwarzania oraz benchmark kalibracji rozkładu dla 96 przypadków z własnym generatorem i scorerem działającym offline. Przewodnik ewaluacji InternLM zauważa, że udostępnione presety są związane z backendem XTuner, a wyniki HF należy raportować jako inne ustawienie wykonania — co jest dokładnie tym rodzajem zastrzeżenia, który zestaw do reprodukcji ma uczynić sprawdzalnym.

A screenshot of the GitHub repository page for InternLM/Intern-Decision, showing the organisation and repository breadcrumb, the description 'Fast multi-modal decision model', 5 stars and 0 forks, the file tree with assets, benchmarks, configs, docs, runtime, scripts, src and tests directories plus a release-manifest.json, and a commit list headed by 'Add demonstration videos and centered README links' roughly an hour old.

Kto powinien pobrać co

Jeśli masz zadanie, które polega na czytaniu czegoś długiego, pisaniu czegoś lub odpowiadaniu na pytanie, którego opcji nie wyliczyłeś wcześniej, MiniCPM5-2B jest modelem i nie ma decyzji do podjęcia. To ukończony generalista klasy 2B z prawdziwym ekosystemem, otwartymi danymi za nim i niezależną listą ocen, a jego wypróbowanie nic nie kosztuje — kompilacje GGUF i MLX są już na Hubie.

Jeśli masz zadanie, które jest naprawdę wyborem spośród znanych odpowiedzi — przekierowanie zgłoszenia, sklasyfikowanie e-maila do wsparcia, oznaczenie kandydata, ocena intencji na skali porządkowej — to model generatywny jest niewłaściwym narzędziem, a Intern-Decision-2B jest ciekawszy z tych dwóch, mimo że prawie nikt go nie uruchomił. Prawdopodobieństwo, które można progować, jest tańsze w obsłudze, łatwiejsze do audytu i nie da się go wyhalucynować, a fakt, że checkpoint pojawił się z zestawem do reprodukcji, a nie wpisem na leaderboardzie, czyni go lepiej udokumentowanym z tych dwóch na osi, która ma znaczenie, gdy musisz bronić tego wyboru.

Żaden z tych modeli nie znajduje się w OrcaRouter. Nasza strona modelu Intern-Decision-2B zwraca 404, a trasa MiniCPM5-2B nie istnieje; nic tutaj nie jest twierdzeniem o dostępności, a oba oznaczają uruchamianie własnego wnioskowania. Praktyczna alternatywa istnieje wśród hostowanych modeli decyzyjnych: Jev 1.13 firmy TypeSafe, model, względem którego InternLM porównywał całą swoją rodzinę, jest w katalogu za 0,042 USD za milion tokenów wejściowych, z kontekstem 65K i medianą czasu do pierwszego tokenu (P50) wynoszącą 178 ms. A jeśli tak naprawdę potrzebujesz modelu ogólnego przeznaczenia w tej samej klasie rozmiaru co MiniCPM5-2B, bez pracy operacyjnej, nasza najmniejsza hostowana trasa Qwen jest kilkukrotnie większa, ale stanowi jeden klucz spośród ponad 200 modeli, w cenie ceny katalogowej dostawcy przekazywanej bez marży i automatycznego przełączania awaryjnego za nim.

Ta jedna liczba, która o tym decyduje

To nie jest 84,68 przeciw 53,9. Te dwie średnie pochodzą z różnych zestawów testowych, mierzonych przez różne laboratoria, a w jednym przypadku przez laboratorium, którego wyniki nigdy nie zostały zweryfikowane. Liczbą, która rozstrzyga, jest 8 192. Jeśli twój stan mieści się w ośmiu tysiącach tokenów, a twoja odpowiedź jest już listą, Intern-Decision-2B to precyzyjne narzędzie z zestawem do reprodukcji i anomalią kalibracyjną, o której warto wiedzieć — jego oczekiwany błąd kalibracji wynoszący 0,100 jest najgorszy z trzech rozmiarów opublikowanych przez InternLM, wobec 0,066 dla modelu o połowę mniejszego, więc dopasuj własną temperaturę, zanim zaufasz wartości ufności. Jeśli twój stan się nie mieści, sprawa jest rozstrzygnięta, zanim zaczną się testy porównawcze, a odpowiedzią jest MiniCPM5-2B.

Porównane w tym artykule1

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie