Wygenerowana karta tytułowa z napisem „Intern-Decision-2B vs Laya”, z podtytułem „2,21 mld przeciw 421 mln, żaden nie pisze ani jednego tokena”, z plakietkami „jeden dostarcza pakiet pip” i „jeden dostarcza zestaw do reprodukcji”, z logo OrcaRouter wkomponowanym w rogu.
Guides & Insights

Intern-Decision-2B kontra Laya: 2,2 miliarda parametrów przeciwko 421 milionom, oba odmawiają napisania odpowiedzi

Autor

Alistair Wren

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

internlm/Intern-Decision-2B i convaiinnovations/laya to dwa najbardziej podobne modele w niszy małych modeli decyzyjnych, a najpożyteczniejszym faktem w tym porównaniu jest to, że osiągają ten cel przeciwnymi drogami. Checkpoint InternLM z 2 213 241 664 parametrami odczytuje logit na stałej pozycji przed symbolem zastępczym i nigdy nie wywołuje generate(). Checkpoint Convai z 421 milionami parametrów podaje wpisane pytania do głowy decyzyjnej na szczycie szkieletu ModernBERT-large i zwraca skalibrowane prawdopodobieństwa w pojedynczym przejściu w przód. Żaden z nich nie zapisuje tokenu, oba obiecują prawdopodobieństwa, oba mają limit około ośmiu tysięcy tokenów wejściowych, a mniejszy z nich jest pięć razy mniejszy i około tysiąca razy bardziej popularny. Tym, co je dzieli, nie jest tak bardzo zdolność, co opakowanie, a różnica w opakowaniu decyduje o zakupie dla większości czytelników.

Intern-Decision-2B pojawił się na Hugging Face o 05:36 UTC 26 września 2026 r. jako środkowy z trzech rozmiarów, które InternLM przesłał w ciągu czterdziestu sekund bez żadnej zapowiedzi, dostrojony na podstawie Qwen/Qwen3.5-2B na licencji Apache-2.0. Laya została po raz pierwszy opublikowana 18 września 2026 r. i od tego czasu zgromadziła około 3700 polubień, pakiet pip, serwer HTTP zgodny z Jev, integracje z ONNX i LangChain oraz notebook do dostrajania. Kontrast w poziomie dojrzałości jest tematem artykułu.

Założenie, które dzielą, i mechanizmy, które się różnią

Obie karty twierdzą, że jeśli twoim problemem jest wybór spośród znanych odpowiedzi, generowanie prozy to niewłaściwa operacja. Sformułowanie Laya brzmi: „nigdy nie generuje tekstu, więc nie ma nic do parsowania ani nic do halucynowania”. Sformułowanie Intern-Decision-2B jest takie, że jego API „wykonuje ustrukturyzowane ocenianie kandydatów. Nie wywołuje generate() ani nie próbkuje tekstu swobodnego”.

Mechanizmy są miejscem, w którym się rozchodzą.

Laya to klasyfikator. Enkoder ModernBERT-large (395M, dwukierunkowy, w pełni dostrojony) zasila głowicę decyzyjną trenowaną od zera — dwie warstwy transformera, scorer znaczników opcji i głowicę act/escalate — co daje w sumie 421M. Opcje dzielą stały budżet tokenów (head_max_len, 192 tokeny na angielskim checkpointcie, 256 na wielojęzycznym), a router wykrywa pismo i język w mniej niż pół milisekundy przed przebiegiem.

Intern-Decision-2B to model przewidywania następnego tokenu, któremu zabroniono stania się generatorem. Mapuje opcje każdego pytania na symbole będące pojedynczymi tokenami A–Z, a–z, 0–9; renderuje pełny szkielet JSON asystenta z jednym znacznikiem zastępczym <decision> na pole; wykonuje jeden przyczynowy przebieg w przód; odczytuje logity bezpośrednio przed każdym znacznikiem zastępczym; wykonuje softmax na dozwolonych symbolach tego pola; i stosuje dopasowaną temperaturę 2,100509348278. Pod spodem znajduje się standardowy Qwen3_5ForConditionalGeneration — 24 warstwy, trzy warstwy uwagi liniowej na jedną warstwę pełnej uwagi, zachowana warstwa przewidywania wielu tokenów, limit pozycji osadzania wynoszący 262 144 — plus wieża wizyjna i projektor.

Praktyczną konsekwencją tej różnicy jest liczba obsługiwanych opcji. Stały budżet Layi na opcję załamuje się przy szerokich przestrzeniach etykiet; jej własna karta dokumentuje pytanie z 77 etykietami uzyskujące 0,425 wobec 0,870 TypeSafe Jev w tym samym zadaniu, ponieważ każda z 77 opcji otrzymuje około trzech lub czterech tokenów. Intern-Decision-2B obsługuje do 62 opcji na pytanie i do szesnastu pytań, a 62 nie jest preferencją, lecz dokładną liczbą symboli jednokenowych, które może zaadresować jego kontrakt. Żaden z nich nie jest komfortowy powyżej kilkudziesięciu opcji; ich kształty awarii się różnią.

A screenshot of the Hugging Face model card for internlm/Intern-Decision-2B, showing the internlm organisation, the image-text-to-text, Transformers, Safetensors, qwen3_5, decision-making and multimodal tags, the Demo, Model Weights and GitHub links, and the opening description of Intern-Decision-2B as a multimodal structured decision model fine-tuned from Qwen3.5-2B that accepts a shared state, a schema of named questions and optional images.

Tablica wyników

A two-column comparison scoreboard titled 'Intern-Decision-2B vs Laya'. The left column reads: Parameters 2,213,241,664 plus vision tower; Input ceiling 8,192 tokens, refused above; Images up to eight; Speed 33.28 ms mean on one RTX 4090; Languages no multilingual claim made; Packaging a checkpoint and an inference script. The right column reads: Parameters 421M, one 842 MB safetensors file; Input ceiling 8,192 with max_len set, 1,024 default; Images none; Speed 103-332 questions/sec batched on one T4; Languages 100+ routed, 45 of 51 usable; Packaging pip install, HTTP server, ONNX, LangChain. A footer notes the Intern-Decision-2B figures are vendor-reported and unreproduced and the Laya figures are Convai's own card, including its zero-shot typed-decisions result below the majority-class line.

• Parametry — Intern-Decision-2B 2 213 241 664 w BF16 plus wieża wizyjna i projektor, około 4,46 GB na dysku; Laya 421M, pojedynczy plik safetensors o rozmiarze 842 MB, z osobnym wielojęzycznym checkpointem o rozmiarze 644 MB.

• Górny limit wejściowy — 8 192 tokeny dla obu, oba odmawiają zamiast obcinać; należy zauważyć, że 8 192 w Laya dotyczy laya-multilingual i wymaga max_len=8192, ponieważ domyślna wartość dostarczana to 1 024.

• Obrazy — do ośmiu dla Intern-Decision-2B, liczone w ramach tego samego budżetu tokenów; brak ścieżki multimodalnej dla Laya.

• Szybkość — 33,28 ms średnio, 33,15 ms P50, 33,55 ms P95 na żądanie na jednym RTX 4090 dla Intern-Decision-2B; Laya podaje około 33 ms na żądanie oraz 103–332 pytania na sekundę przetwarzane wsadowo na pojedynczej karcie T4.

• Języki — Intern-Decision-2B nie deklaruje w ogóle wielojęzyczności; Laya prowadzi routing w ponad 100 językach, raportując, że 45 z 51 testowanych języków jest użytecznych przy ponad trzykrotnie lepszym wyniku od losowego, oraz 0,451 w MASSIVE intent w trzynastu językach innych niż angielski w porównaniu z 0,306 dla jej checkpointu tylko angielskiego.

• Dokładność zero-shot — Intern-Decision-2B osiąga 84,68 uśrednione po siedmiu zestawach dostawców, z Brier 0,437 i ECE 0,100, wszystkie nieodtworzone; bazowy angielski checkpoint Layi uzyskuje 0,362 w benchmarku typed-decisions obejmującym 2000 decyzji, który jego własna karta oznacza jako poniżej linii 0,461 dla klasy większościowej.

• Pakowanie — checkpoint, plik inference.py i nowo upublicznione repozytorium GitHub z kodem do trenowania i ewaluacji, w porównaniu z pip install laya, serwerem HTTP kompatybilnym z Jev, szybkimi ścieżkami ONNX Runtime i TileLang, integracjami MCP i LangChain oraz notatnikiem do fine-tuningu, który działa na GPU w darmowym planie.

Najuczciwsze porównanie to nie to, które narzuca karta specyfikacji

Zestawienie 84,68 z 0,362 jest bliskie nieuczciwości i warto powiedzieć, dlaczego, zamiast pozostawiać te liczby bez wyjaśnienia.

0.362 Layi to bazowy checkpoint mierzony zero-shot na benchmarku, do którego nie był dostrajany. Jej własna karta wyciąga wniosek wprost: „Laya to szybka baza do specjalizacji, a nie silnik decyzyjny zero-shot”. Po dostrojeniu na własnym zbiorze treningowym tego benchmarku osiąga 0.766, przekraczając pułap nauczyciela wynoszący 0.735 i bijąc opublikowany wynik TypeSafe Jev 0.727 na tych samych decyzjach. Tymczasem 84.68 Intern-Decision-2B to średnia dostawcy z siedmiu zestawów, której zbiory testowe nie są tymi, które podaje Laya, uzyskana przez laboratorium, które zbudowało model, i której nie uruchomiła żadna strona trzecia — checkpoint ma jedno polubienie i zero pobrań. Porównywanie wyniku po dostrojeniu z wynikiem zero-shot albo średniej dostawcy z niezależnym rankingiem nie jest porównaniem. To dwa różne pomiary dzielące ten sam krój pisma.

Co jest naprawdę porównywalne: oba są małe, oba są tanie w uruchomieniu i oba nie dają się dostroić do twojej domeny. Repozytorium, które InternLM opublikowało dziś rano, sprawia, że ta ostatnia część jest znacząco łatwiejsza niż wczoraj, ponieważ zawiera launcher treningowy, funkcję celu masked-next-token, zweryfikowany haszem pakiet 10 751 wierszy testowych w siedmiu zestawach oraz skrypty dopasowywania temperatury i odtwarzania. Laboratorium, które dostarcza deterministyczny generator kalibracji i twierdzi, że odtwarzanie nie zmienia żadnych decyzji, zaprasza dokładnie do takiego rodzaju adaptacji, jaki zaleca karta Laya.

Jak właściwie nazwałbyś jedno lub drugie?

Żaden z tych modeli nie znajduje się na OrcaRouter. Strona modelu Intern-Decision-2B w OrcaRouter zwraca 404 i nie ma też trasy Laya; nic tutaj nie stanowi twierdzenia o dostępności. Intern-Decision-2B oznacza pobranie checkpointu i uruchomienie jego dołączonego silnika na własnym GPU. Laya oznacza pip install laya, a jeśli chcesz interfejs zgodny z Jev, laya-serve na POST /v1/systemone.

Pytanie w kształcie Orchestratora, które się pod tym kryje, brzmi: czy chcesz drugą powierzchnię operacyjną dla scorera. Laya jest zaprojektowana tak, by można ją było osadzać — ten sam kształt żądania i odpowiedzi co TypeSafe Jev, więc istniejący klient zmienia bazowy URL i nic więcej. Intern-Decision-2B jest zaprojektowany do odtwarzania, a dziś to mniej więcej dzień pracy nad środowiskiem, zanim wróci pierwsza decyzja. Jeśli podejmowana przez ciebie decyzja ze zbioru zamkniętego ma kształt zbliżony do którejkolwiek z tych dwóch, hostowaną alternatywą, względem której benchmarkowane są obie karty, jest TypeSafe Jev 1.13, który rzeczywiście ma trasę: 0,042 USD za milion tokenów wejściowych, kontekst 65K i P50 czasu do pierwszego tokenu wynoszący 178 ms, dostępny na tym samym kluczu co ponad 200 innych modeli, z ceną katalogową dostawcy przekazywaną przy 0% marży.

A screenshot of the OrcaRouter model page for typesafe/jev-1.13, dated 2026-09-24, showing the TypeSafe breadcrumb, the model name Jev 1.13, text input, and the description that Jev is a structured decision and evaluation model taking a state and named questions (noul / choice / score) and returning a structured answer for each, served non-streaming via POST /v1/systemone with up to about 64K input tokens.

W czym każdy wygrywa

Laya wygrywa we wszystkim, co operacyjne. Pakiet pip kontra pobieranie checkpointu. Router obsługujący ponad sto języków kontra brak jakiejkolwiek deklaracji wielojęzyczności. Przepustowość wsadowa mierzona w setkach pytań na sekundę kontra wynik na pojedyncze żądanie bez żadnej obsługi batchowania. Dwa lata ekosystemowego zaplecza — ONNX, TileLang, LangChain, MCP — kontra repozytorium publiczne od dwóch godzin.

Intern-Decision-2B wygrywa w trzech wąskich kwestiach. Przyjmuje obrazy, czego Laya nie potrafi. Nie ciąży na nim dług związany z dostrajaniem: jego 84,68 to deklaracja dostawcy dla trybu zero-shot, podczas gdy flagowe 0,766 Layi należy do checkpointu dostrojonego na własnym zbiorze treningowym tego benchmarku. A do tego ma dokumentację wraz z zestawem do reprodukcji — weryfikowalny pakiet ewaluacyjny i publiczny stos treningowy — co dla każdego, kto musi uzasadnić ten model komuś innemu, jest warte więcej niż wiersz w tabeli liderów.

Remis jest założeniem. Oba odmawiają generowania, oba dają ci prawdopodobieństwa, dla których możesz ustawić próg, i oba są poniżej długości wejściowej, przy której żyje większość rzeczywistych dokumentów. Jeśli twoim stanem jest zgłoszenie, e-mail lub formularz, oba się nadadzą, a Laya doprowadzi cię tam szybciej. Jeśli do twojego stanu dołączono zrzut ekranu albo twoja organizacja potrzebuje, by reprodukcja była audytowalna, środkowy checkpoint InternLM jest tym, który odpowiada na ten konkretny zarzut — a według własnych liczb InternLM jest najgorzej skalibrowany z trzech modeli z tej samej rodziny, przy ECE 0,100 wobec 0,066 i 0,065, więc dopasuj własną temperaturę, zanim zaufasz pewności, którą podaje.