Wygenerowana karta tytułowa o treści „Intern-Decision-4B vs Laya”, z podtytułem „dwa modele, które odpowiadają bez generowania tokenu”, z trzema etykietami o treści „4.54B vs 421M”, „oba w jednym przebiegu w przód” i „oba Apache-2.0”. Logo OrcaRouter jest wkomponowane w prawym dolnym rogu.
Engineering & Research

Intern-Decision-4B kontra Laya: Dwa modele, które odmawiają napisania odpowiedzi, dziesięciokrotnie różniące się rozmiarem

Autor

Alistair Wren

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

W karcie modelu Intern-Decision-4B znajduje się wiersz o treści „Laya — 57.77”. Każdy, kto czytał dokumentację samej Layi, rozpozna znaczenie tej liczby: convaiinnovations/laya to 421-milionowy nienarautoregresyjny model decyzyjny, a 57.77 to średnia, którą uzyskuje, gdy używa się go zero-shot na cudzym benchmarku. Jego własna karta mówi to samo bardziej dosadnie — bazowe checkpointy znajdują się poniżej poziomu odniesienia klasy większościowej w benchmarku typed-decisions, na poziomie 0.362 wobec 0.461. Tymczasem internlm/Intern-Decision-4B to model o 4.54 miliarda parametrów zbudowany dokładnie do tego samego zadania: przyjąć stan i zestaw typowanych pytań, wykonać jeden przebieg w przód, zwrócić skalibrowane prawdopodobieństwa, nigdy nie wygenerować żadnego tokenu. Ten sam zakład architektoniczny, ten sam kształt wyjścia, ta sama licencja Apache-2.0, dziesięć razy więcej parametrów — a jeden z nich to baza do dostrajania, podczas gdy drugi reklamuje się jako gotowy silnik zero-shot.

{{1}}Zgadzają się co do założenia, {{2}}co jest rzadkością{{/2}}{{/1}}

Obie karty argumentują to samo stanowisko i warto je przytoczyć, ponieważ większość branży twierdzi przeciwnie. Jeśli twoim problemem jest wybór spośród znanego zestawu odpowiedzi, generowanie prozy to niewłaściwa operacja: płacisz za tokeny, które wyrzucasz, potrzebujesz parsera, a zamiast prawdopodobieństwa, które możesz porównać z progiem, dostajesz wyjaśnienie, o które nie prosiłeś. Karta Layi ujmuje to tak: „nigdy nie generuje tekstu, więc nie ma czego parsować i nie ma czego halucynować”. Karta Intern-Decision-4B mówi, że jej API „wykonuje ustrukturyzowane ocenianie kandydatów. Nie wywołuje generate() ani nie próbkuje tekstu swobodnego.”

Mechanizmy różnią się w pouczający sposób. Laya podaje pytania z typem do głowicy klasyfikującej i zwraca odpowiedzi z typem oraz skalibrowanymi prawdopodobieństwami w pojedynczym przejściu w przód, z warstwą routingu, która wykrywa pismo i język w czasie poniżej pół milisekundy przed tym przejściem. Intern-Decision-4B mapuje opcje każdego pytania na symbole pojedynczych tokenów, renderuje szkielet JSON asystenta z jednym symbolem zastępczym na pole, odczytuje logity bezpośrednio przed każdym symbolem zastępczym i wykonuje softmax wyłącznie po dozwolonych symbolach danego pola. Podejście Layi to problem klasyfikacji; podejście InternLM to problem przewidywania następnego tokenu, któremu nie pozwala stać się problemem generowania.

A screenshot of the convaiinnovations/laya model card on Hugging Face, showing the title 'Laya', the description of it as a multilingual non-autoregressive System 1 decision model returning typed answers with calibrated probabilities in a single forward pass across 100+ languages, the pip install laya line, and the long-documents note about laya-multilingual reading up to 8,192 tokens with max_len=8192.

Różnica rozmiarów i co z tego wynika

Poproszenie dwóch modeli o wykonanie tego samego zadania przy 421 mln i 4,54 mld parametrów daje wynik, którego można się spodziewać, a potem niespodziankę.

Przewidywana część to zdolność do radzenia sobie z trudnymi pytaniami. Intern-Decision-4B osiąga średnio 90,02 w siedmiu zestawach ewaluacyjnych, z wynikiem Brier'a 0,347 i oczekiwanym błędem kalibracji 0,065 w pomiarze własnym InternLM, a jego średni czas na zapytanie wynosi 44,16 ms na pojedynczym RTX 4090. Bazowy checkpoint Laya dla języka angielskiego osiąga dokładność 0,362 w benchmarku typed-decisions obejmującym 2000 decyzji, co karta Laya oznacza jako wynik poniżej progu klasy większościowej wynoszącego 0,461 i zaledwie powyżej losowego poziomu odniesienia wynoszącego 0,318. Gdy ten sam checkpoint zostanie dostrojony na własnym podziale treningowym tego benchmarku, wynik skacze do 0,766. Karta Laya sama wyciąga wniosek: „Laya to szybka baza do specjalizacji, a nie silnik decyzyjny zero-shot”.

Niespodzianka polega na tym, że mniejszy model wygrywa bezapelacyjnie w dwóch wymiarach. Szybkość: Laya odpowiada na 103 do 332 pytań na sekundę w trybie wsadowym na pojedynczym T4, a jej karta określa ją jako około sześć do ośmiu razy szybszą niż TypeSafe Jev na podstawie niezależnie zmierzonego wskaźnika p50 wynoszącego 236–276 ms, który cytuje. Dziesięć razy więcej parametrów nie daje dziesięć razy większej przepustowości w drugą stronę — 44,16 ms dla Intern-Decision-4B to czas na zapytanie na 4090, bez opublikowanych danych o przetwarzaniu wsadowym. A język: Laya podaje, że 45 z 51 testowanych języków jest użytecznych przy ponad trzykrotnie lepszym wyniku niż losowy, z wynikiem 0,451 w routingu na MASSIVE intent w trzynastu językach innych niż angielski, w porównaniu do 0,306 dla jej checkpointu tylko w języku angielskim. Intern-Decision-4B nie ma żadnych twierdzeń o wielojęzyczności.

Tablica wyników

• Parametry — 4,54 mld BF16 dla Intern-Decision-4B, wieża tekstowa plus wieża wizyjna plus projektor; 421 mln dla Laya, pojedynczy kompaktowy stos klasy enkodera.

• Limit wejściowy — 8,192 tokeny dla obu, i oba wolą odmówić, niż obciąć; zauważ, że 8,192 Laya dotyczy wielojęzycznego checkpointu, którego domyślna wartość to 1,024.

• Multiplicity — Intern-Decision-4B przyjmuje od 1 do 16 pytań, a w każdym z nich do 62 opcji, i 62 nie jest liczbą przypadkową: to dokładnie liczba symboli jedn tokenowych, które może zaadresować jego kontrakt wnioskowania. Laya również przyjmuje wiele pytań typowanych, ale jej karta dokumentuje gwałtowne załamanie po przekroczeniu około 50 opcji, gdzie pytanie z 77 etykietami otrzymuje tylko trzy lub cztery tokeny budżetu na etykietę, a dokładność spada do 0,425.

• Obrazy — do ośmiu dla Intern-Decision-4B, wliczane do budżetu 8 192 tokenów; brak ścieżki multimodalnej dla Laya.

• Kalibracja — Intern-Decision-4B jest dostarczany z dopasowaną temperaturą 1,99241824, wybraną przez minimalizację NLL na 1728 przypadkach, i raportuje ECE 0,065 we własnym zestawie; Laya jest domyślnie nadmiernie pewna siebie, a jej karta mówi, że ponowne dopasowanie jednej temperatury na typ pytania i liczbę opcji przesuwa średnie ECE z 0,466 do 0,081.

• Postawa zero-shot — gotowy checkpoint deklarujący średnią 90,02 wobec udokumentowanej bazy, która uzyskuje wynik poniżej linii klasy większościowej.

• Opóźnienie — średnia 44,16 ms, mediana 44,03 ms na jednym RTX 4090 w porównaniu z 103–332 pytaniami na sekundę przetwarzanymi wsadowo na jednym T4.

• Języki — brak opublikowanego twierdzenia przeciwko 45 z 51 językom, których można używać w routingu.

• Licencja — Apache-2.0 z zachowaniem licencji Qwen upstream, w przeciwieństwie do Apache-2.0 wyraźnie oznaczonej jako przeznaczona do użytku komercyjnego.

A two-column comparison scoreboard titled 'Intern-Decision-4B vs Laya'. The left column reads: Parameters: 4.54B BF16; Output: probabilities, no text; Options per question: up to 62; Latency: 44.16 ms mean on one RTX 4090; Zero-shot: 90.02 average reported; Images: up to eight; License: Apache-2.0. The right column reads: Parameters: 421M; Output: typed answers, no text; Options per question: degrades past ~50; Latency: 103-332 q/s batched on one T4; Zero-shot: below majority class, 0.362; Images: none; License: Apache-2.0, commercial use tagged. A footer reads 'Intern-Decision figures per InternLM's model card; Laya figures per the Laya model card, including its own negative results.' The OrcaRouter logo is composited in the bottom-right corner.

Dwie karty, dwie bardzo różne koncepcje ujawniania informacji

W tym miejscu porównanie przestaje być zestawieniem parametrów, a staje się kwestią oceny, ponieważ obaj dostawcy dokumentują swoje modele w przeciwstawnych stylach.

Karta Laya publikuje szczegółowo swoje własne błędy. Informuje, że angielski checkpoint osiąga dokładność 0,000 na khmerskim przy pewności 0,952 — pewny siebie, choć się myli, co czyni bramkowanie pewności bezużytecznym w tym przypadku. Informuje, że action.act_probability nie niesie użytecznego sygnału, przyjmując wartość 1,0 dla prawie każdego wejścia, z AUROC wynoszącym 0,30 na 396 oznaczonych decyzjach, i zaleca bramkowanie na pewności zamiast tego, która osiąga 0,77 na tych samych elementach. Nazywa pytania z punktacją porządkową „najsłabszym prymitywem”, powołując się na 0,372 na SST-5. Karta, która mówi, które z jej własnych wyników zignorować, robi coś, czego większość dostawców nie próbuje.

Karta modelu Intern-Decision-4B publikuje czystą tabelę i ani jednego przypadku niepowodzenia. Jej zastrzeżenia są prawdziwe i mają istotne znaczenie — sekcja kalibracji wyjątkowo wprost stwierdza, że kolumna „przed” w pilotażu tego modelu nie jest tym, co zobaczyłby jakikolwiek użytkownik, oraz że etykiety zestawu testowego nie zostały użyte do wyboru temperatury — ale sekcja ewaluacji to siedem zwycięstw i ani jednego przyznania się do porażki. Zawiera również wiersze dla pięciu konkurencyjnych systemów, które InternLM uruchomił we własnym środowisku testowym, w tym wiersz Laya, od którego zaczyna się ten artykuł. To nie są własne wyniki tamtych projektów, a odczytywanie ich w ten sposób byłoby błędem.

Tak więc linia źródłowa w tym starciu jest asymetryczna w sposób, który faworyzuje mniejszy model: dowody Layi obejmują wady, które sama udokumentowała, a dowody Intern-Decision-4B nigdy nie spotkały zestawu testowego, którego nie wybrali jego autorzy.

Do jakiego kształtu problemu pasuje każdy z nich

Mając krótki, ustrukturyzowany stan w języku angielskim, zamknięty zestaw odpowiedzi i potrzebę wiarygodnego prawdopodobieństwa, Intern-Decision-4B na papierze ma większe możliwości, a w praktyce jest droższy — cztery shardy safetensors, PyTorch 2.9.1 i Transformers 5.14.1 pod Pythonem 3.12, silnik rezydentny oraz wrapper, który piszesz samodzielnie, jeśli chcesz punkt końcowy HTTP. W przypadku decyzji routingowej lub guardrailowej o dużym wolumenie w dziesiątkach języków, gdzie przepustowość jest wiążącym ograniczeniem, Laya ma lepszą formę: pip install laya, model 421M i karta, która już powiedziała ci, by dostroić model, zanim zaufasz prawdopodobieństwom.

Jedyna rzecz, co do której obie karty się zgadzają, to że żadnemu z modeli nie należy ufać w trybie zero-shot bez sprawdzenia kalibracji na własnych danych — Laya, ponieważ jej bazowe checkpointy są bliskie losowości przy nieznanych typach decyzji, Intern-Decision-4B, ponieważ jego ECE wynoszące 0,065 pochodzi z zestawu, który złożyli jego własni autorzy.

Co router zmienia, a czego nie zmienia tutaj

Żaden z tych modeli nie znajduje się w katalogu OrcaRouter i warto powiedzieć to wprost, a nie sugerować coś przeciwnego: nasze strony modeli zwracają 404 zarówno dla Intern-Decision-4B, jak i Laya, a żaden z nich nie jest trasą, którą można dziś wywołać. Konsekwencje dla tych dwóch projektów nie są takie same. Licencja Apache-2.0 modelu Laya z adnotacją o użyciu komercyjnym oznacza, że przeszkodą jest wyłącznie pakowanie — to lokalny pakiet Pythona o niewielkim rozmiarze, czyli coś, co prawdopodobnie dałoby się udostępnić jako usługę. Przeszkodą w przypadku Intern-Decision-4B również jest pakowanie, ale jego wagi 4,54B BF16 i limit odmów wynoszący 8 192 tokeny czynią go komponentem, a nie usługą.

Tam, gdzie OrcaRouter rzeczywiście pomaga, jest po drugiej stronie decyzji. Jeśli Twój problem decyzyjny o strukturze okaże się jednak wymagać kroku rozumowania, modele ogólne, które potrafią to zrobić, są dostępne za pomocą jednego klucza do ponad 200 modeli, z ceną katalogową dostawcy przekazywaną dalej przy 0% marży i automatycznym przełączaniem awaryjnym między dostawcami — więc model, który łączysz ze scorerem, jest dostępny przez jeden endpoint, a nie przez drugą umowę.

Krótka wersja

Te dwa projekty doszły do tego samego wniosku co do tego, jak powinno się podejmować decyzje, a potem różniły się niemal pod każdym innym względem. Laya zakłada, że 421 mln parametrów, ciasny routing językowy i bezwzględna szczerość co do własnych wad dają szybką bazę, którą można specjalizować. Intern-Decision-4B zakłada, że dziesięciokrotnie większa liczba parametrów i starannie zaprojektowany kontrakt oceniania pojedynczego tokenu dają gotowy silnik zero-shot. Decydujący eksperyment to taki, którego żaden z nich nie przeprowadził publicznie: weź zestaw decyzji z obliczalnymi odpowiedziami, uruchom oba i sprawdź, czy prawdopodobieństwa cokolwiek znaczą. Laya opublikowała ten eksperyment połowicznie i pokazała, gdzie on zawodzi. Intern-Decision-4B nie opublikował go wcale.

A generated comparison card titled 'Same bet, ten times the parameters'. The left side, 'Intern-Decision-4B', lists: 4.54B BF16; a finished zero-shot checkpoint claiming a 90.02 average across seven sets; fitted temperature 1.99241824; 44.16 ms mean per query on one RTX 4090; Apache-2.0 with the upstream Qwen license preserved. The right side, 'Laya', lists: 421M; a documented base below the majority-class line at 0.362, rising to 0.766 once fine-tuned on the benchmark's own training split; refitting one temperature per question type moves mean ECE from 0.466 to 0.081; 103 to 332 questions per second batched on one T4; Apache-2.0 tagged for commercial use. A footer reads 'Intern-Decision figures per InternLM's model card; Laya figures per the Laya model card, including its own negative results.' The OrcaRouter logo is composited in the bottom-right corner.