Een gegenereerde titelkaart met de tekst 'Intern-Decision-4B vs Laya', met als ondertitel 'twee modellen die antwoorden zonder een token te genereren', met drie chips met de tekst '4.54B vs 421M', 'beide één forward pass' en 'beide Apache-2.0'. Het OrcaRouter-logo is in de rechteronderhoek samengevoegd.
Engineering & Research

Intern-Decision-4B vs Laya: twee modellen die weigeren een antwoord te schrijven, met een tienvoudig verschil in omvang

Auteur

Alistair Wren

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen →
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Er staat een rij in de modelkaart van Intern-Decision-4B met de tekst "Laya — 57.77". Iedereen die Laya's eigen documentatie heeft gelezen, zal de betekenis van dat getal herkennen: convaiinnovations/laya is een niet-autoregressief beslissingsmodel met 421 miljoen parameters, en 57,77 is het gemiddelde dat het behaalt wanneer het zero-shot wordt gebruikt op de benchmark van iemand anders. De eigen kaart zegt hetzelfde nog botter — de basis-checkpoints bevinden zich onder de baseline van de meerderheidsklasse op de typed-decisions-benchmark, op 0,362 tegen 0,461. Ondertussen is internlm/Intern-Decision-4B een model met 4,54 miljard parameters dat voor precies dezelfde taak is gebouwd: neem een toestand en een set getypte vragen, voer één forward pass uit, retourneer gekalibreerde waarschijnlijkheden, genereer nooit een token. Dezelfde architectonische gok, dezelfde uitvoervorm, dezelfde Apache-2.0-licentie, tien keer zoveel parameters — en de een is een basis om te fine-tunen, terwijl de ander claimt een afgewerkte zero-shot-engine te zijn.

Ze zijn het eens over de premisse, wat het zeldzame eraan is.

Beide kaarten bepleiten hetzelfde standpunt, en het is de moeite waard om dat te stellen, omdat het grootste deel van de branche het tegenovergestelde beweert. Als je probleem is om uit een bekende set antwoorden te kiezen, is proza genereren de verkeerde operatie: je betaalt voor tokens die je weggooit, je hebt een parser nodig, en je krijgt een uitleg die je niet hebt gevraagd in plaats van een waarschijnlijkheid waarop je een drempel kunt toepassen. Laya's kaart formuleert het als: 'het genereert nooit tekst, dus er is niets te parsen en niets te hallucineren.' De kaart van Intern-Decision-4B zegt dat zijn API 'gestructureerde kandidaatscoring uitvoert. Hij roept geen generate() aan, noch samplet hij vrije tekst.'

De mechanismen verschillen op een leerzame manier. Laya voedt getypeerde vragen aan een classificatiehoofd en retourneert getypeerde antwoorden met gekalibreerde waarschijnlijkheden in één forward pass, met een routeringslaag die schrift en taal detecteert in minder dan een halve milliseconde vóór de pass. Intern-Decision-4B mapt de opties van elke vraag op single-token-symbolen, rendert een assistant-JSON-skelet met één placeholder per veld, leest de logits onmiddellijk vóór elke placeholder, en softmaxt over alleen de toegestane symbolen van dat veld. Dat van Laya is een classificatieprobleem; dat van InternLM is een next-token-probleem dat het weigert een generatieprobleem te laten worden.

A screenshot of the convaiinnovations/laya model card on Hugging Face, showing the title 'Laya', the description of it as a multilingual non-autoregressive System 1 decision model returning typed answers with calibrated probabilities in a single forward pass across 100+ languages, the pip install laya line, and the long-documents note about laya-multilingual reading up to 8,192 tokens with max_len=8192.

Het grootteverschil, en wat het oplevert

Als je twee modellen vraagt dezelfde taak uit te voeren met 421M en 4,54B parameters, levert dat het resultaat op dat je zou verwachten, en dan een verrassing.

Het voorspelde deel is bekwaamheid bij moeilijke vragen. Intern-Decision-4B scoort gemiddeld 90,02 over zeven evaluatiesets met een Brier-score van 0,347 en een verwachte kalibratiefout van 0,065 in de eigen meting van InternLM, en het draait gemiddeld 44,16 ms per query op één RTX 4090. Laya's Engelse basis-checkpoint heeft een nauwkeurigheid van 0,362 op de typed-decisions-benchmark met 2.000 beslissingen, die volgens de eigen kaart onder de drempel van de meerderheidsklasse van 0,461 ligt en nauwelijks boven de willekeurige basislijn van 0,318. Wanneer hetzelfde checkpoint op de eigen trainingssplit van die benchmark wordt gefinetuned, springt het cijfer naar 0,766. Laya's kaart trekt zelf de conclusie: "Laya is een snelle basis om te specialiseren, geen zero-shot beslissingsengine."

De verrassing is dat het kleinere model op twee dimensies ronduit wint. Snelheid: Laya beantwoordt 103 tot 332 vragen per seconde, gebatcht op één enkele T4, en op zijn modelkaart staat dat het ongeveer zes tot acht keer sneller is dan TypeSafe Jev, op basis van de onafhankelijk gemeten p50-waarde van 236–276 ms die het aanhaalt. Tien keer zoveel parameters levert niet tien keer zoveel doorvoer op in de andere richting — de 44,16 ms van Intern-Decision-4B is per query op een 4090, zonder dat er iets over batchen is gepubliceerd. En taal: Laya rapporteert dat 45 van de 51 gebenchmarkte talen bruikbaar zijn met meer dan drie keer random, met een gerouteerde 0,451 op MASSIVE-intentie in dertien niet-Engelse talen, tegenover 0,306 voor zijn alleen-Engelstalige checkpoint. Intern-Decision-4B maakt helemaal geen aanspraak op meertaligheid.

Scorebord

• Parameters — 4,54B BF16 voor Intern-Decision-4B, teksttoren plus visietoren plus projector; 421M voor Laya, een enkele compacte stack van encoderklasse.

• Invoerplafond — 8.192 tokens voor beide, en beide weigeren liever dan af te kappen; let op dat Laya's 8.192 geldt voor de meertalige checkpoint, waarvan de standaard meegeleverde waarde 1.024 is.

• Multipliciteit — Intern-Decision-4B verwerkt 1 tot 16 vragen en maximaal 62 opties per vraag, en 62 is niet willekeurig: het is precies het aantal single-token-symbolen dat zijn inferentiecontract kan adresseren. Laya verwerkt ook meerdere getypeerde vragen, maar de kaart ervan documenteert een scherpe instorting boven ongeveer 50 opties, waarbij een vraag met 77 labels slechts drie of vier tokens budget per label krijgt en de nauwkeurigheid daalt tot 0,425.

• Afbeeldingen — maximaal acht voor Intern-Decision-4B, meegeteld in het budget van 8.192 tokens; geen multimodaal pad voor Laya.

• Kalibratie — Intern-Decision-4B wordt geleverd met een gefitte temperatuur van 1,99241824, geselecteerd via NLL-minimalisatie over 1.728 gevallen, en rapporteert een ECE van 0,065 op zijn eigen suite; Laya is standaard overmatig zelfverzekerd, en op zijn kaart staat dat het opnieuw fitten van één temperatuur per vraagtype en aantal opties de gemiddelde ECE van 0,466 naar 0,081 brengt.

• Zero-shot-houding — een afgerond checkpoint dat een gemiddelde van 90,02 claimt tegenover een gedocumenteerde basis die onder de grens van de meerderheidsklasse ligt.

• Latentie — 44,16 ms gemiddeld, 44,03 ms mediaan op één RTX 4090 tegenover 103 tot 332 vragen per seconde in batches op één T4.

• Talen — geen gepubliceerde claim tegen 45 van de 51 talen die bruikbaar zijn bij routering.

• Licentie — Apache-2.0, waarbij de upstream Qwen-licentie behouden blijft, tegenover Apache-2.0 dat expliciet is aangeduid voor commercieel gebruik.

A two-column comparison scoreboard titled 'Intern-Decision-4B vs Laya'. The left column reads: Parameters: 4.54B BF16; Output: probabilities, no text; Options per question: up to 62; Latency: 44.16 ms mean on one RTX 4090; Zero-shot: 90.02 average reported; Images: up to eight; License: Apache-2.0. The right column reads: Parameters: 421M; Output: typed answers, no text; Options per question: degrades past ~50; Latency: 103-332 q/s batched on one T4; Zero-shot: below majority class, 0.362; Images: none; License: Apache-2.0, commercial use tagged. A footer reads 'Intern-Decision figures per InternLM's model card; Laya figures per the Laya model card, including its own negative results.' The OrcaRouter logo is composited in the bottom-right corner.

Twee kaarten, twee heel verschillende opvattingen over openbaarmaking

Dit is waar de vergelijking ophoudt een specificatieblad te zijn en een inschattingskwestie wordt, want de twee leveranciers documenteren hun modellen op tegenovergestelde wijze.

Laya's kaart publiceert haar eigen fouten in detail. De kaart meldt dat het Engelse checkpoint 0,000 nauwkeurigheid scoort op Khmer bij 0,952 confidence — zelfverzekerd terwijl het fout is, waardoor confidence-gating daar nutteloos is. De kaart meldt dat action.act_probability geen bruikbaar signaal bevat en 1,0 aangeeft voor bijna elke input met een AUROC van 0,30 op 396 gelabelde beslissingen, en dat je wordt geadviseerd om te filteren op confidence in plaats daarvan, die 0,77 bereikt op dezelfde items. De kaart noemt ordinale scorevragen "de zwakste primitive", met verwijzing naar 0,372 op SST-5. Een kaart die je vertelt welke van haar eigen outputs je moet negeren, doet iets wat de meeste leveranciers niet proberen.

De kaart van Intern-Decision-4B publiceert een nette tabel en geen faalgevallen. De kanttekeningen zijn reëel en zwaarwegend — de kalibratiesectie is ongewoon expliciet over het feit dat de "before"-kolom in de pilot niet is wat welke gebruiker dan ook te zien zou krijgen, en dat de labels van de testsuite niet zijn gebruikt om de temperatuur te kiezen — maar de evaluatiesectie bestaat uit zeven overwinningen en geen enkele erkenning van tekortkomingen. Het bevat ook rijen voor vijf concurrerende systemen die InternLM op het testharnas van InternLM heeft gedraaid, waaronder de Laya-rij waarmee dit artikel opent. Dat zijn niet de eigen cijfers van die projecten, en het zou een vergissing zijn om ze als zodanig te lezen.

Dus de bronlijn voor deze confrontatie is asymmetrisch op een manier die het kleinere model bevoordeelt: het bewijs van Laya bevat gebreken die het zelf heeft gedocumenteerd, en het bewijs van Intern-Decision-4B is nooit een testset tegengekomen die zijn auteurs niet hebben gekozen.

Welke vorm van probleem past bij elk ervan

Gegeven een korte, gestructureerde toestand in het Engels, een gesloten set antwoorden en een behoefte aan een betrouwbare waarschijnlijkheid, is Intern-Decision-4B op papier het capabelere object en in de praktijk het duurdere — vier safetensors-shards, PyTorch 2.9.1 en Transformers 5.14.1 onder Python 3.12, een residente engine, en een wrapper die je zelf schrijft als je een HTTP-endpoint wilt. Gegeven een routerings- of guardrailbeslissing met hoog volume over tientallen talen, waar doorvoer de bindende beperking is, is Laya de betere vorm: pip install laya, een 421M-model, en een kaart die je al heeft verteld dat je moet fine-tunen voordat je de waarschijnlijkheden vertrouwt.

Het enige waar beide kaarten het over eens zijn, is dat geen van beide modellen zero-shot vertrouwd mag worden zonder de kalibratie op je eigen data te controleren — Laya omdat zijn basis-checkpoints bijna op kansniveau presteren bij onbekende beslissingstypen, Intern-Decision-4B omdat zijn 0,065 ECE afkomstig is uit een suite die de eigen auteurs hebben samengesteld.

Wat een router hier wel en niet verandert

Geen van deze modellen staat in de OrcaRouter-catalogus, en het is de moeite waard om dat ronduit te zeggen in plaats van iets anders te suggereren: onze modelpagina's geven een 404 voor zowel Intern-Decision-4B als Laya, en geen van beide is een route die je vandaag kunt aanroepen. Wat dat voor de twee projecten betekent, is hetzelfde. De Apache-2.0-licentie van Laya met een tag voor commercieel gebruik betekent dat het obstakel puur een kwestie van verpakking is — het is een lokaal Python-pakket met een kleine voetafdruk, wat het soort ding is dat aannemelijk geserveerd zou kunnen worden. Het obstakel van Intern-Decision-4B is ook een kwestie van verpakking, maar zijn BF16-gewichten van 4,54 miljard en weigeringsplafond van 8.192 tokens maken het een component in plaats van een service.

Waar OrcaRouter wél helpt, is aan de andere kant van de beslissing. Als je gestructureerde beslissingsprobleem toch een redeneerstap blijkt te vereisen, zijn de algemene modellen die dat kunnen beschikbaar via één sleutel voor meer dan 200 modellen, met de lijstprijs van de provider doorgegeven tegen 0% opslag en automatische failover tussen providers — dus het model dat je aan een scorer koppelt, is slechts één endpoint verwijderd, niet een tweede contract.

De korte versie

Deze twee projecten kwamen tot dezelfde conclusie over hoe beslissingen genomen zouden moeten worden en verschilden daarna over bijna al het andere. Laya wedt dat 421M parameters, strakke taalroutering en meedogenloze eerlijkheid over zijn eigen gebreken een snelle basis vormen die je specialiseert. Intern-Decision-4B wedt dat tien keer zoveel parameters en een zorgvuldig ontworpen single-token-scoringscontract een afgewerkte zero-shot-engine opleveren. Het beslissende experiment is er een dat geen van beide publiekelijk heeft uitgevoerd: neem een reeks beslissingen met berekenbare antwoorden, voer beide uit en controleer of de waarschijnlijkheden iets betekenen. Laya heeft dat experiment half gepubliceerd en je laten zien waar het faalt. Intern-Decision-4B heeft het helemaal niet gepubliceerd.

A generated comparison card titled 'Same bet, ten times the parameters'. The left side, 'Intern-Decision-4B', lists: 4.54B BF16; a finished zero-shot checkpoint claiming a 90.02 average across seven sets; fitted temperature 1.99241824; 44.16 ms mean per query on one RTX 4090; Apache-2.0 with the upstream Qwen license preserved. The right side, 'Laya', lists: 421M; a documented base below the majority-class line at 0.362, rising to 0.766 once fine-tuned on the benchmark's own training split; refitting one temperature per question type moves mean ECE from 0.466 to 0.081; 103 to 332 questions per second batched on one T4; Apache-2.0 tagged for commercial use. A footer reads 'Intern-Decision figures per InternLM's model card; Laya figures per the Laya model card, including its own negative results.' The OrcaRouter logo is composited in the bottom-right corner.