Een gegenereerde titelkaart met de tekst 'Intern-Decision-2B vs Laya', met als ondertitel '2,21B tegen 421M, geen van beide schrijft een token', met de badges 'de een levert een pip-package' en 'de ander levert een reproductiekit', met het OrcaRouter-logo in de hoek samengevoegd.
Guides & Insights

Intern-Decision-2B vs Laya: 2,2 miljard parameters tegenover 421 miljoen, beide weigeren een antwoord te schrijven

Auteur

Alistair Wren

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen →
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

internlm/Intern-Decision-2B en convaiinnovations/laya zijn de twee meest op elkaar lijkende modellen in de kleine niche van beslissingsmodellen, en het nuttigste feit over de vergelijking is dat ze daar via tegenovergestelde routes komen. De checkpoint van InternLM met 2.213.241.664 parameters leest de logit op een vaste positie vóór een placeholder en roept nooit generate() aan. De checkpoint van Convai met 421 miljoen parameters voert getypte vragen naar een decision head bovenop een ModernBERT-large backbone en retourneert gekalibreerde waarschijnlijkheden in één forward pass. Geen van beide schrijft een token, beide beloven waarschijnlijkheden, beide komen niet verder dan ongeveer achtduizend tokens aan invoer, en de kleinere is vijf keer kleiner en ongeveer duizend keer populairder. Wat hen scheidt is niet zozeer het vermogen als wel de verpakking, en het verschil in verpakking bepaalt de aankoop voor de meeste lezers.

Intern-Decision-2B verscheen op 18 september 2026 om 05:36 UTC op Hugging Face, de middelste van drie formaten die InternLM in veertig seconden zonder aankondiging uploadde, fine-tuned op basis van Qwen/Qwen3.5-2B onder Apache-2.0. Laya werd op 18 september 2026 voor het eerst gepusht en heeft sindsdien zo'n 3.700, een pip-pakket, een Jev-compatibele HTTP-server, ONNX- en LangChain-integraties en een fine-tuningnotebook verzameld. Het contrast in volwassenheid vormt het artikel.

Het uitgangspunt dat ze delen, en de mechanismen die verschillen

Beide kaarten betogen dat als je probleem het kiezen tussen bekende antwoorden is, het genereren van proza de verkeerde bewerking is. De formulering van Laya is: "het genereert nooit tekst, dus er is niets te parsen en niets te hallucineren." Die van Intern-Decision-2B is dat zijn API "gestructureerde scoring van kandidaten uitvoert. Het roept generate() niet aan en doet geen sampling van vrije tekst."

De mechanismen zijn waar ze uiteengaan.

Laya is een classifier. Een ModernBERT-large encoder (395M, bidirectioneel, volledig fine-tuned) voedt een decision head die vanaf nul is getraind — twee transformerlagen, een option-marker scorer, en een act/escalate head — voor een totaal van 421M. Opties delen een vast tokenbudget (head_max_len, 192 tokens op de Engelse checkpoint, 256 op de meertalige), en de router detecteert script en taal in minder dan een halve milliseconde voor de pass.

Intern-Decision-2B is een next-tokenmodel dat verboden is om een generator te worden. Het beeldt de opties van elke vraag af op single-token-symbolen A–Z, a–z, 0–9; genereert een volledig assistent-JSON-skelet met één <decision>-placeholder per veld; voert één causale forward pass uit; leest logits onmiddellijk vóór elke placeholder; past softmax toe over de toegestane symbolen van dat veld; en past een gefitte temperatuur van 2,100509348278 toe. Daaronder ligt een standaard Qwen3_5ForConditionalGeneration — 24 lagen, drie linear-attentionlagen op één full-attentionlaag, een behouden multi-token-predictionlaag, een embeddingplafond van 262.144 posities — plus een vision tower en projector.

De praktische consequentie van het verschil is optiecapaciteit. Het vaste budget per optie van Laya stort in bij brede labelruimtes; de eigen kaart van Laya documenteert een vraag met 77 labels die 0,425 scoort tegenover TypeSafe Jev's 0,870 op dezelfde taak, omdat 77 opties elk ongeveer drie of vier tokens krijgen. Intern-Decision-2B neemt tot 62 opties per vraag en tot zestien vragen, en 62 is geen voorkeur maar het exacte aantal single-token symbolen dat zijn contract kan adresseren. Geen van beide is comfortabel voorbij een paar dozijn opties; de faalvormen verschillen.

A screenshot of the Hugging Face model card for internlm/Intern-Decision-2B, showing the internlm organisation, the image-text-to-text, Transformers, Safetensors, qwen3_5, decision-making and multimodal tags, the Demo, Model Weights and GitHub links, and the opening description of Intern-Decision-2B as a multimodal structured decision model fine-tuned from Qwen3.5-2B that accepts a shared state, a schema of named questions and optional images.

Scorebord

A two-column comparison scoreboard titled 'Intern-Decision-2B vs Laya'. The left column reads: Parameters 2,213,241,664 plus vision tower; Input ceiling 8,192 tokens, refused above; Images up to eight; Speed 33.28 ms mean on one RTX 4090; Languages no multilingual claim made; Packaging a checkpoint and an inference script. The right column reads: Parameters 421M, one 842 MB safetensors file; Input ceiling 8,192 with max_len set, 1,024 default; Images none; Speed 103-332 questions/sec batched on one T4; Languages 100+ routed, 45 of 51 usable; Packaging pip install, HTTP server, ONNX, LangChain. A footer notes the Intern-Decision-2B figures are vendor-reported and unreproduced and the Laya figures are Convai's own card, including its zero-shot typed-decisions result below the majority-class line.

• Parameters — Intern-Decision-2B 2.213.241.664 in BF16 plus een visietoren en projector, ongeveer 4,46 GB op schijf; Laya 421M, één enkel 842 MB safetensors-bestand, met een aparte meertalige checkpoint van 644 MB.

Inputplafond — 8.192 tokens voor beide, beide weigeren in plaats van af te kappen; let op: Laya's 8.192 geldt voor laya-multilingual en vereist max_len=8192, aangezien de meegeleverde standaardwaarde 1.024 is.

• Afbeeldingen — maximaal acht voor Intern-Decision-2B, meegerekend binnen hetzelfde tokenbudget; geen multimodaal pad voor Laya.

Snelheid — 33,28 ms gemiddeld, 33,15 ms P50, 33,55 ms P95 per verzoek op één RTX 4090 voor Intern-Decision-2B; Laya rapporteert ongeveer 33 ms per verzoek en 103–332 vragen per seconde in batches op één T4.

• Talen — Intern-Decision-2B maakt helemaal geen meertalige claim; Laya routeert over 100+ talen, en rapporteert dat 45 van de 51 gebenchmarkte talen bruikbaar zijn bij meer dan drie keer random, en 0,451 op MASSIVE-intentie over dertien niet-Engelse talen tegenover 0,306 voor zijn Engelstalige checkpoint.

• Zero-shotnauwkeurigheid — Intern-Decision-2B rapporteert 84,68 gemiddeld over zeven leverancierssuites, met Brier 0,437 en ECE 0,100, allemaal niet gereproduceerd; Laya's Engelse basischeckpoint scoort 0,362 op de typed-decisions-benchmark met 2.000 beslissingen, die volgens zijn eigen modelkaart onder de 0,461-lijn van de meerderheidsklasse ligt.

• Verpakking — een checkpoint, een inference.py en een onlangs openbaar gemaakte GitHub-repository met trainings- en evaluatiecode, tegenover pip install laya, een Jev-compatibele HTTP-server, snelle paden voor ONNX Runtime en TileLang, MCP- en LangChain-integraties, en een fine-tuning-notebook die draait op GPU's uit de gratis laag.

De eerlijkste vergelijking is niet degene die de specificatielijst opzet.

Het is bijna oneerlijk om 84,68 naast 0,362 te zetten, en het is de moeite waard om te zeggen waarom, in plaats van de cijfers zo te laten staan.

Laya's 0.362 is een basis-checkpoint dat zero-shot is gemeten op een benchmark waarvoor het niet is getuned. De eigen model card trekt de conclusie expliciet: "Laya is een snelle basis om op te specialiseren, geen zero-shot beslissingsengine." Fine-getuned op de eigen trainingssplit van die benchmark bereikt het 0.766, waarmee het het lerarenplafond van 0.735 overschrijdt en de gepubliceerde 0.727 van TypeSafe Jev op dezelfde beslissingen verslaat. De 84.68 van Intern-Decision-2B is daarentegen een leveranciersgemiddelde over zeven suites, waarvan de testsets niet dezelfde zijn als die Laya noemt, geproduceerd door het lab dat het model heeft gebouwd, zonder dat een derde partij het heeft gedraaid — het checkpoint toont één like en nul downloads. Een fine-getuned resultaat vergelijken met een zero-shot resultaat, of een leveranciersgemiddelde met een onafhankelijke ranglijst, is geen vergelijking. Het zijn twee verschillende metingen die hetzelfde lettertype delen.

Wat echt vergelijkbaar is: beide zijn klein, beide zijn goedkoop om te draaien, en beide zijn niet te fine-tunen voor je eigen domein. De repository die InternLM vanmorgen heeft gepubliceerd maakt dat laatste deel aanzienlijk gemakkelijker dan het gisteren was, want er zit een trainingslauncher in, de masked-next-token-doelstelling, een hash-geverifieerde bundel van 10.751 testrijen verdeeld over zeven suites, en de temperatuur-fit- en replayscripts. Een lab dat een deterministische kalibratiegenerator levert en beweert dat replay nul beslissingen verandert, lokt precies het soort aanpassing uit dat Laya's kaart aanbeveelt.

Hoe je een van beide eigenlijk zou noemen

Geen van beide modellen staat op OrcaRouter. De modelpagina van OrcaRouter voor Intern-Decision-2B geeft een 404 en er is ook geen Laya-route; niets hier is een claim over beschikbaarheid. Intern-Decision-2B betekent de checkpoint downloaden en de meegeleverde engine op je eigen GPU draaien. Laya betekent pip install laya en, als je het Jev-compatibele oppervlak wilt, laya-serve op POST /v1/systemone.

De onderliggende vraag, in Orchestrator-vorm, is of je een tweede operationeel oppervlak voor een scorer wilt. Laya is ontworpen om ingebed te worden — dezelfde request- en responsvorm als TypeSafe Jev, dus een bestaande client wijzigt alleen een basis-URL en verder niets. Intern-Decision-2B is ontworpen om gereproduceerd te worden, en vandaag is het ongeveer een dag omgevingswerk voordat de eerste beslissing terugkomt. Als de closed-set-beslissing die je neemt qua vorm dicht bij een van deze twee ligt, is het gehoste alternatief waartegen beide kaarten benchmarken TypeSafe Jev 1.13, dat wél een route heeft: $0,042 per miljoen inputtokens, een context van 65K en een P50-tijd-tot-eerste-token van 178 ms, bereikbaar met dezelfde sleutel als 200+ andere modellen met de lijstprijs van de provider doorgegeven tegen 0% opslag.

A screenshot of the OrcaRouter model page for typesafe/jev-1.13, dated 2026-09-24, showing the TypeSafe breadcrumb, the model name Jev 1.13, text input, and the description that Jev is a structured decision and evaluation model taking a state and named questions (noul / choice / score) and returning a structured answer for each, served non-streaming via POST /v1/systemone with up to about 64K input tokens.

Waar elk van hen wint

Laya wint op elk operationeel punt. Een pip-pakket tegenover het downloaden van een checkpoint. Een router voor meer dan honderd talen tegenover geen enkele claim op meertaligheid. Batchdoorvoer gemeten in honderden vragen per seconde tegenover een getal per verzoek zonder enige vorm van batchverwerking. Twee jaar ecosysteemkracht — ONNX, TileLang, LangChain, MCP — tegenover een repository die pas twee uur openbaar is.

Intern-Decision-2B wint op drie beperkte punten. Het ondersteunt afbeeldingen, wat Laya niet doet. Het heeft geen fine-tuning-schuld: de 84,68 is een zero-shot-claim van de leverancier, terwijl het kopcijfer van Laya, 0,766, toekomt aan een checkpoint dat is fine-tuned op de eigen trainingssplit van de benchmark. En het is gedocumenteerd met een reproductiekit — een verifieerbare evaluatiebundel en een openbare trainingsstack — die voor iedereen die het model tegenover iemand anders moet verantwoorden, meer waard is dan een regel op een leaderboard.

De gelijkstand is het uitgangspunt. Beide weigeren te genereren, beide geven je waarschijnlijkheden waarop je een drempel kunt toepassen, en beide blijven onder de invoerlengte waarop de meeste echte documenten zich bevinden. Als je state een ticket, een e-mail of een formulier is, voldoet elk van beide en ben je met Laya sneller. Als je state een bijgevoegde screenshot heeft of je organisatie wil dat de reproductie auditbaar is, is de middelste checkpoint van InternLM degene die dat specifieke bezwaar beantwoordt — en volgens InternLM's eigen cijfers is het de minst goed gekalibreerde van zijn drie zustermodellen, met ECE 0,100 tegen 0,066 en 0,065, dus fit je eigen temperatuur voordat je het vertrouwen gelooft dat het rapporteert.