Ett genererat titelkort med texten 'Intern-Decision-2B vs Laya', med undertexten '2,21B mot 421M, ingen av dem skriver en token', med märkena 'en släpper ett pip-paket' och 'en släpper ett reproduktionskit', med OrcaRouter-logotypen komponerad i hörnet.
Guides & Insights

Intern-Decision-2B vs Laya: 2,2 miljarder parametrar mot 421 miljoner, båda vägrar skriva ett svar

Författare

Alistair Wren

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller →
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

internlm/Intern-Decision-2B och convaiinnovations/laya är de två mest lika modellerna i nischen små beslutsmodeller, och det mest användbara faktumet om jämförelsen är att de tar sig dit via motsatta vägar. InternLMs checkpoint med 2 213 241 664 parametrar läser logiten vid en fast position före en platshållare och anropar aldrig generate(). Convais checkpoint med 421 miljoner parametrar matar typade frågor till ett beslutshuvud ovanpå en ModernBERT-large-ryggrad och returnerar kalibrerade sannolikheter i en enda framåtpassning. Ingen av dem skriver en token, båda utlovar sannolikheter, båda når taket vid nära åtta tusen tokens indata, och den mindre är fem gånger mindre och ungefär tusen gånger mer populär. Det som skiljer dem åt är inte så mycket kapacitet som paketering, och paketeringsgapet avgör köpet för de flesta läsare.

Intern-Decision-2B dök upp på Hugging Face kl. 05:36 UTC den 26 september 2026, den mellersta av tre storlekar som InternLM laddade upp på fyrtio sekunder utan tillkännagivande, finjusterad från Qwen/Qwen3.5-2B under Apache-2.0. Laya publicerades först den 18 september 2026 och har sedan dess samlat på sig drygt 3 700 gillamarkeringar, ett pip-paket, en Jev-kompatibel HTTP-server, ONNX- och LangChain-integrationer och en finjusteringsnotebook. Kontrasten i mognad är artikeln.

Premissen de delar, och mekanismerna som skiljer sig åt

Båda korten argumenterar för att om ditt problem är att välja bland kända svar, så är det fel operation att generera prosa. Layas formulering är "den genererar aldrig text, så det finns inget att tolka och inget att hallucinera." Intern-Decision-2B:s är att dess API "utför strukturerad kandidatpoängsättning. Den anropar inte generate() eller samplar fritext."

Mekanismerna är där de skiljs åt.

Laya är en klassificerare. En ModernBERT-large-encoder (395M, bidirektionell, fullt finjusterad) matar ett beslutshuvud tränat från grunden – två transformerlager, en poängsättare för alternativmarkörer och ett agera/eskalera-huvud – för totalt 421M. Alternativen delar en fast tokenbudget (head_max_len, 192 token i den engelska checkpointen, 256 i den flerspråkiga), och routern identifierar skriftsystem och språk på under en halv millisekund före passet.

Intern-Decision-2B är en nästa-token-modell som har förbjudits att bli en generator. Den mappar varje frågas alternativ till symboler med en enda token, A–Z, a–z, 0–9; renderar ett fullständigt assistent-JSON-skelett med en <decision>-platshållare per fält; kör en kausal framåtpassning; läser logits omedelbart före varje platshållare; softmaxar över fältets tillåtna symboler; och tillämpar en anpassad temperatur på 2,100509348278. Under detta ligger en standard Qwen3_5ForConditionalGeneration – 24 lager, tre linjära attention-lager mot ett fullt attention-lager, ett bibehållet multi-token-prediktionslager, ett inbäddningstak på 262 144 positioner – plus ett visionstorn och en projektor.

Den praktiska konsekvensen av optionskapaciteten. L:s fasta budget per option kollapsar i breda etikettrymder; dess eget kort dokumenterar en 77-etikettsmodell som får 0,870 mot TypeSafe Jevs 0,870 på samma uppgift. Intern-Decision-2B tar upp till 62 optioner per indata och upp till sexton optioner; 62 är inte det exakta antalet symboler med en enda token som dess kontrakt kan adressera. Ingen av dem är bekväm bortom ett fåtal optioner; misslyckandet fortsätter.

A screenshot of the Hugging Face model card for internlm/Intern-Decision-2B, showing the internlm organisation, the image-text-to-text, Transformers, Safetensors, qwen3_5, decision-making and multimodal tags, the Demo, Model Weights and GitHub links, and the opening description of Intern-Decision-2B as a multimodal structured decision model fine-tuned from Qwen3.5-2B that accepts a shared state, a schema of named questions and optional images.

Resultattavla

A two-column comparison scoreboard titled 'Intern-Decision-2B vs Laya'. The left column reads: Parameters 2,213,241,664 plus vision tower; Input ceiling 8,192 tokens, refused above; Images up to eight; Speed 33.28 ms mean on one RTX 4090; Languages no multilingual claim made; Packaging a checkpoint and an inference script. The right column reads: Parameters 421M, one 842 MB safetensors file; Input ceiling 8,192 with max_len set, 1,024 default; Images none; Speed 103-332 questions/sec batched on one T4; Languages 100+ routed, 45 of 51 usable; Packaging pip install, HTTP server, ONNX, LangChain. A footer notes the Intern-Decision-2B figures are vendor-reported and unreproduced and the Laya figures are Convai's own card, including its zero-shot typed-decisions result below the majority-class line.

• Parametrar — Intern-Decision-2B 2 213 241 664 i BF16 plus ett visionstorn och en projektor, cirka 4,46 GB på disk; Laya 421M, en enda safetensors-fil på 842 MB, med en separat flerspråkig checkpoint på 644 MB.

• Indatatak — 8 192 tokens för båda, båda vägrar i stället för att trunkera; observera att Layas 8 192 gäller laya-multilingual och kräver max_len=8192, eftersom medföljande standard är 1 024.

• Bilder — upp till åtta för Intern-Decision-2B, räknas mot samma tokenbudget; ingen multimodal väg för Laya.

• Hastighet — 33,28 ms i genomsnitt, 33,15 ms P50, 33,55 ms P95 per begäran på ett RTX 4090 för Intern-Decision-2B; Laya rapporterar ungefär 33 ms per begäran och 103–332 frågor per sekund i batch på ett enda T4.

• Språk — Intern-Decision-2B gör inte alls anspråk på flerspråkighet; Laya dirigerar över 100+ språk och rapporterar att 45 av 51 benchmarkade språk är användbara vid över tre gånger slumpmässig nivå, samt 0,451 på MASSIVE intent över tretton icke-engelska språk mot 0,306 för sin checkpoint som endast är på engelska.

• Zero-shot-noggrannhet — Intern-Decision-2B rapporterar 84,68 i genomsnitt över sju leverantörssviter med Brier 0,437 och ECE 0,100, alla oreproducerade; Layas engelska bascheckpoint får 0,362 på typed-decisions-benchmarken med 2 000 beslut, vilket dess eget kort flaggar som under majoritetsklassgränsen 0,461.

• Paketering – en checkpoint, en inference.py och ett nyligen offentligt GitHub-repositorium med tränings- och utvärderingskod, kontra pip install laya, en Jev-kompatibel HTTP-server, ONNX Runtime- och TileLang-snabbvägar, MCP- och LangChain-integrationer samt en finjusteringsnotebook som körs på GPU:er på gratisnivå.

Den mest rättvisa jämförelsen är inte den som specifikationsbladet ställer upp.

Att ställa 84,68 bredvid 0,362 gränsar till ohederligt, och det är värt att säga varför i stället för att låta siffrorna stå.

Layas 0,362 är en bas-checkpoint mätt zero-shot på ett benchmark som den inte var trimmad för. Dess eget kort drar slutsatsen explicit: "Laya är en snabb bas att specialisera, inte en zero-shot-beslutsmotor." Finjusterad på det benchmarkets egen träningsdel når den 0,766, tar sig över 0,735-lärartaket och slår TypeSafe Jevs publicerade 0,727 på samma beslut. Intern-Decision-2B:s 84,68 är däremot ett leverantörsgenomsnitt över sju sviter vars testuppsättningar inte är de som Laya anger, framställt av labbet som byggde modellen, utan att någon tredje part har kört den — checkpointen visar en gillamarkering och noll nedladdningar. Att jämföra ett finjusterat resultat med ett zero-shot-resultat, eller ett leverantörsgenomsnitt med en oberoende resultattavla, är inte en jämförelse. Det är två olika mätningar som delar typsnitt.

Vad som är genuint jämförbart: båda är små, båda är billiga att köra och båda är omöjliga att finjustera för din domän. Repositoriet som InternLM publicerade i morse gör den sista delen påtagligt enklare än den var igår, eftersom det levererar träningsstartaren, målet för maskerad nästa token, ett hashverifierat paket med 10 751 testrader över sju testsviter samt temperaturanpassnings- och replay-skripten. Ett labb som levererar en deterministisk kalibreringsgenerator och hävdar att replay inte ändrar ett enda beslut inbjuder till precis den typ av anpassning som Layas kort rekommenderar.

Hur du faktiskt skulle kalla någon av dem

Ingen av modellerna finns på OrcaRouter. OrcaRouters modellsida för Intern-Decision-2B returnerar 404 och det finns ingen Laya-route heller; inget här är ett påstående om tillgänglighet. Intern-Decision-2B innebär att ladda ner checkpointen och köra dess medföljande motor på din egen GPU. Laya innebär pip install laya och, om du vill ha det Jev-kompatibla gränssnittet, laya-serve på POST /v1/systemone.

Den Orchestrator-formade frågan under ytan är om du vill ha en andra operativ yta för en scorer. Laya är utformad för att bäddas in – samma form för förfrågan och svar som TypeSafe Jev, så en befintlig klient ändrar bara en bas-URL och inget annat. Intern-Decision-2B är utformad för att reproduceras, och i dag är det ungefär en dags miljöarbete innan det första beslutet kommer tillbaka. Om det slutna beslutet du fattar har en form som ligger nära något av dessa, är det hostade alternativet som båda korten benchmarkar mot TypeSafe Jev 1.13, som faktiskt har en väg: 0,042 USD per miljon indatatoken, en kontext på 65K och en P50-tid till första token på 178 ms, nåbar med samma nyckel som 200+ andra modeller med leverantörens listpris vidarebefordrat med 0 % påslag.

A screenshot of the OrcaRouter model page for typesafe/jev-1.13, dated 2026-09-24, showing the TypeSafe breadcrumb, the model name Jev 1.13, text input, and the description that Jev is a structured decision and evaluation model taking a state and named questions (noul / choice / score) and returning a structured answer for each, served non-streaming via POST /v1/systemone with up to about 64K input tokens.

Där var och en vinner

Laya vinner på allt operativt. Ett pip-paket mot en checkpoint-nedladdning. En router över fler än hundra språk mot inget påstående om flerspråkighet. Batchad genomströmning mätt i hundratals frågor per sekund mot en siffra per förfrågan utan någon historia om batchning. Två års ekosystemmuskler – ONNX, TileLang, LangChain, MCP – mot ett repo som varit offentligt i två timmar.

Intern-Decision-2B vinner på tre snäva punkter. Den tar emot bilder, vilket Laya inte gör. Den bär ingen finjusteringsskuld: dess 84,68 är ett zero-shot-påstående från leverantören, medan Layas rubriksiffra 0,766 tillhör en checkpoint som finjusterats på benchmarkens egen träningsdel. Och den dokumenteras med ett reproduktionspaket – ett verifierbart utvärderingspaket och en offentlig träningsstack – vilket är värt mer än en rad i en resultattabell för alla som måste motivera modellen för någon annan.

Oavgjort är premissen. Båda vägrar generera, båda ger dig sannolikheter du kan tröskla, och båda ligger under den indatalängd där de flesta verkliga dokument befinner sig. Om det du arbetar med är en ticket, ett e-postmeddelande eller ett formulär duger vilken som helst av dem, och Laya får dig dit snabbare. Om det du arbetar med har en skärmbild bifogad eller din organisation behöver att reproduktionen är granskningsbar, är InternLM:s mellersta checkpoint den som bemöter just den invändningen — och enligt InternLM:s egna siffror är den den sämst kalibrerade av sina tre syskon, med ECE 0,100 mot 0,066 och 0,065, så anpassa din egen temperatur innan du litar på den konfidens den rapporterar.