
Intern-Decision-4B vs Laya: Två modeller som vägrar skriva ett svar, med tio gångers storleksskillnad
- typesafeNYTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M tokens · 592 tok/s
- openaiNYOpenAI: GPT-6 Luna2026-09-2237Intelligens
- openaiNYOpenAI: GPT-6 Sol2026-09-2248Intelligens
- anthropicNYAnthropic: Claude Opus 5.52026-09-2258Intelligens
- grokNYGrok 4.72026-09-2146Intelligens
- OrcaNYOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M tokens · 187 tok/s
- orcaNYOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0540Intelligens72Kodning
Det finns en rad i modellkortet för Intern-Decision-4B som lyder "Laya — 57.77". Den som har läst Layas egen dokumentation känner igen vad siffran betyder: convaiinnovations/laya är en icke-autoregressiv beslutsmodell med 421 miljoner parametrar, och 57.77 är det genomsnitt den får när den används zero-shot på någon annans benchmark. Dess eget modellkort säger samma sak mer rakt på sak — bascheckpunkterna ligger under majoritetsklassbaslinjen på typed-decisions-benchmarken, på 0.362 mot 0.461. Samtidigt internlm/Intern-Decision-4B är en modell med 4,54 miljarder parametrar byggd för exakt samma uppgift: ta ett tillstånd och en uppsättning typade frågor, kör en enda forward-pass, returnera kalibrerade sannolikheter, generera aldrig en token. Samma arkitektoniska satsning, samma utdataform, samma Apache-2.0-licens, tio gånger parametrarna — och en av dem är en bas att finjustera medan den andra utger sig för att vara en färdig zero-shot-motor.
De är överens om premissen, vilket är det ovanliga.
Båda korten argumenterar för samma sak, och det är värt att säga eftersom större delen av branschen argumenterar för motsatsen. Om ditt problem är att välja bland en känd uppsättning svar är det fel operation att generera prosa: du betalar för token som du kastar bort, du behöver en parser, och du får en förklaring du inte bad om i stället för en sannolikhet du kan tröskla. Layas kort uttrycker det som "den genererar aldrig text, så det finns inget att parsa och inget att hallucinera." Intern-Decision-4B:s kort säger att dess API "utför strukturerad poängsättning av kandidater. Den anropar inte generate() eller samplar fritext."
Mekanismerna skiljer sig på ett lärorikt sätt. Laya matar in typade frågor till ett klassificeringshuvud och returnerar typade svar med kalibrerade sannolikheter i en enda framåtpassning, med ett routinglager som upptäcker skriftsystem och språk på under en halv millisekund före passningen. Intern-Decision-4B mappar varje frågas alternativ till enstaka tokensymboler, renderar ett JSON-skelett för assistenten med en platshållare per fält, läser logitsen omedelbart före varje platshållare och softmaxar endast över det fältets tillåtna symboler. Layas är ett klassificeringsproblem; InternLMs är ett nästa-token-problem som det vägrar låta förvandlas till ett genereringsproblem.

Storleksgapet, och vad det ger
Att be två modeller utföra samma uppgift med 421M och 4.54B parametrar ger det resultat du skulle förutse, och sedan en överraskning.
Den förutsagda delen är förmågan på svåra frågor. Intern-Decision-4B har i genomsnitt 90,02 över sju utvärderingsset med en Brier-poäng på 0,347 och ett förväntat kalibreringsfel på 0,065 enligt InternLMs egen mätning, och den kör 44,16 ms i genomsnitt per fråga på ett enda RTX 4090. Layas engelska bascheckpoint har en noggrannhet på 0,362 på typed-decisions-benchmarken med 2 000 beslut, vilket dess eget kort flaggar som under majoritetsklassgränsen på 0,461 och knappt över den slumpmässiga baslinjen på 0,318. När samma checkpoint finjusteras på just den benchmarkens egen träningssplit hoppar siffran till 0,766. Layas kort drar själv slutsatsen: "Laya är en snabb bas att specialisera, inte en zero-shot-beslutsmotor."
Överraskningen är att den mindre modellen vinner två dimensioner rakt av. Hastighet: Laya svarar på 103 till 332 frågor per sekund i batch på en enda T4, och dess modellkort placerar den ungefär sex till åtta gånger snabbare än TypeSafe Jev på den oberoende uppmätta 236–276 ms p50-siffran som den citerar. Tio gånger så många parametrar ger inte tio gånger så mycket genomströmning i den andra riktningen — Intern-Decision-4B:s 44,16 ms är per fråga på ett 4090 utan någon publicerad batchning. Och språk: Laya rapporterar att 45 av 51 benchmarkade språk är användbara vid mer än tre gånger slumpen, med en routad 0,451 på MASSIVE intent i tretton icke-engelska språk mot 0,306 för dess engelskspråkiga checkpoint. Intern-Decision-4B gör inte alls något flerspråkigt anspråk.
Resultattavla
• Parametrar — 4,54B BF16 för Intern-Decision-4B, texttorn plus visionstorn plus projektor; 421M för Laya, en enda kompakt stack av encoderklass.
• Indatatak — 8 192 tokens för båda, och båda vägrar hellre än att trunkera; observera att Layas 8 192 gäller den flerspråkiga checkpointen, vars standardvärde vid leverans är 1 024.
• Multiplicitet — Intern-Decision-4B tar 1 till 16 frågor och upp till 62 alternativ per fråga, och 62 är inte godtyckligt: det är exakt antalet symboler med en enda token som dess inferenskontrakt kan adressera. Laya tar också flera typade frågor, men dess kort dokumenterar en kraftig kollaps efter ungefär 50 alternativ, där en fråga med 77 etiketter bara får tre eller fyra tokens i budget per etikett och noggrannheten faller till 0,425.
• Bilder — upp till åtta för Intern-Decision-4B, räknas mot budgeten på 8 192 token; ingen multimodal väg för Laya.
• Kalibrering — Intern-Decision-4B levereras med en anpassad temperatur på 1,99241824 som valts genom NLL-minimering över 1 728 fall, och rapporterar ECE 0,065 i sin egen svit; Laya levereras i överkonfident skick, och dess modellkort anger att återanpassning av en temperatur per frågetyp och antal svarsalternativ flyttar medel-ECE från 0,466 till 0,081.
• Zero-shot-hållning – en färdig checkpoint som gör anspråk på ett genomsnitt på 90,02 mot en dokumenterad bas som presterar under majoritetsklassens linje.
• Latens — 44,16 ms i genomsnitt, 44,03 ms i median på ett RTX 4090 jämfört med 103 till 332 frågor per sekund batchade på ett T4.
• Språk — inget publicerat påstående mot 45 av 51 språk som kan användas vid routning.
• Licens — Apache-2.0 med den uppströms Qwen-licensen bevarad mot Apache-2.0 som uttryckligen märkts för kommersiellt bruk.

Två kort, två väldigt olika syn på öppenhet
Det är här jämförelsen slutar vara ett specifikationsblad och blir en bedömningsfråga, eftersom de två leverantörerna dokumenterar sina modeller i motsatta stilar.
Layas kort redogör i detalj för sina egna misslyckanden. Det rapporterar att den engelska checkpointen får 0,000 i noggrannhet på khmer vid 0,952 i konfidens — självsäker men fel, vilket gör konfidensstyrning oanvändbar där. Det rapporterar att action.act_probability inte bär någon användbar signal, utan visar 1,0 för nästan varje indata med en AUROC på 0,30 över 396 märkta beslut, och säger åt dig att i stället styra på konfidens, som når 0,77 på samma objekt. Den pekar ut ordinala poängfrågor som "den svagaste primitiven" och hänvisar till 0,372 på SST-5. Ett kort som talar om vilka av dess egna utdata du ska ignorera gör något som de flesta leverantörer inte ens försöker sig på.
Kortet för Intern-Decision-4B publicerar en prydlig tabell och inga misslyckandefall. Dess förbehåll är verkliga och bärande — kalibreringsavsnittet är ovanligt explicit med att kolumnen "before" i dess pilot inte är vad någon användare skulle se, och att testsvitens etiketter inte användes för att välja temperaturen — men utvärderingsavsnittet är sju vinster och inga erkännanden. Den innehåller också rader för fem konkurrerande system som InternLM körde i InternLM:s testharness, inklusive Laya-raden som inleder den här artikeln. Det är inte dessa projekts egna siffror, och att läsa dem som sådana vore ett misstag.
Så bevisinsamlingen för den här matchningen är asymmetrisk på ett sätt som gynnar den mindre modellen: Layas bevisning innehåller defekter som den själv dokumenterade, och Intern-Decision-4B:s bevisning har aldrig mött ett testset som dess författare inte valt.
Vilken form av problem var och en passar
Givet ett kort, strukturerat tillstånd på engelska, en sluten uppsättning svar och ett behov av en tillförlitlig sannolikhet är Intern-Decision-4B det mer kapabla objektet på pappret och det dyrare i praktiken — fyra safetensors-shards, PyTorch 2.9.1 och Transformers 5.14.1 under Python 3.12, en resident motor, och en wrapper som du skriver själv om du vill ha en HTTP-slutpunkt. Givet ett högvolymbeslut om routing eller guardrails över dussintals språk där genomströmningen är den begränsande faktorn är Laya den bättre formen: pip install laya, en 421M-modell och ett kort som redan har sagt åt dig att finjustera innan du litar på sannolikheterna.
Det enda som båda korten är överens om är att man inte bör lita på någon av modellerna zero-shot utan att kontrollera kalibreringen på dina egna data — Laya eftersom dess bas-checkpoints ligger nära slumpnivå för obekanta beslutstyper, Intern-Decision-4B eftersom dess 0,065 ECE kommer från en svit som dess egna författare har sammanställt.
Vad en router ändrar och inte ändrar här
Ingen av dessa modeller finns i OrcaRouters katalog, och det är värt att säga rakt ut i stället för att antyda något annat: våra modellsidor returnerar 404 för både Intern-Decision-4B och Laya, och ingen av dem är en rutt du kan anropa i dag. Vad det innebär för de två projekten är inte samma sak. Layas Apache-2.0-licens med en tagg för kommersiell användning innebär att hindret enbart är paketering – det är ett lokalt Python-paket med ett litet fotavtryck, vilket är den typ av sak som rimligen skulle kunna serveras. Intern-Decision-4B:s hinder är också paketering, men dess 4,54B BF16-vikter och taket på 8 192 tokens för avböjanden gör det till en komponent snarare än en tjänst.
Där OrcaRouter faktiskt hjälper till är på den bortre sidan av beslutet. Om ditt strukturerade beslutsproblem visar sig behöva ett resonemangssteg trots allt, finns de allmänna modellerna som kan göra det på en enda nyckel över 200+ modeller, med leverantörens listpris vidarebefordrat med 0 % påslag och automatisk redundansväxling mellan leverantörer — så modellen du kopplar ihop med en scorer är bara en slutpunkt bort, inte ett andra kontrakt.
Den korta versionen
Dessa två projekt nådde samma slutsats om hur beslut bör fattas och skilde sig sedan åt i nästan allt annat. Laya satsar på att 421M parametrar, snäv språkdirigering och obeveklig ärlighet om sina egna brister utgör en snabb bas som man specialiserar. Intern-Decision-4B satsar på att tio gånger så många parametrar och ett noggrant konstruerat poängsättningskontrakt för en enda token utgör en färdig zero-shot-motor. Det avgörande experimentet är ett som ingen av dem har kört offentligt: ta en uppsättning beslut med beräkningsbara svar, kör båda och kontrollera om sannolikheterna betyder något. Laya har halvpublicerat experimentet och visat var det misslyckas. Intern-Decision-4B har inte publicerat det alls.

