
Laya vs Decider: En 421M-kodare mot en 35B-blandning
- openaiNYOpenAI: GPT-6 Luna2026-09-2237Intelligens
- openaiNYOpenAI: GPT-6 Sol2026-09-2248Intelligens
- anthropicNYAnthropic: Claude Opus 5.52026-09-2258Intelligens
- grokNYGrok 4.72026-09-2146Intelligens
- OrcaNYOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M tokens
- orcaNYOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens
- deepseekNYDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0540Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligens76Kodning
Laya och Decider är båda icke-autoregressiva beslutsmodeller med öppna vikter som besvarar frågor med bestämd svarstyp – ett val från en medföljande lista, en poäng på en ordnad bedömningsskala, en ja/nej-sannolikhet – i en enda framåtpassning, och de befinner sig i varsin ände av storleksspektrumet. Convai Innovations släppte Laya den 18 september 2026 under Apache 2.0: en ModernBERT-large-encoder på 421M för engelska med ett fönster på 512 token, en flerspråkig mmBERT-base-checkpoint på 322M med ett fönster på 1 024 token som täcker 100+ språk, och en router som identifierar skriftsystem och skickar vidare till rätt modell. Mapikas Decider-familj sträcker sig från decider-0.8b och decider-2b på små generativa basmodeller upp till decider-35b-a3b, en 35B mixture-of-experts med ungefär 3B aktiva parametrar. Båda är gratis att ladda ner och båda returnerar sannolikheter i stället för text. Anledningen till att de inte är utbytbara är inte den noggrannhetssiffra som de flesta genomgångar inleder med.
Två familjer, en arkitektonisk satsning

Den gemensamma satsningen är att ett beslut inte behöver en avkodningsloop. En generativ modell som får frågan "är det här ärendet en återbetalningsbegäran?" måste generera tokens, och i samma stund som den genererar tokens äger du parsning, schemavalidering och en återförsöksväg för den ena gången på tvåhundra då den glömmer en klammerparentes. Laya och Decider hoppar båda över det genom att läsa svaret direkt ur ett enda framåtpass – Laya från en dubbelriktad encoder, Decider från logits för bokstavsmärkta alternativtoken vid en dedikerad svarsplats i prompten.
Det är där likheten slutar. Laya är två små encodrar bakom en språkrouter, vilket är vad som ger den ett engelskt fönster på 512 token och ett flerspråkigt på 1 024 token, med 421M respektive 322M parametrar. Decider behåller en generativ ryggrad och lägger till ett utläsningslager ovanpå: decider-2b är en övervakad finjustering av Qwen3.5-2B-Base som följs av en kalibreringsmedveten förstärkningsomgång på webbläsaruppgifter i realtid och exakta spel, medan decider-35b-a3b fryser de routade experterna och tränar blockmatriser med Muon. Den praktiska konsekvensen är att Decider ärver en språkmodells världskunskap, vilket Laya inte gör. Den andra konsekvensen är att Decider ärver en språkmodells fotavtryck.

Mapikas egen dokumentation anger decider-2b till 18 ms median per beslut på en B300 i bf16, batch om ett, utan CUDA-grafer eller kompilering, och decider-35b-a3b till 41 ms i samma uppsättning. På en GH200 med supportärende-kontexter på ungefär 230 tokens och tre till fem inskrivna frågor rapporterar samma projekt 49 ms eager, 4,0 ms med CUDA-grafer och torch.compile, samt omkring 1 370 beslut per sekund vid batch 32. Det är leverantörspublicerade siffror från projektets egen redogörelse, inte en oberoende mätning. Layas rubriksiffra är på samma sätt leverantörspublicerad: 32,8 ms p50 per beslut på en Tesla T4, och 7,2 ms per fråga vid batchstorlek 10.
Kalibreringsfrågan, som de två projekten besvarar på olika skalor
Kalibrering är det tal som har störst betydelse för en beslutsmodell, eftersom själva poängen med att returnera en sannolikhet är att någon nedströms kommer att sätta ett tröskelvärde på den. Det är också här som en direkt jämförelse mellan Laya och Decider kommer att vilseleda dig.
Laya levereras med ett förväntat kalibreringsfel på 0,466 på sitt eget modellkort, och kortet säger rent ut att om man på nytt anpassar en temperatur per frågetyp så ändras det till 0,081. Det är en ovanligt ärlig upplysning, och det innebär också att den levererade checkpointen inte är den kalibrerade artefakten. Siffran du får direkt ur lådan är 0,466.
Decider rapporterar på ett helt annat instrument. Decision Index – en öppen resultattavla som körde varje öppen reproduktion av Jev över 132 422 förfrågningar – placerar decider-35b-a3b på fjärde plats totalt med 54,3, bakom Jevs 59,5, och rapporterar den som den bäst kalibrerade av de 32 posterna med ett kalibreringsfel på 3,1 punkter och 0,4 % felaktiga svar vid 95 %+ angiven konfidens. decider-2b rapporterar 8,8 punkter och 0,9 %. Det är siffror publicerade på resultattavlan, och 3,1 punkter på Indexets tio-bins-ECE är inte samma mätning som Layas 0,466 i dess egen utvärdering. Att ställa dem sida vid sida i en tabell vore ett äpplen-och-päron-fel klätt som stringens. Vad man kan säga är att Deciders författare valde att bli mätt på en tredjepartsresultattavla och Layas författare valde att själv publicera sitt svagaste kalibreringsnummer; ingendera har granskats av den andras testramverk.
Där var och en vinner, dimension för dimension
• Backbone — Laya: ModernBERT-large 421M-kodare, dubbelriktad. Decider: Qwen3.5 generativa baser, 0,8B till 35B-A3B.
• Språk — Laya: 100+ via en flerspråkig checkpoint på 322M bakom en router. Decider: endast engelska, vilket anges som en begränsning.
• Kontextfönster — Laya: 512 tokens för engelska, 1 024 för flera språk. Decider: indata upp till 32k accepteras, tränad till 16k på v6-generationen, testad upp till 30k.
• Tak för alternativmängd — Laya: försämras kraftigt efter ungefär 20 alternativ, 0,425 på Banking77 mot Jevs 0,870. Beslutare: Val med 2 till 255 namngivna alternativ, Poäng med 2 till 10 beskrivna nivåer.
• Zero-shot-noggrannhet — Laya: 0,362 på typed-decisions-benchmarken, under majoritetsklassbaslinjen på 0,461. Decider: publiceras inte som ett zero-shot-tal; projektet rapporterar i stället uppgiftsspecifika resultat.
• Kalibrering – Laya: ECE 0,466 i leveransskick, 0,081 efter temperaturåteranpassning per frågetyp. Decider: 3,1 poäng på Decision Index för 35B, bäst av 32 bidrag.
• Resonemang — Laya: inget, per konstruktion. Decider: inget, uttryckligen angivet — det är en mönstermatchningsutläsning, inte en resonerare.
• Licens — Apache 2.0 för båda.
Ytterligare en Decider-detalj värd att känna till innan du gör ditt val: projektet varnar för att välja ut en post ur en lång JSON-array efter position är ett svagt användningsfall, och rekommenderar att adressera poster med nyckel. Det är den typen av begränsning som man bara lär sig genom att köra det.
Vad det kostar dig att driva endera
Layas kostnadsprofil är ett finjusteringsprojekt. Modellen är liten nog att köras på en bärbar dators CPU för arbete med låg genomströmning, men den levererade engelska checkpointens zero-shot-poäng ligger under den triviala baslinjen, vilket innebär att anta Laya är att anta jobbet att bygga en märkt datamängd, finjustera och återanpassa temperaturen per frågetyp. Belöningen är att när du väl har gjort det är artefakten 421M parametrar och svarar på tiotals millisekunder på en T4. Convaiss egen finjusterade laya-typed-decisions checkpoint når 0,766 på benchmarkens träningsdel — en siffra som säger mer om finjusteringen än om basmodellen, och det står så på kortet.
Deciders kostnadsprofil är ett serveringsbeslut. Du väljer hur mycket GPU du ska hyra, och familjen ger dig en äkta ratt: 18 ms på en 2B mot 41 ms på en 35B-A3B, där den större modellen köper kunskaps- och resonemangsutrymme på GPQA, GSM8K, CRUXEval och MMLU som de små inte har. Om din uppgift är smal och dina etiketter är fasta är decider-2b den billigare maskinen. Om din uppgift kräver att modellen vet saker betalar du för blandningen.
Var OrcaRouter passar – och var det inte gör det
Varken Laya eller Decider är en hostad modell på OrcaRouter. Du laddar ner vikterna och kör dem själv, och inget här ändrar på det. Det som däremot ändras är den andra halvan av mönstret. En typad beslutsmodell är nästan aldrig hela applikationen: något måste läsa in ärendet, sammanfatta tråden eller formulera svaret som beslutet styr. Den halvan är ett generativt anrop, och det är den halvan OrcaRouter är byggd för – över 200 modeller bakom en enda OpenAI-kompatibel nyckel till leverantörslistpris vidarefakturerat med 0 % påslag, så en prissänkning från leverantören landar på din faktura samma dag i stället för vid nästa avtalsförnyelse. Om du finjusterar en Laya-checkpoint mot en frontmodells utdata, eller routar mellan decider-2b för triage och en stor modell för de svåra 4 %, gör det att hålla den generativa sidan på en enda endpoint att beslutsidan och generationssidan inte behöver två avtal och två SDK:er. Automatisk failover täcker fallet där den stora modellen är den del som går ner.
Vilken ska man välja?
Välj Laya om dina indata är flerspråkiga, dina etiketter är få, din latensbudget ligger på tiotals millisekunder på blygsam hårdvara och du är beredd att finjustera – för det kommer du att behöva. Välj Decider om dina indata är engelska, du behöver att modellen för in viss världskunskap i beslutet och du hellre väljer en modellstorlek än kör en träningspipeline. Om dina alternativuppsättningar går över tjugo etiketter, läs Layas Banking77-siffra innan du bestämmer dig; om dina indata är långa JSON-dokument som du adresserar efter position, läs Deciders angivna begränsning innan du bestämmer dig.
Jämförelsen som faktiskt skulle avgöra saken – båda modellerna på byte-identiska indata, samma prompter, samma ordning på alternativen, samma tröskelgenomsökning – finns inte ännu. Tills den finns är den ärliga hållningen att Laya har den bättre kostnadskurvan och Decider har den bättre kalibreringsbevisningen, och att båda är tillräckligt tidiga för att utvärderingen du bygger på dina egna data kommer att vara värd mer än något av projektens publicerade siffror.

