Ett hero-titelkort med texten 'Intern-Decision-0.8B vs LFM2.5 2.6B Base' och underrubriken 'Två sätt att bygga något själv', med märkena 'den ena returnerar en distribution' och 'den andra returnerar en träningskörning', med OrcaRouter-logotypen kompositerad i hörnet.
Guides & Insights

Intern-Decision-0.8B vs LFM2.5 2.6B Base: Två sätt att bygga något själv

Författare

Magnus Corvin

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller →
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Ställ Intern-Decision-0.8B bredvid LFM2.5 2.6B Base, och den ärliga första observationen är att ingen av dem är en produkt i den bemärkelse en köpare vanligtvis avser. Intern-Decision-0.8B är den checkpoint som InternLM laddade upp till Hugging Face den 26 september 2026 helt utan tillkännagivande – en finjustering av Qwen3.5-0.8B med 852 985 920 parametrar som besvarar skrivna frågor och inte avger någon text, släppt under Apache 2.0 med en GitHub-länk som ger 404. LFM2.5 2.6B Base är Liquid AIs förtränade text-checkpoint med 2,69 miljarder parametrar, publicerad den 1 augusti 2026 som grunden för LFM2.5-familjen, och dess eget kort säger att den "endast rekommenderas för uppgifter som kräver omfattande finjustering." Den ena är färdig och snäv. Den andra är ofärdig och allmän. Båda förutsätter att det är du som gör arbetet – och arbetet är inte samma arbete.

Den distinktionen är hela jämförelsen, och det är anledningen till att en rättfram spec-tabell skulle vilseleda. Frågan en läsare faktiskt har är "vilken av dessa ska jag ladda ner", och svaret beror på om det du behöver bygga är ett besluts lager eller en språklig förmåga. Det är olika projekt med olika tidplaner.

Vad varje modell ger dig

Intern-Decision-0.8B levereras som ett fungerande system. Repositoriet inference innehåller DecisionEngine, ett beslutschema och ett genomarbetat exempel som du kan köra efter att ha installerat fyra låsta Python-beroenden. Du anger ett tillstånd, en till sexton namngivna frågor med upp till 62 alternativ vardera, och eventuellt upp till åtta bilder, och du får tillbaka en kalibrerad fördelning plus en argmax-etikett per fält. Motorn läser logits vid fasta positioner i en förrenderad stomme i stället för att generera något, så det finns inget avkodningssteg, inga utdatatokens och ingen JSON att reparera. Det körs från ungefär 1,73 GB filer.

LFM2.5 2.6B Base ger dig motsatsen: rå kapacitet utan gränssnitt. Det är en textbaserad kausal språkmodell med 30 lager ordnade som 22 dubbelgrindade kortkonvolutionsblock och 8 grupperade query-attention-lager, förtränad på cirka 34 biljoner token över 16 språk, med en vokabulär på 128 000 token och ett kontextfönster på 131 072 token. Den har ingen egen instruktionsträning och inga uppgiftsbenchmarker på kortet, eftersom en bascheckpoint inte poängsätts – det är modellerna du tränar från den som poängsätts. Liquids egen efterträningspipeline är det som förvandlar den till den agentiska LFM2.5-2.6B, och den pipelinen är det du ombeds reproducera, delvis eller i sin helhet, för din egen domän.

Så axeln är inte storlek. Det är huruvida den saknade delen är ett beslutskontrakt eller en träningskörning.

Resultattavlan, med förbehållen bifogade

• Tid till första resultat — Intern-Decision-0.8B: en eftermiddag, att ladda en checkpoint och anropa predict()/. LFM2.5 2.6B Base: hur länge din fortsatta förträning eller SFT-körning än tar, plus dataarbetet för att förbereda den.

• Parametrar — Intern-Decision-0.8B: 852 985 920 fördelade över en språk-shard på 1,50 GB, en vision-shard på 176 MB och en projektor på 25 MB. LFM2.5 2.6B Base: 2,69B, ungefär 2,5 GB vikter.

• Indatamodaliteter — Intern-Decision-0.8B: text plus upp till åtta bilder, med visionsvikter som finns i repot. LFM2.5 2.6B Base: endast text, avsiktligt — det multimodala arbetet i LFM2.5-familjen finns i VL-varianterna.

• Praktisk kontext – Intern-Decision-0.8B: 8 192 tokens, avvisas i stället för att trunkeras, trots en maximal positionsinbäddning på 262 144 i konfigurationen. LFM2.5 2.6B Base: 131 072 tokens inbyggt.

• Utdata — Intern-Decision-0.8B: en kalibrerad sannolikhetsfördelning och en argmax-etikett per fält, deterministisk. LFM2.5 2.6B Base: fortsatt text, samplad.

• Benchmarks — Intern-Decision-0.8B: en fullständig leverantörstabell över sju benchmarks, inte reproducerad av någon. LFM2.5 2.6B Base: inga publicerade för själva basen, avsiktligt.

• Licens — Intern-Decision-0.8B: Apache 2.0, med en bevarad LICENSE-QWEN/ för uppströmsvikterna. LFM2.5 2.6B Base: LFM Open License v1.0.

A two-column scoreboard comparing Intern-Decision-0.8B with LFM2.5 2.6B Base on six shared rows: parameters 852,985,920 against 2.69B in about 2.5 GB, what you get a working engine and a documented schema against raw pre-trained weights with no interface, time to first result an afternoon against a continued pre-training or SFT run, input text plus up to eight images against text only with a 131,072-token context, benchmarks a vendor table unreproduced against none published for the base, and licence Apache 2.0 plus LICENSE-QWEN against the LFM Open License v1.0 and its $10M threshold.

Licensraden förtjänar ett eget avsnitt

Båda korten säger "öppen", och de två orden betyder väsentligt olika saker. Intern-Decision-0.8B är Apache 2.0 – inget intäktsvillkor, ingen begränsning av användningsområde, inget separat kommersiellt beviljande att förhandla om. Den andra licensfilen i arkivet är Qwen-licensen som förs vidare eftersom modellen är ett derivat av Qwen3.5-0.8B, vilket är korrekt hantering snarare än en begränsning.

LFM2.5 2.6B Base levereras under LFM Open License v1.0, och avsnitt 5 i den licensen är värt att läsa i sin helhet innan någon kommersiell plan hänger på det. De rättigheter som beviljas för kommersiell användning är villkorade av att du eller din juridiska person inte överskrider en tröskel som i licensen definieras som en årlig omsättning på 10 miljoner amerikanska dollar eller mer. Över den gränsen är kommersiell användning av verket eller ett derivat inte licensierad enligt avtalet. Ideell och forskningsmässig användning är undantagen. Det är en verklig och verkställbar gräns, och eftersom den även fäster vid derivatverk fortplantar den sig till allt du finjusterar från basen – vilket är hela det avsedda användningsområdet för den här checkpointen.

Det finns en rättfram tolkning här: om du bygger kommersiellt och din enhet passerar 10 miljoner dollar i årlig intäkt är LFM2.5 2.6B Base inte samma typ av tillgång som Intern-Decision-0.8B, oavsett hur de två presterar. Om du ligger under tröskeln, forskar eller finjusterar för ett icke-kommersiellt syfte, spelar distinktionen ingen roll. Hur som helst är det en fråga att besvara före träningskörningen, inte efter.

Där var och en faktiskt är rätt nedladdning

LFM2.5 2.6B Base är rätt val när den förmåga du behöver ännu inte finns i en färdig modell. Liquids kort listar de avsedda fallen uttryckligen: språkspecifika assistenter som japanska, domänspecifika assistenter som medicinska, träning på proprietär data som du inte kan skicka till ett API, eller experimenterande med nya metoder för efterträning. Resonemanget bakom listan är att 34 biljoner tokens flerspråkig förträning är dyrt att återskapa och nästan gratis att ärva — du köper en startpunkt som redan är kompetent inom 16 språk och en 128K-kontext, och lägger din egen beräkningskraft på den del som är specifik för dig.

Ekosystemstödet för den planen är ovanligt komplett för en så här ny modell. Liquid dokumenterar fortsatt förträning, SFT, DPO och GRPO via Unsloth och TRL, med notebookar för var och en, och checkpointen stöds av Transformers, vLLM, SGLang, llama.cpp, MLX och LM Studio. Det är inte marknadsföringstext – det är skillnaden mellan en basmodell du kan finjustera den här veckan och en som du lägger två veckor på att limma in i en tränare.

Intern-Decision-0.8B är rätt val när den förmåga du behöver redan finns och problemet är dess form. Om din uppgift är ett avgränsat beslut med en sluten svarsmängd – dirigera detta ärende, poängsätt detta krav, klassificera denna post mot en bedömningsmall – då är en generativ modell ett besvärligt sätt att få en etikett, och en basmodell är inte ett sätt att få en över huvud taget. Det du vill ha är något som returnerar fördelningen, anger sin konfidens och gör det på samma 34 millisekunder varje gång. InternLM:s uppmätta latens på ett enda RTX 4090 är 33,98 ms i medelvärde med en p95 på 37,50 ms, och kortets egna siffror visar 2B-syskonet på 33,28 ms i medelvärde – en påminnelse om att vid dessa promptlängder är kostnaden att läsa schemat, inte att köra vikterna.

Det du gör är att byta flexibilitet mot ett kontrakt. En basmodell kan så småningom bli vad som helst, om du har data och beräkningskraft. Ett beslutshuvud är redan det, och det kommer aldrig att bli något annat. Om ditt schema ändrar form varje månad är det en verklig kostnad. Om det inte gör det är det inte en kostnad alls.

Vad ingen kan berätta för dig om Intern-Decision-tabellen

Alla prestandasiffror för Intern-Decision-0.8B är rapporterade av leverantören, och förbehållet här är tyngre än vanligt eftersom utgåvan är en vecka gammal och helt odokumenterad. Det finns ingen artikel, ingen samling som samlar de tre storlekarna, inget fungerande GitHub-repositorium och ingen oberoende utvärdering. En sökning på Artificial Analysis ger inga träffar för modellen.

InternLM valde benchmarkarna, valde jämförelsemodellerna — en uppsättning dominerad av beslutsmodeller, inklusive TypeSafes Jev, Convais Laya och Kev — och publicerade tabellen utan ett lanseringsinlägg.

A screenshot of the Hugging Face model card for internlm/Intern-Decision-0.8B, showing the tags image-text-to-text, Transformers, Safetensors, qwen3_5, decision-making, multimodal and conversational, an Apache-2.0 licence, a model size of 0.9B params in F32-BF16, a seven-file repository, and a model tree naming Qwen/Qwen3.5-0.8B-Base as the base model. The card text reads that Intern-Decision-0.8B is 'a multimodal structured decision model fine-tuned from Qwen3.5-0.8B' which 'accepts a shared state, a schema of named questions, and optional images, and returns an answer distribution for every question in one model forward pass', followed by a three-step 'How inference works' list.

Med den etiketten fäst är formen fortfarande värd att läsa. Intern-Decision-0.8B får 97,92 / 80,56 / 52,25 över de tre Jevbench-delningarna, 77,35 på Typed Decision och 94,52 på ToolACE, i genomsnitt 79,38. Dess kalibreringsprofil är den mest intressanta posten: ett Brier på 0,530 och ett förväntat kalibreringsfel på 0,066, vilket är en bättre ECE än Jevs 0,095 trots ett sämre Brier. I klartext är den mindre träffsäker men mer ärlig om hur träffsäker den är, och för ett tröskelbaserat arbetsflöde spelar den ordningen större roll än genomsnittet. Kolumnen som borde stoppa en driftsättning är WildJailBreak på 64,48 mot Jevs 96,29. Ett så stort underskott i vägransrobusthet är en egenskap hos finjusteringen, och huruvida det beror på basmodellen Qwen3.5-0.8B, målfunktionen för beslutsfinjusteringen eller parameterantalet dokumenteras ingenstans på modellkortet.

Jämförelsen mot LFM2.5 2.6B Base på den här axeln handlar inte om "vem som får högre poäng", eftersom basen inte har några poäng. Det handlar om att den ena modellens siffror är ogranskade och den andra modellens siffror inte existerar, och en läsare som väljer mellan dem väljer vilken sorts okänd att arbeta med.

Den pipeline som de flesta faktiskt till slut bygger

Det finns en konfiguration som använder båda, och den är värd att namnge eftersom det är där de flesta produktionssystem hamnar. Beslutslagret hanterar de slutna anropen – triage, routning, poängsättning enligt bedömningsmatris – där svarsmängden är känd, latensen ackumuleras över en miljon poster och utdatatokens är ren overhead. Språklagret hanterar allt som kräver prosa, syntes eller lång kontext: eskaleringssammanfattningen, förklaringen som bifogas etiketten, utkastet som en människa redigerar. LFM2.5 2.6B Base är ett rimligt substrat för den andra halvan om du har domändata som är värda att träna på; ett beslutshuvud är den naturliga formen för den första.

Att komponera de två är den knepiga delen, och det är den delen som är värd att inte bygga för hand. OrcaRouters routing-DSL uttrycker routing som kod — YAML med CEL-villkor, driftsatt utan att behöva driftsättas om — så en pipeline som skickar en klass av förfrågningar till en beslutsendpoint och en annan till en språkmodell är en routingregel snarare än en lastbalanserare som du underhåller själv. Gatewayen täcker 200+ modeller bakom en enda OpenAI-kompatibel nyckel med leverantörens listpris vidarebefordrat utan påslag, och den lägger inte till något påslag på modellen du väljer. För att vara exakt om gränsdragningen: varken Intern-Decision-0.8B eller LFM2.5 2.6B Base är en av våra egna — båda är checkpoints som du laddar ner och kör lokalt, och i båda fallen är det själva poängen, eftersom anledningen att välja en 2 GB-modell är att den körs där dina data redan finns. Vad en gateway är till för är den halvan av stacken som du annars skulle anropa.

Om beslutslagret är den del du vill testa utan att binda en träningskörning till det, är en hostad beslutsmodell det billigare experimentet, och TypeSafes Jev 1.13 är den som InternLM benchmarkade mot — anropbar idag via en enda OpenAI-kompatibel endpoint för $0,042 per miljon indata-tokens med utdata fakturerad till noll.

A screenshot of the OrcaRouter model page for typesafe/jev-1.13, dated 2026-09-24, showing a 65K token context, text input and text output, a P95 time to first token of 170 ms, and list pricing of $0.042 per million input tokens with no output rate. The description reads that Jev is TypeSafe's structured decision and evaluation model, taking a state and a set of named questions (noul, choice, score) and returning a structured answer for each, served non-streaming via POST /v1/systemone. A performance panel lower down reports a P50 time to first token of 178 ms and an output speed of 569 tokens per second.

Vilken då?

Välj LFM2.5 2.6B Base om förmågan ännu inte finns och du har både domändata och aptiten för en finjusteringskörning, och kontrollera intäktströskeln på $10M i LFM Open License innan du bygger kommersiellt på den. Välj Intern-Decision-0.8B om förmågan finns, svaren redan är uppräkningsbara i din prompt, och det du behöver är ett snabbt, deterministiskt, licensmässigt rent sätt att få etiketten – samtidigt som du accepterar att dess dokumentation saknas, att dess benchmarks är ogranskade och att dess vägransbeteende vid adversariella indata inte har testats av någon utanför labbet som finjusterade den. Den andra är den kortare vägen och den större okändheten. Den första är den längre vägen och den mer dokumenterade, och inget av dessa faktum är samma sak som bättre.