
Intern-Decision-0.8B vs LFM2.5 2.6B Base: Två sätt att bygga något själv
- typesafeNYTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M tokens · 592 tok/s
- openaiNYOpenAI: GPT-6 Luna2026-09-2237Intelligens
- openaiNYOpenAI: GPT-6 Sol2026-09-2248Intelligens
- anthropicNYAnthropic: Claude Opus 5.52026-09-2258Intelligens
- grokNYGrok 4.72026-09-2146Intelligens
- OrcaNYOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M tokens · 187 tok/s
- orcaNYOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0540Intelligens72Kodning
Ställ Intern-Decision-0.8B bredvid LFM2.5 2.6B Base, och den ärliga första observationen är att ingen av dem är en produkt i den bemärkelse en köpare vanligtvis avser. Intern-Decision-0.8B är den checkpoint som InternLM laddade upp till Hugging Face den 26 september 2026 helt utan tillkännagivande – en finjustering av Qwen3.5-0.8B med 852 985 920 parametrar som besvarar skrivna frågor och inte avger någon text, släppt under Apache 2.0 med en GitHub-länk som ger 404. LFM2.5 2.6B Base är Liquid AIs förtränade text-checkpoint med 2,69 miljarder parametrar, publicerad den 1 augusti 2026 som grunden för LFM2.5-familjen, och dess eget kort säger att den "endast rekommenderas för uppgifter som kräver omfattande finjustering." Den ena är färdig och snäv. Den andra är ofärdig och allmän. Båda förutsätter att det är du som gör arbetet – och arbetet är inte samma arbete.
Den distinktionen är hela jämförelsen, och det är anledningen till att en rättfram spec-tabell skulle vilseleda. Frågan en läsare faktiskt har är "vilken av dessa ska jag ladda ner", och svaret beror på om det du behöver bygga är ett besluts lager eller en språklig förmåga. Det är olika projekt med olika tidplaner.
Vad varje modell ger dig
Intern-Decision-0.8B levereras som ett fungerande system. Repositoriet inference innehåller DecisionEngine, ett beslutschema och ett genomarbetat exempel som du kan köra efter att ha installerat fyra låsta Python-beroenden. Du anger ett tillstånd, en till sexton namngivna frågor med upp till 62 alternativ vardera, och eventuellt upp till åtta bilder, och du får tillbaka en kalibrerad fördelning plus en argmax-etikett per fält. Motorn läser logits vid fasta positioner i en förrenderad stomme i stället för att generera något, så det finns inget avkodningssteg, inga utdatatokens och ingen JSON att reparera. Det körs från ungefär 1,73 GB filer.
LFM2.5 2.6B Base ger dig motsatsen: rå kapacitet utan gränssnitt. Det är en textbaserad kausal språkmodell med 30 lager ordnade som 22 dubbelgrindade kortkonvolutionsblock och 8 grupperade query-attention-lager, förtränad på cirka 34 biljoner token över 16 språk, med en vokabulär på 128 000 token och ett kontextfönster på 131 072 token. Den har ingen egen instruktionsträning och inga uppgiftsbenchmarker på kortet, eftersom en bascheckpoint inte poängsätts – det är modellerna du tränar från den som poängsätts. Liquids egen efterträningspipeline är det som förvandlar den till den agentiska LFM2.5-2.6B, och den pipelinen är det du ombeds reproducera, delvis eller i sin helhet, för din egen domän.
Så axeln är inte storlek. Det är huruvida den saknade delen är ett beslutskontrakt eller en träningskörning.
Resultattavlan, med förbehållen bifogade
• Tid till första resultat — Intern-Decision-0.8B: en eftermiddag, att ladda en checkpoint och anropa predict()/. LFM2.5 2.6B Base: hur länge din fortsatta förträning eller SFT-körning än tar, plus dataarbetet för att förbereda den.
• Parametrar — Intern-Decision-0.8B: 852 985 920 fördelade över en språk-shard på 1,50 GB, en vision-shard på 176 MB och en projektor på 25 MB. LFM2.5 2.6B Base: 2,69B, ungefär 2,5 GB vikter.
• Indatamodaliteter — Intern-Decision-0.8B: text plus upp till åtta bilder, med visionsvikter som finns i repot. LFM2.5 2.6B Base: endast text, avsiktligt — det multimodala arbetet i LFM2.5-familjen finns i VL-varianterna.
• Praktisk kontext – Intern-Decision-0.8B: 8 192 tokens, avvisas i stället för att trunkeras, trots en maximal positionsinbäddning på 262 144 i konfigurationen. LFM2.5 2.6B Base: 131 072 tokens inbyggt.
• Utdata — Intern-Decision-0.8B: en kalibrerad sannolikhetsfördelning och en argmax-etikett per fält, deterministisk. LFM2.5 2.6B Base: fortsatt text, samplad.
• Benchmarks — Intern-Decision-0.8B: en fullständig leverantörstabell över sju benchmarks, inte reproducerad av någon. LFM2.5 2.6B Base: inga publicerade för själva basen, avsiktligt.
• Licens — Intern-Decision-0.8B: Apache 2.0, med en bevarad LICENSE-QWEN/ för uppströmsvikterna. LFM2.5 2.6B Base: LFM Open License v1.0.

Licensraden förtjänar ett eget avsnitt
Båda korten säger "öppen", och de två orden betyder väsentligt olika saker. Intern-Decision-0.8B är Apache 2.0 – inget intäktsvillkor, ingen begränsning av användningsområde, inget separat kommersiellt beviljande att förhandla om. Den andra licensfilen i arkivet är Qwen-licensen som förs vidare eftersom modellen är ett derivat av Qwen3.5-0.8B, vilket är korrekt hantering snarare än en begränsning.
LFM2.5 2.6B Base levereras under LFM Open License v1.0, och avsnitt 5 i den licensen är värt att läsa i sin helhet innan någon kommersiell plan hänger på det. De rättigheter som beviljas för kommersiell användning är villkorade av att du eller din juridiska person inte överskrider en tröskel som i licensen definieras som en årlig omsättning på 10 miljoner amerikanska dollar eller mer. Över den gränsen är kommersiell användning av verket eller ett derivat inte licensierad enligt avtalet. Ideell och forskningsmässig användning är undantagen. Det är en verklig och verkställbar gräns, och eftersom den även fäster vid derivatverk fortplantar den sig till allt du finjusterar från basen – vilket är hela det avsedda användningsområdet för den här checkpointen.
Det finns en rättfram tolkning här: om du bygger kommersiellt och din enhet passerar 10 miljoner dollar i årlig intäkt är LFM2.5 2.6B Base inte samma typ av tillgång som Intern-Decision-0.8B, oavsett hur de två presterar. Om du ligger under tröskeln, forskar eller finjusterar för ett icke-kommersiellt syfte, spelar distinktionen ingen roll. Hur som helst är det en fråga att besvara före träningskörningen, inte efter.
Där var och en faktiskt är rätt nedladdning
LFM2.5 2.6B Base är rätt val när den förmåga du behöver ännu inte finns i en färdig modell. Liquids kort listar de avsedda fallen uttryckligen: språkspecifika assistenter som japanska, domänspecifika assistenter som medicinska, träning på proprietär data som du inte kan skicka till ett API, eller experimenterande med nya metoder för efterträning. Resonemanget bakom listan är att 34 biljoner tokens flerspråkig förträning är dyrt att återskapa och nästan gratis att ärva — du köper en startpunkt som redan är kompetent inom 16 språk och en 128K-kontext, och lägger din egen beräkningskraft på den del som är specifik för dig.
Ekosystemstödet för den planen är ovanligt komplett för en så här ny modell. Liquid dokumenterar fortsatt förträning, SFT, DPO och GRPO via Unsloth och TRL, med notebookar för var och en, och checkpointen stöds av Transformers, vLLM, SGLang, llama.cpp, MLX och LM Studio. Det är inte marknadsföringstext – det är skillnaden mellan en basmodell du kan finjustera den här veckan och en som du lägger två veckor på att limma in i en tränare.
Intern-Decision-0.8B är rätt val när den förmåga du behöver redan finns och problemet är dess form. Om din uppgift är ett avgränsat beslut med en sluten svarsmängd – dirigera detta ärende, poängsätt detta krav, klassificera denna post mot en bedömningsmall – då är en generativ modell ett besvärligt sätt att få en etikett, och en basmodell är inte ett sätt att få en över huvud taget. Det du vill ha är något som returnerar fördelningen, anger sin konfidens och gör det på samma 34 millisekunder varje gång. InternLM:s uppmätta latens på ett enda RTX 4090 är 33,98 ms i medelvärde med en p95 på 37,50 ms, och kortets egna siffror visar 2B-syskonet på 33,28 ms i medelvärde – en påminnelse om att vid dessa promptlängder är kostnaden att läsa schemat, inte att köra vikterna.
Det du gör är att byta flexibilitet mot ett kontrakt. En basmodell kan så småningom bli vad som helst, om du har data och beräkningskraft. Ett beslutshuvud är redan det, och det kommer aldrig att bli något annat. Om ditt schema ändrar form varje månad är det en verklig kostnad. Om det inte gör det är det inte en kostnad alls.
Vad ingen kan berätta för dig om Intern-Decision-tabellen
Alla prestandasiffror för Intern-Decision-0.8B är rapporterade av leverantören, och förbehållet här är tyngre än vanligt eftersom utgåvan är en vecka gammal och helt odokumenterad. Det finns ingen artikel, ingen samling som samlar de tre storlekarna, inget fungerande GitHub-repositorium och ingen oberoende utvärdering. En sökning på Artificial Analysis ger inga träffar för modellen.
InternLM valde benchmarkarna, valde jämförelsemodellerna — en uppsättning dominerad av beslutsmodeller, inklusive TypeSafes Jev, Convais Laya och Kev — och publicerade tabellen utan ett lanseringsinlägg.

Med den etiketten fäst är formen fortfarande värd att läsa. Intern-Decision-0.8B får 97,92 / 80,56 / 52,25 över de tre Jevbench-delningarna, 77,35 på Typed Decision och 94,52 på ToolACE, i genomsnitt 79,38. Dess kalibreringsprofil är den mest intressanta posten: ett Brier på 0,530 och ett förväntat kalibreringsfel på 0,066, vilket är en bättre ECE än Jevs 0,095 trots ett sämre Brier. I klartext är den mindre träffsäker men mer ärlig om hur träffsäker den är, och för ett tröskelbaserat arbetsflöde spelar den ordningen större roll än genomsnittet. Kolumnen som borde stoppa en driftsättning är WildJailBreak på 64,48 mot Jevs 96,29. Ett så stort underskott i vägransrobusthet är en egenskap hos finjusteringen, och huruvida det beror på basmodellen Qwen3.5-0.8B, målfunktionen för beslutsfinjusteringen eller parameterantalet dokumenteras ingenstans på modellkortet.
Jämförelsen mot LFM2.5 2.6B Base på den här axeln handlar inte om "vem som får högre poäng", eftersom basen inte har några poäng. Det handlar om att den ena modellens siffror är ogranskade och den andra modellens siffror inte existerar, och en läsare som väljer mellan dem väljer vilken sorts okänd att arbeta med.
Den pipeline som de flesta faktiskt till slut bygger
Det finns en konfiguration som använder båda, och den är värd att namnge eftersom det är där de flesta produktionssystem hamnar. Beslutslagret hanterar de slutna anropen – triage, routning, poängsättning enligt bedömningsmatris – där svarsmängden är känd, latensen ackumuleras över en miljon poster och utdatatokens är ren overhead. Språklagret hanterar allt som kräver prosa, syntes eller lång kontext: eskaleringssammanfattningen, förklaringen som bifogas etiketten, utkastet som en människa redigerar. LFM2.5 2.6B Base är ett rimligt substrat för den andra halvan om du har domändata som är värda att träna på; ett beslutshuvud är den naturliga formen för den första.
Att komponera de två är den knepiga delen, och det är den delen som är värd att inte bygga för hand. OrcaRouters routing-DSL uttrycker routing som kod — YAML med CEL-villkor, driftsatt utan att behöva driftsättas om — så en pipeline som skickar en klass av förfrågningar till en beslutsendpoint och en annan till en språkmodell är en routingregel snarare än en lastbalanserare som du underhåller själv. Gatewayen täcker 200+ modeller bakom en enda OpenAI-kompatibel nyckel med leverantörens listpris vidarebefordrat utan påslag, och den lägger inte till något påslag på modellen du väljer. För att vara exakt om gränsdragningen: varken Intern-Decision-0.8B eller LFM2.5 2.6B Base är en av våra egna — båda är checkpoints som du laddar ner och kör lokalt, och i båda fallen är det själva poängen, eftersom anledningen att välja en 2 GB-modell är att den körs där dina data redan finns. Vad en gateway är till för är den halvan av stacken som du annars skulle anropa.
Om beslutslagret är den del du vill testa utan att binda en träningskörning till det, är en hostad beslutsmodell det billigare experimentet, och TypeSafes Jev 1.13 är den som InternLM benchmarkade mot — anropbar idag via en enda OpenAI-kompatibel endpoint för $0,042 per miljon indata-tokens med utdata fakturerad till noll.

Vilken då?
Välj LFM2.5 2.6B Base om förmågan ännu inte finns och du har både domändata och aptiten för en finjusteringskörning, och kontrollera intäktströskeln på $10M i LFM Open License innan du bygger kommersiellt på den. Välj Intern-Decision-0.8B om förmågan finns, svaren redan är uppräkningsbara i din prompt, och det du behöver är ett snabbt, deterministiskt, licensmässigt rent sätt att få etiketten – samtidigt som du accepterar att dess dokumentation saknas, att dess benchmarks är ogranskade och att dess vägransbeteende vid adversariella indata inte har testats av någon utanför labbet som finjusterade den. Den andra är den kortare vägen och den större okändheten. Den första är den längre vägen och den mer dokumenterade, och inget av dessa faktum är samma sak som bättre.
