Een hero-titelkaart met de tekst 'Intern-Decision-0.8B vs LFM2.5 2.6B Base', met de ondertitel 'Twee manieren om zelf iets te bouwen', met de badges 'de ene retourneert een distributie' en 'de andere retourneert een trainingsrun', met het OrcaRouter-logo samengevoegd in de hoek.
Guides & Insights

Intern-Decision-0.8B vs LFM2.5 2.6B Base: Twee manieren om zelf iets te bouwen

Auteur

Magnus Corvin

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen →
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Zet Intern-Decision-0.8B naast LFM2.5 2.6B Base en de eerlijke eerste observatie is dat geen van beide een product is in de zin die een koper gewoonlijk bedoelt. Intern-Decision-0.8B is het checkpoint dat InternLM op 26 september 2026 zonder enige aankondiging naar Hugging Face heeft geüpload — een fine-tune van Qwen3.5-0.8B met 852.985.920 parameters die getypte vragen beantwoordt en geen tekst produceert, uitgebracht onder Apache 2.0 met een GitHub-link die een 404 geeft. LFM2.5 2.6B Base is het voorgetrainde tekstcheckpoint van Liquid AI met 2,69 miljard parameters, geplaatst op 1 augustus 2026 als basis voor de LFM2.5-familie, en de eigen modelkaart zegt dat het "alleen wordt aanbevolen voor taken waarvoor zware fine-tuning nodig is." De een is voltooid en smal. De ander is onvoltooid en algemeen. Beide gaan ervan uit dat jij degene bent die het werk doet — en het werk is niet hetzelfde werk.

Dat onderscheid is de hele vergelijking, en het is de reden waarom een simpele specificatietabel misleidend zou zijn. De vraag die een lezer eigenlijk heeft, is "welke van deze moet ik downloaden?", en het antwoord hangt ervan af of het ding dat je moet bouwen een beslissingslaag of een taalcapaciteit is. Dat zijn verschillende projecten met verschillende tijdlijnen.

Wat elk model je geeft

Intern-Decision-0.8B arriveert als een werkend systeem. De repository levert inference.py/, een DecisionEngine/ klasse, een gedocumenteerd aanvraagschema en een antwoordschema, en een uitgewerkt voorbeeld dat je kunt uitvoeren na het installeren van vier vastgepinde Python-afhankelijkheden. Je levert een toestand aan, één tot zestien benoemde vragen met elk maximaal 62 opties, en optioneel maximaal acht afbeeldingen, en je krijgt een gekalibreerde distributie terug plus een argmax-label per veld. De engine leest logits op vaste posities in een vooraf gerenderd skelet in plaats van iets te genereren, dus er is geen decoderingsstap, geen uitvoertokens en geen JSON om te repareren. Hij draait op ongeveer 1,73 GB aan bestanden.

LFM2.5 2.6B Base geeft je het tegenovergestelde: ruwe capaciteit zonder interface. Het is een puur tekstueel causaal taalmodel met 30 lagen, ingedeeld als 22 dubbel-gegate short-convolution-blokken en 8 grouped-query-attention-lagen, vooraf getraind op ongeveer 34 biljoen tokens in 16 talen, met een vocabulaire van 128.000 tokens en een contextvenster van 131.072 tokens. Het heeft zelf geen instruction tuning en geen taakbenchmarks op de kaart, omdat een basis-checkpoint niet wordt gescoord — de modellen die je erop traint wel. Liquid's eigen post-training-pijplijn is wat er het agentische LFM2.5-2.6B van maakt, en die pijplijn is precies hetgeen je wordt gevraagd om, gedeeltelijk of volledig, voor je eigen domein te reproduceren.

Dus de as is niet grootte. Het is of het ontbrekende stuk een beslissingscontract of een trainingsrun is.

Het scorebord, met de bijbehorende kanttekeningen

• Tijd tot eerste resultaat — Intern-Decision-0.8B: een middag, een checkpoint laden en het aanroepen van predict()/. LFM2.5 2.6B Base: hoe lang je voortgezette pre-training of SFT-run ook duurt, plus het datawerk om die voor te bereiden.

• Parameters — Intern-Decision-0.8B: 852.985.920 verdeeld over een taalshard van 1,50 GB, een visionshard van 176 MB en een projector van 25 MB. LFM2.5 2.6B Base: 2,69 miljard, ongeveer 2,5 GB aan gewichten.

• Invoermodaliteiten — Intern-Decision-0.8B: tekst plus maximaal acht afbeeldingen, met visiegewichten aanwezig in de repo. LFM2.5 2.6B Base: alleen tekst, bewust — het multimodale werk in de LFM2.5-familie zit in de VL-varianten.

• Praktische context — Intern-Decision-0.8B: 8.192 tokens, afgewezen in plaats van afgekapt, ondanks een maximale positie-embedding van 262.144 in de config. LFM2.5 2.6B Base: 131.072 native tokens.

• Uitvoer — Intern-Decision-0.8B: een gekalibreerde kansverdeling en een argmax-label per veld, deterministisch. LFM2.5 2.6B Base: vervolgtekst, gesampled.

• Benchmarks — Intern-Decision-0.8B: een volledige leverancierstabel over zeven benchmarks, door niemand gereproduceerd. LFM2.5 2.6B Base: geen enkele gepubliceerd voor de base zelf, bewust.

• Licentie — Intern-Decision-0.8B: Apache 2.0, met een behouden LICENSE-QWEN/ voor de upstream-gewichten. LFM2.5 2.6B Base: LFM Open License v1.0.

A two-column scoreboard comparing Intern-Decision-0.8B with LFM2.5 2.6B Base on six shared rows: parameters 852,985,920 against 2.69B in about 2.5 GB, what you get a working engine and a documented schema against raw pre-trained weights with no interface, time to first result an afternoon against a continued pre-training or SFT run, input text plus up to eight images against text only with a 131,072-token context, benchmarks a vendor table unreproduced against none published for the base, and licence Apache 2.0 plus LICENSE-QWEN against the LFM Open License v1.0 and its $10M threshold.

De licentierij verdient een eigen sectie.

Beide kaarten zeggen "open", en die twee woorden betekenen wezenlijk verschillende dingen. Intern-Decision-0.8B is Apache 2.0 — geen omzetvoorwaarde, geen beperking van het gebruiksgebied, geen afzonderlijke commerciële licentieverlening om over te onderhandelen. Het tweede licentiebestand in de repository is de Qwen-licentie die is overgenomen omdat het model een afgeleide is van Qwen3.5-0.8B, wat de juiste behandeling is in plaats van een beperking.

LFM2.5 2.6B Base wordt uitgebracht onder de LFM Open License v1.0, en sectie 5 van die licentie is het waard om volledig te lezen voordat enig commercieel plan erop steunt. De rechten die voor Commercieel Gebruik worden verleend, zijn eraan onderworpen dat u of uw juridische entiteit een drempel niet overschrijdt die in de licentie is gedefinieerd als een jaarlijkse omzet van 10 miljoen Amerikaanse dollar of meer. Boven die grens valt commercieel gebruik van het werk of een afgeleide niet onder de licentie van de overeenkomst. Gebruik voor non-profit en onderzoek is uitgezonderd. Dat is een echte en afdwingbare grens, en omdat die ook aan afgeleide werken verbonden is, strekt die zich uit tot alles wat u vanaf de basis fine-tunet — wat het volledige beoogde gebruik van dit checkpoint is.

Er is hier een eenvoudige lezing: als je commercieel bouwt en je entiteit overschrijdt $10M aan jaarlijkse omzet, dan is LFM2.5 2.6B Base niet hetzelfde soort activum als Intern-Decision-0.8B, ongeacht hoe de twee presteren. Als je onder de drempel zit, onderzoek doet of fine-tunet voor een niet-commercieel doel, speelt dat onderscheid geen rol. Hoe dan ook is het een vraag die je vóór de trainingsrun moet beantwoorden, niet erna.

Waar elk ervan daadwerkelijk de juiste download is

LFM2.5 2.6B Base is de juiste keuze wanneer de capaciteit die je nodig hebt nog niet bestaat in een afgerond model. De kaart van Liquid somt de beoogde gevallen expliciet op: taalspecifieke assistenten zoals Japans, domeinspecifieke assistenten zoals medisch, trainen op propriëtaire data die je niet naar een API kunt sturen, of experimenteren met nieuwe post-training-benaderingen. De redenering achter die lijst is dat 34 biljoen tokens aan meertalige pre-training duur zijn om te reproduceren en bijna gratis om te erven — je koopt een startpunt dat al competent is in 16 talen en een context van 128K, en besteedt je eigen rekenkracht aan het deel dat specifiek voor jou is.

De ecosysteemondersteuning voor dat plan is ongewoon compleet voor een model dat zo nieuw is. Liquid documenteert vervolgpretraining, SFT, DPO en GRPO via Unsloth en TRL, met notebooks voor elk, en de checkpoint wordt ondersteund door Transformers, vLLM, SGLang, llama.cpp, MLX en LM Studio. Dat is geen marketingtekst — het is het verschil tussen een basismodel dat je deze week kunt fine-tunen en een model waaraan je twee weken besteedt om het in een trainer te lijmen.

Intern-Decision-0.8B is de juiste keuze wanneer de capaciteit die je nodig hebt al bestaat en het probleem de vorm ervan is. Als je taak een begrensde beslissing is met een gesloten antwoordverzameling — dit ticket routeren, deze claim scoren, dit record aan de hand van een rubric classificeren — dan is een generatief model een onhandige manier om een label te krijgen, en een basismodel is helemaal geen manier om er een te krijgen. Wat je wilt, is iets dat de distributie retourneert, je de betrouwbaarheid ervan vertelt, en dat elke keer in dezelfde 34 milliseconden doet. De gemeten latentie van InternLM op een enkele RTX 4090 is 33,98 ms gemiddeld met een p95 van 37,50 ms, en de cijfers van de kaart zelf tonen het 2B-broertje op 33,28 ms gemiddeld — een herinnering dat bij deze promptlengtes de kosten zitten in het lezen van het schema, niet in het draaien van de gewichten.

De ruil die je doet, is flexibiliteit voor een contract. Een basismodel kan uiteindelijk alles worden, als je de data en de rekenkracht maar hebt. Een decision head is al het ding zelf, en het zal nooit iets anders worden. Als je schema elke maand van vorm verandert, is dat een echte kostenpost. Als dat niet zo is, is het helemaal geen kostenpost.

Wat niemand je kan vertellen over de Intern-Decision-tafel

Elk prestatiecijfer voor Intern-Decision-0.8B is door de leverancier gerapporteerd, en het voorbehoud is hier zwaarder dan gewoonlijk, omdat de release een week oud en volledig ongedocumenteerd is. Er is geen paper, geen verzameling die de drie groottes samenbrengt, geen werkende GitHub-repository en geen onafhankelijke evaluatie. Een zoekopdracht in Artificial Analysis levert niets op voor het model.

InternLM selecteerde de benchmarks, selecteerde de vergelijkingsmodellen — een set die werd gedomineerd door beslissingsmodellen, waaronder TypeSafe's Jev, Convai's Laya en Kev — en publiceerde de tabel zonder een lanceringsbericht.

A screenshot of the Hugging Face model card for internlm/Intern-Decision-0.8B, showing the tags image-text-to-text, Transformers, Safetensors, qwen3_5, decision-making, multimodal and conversational, an Apache-2.0 licence, a model size of 0.9B params in F32-BF16, a seven-file repository, and a model tree naming Qwen/Qwen3.5-0.8B-Base as the base model. The card text reads that Intern-Decision-0.8B is 'a multimodal structured decision model fine-tuned from Qwen3.5-0.8B' which 'accepts a shared state, a schema of named questions, and optional images, and returns an answer distribution for every question in one model forward pass', followed by a three-step 'How inference works' list.

Met dat label eraan is de vorm nog steeds de moeite van het lezen waard. Intern-Decision-0.8B scoort 97,92 / 80,56 / 52,25 op de drie Jevbench-splits, 77,35 op Typed Decision en 94,52 op ToolACE, met een gemiddelde van 79,38. Het calibratieprofiel is de interessantste vermelding: een Brier van 0,530 en een verwachte calibratiefout van 0,066, wat een betere ECE is dan Jev's 0,095 ondanks een slechtere Brier. In gewone taal: het is minder nauwkeurig, maar eerlijker over hoe nauwkeurig het is, en voor een op drempels gebaseerde workflow is die ordening belangrijker dan het gemiddelde. De kolom die een deployment zou moeten tegenhouden is WildJailBreak op 64,48 tegenover Jev's 96,29. Een zo groot tekort in weigeringsrobuustheid is een eigenschap van de fine-tune, en of dat aan de Qwen3.5-0.8B-basis, de decision-tuningdoelstelling of het aantal parameters ligt, staat nergens op de kaart gedocumenteerd.

De vergelijking met LFM2.5 2.6B Base op deze as is niet "wie scoort hoger", omdat de base geen scores heeft. Het is dat de cijfers van het ene model niet gecontroleerd zijn en de cijfers van het andere model niet bestaan, en een lezer die tussen beide kiest, kiest met wat voor soort onbekende er moet worden gewerkt.

De pipeline die de meeste mensen uiteindelijk daadwerkelijk bouwen

Er is een configuratie die beide gebruikt, en het is de moeite waard die te benoemen, want daar komen de meeste productiesystemen terecht. De beslissingslaag behandelt de gesloten calls — triage, routing, rubriekscoring — waar de antwoordset bekend is, latentie zich opstapelt over een miljoen records, en uitvoertokens pure overhead zijn. De taallaag behandelt alles wat proza, synthese of lange context nodig heeft: de escalatiesamenvatting, de uitleg bij het label, het concept dat een mens bewerkt. LFM2.5 2.6B Base is een plausibel substraat voor de tweede helft als je domeindata hebt die het trainen waard is; een decision head is de natuurlijke vorm van de eerste.

Het samenstellen van de twee is het lastige deel, en dat is nu juist het deel dat je niet zelf wilt bouwen. De routing-DSL van OrcaRouter drukt routing uit als code — YAML met CEL-condities, uitgerold zonder nieuwe deployment — dus een pipeline die de ene klasse verzoeken naar een decision-endpoint stuurt en de andere naar een taalmodel is een routingregel in plaats van een load balancer die je zelf onderhoudt. De gateway ontsluit 200+ modellen achter één OpenAI-compatibele key, met de lijstprijs van de provider doorgegeven zonder opslag, en er komt geen opslag bij op het model dat je kiest. Om precies te zijn over de grens: noch Intern-Decision-0.8B noch LFM2.5 2.6B Base is van ons — beide zijn checkpoints die je downloadt en lokaal draait, en dat is in beide gevallen juist het punt, want de reden om een model van 2 GB te kiezen is dat het draait waar je data al staat. Waar een gateway voor dient, is het deel van de stack waarvoor je anders naar buiten zou moeten bellen.

Als de beslislaag het onderdeel is dat je wilt testen zonder er een trainingsrun aan toe te wijden, dan is een gehost beslismodel het goedkopere experiment, en TypeSafe's Jev 1.13 is het model waartegen InternLM heeft gebenchmarkt — vandaag aanroepbaar via één OpenAI-compatibel endpoint voor $0,042 per miljoen invoertokens, waarbij de output tegen nul wordt gefactureerd.

A screenshot of the OrcaRouter model page for typesafe/jev-1.13, dated 2026-09-24, showing a 65K token context, text input and text output, a P95 time to first token of 170 ms, and list pricing of $0.042 per million input tokens with no output rate. The description reads that Jev is TypeSafe's structured decision and evaluation model, taking a state and a set of named questions (noul, choice, score) and returning a structured answer for each, served non-streaming via POST /v1/systemone. A performance panel lower down reports a P50 time to first token of 178 ms and an output speed of 569 tokens per second.

Welke dan?

Kies LFM2.5 2.6B Base als de capaciteit nog niet bestaat en je zowel de domeindata als de zin hebt om een fine-tuningrun te doen, en controleer de omzetdrempel van $10M in de LFM Open License voordat je er commercieel op voortbouwt. Kies Intern-Decision-0.8B als de capaciteit bestaat, de antwoorden al opsombaar zijn in je prompt, en wat je nodig hebt een snelle, deterministische, licentiezuivere manier is om het label te verkrijgen — in de wetenschap dat de documentatie ontbreekt, de benchmarks niet-geauditeerd zijn en het weigeringsgedrag bij adversariële input door niemand buiten het lab dat het heeft getuned is getest. De tweede is de kortere weg en de grotere onbekende. De eerste is de langere weg en de beter gedocumenteerde, en geen van beide feiten is hetzelfde als beter.