
Intern-Decision-0.8B vs LFM2.5 2.6B Base: Twee manieren om zelf iets te bouwen
- typesafeNIEUWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 mln tokens · 592 tok/s
- openaiNIEUWOpenAI: GPT-6 Luna2026-09-2237Intelligentie
- openaiNIEUWOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- anthropicNIEUWAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- grokNIEUWGrok 4.72026-09-2146Intelligentie
- OrcaNIEUWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 mln tokens · 187 tok/s
- orcaNIEUWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
Zet Intern-Decision-0.8B naast LFM2.5 2.6B Base en de eerlijke eerste observatie is dat geen van beide een product is in de zin die een koper gewoonlijk bedoelt. Intern-Decision-0.8B is het checkpoint dat InternLM op 26 september 2026 zonder enige aankondiging naar Hugging Face heeft geüpload — een fine-tune van Qwen3.5-0.8B met 852.985.920 parameters die getypte vragen beantwoordt en geen tekst produceert, uitgebracht onder Apache 2.0 met een GitHub-link die een 404 geeft. LFM2.5 2.6B Base is het voorgetrainde tekstcheckpoint van Liquid AI met 2,69 miljard parameters, geplaatst op 1 augustus 2026 als basis voor de LFM2.5-familie, en de eigen modelkaart zegt dat het "alleen wordt aanbevolen voor taken waarvoor zware fine-tuning nodig is." De een is voltooid en smal. De ander is onvoltooid en algemeen. Beide gaan ervan uit dat jij degene bent die het werk doet — en het werk is niet hetzelfde werk.
Dat onderscheid is de hele vergelijking, en het is de reden waarom een simpele specificatietabel misleidend zou zijn. De vraag die een lezer eigenlijk heeft, is "welke van deze moet ik downloaden?", en het antwoord hangt ervan af of het ding dat je moet bouwen een beslissingslaag of een taalcapaciteit is. Dat zijn verschillende projecten met verschillende tijdlijnen.
Wat elk model je geeft
Intern-Decision-0.8B arriveert als een werkend systeem. De repository levert inference.py/, een DecisionEngine/ klasse, een gedocumenteerd aanvraagschema en een antwoordschema, en een uitgewerkt voorbeeld dat je kunt uitvoeren na het installeren van vier vastgepinde Python-afhankelijkheden. Je levert een toestand aan, één tot zestien benoemde vragen met elk maximaal 62 opties, en optioneel maximaal acht afbeeldingen, en je krijgt een gekalibreerde distributie terug plus een argmax-label per veld. De engine leest logits op vaste posities in een vooraf gerenderd skelet in plaats van iets te genereren, dus er is geen decoderingsstap, geen uitvoertokens en geen JSON om te repareren. Hij draait op ongeveer 1,73 GB aan bestanden.
LFM2.5 2.6B Base geeft je het tegenovergestelde: ruwe capaciteit zonder interface. Het is een puur tekstueel causaal taalmodel met 30 lagen, ingedeeld als 22 dubbel-gegate short-convolution-blokken en 8 grouped-query-attention-lagen, vooraf getraind op ongeveer 34 biljoen tokens in 16 talen, met een vocabulaire van 128.000 tokens en een contextvenster van 131.072 tokens. Het heeft zelf geen instruction tuning en geen taakbenchmarks op de kaart, omdat een basis-checkpoint niet wordt gescoord — de modellen die je erop traint wel. Liquid's eigen post-training-pijplijn is wat er het agentische LFM2.5-2.6B van maakt, en die pijplijn is precies hetgeen je wordt gevraagd om, gedeeltelijk of volledig, voor je eigen domein te reproduceren.
Dus de as is niet grootte. Het is of het ontbrekende stuk een beslissingscontract of een trainingsrun is.
Het scorebord, met de bijbehorende kanttekeningen
• Tijd tot eerste resultaat — Intern-Decision-0.8B: een middag, een checkpoint laden en het aanroepen van predict()/. LFM2.5 2.6B Base: hoe lang je voortgezette pre-training of SFT-run ook duurt, plus het datawerk om die voor te bereiden.
• Parameters — Intern-Decision-0.8B: 852.985.920 verdeeld over een taalshard van 1,50 GB, een visionshard van 176 MB en een projector van 25 MB. LFM2.5 2.6B Base: 2,69 miljard, ongeveer 2,5 GB aan gewichten.
• Invoermodaliteiten — Intern-Decision-0.8B: tekst plus maximaal acht afbeeldingen, met visiegewichten aanwezig in de repo. LFM2.5 2.6B Base: alleen tekst, bewust — het multimodale werk in de LFM2.5-familie zit in de VL-varianten.
• Praktische context — Intern-Decision-0.8B: 8.192 tokens, afgewezen in plaats van afgekapt, ondanks een maximale positie-embedding van 262.144 in de config. LFM2.5 2.6B Base: 131.072 native tokens.
• Uitvoer — Intern-Decision-0.8B: een gekalibreerde kansverdeling en een argmax-label per veld, deterministisch. LFM2.5 2.6B Base: vervolgtekst, gesampled.
• Benchmarks — Intern-Decision-0.8B: een volledige leverancierstabel over zeven benchmarks, door niemand gereproduceerd. LFM2.5 2.6B Base: geen enkele gepubliceerd voor de base zelf, bewust.
• Licentie — Intern-Decision-0.8B: Apache 2.0, met een behouden LICENSE-QWEN/ voor de upstream-gewichten. LFM2.5 2.6B Base: LFM Open License v1.0.

De licentierij verdient een eigen sectie.
Beide kaarten zeggen "open", en die twee woorden betekenen wezenlijk verschillende dingen. Intern-Decision-0.8B is Apache 2.0 — geen omzetvoorwaarde, geen beperking van het gebruiksgebied, geen afzonderlijke commerciële licentieverlening om over te onderhandelen. Het tweede licentiebestand in de repository is de Qwen-licentie die is overgenomen omdat het model een afgeleide is van Qwen3.5-0.8B, wat de juiste behandeling is in plaats van een beperking.
LFM2.5 2.6B Base wordt uitgebracht onder de LFM Open License v1.0, en sectie 5 van die licentie is het waard om volledig te lezen voordat enig commercieel plan erop steunt. De rechten die voor Commercieel Gebruik worden verleend, zijn eraan onderworpen dat u of uw juridische entiteit een drempel niet overschrijdt die in de licentie is gedefinieerd als een jaarlijkse omzet van 10 miljoen Amerikaanse dollar of meer. Boven die grens valt commercieel gebruik van het werk of een afgeleide niet onder de licentie van de overeenkomst. Gebruik voor non-profit en onderzoek is uitgezonderd. Dat is een echte en afdwingbare grens, en omdat die ook aan afgeleide werken verbonden is, strekt die zich uit tot alles wat u vanaf de basis fine-tunet — wat het volledige beoogde gebruik van dit checkpoint is.
Er is hier een eenvoudige lezing: als je commercieel bouwt en je entiteit overschrijdt $10M aan jaarlijkse omzet, dan is LFM2.5 2.6B Base niet hetzelfde soort activum als Intern-Decision-0.8B, ongeacht hoe de twee presteren. Als je onder de drempel zit, onderzoek doet of fine-tunet voor een niet-commercieel doel, speelt dat onderscheid geen rol. Hoe dan ook is het een vraag die je vóór de trainingsrun moet beantwoorden, niet erna.
Waar elk ervan daadwerkelijk de juiste download is
LFM2.5 2.6B Base is de juiste keuze wanneer de capaciteit die je nodig hebt nog niet bestaat in een afgerond model. De kaart van Liquid somt de beoogde gevallen expliciet op: taalspecifieke assistenten zoals Japans, domeinspecifieke assistenten zoals medisch, trainen op propriëtaire data die je niet naar een API kunt sturen, of experimenteren met nieuwe post-training-benaderingen. De redenering achter die lijst is dat 34 biljoen tokens aan meertalige pre-training duur zijn om te reproduceren en bijna gratis om te erven — je koopt een startpunt dat al competent is in 16 talen en een context van 128K, en besteedt je eigen rekenkracht aan het deel dat specifiek voor jou is.
De ecosysteemondersteuning voor dat plan is ongewoon compleet voor een model dat zo nieuw is. Liquid documenteert vervolgpretraining, SFT, DPO en GRPO via Unsloth en TRL, met notebooks voor elk, en de checkpoint wordt ondersteund door Transformers, vLLM, SGLang, llama.cpp, MLX en LM Studio. Dat is geen marketingtekst — het is het verschil tussen een basismodel dat je deze week kunt fine-tunen en een model waaraan je twee weken besteedt om het in een trainer te lijmen.
Intern-Decision-0.8B is de juiste keuze wanneer de capaciteit die je nodig hebt al bestaat en het probleem de vorm ervan is. Als je taak een begrensde beslissing is met een gesloten antwoordverzameling — dit ticket routeren, deze claim scoren, dit record aan de hand van een rubric classificeren — dan is een generatief model een onhandige manier om een label te krijgen, en een basismodel is helemaal geen manier om er een te krijgen. Wat je wilt, is iets dat de distributie retourneert, je de betrouwbaarheid ervan vertelt, en dat elke keer in dezelfde 34 milliseconden doet. De gemeten latentie van InternLM op een enkele RTX 4090 is 33,98 ms gemiddeld met een p95 van 37,50 ms, en de cijfers van de kaart zelf tonen het 2B-broertje op 33,28 ms gemiddeld — een herinnering dat bij deze promptlengtes de kosten zitten in het lezen van het schema, niet in het draaien van de gewichten.
De ruil die je doet, is flexibiliteit voor een contract. Een basismodel kan uiteindelijk alles worden, als je de data en de rekenkracht maar hebt. Een decision head is al het ding zelf, en het zal nooit iets anders worden. Als je schema elke maand van vorm verandert, is dat een echte kostenpost. Als dat niet zo is, is het helemaal geen kostenpost.
Wat niemand je kan vertellen over de Intern-Decision-tafel
Elk prestatiecijfer voor Intern-Decision-0.8B is door de leverancier gerapporteerd, en het voorbehoud is hier zwaarder dan gewoonlijk, omdat de release een week oud en volledig ongedocumenteerd is. Er is geen paper, geen verzameling die de drie groottes samenbrengt, geen werkende GitHub-repository en geen onafhankelijke evaluatie. Een zoekopdracht in Artificial Analysis levert niets op voor het model.
InternLM selecteerde de benchmarks, selecteerde de vergelijkingsmodellen — een set die werd gedomineerd door beslissingsmodellen, waaronder TypeSafe's Jev, Convai's Laya en Kev — en publiceerde de tabel zonder een lanceringsbericht.

Met dat label eraan is de vorm nog steeds de moeite van het lezen waard. Intern-Decision-0.8B scoort 97,92 / 80,56 / 52,25 op de drie Jevbench-splits, 77,35 op Typed Decision en 94,52 op ToolACE, met een gemiddelde van 79,38. Het calibratieprofiel is de interessantste vermelding: een Brier van 0,530 en een verwachte calibratiefout van 0,066, wat een betere ECE is dan Jev's 0,095 ondanks een slechtere Brier. In gewone taal: het is minder nauwkeurig, maar eerlijker over hoe nauwkeurig het is, en voor een op drempels gebaseerde workflow is die ordening belangrijker dan het gemiddelde. De kolom die een deployment zou moeten tegenhouden is WildJailBreak op 64,48 tegenover Jev's 96,29. Een zo groot tekort in weigeringsrobuustheid is een eigenschap van de fine-tune, en of dat aan de Qwen3.5-0.8B-basis, de decision-tuningdoelstelling of het aantal parameters ligt, staat nergens op de kaart gedocumenteerd.
De vergelijking met LFM2.5 2.6B Base op deze as is niet "wie scoort hoger", omdat de base geen scores heeft. Het is dat de cijfers van het ene model niet gecontroleerd zijn en de cijfers van het andere model niet bestaan, en een lezer die tussen beide kiest, kiest met wat voor soort onbekende er moet worden gewerkt.
De pipeline die de meeste mensen uiteindelijk daadwerkelijk bouwen
Er is een configuratie die beide gebruikt, en het is de moeite waard die te benoemen, want daar komen de meeste productiesystemen terecht. De beslissingslaag behandelt de gesloten calls — triage, routing, rubriekscoring — waar de antwoordset bekend is, latentie zich opstapelt over een miljoen records, en uitvoertokens pure overhead zijn. De taallaag behandelt alles wat proza, synthese of lange context nodig heeft: de escalatiesamenvatting, de uitleg bij het label, het concept dat een mens bewerkt. LFM2.5 2.6B Base is een plausibel substraat voor de tweede helft als je domeindata hebt die het trainen waard is; een decision head is de natuurlijke vorm van de eerste.
Het samenstellen van de twee is het lastige deel, en dat is nu juist het deel dat je niet zelf wilt bouwen. De routing-DSL van OrcaRouter drukt routing uit als code — YAML met CEL-condities, uitgerold zonder nieuwe deployment — dus een pipeline die de ene klasse verzoeken naar een decision-endpoint stuurt en de andere naar een taalmodel is een routingregel in plaats van een load balancer die je zelf onderhoudt. De gateway ontsluit 200+ modellen achter één OpenAI-compatibele key, met de lijstprijs van de provider doorgegeven zonder opslag, en er komt geen opslag bij op het model dat je kiest. Om precies te zijn over de grens: noch Intern-Decision-0.8B noch LFM2.5 2.6B Base is van ons — beide zijn checkpoints die je downloadt en lokaal draait, en dat is in beide gevallen juist het punt, want de reden om een model van 2 GB te kiezen is dat het draait waar je data al staat. Waar een gateway voor dient, is het deel van de stack waarvoor je anders naar buiten zou moeten bellen.
Als de beslislaag het onderdeel is dat je wilt testen zonder er een trainingsrun aan toe te wijden, dan is een gehost beslismodel het goedkopere experiment, en TypeSafe's Jev 1.13 is het model waartegen InternLM heeft gebenchmarkt — vandaag aanroepbaar via één OpenAI-compatibel endpoint voor $0,042 per miljoen invoertokens, waarbij de output tegen nul wordt gefactureerd.

Welke dan?
Kies LFM2.5 2.6B Base als de capaciteit nog niet bestaat en je zowel de domeindata als de zin hebt om een fine-tuningrun te doen, en controleer de omzetdrempel van $10M in de LFM Open License voordat je er commercieel op voortbouwt. Kies Intern-Decision-0.8B als de capaciteit bestaat, de antwoorden al opsombaar zijn in je prompt, en wat je nodig hebt een snelle, deterministische, licentiezuivere manier is om het label te verkrijgen — in de wetenschap dat de documentatie ontbreekt, de benchmarks niet-geauditeerd zijn en het weigeringsgedrag bij adversariële input door niemand buiten het lab dat het heeft getuned is getest. De tweede is de kortere weg en de grotere onbekende. De eerste is de langere weg en de beter gedocumenteerde, en geen van beide feiten is hetzelfde als beter.
