
Solar Mini 4 vs LFM2.5 2.6B Base: drie keer de index, en een kostenvergelijking die niet bestaat
- openaiNIEUWOpenAI: GPT-6.1 Sol2026-09-29$2.00 / $10.00 per 1 mln tokens
- anthropicNIEUWAnthropic: Claude Sonnet 5.52026-09-28$2.00 / $10.00 per 1 mln tokens · 159 tok/s
- typesafeNIEUWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 mln tokens · 220 tok/s
- OpenAINIEUWOpenAI: GPT-6 Luna2026-09-2238Intelligentie
- OpenAINIEUWOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- AnthropicNIEUWAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- xAINIEUWGrok 4.72026-09-2146Intelligentie
- OrcaNIEUWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 mln tokens · 118 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 mln tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 102 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 217 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
De eerlijke manier om Solar Mini 4 en LFM2.5 2.6B Base te vergelijken, is vooraf toe te geven dat ze niet in dezelfde markt zitten. Solar Mini 4 is Upstage's sparse mixture-of-experts met 35 miljard parameters, uitgebracht op 22 september 2026, die ongeveer 3 miljard parameters per token activeert, propriëtair is en gefactureerd wordt tegen $0,10 per miljoen inputtokens en $0,40 per miljoen output. LFM2.5 2.6B Base is Liquid AI's vooraf getrainde checkpoint met 2,69 miljard parameters, begin augustus 2026 gepubliceerd op Hugging Face onder de LFM Open License v1.0, klein genoeg om in het geheugen van een telefoon te passen. De een is een endpoint. De ander is een gewichtsbestand, en als je dit leest omdat je een model wilt draaien in plaats van er een aan te roepen, is de vergelijking al voorbij.
Wat de combinatie toch een artikel waard maakt, is de ene dimensie waarin ze echt overlappen: beide zijn tegen dezelfde onafhankelijke maatstaf afgezet, en de vorm van die vergelijking is niet wat de parameteraantallen voorspellen. Artificial Analysis geeft Solar Mini 4 een score van 24 op de Intelligence Index v4.3.2 en beoordeelt de LFM2.5 2.6B-generatie op 8.4 — maar het tweede cijfer is een schatting, en het meet niet het checkpoint in de titel van dit artikel. Beide voorbehouden doen ertoe, en ze zijn het eerste dat moet worden uitgezocht.
Het specificatieblad, naast elkaar
• Parameters — Solar Mini 4 heeft 35B totaal met 3B actief; LFM2.5 2.6B Base is dense op 2,69B, zonder iets achter te houden. Dertien keer zoveel gewichten aan de Upstage-kant voor ongeveer hetzelfde rekenbudget per token.
• Architectuur— Solar Mini 4 is een sparse mixture-of-experts. LFM2.5 2.6B Base heeft 30 lagen, waarvan 22 double-gated short-convolutionblokken en 8 grouped-query attention, het hybride ontwerp dat Liquid bouwde voor CPU- en edge-inferentie.
• Training — Upstage publiceert geen tokenbudget. De kaart van Liquid documenteert 34 biljoen tokens en een vocabulaire van 128.000 tokens verdeeld over 16 talen, waaronder Koreaans en Japans.
• Licentie — Solar Mini 4 is propriëtair. LFM2.5 2.6B Base valt onder de LFM Open License v1.0 — permissief voor commercieel gebruik onder voorwaarden, en fine-tunebaar.
• Context — Upstage documenteert 512K tokens, Artificial Analysis vermeldt 1,05M voor hetzelfde model, dus beschouw het plafond als onbeslist. LFM2.5 2.6B Base draait op 131.072.
• Modaliteit — beide zijn tekst-in, tekst-uit. Geen van beide verwerkt afbeeldingen of audio.
• Prijs — Solar Mini 4 voor $0.10 / $0.01 gecachet / $0.40 per miljoen tokens, momenteel 50% korting tot 22 oktober 2026. LFM2.5 2.6B Base heeft helemaal geen tariefkaart; de host Artificial Analysis registreert de prijzen van de LFM2.5 2.6B-generatie op $0.00.
Wat "8.4, geschat" wel en niet meet

De vermelding van Artificial Analysis voor de LFM2.5 2.6B-generatie — het post-getrainde model, niet de voorgetrainde Base — heeft een index van 8,4 die als schatting is gemarkeerd, waarbij de meeste van de bijbehorende componentevaluaties op dezelfde manier zijn gemarkeerd. Dat is een positie op een ranglijst, geen specificatie om op te bouwen, en het mag nooit worden aangehaald alsof iemand het Base-checkpoint door de suite heeft gehaald. Niemand heeft dat gedaan. De eigen modelkaart van Liquid publiceert helemaal geen benchmarktabel voor LFM2.5 2.6B Base: het is een voorgetraind checkpoint voor tekstaanvulling, en de kaart zegt ronduit dat het alleen wordt aanbevolen voor zware fine-tuning.
Het gescoorde broertje is een ander artefact. De benchmarktabel van Liquid voor de post-getrainde LFM2.5 2.6B toont IFStruct op 85,5 en Multi-IF op 80,1, AIME25 op 51,9, LiveCodeBench v6 op 59,4, BFCLv4 op 56,9 en τ³-Banking op 5,7 — allemaal door de leverancier uitgevoerd, allemaal op de instructie-afgestemde build, en het τ³-cijfer is het cijfer dat als een waarschuwing klinkt.
Het profiel van Solar Mini 4 heeft een heel andere vorm. Het scoort 83,3% op AA-LCR v1.1 voor redeneren met een lange context, 47,6% op SciCode en −10,8 op AA-Omniscience, met 18,4% nauwkeurigheid en een niet-hallucinatiepercentage van 64,2%. Het scoort ook 1% op Terminal-Bench 4.0 en 22,3% op AutomationBench-AA. Beide families zijn zwak in agentisch werk; het model van Upstage is zwak in agentisch werk én duur, en dat is een slechtere positie dan zwak zijn in agentisch werk terwijl het gratis is.
Waar Solar Mini 4 zijn prijs waarmaakt, is de schaal van redeneren. Bij 88.300 outputtokens per indextaak — waarvan 71.600 voor redeneren — besteedt het rekenkracht op een manier die een 2,6B dense model niet kan imiteren door een langere prompt te krijgen. Tegen een model met 2,69B parameters kun je zeggen dat het stap voor stap moet denken; je kunt niet zeggen dat het 35B parameters heeft. Dat is het eigenlijke product.
Drie keer de index, en geen vergelijkbaar kostencijfer
Artificial Analysis zet Solar Mini 4 op $0,36 per voltooide indextaak tegenover $0,006 voor Granite 4.2 3B, en de LFM2.5 2.6B-generatie kost nul, dus er bestaat geen kosten-per-taakcijfer dat hiervan een eerlijke verhouding zou maken. De framing "Solar Mini 4 kost veel meer dan LFM2.5 2.6B Base" is daarom waar en ietwat naast de kwestie. De relevante vraag is of het Koreaansstalige, langdocumentige, gestructureerde extractiewerk waarvoor Solar Mini 4 is gebouwd, überhaupt kan worden gedaan door een vooraf getrainde checkpoint van 2,69B. Meestal kan dat niet, en dan wordt de vergelijking Solar Mini 4 versus een frontier-generalist in plaats van Solar Mini 4 versus een telefoonmodel.
Het geval waarin LFM2.5 2.6B Base wint, is niet het geval waarin hij goedkoper is. Het is het geval waarin de taak smal genoeg is dat fine-tuning het gat dicht. Gestructureerde veldextractie uit een bekend documentformaat, classificatie tegen een vaste taxonomie, een on-device assistent die zonder netwerk moet kunnen werken — dat zijn taken waarin een checkpoint van 2,69B plus je eigen trainingsdata een 35B-generalist plus een tariefkaart verslaat, en een GPU-instance kost in plaats van een tokenmeter. Liquid levert het base-checkpoint met continued-pretraining-, LoRA SFT-, DPO- en GRPO-recepten via Unsloth en TRL precies voor die beweging.
Wie te bellen
Kies Solar Mini 4 wanneer de invoer lang is, over de uitvoer moet worden geredeneerd en de taalmix Koreaans of Japans bevat — en wanneer zeven minuten decoderen per moeilijke taak acceptabel is. Kies LFM2.5 2.6B Base wanneer de gewichten van jou moeten zijn, het apparaat geen netwerk heeft en de taak smal genoeg is om te fine-tunen. De interessante implementaties gebruiken beide, want ze zijn geen alternatieven: een klein lokaal model doet de routering, redactie en extractie, en een gehost model wordt alleen aangeroepen voor het deel van de aanvragen dat daadwerkelijk 35B parameters nodig had.
Het model van Liquid staat niet op OrcaRouter, en dat van Upstage ook niet, dus geen van beide routes is iets wat we je kunnen verkopen. Wat we wel kunnen doen, is het deel dat deze vergelijking van een beslissing verandert in een configuratie: meer dan 200 modellen achter één sleutel met 0% opslag bovenop de adviesprijs van de provider, met automatische failover tussen providers en een routing-DSL waarmee je meerdere modellen tot één aanroep kunt samenstellen. Wanneer het juiste antwoord "de goedkope meestal en de goede wanneer het ertoe doet" is, is dat een routeringsprobleem, en dat is de reden dat de routing-DSL bestaat.

Het getal dat geen van beide leveranciers op een dia zal zetten
Latentie. Solar Mini 4 verbruikt 88.300 outputtokens per taak van de Intelligence Index bij een gemeten 204 tokens per seconde, dus het kwam gemiddeld uit op 430 seconden — iets meer dan zeven minuten — per moeilijke taak. De LFM2.5 2.6B-generatie draaide op de host die Artificial Analysis testte op 45,7 tokens per seconde met een wachttijd van 2,8 seconden voor de eerste chunk, maar dat is een datacenterhost die praat met een model dat normaal op je bureau zou draaien. Liquids eigen metingen plaatsen dezelfde architectuur op 220 tokens per seconde op een M5 Max, 113 op een Ryzen AI Max+ 395, en ongeveer 30 tokens per seconde op een telefoon — wat een bruikbare agent-loop oplevert op een apparaat zonder netwerk.
Als je workload interactief is, komt de vergelijking niet eens in de buurt en geen enkele benchmarkscore zal daar iets aan veranderen. Als je workload batch is en het ding dat wacht een cronjob is, zijn zeven minuten prima en is de redeneerdiepte het waard.

Twee bronnotities tot slot. Elk cijfer van Artificial Analysis hier is de onafhankelijke meting van die organisatie op een gedeelde suite; de LFM2.5 2.6B-index is expliciet een schatting en betreft het post-trained model, niet het hierboven genoemde pretrained Base-checkpoint. Elk cijfer van Liquid AI is de eigen run van de leverancier op de eigen benchmarks van de leverancier, niet gereproduceerd — en het Base-checkpoint zelf heeft helemaal geen gepubliceerde scores, wat een feit over pretrained modellen is en geen kritiek op dit model.
