
Ember-1 vs LFM2.5 2.6B Base: Een afgewerkt gedrag tegenover een ruw substraat
- openaiNIEUWOpenAI: GPT-6 Luna2026-09-2237Intelligentie
- openaiNIEUWOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- anthropicNIEUWAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- grokNIEUWGrok 4.72026-09-2146Intelligentie
- OrcaNIEUWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 mln tokens · 177 tok/s
- orcaNIEUWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 1323 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligentie76Coderen
Noch Ember-1, noch LFM2.5 2.6B Base is een model dat je er even bij kunt pakken en kunt gebruiken, en ze zijn om tegenovergestelde redenen onbruikbaar. Ember-1, gepubliceerd door Fireworks Research op 23 september 2026, is een gespecialiseerd derivaat van Kimi K3 van Moonshot AI dat het lab opnieuw heeft getraind om de nauwkeurigheid van K3 te bereiken met ongeveer 40% minder tokens — een afgerond gedrag, alleen beschikbaar als research preview op het eigen serverless platform van de leverancier, zonder gewichten en zonder gepubliceerde prijs. LFM2.5 2.6B Base, gepubliceerd door Liquid AI op 4 augustus 2026, is een vooraf getraind checkpoint met 2,69 miljard parameters onder de LFM Open License v1.0 dat helemaal niet op instructies is afgestemd en je tekst zal voortzetten in plaats van je vraag te beantwoorden — een ruw substraat, vandaag nog te downloaden, bewust onvoltooid. Ze naast elkaar lezen is een goede manier om de twee argumenten te zien die worden aangevoerd over waar efficiëntiewinsten nu vandaan komen.
De vraag die beide modellen beantwoorden
Beide releases gaan uit van hetzelfde uitgangspunt: dat de goedkope winst van het groter maken van een model grotendeels al is behaald, en dat het interessante werk is verschoven naar hoe een model besteedt wat het al heeft. De twee labs antwoorden daar verschillend op. Fireworks Research nam een bestaand frontiermodel en veranderde het gedrag ervan. Liquid AI bouwde vanaf nul een klein model en veranderde de schaal. Geen van beide is een verhaal over een nieuwe architectuur, en geen van beide probeert een leaderboard aan te voeren.
Antwoord van Ember-1: behoud het model, hertrain het gedrag.
Ember-1 laat de architectuur van Kimi K3 met rust en pakt één specifieke inefficiëntie aan. Redeneermodellen kunnen meer dan 90% van hun gegenereerde tokens verbranden aan interne deliberatie, en in een multi-turn agent-loop worden die sporen bij elke volgende beurt opnieuw afgespeeld en opnieuw gefactureerd — Fireworks Research beschrijft de resulterende contextgroei als ruwweg kwadratisch in het aantal beurten. De bewering van het lab is dat de redenering van K3 langer is dan de taak vereist en dat het teveel kan worden verwijderd zonder de antwoorden te veranderen. Het zegt meer dan 50 trainingsexperimenten en meer dan 200 evaluaties te hebben uitgevoerd op zijn eigen serverloze trainingstack, en stelt dat de redeneerlengte met 35–50% daalde zonder verlies van nauwkeurigheid op zeven benchmarks en twee productieverkeersets van klanten. Dat alles is door de leverancier gerapporteerd en niet gereproduceerd.
De resultaten zijn ongelijkmatig op een manier die het kopcijfer verbergt. De tokenreducties van Ember-1 variëren van 51,9% op Terminal Bench 2.1 tot 5,9% op τ-2 Bench Airline. In een productie-codeer-A/B bij een klant daalden de outputtokens van 49,3K naar 29,9K, terwijl de score op 0,753 tegenover 0,751 bleef staan — een verlaging van 71,3% in redeneertokens. Dat is een groot effect op de ene workloadvorm en een vrijwel onzichtbaar effect op een andere, wat je zou verwachten van een model dat is getraind om te stoppen met overdenken in plaats van om minder te denken.

Het antwoord van LFM2.5 2.6B Base: verander de schaal, behoud het recept
LFM2.5 2.6B Base is een ander soort gok. Het is de hybride architectuur van Liquid AI op kleine schaal: 30 lagen, waarvan 22 dual-gated short-convolutionblokken en 8 grouped-query-attentionlagen, getraind op ongeveer 34 biljoen tokens in 16 talen, met een contextvenster van 131.072 tokens. Het hele checkpoint bestaat uit 2,69 miljard dense parameters — klein genoeg dat het gesprek over kosten niet meer over tokens gaat, maar over welke enkele GPU je nog over hebt.
Wat het ongebruikelijk maakt, is wat het bewust niet doet. Er is geen instruction tuning, wat precies het hele punt is van het achtervoegsel "Base": geef het een vraag en het zal tekst in de stijl van de vraag voortzetten in plaats van die te beantwoorden. Liquid AI's eigen modelkaart raadt het aan voor taken die zware fine-tuning vereisen. Er is ook geen gepubliceerde evaluatie van, en dat is geen vergissing — een basis-checkpoint evalueren op benchmarks voor het opvolgen van instructies zou niets meten, omdat het gedrag dat wordt gemeten er nog niet in is getraind.
Het contrast, één regel per dimensie
• Wat het is — Ember-1: een opnieuw getrainde afgeleide van Kimi K3 met verkort redeneren. LFM2.5 2.6B Base: een vanaf nul voorgetrainde checkpoint zonder instructietuning.
• Parameters — Ember-1: niet bekendgemaakt; overgenomen van Kimi K3. LFM2.5 2.6B Base: 2,69 miljard dense.
• Gewichten — Ember-1: niets gepubliceerd. LFM2.5 2.6B Base: beschikbaar onder de LFM Open License v1.0.
• Prijs — Ember-1: niets gepubliceerd; benchmarkdollars gebruiken de tariefkaart van Kimi K3. LFM2.5 2.6B Base: gratis te downloaden; u levert de hardware.
• Context — Ember-1: niet gepubliceerd voor de preview. LFM2.5 2.6B Base: 131.072 tokens.
• Gepubliceerde evaluatie — Ember-1: zeven benchmarks en twee A/B-tests, allemaal door de leverancier uitgevoerd. LFM2.5 2.6B Base: geen, bewust.
• Wat je aan het eind krijgt — Ember-1: een endpoint dat kortere redeneringen produceert met nauwkeurigheid op K3-niveau. LFM2.5 2.6B Base: een startpunt waarvan het gedrag precies is wat je erin traint.
Twee verschillende soorten gemis
De hiaten in deze twee releases lijken symmetrisch en zijn dat niet. Het ontbreken van een evaluatie bij LFM2.5 2.6B Base is een eigenschap van het artefact: een basis-checkpoint heeft geen gedrag om te beoordelen, en het ontbreken van instruction tuning is een gedocumenteerde eigenschap, geen tekortkoming. Het ontbreken ervan veroorzaakt geen commerciële onzekerheid, want wat je koopt is een bestand met een licentie eraan verbonden, en het op te leveren product is compleet op het moment dat de download klaar is.
De ontbrekende stukken van Ember-1 zijn echt onopgelost. Er is geen gepubliceerde prijs, dus de kostenclaim is een rekensom op basis van de tariefkaart van Kimi K3, niet een tarief waarop je kunt budgetteren. Er is geen release van de gewichten, dus het model kan niet langer voortbestaan dan de beslissing van de leverancier om het te blijven aanbieden. En het toegangsvenster wordt beschreven als tijdelijk: Fireworks Research presenteert zijn onderzoeksreleases als serverloze vensters van twee weken waarvan de permanente beschikbaarheid afhangt van de vraag uit de community. Een preview die volgende maand misschien niet meer bestaat, is iets anders dan een preview die slechts onbewezen is, en de tweede klant-A/B in de aankondiging — ongeveer 35% minder tokens per taak — vertelt je wat het lab verwacht, niet wat in november nog steeds bereikbaar zal zijn.
Die asymmetrie is het eerlijke antwoord op de vraag "welke van deze het meest gereed is". Geen van beide is gereed in de zin dat het een drop-in productieafhankelijkheid is. LFM2.5 2.6B Base is voltooid als grondstof en onvoltooid als model. Ember-1 is voltooid als model en onvoltooid als dienst.

Wat te doen met elk dit kwartaal
Als je een fine-tuningpipeline hebt en een nauw afgebakende taak met schone labels, is LFM2.5 2.6B Base de voorspelbaardere van de twee. De checkpoint is klein, de licentie is permissief, de architectuur is ontworpen om efficiënt te zijn bij inferentie, en het werk om er iets nuttigs van te maken — gesuperviseerde fine-tuning, een evaluatieset, een serving-stack — is werk dat je al van begin tot eind zelf in de hand hebt. Je zult hoe dan ook je eigen evaluaties draaien, omdat Liquid AI er geen heeft gepubliceerd.
Als je een hosted agent-workload hebt waarvan de rekening wordt gedomineerd door reasoning-tokens, dan pakt Ember-1 een echte term in je kostenvergelijking aan, en is het de twee weken waard. De juiste test is schaduwverkeer naast je huidige aanbieder: stuur een deel van de echte verzoeken naar beide, vergelijk de uitkomsten, en laat de live resultaten met rust. Dat is ook het advies dat onafhankelijke kritische berichtgeving over de release gaf, samen met een terechte waarschuwing — het comprimeren van beraadslaging brengt het risico mee dat een stap verloren gaat die het model nodig had, en bij een agent komt dat later naar voren als een verkeerde tool-aanroep in plaats van een verkeerde zin.
Geen van beide modellen staat op OrcaRouter. Als je het patroon wilt testen in plaats van deze twee artefacten — een klein fijn afstelbaar model en een groot gehost redeneermodel in één pipeline — dan is dat precies waar de routing-DSL voor dient: stel meerdere modellen samen in één enkele aanroep en laat elk het deel doen waar het goed in is, achter één sleutel en één rekening. De vergelijking hier is de moeite waard op architectuurniveau, zelfs terwijl beide specifieke endpoints buiten bereik blijven.
De transactie, eenmalig gesteld
Ember-1 verkoopt zekerheid over gedrag en onzekerheid over beschikbaarheid: een model waarvan de kwaliteit zorgvuldig wordt beargumenteerd en waarvan de beschikbaarheid expliciet voorwaardelijk is. LFM2.5 2.6B Base verkoopt zekerheid over beschikbaarheid en onzekerheid over gedrag: een bestand dat je altijd zult hebben en waarvan de competentie volledig afhangt van de training die je erin stopt. Teams met een probleem met serving en geen trainingscapaciteit moeten de preview in de gaten houden en hopen dat die permanent wordt. Teams met trainingscapaciteit en een nauw afgebakende taak moeten de base downloaden en stoppen met wachten op de roadmap van iemand anders.

Wat de combinatie echt laat zien, is dat "efficiëntie" niet langer één ding betekent. Voor Ember-1 betekent het minder tokens bij dezelfde kwaliteit op andermans hardware. Voor LFM2.5 2.6B Base betekent het een model dat klein genoeg is dat de hardware helemaal niet meer van iemand anders is. Dat zijn beide goede antwoorden en ze zijn niet uitwisselbaar.
