Een gegenereerde titelkaart met de tekst "Ember-1" en de ondertitel "Kimi K3-kwaliteit, ongeveer 40% minder redeneertokens" en drie kaarten: Reductie van redeneertokens 35-50%, Terminal Bench 2.1 82,0%, Release: onderzoekspreview. Een voettekst luidt: Door Fireworks gerapporteerde cijfers, niet gereproduceerd; gepubliceerd op 23 september 2026.
Guides & Insights

Ember-1 snijdt het redeneervermogen van Kimi K3 met 40% terug — en het verhaal zit in de kleine lettertjes.

Auteur

Alistair Wren

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Het getal dat geciteerd zal worden, is 40%. Fireworks Research publiceerde Ember-1 op 23 september 2026 en beschreef het als een gespecialiseerd derivaat van Moonshot AI's Kimi K3 dat de nauwkeurigheid van K3 behoudt terwijl het ongeveer 40% minder tokens verbruikt om daar te komen. Dat is een echte en ongewoon specifieke claim, en er hangen drie dingen aan vast: een volledige benchmarksheet met kolommen voor tokenreductie, twee klant-A/B-tests uit productieverkeer voor code en een releasestatus die geen algemene beschikbaarheid is. Ember-1 is beschikbaar als research preview, op het eigen serverloze platform van de leverancier, met een toegangsvenster van twee weken en een beslissing over permanentie die afhangt van de vraag. Begrijpen welk deel hiervan een uitgeleverd product is en welk deel een goed beargumenteerd onderzoeksresultaat, is de hele exercitie.

Er is ook een naamconflict dat eerst opgehelderd moet worden. Een afzonderlijk open onderzoeksproject genaamd Ember (v0.1.5, van Slow Lit Labs) publiceerde in 2026 evaluaties van coherentie over lange termijn, en het heeft op geen enkele manier met dit model te maken. Alles wat je leest over dat Ember er onder overeenkomstige inferentie-instellingen niet in slaagt Qwen3-8B te verslaan, gaat over dat project. Ember-1, waar het hier om gaat, is een afgeleide van Kimi K3 van Fireworks Research.

Wat Ember-1 eigenlijk is

Ember-1 is geen nieuwe architectuur en geen nieuw basismodel. Het is Kimi K3, opnieuw getraind om beknopter te redeneren. Fireworks Research voerde meer dan 50 trainingsexperimenten en ruim 200 evaluaties uit op zijn eigen serverloze trainingsstack, op het gebied van wiskunde, programmeren, instructieopvolging, gesprek, zoeken, toolgebruik en software-engineering, met het expliciete doel redeneringen te verwijderen die het antwoord niet veranderen. Het lab zegt dat de lengte van de redeneringen met 35–50% kon worden teruggebracht zonder verlies van nauwkeurigheid, over zeven benchmarks en twee sets met productieverkeer van klanten. Al die cijfers zijn door de leverancier gerapporteerd en zijn niet onafhankelijk gereproduceerd; geen enkele derde partij heeft op het moment van schrijven een run van Ember-1 gepubliceerd.

De framing is belangrijk omdat het voor de hand liggende alternatief al bestond. Kimi K3 wordt geleverd met instellingen voor redeneerinspanning, en de goedkope manier om minder tokens te verbruiken is om de inspanning te verlagen. Fireworks Research zegt dat het dat heeft geprobeerd en dat de lage instelling te veel kwaliteit inleverde — wat een bekend resultaat is voor iedereen die inspanningsniveaus op een redeneermodel heeft afgestemd. De bewering van Ember-1 is dat de inspanningsknop grof is en dat hertraining fijn is.

A single-column scoreboard titled "Ember-1 — the scoreboard": base model Kimi K3 (Moonshot AI); what changed, shorter reasoning with the same answers; token reduction claimed 35-50% across seven benchmarks; Terminal Bench 2.1 82.0% against K3 Max 80.9%; SWE-bench Verified 92.2% against K3 Max 93.2%; weights and price, none published — research preview. The footer states every figure is Fireworks-reported and unreproduced.

Waarom redeneertokens zoveel moeite waard zijn

De rekening van een redeneermodel wordt niet gedomineerd door zijn antwoord. Fireworks Research merkt op dat K3 meer dan 90% van zijn gegenereerde tokens kan besteden aan interne redenering voordat het iets schrijft dat een gebruiker te zien krijgt. Bij een enkele aanvraag is dat alleen maar duur. In een agent-lus met meerdere beurten stapelt het zich op, omdat elke beurt het voorafgaande gesprek opnieuw afspeelt, zodat de redeneersporen van eerdere beurten bij elke daaropvolgende aanroep opnieuw worden gelezen en gefactureerd. Fireworks Research beschrijft dat de context ongeveer kwadratisch groeit met het aantal beurten. Dat is het eigenlijke doel van deze release, en daarom is de belangrijkste metriek ongeveer 40% minder tokens in plaats van een kwaliteitssprong.

Het mechanisme verklaart ook het risico. Compressie die verspilde overwegingen schrapt, is gratis; compressie die een stap schrapt die het model nodig had, niet. De breed gerapporteerde faalmodus van te agressieve vermindering van redeneerwerk is een model dat een tussentijdse controle overslaat en naar een conclusie springt, wat zich bij een agent veel later uit als een verkeerde tool-aanroep in plaats van een verkeerde zin. De herhaalde nadruk van Fireworks Research op gelijkwaardige kwaliteit leest als een antwoord op die zorg, en de A/B-cijfers komen het dichtst in de buurt van bewijs daarvoor — met de gebruikelijke kanttekening dat de testsets, de slaagcriteria en de steekproefgroottes allemaal zijn gekozen door de partij die de bewering doet.

Het benchmarkblad, met de herkomst eraan gehecht.

Dit zijn de cijfers van Fireworks Research, niet gereproduceerd. De rechterkolom is het deel dat aandachtig lezen waard is: die koppelt elke score aan hoeveel tokens en dollars er nodig waren ten opzichte van K3 Max.

• Terminal Bench 2.1 (n=89) — Ember-1 82,0% vs K3 Max 80,9%, K3 High 77,6%, K3 Low 76,4%; 51,9% minder tokens, $23,10 minder per taak.

• SWE-bench Verified (n=500) — Ember-1 92,2% vs K3 Max 93,2%; 15,5% minder tokens, $68,10 minder per taak.

• SWE-Interact (n=75) — Ember-1 20,0% vs K3 Max 21,3%, K3 High 13,3%, K3 Low 6,7%; 32,5% minder tokens.

• DeepSWE 1.1 (n=113) — Ember-1 75,2% vs K3 Max 66,4%; 23,7% minder tokens, $126,90 minder per taak.

• τ-2 Bench Airline (n=50) — Ember-1 66% vs K3 Max 64%, K3 High en Low beide 64%; 5,9% minder tokens, $0,30 minder per taak.

Twee dingen vallen op. Ten eerste wint Ember-1 glansrijk op Terminal Bench 2.1 en DeepSWE 1.1, terwijl het nipt verliest op SWE-bench Verified en SWE-Interact — een patroon dat past bij een model dat niet zozeer capaciteit heeft verloren, maar veeleer is veranderd in aan welke taken het zijn afweging besteedt. Ten tweede zijn de tokenbesparingen enorm ongelijk: 51,9% op Terminal Bench tegenover 5,9% op τ-2 Airline. Wat Ember-1 ook heeft geleerd, het is geen uniforme bezuiniging van 40% op denkwerk. Het "ongeveer 40%" in de kop is een gemiddelde over een spreiding die loopt van ruwweg 6% tot ruwweg 52%, en een team wiens werklast op τ-2 Airline lijkt, moet niet verwachten dat het dit merkt.

De productie-A/B-tests zijn het overtuigendere bewijs, juist omdat ze niet zijn opgezet als benchmarks. In de codingworkload van één klant scoorde Ember-1 0,753 tegenover K3's 0,751, had het 21,4 stappen nodig tegenover 23,8, en produceerde het 29,9K outputtokens tegenover 49,3K — een vermindering van 71,3% in reasoningtokens en 39% in totale tokens, met ongeveer gelijkwaardige kwaliteit. Een tweede klant zag ongeveer 35% minder tokens per taak bij vergelijkbare kwaliteit, en Fireworks Research zegt dat het de overstap eerst heeft uitgevoerd op zijn eigen interne coding- en coworkingverkeer, met de gerapporteerde uitkomst dat niemand het merkte. Behandel dit alles als door de leverancier gerapporteerd, maar behandel het als de sterkste vorm van door de leverancier gerapporteerd: A/B-voorkeur- en taakvoltooiingsgegevens zijn moeilijker te manipuleren dan een leaderboard.

Er is nog een evaluatie, op Doximity's Bedside Bench — 500 door artsen gevalideerde klinische gevallen in tien categorieën — waarbij Fireworks Research beweert dat Ember-1 een nieuwe Pareto-grens heeft bereikt op kosten per taak, met een vergelijking met open en gesloten modellen, waaronder GPT-5.6 Sol, GPT-6 Astra en Claude Opus 5. Dat is een leveranciersclaim over een Pareto-positie, wat een claim is over een tweedimensionale afweging in plaats van één enkele score, en die is slechts zo goed als de kostenveronderstellingen erachter. Die veronderstellingen kwamen van Kimi K3's openbare API-tariefkaart. Dat brengt ons bij het deel van het verhaal dat een lezer vandaag daadwerkelijk kan verifiëren.

A screenshot of OrcaRouter's model page for Kimi K3, showing the MoonshotAI Kimi K3 listing priced at $3.00 per 1M input tokens and $15.00 per 1M output tokens, a p50 time-to-first-token of 8.00s, 749.2M tokens of traffic over seven days, a 1M-token context window, and a Python snippet calling the model at api.orcarouter.ai/v1.

Het basismodel is het deel dat je al kunt routeren

Het hele kostenargument van Ember-1 wordt afgemeten tegen de gepubliceerde tarieven van Kimi K3. Kimi K3 is live op OrcaRouter voor $3,00 per miljoen inputtokens, $0,30 per miljoen gecachte inputtokens en $15,00 per miljoen outputtokens, met een contextvenster van 1.048.576 tokens. Dat is dezelfde tariefkaart die de vergelijking van Fireworks Research gebruikt, en het is goed om te weten dat de besparingen in die kolommen voor tokenreductie worden berekend op basis van cijfers die u zelf kunt zien, in plaats van op basis van het interne kostenmodel van een leverancier.

Ember-1 zelf staat niet op OrcaRouter. Het is alleen beschikbaar via het eigen serverless platform van de leverancier, als een research preview, en Fireworks Research heeft er geen prijs voor gepubliceerd — dus de dollarbedragen in de benchmarktabel zijn afgeleid van K3-tarieven en tokentellingen, niet van een Ember-1-tariefkaart die bestaat. Als de rekensom is wat je interesseert, is de eerlijke volgorde om de workload vandaag tegen K3's route te prijzen, de tokenreductiepercentages te nemen als de bovengrens van wat een overstap zou kunnen opleveren, en te wachten op een gepubliceerd tarief voordat je de besparing als geld modelleert.

Waar OrcaRouter hier wel bij helpt, is bij de hedge. Een research preview met een toegangsvenster van twee weken is precies het soort model dat je wilt uitproberen zonder er een productiepad op te verwedden, en de manier om dat te doen zonder een tweede contract is om het achter hetzelfde endpoint te zetten als alles wat je aanroept. OrcaRouter serveert 200+ modellenachter één API met automatische failover, zodat een preview-model dat volgende maand niet beschikbaar blijkt te zijn een routeringswijziging is in plaats van een migratie. Niets aan Ember-1 vereist dat — maar niets aan een venster van twee weken pleit er ook tegen.

Wat te doen met deze release

Als je Kimi K3 al in een agent-loop draait, beschrijven de cijfers van Ember-1 jouw factuur. Het multi-turn replay-probleem is reëel, het is de dominante kostenpost bij lange agent-runs, en een model dat zijn eigen traces inkort zonder zijn antwoorden te veranderen, is de evaluatietijd waard. De juiste test is niet de benchmarktabel; het is je eigen verkeer, in shadow-modus gedraaid — stuur een deel van de echte verzoeken naar beide modellen, vergelijk de uitvoer, en laat de live resultaten een week of twee ongemoeid voordat je iets verandert. Dat is ook het advies dat de eigen kritische lezers van de release geven, en het is degelijk.

Als je een workload met weinig beraad draait, of een die wordt gedomineerd door korte single-turn-aanroepen, verdwijnen de besparingen grotendeels en is de τ-2 Airline-rij je realistische verwachting. En als je een productieklare toezegging nodig hebt — een prijs, een serviceniveau, een garantie dat het endpoint over zes maanden bestaat — biedt Ember-1 die nog niet. Het is een research preview waarvan Fireworks Research de permanentie expliciet aan vraag koppelt. De interessante vraag de komende maand is of het venster van twee weken een permanente serveeroptie wordt en of een derde partij een van de cijfers reproduceert. Tot een van die dingen gebeurt, is dit een sterk resultaat om te lezen en een slecht resultaat om een budget op te baseren.

A screenshot of OrcaRouter's model catalogue headed "Models — 203 models · 15 providers · one API, one bill", with filter panels for input modalities, context length and input price, a "How to call any model" panel showing a POST to api.orcarouter.ai/v1/chat/completions, and model cards for OpenAI GPT-6 Luna, OpenAI GPT-6 Sol, Anthropic Claude Opus 5 and Grok 4.7 with their per-million-token rates.

Niets daarvan mag worden opgevat als een geringschatting van het werk. Redeneren verwijderen zonder de nauwkeurigheid te verminderen is een moeilijker probleem dan het toevoegen ervan, en dat doen bovenop het frontiermodel van iemand anders in plaats van je eigen model te trainen, is de vorm die veel capaciteitswerk in 2026 heeft aangenomen. Ember-1 is de eerste release in wat volgens Fireworks Research een doorlopende reeks zal zijn, en het sjabloon — neem een model dat al goed is, hertrain één as van zijn gedrag, verkoop de delta in tokens — is het bekijken waard, ongeacht hoe deze specifieke preview uitpakt.