Ett genererat titelkort med texten ”Ember-1” och underrubriken ”Kimi K3-kvalitet, ungefär 40 % färre resonemangstokens” samt tre kort: Resonemangsreduktion 35–50 %, Terminal Bench 2.1 82,0 %, Släpp: forskningsförhandsvisning. En sidfot lyder: Siffror rapporterade av Fireworks, ej reproducerade; publicerade 23 september 2026.
Guides & Insights

Ember-1 skär ner Kimi K3:s resonemang med 40 % – och det finstilta är hela historien

Författare

Alistair Wren

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Den siffra som kommer att citeras är 40 %. Fireworks Research publicerade Ember-1 den 23 september 2026 och beskrev den som en specialiserad derivatmodell av Moonshot AI:s Kimi K3 som behåller K3:s noggrannhet samtidigt som den gör av med ungefär 40 % färre tokens för att nå dit. Det är ett verkligt och ovanligt specifikt påstående, och det kommer med tre saker kopplade till sig: ett fullständigt benchmarkblad med kolumner för tokenreduktion, två kund-A/B-tester från kodningstrafik i produktion, och en släppstatus som inte är allmän tillgänglighet. Ember-1 har släppts som en forskningsförhandsvisning, på leverantörens egen serverlösa plattform, med ett åtkomstfönster på två veckor och ett beslut om permanent status som beror på efterfrågan. Att förstå vilken del av detta som är en levererad produkt och vilken del som är ett välargumenterat forskningsresultat är hela poängen.

Det finns också en namnkollision som är värd att reda ut innan något annat. Ett separat öppet forskningsprojekt som heter Ember (v0.1.5, från Slow Lit Labs) ägnade 2026 åt att publicera long-horizon-coherence-utvärderingar, och det har inte någon som helst koppling till den här modellen. Allt du läser om att Ember inte lyckas slå Qwen3-8B under matchade inferensinställningar handlar om det projektet. Ember-1, som avses här, är ett Kimi K3-derivat från Fireworks Research.

Vad Ember-1 egentligen är

Ember-1 är inte en ny arkitektur och inte en ny basmodell. Det är Kimi K3, omtränad för att resonera mer koncist. Fireworks Research körde fler än 50 träningsexperiment och över 200 utvärderingar på sin egen serverlösa träningsstack, inom matematik, kodning, instruktionsföljning, konversation, sökning, verktygsanvändning och mjukvaruutveckling, med det uttalade målet att ta bort resonemang som inte ändrar svaret. Labbet säger att resonemangslängden kunde minskas med 35–50 % utan noggrannhetsförlust över sju benchmarks och två kunders produktionsflöden. Var och en av dessa siffror är leverantörsrapporterad och har inte reproducerats oberoende; ingen tredje part har publicerat en körning av Ember-1 i skrivande stund.

Inramningen spelar roll eftersom det uppenbara alternativet redan fanns. Kimi K3 levereras med inställningar för resonemangsansträngning, och det billiga sättet att göra av med färre tokens är att sänka ansträngningen. Fireworks Research säger att de provade det och att den låga inställningen offrade för mycket kvalitet — ett resultat som är bekant för alla som har justerat ansträngningsnivåer på en resonemangsmodell. Ember-1:s påstående är att ansträngningsratten är grov och att omträning är finkornig.

A single-column scoreboard titled "Ember-1 — the scoreboard": base model Kimi K3 (Moonshot AI); what changed, shorter reasoning with the same answers; token reduction claimed 35-50% across seven benchmarks; Terminal Bench 2.1 82.0% against K3 Max 80.9%; SWE-bench Verified 92.2% against K3 Max 93.2%; weights and price, none published — research preview. The footer states every figure is Fireworks-reported and unreproduced.

Varför resonemangstoken är värda så mycket ansträngning

Notan för en resonemangsmodell domineras inte av dess svar. Fireworks Research påpekar att K3 kan lägga mer än 90 % av sina genererade tokens på internt resonemang innan den skriver något som en användare ser. För en enskild begäran är det bara dyrt. I en agentloop med flera turer förstärks det, eftersom varje tur spelar upp den tidigare konversationen igen, så resonemangsspåren från tidigare turer läses om och debiteras på nytt vid varje efterföljande anrop. Fireworks Research beskriver att kontexten växer ungefär kvadratiskt med antalet turer. Det är det faktiska målet med den här lanseringen, och det är därför huvudmåttet är ungefär 40 % färre tokens snarare än ett kvalitetslyft.

Mekanismen förklarar också risken. Komprimering som tar bort bortkastad eftertanke är gratis; komprimering som tar bort ett steg som modellen behövde är inte det. Det allmänt rapporterade felmoduset vid alltför aggressiv resonemangsreducering är en modell som hoppar över en mellanliggande kontroll och drar en slutsats, vilket i en agent visar sig mycket senare som ett felaktigt verktygsanrop snarare än en felaktig mening. Fireworks Researchs upprepade betoning på likvärdig kvalitet framstår som ett svar på den oron, och A/B-siffrorna är det närmaste man kommer bevis för det – med det vanliga förbehållet att testuppsättningarna, godkännandekriterierna och urvalsstorlekarna alla valdes av den part som framför påståendet.

Benchmark-arket, med dess proveniens bifogad

Det här är siffrorna från Fireworks Research, oreproducerade. Den högra kolumnen är den del som är värd att läsa noga: den kopplar varje poäng till hur många tokens och dollar som krävdes i förhållande till K3 Max.

• Terminal Bench 2.1 (n=89) — Ember-1 82,0 % jämfört med K3 Max 80,9 %, K3 High 77,6 %, K3 Low 76,4 %; 51,9 % färre tokens, 23,10 $ mindre per uppgift.

• SWE-bench Verified (n=500) — Ember-1 92,2 % mot K3 Max 93,2 %; 15,5 % färre tokens, 68,10 $ mindre per uppgift.

• SWE-Interact (n=75) — Ember-1 20,0 % mot K3 Max 21,3 %, K3 High 13,3 %, K3 Low 6,7 %; 32,5 % färre tokens.

• DeepSWE 1.1 (n=113) — Ember-1 75,2 % mot K3 Max 66,4 %; 23,7 % färre tokens, 126,90 USD mindre per uppgift.

• τ-2 Bench Airline (n=50) — Ember-1 66 % mot K3 Max 64 %, K3 High och Low båda 64 %; 5,9 % färre tokens, 0,30 $ mindre per uppgift.

Två saker sticker ut. För det första vinner Ember-1 klart på Terminal Bench 2.1 och DeepSWE 1.1 samtidigt som den förlorar knappt på SWE-bench Verified och SWE-Interact – ett mönster som stämmer med en modell som inte så mycket har förlorat förmåga som ändrat vilka uppgifter den lägger eftertanke på. För det andra är tokenbesparingarna extremt ojämna: 51,9 % på Terminal Bench mot 5,9 % på τ-2 Airline. Vad Ember-1 än har lärt sig är det inte en enhetlig 40-procentig nedskärning av tänkandet. "Ungefär 40 %" i rubriken är ett genomsnitt över ett intervall som sträcker sig från ungefär 6 % till ungefär 52 %, och ett team vars arbetsbelastning liknar τ-2 Airline bör inte förvänta sig att märka av det.

Produktions-A/B-testerna är det mer övertygande beviset, just eftersom de inte byggdes för att vara benchmarks. I en kunds kodningsarbetsbelastning fick Ember-1 0,753 mot K3:s 0,751, tog 21,4 steg mot 23,8 och producerade 29,9K utdatatokens mot 49,3K – en minskning av resonemangstokens med 71,3 % och av totala tokens med 39 %, med ungefär likvärdig kvalitet. En andra kund såg omkring 35 % färre tokens per uppgift vid jämförbar kvalitet, och Fireworks Research säger att man först körde bytet på sin egen interna kodnings- och coworking-trafik, med det rapporterade resultatet att ingen märkte något. Betrakta allt som leverantörsrapporterat, men betrakta det som den starkaste formen av leverantörsrapporterat: A/B-preferens och data om slutförda uppgifter är svårare att manipulera än en topplista.

Det finns ytterligare en utvärdering, på Doximitys Bedside Bench – 500 läkarvaliderade kliniska fall inom tio kategorier – där Fireworks Research hävdar att Ember-1 satte en ny Pareto-front för kostnad per uppgift, jämfört med öppna och slutna modeller inklusive GPT-5.6 Sol, GPT-6 Astra och Claude Opus 5. Det är ett leverantörspåstående om en Pareto-position, vilket är ett påstående om en tvådimensionell avvägning snarare än en enskild poäng, och det är bara så bra som kostnadsantagandena bakom det. Dessa antaganden kom från Kimi K3:s offentliga API-prislista. Vilket för oss till den del av historien som en läsare faktiskt kan verifiera i dag.

A screenshot of OrcaRouter's model page for Kimi K3, showing the MoonshotAI Kimi K3 listing priced at $3.00 per 1M input tokens and $15.00 per 1M output tokens, a p50 time-to-first-token of 8.00s, 749.2M tokens of traffic over seven days, a 1M-token context window, and a Python snippet calling the model at api.orcarouter.ai/v1.

Basmodellen är den del du redan kan routa.

Ember-1:s hela kostnadsargument mäts mot Kimi K3:s publicerade priser. Kimi K3 är live på OrcaRouter till $3.00 per miljon indata-tokens, $0.30 per miljon cachade indata-tokens och $15.00 per miljon utdata-tokens, med ett kontextfönster på 1 048 576 tokens. Det är samma prislista som Fireworks Research-jämförelsen använder, och det är värt att veta att besparingarna i de där tokenreduktionskolumnerna beräknas mot siffror du kan se själv snarare än mot en leverantörs interna kostnadsmodell.

Ember-1 finns inte självt på OrcaRouter. Det är endast tillgängligt via leverantörens egen serverlösa plattform, som en forskningsförhandsvisning, och Fireworks Research har inte publicerat ett pris för det — så dollarvärdena i benchmarktabellen härleds från K3:s priser och tokenantal, inte från ett Ember-1-priskort som existerar. Om det är räknestycket som intresserar dig är den ärliga ordningen att prissätta arbetsbelastningen enligt K3:s rutt i dag, ta procenttalen för tokenminskning som den övre gränsen för vad ett byte kan ge, och vänta på en publicerad prislista innan du modellerar besparingen som pengar.

Där OrcaRouter faktiskt gör nytta här är med hedgen. En forskningsförhandsvisning med ett åtkomstfönster på två veckor är precis den typ av modell du vill prova utan att satsa en produktionsväg på den, och sättet att göra det utan ett andra avtal är att lägga den bakom samma endpoint som allt annat du anropar. OrcaRouter tillhandahåller 200+ modeller bakom ett enda API med automatisk failover, så en förhandsvisningsmodell som visar sig vara otillgänglig nästa månad är en routingändring snarare än en migrering. Inget hos Ember-1 kräver det – men inget hos ett fönster på två veckor talar emot det heller.

Vad ska man göra med den här releasen

Om du redan kör Kimi K3 i en agentloop beskriver Ember-1:s siffror din räkning. Problemet med återspelning över flera turer är verkligt, det är den dominerande kostnaden i långa agentkörningar, och en modell som förkortar sina egna spår utan att ändra sina svar är värd utvärderingstiden. Det rätta testet är inte benchmarktabellen; det är din egen trafik, körd i skuggläge – skicka en andel av de verkliga förfrågningarna till båda modellerna, jämför utdata och låt de skarpa resultaten vara orörda i en vecka eller två innan du ändrar något. Det är också rådet som släppets egen kritiska läsekrets ger, och det är klokt.

Om du kör en arbetsbelastning med låg deliberation, eller en som domineras av korta anrop med en enda tur, försvinner besparingarna till stor del och τ-2 Airline-raden är din realistiska förväntan. Och om du behöver ett åtagande av produktionsklass — ett pris, en servicenivå, en garanti för att slutpunkten finns om sex månader — erbjuder Ember-1 ännu inget sådant. Det är en forskningsförhandsvisning vars beständighet Fireworks Research uttryckligen knyter till efterfrågan. Den intressanta frågan under den kommande månaden är om tvåveckorsfönstret blir ett permanent serveringsalternativ och om en tredje part reproducerar några av siffrorna. Tills något av detta inträffar är detta ett starkt resultat att läsa och ett dåligt att bygga en budget på.

A screenshot of OrcaRouter's model catalogue headed "Models — 203 models · 15 providers · one API, one bill", with filter panels for input modalities, context length and input price, a "How to call any model" panel showing a POST to api.orcarouter.ai/v1/chat/completions, and model cards for OpenAI GPT-6 Luna, OpenAI GPT-6 Sol, Anthropic Claude Opus 5 and Grok 4.7 with their per-million-token rates.

Inget av detta bör läsas som att det förminskar arbetet. Att ta bort resonemang utan att ta bort noggrannhet är ett svårare problem än att lägga till det, och att göra det ovanpå någon annans frontiermodell i stället för att träna sin egen är den form som en stor del av 2026 års kapacitetsarbete har antagit. Ember-1 är det första släppet i vad Fireworks Research säger kommer bli en pågående serie, och mallen – ta en modell som redan är bra, träna om en axel av dess beteende, sälj deltat i tokens – är värd att hålla ögonen på oavsett hur just den här förhandsvisningen faller ut.