Ett genererat titelkort med texten "Ember-1 vs Qwen3.8-Max" och underrubriken "Ett tokensnålt derivat mot flaggskeppet", ovanför två kort: Ember-1 — "40 % färre tokens uppges" och "inget publicerat pris"; Qwen3.8-Max — "2 dollar in, 6 dollar ut" och "1M-tokenskontext".
Guides & Insights

Ember-1 vs Qwen3.8-Max: Det tokenbesparande derivatet mot flaggskeppet

Författare

Alistair Wren

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

The two models in this matchup both have a real number on the same benchmark, and it still does not settle anything. Ember-1 is Fireworks Research's specialized derivative of Moonshot AI's Kimi K3, published 23 September 2026, reporting 82.0% on Terminal Bench 2.1 with roughly half the tokens its base model spends. Qwen3.8-Max is Aliba​ba's flagship — a sparse mixture-of-experts model of roughly 2.4 trillion parameters with about 95 billion active per token — generally available since 3 August 2026, reporting 86.6% on the same benchmark. Both those figures are vendor-reported, both labs ran their own harness, and a 4.6-point gap between two unpublished evaluation setups is not a verdict. What is comparable is the money, and that is where this matchup gets interesting: one model's entire thesis is that you should not pay for tokens you do not need, and the other is a flagship priced at $2 per million in and $6 per million out.

Vad varje modell faktiskt är

Ember-1 är inte en ny modell i någon arkitektonisk mening. Den är Kimi K3 omtränad för att resonera mer koncist, byggd av Fireworks Research genom fler än 50 träningsexperiment och över 200 utvärderingar på deras egen serverlösa träningsstack. Labbets påstående är att K3:s resonemang är längre än vad uppgifterna kräver och att överskottet kan tas bort utan att svaren ändras – resonemangslängden sjönk med 35–50 % utan förlust av noggrannhet över sju benchmarks och två kunders produktions-A/B-tester. Den finns tillgänglig som en forskningsförhandsvisning på leverantörens egen serverlösa plattform, utan publicerade vikter och utan publicerat pris.

Qwen3.8-Max is a different kind of object entirely. It is Aliba​ba's frontier tier, natively multimodal for text, image and video input, carrying a one-million-token context window, and refreshed twice since launch: a post-trained update on 2 September 2026 aimed at coding and professional office work, and a faster serving tier announced on 22 September 2026. Aliba​ba positions it against GPT-5.5, Claude Opus 4.7 and Gemini 3.1 Pro, and its published evaluation sheet reflects that ambition — GPQA Diamond 92.6, OSWorld-Verified 86.1, SWE-bench Pro 67.7, PaperBench 93.0, IFBench 82.8 and Humanity's Last Exam at 43.6, all vendor-reported.

A two-column scoreboard titled "Ember-1 vs Qwen3.8-Max — the scoreboard" comparing six dimensions. Ember-1: input/output price not published, computed from Kimi K3 rates of $3 and $15; context not published, base model carries 1M; text input; Terminal Bench 2.1 82.0% vendor-reported; research preview with a two-week window; not routed on OrcaRouter. Qwen3.8-Max: $2.00 in and $6.00 out per 1M tokens; 1,000,000-token context; text, image and video input; Terminal Bench 2.1 86.6% vendor-reported; generally available and priced; routed on OrcaRouter. The footer notes both Terminal Bench figures are vendor-reported and were produced on different harnesses.

Priskorten, sida vid sida.

En av dessa har ett pris och den andra inte, vilket är den första praktiska asymmetrin.

• Indata — Ember-1: inget publicerat; benchmarkbladet beräknar dollar utifrån Kimi K3:s prislista. Qwen3.8-Max: $2.00 per miljon tokens på OrcaRouter.

• Utdata — Ember-1: inget publicerat. Qwen3.8-Max: 6,00 USD per miljon tokens.

• Cachad indata — Ember-1: ej tillämpligt. Qwen3.8-Max: $0.25 per miljon tokens för cacheläsningar, vilket är en åttondel av indatapriset och har enorm betydelse i agentloopar där samma kontext skickas igen varje tur.

• Kontextfönster — Ember-1: ej publicerat för förhandsversionen; dess basmodell har 1 048 576 tokens. Qwen3.8-Max: 1 000 000 tokens.

• Multimodalitet — Ember-1: text. Qwen3.8-Max: text, bild och video in, text ut.

• Vikter — Ember-1: inga. Qwen3.8-Max: ett släpp med öppna vikter finns, men det är endast textbaserat och saknar det fullständiga kontextfönstret och bildinmatningen hos den serverade slutpunkten.

• Åtkomst — Ember-1: forskningsförhandsvisning, två veckor långt serverlöst fönster, permanens kopplad till efterfrågan. Qwen3.8-Max: allmänt tillgänglig och prissatt.

Note one thing about the Qwen3.8-Max rates before modelling anything: Aliba​ba has revised this model's packaging repeatedly since launch, and the international rate card has not always matched the August headline. Treat $2.00 and $6.00 as the current route price on our platform — which passes provider list price through with no markup, so a vendor change shows up the same day — and check the card before you commit a budget to it.

Varför benchmarkjämförelsen inte fungerar

Ember-1's 82.0% and Qwen3.8-Max's 86.6% are both Terminal Bench 2.1, which makes them look comparable and does not make them comparable. Ember-1's sheet reports its number against Kimi K3 variants evaluated by Fireworks Research, on 89 samples, with token and cost deltas attached. Qwen3.8-Max's number comes from Aliba​ba's own evaluation sheet. Different labs, different harnesses, different agent scaffolds, and in a benchmark whose scores move several points on scaffold choice alone, a 4.6-point gap is inside the noise floor of the methodology.

Det du kan läsa ut från Ember-1:s ark är tokenkolumnen, det enda modellen tränades att ändra. Jämfört med sin egen basmodell använder Ember-1 51,9 % färre tokens på Terminal Bench 2.1, 32,5 % färre på SWE-Interact, 23,7 % färre på DeepSWE 1.1 och bara 5,9 % färre på τ-2 Bench Airline. Spridningen är den ärliga rubriken. En modell som minskar sitt resonerande är värd mycket på benchmarks där basmodellen tänker för mycket och nästan ingenting där den inte gör det, och du kan inte veta vilken typ av arbetsbelastning du har utan att mäta din egen.

Kostnad per slutförd uppgift, genomräknad

Här är räkneexemplet som faktiskt avgör detta, med Kimi K3:s publicerade priser som ersättning för Ember-1:s kostnad, eftersom Ember-1 inte har någon. Kimi K3 kostar $3.00 per miljon indatatokens, $0.30 cachade och $15.00 utdata – exakt den prislista som Fireworks Research använde i sin egen jämförelse. Qwen3.8-Max kostar $2.00 in och $6.00 ut, med cacheläsningar på $0.25.

På inputsidan är Qwen3.8-Max redan billigare, med en tredjedel. På outputsidan är den 2,5 gånger billigare per token. Det betyder att Ember-1:s tokenreduktion inte konkurrerar mot en statisk nota — den konkurrerar mot en flaggskeppsmodell som är billigare per token innan något effektiviseringsarbete ens har gjorts. Fireworks Researchs egen produktions-A/B-test visade att outputtokens sjönk från 49,3K till 29,9K, en total minskning med 39 %; tillämpa det på Qwen3.8-Max outputpris och du får samma besparing på 39 %, vilket är en mindre absolut vinst än samma procentandel tillämpad på K3:s $15-pris.

Effektivitetsargumentet för Ember-1 är därför starkast när det mäts mot dess egen basmodell, och det är exakt det argument som lanseringen för fram. Mot Qwen3.8-Max förskjuts jämförelsen till förmåga per dollar, där flaggskeppets större kontext, multimodala indata och prissatta tillgänglighet är motargumenten — och där ingen har publicerat en head-to-head-jämförelse som skulle avgöra saken.

A screenshot of OrcaRouter's model page for Qwen3.8 Max, showing the qwen/qwen3.8-max listing priced at $2.00 per 1M input tokens and $6.00 per 1M output tokens, a p50 time-to-first-token of 1.98s, 33.3M tokens of traffic over seven days, a 1M-token context window accepting text, image and video, and a Python snippet calling api.orcarouter.ai/v1.

Vad vår egen routingdata visar

Två av de tre modellerna som är involverade här är aktiva rutter på OrcaRouter, vilket ger en inblick som ingen benchmark-tabell innehåller. Qwen3.8-Max serveras med 1 000 000 tokens kontext, med en medianlatens för första token på omkring 2,0 sekunder och ungefär 52,7 utdata-tokens per sekund under de senaste sju dagarna, med en felfrekvens på cirka 4,2 %. Kimi K3 – Ember-1:s basmodell och referenspunkten för varje besparing som Ember-1 hävdar – körs med 1 048 576 tokens kontext, en medianlatens nära 8,0 sekunder, cirka 43,6 utdata-tokens per sekund och en felfrekvens på ungefär 0,27 %, på väsentligt högre trafik. Ember-1 finns inte själv på OrcaRouter.

De siffrorna ger beslutet en ny inramning. Kimi K3 är betydligt långsammare till första token och ungefär dubbelt så dyr per utdata-token som Qwen3.8-Max, samtidigt som den har en mycket lägre felfrekvens under betydligt tyngre belastning. Ett tokensnålt derivat av K3 minskar kostnadsgapet men sluter inte latensgapet, eftersom kortare resonemang förkortar genereringsfasen, inte kön. Om din arbetsbelastning är latenskänslig snarare än kostnadskänslig är flaggskeppet det bättre valet idag, och effektivitetsberättelsen är irrelevant.

Vilken ska dirigeras

Använd Qwen3.8-Max när du behöver kontextfönstret, multimodalinmatningen, ett publicerat pris och en tjänst som du kan budgetera för. Det är det säkrare av de två till sin konstruktion: allmänt tillgänglig, prissatt och uppdaterad två gånger på två månader av en leverantör med en dokumenterad förmåga att hålla slutpunkten aktuell.

Prova Ember-1 när din räkning domineras av resonemangstoken i långa agentloopar och du kör mot en hostad modell i stället för din egen hårdvara. Det rätta testet är de två veckor som förhandsversionen ger dig, med körning i skugga mot produktionstrafik och mätning av tokens per slutförd uppgift i stället för tokens per begäran. Det du inte bör göra är att byta in den som en likvärdig ersättning för en flaggskeppsmodell med stöd av en siffra på 40 % som varierar från 6 % till 52 % beroende på arbetsbelastningen.

Om den verkliga frågan är huruvida man alls ska fortsätta köra Kimi K3, kan du svara på den redan idag utan någon förhandsvisning: både Kimi K3 och Qwen3.8-Max finns på OrcaRouter bakom en enda nyckel, prissatta enligt leverantörens listpris utan påslag, med automatisk failover mellan leverantörer. Att jämföra kostnaden för din arbetsbelastning hos båda är en routingändring, inte ett upphandlingsprojekt – och det ger dig baslinjen som gör att alla effektivitetsanspråk om Ember-1 går att mäta i dina egna siffror i stället för labbets.

A screenshot of OrcaRouter's model page for Kimi K3, showing the MoonshotAI Kimi K3 listing priced at $3.00 per 1M input tokens and $15.00 per 1M output tokens, a p50 time-to-first-token of 8.00s, 749.2M tokens of traffic over seven days, a 1M-token context window and a Python snippet calling api.orcarouter.ai/v1.

Den ärliga sammanfattningen är att dessa två modeller är optimerade mot olika begränsningar. Qwen3.8-Max är byggd för att vara det mest kapabla som finns och prissatt därefter; Ember-1 är byggd för att göra en redan dyr modell billigare att köra. Båda är legitima, och anledningen till att den här jämförelsen inte låter sig avgöras entydigt är att derivatets besparingar definieras i förhållande till en prislista som flaggskeppet väsentligt underbjuder.

Jämförda i den här artikeln1

Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen