
Ember-1 vs Qwen3.8-Max: Het tokenzuinige derivaat tegen het vlaggenschip
- openaiNIEUWOpenAI: GPT-6 Luna2026-09-2237Intelligentie
- openaiNIEUWOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- anthropicNIEUWAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- grokNIEUWGrok 4.72026-09-2146Intelligentie
- OrcaNIEUWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 mln tokens · 177 tok/s
- orcaNIEUWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 1323 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligentie76Coderen
De twee modellen in deze confrontatie hebben allebei een echt getal op dezelfde benchmark, en toch beslecht het nog steeds niets. Ember-1 is een gespecialiseerde afgeleide van Fireworks Research van Moonshot AI's Kimi K3, gepubliceerd op 23 september 2026, met 82,0% op Terminal Bench 2.1 en ongeveer de helft van de tokens die het basismodel verbruikt. Qwen3.8-Max is Alibaba's vlaggenschip — een sparse mixture-of-experts-model van ongeveer 2,4 biljoen parameters met ongeveer 95 miljard actieve parameters per token — algemeen beschikbaar sinds 3 augustus 2026, met 86,6% op dezelfde benchmark. Beide cijfers zijn door leveranciers gerapporteerd, beide labs gebruikten hun eigen harness, en een verschil van 4,6 punten tussen twee niet-gepubliceerde evaluatieopstellingen is geen eindoordeel. Wat vergelijkbaar is, is het geld, en dat is waar deze confrontatie interessant wordt: de hele these van het ene model is dat je niet moet betalen voor tokens die je niet nodig hebt, en het andere is een vlaggenschip met een prijs van $2 per miljoen input en $6 per miljoen output.
Wat elk model daadwerkelijk is
Ember-1 is in geen enkele architectonische zin een nieuw model. Het is Kimi K3 dat opnieuw is getraind om beknopter te redeneren, gebouwd door Fireworks Research na meer dan 50 trainingsexperimenten en meer dan 200 evaluaties op zijn eigen serverless trainingsstack. De bewering van het lab is dat de redenering van K3 langer is dan taken vereisen en dat het overtollige deel kan worden verwijderd zonder de antwoorden te veranderen — de lengte van de redenering daalde met 35–50% zonder verlies van nauwkeurigheid across zeven benchmarks en twee productie-A/B-tests bij klanten. Het is beschikbaar als een onderzoekspreview op het eigen serverless platform van de leverancier, zonder gepubliceerde gewichten en zonder gepubliceerde prijs.
Qwen3.8-Max is een heel ander soort object. Het is de frontier-tier van Alibaba, native multimodaal voor tekst-, beeld- en video-invoer, met een contextvenster van één miljoen tokens, en sinds de lancering twee keer vernieuwd: een post-trained update op 2 september 2026 gericht op coderen en professioneel kantoorwerk, en een snellere serving-tier die op 22 september 2026 werd aangekondigd. Alibaba positioneert het tegenover GPT-5.5, Claude Opus 4.7 en Gemini 3.1 Pro, en het gepubliceerde evaluatieblad weerspiegelt die ambitie — GPQA Diamond 92,6, OSWorld-Verified 86,1, SWE-bench Pro 67,7, PaperBench 93,0, IFBench 82,8 en Humanity's Last Exam op 43,6, allemaal door de leverancier gerapporteerd.

De tariefkaarten naast elkaar
Een van deze heeft een prijs en de andere niet, wat de eerste praktische asymmetrie is.
• Invoer — Ember-1: niets gepubliceerd; het benchmarkblad berekent dollars op basis van de tariefkaart van Kimi K3. Qwen3.8-Max: $2,00 per miljoen tokens op OrcaRouter.
• Uitvoer — Ember-1: niet gepubliceerd. Qwen3.8-Max: $6,00 per miljoen tokens.
• Gecachte invoer — Ember-1: niet van toepassing. Qwen3.8-Max: $0,25 per miljoen tokens voor cache-reads, wat een achtste van het invoertarief is en enorm veel uitmaakt in agent-loops waarin dezelfde context bij elke beurt opnieuw wordt verzonden.
• Contextvenster — Ember-1: niet gepubliceerd voor de preview; het basismodel heeft 1.048.576 tokens. Qwen3.8-Max: 1.000.000 tokens.
• Multimodaliteit — Ember-1: tekst. Qwen3.8-Max: tekst, afbeelding en video in, tekst uit.
• Gewichten — Ember-1: geen. Qwen3.8-Max: er bestaat een open-weights-release, maar die is alleen tekst en mist het volledige contextvenster en de visuele input van het geserveerde endpoint.
• Toegang — Ember-1: onderzoekspreview, serverloos venster van twee weken, permanentie gekoppeld aan de vraag. Qwen3.8-Max: algemeen beschikbaar en geprijsd.
Let op één ding over de tarieven van Qwen3.8-Max voordat je iets modelleert: Alibaba heeft de prijsopbouw van dit model sinds de lancering herhaaldelijk herzien, en de internationale tariefkaart kwam niet altijd overeen met het hoofdtarief van augustus. Beschouw $2,00 en $6,00 als de huidige routeprijs op ons platform — dat de listprijs van de provider zonder opslag doorgeeft, zodat een wijziging bij de leverancier dezelfde dag zichtbaar wordt — en controleer de tariefkaart voordat je er budget aan toewijst.
Waarom de benchmarkvergelijking niet werkt
Ember-1's 82,0% en Qwen3.8-Max' 86,6% zijn beide Terminal Bench 2.1, waardoor ze vergelijkbaar lijken maar niet vergelijkbaar zijn. Ember-1's sheet rapporteert zijn score ten opzichte van Kimi K3-varianten die door Fireworks Research zijn geëvalueerd, op 89 samples, met bijgevoegde token- en kostendelta's. Qwen3.8-Max' score komt uit Alibaba's eigen evaluatieblad. Verschillende labs, verschillende harnesses, verschillende agent-scaffolds, en in een benchmark waarvan de scores alleen al door scaffoldkeuze meerdere punten verschuiven, valt een verschil van 4,6 punt binnen de ruisvloer van de methodologie.
Wat je uit het blad van Ember-1 kunt aflezen, is de tokenkolom, het enige dat het model getraind is te veranderen. Ten opzichte van zijn eigen basis gebruikt Ember-1 51,9% minder tokens op Terminal Bench 2.1, 32,5% minder op SWE-Interact, 23,7% minder op DeepSWE 1.1 en slechts 5,9% minder op τ-2 Bench Airline. De spreiding is de eerlijke kop. Een model dat de deliberatie terugschroeft, is veel waard op benchmarks waar het basismodel te veel nadenkt en bijna niets waar dat niet zo is, en je kunt niet weten welk soort werklast je hebt zonder je eigen metingen te doen.
Kosten per voltooide taak, doorgerekend
Hier is de rekensom die dit daadwerkelijk bepaalt, waarbij de gepubliceerde tarieven van Kimi K3 als plaatsvervanger dienen voor de kosten van Ember-1, aangezien Ember-1 die niet heeft. Kimi K3 kost $3,00 per miljoen invoertokens, $0,30 gecachet en $15,00 uitvoer — precies de tariefkaart die Fireworks Research in zijn eigen vergelijking gebruikte. Qwen3.8-Max kost $2,00 voor invoer en $6,00 voor uitvoer, met cache-lezingen tegen $0,25.
Aan de inputkant is Qwen3.8-Max al een derde goedkoper. Aan de outputkant is het 2,5 keer goedkoper per token. Dat betekent dat de tokenreductie van Ember-1 niet concurreert met een statische rekening — het concurreert met een vlaggenschip dat al goedkoper is per token voordat er enig efficiëntiewerk plaatsvindt. Fireworks Research' eigen productie-A/B-test liet outputtokens dalen van 49,3K naar 29,9K, een totale reductie van 39%; pas dat toe op het outputtarief van Qwen3.8-Max en je krijgt dezelfde 39% besparing, wat een kleinere absolute winst is dan hetzelfde percentage toegepast op K3's tarief van $15.
Het efficiëntieargument voor Ember-1 is daarom het sterkst wanneer het wordt afgezet tegen zijn eigen basismodel, en dat is precies het argument dat de release maakt. Tegenover Qwen3.8-Max verschuift de vergelijking naar capaciteit per dollar, waar de grotere context, multimodale input en geprijsde beschikbaarheid van het vlaggenschip de tegenargumenten zijn — en waar niemand een rechtstreekse vergelijking heeft gepubliceerd die het zou beslechten.

Wat onze eigen routeringsgegevens laten zien
Twee van de drie modellen die hierbij betrokken zijn, zijn live routes op OrcaRouter, wat een beeld geeft dat geen enkel benchmarkoverzicht bevat. Qwen3.8-Max wordt aangeboden met 1.000.000 tokens context, met een mediane latentie voor het eerste token van ongeveer 2,0 seconden en ongeveer 52,7 outputtokens per seconde over de afgelopen zeven dagen, met een foutpercentage van ongeveer 4,2%. Kimi K3 — het basismodel van Ember-1 en het referentiepunt voor elke besparing die Ember-1 claimt — draait met een context van 1.048.576 tokens, een mediane latentie van bijna 8,0 seconden, ongeveer 43,6 outputtokens per seconde en een foutpercentage van ongeveer 0,27%, bij aanzienlijk hoger verkeer. Ember-1 zelf staat niet op OrcaRouter.
Die cijfers geven de beslissing een andere context. Kimi K3 is aanzienlijk trager tot het eerste token en ongeveer twee keer zo duur per uitvoertoken als Qwen3.8-Max, terwijl het een veel lager foutpercentage heeft onder een veel zwaardere belasting. Een tokenzuinige afgeleide van K3 verkleint de kostenkloof, maar dicht de latentiekloof niet, omdat het verkorten van de redenering de generatiefase verkort, niet de wachtrij. Als je workload latentiegevoelig is in plaats van kostengevoelig, is het vlaggenschip vandaag de betere route en doet het efficiëntieverhaal er niet toe.
Welke moet er gerouteerd worden
Routeer Qwen3.8-Max wanneer je het contextvenster nodig hebt, de multimodale invoer, een gepubliceerde prijs en een dienst waarop je een budget kunt baseren. Door zijn opzet is het de veiligere van de twee: algemeen beschikbaar, geprijsd en binnen twee maanden tweemaal vernieuwd door een leverancier met een bewezen staat van dienst in het actueel houden van het endpoint.
Probeer Ember-1 wanneer je factuur wordt gedomineerd door reasoningtokens in lange agentlussen en je tegen een gehost model draait in plaats van je eigen hardware. De juiste test is de twee weken die de preview je geeft, in shadow draaien tegen productieverkeer, waarbij je tokens per voltooide taak meet in plaats van tokens per verzoek. Wat je niet moet doen, is het inzetten als een gelijkwaardige vervanging voor een flagship op grond van een cijfer van 40% dat varieert van 6% tot 52%, afhankelijk van de workload.
Als de echte vraag is of je Kimi K3 überhaupt moet blijven draaien, die kun je vandaag beantwoorden zonder enige preview: zowel Kimi K3 als Qwen3.8-Max staan op OrcaRouter achter één sleutel, geprijsd tegen de providerlijstprijs zonder markup, met automatische failover tussen providers. De kosten van je workload op beide vergelijken is een routingwijziging, geen inkoopproject — en het geeft je de baseline waardoor elke efficiëntieclaim over Ember-1 meetbaar wordt in je eigen cijfers in plaats van die van het lab.

De eerlijke samenvatting is dat deze twee modellen zijn geoptimaliseerd onder verschillende randvoorwaarden. Qwen3.8-Max is gebouwd om het meest capabele te zijn dat beschikbaar is, en is dienovereenkomstig geprijsd; Ember-1 is gebouwd om een al duur model goedkoper te laten draaien. Beide zijn legitiem, en de reden dat deze vergelijking zich niet leent voor een eenduidig oordeel, is dat de besparingen van het afgeleide model worden bepaald ten opzichte van een tariefkaart die het vlaggenschip wezenlijk onderbiedt.
Vergeleken in dit artikel1
Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt
