
Ember-1 vs Qwen3.8-Max : Le dérivé économe en tokens contre le vaisseau amiral
- openaiNOUVEAUOpenAI: GPT-6 Luna2026-09-2237Intelligence
- openaiNOUVEAUOpenAI: GPT-6 Sol2026-09-2248Intelligence
- anthropicNOUVEAUAnthropic: Claude Opus 5.52026-09-2258Intelligence
- grokNOUVEAUGrok 4.72026-09-2146Intelligence
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 par million de tokens · 177 tok/s
- orcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 1323 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligence76Code
Les deux modèles de cette confrontation affichent tous deux un chiffre concret sur le même benchmark, et cela ne tranche toujours rien. Ember-1 est un dérivé spécialisé de Kimi K3 de Moonshot AI, développé par Fireworks Research, publié le 23 septembre 2026, et annonce 82,0 % sur Terminal Bench 2.1 avec environ la moitié des tokens que dépense son modèle de base. Qwen3.8-Max est le modèle phare d'Alibaba — un modèle à mélange d'experts clairsemé d'environ 2 400 milliards de paramètres, avec environ 95 milliards d'actifs par token — généralement disponible depuis le 3 août 2026, et annonce 86,6 % sur le même benchmark. Ces deux chiffres sont déclarés par les fournisseurs, les deux laboratoires ont utilisé leur propre harnais, et un écart de 4,6 points entre deux protocoles d'évaluation non publiés n'est pas un verdict. Ce qui est comparable, c'est l'argent, et c'est là que cette confrontation devient intéressante : toute la thèse d'un modèle est qu'il ne faut pas payer pour des tokens dont on n'a pas besoin, et l'autre est un modèle phare facturé 2 $ par million en entrée et 6 $ par million en sortie.
Ce qu'est réellement chaque modèle
Ember-1 n'est pas un nouveau modèle au sens architectural. C'est Kimi K3 réentraîné pour raisonner de manière plus concise, développé par Fireworks Research au cours de plus de 50 expériences d'entraînement et de plus de 200 évaluations sur sa propre stack d'entraînement serverless. L'affirmation du laboratoire est que le raisonnement de K3 est plus long que les tâches ne l'exigent et que l'excédent peut être supprimé sans modifier les réponses — la longueur du raisonnement a chuté de 35 à 50 % sans perte de précision sur sept benchmarks et deux tests A/B en production chez des clients. Il est disponible en aperçu de recherche sur la plateforme serverless du fournisseur lui-même, sans poids publiés ni prix publié.
Qwen3.8-Max est un objet d'une tout autre nature. C'est le niveau de pointe d'Alibaba, nativement multimodal pour les entrées texte, image et vidéo, doté d'une fenêtre de contexte d'un million de tokens, et actualisé deux fois depuis son lancement : une mise à jour post-entraînée le 2 septembre 2026 axée sur la programmation et la bureautique professionnelle, puis un palier de service plus rapide annoncé le 22 septembre 2026. Alibaba le positionne face à GPT-5.5, Claude Opus 4.7 et Gemini 3.1 Pro, et sa fiche d'évaluation publiée reflète cette ambition — GPQA Diamond 92,6, OSWorld-Verified 86,1, SWE-bench Pro 67,7, PaperBench 93,0, IFBench 82,8 et Humanity's Last Exam à 43,6, tous rapportés par l'éditeur.

Les grilles tarifaires, côte à côte
L’un d’eux a un prix et l’autre non, ce qui est la première asymétrie pratique.
• Entrée — Ember-1 : aucun tarif publié ; la feuille de benchmark calcule les montants en dollars à partir de la grille tarifaire de Kimi K3. Qwen3.8-Max : 2,00 $ par million de tokens sur OrcaRouter.
• Sortie — Ember-1 : aucun prix publié. Qwen3.8-Max : 6,00 $ par million de tokens.
• Entrée mise en cache — Ember-1 : sans objet. Qwen3.8-Max : 0,25 $ par million de jetons pour les lectures de cache, soit un huitième du tarif d'entrée, ce qui compte énormément dans les boucles d'agents où le même contexte est renvoyé à chaque tour.
• Fenêtre de contexte — Ember-1 : non publiée pour l’aperçu ; son modèle de base dispose de 1 048 576 tokens. Qwen3.8-Max : 1 000 000 tokens.
• Multimodalité — Ember-1 : texte. Qwen3.8-Max : texte, image et vidéo en entrée, texte en sortie.
• Poids — Ember-1 : aucun. Qwen3.8-Max : une version à poids ouverts existe, mais elle est uniquement textuelle et ne dispose ni de la fenêtre de contexte complète ni de l’entrée visuelle du point de terminaison servi.
• Accès — Ember-1 : aperçu de recherche, fenêtre serverless de deux semaines, pérennité liée à la demande. Qwen3.8-Max : disponible en général et tarifé.
Notez un point au sujet des tarifs de Qwen3.8-Max avant toute modélisation : Alibaba a révisé à plusieurs reprises l’offre de ce modèle depuis son lancement, et la grille tarifaire internationale n’a pas toujours correspondu au prix affiché en août. Considérez 2,00 $ et 6,00 $ comme le tarif de route actuel sur notre plateforme — qui répercute le prix catalogue du fournisseur sans marge, si bien qu’une modification du fournisseur apparaît le jour même — et vérifiez la grille tarifaire avant d’y engager un budget.
Pourquoi la comparaison des benchmarks ne fonctionne pas
Les 82,0 % d’Ember-1 et les 86,6 % de Qwen3.8-Max relèvent tous deux de Terminal Bench 2.1, ce qui les fait paraître comparables et ne les rend pas comparables. La fiche d’Ember-1 rapporte son chiffre face à des variantes de Kimi K3 évaluées par Fireworks Research, sur 89 échantillons, avec les deltas de tokens et de coûts associés. Le chiffre de Qwen3.8-Max provient de la propre fiche d’évaluation d’Alibaba. Des laboratoires différents, des harnais différents, des scaffolds d’agents différents, et dans un benchmark dont les scores varient de plusieurs points rien qu’avec le choix du scaffold, un écart de 4,6 points se situe dans le plancher de bruit de la méthodologie.
Ce que vous pouvez lire sur la fiche d'Ember-1, c'est la colonne des tokens, qui est la seule chose que le modèle a été entraîné à modifier. Par rapport à sa propre base, Ember-1 utilise 51,9 % de tokens en moins sur Terminal Bench 2.1, 32,5 % de moins sur SWE-Interact, 23,7 % de moins sur DeepSWE 1.1 et seulement 5,9 % de moins sur τ-2 Bench Airline. La dispersion est le vrai titre. Un modèle qui réduit la délibération vaut beaucoup sur les benchmarks où le modèle de base réfléchit trop, et presque rien là où ce n'est pas le cas, et vous ne pouvez pas savoir à quel type de charge de travail vous avez affaire sans mesurer la vôtre.
Coût par tâche accomplie, calculé en détail
Voici l’arithmétique qui décide réellement de cela, en utilisant les tarifs publiés de Kimi K3 comme référence pour le coût d’Ember-1, puisque Ember-1 n’en a aucun. Kimi K3 est à 3,00 $ par million de jetons d’entrée, 0,30 $ en cache et 15,00 $ en sortie — exactement la grille tarifaire utilisée par Fireworks Research dans sa propre comparaison. Qwen3.8-Max est à 2,00 $ en entrée et 6,00 $ en sortie, avec des lectures de cache à 0,25 $.
Du côté des entrées, Qwen3.8-Max est déjà moins cher, d’un tiers. Du côté des sorties, il est 2,5 fois moins cher par token. Cela signifie que la réduction de tokens d’Ember-1 n’est pas en concurrence avec une facture statique — elle est en concurrence avec un modèle phare qui est moins cher par token avant même tout travail d’efficacité. Le propre test A/B en production de Fireworks Research a montré que les tokens de sortie passaient de 49,3K à 29,9K, soit une réduction totale de 39 % ; appliquez cela au tarif de sortie de Qwen3.8-Max et vous obtenez la même économie de 39 %, ce qui représente un gain absolu plus faible que le même pourcentage appliqué au tarif de 15 $ de K3.
L'argument en faveur de l'efficacité d'Ember-1 est donc le plus solide lorsqu'on le mesure à son propre modèle de base, et c'est exactement l'argument mis en avant lors de la sortie. Face à Qwen3.8-Max, la comparaison se déplace vers la capacité par dollar, où le contexte plus étendu du modèle phare, son entrée multimodale et sa disponibilité tarifaire constituent les contre-arguments — et où personne n'a publié de comparatif direct qui permettrait de trancher.

Ce que montrent nos propres données de routage
Deux des trois modèles concernés ici sont des routes actives sur OrcaRouter, ce qui donne une vue qu’aucune fiche de benchmark ne contient. Qwen3.8-Max est servi avec 1 000 000 de tokens de contexte, une latence médiane du premier token d’environ 2,0 secondes et environ 52,7 tokens de sortie par seconde au cours des sept derniers jours, avec un taux d’erreur d’environ 4,2 %. Kimi K3 — le modèle de base d’Ember-1, et le point de référence pour chaque économie revendiquée par Ember-1 — fonctionne avec 1 048 576 tokens de contexte, une latence médiane proche de 8,0 secondes, environ 43,6 tokens de sortie par seconde et un taux d’erreur d’environ 0,27 %, sur un trafic nettement plus élevé. Ember-1 lui-même n’est pas sur OrcaRouter.
Ces chiffres recontextualisent la décision. Kimi K3 met nettement plus de temps à générer le premier token et coûte environ deux fois plus cher par token de sortie que Qwen3.8-Max, tout en affichant un taux d'erreur bien plus faible sous une charge nettement plus lourde. Une déclinaison de K3 économe en tokens réduit l'écart de coût, mais ne comble pas l'écart de latence, car raccourcir le raisonnement raccourcit la phase de génération, pas la file d'attente. Si votre charge de travail est sensible à la latence plutôt qu'à la facture, le modèle phare est la meilleure option aujourd'hui, et l'argument de l'efficacité est hors sujet.
Lequel router
Routez vers Qwen3.8-Max lorsque vous avez besoin de la fenêtre de contexte, de l'entrée multimodale, d'un prix publié et d'un service sur lequel baser un budget. C'est, par construction, le plus sûr des deux : en disponibilité générale, avec un tarif affiché, et actualisé deux fois en deux mois par un fournisseur dont l'historique témoigne du maintien à jour de son point de terminaison.
Essayez Ember-1 lorsque votre facture est dominée par les jetons de raisonnement dans de longues boucles d’agent et que vous utilisez un modèle hébergé plutôt que votre propre matériel. Le bon test est celui des deux semaines que vous offre l’aperçu, exécuté en mode fantôme face au trafic de production, en mesurant les jetons par tâche terminée plutôt que les jetons par requête. Ce que vous ne devez pas faire, c’est l’intégrer comme remplacement à l’identique d’un modèle phare sur la foi d’un chiffre de 40 % qui varie de 6 % à 52 % selon la charge de travail.
Si la vraie question est de savoir s'il faut continuer à exécuter Kimi K3 tout court, celle-là, vous pouvez y répondre aujourd'hui sans aucun aperçu : Kimi K3 et Qwen3.8-Max sont tous deux sur OrcaRouter derrière une seule clé, au tarif public du fournisseur sans marge, avec un basculement automatique entre fournisseurs. Comparer le coût de votre charge de travail sur les deux est un changement de routage, pas un projet d'approvisionnement — et cela vous donne la base de référence qui rend toute affirmation d'efficacité concernant Ember-1 mesurable dans vos propres chiffres plutôt que dans ceux du laboratoire.

Le résumé honnête, c'est que ces deux modèles sont optimisés selon des contraintes différentes. Qwen3.8-Max est conçu pour être ce qui se fait de plus performant disponible, et son prix est fixé en conséquence ; Ember-1 est conçu pour rendre moins cher l'exploitation d'un modèle déjà coûteux. Les deux sont légitimes, et si cette confrontation résiste à un verdict net, c'est parce que les économies du dérivé se définissent par rapport à une grille tarifaire que le modèle phare minore nettement.
Comparés dans cet article1
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
