
Ember-1 vs Qwen3.8-Max: La derivata parsimoniosa in token contro il modello di punta
- openaiNUOVOOpenAI: GPT-6 Luna2026-09-2237Intelligenza
- openaiNUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- anthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- grokNUOVOGrok 4.72026-09-2146Intelligenza
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token · 177 tok/s
- orcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 1323 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenza76Codice
I due modelli in questo confronto hanno entrambi un numero reale sullo stesso benchmark, e ciò non risolve comunque nulla. Ember-1 è il derivato specializzato di Fireworks Research del Kimi K3 di Moonshot AI, pubblicato il 23 settembre 2026, che riporta l'82,0% su Terminal Bench 2.1 con circa la metà dei token spesi dal suo modello base. Qwen3.8-Max è il modello di punta di Alibaba — un modello sparse mixture-of-experts da circa 2,4 trilioni di parametri con circa 95 miliardi attivi per token — generalmente disponibile dal 3 agosto 2026, che riporta l'86,6% sullo stesso benchmark. Entrambe queste cifre sono dichiarate dal fornitore, entrambi i laboratori hanno usato il proprio harness, e un divario di 4,6 punti tra due setup di valutazione non pubblicati non è un verdetto. Ciò che è comparabile sono i soldi, ed è qui che questo confronto diventa interessante: l'intera tesi di un modello è che non dovresti pagare per token di cui non hai bisogno, e l'altro è un modello di punta prezzato a 2 $ per milione in input e 6 $ per milione in output.
Cosa è realmente ciascun modello
Ember-1 non è un nuovo modello in alcun senso architetturale. È Kimi K3 riaddestrato per ragionare in modo più conciso, sviluppato da Fireworks Research attraverso più di 50 esperimenti di addestramento e oltre 200 valutazioni sul proprio stack di addestramento serverless. L'affermazione del laboratorio è che il ragionamento di K3 è più lungo di quanto richiedano i compiti e che l'eccesso può essere rimosso senza cambiare le risposte: la lunghezza del ragionamento è diminuita del 35–50% senza perdita di accuratezza su sette benchmark e due test A/B in produzione dei clienti. È disponibile come anteprima di ricerca sulla piattaforma serverless del fornitore stesso, senza pesi pubblicati e senza prezzo pubblicato.
Qwen3.8-Max è un oggetto di tipo completamente diverso. È il tier di frontiera di Alibaba, nativamente multimodale per input di testo, immagini e video, dotato di una finestra di contesto da un milione di token, e aggiornato due volte dal lancio: un aggiornamento post-training del 2 settembre 2026 mirato alla programmazione e al lavoro d'ufficio professionale, e un tier di serving più rapido annunciato il 22 settembre 2026. Alibaba lo posiziona in competizione con GPT-5.5, Claude Opus 4.7 e Gemini 3.1 Pro, e la sua scheda di valutazione pubblicata riflette tale ambizione: GPQA Diamond 92,6, OSWorld-Verified 86,1, SWE-bench Pro 67,7, PaperBench 93,0, IFBench 82,8 e Humanity's Last Exam a 43,6, tutti riportati dal fornitore.

Le schede tariffarie, fianco a fianco
Uno di questi ha un prezzo e l'altro no, il che è la prima asimmetria pratica.
• Input — Ember-1: nessuno pubblicato; il foglio di benchmark calcola i dollari dal listino prezzi di Kimi K3. Qwen3.8-Max: $2.00 per milione di token su OrcaRouter.
• Output — Ember-1: nessuno pubblicato. Qwen3.8-Max: 6,00 $ per milione di token.
• Input memorizzato nella cache — Ember-1: non applicabile. Qwen3.8-Max: 0,25 $ per milione di token per le letture dalla cache, che equivale a un ottavo della tariffa di input e riveste un'importanza enorme nei cicli degli agenti, dove lo stesso contesto viene rinviato a ogni turno.
• Finestra di contesto — Ember-1: non pubblicata per l'anteprima; il suo modello di base dispone di 1.048.576 token. Qwen3.8-Max: 1.000.000 token.
• Multimodalità — Ember-1: testo. Qwen3.8-Max: testo, immagine e video in input, testo in output.
• Pesi — Ember-1: nessuno. Qwen3.8-Max: esiste una release con pesi aperti, ma è solo testo e manca della finestra di contesto completa e dell'input visivo dell'endpoint servito.
• Accesso — Ember-1: anteprima di ricerca, finestra serverless di due settimane, permanenza legata alla domanda. Qwen3.8-Max: disponibilità generale e prezzo definito.
Prima di modellare qualsiasi cosa, tieni presente una cosa sulle tariffe di Qwen3.8-Max: Alibaba ha più volte rivisto il packaging di questo modello dal lancio, e la scheda tariffaria internazionale non sempre ha coinciso con la tariffa di riferimento di agosto. Considera $2,00 e $6,00 come il prezzo attuale della route sulla nostra piattaforma — che trasferisce il prezzo di listino del fornitore senza alcun ricarico, così una variazione del fornitore compare lo stesso giorno — e controlla la scheda prima di impegnare un budget.
Perché il confronto dei benchmark non funziona
L'82,0% di Ember-1 e l'86,6% di Qwen3.8-Max sono entrambi su Terminal Bench 2.1, il che li fa sembrare comparabili e non li rende comparabili. La scheda di Ember-1 riporta il proprio numero rispetto a varianti di Kimi K3 valutate da Fireworks Research, su 89 campioni, con allegati i delta di token e costi. Il numero di Qwen3.8-Max proviene dalla scheda di valutazione di Alibaba stessa. Laboratori diversi, harness diversi, scaffold per agenti diversi e, in un benchmark i cui punteggi variano di diversi punti già solo in base alla scelta dello scaffold, un divario di 4,6 punti rientra nel rumore di fondo della metodologia.
Ciò che puoi leggere dal foglio di Ember-1 è la colonna dei token, che è l'unica cosa che il modello è stato addestrato a cambiare. Rispetto alla propria base, Ember-1 spende il 51,9% di token in meno su Terminal Bench 2.1, il 32,5% in meno su SWE-Interact, il 23,7% in meno su DeepSWE 1.1 e appena il 5,9% in meno su τ-2 Bench Airline. La forbice è il dato più onesto. Un modello che riduce la deliberazione vale moltissimo su benchmark in cui il modello base pensa troppo e quasi nulla dove non lo fa, e non puoi sapere che tipo di carico di lavoro hai senza misurare il tuo.
Costo per attività completata, calcolato
Ecco il calcolo che decide davvero la questione, usando le tariffe pubblicate di Kimi K3 come sostituto del costo di Ember-1, dato che Ember-1 non ne ha. Kimi K3 costa 3,00 $ per milione di token di input, 0,30 $ in cache e 15,00 $ in output — esattamente il tariffario che Fireworks Research ha usato nel proprio confronto. Qwen3.8-Max costa 2,00 $ in input e 6,00 $ in output, con le letture dalla cache a 0,25 $.
Sul fronte dell'input, Qwen3.8-Max costa già un terzo in meno. Sul fronte dell'output, costa 2,5 volte meno per token. Ciò significa che la riduzione dei token di Ember-1 non compete con una bolletta statica — compete con un modello di punta che costa meno per token prima che venga svolto qualsiasi lavoro di efficienza. Il test A/B in produzione della stessa Fireworks Research ha mostrato i token di output scendere da 49,3K a 29,9K, una riduzione totale del 39%; applica questo dato alla tariffa di output di Qwen3.8-Max e ottieni lo stesso risparmio del 39%, che è un guadagno assoluto inferiore rispetto alla stessa percentuale applicata alla tariffa di 15 $ di K3.
Il caso di efficienza di Ember-1 è quindi più solido se misurato rispetto al suo stesso modello base, ed è esattamente l'argomentazione che il rilascio presenta. Rispetto a Qwen3.8-Max il confronto si sposta sulla capacità per dollaro, dove il contesto più ampio del flagship, l'input multimodale e la disponibilità a pagamento rappresentano le controargomentazioni — e dove nessuno ha pubblicato un confronto diretto che potrebbe risolverlo.

Cosa mostrano i nostri stessi dati di routing
Due dei tre modelli coinvolti qui sono route live su OrcaRouter, il che offre una visione che nessun foglio di benchmark contiene. Qwen3.8-Max viene servito con 1.000.000 di token di contesto, una latenza mediana del primo token di circa 2,0 secondi e circa 52,7 token di output al secondo negli ultimi sette giorni, con un tasso di errore di circa il 4,2%. Kimi K3 — il modello base di Ember-1, e il punto di riferimento per ogni risparmio rivendicato da Ember-1 — viene eseguito con 1.048.576 token di contesto, una latenza mediana vicina a 8,0 secondi, circa 43,6 token di output al secondo e un tasso di errore di circa lo 0,27%, su un traffico sostanzialmente superiore. Ember-1 stesso non è su OrcaRouter.
Quei numeri inquadrano diversamente la decisione. Kimi K3 è sostanzialmente più lento al primo token e costa all'incirca il doppio per token di output rispetto a Qwen3.8-Max, pur presentando un tasso di errore molto più basso sotto un carico ben più pesante. Un derivato di K3 parsimonioso nell'uso dei token riduce il divario di costo ma non colma quello di latenza, perché accorciare il ragionamento accorcia la fase di generazione, non la coda. Se il tuo carico di lavoro è sensibile alla latenza più che alla spesa, il modello di punta è la strada migliore oggi e il discorso sull'efficienza è fuori luogo.
Quale instradare
Instrada Qwen3.8-Max quando ti serve la finestra di contesto, l'input multimodale, un prezzo pubblicato e un servizio su cui basare un budget. È il più sicuro dei due per costruzione: disponibile a livello generale, con prezzo pubblico e aggiornato due volte in due mesi da un fornitore con uno storico consolidato nel mantenere l'endpoint aggiornato.
Prova Ember-1 quando la tua fattura è dominata dai token di ragionamento in lunghi loop degli agenti e usi un modello ospitato anziché il tuo hardware. Il test giusto sono le due settimane che l'anteprima ti offre, eseguite in shadow sul traffico di produzione, misurando i token per attività completata anziché i token per richiesta. Quello che non dovresti fare è sostituirlo come rimpiazzo equivalente di un modello di punta sulla base di una cifra del 40% che va dal 6% al 52% a seconda del carico di lavoro.
Se la vera domanda è se continuare a eseguire Kimi K3 o meno, a quella puoi rispondere oggi senza alcuna anteprima: sia Kimi K3 sia Qwen3.8-Max sono su OrcaRouter dietro un'unica chiave, al prezzo di listino del provider senza ricarico, con failover automatico tra provider. Confrontare il costo del tuo carico di lavoro su entrambi è un cambio di routing, non un progetto di approvvigionamento — e ti fornisce la baseline che rende qualsiasi affermazione di efficienza su Ember-1 misurabile nei tuoi numeri anziché in quelli del laboratorio.

Il riassunto onesto è che questi due modelli sono ottimizzati rispetto a vincoli diversi. Qwen3.8-Max è progettato per essere la soluzione più capace disponibile, con un prezzo commisurato; Ember-1 è progettato per rendere più economico l'utilizzo di un modello già costoso. Entrambi sono legittimi, e il motivo per cui questo confronto non si presta a un verdetto netto è che i risparmi del derivato sono definiti rispetto a un listino che il modello di punta batte sensibilmente sul prezzo.
Confrontati in questo articolo1
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
