
Ember-1 riduce del 40% il ragionamento di Kimi K3 — e il diavolo è nei dettagli
- openaiNUOVOOpenAI: GPT-6 Luna2026-09-2237Intelligenza
- openaiNUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- anthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- grokNUOVOGrok 4.72026-09-2146Intelligenza
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token · 177 tok/s
- orcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 1323 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenza76Codice
Il numero che verrà citato è il 40%. Fireworks Research ha pubblicato Ember-1 il 23 settembre 2026, descrivendolo come un derivato specializzato di Kimi K3 di Moonshot AI che mantiene l'accuratezza di K3 spendendo circa il 40% in meno di token per arrivarci. Si tratta di un'affermazione reale e insolitamente specifica, e arriva con tre cose allegate: un foglio completo di benchmark con colonne di riduzione dei token, due test A/B dei clienti da traffico di coding in produzione, e uno stato di rilascio che non è la disponibilità generale. Ember-1 è disponibile come anteprima di ricerca, sulla piattaforma serverless del fornitore stesso, con una finestra di accesso di due settimane e una decisione sulla permanenza che dipende dalla domanda. Capire quale parte di tutto ciò sia un prodotto già distribuito e quale parte sia un risultato di ricerca ben argomentato è l'intero esercizio.
C'è anche un'omonimia che vale la pena chiarire prima di ogni altra cosa. Un progetto di ricerca aperto separato chiamato Ember (v0.1.5, di Slow Lit Labs) ha passato il 2026 a pubblicare valutazioni di coerenza a lungo orizzonte, e non è in alcun modo correlato a questo modello. Qualunque cosa leggiate sul fatto che Ember non riesca a battere Qwen3-8B in condizioni di inferenza comparabili riguarda quel progetto. Ember-1, l'oggetto in questione, è un derivato di Kimi K3 di Fireworks Research.
Cos'è realmente Ember-1
Ember-1 non è una nuova architettura e non un nuovo modello di base. È Kimi K3, riaddestrato per ragionare in modo più conciso. Fireworks Research ha eseguito più di 50 esperimenti di addestramento e oltre 200 valutazioni sulla propria stack di addestramento serverless, in matematica, programmazione, rispetto delle istruzioni, conversazione, ricerca, uso di strumenti e ingegneria del software, con l'obiettivo esplicito di rimuovere il ragionamento che non cambia la risposta. Il laboratorio afferma che la lunghezza del ragionamento potrebbe essere ridotta del 35–50% senza perdita di accuratezza su sette benchmark e due set di traffico di produzione dei clienti. Ognuna di queste cifre è riportata dal fornitore e non è stata riprodotta in modo indipendente; nessuna terza parte ha pubblicato un'esecuzione di Ember-1 al momento della scrittura.
L'inquadramento conta perché l'alternativa ovvia esisteva già. Kimi K3 arriva con impostazioni di reasoning-effort, e il modo economico per spendere meno token è abbassare l'effort. Fireworks Research afferma di averci provato e che l'impostazione bassa sacrificava troppa qualità — un risultato familiare a chiunque abbia regolato i livelli di effort su un modello di ragionamento. La tesi di Ember-1 è che la manopola dell'effort è grossolana e che il retraining è a grana fine.

Perché i token di ragionamento valgono tutto questo sforzo
La bolletta di un modello di ragionamento non è dominata dalla sua risposta. Fireworks Research osserva che K3 può spendere più del 90% dei suoi token generati nel ragionamento interno prima di scrivere qualcosa che un utente veda. Su una singola richiesta è semplicemente costoso. In un ciclo di agente multi-turno si amplifica, perché ogni turno riproduce la conversazione precedente, quindi le tracce di ragionamento dei turni precedenti vengono rilette e riaddebitate a ogni chiamata successiva. Fireworks Research descrive il contesto che cresce all’incirca in modo quadratico con il numero di turni. Questo è l’obiettivo effettivo di questa release, ed è il motivo per cui la metrica principale è circa il 40% in meno di token anziché un salto di qualità.
Il meccanismo spiega anche il rischio. La compressione che elimina deliberazione sprecata non comporta costi; la compressione che elimina un passaggio di cui il modello aveva bisogno sì. La modalità di fallimento ampiamente segnalata della riduzione troppo aggressiva del ragionamento è un modello che salta un controllo intermedio e giunge a una conclusione, il che in un agente si manifesta molto più tardi come una chiamata errata a uno strumento anziché come una frase sbagliata. L'insistenza ripetuta di Fireworks Research sulla qualità equivalente si legge come una risposta a quella preoccupazione, e i numeri A/B sono quanto di più vicino a una prova a sostegno di ciò — con la solita avvertenza che i set di test, i criteri di superamento e le dimensioni dei campioni sono stati tutti scelti dalla parte che avanza l'affermazione.
Il foglio di benchmark, con la sua provenienza allegata
Queste sono le cifre di Fireworks Research, non riprodotte. La colonna di destra è la parte che vale la pena leggere con attenzione: abbina ogni punteggio a quanti token e dollari sono stati necessari rispetto a K3 Max.
• Terminal Bench 2.1 (n=89) — Ember-1 82,0% rispetto a K3 Max 80,9%, K3 High 77,6%, K3 Low 76,4%; 51,9% in meno di token, 23,10 $ in meno per attività.
• SWE-bench Verified (n=500) — Ember-1 92,2% vs K3 Max 93,2%; 15,5% in meno di token, $68,10 in meno per attività.
• SWE-Interact (n=75) — Ember-1 20,0% vs K3 Max 21,3%, K3 High 13,3%, K3 Low 6,7%; 32,5% in meno di token.
• DeepSWE 1.1 (n=113) — Ember-1 75,2% vs K3 Max 66,4%; 23,7% in meno di token, 126,90 $ in meno per attività.
• τ-2 Bench Airline (n=50) — Ember-1 66% vs K3 Max 64%, K3 High e Low entrambi al 64%; 5,9% di token in meno, 0,30 $ in meno per attività.
Due cose spiccano. In primo luogo, Ember-1 vince nettamente su Terminal Bench 2.1 e DeepSWE 1.1, mentre perde di stretta misura su SWE-bench Verified e SWE-Interact — un andamento coerente con un modello che non ha tanto perso capacità quanto ha cambiato le attività su cui dedica la propria deliberazione. In secondo luogo, i risparmi di token sono estremamente disomogenei: 51,9% su Terminal Bench contro 5,9% su τ-2 Airline. Qualunque cosa Ember-1 abbia imparato, non è una riduzione uniforme del 40% sul pensiero. Il «circa 40%» nel titolo è una media su una forbice che va da circa il 6% a circa il 52%, e un team il cui carico di lavoro assomiglia a τ-2 Airline non dovrebbe aspettarsi di percepirlo.
I test A/B in produzione sono la prova più persuasiva, proprio perché non sono stati costruiti per essere benchmark. Nel carico di lavoro di codifica di un cliente, Ember-1 ha ottenuto 0,753 contro 0,751 di K3, ha impiegato 21,4 passaggi contro 23,8 e ha emesso 29,9K token di output contro 49,3K — una riduzione del 71,3% nei token di ragionamento e del 39% in quelli totali, con una qualità più o meno equivalente. Un secondo cliente ha riscontrato circa il 35% in meno di token per attività a qualità comparabile, e Fireworks Research afferma di aver eseguito il passaggio prima sul proprio traffico interno di codifica e coworking, con il risultato riportato che nessuno se ne è accorto. Considerate tutto quanto come dichiarato dal fornitore, ma consideratelo la forma più forte di dichiarazione del fornitore: i dati sulle preferenze A/B e sul completamento delle attività sono più difficili da manipolare rispetto a una classifica.
C'è ancora una valutazione, su Bedside Bench di Doximity — 500 casi clinici validati da medici in dieci categorie — in cui Fireworks Research sostiene che Ember-1 abbia stabilito una nuova frontiera di Pareto sul costo per attività, confrontandolo con modelli aperti e chiusi tra cui GPT-5.6 Sol, GPT-6 Astra e Claude Opus 5. Questa è un'affermazione di un fornitore su una posizione di Pareto, cioè un'affermazione su un compromesso bidimensionale anziché su un singolo punteggio, e vale solo quanto le assunzioni di costo che ne stanno alla base. Tali assunzioni provenivano dal listino prezzi pubblico dell'API di Kimi K3. Il che ci porta alla parte della storia che un lettore può effettivamente verificare oggi.

Il modello di base è la parte che puoi già instradare
L'intera argomentazione sui costi di Ember-1 è misurata rispetto alle tariffe pubblicate di Kimi K3. Kimi K3 è attivo su OrcaRouter a 3,00 $ per milione di token di input, 0,30 $ per milione di token di input in cache e 15,00 $ per milione di token di output, con una finestra di contesto di 1.048.576 token. È lo stesso listino prezzi utilizzato nel confronto di Fireworks Research, e vale la pena sapere che i risparmi in quelle colonne di riduzione dei token sono calcolati rispetto a numeri che puoi verificare di persona, non rispetto a un modello di costo interno di un fornitore.
Ember-1 stesso non è su OrcaRouter. È disponibile solo tramite la piattaforma serverless del fornitore, come anteprima di ricerca, e Fireworks Research non ha pubblicato un prezzo per esso — quindi le cifre in dollari nella tabella di benchmark derivano dalle tariffe e dai conteggi di token di K3, non da un listino prezzi di Ember-1 che esista. Se è l'aritmetica a interessarti, la sequenza onesta è prezzare il carico di lavoro sulla rotta di K3 oggi, prendere le percentuali di riduzione dei token come limite superiore di ciò che un cambio potrebbe garantire, e attendere una tariffa pubblicata prima di modellare il risparmio in termini monetari.
Dove OrcaRouter è davvero d'aiuto, qui, è nella copertura. Un'anteprima di ricerca con una finestra di accesso di due settimane è esattamente il tipo di modello che vuoi provare senza puntarci un percorso di produzione, e il modo per farlo senza un secondo contratto è metterlo dietro lo stesso endpoint di tutto il resto che chiami. OrcaRouter serve oltre 200 modelli dietro un'unica API con failover automatico, così un modello in anteprima che risulta non disponibile il mese prossimo è un cambio di routing anziché una migrazione. Niente in Ember-1 lo richiede — ma neanche niente in una finestra di due settimane lo sconsiglia.
Cosa fare con questa release
Se esegui già Kimi K3 in un loop di agenti, i numeri di Ember-1 descrivono la tua bolletta. Il problema del replay multi-turno è reale, è il costo dominante nelle lunghe esecuzioni degli agenti, e un modello che accorcia le proprie tracce senza cambiare le proprie risposte vale il tempo di valutazione. Il test giusto non è la tabella di benchmark; è il tuo traffico, eseguito in shadow — invia una quota di richieste reali a entrambi i modelli, confronta gli output, mantieni i risultati live intatti per una o due settimane prima di cambiare qualsiasi cosa. È anche il consiglio che sta dando il pubblico critico della release stessa, ed è sensato.
Se si esegue un carico di lavoro a bassa deliberazione, o uno dominato da brevi chiamate a turno singolo, i risparmi in gran parte svaniscono e la riga τ-2 Airline è la vostra aspettativa realistica. E se serve un impegno di livello produttivo — un prezzo, un livello di servizio, una garanzia che l'endpoint esista tra sei mesi — Ember-1 non ne offre ancora uno. È un'anteprima di ricerca la cui permanenza Fireworks Research lega esplicitamente alla domanda. La domanda interessante per il prossimo mese è se la finestra di due settimane diventerà un'opzione di servizio permanente e se una terza parte riprodurrà alcuni dei numeri. Finché una di queste cose non accadrà, questo è un risultato forte da leggere e uno debole su cui costruire un budget.

Niente di tutto ciò va inteso come una svalutazione del lavoro. Rimuovere il ragionamento senza rimuovere l'accuratezza è un problema più difficile che aggiungerlo, e farlo sopra il modello di frontiera di qualcun altro invece di addestrare il proprio è la forma che ha assunto gran parte del lavoro sulle capacità nel 2026. Ember-1 è il primo rilascio di quella che, secondo Fireworks Research, sarà una serie continuativa, e lo schema — prendere un modello già buono, riaddestrare un asse del suo comportamento, vendere il delta in token — vale la pena di essere osservato, indipendentemente da come andrà questa particolare anteprima.
