Una card di titolo generata che recita "Ember-1 vs Gemma 4 12B" con il sottotitolo "Meno token su un endpoint a noleggio, oppure i tuoi pesi", sopra due card: Ember-1 — "derivato di Kimi K3" e "nessun peso, nessun prezzo pubblicato"; Gemma 4 12B — "11,95B dense, Apache 2.0" e "contesto 256K, multimodale".
Guides & Insights

Ember-1 vs Gemma 4 12B: uno ti noleggia meno token, l'altro ti consegna i pesi

Autore

Magnus Corvin

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Ember-1 e Gemma 4 12B non competono per la stessa voce in un ordine d'acquisto, e il modo più rapido per capire perché è chiedersi cosa possiederesti alla fine di ogni mese. Gemma 4 12B è il modello multimodale denso da 11,95 miliardi di parametri di Goog​le, rilasciato il 3 giugno 2026 con licenza Apache 2.0 — lo scarichi e il checkpoint è tuo. Ember-1 è il derivato specializzato di Fireworks Research del Kimi K3 di Moonshot AI, pubblicato il 23 settembre 2026 come anteprima di ricerca sulla piattaforma serverless propria del fornitore — lo chiami e non possiedi nulla tranne la fattura. Uno è un discorso di rent-to-own sui token; l'altro è un acquisto in conto capitale. Mettili fianco a fianco e il confronto utile non è quale modello sia migliore, perché nulla di pubblicato ti permette di stabilirlo. È quale delle due forme di approvvigionamento si adatta a ciò che stai costruendo.

I due contratti, esposti in parole semplici

Gemma 4 12B è una release open-weights completa. Google pubblica i pesi, l'architettura, la scheda dei benchmark e la licenza, e una comunità di runtime — llama.cpp, vLLM, MLX, SGLang, Transformers — la esegue su hardware che controlli. Il costo di un token dopo l'acquisto è elettricità e ammortamento, non una voce di costo di un fornitore. Le cose a cui rinunci sono quelle che i pesi aperti comportano sempre: la pianificazione della capacità è a tuo carico, e il tuo tetto di qualità è fissato a 11,95 miliardi di parametri.

Ember-1 è l'inverso. Non ci sono pesi da scaricare — esiste come opzione di serving sulla piattaforma del fornitore stesso — e nessun prezzo pubblicato. Quello che offre invece è un'affermazione più ristretta, eseguita al di sopra di un modello molto più grande: l'accuratezza di Kimi K3, con circa il 40% in meno di token spesi per arrivarci. Fireworks Research lo ha addestrato specificamente per accorciare le tracce di ragionamento senza cambiare le risposte, e riporta che la lunghezza del ragionamento potrebbe essere ridotta del 35–50% senza perdita di accuratezza su sette benchmark e due test A/B di produzione dei clienti. Ogni cifra è riportata dal fornitore e non riprodotta.

A two-column scoreboard titled "Ember-1 vs Gemma 4 12B — the scoreboard" comparing six dimensions. Ember-1: a Kimi K3 derivative retrained for shorter reasoning; no published weights; context not published (base model 1M); text-only input; price not published, preview only; evidence is vendor benchmarks plus two vendor-run A/B tests. Gemma 4 12B: a dense 11.95B multimodal generalist; Apache 2.0 weights, downloadable; 256K-token context; text, image and audio input; free to download with hardware costs; evidence is Google evaluations plus an independent local-run ecosystem.

Quanto vale l'argomentazione sui token dipende interamente da chi paga i token.

Il pitch per Ember-1 presuppone una fatturazione per token. Questa ipotesi è corretta per il pubblico per cui è stato progettato — team che eseguono lunghi cicli di agenti su un modello frontier ospitato, dove Fireworks Research osserva che Kimi K3 può spendere più del 90% dei token generati nel ragionamento interno, e dove ogni turno riproduce i turni precedenti, così il ragionamento precedente viene riletto e riaddebitato. In quel contesto, ridurre la lunghezza della traccia è un taglio diretto alla fattura mensile, e il risultato A/B di 29,9K token di output contro i 49,3K di K3 è il numero che conta.

Applica lo stesso modello ai termini di Gemma 4 12B e l'argomentazione si dissolve. Quando fai self-hosting di un checkpoint Apache-2.0, i token di ragionamento extra costano tempo effettivo e occupazione della GPU, non dollari per milione. Una traccia di ragionamento prolissa sul tuo laptop da 16 GB è una risposta più lenta, non una bolletta più alta. Ciò non rende l'inefficienza innocua — in un ciclo di agenti si accumula comunque, e si manifesta comunque come latenza — ma il tasso di cambio è diverso, e trattare una riduzione del 40% dei token come un risparmio del 40% su hardware self-hosted è un errore di categoria.

La scheda tecnica, una riga per dimensione

• Che cos'è — Ember-1: un derivato in anteprima di ricerca di Kimi K3, riaddestrato per un ragionamento più breve. Gemma 4 12B: un modello multimodale denso da 11,95B con pesi aperti della famiglia Gemma 4 di Goog​le.

• Pesi — Ember-1: nessuno pubblicato; servito solo tramite la piattaforma del fornitore. Gemma 4 12B: Apache 2.0, scaricabile, senza restrizioni.

• Dimensione — Ember-1: non divulgato; ereditato dall'architettura di Kimi K3. Gemma 4 12B: 11,95B denso, 48 strati, circa 18 GB di pesi in BF16.

• Finestra di contesto — Ember-1: non pubblicata per l'anteprima; il suo modello base ha 1.048.576 token. Gemma 4 12B: 256K token.

• Input — Ember-1: testo. Gemma 4 12B: testo, immagine e audio attraverso un design unificato senza encoder, con video elencato da alcune fonti.

• Prezzo — Ember-1: nessun prezzo pubblicato; i dollari della scheda di benchmark sono calcolati dal listino prezzi di Kimi K3. Gemma 4 12B: gratuito da scaricare; paghi l'hardware.

• Requisiti minimi hardware — Ember-1: qualunque cosa pianifichi il fornitore. Gemma 4 12B: 16GB di VRAM o memoria unificata, secondo il posizionamento di Goog​le.

• Prove — Ember-1: benchmark del fornitore e due test A/B condotti dal fornitore, non riprodotti. Gemma 4 12B: valutazioni riportate da Goog​le più un ecosistema indipendente di esecuzioni locali.

Cosa pubblica Gemma 4 12B e come legge

Goog​le stesso ha fornito i numeri per Gemma 4 12B, che si colloca tra l'edge-sized Gemma 4 E4B e il più grande 26B MoE: GPQA Diamond 78,8%, MMLU Pro 77,2%, AIME 2026 senza strumenti 77,5%, LiveCodeBench v6 72,0, Codeforces ELO 1659, τ-2 media 69,0%, MMMU Pro 69,1%, DocVQA 94,9 e BigBench Extra Hard 53,0%. Anche questi sono dati dichiarati dal produttore — Goog​le ha valutato il proprio modello e pubblicato la scheda — ma hanno il vantaggio di descrivere un checkpoint che chiunque può scaricare ed eseguire di nuovo, ed è per questo che le dichiarazioni sui modelli open-weights tendono a ottenere rapidamente una conferma da terze parti, mentre quelle sulle anteprime closed non lo fanno.

La distinzione reale del modello è strutturale, non numerica. Gemma 4 12B non ha un encoder separato per visione o audio: le patch delle immagini e le forme d'onda audio si proiettano direttamente nello spazio dei token, ed è questo che permette a un modello da 12B di accettare in input uno screenshot o una registrazione. Inoltre viene fornito con drafter multi-token-prediction per il decoding speculativo, una funzione di latenza più che di qualità — il tipo di cosa che conta quando esegui il modello in autonomia e ogni millisecondo di prefill è a tuo carico.

Dove i due si scontrano davvero

Entrambi i modelli sono venduti per il coding agentico e l'uso di strumenti, e questo è l'unico territorio in cui esiste una vera scelta. Il dato di Ember-1 su Terminal Bench 2.1 è 82,0% contro l'80,9% di Kimi K3 Max, con il 51,9% in meno di token; il suo risultato su SWE-bench Verified è 92,2% contro il 93,2% di K3 Max. Gemma 4 12B non ha alcun numero per Terminal Bench o SWE-bench nel set pubblicato da Google — la sua evidenza agentica è τ-2 al 69,0%. Quindi non puoi allinearli su un benchmark condiviso, e qualsiasi articolo che lo faccia si sta inventando il confronto.

Quello che si può dire è che si collocano in punti diversi di una curva dei costi. Se il tuo carico di lavoro agentico gira su un modello frontier ospitato e la fattura è dominata dai token di ragionamento, Ember-1 attacca esattamente quel termine — al prezzo di una finestra di accesso di due settimane e nessuna tariffa pubblicata. Se il tuo carico di lavoro deve girare su hardware che controlli, gestire uno screenshot o sopravvivere a un fornitore che decide di non continuare un'anteprima, Gemma 4 12B è l'unico dei due che risponda anche solo alla domanda.

A screenshot of the Hugging Face model card for google/gemma-4-12B, showing 97,559 downloads in the last month, a safetensors model size of 12B parameters in BF16, the Apache 2.0 licence, any-to-any modality, and a model tree listing 7 adapters, 62 fine-tunes and 49 quantizations. The Inference Providers panel reads "This model isn't deployed by any Inference Provider."

Una via di mezzo, e dove trovarla

Esiste una terza opzione su cui non è costruito il marketing di nessuno dei due modelli: usare i tier più grandi di Gemma 4 come metà ospitata di un ibrido. OrcaRouter instrada i Gemma 4 26B-A4B di Goog​le e Gemma 4 31B insieme ad altri 200+ modelli dietro un'unica API al prezzo di listino del provider con 0% di markup, così la stessa chiave che raggiunge un Gemma di medie dimensioni raggiunge anche i modelli frontier per cui altrimenti servirebbe un secondo contratto. Gemma 4 12B di per sé non è sulla nostra piattaforma, e nemmeno Ember-1 lo è — se ti serve il 12B in locale, scaricalo; se vuoi prima verificare se un Gemma più grande colma il divario, quel test costa un solo endpoint.

Quell'assetto è anche il modo onesto di valutare un'anteprima di ricerca. Il failover automatico tra provider significa che un modello che scompare da una finestra di anteprima non porta con sé la tua applicazione, che è il rischio specifico introdotto dallo stato di rilascio di Ember-1 e il rischio specifico che nulla nella sua tabella di benchmark affronta.

Quale dei due merita un posto nella tua roadmap?

Scegli Gemma 4 12B se la proprietà è un requisito — privacy, funzionamento offline, una soglia di costo fissa, o un prodotto che deve continuare a funzionare se un fornitore cambia idea. Il suo tetto pubblicato è più basso di quello di un derivato di frontiera e il suo input multimodale è davvero distintivo, e nessuno dei due fatti dipende dalla roadmap di qualcun altro.

Scegli Ember-1 se il tuo problema è la fatturazione a token nelle lunghe esecuzioni degli agenti e puoi assorbire il rischio di anteprima. Eseguilo in modalità shadow rispetto al tuo fornitore attuale per le due settimane che hai, misura i token per attività completata sul tuo traffico e considera il 40% un'ipotesi più che una percentuale consolidata. Quello che non dovresti fare è scegliere tra i due in base alla qualità, perché nessuno — incluso il laboratorio che ha creato Ember-1 — ha pubblicato un confronto che te lo consentirebbe.

A screenshot of OrcaRouter's model page for Gemma 4 31B, showing the google/gemma-4-31b-it listing priced at $0.13 per 1M input tokens and $0.38 per 1M output tokens, a p50 time-to-first-token of 1.44s, 375.3K tokens of traffic over seven days, a 256K-token context window and a Python snippet calling api.orcarouter.ai/v1.

Il punto più ampio è che queste due release rappresentano i due modi in cui la capacità viene venduta alla fine del 2026. Un laboratorio pubblica un checkpoint e lascia che l'ecosistema trovi il proprio livello; un altro prende un modello addestrato da qualcun altro, migliora un asse del suo comportamento e vende il miglioramento come servizio. Entrambi sono legittimi, e falliscono in modi diversi: i pesi aperti falliscono lentamente e in pubblico, le preview falliscono all'improvviso e con un annuncio.

Confrontati in questo articolo1

Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno