
AstaBrief 8B vs Gemma 4 12B: uno specialista della scrittura contro un generalista che fa tutto
- openaiNUOVOOpenAI: GPT-6.1 Sol2026-09-2952Intelligenza
- anthropicNUOVOAnthropic: Claude Sonnet 5.52026-09-2856Intelligenza
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 220 tok/s
- OpenAINUOVOOpenAI: GPT-6 Luna2026-09-2238Intelligenza
- OpenAINUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- AnthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- xAINUOVOGrok 4.72026-09-2146Intelligenza
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M di token · 113 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
AstaBrief 8B e Gemma 4 12B sono della stessa classe dimensionale e hanno la stessa licenza, e al di là di questo sono risposte a domande diverse. AstaBrief 8B è il modello open-weights da 8B di Ai2, rilasciato il 2026-10-02 e fine-tuned da Qwen3-8B, che fa una sola cosa: trasformare una domanda di ricerca e estratti di letteratura recuperati in un report con citazioni, in un'unica passata, in circa 51 secondi end-to-end. Gemma 4 12B è il modello multimodale unificato da 11,95B di DeepMind, un generalista Apache-2.0 che accetta nativamente testo, immagini, audio e video e gestisce 256.000 token di contesto. Uno è un bisturi che svolge un singolo compito più velocemente della pipeline generica che ha sostituito; l'altro è l'intera cassetta degli attrezzi, sul dispositivo.
La tentazione è dichiarare che lo specialista è migliore nel suo lavoro e passare oltre. La domanda più utile, se si esegue il deployment su una singola GPU consumer, è se il vantaggio del modello ristretto sia abbastanza ampio da giustificare l'esecuzione di due stack invece di uno — e la risposta dipende da numeri che nessuno dei due laboratori ha fatto verificare in modo indipendente.
Le parti che si sovrappongono davvero
Entrambi sono modelli densi open-weights che puoi tenere su una singola scheda, entrambi sono Apache-2.0 ed entrambi sono disponibili per il download anziché dietro un'API. Questa è una sovrapposizione reale, ed è il motivo per cui vale la pena fare il confronto.
Oltre a ciò, la divergenza è totale, e sono due righe a fare la maggior parte del lavoro.
• Parametri — AstaBrief 8B: circa 8B denso, pesi BF16 nella classe a GPU singola. Gemma 4 12B: 11,95B denso, architettura unificata senza encoder.
Modalità in — AstaBrief 8B: solo testo, e nello specifico estratti di domande. Gemma 4 8B: testo, immagine, audio e video, e visione con proiezioni lineari leggere nello spazio di embedding del decoder anziché encoder separati.
• Modalità di output — Entrambi: testo. AstaBrief 8B genera un report con citazioni; Gemma 4 12B genera testo semplice nella forma che richiedi.
• Contesto — AstaBrief 8B: il tetto di posizione di 40.960 token del modello base, addestrato a 32K. Gemma 4 12B: 256.000 token, con uno schema di attenzione ibrido che alterna attenzione locale a finestra scorrevole (finestra di 1024 token) con attenzione globale, e RoPE proporzionale sui layer globali per tenere sotto controllo la memoria in contesti lunghi.
• Addestramento — AstaBrief 8B: fine-tuning supervisionato su 47K esempi di report e poi circa 6K coppie DPO, su otto H100. Gemma 4 12B: pretraining generale di Google DeepMind più instruction tuning, documentato in un report tecnico.
• Compito — AstaBrief 8B: un unico compito, generazione di report con citazioni. Gemma 4 12B: ragionamento, programmazione, flussi di lavoro agentici, chat multilingue in oltre 140 lingue.
• Punteggi indipendenti — Nessuno per AstaBrief 8B oltre alle tabelle di Ai2. Gemma 4 12B compare su classifiche pubbliche, tra cui Artificial Analysis, dove viene valutata la famiglia di rilascio; si tratta di numeri di terze parti e sono gli unici in questo articolo a non essere forniti da un fornitore.
Leggi la riga del contesto come la differenza strutturale, non come un punto di una scheda tecnica. Il tetto di 40K di AstaBrief 8B non è una limitazione che Ai2 sta aggirando; è una conseguenza del design. Il modello non contiene mai un corpus, ma solo estratti che qualcun altro ha selezionato e dimensionato. La finestra da 256K di Gemma 4 12B significa che lo stesso compito può essere affrontato senza alcun livello di retrieval — incolla una grande mole di materiale e chiedi — il che è un'architettura davvero diversa per lo stesso esito, e una che accorpa due sistemi in uno.
Dove lo specialista vince, e di quanto
L'argomento di Ai2 a favore di AstaBrief è il cronometro, ed è un buon argomento. La sua pipeline Thinking basata su Claude impiegava in media 178,5 secondi per report; AstaBrief, scrivendo l'intero report in un'unica passata, impiega in media 51,1 secondi, circa 3,5 volte più veloce, e Ai2 sostiene che la semplificazione non è costata qualità sulle sue metriche monitorate.
L'azienda che conta qui non è Claude. È l'impalcatura multi-step stessa — riassunto di snippet, clustering tematico e scrittura sezione per sezione — tutte cose che AstaBrief elimina. E quell'impalcatura è lo stesso lavoro che altrimenti dovresti costruire sopra qualsiasi generalista, incluso Gemma 4 12B, se volessi ottenerne un report strutturato e con citazioni. A un generalista a cui si chiede «un report con citazioni» ne verrà prodotto uno; fargliene produrre uno secondo uno schema fisso, con chiavi di citazione che corrispondano all'elenco delle fonti, è prompt engineering che possiedi e mantieni.
La dichiarazione di qualità è il punto in cui devi rallentare.
• Media SQABench-CS2, split di test (riportato dal fornitore) — AstaBrief 8B 87,0, il suo checkpoint SFT 83,7, Qwen3-8B base 77,3. 100 domande di informatica scritte da utenti.
• DeepScholarBench (riportato dal fornitore) — AstaBrief 8B 53,50, dietro ad Asta ScholarQA di Ai2 stessa a 60,25 e a DR-Tulu-8B a 56,26.
• Confronto a coppie con la pipeline di Ai2 basata su Claude (dichiarato dal fornitore) — 55% di vittorie sul dev split, 72% sul test.
Studio umano (riportato dal fornitore) — 14 domande da tre ricercatori, DR-Tulu preferito nel complesso, con due dei tre che citano l'accuratezza delle citazioni di AstaBrief.
Non esiste un punteggio equivalente per Gemma 4 12B su SQABench-CS2, in nessuna delle due direzioni. Questa assenza è il centro onesto di questo confronto: non puoi attribuire un numero alla qualità dei report di Gemma 4 12B rispetto a quella di AstaBrief 8B, perché nessuno ha sottoposto il generalista all'harness di Ai2 e nessuno finge di averlo fatto. Chiunque ti dica che lo specialista è "26 punti migliore" sta confrontando un numero di un fornitore con il nulla.

Dove il generalista vince nettamente
I vantaggi di Gemma 4 12B non sono marginali ed è facile sottovalutarli.
Il primo è l'ampiezza. AstaBrief 8B è un componente che si aspetta che gli vengano fornite le prove. Gemma 4 12B legge screenshot, ascolta audio, guarda video, scrive codice e sostiene una conversazione da 256K. Se il tuo lavoro riguarda figure in articoli, interventi registrati o materiale sorgente multimodale, lo specialista non può partecipare affatto e la questione è chiusa.
Il secondo è che un'ampia esposizione pubblica è di per sé una forma di prova. Gemma 4 12B è presente nelle classifiche di terze parti; la famiglia copre cinque dimensioni, da E2B fino a 31B; sia le varianti ottimizzate per le istruzioni sia quelle preaddestrate sono pubblicate insieme a un rapporto tecnico. Questa è una provenienza normale, noiosa e verificabile — esattamente ciò che manca sia ad AstaBrief 8B sia alla più ampia categoria di modelli di ricerca specializzati.
Il terzo è il costo pratico di un secondo stack. Eseguire AstaBrief 8B per la scrittura di report più un generalista per tutto il resto significa due modelli residenti, due formati di prompt, due harness di valutazione e due percorsi di aggiornamento. Su una singola scheda da 24 GB in BF16 non è gratis — e la scheda di AstaBrief avverte che è stato messo a punto su un formato di prompt specifico, pubblicato come file di dataset, e che usarne uno diverso può degradare il comportamento. Un generalista non ha questo tipo di lock-in.
• Gemma 4 12B (dichiarato dal fornitore) — indice di intelligenza 9 sulla configurazione Reasoning; non esiste alcun dato Gemma comparabile nei benchmark del report di Ai2.
• Famiglia Gemma 4 — cinque dimensioni da E2B a 31B, Apache-2.0, report tecnico pubblicato, presenza in classifiche di terze parti.
• Gemma 4 26B A4B, disponibile nel nostro catalogo — $0,06 per milione di token di input, $0,33 per milione di output, finestra di contesto di 262.144 token. Anche Gemma 4 31B è instradato, a $0,13 / $0,38.
• Gemma 4 12B, locale — 11,95B denso, contesto 256K, attenzione ibrida a finestra scorrevole e globale, finestra locale di 1024 token.
Sulla disponibilità, i modelli Gemma 4 sono ospitati commercialmente: Gemma 4 26B A4B è una route attiva nel nostro catalogo a $0,06 per milione di token in input e $0,33 per milione in output, con una finestra di contesto di 262.144 token, e anche Gemma 4 31B è instradato. Questo conta perché significa che puoi valutare il ramo generalista senza possedere affatto una GPU. Nessun provider nel nostro catalogo serve AstaBrief 8B, noi compresi — è un modello da scaricare ed eseguire, e il modo onesto di usarlo è su hardware che controlli, oppure all'interno del prodotto Asta di Ai2.
Eseguire il confronto da soli, a basso costo
La decisione che questo articolo non può prendere per te è quella che puoi prendere in un pomeriggio, perché l'esperimento è asimmetrico nei costi. AstaBrief 8B richiede pesi locali e il suo formato di prompt pubblicato; puoi avviarlo su una singola scheda con vLLM nella configurazione documentata da Ai2, temperature 0.7 e top-p 0.95. Il braccio generalista può essere una chiamata a un servizio hosted — Gemma 4 26B A4B a $0,06 in input e $0,33 in output per milione di token è abbastanza vicino nello spirito per calibrare, e puoi puntare il tuo harness su entrambi senza possedere la seconda GPU.
Poi misura la cosa che le tabelle dei vendor non fanno: sulle tue domande, con i tuoi estratti, quanti report tornano citati correttamente e quanto tempo impiega l'intera catena una volta che hai aggiunto il collante dello schema di citazione al lato generalista. Il 3,5x di Ai2 è misurato rispetto alla pipeline di Ai2 stessa, non rispetto a Gemma 4 12B, e quel divario apparirà diverso nel tuo stack.
Tenere il ramo generalista dietro un unico endpoint è ciò che rende questo economico da ripetere anziché un progetto una tantum: un'unica API su oltre 200 modelli, prezzo di listino del provider passato con 0% di markup, così un taglio di prezzo del fornitore arriva sulla tua fattura lo stesso giorno, failover automatico quando un provider si degrada, e un DSL di routing se vuoi che più modelli rispondano insieme. Il punto non è la fedeltà all'uno o all'altro modello; è che rieseguire il confronto il prossimo trimestre dovrebbe essere una modifica di configurazione, perché entrambi questi modelli verranno superati.

Quale dovresti scaricare davvero
Scegli AstaBrief 8B se il risultato è un rapporto di ricerca con citazioni e hai un livello di retrieval che lo alimenta. Il design a passaggio singolo è un vero traguardo ingegneristico, la riduzione di 3,5 volte del tempo di generazione è il motivo per cui esiste, Apache-2.0 più i dati di addestramento pubblicati lo rendono verificabile, e nessun generalista eguaglierà la sua struttura di output senza che tu costruisca e mantenga tu stesso l'impalcatura.
Scegli Gemma 4 12B se il tuo lavoro è più ampio dei report, se le tue fonti sono multimodali, se 256K di contesto ti permette di evitare del tutto di costruire un livello di retrieval, o se vuoi il modello che ha punteggi di terze parti associati al suo nome e una route hosted che puoi chiamare oggi.
E nota l'onesta asimmetria nelle prove, perché va a sfavore dello specialista: i numeri di AstaBrief 8B, compresi quelli che suonano migliori tra i suoi, provengono da Ai2, descrivono un set di confronto del 2025 che il laboratorio dice di non aver rieseguito e includono uno studio umano su quattordici domande. I numeri di Gemma 4 12B provengono da persone che non lavorano a Google. Questa differenza di provenienza vale più di qualche punto su un benchmark che nessuno ha eseguito su entrambi.
