Una title card generata che recita 'AREX-2 vs Gemma 4 12B - One of These Is a Model', con due pannelli. Il pannello sinistro, intitolato Gemma 4 12B, elenca: rilasciato il 3 giugno 2026; 11,95B parametri, dense; contesto 256K, Apache 2.0; scaricalo oggi. Il pannello destro, intitolato AREX-2, elenca: repo creato il 29 set 2026; nessun peso caricato; nessuna card, nessun tag di licenza; non scaricabile. Un footer recita 'One column is a model. The other is a timestamp.' Il logo OrcaRouter è compositato nell'angolo in basso a destra.
Guides & Insights

AREX-2 vs Gemma 4 12B: Uno di questi è un modello

Autore

Gideon Frost

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Un confronto tra Gemma 4 12B e AREX-2 ha una proprietà che nessun altro confronto su questo blog possiede: una delle due colonne è vuota perché il modello su quel lato non esiste ancora. Gemma 4 12B è un artefatto già distribuito — Google DeepMind lo ha pubblicato il 3 giugno 2026 come modello denso a pesi aperti da 11,95 miliardi di parametri sotto licenza Apache 2.0, con una model card completa, una finestra di contesto di 256K token, input nativo per audio e immagini e tre mesi e mezzo di test indipendenti alle spalle. AREX-2 è un repository di Hugging Face che BAAI ha creato il 29 settembre 2026 alle 17:56 UTC e in cui non ha ancora inserito nulla: nessun peso, nessuna card, nessun tag di licenza, nessuna valutazione, nessun annuncio.

Quell’asimmetria non è un motivo per saltare il confronto. È il confronto. La domanda a cui vale la pena rispondere non è quale di questi sia migliore — nessuno può rispondere finché AREX-2 non avrà file al suo interno — ma se un agente di ricerca BAAI di seconda generazione sarebbe persino in competizione con un modello edge da 12B, oppure se questi due occupano posizioni in uno stack che non si toccano mai. Sbagliare questo è l’errore costoso, perché è l’errore che porta un team a destinare budget alla cosa sbagliata.

Il lato rilasciato, alle sue condizioni.

Gemma 4 12B è il membro piccolo della famiglia open di quarta generazione di Google, e la sua scelta progettuale distintiva è architetturale: elimina del tutto il codificatore visivo separato e immette direttamente patch di immagini grezze e forme d'onda audio nel transformer. Non è un trucco da benchmark. È ciò che rende il modello realmente portatile — circa 27 GB di pesi BF16 che, quantizzati, scendono sotto i 7 GB, e una scheda che indica 16 GB di VRAM come target di deployment. Su un laptop o su una singola scheda di fascia media, questo è un modello che puoi davvero tenere tra le mani.

Il profilo di capacità ne consegue. La scheda di Goog​le — riportata dal fornitore, e vale la pena etichettarla come tale — elenca DocVQA 94,9 e InfoVQA 88,4 per la comprensione dei documenti, MMLU-Pro 77,2, GPQA Diamond 78,8, AIME 2026 77,5 e LiveCodeBench v6 72,0 in modalità thinking. Artificial Analysis, che è indipendente, assegna alla configurazione di ragionamento un Intelligence Index di 14, la misura a 114 token al secondo e fissa il prezzo di una tipica chiamata servita a 0,10 $ per milione di token di input e 0,30 $ per milione di token di output. La nostra voce di catalogo per il più grande Gemma 4 31B riporta 85,7 su GPQA Diamond. Il quadro che ne emerge è quello di un piccolo generalista insolitamente forte su documenti e immagini, ragionevole sul ragionamento e ben lontano da un modello di frontiera nei compiti difficili a più passaggi.

Il suo ruolo è quindi concreto: inferenza locale o single-tenant, comprensione di documenti e screenshot, modesti cicli agentici e qualsiasi cosa in cui i dati non possano lasciare l'edificio. Non è un motore di ricerca approfondita e Google non lo vende come tale.

A screenshot of the Artificial Analysis model page for Gemma 4 12B (Reasoning), showing an Artificial Analysis Intelligence Index of 14, a speed rank of 19 of 142, $0.10 per million input tokens and $0.30 per million output, a 256K-token context window, text, image, speech and video input with text output, and the note that it is among the leading models in intelligence but somewhat expensive for its size. The page header reads 'Released June 2026' and 'Open weights model'.

L'altro lato, che è un nome e un timestamp

Tutto ciò che è confermabile su AREX-2 questa settimana sta in una frase. È un repository sotto l'organizzazione BAAI su Hugging Face, creato il 29 settembre 2026, contenente un .gitattributes file e nient'altro — zero byte di dati del modello archiviati, zero download, nessuna model card, nessuna dichiarazione di licenza, nessuna distribuzione da parte di provider. BAAI stessa non ha annunciato nulla.

Ciò che lo rende degno di essere messo per iscritto è la famiglia da cui prende il nome. La linea AREX di BAAI è stata rilasciata il 23 luglio 2026 con due modelli: AREX-Base, un mixture-of-experts da 122 miliardi di parametri con 10 miliardi di parametri attivi basato su Qwen3.5-122B-A10B, e AREX-Turbo, un modello dense da 4B costruito su Qwen3.5-4B. Entrambi sono Apache 2.0. Entrambi sono agenti di ricerca approfondita anziché modelli di chat — un ciclo interno che raccoglie prove e produce una risposta candidata con un valore di confidenza, e un ciclo esterno che verifica quella risposta rispetto ai vincoli originali e può perfezionare o riavviare l'intera traiettoria. Secondo i numeri pubblicati da BAAI, AREX-Base raggiunge 82,5 su BrowseComp, 85,4 su GAIA e 89,9 su DeepSearch QA; AREX-Turbo raggiunge 70,7, 81,6 e 78,5 sugli stessi tre.

Tutti quei dati provengono dal fornitore stesso e nessuno è stato riprodotto in modo indipendente. Inoltre, si riferiscono a un modello diverso. AREX-2 non ha dati, e il "2" non dice nulla su dimensione, backbone o architettura — una seconda generazione in questa linea potrebbe essere un agente più grande, una distillazione più piccola, o un framework riaddestrato con il backbone sostituito.

Ma questi due si incontrano?

Ecco dove il confronto si rivela più utile di quanto sembri. Prendi le due letture plausibili di ciò che AREX-2 diventa.

Se è un agente di ricerca di seconda generazione a una scala anche solo lontanamente paragonabile a quella di Base, allora esso e Gemma 4 12B non entrano mai in competizione. Un mixture-of-experts da 122B che guida la ricerca multi-fonte è un servizio ospitato, fatturato per token e vincolato alla rete; Gemma 4 12B è un checkpoint che scarichi ed esegui da solo. La decisione tra loro non è un confronto di qualità, è una decisione sul fatto che il tuo carico di lavoro sia un ciclo di ricerca o un endpoint di inferenza.

Se AREX-2 si rivela essere il livello piccolo — il successore del 4B Turbo anziché del 122B Base — allora i due condividono davvero uno scaffale, e il confronto diventa reale. Quella versione di AREX-2 avrebbe all'incirca un terzo del numero di parametri di Gemma 4 12B, specializzata nella ricerca guidata dagli strumenti anziché nell'ampiezza multimodale, e verrebbe misurata su BrowseComp e GAIA anziché su DocVQA. Due modelli piccoli, uno ottimizzato per mantenere una lunga traiettoria di ricerca, l'altro per vedere e leggere su hardware modesto. Un team che costruisce una pipeline di documentazione non dovrebbe interessarsi al primo; un team che costruisce un agente di ricerca non dovrebbe interessarsi al secondo.

• Ciò che esiste — Gemma 4 12B è scaricabile oggi con una scheda completa. AREX-2 è un repository che non contiene alcun file.

• Parametri — 11,95B dense per Gemma 4 12B. Non dichiarato, e deducibile solo da un nome di prodotto, per AREX-2.

• Contesto — 256K token (262.144 posizioni) per Gemma 4 12B. Sconosciuto per AREX-2.

• Modalità — testo, immagini e audio in ingresso per Gemma 4 12B. Non nota per AREX-2; la prima generazione di AREX era testo più uso di strumenti.

• Licenza — Apache 2.0 per Gemma 4 12B, indicato sulla scheda. Non indicato per AREX-2; AREX-Base e AREX-Turbo erano Apache 2.0.

• A cosa serve — inferenza multimodale distribuibile sul proprio hardware rispetto, sulla base delle evidenze della famiglia, a ricerca a lungo termine e aggregazione di evidenze contro un endpoint ospitato.

A generated two-column card headed 'Two deployment shapes, and only one of them exists'. It contrasts where Gemma 4 12B runs (local or single-tenant; about 27 GB BF16, under 7 GB quantised, 16 GB VRAM target; no rate card or per-token meter) against where AREX-Base runs (a 122B mixture-of-experts, a cluster or a hosted endpoint billed per token), names tokens per search step times steps per trajectory as the cost driver for the AREX shape, and notes that AREX-2 is neither shape because there are no files in the repository. A footer reads 'Is this a quality comparison? Not until one side has a model in it.' The OrcaRouter logo is composited in the bottom-right corner.

La parte che è effettivamente comparabile: dove viene eseguito ciascuno

Poiché il confronto delle capacità non è disponibile, il confronto dei deployment è quello onesto da fare, e non c'è partita.

Gemma 4 12B funziona dove lo metti. Non c'è alcun tariffario, nessun contatore per token e nessun fornitore tra te e il modello — il costo è l'hardware e l'elettricità, e la modalità di guasto è la tua stessa pianificazione della capacità. Quando AREX-Base è stato rilasciato a luglio, al contrario, era un mixture-of-experts da 122B: un modello che servi su un cluster o noleggi a token, e il 4B Turbo della stessa famiglia esiste proprio perché quella scelta ha un prezzo. Se la seconda generazione segue la stessa forma, l'economia di AREX-2 sarà una funzione dei token consumati per query moltiplicata per il numero di passi di ricerca che una traiettoria compie — un numero molto più grande per un agente di ricerca approfondita che per un modello di lettura di documenti, perché l'agente rilegge un contesto in crescita a ogni iterazione.

È qui che un livello di routing smette di essere un'astrazione e inizia a essere una voce di costo. Se ti ritrovi a eseguire un agente di ricerca su un modello ospitato tenendo un Gemma 4 12B locale per il lavoro sui documenti, nel caso ordinario sono due integrazioni. Tramite un'unica API davanti a oltre 200 modelli — con il prezzo di listino del provider passato così com'è e nessun ricarico aggiunto, così una variazione di prezzo di un fornitore arriva lo stesso giorno — sono un'unica chiave, un'unica fattura e un unico client, e una regola di failover può spostare una richiesta da un provider che sta avendo un'ora difficile senza che il ciclo del tuo agente se ne accorga. Oggi instradiamo Gemma 4 26B-A4B e Gemma 4 31B; non instradiamo il 12B, e nulla della linea AREX è presente nel nostro catalogo, quindi se uno di questi è il modello che ti serve, arriva dalla distribuzione del suo fornitore stesso.

Cosa fare questa settimana

Se ti serve un modello multimodale compatto che puoi eseguire in autonomia, la decisione non è mai stata subordinata ad AREX-2. Gemma 4 12B è rilasciato, documentato, valutato in modo indipendente e implementabile, e la colonna di confronto dall'altra parte è vuota. Non acquistare nulla in virtù di un nome riservato.

Se stai costruendo un agente di ricerca approfondita e la linea AREX è ciò che vuoi davvero, la cosa da tenere d'occhio non è il nome ma l'albero: se i safetensors compaiono in quel repository, cosa dice la scheda sul numero di parametri e quale tag di licenza gli viene applicato. La prima generazione è stata distribuita con Apache 2.0, e se anche la seconda lo sarà, la questione diventa una questione di hosting più che di licenza. Fino ad allora, AREX-Base è il modello AREX che puoi effettivamente eseguire, ed è disponibile da luglio.

L'unica cosa che vale la pena dire chiaramente sul confronto di cui questo articolo si occupa nominalmente: una pagina VS in cui una parte è un commit di repository e l'altra è un modello rilasciato non è un confronto, è un calendario. Il calendario dice che Gemma 4 12B è disponibile ora e che AREX-2 non è disponibile affatto.