
Tiny Aya Base 32K vs Tiny Aya En-Thinker: Genitore e Figlio, Non Rivali
- deepseekNUOVODeepSeek: DeepSeek V4.1 Flash2026-09-10$0.15 / $0.60 per 1M di token
- openaiNUOVOOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- googleNUOVOGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- qwenNUOVOQwen: Qwen3.8 Max (0902)2026-09-0240Intelligenza72Codice
- anthropicNUOVOAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 per 1M di token
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
- metaMeta: Muse Spark 1.22026-08-0540Intelligenza72Codice
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligenza72Codice
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligenza69Codice
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligenza78Codice
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligenza69Codice
Due repository Hugging Face, quattro shard safetensors ciascuno, e le dimensioni degli shard coincidono al byte — 1.998.698.496 / 1.996.494.056 / 1.996.494.088 / 708.852.792. Tiny Aya Base 32K e Tiny Aya En-Thinker non sono le risposte di due laboratori alla stessa domanda. Sono la stessa architettura Cohere2 da 3,35B in due fasi diverse, e la model card di Cohere Labs lo dice apertamente: il checkpoint base "è usato come modello base per Tiny Aya L2-Thinker e Tiny Aya En-Thinker".
Questo rende sbagliata la consueta impostazione basata sul confronto diretto. Non stai scegliendo tra due modelli multilingue da 3B in competizione. Stai scegliendo tra un punto di partenza e uno finito — e la domanda interessante è che cosa abbia effettivamente apportato il passaggio di post-addestramento tra i due, quanto sia costato, e se l'uno o l'altro sia utilizzabile per ciò che hai in mente, dato che entrambi sono soggetti alla stessa licenza non commerciale e nessuno dei due ha un singolo benchmark pubblicato.
L'unica frase che mette a posto la relazione
Normalmente un pezzo "vs" deve dedurre la relazione tra due checkpoint dall'architettura e dal numero di parametri. Qui non devi farlo.
La card di Tiny Aya Base 32K lo afferma chiaramente, e vale la pena leggerlo con attenzione per via di dove si trova la frase — non in una nota a piè di pagina, ma nel riepilogo del modello, tra la descrizione del checkpoint e i crediti degli sviluppatori:
"Questo è un modello base preaddestrato e non è stato sottoposto a instruction tuning né allineato alle preferenze. Questo checkpoint viene utilizzato come modello base per Tiny Aya L2-Thinker e Tiny Aya En-Thinker."
Ciò che lo rende meritevole di un paragrafo è l'incoerenza che mette in luce. La scheda di En-Thinker non nomina Base 32K. La sua riga finale indirizza i lettori a "tiny-aya-global, tiny-aya-base, tiny-aya-l2-thinker" — e tiny-aya-base è il checkpoint di febbraio, documentato con contesto a 8K, non la variante a 32K che dichiara di essere il genitore di En-Thinker. En-Thinker rivendica 32K sulla propria scheda. Un modello non può essere post-addestrato fino a una finestra quattro volte più ampia di quella con cui è stato pre-addestrato. Quindi la base a 8K non sarebbe mai stata la risposta, e l'affermazione della base a 32K è coerente con l'aritmetica, mentre il puntatore di En-Thinker stesso non lo è.
La spiegazione probabile è banale: Base 32K è stato caricato l'8 settembre 2026, sei giorni dopo i Thinkers, quindi la scheda di En-Thinker è stata scritta prima che esistesse il suo genitore e non è stata aggiornata da allora. Questa è un'inferenza basata sui timestamp, non una dichiarazione di un fornitore — ma è la lettura che richiede il minor numero di assunzioni, e significa che il documento più recente della famiglia è quello più informativo.

Dimensione per dimensione
Tutto ciò che segue è quanto affermano le due card, al netto della duplicazione — entrambi sono 3,35B, BF16, solo testo, Cohere2ForCausalLM, CC-BY-NC-4.0, ad accesso controllato e non benchmarkati.
• Fase — Tiny Aya Base 32K è una base preaddestrata, "non ottimizzata per le istruzioni né allineata alle preferenze"; Tiny Aya En-Thinker è post-addestrata su dati di ragionamento multilingue con tracce di ragionamento in inglese.
• Template di chat — Base 32K non fornisce alcun chat_template.jinja affatto; En-Thinker ne fornisce uno, e la sua scheda dedica un'intera sezione a come renderizza i turni.
• Stile di prompting — l'esempio proprio di Base 32K è il completamento (prompt = "The capital of Spain is"); En-Thinker si aspetta apply_chat_template() con una lista di messaggi.
• Modalità di ragionamento — Base 32K non ha una modalità di ragionamento; En-Thinker è a doppia modalità, aggiungendo /think per impostazione predefinita ed emettendo una traccia di pensiero in inglese, oppure /no_think con enable_thinking=False per una risposta diretta.
• Ambito linguistico — La scheda di Base 32K dichiara l'addestramento su oltre 70 lingue e ne nomina esplicitamente 67; En-Thinker copre "44 lingue più l'inglese" con tracce di ragionamento in inglese, estendendosi a oltre 20 altre attraverso ulteriori dati di istruzione non di ragionamento.
• Impronta architetturale — identica. Stesse quattro dimensioni di shard, stesso numero di parametri, stessa lunghezza del file di configurazione.
• Contesto — 32K di input più output su entrambe le schede. Nessuna delle due è verificabile: entrambe le configurazioni sono dietro il controllo della licenza.
• Benchmark — nessuno su nessuna delle due schede. Non esiste alcuna valutazione di terze parti di nessuno dei due modelli.
• Trazione — Base 32K mostra zero download e un like; En-Thinker mostra sette download e due like. Nessuno dei due compare nel catalogo di un fornitore di inferenza.
Cosa ha fruttato la fase di post-addestramento
Tre cose, tutte comportamentali anziché strutturali.
Il primo è un'interfaccia utilizzabile. Un checkpoint senza template di chat non è un modello a cui invii prompt; è un modello che continui. Ogni conversazione che hai con Base 32K deve essere serializzata in testo da te, e la scheda lo dice chiaramente: "i prompt dovrebbero usare il completamento di testo anziché un template di chat. Si raccomanda un ulteriore post-addestramento prima di distribuirlo come assistente conversazionale." En-Thinker ha già preso questa decisione per te, persino per quanto riguarda il layout dei token.
Il secondo è il ragionamento come interruttore. En-Thinker/think e /no_think che consentono agli stessi pesi di produrre una catena di pensiero visibile tra i tag di pensiero oppure di rispondere direttamente, e la scheda documenta il passaggio di un blocco di pensiero precedente di nuovo nella conversazione come turno dell'assistente. Questo è un artefatto di post-addestramento — non c'è nulla in un checkpoint di base che vi risponda.
Il terzo è la scommessa progettuale al centro di En-Thinker: che il ragionamento avvenga in inglese anche quando la domanda e la risposta sono in un'altra lingua. La scheda è esplicita nel dire che questo lo distingue da Tiny Aya L2-Thinker, "che pensa nella stessa lingua del prompt". Se pianificare in una lingua ad alte risorse e rispondere in una a basse risorse aiuti davvero è una questione di ricerca aperta, ed En-Thinker esiste per permettere alle persone di testarla, non per risolverla. Base 32K, non avendo alcuna modalità di ragionamento, tace sulla questione — ed è proprio per questo che rappresenta il controllo giusto per chiunque provi a rispondervi.

Quanto è costata la fase di post-addestramento
La risposta onesta è che nessuno può quantificarlo, perché nessuno dei due modelli è stato valutato su alcunché. Ma le due schede insieme lasciano intuire dove si annida il compromesso, e non è dove te lo aspetteresti.
Non è la copertura linguistica. La ristretta portata di ragionamento di En-Thinker, limitata a 44 lingue più l'inglese, è una proprietà dei suoi dati di addestramento al ragionamento, e la scheda afferma che la copertura si estende a oltre 20 altre lingue "tramite dati aggiuntivi di istruzione non di ragionamento" — quindi il modello le gestisce comunque, solo senza il percorso di pensiero. Non è nemmeno la finestra di contesto; entrambi dichiarano 32K.
È l'ampiezza del comportamento. La scheda di Base 32K elenca «pre-addestramento continuato, instruction tuning e ricerca sulla modellazione linguistica multilingue e a contesto lungo» tra gli usi previsti, indicando generazione di testo multilingue, sintesi, traduzione e adattamento interlinguistico come applicazioni a valle. La scheda di En-Thinker è più ristretta: «compiti di matematica, scienza e ragionamento generale, oltre a seguire istruzioni e generazione aperta multilingue». Un checkpoint post-addestrato esprime una precisa presa di posizione, cosa che un checkpoint di base non fa, e la limitazione segnalata dalla scheda di Base 32K — «I compiti di ragionamento a catena di pensiero, come la matematica multilingue, sono comparativamente più deboli» — è esattamente la debolezza che il post-training si proponeva di correggere.
Quindi la famiglia si legge come una divisione del lavoro più che come una competizione. La base è ampia e incompiuta; En-Thinker è ristretto e finito; e il testo stesso della scheda base la chiama per quello che è — il substrato da cui entrambi i Thinker sono stati plasmati.
La licenza è il vincolo che effettivamente vincola
Entrambi i modelli sono CC-BY-NC-4.0 con l'Acceptable Use Policy di Cohere Labs applicata in aggiunta, entrambi si trovano dietro lo stesso gate che chiede di accettare i termini e registrarsi prima del download dei file, ed entrambi indirizzano le domande commerciali a Cohere Sales.
Vale la pena affermarlo prima di qualsiasi confronto tecnico, perché decide la questione per una gran parte dei lettori. Se il piano è un prodotto commerciale, nessuno dei due checkpoint è una scelta possibile senza una conversazione con Cohere, e nessuna quantità di comportamento a contesto lungo o flessibilità della modalità di ragionamento cambia le cose. Laddove l'uso non commerciale sia davvero accettabile — lavoro accademico, ricerca interna, un'infrastruttura di benchmark, un confronto con il tuo modello — la licenza è irrilevante e la decisione è tutta nella scelta tecnica.
Nessuno dei due è stato sottoposto a benchmark. Ecco come scegliere comunque
L'assenza di numeri è reale e non sarà risolta leggendo con più attenzione. Entrambe le schede non contengono alcuna dichiarazione sulle prestazioni, nessuna classifica elenca l'uno o l'altro modello, e nessuno dei due ha un fornitore di inferenza alle spalle — il che significa che nessun fornitore ha pubblicato il throughput o i prezzi che di solito sostituiscono un benchmark. Quello che puoi fare è concentrarti sulla struttura, dove le prove sono solide.
• Scegli Tiny Aya Base 32K se intendi addestrare. Il continued pretraining, l'instruction tuning o un adattamento di dominio su un modello multilingue da 3,35B sono gli usi per cui la scheda dice che è pensato, e partire da un checkpoint base significa che non devi combattere contro un post-training che non hai scelto. La finestra da 32K supporta anche la ricerca su contesti lunghi, cosa che la base di febbraio da 8K non poteva fare.
• Scegli Tiny Aya En-Thinker se oggi vuoi promptare qualcosa. È l'unico dei due che sosterrà una conversazione, e l'unico che abbia in assoluto una modalità di ragionamento.
• Scegli entrambi se la domanda è scientifica piuttosto che pratica. La coppia è un confronto controllato — stessa architettura, stessa dimensione, stessa finestra, che differisce principalmente per il fatto che il post-addestramento sia avvenuto o meno — per chiedere se le tracce di ragionamento in inglese migliorano le risposte multilingue. Questa è la domanda che En-Thinker è stato rilasciato per permettere alle persone di sondare, e il suo stesso genitore è la baseline più pulita.

Una nota pratica sulla valutazione dell'uno o dell'altro: sono checkpoint di ricerca non comprovati, senza alcuna storia di deployment, e un download BF16 da 6,7 GB più il tempo di GPU rappresentano un costo reale da spendere per un modello che non è mai stato eseguito in modo indipendente. Eseguire quel confronto attraverso un unico endpoint anziché predisporre i pesi per ogni candidato è più economico — OrcaRouter offre 195 modelli dietro un'unica API con 0% di ricarico sui prezzi di listino dei provider e failover automatico tra provider, così un checkpoint di ricerca che stai soltanto testando non finisce mai su un percorso di produzione. Tiny Aya non è tra questi e non lo ospitiamo; il punto è solo che i modelli contro cui lo testeresti
{{1}}Cosa risolverebbe questo{{/1}}
Due cose, ed entrambe sono economiche da pubblicare per Cohere Labs e costose da produrre per chiunque altro.
Il primo è un benchmark — qualsiasi benchmark. Una singola valutazione di ragionamento multilingue eseguita su entrambi i checkpoint convertirebbe l'intera famiglia da "dichiarato sulla scheda" a "misurato", e risponderebbe immediatamente se il design di pensiero in inglese batte lo stesso modello senza post-addestramento, che è la domanda di ricerca attorno a cui è costruito il rilascio.
Il secondo è una configurazione. L'affermazione dei 32K su entrambe le schede non è verificabile finché i repository sono ad accesso limitato, e la differenza tra un addestramento preliminare autenticamente a contesto lungo e un'estensione della codifica posizionale applicata a un checkpoint da 8K è grande nella pratica, anche se entrambi producono un modello che accetta 32K token. Aprire i due file di configurazione colmerebbe quel divario in un modo che nessun testo pubblicitario può.
Fino ad allora, la risposta accurata a "Tiny Aya Base 32K o Tiny Aya En-Thinker" è che il confronto è reale, ma la sfida no. Stessi pesi, stessa finestra, stessa licenza, stesso silenzio da parte di chiunque non li abbia scaricati — uno dei due ha semplicemente il template di chat e i tag di pensiero, e l'altro è ciò da cui è stato ottenuto.
